التعلم المعزز2019متقدم13 دقيقة قراءة

مستوى الأستاذ الأكبر في StarCraft II باستخدام التعلّم المعزّز متعدّد الوكلاء

Grandmaster Level in StarCraft II Using Multi-Agent Reinforcement Learning

Vinyals, O. · Babuschkin, I. · Czarnecki, W. M. · Mathieu, M. · Dudzik, A. · Chung, J. · Choi, D. H. · Powell, R. · Ewalds, T. · Georgiev, P. · others — Nature

المشكلة

تُعدّ StarCraft II من أعقد الألعاب التي واجهها الذكاء الاصطناعي. على عكس الشطرنج أو Go، تتّسم بمعلومات ناقصة بسبب ضبابية الحرب، وفضاء أفعال تركيبي هائل يصل إلى 10^26 فعلاً ممكناً في كل خطوة زمنية، واتخاذ قرارات فورية في الوقت الحقيقي، وتخطيط طويل الأمد عبر آلاف الخطوات. فوق ذلك، تتعدّد الاستراتيجيات القابلة للتطبيق وتُشكّل لعبة غير متعدّية — حيث الاستراتيجية أ تتغلّب على ب، وب تتغلّب على ج، لكن ج تتغلّب على أ. الأنظمة السابقة إمّا بسّطت اللعبة، أو استغلّت سرعة ردّ فعل فوق بشرية، أو اعتمدت على وحدات مُصمَّمة يدوياً. لم يقترب أي نظام تعلّم عامّ من مستوى اللعب الاحترافي.

الإسهام

قدّم AlphaStar وكيلاً يعمل بالتعلّم المعزّز العميق من طرف إلى طرف، بلغ مستوى الأستاذ الأكبر (أعلى 0.2% من اللاعبين البشريين) في لعبة StarCraft II الكاملة، بجميع الأعراق الثلاثة (Protoss وTerran وZerg) وبشروط اللعب المعيارية على الخادم الرسمي. تجمع البنية بين جذع محوّلي لمعالجة الوحدات، ونواة LSTM عميقة للاستدلال الزمني، ورأس سياسة مع لفضاء الأفعال التركيبي، وخطّ أساس قيمة مركزي. يسير التدريب في مرحلتين: تعلّم بالإشراف على 971,000 إعادة تشغيل بشرية، ثم تعلّم معزّز متعدّد الوكلاء في دوري من وكلاء متنوّعين يشمل وكلاء رئيسيين ومستغِلّين رئيسيين ومستغِلّين للدوري — عملية تكتشف تلقائياً نقاط الضعف الاستراتيجية وتعالجها.

الأثر

أثبت AlphaStar أن التعلّم المعزّز العميق العامّ قادر على إتقان مجال بتعقيد مشابه للعالم الحقيقي دون تبسيط. أصبح إطار نموذجاً مرجعياً للأنظمة متعدّدة الوكلاء، وأثّر في OpenAI Five وأبحاث ذكاء الألعاب ومنهجيات التدريب متعدّد الوكلاء عموماً. تبنّت مجالات الروبوتات والقيادة الذاتية وأنظمة الوكلاء واسعة النطاق ابتكاراته المعمارية — خاصةً السياسة ذاتية الانحدار لفضاءات الأفعال المهيكلة والتدريب متعدّد الوكلاء القائم على المجتمعات. كما عمّق العمل فهمنا للاستراتيجية الناشئة في بيئات تعدّد الوكلاء.

تخيّل أكاديمية عسكرية تُدرّب القادة — لا بالمحاضرات، بل بإجبارهم على التنافس في بطولة متطوّرة باستمرار. كل قائد يبدأ بدراسة آلاف المعارك التاريخية الحقيقية (إعادات التشغيل البشرية). ثم يدخل الدوري: بعض القادة يسعون ليكونوا الأفضل في كل شيء، بينما آخرون متخصّصون مهمّتهم الوحيدة هي كشف واستغلال نقاط الضعف في استراتيجيات القادة المتصدّرين.

حين يكتشف المتخصّص ثغرة — مثلاً ضعف أمام هجمات الفرسان المبكّرة — يُضطرّ القائد المتصدّر إلى التكيّف. عبر ملايين المعارك المُحاكاة، يصبح القادة المتصدّرون متينين بشكل استثنائي، لأن كل ثغرة محتملة استُكشفت بواسطة خصم مُكرَّس لها.

AlphaStar هو هذه الأكاديمية. القادة هم شبكات عصبية. والمعارك هي مباريات StarCraft II. والنتيجة وكيل يلعب أفضل من 99.8% من جميع اللاعبين البشريين.

لماذا تُعدّ StarCraft II التحدي الأعظم للذكاء الاصطناعي

StarCraft II هي لعبة استراتيجية في الوقت الحقيقي يتنافس فيها لاعبان على جمع الموارد وبناء القواعد وتدريب الجيوش والسيطرة على الخريطة. ثلاثة أعراق غير متماثلة — Protoss وTerran وZerg — تقدّم قوائم وحدات وقدرات واستراتيجيات مختلفة جذرياً. تجري اللعبة في الوقت الحقيقي بلا أدوار، ما يفرض إدارة دقيقة متزامنة على مستوى الوحدات المنفردة في القتال وعلى مستوى الاقتصاد والإنتاج والتوسّع.

ما يجعلها صعبة بشكل فريد على الذكاء الاصطناعي هو تجمّع عدة تحدّيات نادراً ما تظهر معاً. أولاً، المعلومات الناقصة: ضبابية الحرب تُخفي معظم الخريطة، فيتوجّب على الوكيل الاستدلال على ما يفعله الخصم دون رؤيته. ثانياً، ضخم: في كل خطوة يختار الوكيل نوع الفعل، والوحدات التي يطبّقه عليها، والموقع المستهدف على الخريطة — انفجار تركيبي يصل إلى 10²⁶ فعلاً ممكناً. ثالثاً، اللعبة غير متعدّية: لا توجد استراتيجية واحدة مهيمنة لأن الاستراتيجيات تُشكّل دورات من نوع حجر-ورقة-مقص. ورابعاً، تمتد المباريات لآلاف الخطوات، ما يتطلّب تخطيطاً طويل الأفق حيث تُحدّد القرارات الاقتصادية المبكّرة مجريات اللعبة المتأخّرة.

افتح في المختبر
قارن أبعاد تعقيد StarCraft II مع إنجازات الذكاء الاصطناعي الأخرى في الألعاب. كل محور يمثّل بُعداً مختلفاً من التحدّي.
تستيقظ التجربة عند وصولك…

البنية المعمارية: الرؤية والتذكّر والتصرّف

تحتوي الشبكة العصبية في AlphaStar على 139 مليون معامل، وتعالج ملاحظات اللعبة الخام — قائمة الوحدات المرئية بخصائصها، وسمات الخريطة المصغّرة، وحالة اللعبة العددية — لإنتاج أفعال مهيكلة. تتألف البنية من ثلاث مراحل رئيسية، كل منها تعالج جانباً مختلفاً من التحدّي.

المرحلة الأولى — الترميز: يستقبل الوكيل الملاحظة الحالية على شكل مجموعة وحدات (كل واحدة موصوفة بمئات السمات: النوع، الصحة، الموقع، المالك). يعالج المحوّل هذه السمات ويسمح لكل وحدة بالانتباه لكل وحدة أخرى. ثم تدمج وصلات التشتيت المعلومات المكانية من الخريطة المصغّرة (المعالَجة بشبكة بقايا) مع تضمينات الوحدات غير المكانية. هذا الدمج بالغ الأهمية لأن StarCraft يتطلّب الاستدلال على ماهية الوحدات الموجودة ومواقعها على الخريطة معاً.

المرحلة الثانية — الذاكرة: تتدفق الملاحظة المرمَّزة إلى نواة LSTM عميقة تحتفظ بحالة خفية عبر الخطوات الزمنية. هنا يحدث الاستدلال الزمني: تتعلّم الـ LSTM تتبّع تحرّكات العدوّ غير المرئية، وتذكّر معلومات الاستكشاف، وتوقّع توقيتات البناء، والتخطيط لاستراتيجيات متعدّدة الخطوات. بدون هذه الذاكرة، سيكون الوكيل مجرّد ردّ فعل آني وعاجزاً عن تنفيذ خطط منسّقة.

المرحلة الثالثة — الفعل: يغذّي مخرج الـ LSTM رأس سياسة ذاتي الانحدار. بدلاً من الاختيار من قائمة مسطّحة تضمّ 10²⁶ فعلاً، يُحلّل AlphaStar كل فعل إلى سلسلة من القرارات الفرعية: ما نوع الفعل (بناء، تحرّك، هجوم)، ومَن يُطبَّق عليه (اختيار الوحدات عبر شبكة المؤشّرات)، وأين يُوجَّه (موقع على الخريطة). كل قرار فرعي مشروط بجميع القرارات السابقة، ما يُشكّل سلسلة تجعل فضاء الأفعال التركيبي قابلاً للمعالجة.

افتح في المختبر
استكشف خط أنابيب الشبكة العصبية في AlphaStar: من ملاحظات اللعبة الخام عبر مرمِّز المحوِّل وذاكرة LSTM إلى رأس الفعل ذاتي الانحدار.
تستيقظ التجربة عند وصولك…

تحليل الأفعال: من الانفجار إلى السلسلة

في كل خطوة لعب، يتكوّن فعل StarCraft من عدة وسائط مهيكلة: نوع الفعل (مثلاً «تحرّك»، «هاجم»، «ابنِ»)، والوحدات المعنيّة، ووحدة مستهدفة أو موقع على الخريطة، وأعلام الانتظار في الطابور. لو اختير كل وسيط بمعزل عن البقية، لأصبح الفضاء مستعصياً. الفكرة المحورية في AlphaStar هي تحليل التوزيع المشترك بشكل ذاتي الانحدار.

رياضياً، تُحلَّل السياسة كالتالي:

πθ(atst,z)=lπθ(l)(at(l)st,z,at(1),,at(l1))\pi_\theta(a_t \mid s_t, z) = \prod_{l} \pi_\theta^{(l)}(a_t^{(l)} \mid s_t, z, a_t^{(1)}, \ldots, a_t^{(l-1)})
تحليل السياسة ذاتي الانحداركل فعل فرعي aₜˡ (نوع الفعل، اختيار الوحدات، الهدف) يُستخرج بشكل مشروط على جميع الأفعال الفرعية السابقة والحالة الحالية sₜ. الإحصاء z يُلخّص استراتيجية مأخوذة من بيانات بشرية (مثل ترتيب البناء). تُحوّل قاعدة السلسلة هذه فضاءً مسطّحاً من 10²⁶ إلى تسلسل من التوزيعات التصنيفية القابلة للمعالجة.
افتح في المختبر
تتبّع سلسلة الأفعال ذاتية الانحدار: شاهد كيف يُضيّق كل قرار فرعي الاختيارات المتبقية. انقر على كل مرحلة لاستكشاف خياراتها.
تستيقظ التجربة عند وصولك…

لاختيار الوحدات، يستخدم AlphaStar شبكة مؤشّرات — آلية مستعارة من نماذج التسلسل إلى تسلسل تستطيع «الإشارة» إلى عناصر في مجموعة مدخلات متغيّرة الطول. بما أن عدد الوحدات في ساحة المعركة يتغيّر باستمرار، فإن طبقة إخراج ثابتة الحجم لن تنفع. تنتبه شبكة المؤشّرات ديناميكياً إلى قائمة الوحدات الحالية وتختار أيّها ينفّذ الفعل. تخيّلها كضوء كشّاف يمسح ساحة المعركة ويُضيء الوحدات واحدة تلو الأخرى.

خط التدريب: من التقليد إلى الإتقان

يتكشّف تدريب AlphaStar في مرحلتين رئيسيتين، كل منهما تبني على سابقتها — تماماً كطالب يبدأ بمشاهدة المحترفين يلعبون، ثم يدخل دورياً تنافسياً ليطوّر أسلوبه الخاص.

المرحلة الأولى — التعلّم بالإشراف: يتدرّب الوكيل على 971,000 إعادة تشغيل من لاعبين بشريين بتصنيف MMR أعلى من 3500 (أعلى 22% تقريباً). تتعلّم السياسة التنبؤ بالفعل البشري في كل خطوة زمنية، مشروطةً بإحصاء استراتيجي z مأخوذ من نفس الإعادة. يمنح هذا الوكيل أساساً متيناً في الإدارة الدقيقة والإدارة الكلية ويُنتج مجموعة متنوّعة من السياسات الأوّلية تعكس أساليب لعب بشرية مختلفة. بعد التعلّم بالإشراف وحده، يصل الوكيل تقريباً إلى مستوى الماس المتوسّط — تنافسي لكنه بعيد عن الاحتراف.

المرحلة الثانية — التعلّم المعزّز في الدوري: انطلاقاً من الوكلاء المُشرَف عليهم، يُحسّن التعلّم المعزّز السياسة لتعظيم معدّل الفوز. لكن الساذج يؤدي إلى دورات استراتيجية ونسيان كارثي. اختراق AlphaStar هو إطار تدريب الدوري.

افتح في المختبر
تتبّع خط التدريب ذا المرحلتين: التعلّم بالإشراف على الإعادات البشرية يُمهّد للوكيل، ثم تدريب الدوري يدفعه إلى مستوى الأستاذ الأكبر.
تستيقظ التجربة عند وصولك…

تدريب الدوري: الاختراق متعدّد الوكلاء

الفكرة المحورية في تدريب دوري AlphaStar هي أن اللعب المتين يتطلّب تنوّعاً وليس مجرّد قوة. في لعبة غير متعدّية، التفوّق على خصم واحد لا يعني شيئاً إذا كان خصم آخر قادراً على استغلالك. يعالج الدوري هذا بثلاثة أنواع من الوكلاء.

الوكلاء الرئيسيون هم اللاعبون الأساسيون قيد التدريب. يلعبون ضدّ جميع الوكلاء الآخرين في الدوري، مع ترجيح بحسب صعوبة كل خصم. هدفهم إيجاد استراتيجية متينة عبر المجتمع بأكمله — تقريب .

المستغِلّون الرئيسيون يستهدفون نقاط الضعف في الوكلاء الرئيسيين تحديداً. يُعاد تعيينهم إلى التعلّم بالإشراف دورياً، كي يستمرّوا في اكتشاف ثغرات جديدة بدلاً من الإفراط في التخصّص. حين يكتشف رئيسي ثغرة، يُضطرّ الوكيل الرئيسي إلى إصلاحها.

مستغِلّو الدوري يستهدفون نقاط الضعف في الدوري بأكمله، بما في ذلك النسخ السابقة من جميع الوكلاء. يضمنون حفاظ الدوري على التنوّع الاستراتيجي — فإذا انزاح الدوري كلّه نحو أسلوب لعب واحد، يكتشف مستغِلّ الدوري استراتيجيات مضادّة.

جميع الوكلاء يُجمَّدون دورياً كلقطات ويُضافون إلى مجموعة الخصوم، ما يُنشئ أرشيفاً متنامياً من الاستراتيجيات المتنوّعة. هذا يمنع النسيان الكارثي: حتى لو نسي الوكيل الرئيسي الحالي كيف يواجه استراتيجية قديمة، تظلّ تلك الاستراتيجية موجودة في الدوري كخصم مُجمَّد.

افتح في المختبر
استكشف أنواع الوكلاء الثلاثة في دوري AlphaStar. انقر على كل نوع لترى دوره وهدف تدريبه وأسهم المواجهات.
تستيقظ التجربة عند وصولك…

خوارزمية التعلّم المعزّز: تصحيحات خارج السياسة ومكافآت زائفة

يجب على خوارزمية التعلّم المعزّز في AlphaStar التعامل مع وضع صعب: الوكيل يُولّد مسارات بشكل لا متزامن على عدة أجهزة، فبحلول وقت استخدام المسار لتحديث التدرّج، تكون السياسة قد تغيّرت بالفعل. هذه هي مشكلة خارج السياسة.

الحل يجمع بين ثلاث تقنيات. أولاً، تقدّم تقديرات قيمة مُرجَّحة بالأهمية تُصحّح تأخّر السياسة، وقد طُوّرت أصلاً لبنية IMPALA. ثانياً، TD(λ) تحسب أهدافاً متعدّدة الخطوات للفرق الزمني لدالة القيمة. ثالثاً، تقنية جديدة تُسمى UPGO (تدرّج السياسة الصاعد) تستخدم العوائد فقط حين تتجاوز خطّ أساس القيمة، ما يمنع الوكيل من الانجذاب نحو الأسفل بسبب مسارات سيئة الحظ.

vs=V(xs)+t=ss+n1γts(i=st1ci)δtVv_s = V(x_s) + \sum_{t=s}^{s+n-1} \gamma^{t-s} \left(\prod_{i=s}^{t-1} c_i\right) \delta_t V
هدف V-trace — تقدير قيمة مُصحَّح لخارج السياسةيُصحّح هدف V-trace تقدير القيمة V(xₛ) باستخدام أوزان أهمية مبتورة cᵢ تُقيِّد نسبة π(aᵢ|xᵢ)/μ(aᵢ|xᵢ) للحدّ من التباين الناتج عن بيانات خارج السياسة. أخطاء الفرق الزمني δₜV تُجمع مع خصم γ. هذا يسمح بالتدريب من مسارات قديمة دون تباعد.

بالإضافة إلى مكافأة الفوز/الخسارة، يستخدم AlphaStar مكافآت زائفة مشتقّة من إحصاءات بشرية. الإحصاء الاستراتيجي z — المأخوذ من بيانات إعادة التشغيل البشرية — يرمِّز ترتيبات البناء وتركيبات الوحدات وتوقيتات الترقيات. مكافأة إضافية تشجّع الوكيل على اتّباع z المُختار أثناء التدريب المبكّر، ما يضمن التنوّع الاستراتيجي. تُخفَّض هذه المكافأة تدريجياً إلى الصفر مع الوقت، فيُحسِّن الوكيل النهائي أداءه للفوز فقط.

فكّر فيها كعجلات تدريب: الإحصاءات الاستراتيجية البشرية توجّه استكشاف الوكيل المبكّر نحو مناطق معقولة من فضاء الاستراتيجيات، وتمنعه من اكتشاف ثغرة واحدة منحطّة والعلوق فيها. حين يصبح الوكيل قوياً كفاية، تُزال العجلات.

النتائج: من الماس إلى الأستاذ الأكبر

قُيِّم AlphaStar على Battle.net، السلّم الرسمي لـ StarCraft II، حيث لعب بشكل مجهول ضدّ خصوم بشريين بشروط اللعبة المعيارية دون أي تبسيط. الوكيل النهائي — AlphaStar Final — حقّق تصنيف MMR أعلى من 6200 لجميع الأعراق الثلاثة، ما وضعه في دوري الأستاذ الأكبر (أعلى 0.2% من اللاعبين النشطين).

النتائج الرئيسية عبر مراحل التطوير تُظهر مساهمة كل مكوّن. التعلّم بالإشراف وحده يصل تقريباً إلى مستوى الماس (حوالي MMR 3700). إضافة التعلّم المعزّز أحادي الوكيل مع اللعب الذاتي ترفع الأداء إلى مستوى الأستاذ. لكن القفزة إلى الأستاذ الأكبر تأتي من تدريب الدوري: الإطار متعدّد الوكلاء الذي يكتشف نقاط الضعف الاستراتيجية ويعالجها عبر التفاعل بين الوكلاء الرئيسيين والمستغِلّين واللقطات المُجمَّدة.

والأهم أن AlphaStar لعب بقيود شبيهة بالبشر: تحرّكات الكاميرا مقيّدة لمحاكاة رؤية الإنسان، ومعدّلات الأفعال محدودة لتتوافق مع اللعب البشري الاحترافي (حوالي 22 فعلاً فعّالاً غير مكرّر لكل نافذة من 5 ثوانٍ). لم يُمنح الوكيل أي ميزة غير عادلة في السرعة أو المعلومات.

افتح في المختبر
قارن معدّلات الفوز بين أنواع وكلاء AlphaStar المختلفة ومتغيّرات الاجتزاء. شاهد كيف يُحسّن تدريب الدوري المتانة بشكل كبير.
تستيقظ التجربة عند وصولك…

حجم الحوسبة

عمل دوري AlphaStar لمدة 14 يوماً باستخدام 16 وحدة TPU لكل وكيل. أثناء التدريب، شهد كل وكيل ما يصل إلى 200 عام من لعب StarCraft في الوقت الحقيقي. ضمّ الدوري في نهاية المطاف حوالي 900 وكيل مميّز (بما في ذلك جميع اللقطات المُجمَّدة)، كل منها شبكة عصبية منفصلة بـ 139 مليون معامل.

كانت هذه الحوسبة الضخمة ضرورية لأن التعقيد الاستراتيجي لـ StarCraft تطلّب من الدوري اكتشاف تنوّع هائل من الاستراتيجيات والاستراتيجيات المضادّة. كل لقطة مُجمَّدة تحفظ «نوعاً» استراتيجياً فريداً في النظام البيئي. الوكيل النهائي لـ AlphaStar متين تحديداً لأنه اختُبر ضدّ كامل هذه الحديقة من الخصوم.

من ألعاب الطاولة إلى الاستراتيجية الفورية: الطريق إلى AlphaStar

  1. 2013

    Atari DQN

    أثبتت DeepMind أن وكيلاً واحداً بالتعلّم المعزّز العميق يمكنه تعلّم 49 لعبة Atari من البكسلات الخام، مرسيةً التعلّم المعزّز العميق كنهج فعّال للتحكّم المعقّد.

  2. 2016

    AlphaGo يهزم لي سيدول

    جمع AlphaGo بين الشبكات العصبية العميقة وبحث شجرة مونت كارلو ليهزم بطل العالم في Go — لعبة معلومات كاملة ذات فضاء حالات هائل.

  3. 2017

    AlphaZero يُتقن الشطرنج والشوغي وGo

    تعلّم AlphaZero اللعب الفائق في ثلاث ألعاب طاولة من اللعب الذاتي فقط دون بيانات بشرية — مثبتاً أن التعلّم المعزّز واللعب الذاتي يكتشفان استراتيجيات تتجاوز آلاف السنين من المعرفة البشرية.

  4. 2018

    IMPALA يُوسّع الممثّل-الناقد

    قدّمت IMPALA خوارزمية V-trace للتعلّم المعزّز الموزَّع القابل للتوسيع، مُتيحةً بنيات ممثّل-متعلّم لا متزامنة. بنى AlphaStar مباشرةً على طريقة التصحيح هذه لبيانات خارج السياسة.

  5. 2019

    AlphaStar يبلغ مستوى الأستاذ الأكبر

    حقّق AlphaStar مستوى الأستاذ الأكبر في StarCraft II بجميع الأعراق الثلاثة، مُحتلاً مرتبة ضمن أعلى 0.2% من اللاعبين البشريين — أول ذكاء اصطناعي يُتقن لعبة استراتيجية فورية كبرى دون تبسيط.

  6. 2019

    OpenAI Five يهزم أبطال العالم في Dota 2

    استخدم OpenAI Five تعلّماً معزّزاً واسع النطاق مع اللعب الذاتي ليهزم أبطال العالم الحاليين في Dota 2، مؤكّداً فعالية التعلّم المعزّز متعدّد الوكلاء في ألعاب الاستراتيجية الجماعية المعقّدة.

شبه كود: حلقة تدريب دوري AlphaStarpython

مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.

# حلقة تدريب دوري AlphaStar مبسّطة
league = initialize_from_supervised_agents()  # تهيئة من وكلاء التعلّم بالإشراف

for iteration in range(num_iterations):
    # كل نوع وكيل يتدرّب بشكل مختلف
    for agent in league.active_agents:

        # اختيار خصم من الدوري (لقطات مُجمَّدة + وكلاء نشطون)
        if agent.type == "main_agent":  # وكيل رئيسي
            opponent = league.sample_weighted_opponent(agent)
        elif agent.type == "main_exploiter":  # مستغِلّ رئيسي
            opponent = league.sample_main_agent()  # يستهدف الرئيسيين فقط
        else:  # مستغِلّ الدوري
            opponent = league.sample_any_agent()   # يستهدف الدوري كلّه

        # لعب دفعة من المباريات وجمع المسارات
        trajectories = play_games(agent.policy, opponent.policy)

        # التحديث باستخدام V-trace + UPGO + مكافأة الإحصاء z
        loss = v_trace_loss(trajectories) + upgo_loss(trajectories)
        loss += lambda_z * z_statistic_reward(trajectories)  # تُخفَّض تدريجياً
        agent.policy.update(loss)

    # تجميد الوكلاء الحاليين دورياً كلقطات
    if iteration % snapshot_interval == 0:
        for agent in league.active_agents:
            league.add_frozen_snapshot(agent)

المرجعVinyals, Babuschkin, Czarnecki, Mathieu, Dudzik, Chung, Choi, Powell, Ewalds, Georgiev, Oh, Horgan, Kroiss, Danihelka, Huang, Sifre, Cai, Agapiou, Jaderberg, Vezhnevets, Leblond, Pohlen, Dalibard, Budden, Sulsky, Molloy, Paine, Gulcehre, Wang, Pfaff, Wu, Ring, Yogatama, Wünsch, McKinney, Smith, Schaul, Lillicrap, Kavukcuoglu, Hassabis, Apps, Silver. Grandmaster Level in StarCraft II Using Multi-Agent Reinforcement Learning. Nature, 2019.

مصطلحات هذه الورقة