التعلم المعزز2023متقدم12 دقيقة قراءة
إتقان مجالات متنوّعة عبر نماذج العالم
Mastering Diverse Domains Through World Models
Hafner, D. · Pasukonis, J. · Ba, J. · Lillicrap, T. — arXiv / Nature 2025
المشكلة
نجح التعلّم المعزّز في تحقيق أداء يفوق البشر في مجالات محدّدة مثل لعبة غو وDota 2 وStarCraft، لكن كل واحد من هذه النجاحات احتاج ضبطاً يدوياً مُكثّفاً من متخصّصين: ضبط المعاملات الفائقة، وتشكيل المكافآت، وتعديلات خوارزمية مُفصَّلة لذلك المجال بالذات. وحين تحاول نقل خوارزمية من أتاري إلى الروبوتات، أو من التحكم المستمر إلى عوالم ثلاثية الأبعاد ذات مكافآت شحيحة، تحتاج في الغالب جولة جديدة من الضبط المُكلف. هذه الهشاشة تقف حائلاً أمام بناء عملاء عامّين قادرين على التعلّم في بيئات متنوّعة بدون تدخّل بشري.
الإسهام
DreamerV3 خوارزمية تعلّم معزّز مبنية على نموذج عالم واحد بمعاملات فائقة ثابتة لا تتغيّر بين المجالات، ومع ذلك تتفوّق على أساليب متخصّصة في أكثر من 150 مهمة تشمل التحكم المستمر وألعاب أتاري والتنقل ثلاثي الأبعاد وألعاب البقاء في عوالم مفتوحة. يعتمد هذا الأداء على مجموعة من تقنيات المتانة: تنبؤات symlog لتعلّم مستقل عن المقياس، وموازنة تباعد كولباك-لايبلر مع البتات الحرة مستقر لنموذج العالم، وفئويات مخلوطة بتوزيع منتظم للاستكشاف، وتسوية العائد بالنسب المئوية لتحديث الممثّل بصورة مستقلة عن المجال. وهي أول خوارزمية تجمع الماس في ماينكرافت من الصفر بدون بيانات بشرية أو مناهج تدريبية.
الأثر
أثبت DreamerV3 أن خوارزمية عامة واحدة بدون ضبط مخصّص لكل مجال تستطيع منافسة الخوارزميات المتخصّصة بل والتفوّق عليها في معايير تعلّم معزّز متباينة تماماً. نُشر العمل في مجلة Nature عام 2025، وهو ما أعطى مصداقية كبيرة لمنهجية نموذج العالم بوصفها مساراً حقيقياً نحو بناء عملاء عامّين. انتقلت تقنيات المتانة التي قدّمها — وعلى رأسها تنبؤات symlog وتسوية العائد بالنسب المئوية — إلى أبحاث خارج نطاق التعلّم المبني على نموذج، بما في ذلك أنواع مختلفة من PPO. وأصبح إنجاز جمع الماس في ماينكرافت علامة فارقة في الاستكشاف المفتوح انطلاقاً من مكافآت شحيحة.
تخيّل لاعبة شطرنج محترفة لا تحتاج رقعة أمامها. تستطيع أن تتخيّل النقلات والنقلات المضادّة ومباريات بأكملها داخل ذهنها فقط — وتستخدم هذا التمرين الذهني لتحسين أدائها. الآن تخيّل أن هذه القدرة لا تقتصر على الشطرنج: تعمل في كرة القدم ومحاكاة الطيران وألعاب البقاء — كلها بنفس عملية التخيّل، بدون أن تُعيد تعلّم كيفية التفكير.
DreamerV3 هو تلك اللاعبة تماماً. يبني لأي عالم يواجهه، ثم يُجرّب آلاف الاستراتيجيات في خياله. والعملية نفسها — بدون أي تعديل — تنجح في أكثر من 150 مهمة مختلفة اختلافاً جذرياً.
المراحل الثلاث: جرّب، تخيّل، تحسّن
يدور عمل DreamerV3 في ثلاث مراحل تتكرّر باستمرار. في المرحلة الأولى يتفاعل العميل مع البيئة الفعلية ويُخزّن ما يمرّ به في : ملاحظات خام وأفعال ومكافآت. في المرحلة الثانية يتعلّم نموذج العالم كيف يضغط هذه التجارب في مُكثَّف ويتنبّأ بالحالات والمكافآت القادمة. وفي المرحلة الثالثة يأتي دور : يتدرّبان على تحسين السلوك بالكامل داخل خيال نموذج العالم، بدون أن يلمسا البيئة الحقيقية مرة أخرى.
الفكرة المحورية هنا أن المرحلة الثالثة — مرحلة التخيّل — أقل تكلفة بمراحل من التفاعل الحقيقي. يستطيع العميل محاكاة آلاف المستقبلية في الوقت نفسه الذي يستغرقه تشغيل حلقة واحدة في البيئة الفعلية. هذا ما يجعل DreamerV3 متميّزاً في : يستخلص أقصى قدر ممكن من التعلّم بأقل قدر من التجربة الحقيقية.
نموذج العالم: RSSM — حين تلتقي الذاكرة بعدم اليقين
يقوم نموذج العالم على بنية تُعرف بنموذج فضاء الحالة التكراري (RSSM)، وفكرتها أنها تجمع بين نوعين متكاملين من التمثيل. النوع الأول مسار حتمي يعتمد على شبكة التكرارية للاحتفاظ بذاكرة مستمرة لما حدث سابقاً — تخيّله ملخّصاً جارياً يتراكم مع كل خطوة. النوع الثاني مسار عشوائي يلتقط حالة عدم اليقين الطبيعية بشأن ما سيحدث لاحقاً، لأن المستقبل لا يمكن التنبّؤ به بشكل كامل أبداً.
يتكوّن من هذين المسارين معاً حالة كامنة مضغوطة عند كل خطوة زمنية. هي الحالة الداخلية لوحدة GRU، بينما الحالة العشوائية عبارة عن 32 توزيعاً فئوياً يحتوي كل منها على 32 فئة، وتُمثَّل كمتجهات أحادية التفعيل (one-hot). وقد تبيّن في DreamerV2 أن هذا التمثيل المتقطّع أقدر على التعبير من الغاوسية حين نتعامل مع بيئات معقّدة.
يتألّف النموذج من أربعة مكوّنات تعمل بتناسق: أولاً الذي يأخذ الخام ويضغطها في الحالة العشوائية. ثانياً المتنبّئ الديناميكي الذي يتوقّع الحالة العشوائية التالية اعتماداً على الحالة الحتمية وحدها — وهذا هو ما يُتيح التخيّل بدون ملاحظات فعلية. ثالثاً الذي يُقدّر عند كل حالة. وأخيراً الذي يُعيد بناء الملاحظات حتى يظل الفضاء الكامن مرتبطاً بالواقع ولا ينفصل عنه.
تنبؤات Symlog: تحويل واحد لترويض جميع المقاييس
البيئات المختلفة تُنتج أرقاماً على مقاييس متباينة جداً. مهمة روبوتية قد تُعطي مكافآت بين -1 و1، بينما لعبة فيديو قد تُعطي مكافآت بالآلاف، وقيم البكسلات تتراوح بين 0 و255. حين تضطر الشبكة العصبية للتعامل مع كل هذه المقاييس بالأوزان ذاتها، يفقد التدريب استقراره — القيم الكبيرة تستحوذ على التدرّجات والقيم الصغيرة تضيع في الزحام.
الحلول السابقة تراوحت بين قصّ المكافأة (الذي يُهدر معلومات قيّمة) و بإحصاءات متحرّكة (وهي غير مستقرّة وسهلة الانكسار). DreamerV3 يطرح بديلاً أبسط وأمتن: تحويل symlog.
يُوظّف DreamerV3 تحويل symlog في ثلاثة مواضع: المُرمِّز يضغط الملاحظات المُدخلة، ومتنبّئ المكافأة يُخرج تنبؤاته في فضاء symlog ويفكّها عبر توزيع twohot، والناقد كذلك يتنبّأ بالقيم في فضاء symlog. ترميز twohot هو صورة مُبسَّطة من التوزيعي — فبدلاً من أن تتنبّأ الشبكة بقيمة وحيدة، تتنبّأ بتوزيع فئوي على نطاق مُقسَّم من القيم ثم تحسب منه القيمة المتوقّعة. الفائدة أن هذا الأسلوب يوفّر إشارات تدرّج أغنى بكثير مقارنة بالتقديرات النقطية.
موازنة KL والبتات الحرة: إبقاء نموذج العالم أميناً
نموذج العالم يواجه توتّراً دائماً بين قوّتين متعاكستين. من جهة، التوزيع اللاحق (أي المُرمِّز) يحاول حشد أكبر قدر من معلومات الملاحظة داخل الحالة الكامنة. ومن جهة أخرى، التوزيع القَبلي (أي المتنبّئ الديناميكي) يحاول التنبّؤ بالحالة الكامنة التالية من الذاكرة وحدها بدون أن يرى الملاحظة. بين الاثنين يكشف كمّية المعلومات التي يُهرّبها المُرمِّز ولا يستطيع المتنبّئ الديناميكي التنبّؤ بها.
المشكلة أنه إذا كانت عقوبة KL شديدة، يستسلم المُرمِّز ويتوقّف عن ترميز الملاحظات — فتصبح الحالات الكامنة سهلة التنبّؤ لكنها فارغة المحتوى وعديمة الفائدة. وإذا كانت العقوبة ضعيفة جداً، لا يتعلّم المتنبّئ الديناميكي شيئاً لأن المُرمِّز يتكفّل بكل العمل. في السابق كان لا بدّ من ضبط هذا التوازن يدوياً في كل مجال على حدة.
DreamerV3 يحلّ هذه المعضلة بدمج تقنيتين. الأولى موازنة KL بتقسيم 80/20: نسبة 80% من التدرّج تُوجَّه لتدريب المتنبّئ الديناميكي حتى يطابق التوزيع اللاحق (KL الأمامي)، بينما 20% فقط تُوجَّه لتدريب المُرمِّز ليظل قريباً من التوزيع القَبلي (KL العكسي). هذا التفاوت المتعمَّد ينحاز لصالح المتنبّئ الديناميكي — وهو المكوّن الذي يعمل وحده أثناء التخيّل. الثانية البتات الحرة التي تضع حداً أدنى لـ KL عند 1 نات، فتسمح للمُرمِّز بأن يُمرّر على الأقل ناتاً واحداً من المعلومات في كل خطوة زمنية بدون أي عقوبة. هذا يمنع الحل المنهار الذي يُفرغ الفضاء الكامن تماماً من أي محتوى مفيد.
شبكات أمان الاستكشاف: الخلط المنتظم وتسوية النسب المئوية
تقنيتان إضافيتان تُتمّمان تصميم DreamerV3 المستقل عن المجال.
الفئويات المخلوطة بتوزيع منتظم (Unimix). في بنية RSSM وشبكة الممثّل، يُخلط كل توزيع فئوي مع نسبة 1% من الضجيج المنتظم: . الهدف هو ضمان ألا يصل احتمال أي فعل أو فئة كامنة إلى الصفر مطلقاً. حتى السياسة المدرَّبة جيداً تحتفظ دائماً بفرصة 1% لتجريب شيء غير متوقَّع. تخيّلها كباب طوارئ مفتوح دائماً — العميل لا يمكن أن يعلق نهائياً في طريق سلوكي مسدود.
تسوية العائد بالنسب المئوية. الطريقة التقليدية لتسوية العائد تقسمه على الانحراف المعياري المتحرّك، لكن حين تكون المكافآت شحيحة ويقترب الانحراف من الصفر، يتضخّم الضجيج بشكل كارثي. DreamerV3 يعتمد بديلاً أذكى: يتتبّع النسبة المئوية الخامسة والخامسة والتسعين للعوائد عبر متوسطات متحرّكة أُسّية، ثم يُعيد تقييس العوائد بحسب الفجوة بين هاتين النسبتين (فقط حين تتجاوز الفجوة 1). النتيجة أن الممثّل يصبح غير حسّاس للمقياس المطلق — مكافأة 0.01 في مجال ومكافأة 10,000 في مجال آخر تُنتجان حجم تدرّج متقارباً.
التعلّم في الخيال: حلقة الممثّل والناقد
بعد أن يكتمل تدريب نموذج العالم، ينتقل DreamerV3 إلى تحسين سياسته بالكامل داخل خيال هذا النموذج. يبدأ بحالات مأخوذة من ذاكرة الإعادة، ثم يفرد مسارات متخيَّلة باستخدام المتنبّئ الديناميكي — بدون أي حاجة للتفاعل مع البيئة الحقيقية. الممثّل (شبكة السياسة) يختار الأفعال، والناقد () يُقدّر العائد التراكمي المتوقَّع من كل حالة.
يسعى الممثّل لتعظيم تقديرات الناقد عبر تدرّجات المرور المباشر (straight-through): ينتشر عكسياً عبر المسار المتخيَّل بالكامل. ويُضاف منظّم بمقياس ثابت لتشجيع ، وفعاليته مضمونة بفضل تسوية النسب المئوية — الممثّل يرى عوائد بمقاييس متقاربة أيّاً كان المجال.
الناقد يُدرَّب بتنبؤات symlog twohot ويُنظَّم باتجاه متوسط متحرّك أُسّي (EMA) لمخرجاته السابقة، ممّا يُنعّم ديناميكا التدريب. كذلك تُستخدم بطيئة التحديث لتوفير أهداف تمهيد مستقرّة، فلا تلاحق دالة القيمة تقديراتها المتغيّرة بسرعة.
النتائج: خوارزمية واحدة، أكثر من 150 مهمة، صفر ضبط
اختُبر DreamerV3 على سبع مجموعات معايير بمجموعة واحدة لا تتغيّر: التحكم بالإحساس الذاتي (مستمر)، والتحكم البصري (بكسلات)، وأتاري 200 مليون، وBSuite، وCrafter، وDMLab، وماينكرافت. في كل مجموعة كان أداؤه مكافئاً أو متفوّقاً على خوارزميات ضُبطت خصيصاً لذلك المجال.
أبرز النتائج وأكثرها إثارة كانت في ماينكرافت. جمع الماس يحتاج من العميل أن يتنقّل في عالم ثلاثي الأبعاد مفتوح اعتماداً على الملاحظات البكسلية فقط، وأن يصنع شجرة تقنية من 17 عنصراً بالترتيب الصحيح، وكل ذلك مع مكافآت شحيحة للغاية — إشارة المكافأة الوحيدة هي الحصول على الماس. المحاولات السابقة لجأت إمّا إلى عروض بشرية أو تعلّم منهجي أو موارد حوسبة ضخمة (VPT استخدم 720 وحدة V100 على مدى 9 أيام مع بيانات من مقاولين). DreamerV3 نجح في جمع الماس من البداية إلى النهاية ومن الصفر بوحدة V100 واحدة — وهو أول خوارزمية تُحقّق ذلك.
كذلك أظهر الباحثون أن النموذج يتحسّن بشكل طردي مع زيادة الحجم: النماذج الأكبر أدّت مباشرة إلى كفاءة عيّنات أعلى وأداء نهائي أفضل، بدون ظهور عدم استقرار أو عوائد متناقصة ضمن النطاق المُختبَر.
تفاصيل البنية: مجموعة الأدوات الكاملة
إلى جانب تقنيات المتانة، يُدخل DreamerV3 عدة تحسينات على مستوى البنية. وحدة GRU تُستبدل بنسخة تُسمّى Block GRU تُطبّق آلية البوابات بالتوازي على كتل بدلاً من عنصر بعنصر، ممّا يرفع الكفاءة الحسابية. جميع الطبقات تستخدم (وتحديداً RMSNorm في النسخ الأحدث) متبوعة SiLU، عوضاً عن ELU التي كانت مستخدمة سابقاً. المُحسِّن يعتمد قصّ التدرّج التكيّفي لتثبيت التدريب، وذاكرة الإعادة تتضمّن طابوراً للتجارب الحديثة يعمل جنباً إلى جنب مع ذاكرة أكبر تسحب عيّنات بشكل منتظم.
قد تبدو هذه خيارات هندسية ثانوية، لكنها مجتمعةً هي ما يُمكّن DreamerV3 من التدريب بثبات مع شبكات كبيرة. ثبات التدريب الذي توفّره تسوية الطبقة وSiLU كان حاسماً للتوسّع في حجم النموذج — النسخ السابقة من Dreamer لم تكن قادرة على استخدام نماذج بهذا الحجم بدون أن تتباعد قيم التدريب وتنهار.
مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.
# المرحلة 1: جمع التجارب
obs = env.reset()
for step in range(N):
action = actor(world_model.encode(obs)) # التصرّف في العالم الحقيقي
next_obs, reward, done = env.step(action)
replay_buffer.add(obs, action, reward, done)
obs = next_obs
# المرحلة 2: تدريب نموذج العالم
batch = replay_buffer.sample(B, T) # B تسلسل بطول T
for each timestep t in batch:
h_t = GRU(h_{t-1}, z_{t-1}, a_{t-1}) # الحالة الحتمية
z_t_prior = dynamics_predictor(h_t) # تنبّؤ بدون ملاحظة
z_t_post = encoder(h_t, obs_t) # ترميز مع الملاحظة
loss += reconstruction(decoder(h_t, z_t_post), obs_t)
loss += reward_loss(reward_pred(h_t, z_t_post), reward_t)
loss += kl_balanced(z_t_post, z_t_prior) # 80/20 + بتات حرة
# المرحلة 3: تحسين السياسة في الخيال
h, z = sample_initial_state(replay_buffer)
for horizon in range(H): # تخيّل H خطوة
action = actor(h, z) # الممثّل يختار الفعل
h = GRU(h, z, action) # تقدّم الديناميكا
z = dynamics_predictor(h) # تنبّؤ الحالة التالية
value = critic(h, z) # تقييم الحالة
actor_loss = -sum(normalized_returns) # تعظيم العوائد critic_loss = twohot_symlog_loss(value, target) # تنبّؤ العوائدسلالة Dreamer: من PlaNet إلى Nature
2019
PlaNet (هافنر وآخرون)
قدّم بنية RSSM لتعلّم نماذج العالم بمكوّنين حتمي وعشوائي معاً. اعتمد تخطيط الأفعال على أمثَلة مباشرة باستخدام طريقة CEM في الفضاء الكامن.
2020
DreamerV1 (هافنر وآخرون)
استبدل التخطيط المباشر بممثّل-ناقد مُتعلَّم، ممّا أتاح تحسين السياسة بتمرير التدرّجات عبر مسارات متخيّلة. كان أول إصدار من Dreamer يُتقن مهام التحكم المستمر انطلاقاً من البكسلات.
2021
DreamerV2 (هافنر وآخرون)
انتقل إلى حالات كامنة فئوية (متجهات one-hot بأبعاد 32×32) وأدخل آلية موازنة KL. وصل إلى أداء بمستوى بشري على ألعاب أتاري بوحدة GPU واحدة.
2023
DreamerV3 (هذه الورقة)
أضاف تنبؤات symlog والبتات الحرة والفئويات المخلوطة وتسوية النسب المئوية. أول خوارزمية بمعاملات ثابتة تُتقن أكثر من 150 مهمة وتجمع ماس ماينكرافت من الصفر.
2025
النشر في مجلة Nature
نُشر DreamerV3 في مجلة Nature، ما أعطى ثقلاً علمياً كبيراً لمنهجية التعلّم المعزّز المبني على نماذج العالم بوصفها مساراً جدّياً نحو بناء عملاء عامّي الغرض.
المرجعHafner, Pasukonis, Ba, Lillicrap. Mastering Diverse Domains Through World Models. arXiv preprint arXiv:2301.04104 / Nature 2025, 2023.
مصطلحات هذه الورقة
- نموذج العالَمWorld Model
- التعلم بالتعزيز المعتمد على بناء بيئةModel-Based RL
- بنية الفاعل والناقدActor-Critic
- الفضاء الكامنLatent Space
- التعلم المعززReinforcement Learning
- تدرج السياسة التشغيليةPolicy Gradient
- دالة تقييم العوائدValue Function
- صياغة وهندسة دالة المكافأةReward Shaping
- الاستكشاف (تجربة أفعال جديدة)Exploration
- التعميمGeneralization
- تباعد KLKL Divergence
- العشوائية الدلاليةEntropy
- مُعامل الخصمDiscount Factor
- ذاكرة التجاربReplay Buffer
- المُرمِّز الذاتيAutoencoder