التعلم المعزز2016متوسط11 دقيقة قراءة
التحكم المستمر في الأبعاد العالية باستخدام تقدير الأفضلية المعمَّم
High-Dimensional Continuous Control Using Generalized Advantage Estimation
Schulman, J. · Moritz, P. · Levine, S. · Jordan, M. · Abbeel, P. — ICLR
المشكلة
أساليب تدرُّج تُحسِّن مباشرةً الهدف الذي نريده — التراكمية — وتتكامل بسلاسة مع الشبكات العصبية. لكن أمامها عقبتان أساسيتان: أولاً، العالي في تقديرات التدرُّج يفرض الحاجة إلى كمّ هائل من البيانات. ثانياً، يفقد استقراره لأنّ توزيع البيانات يتبدّل مع كل تحسُّن في السياسة. الحلّ المعتاد هو الاستعانة بدالة القيمة ، لكنّ ذلك يُدخل انحيازاً. فكيف نُوازن بين الانحياز والتباين؟
الإسهام
تقدير الأفضلية المعمَّم (GAE): مجموع أُسِّي مُرجَّح من بواقي الفرق الزمني يُقدِّر دالة الأفضلية. مُعامل واحد λ ∈ [0,1] يتحرّك بسلاسة بين تقدير الخطوة الواحدة (تباين منخفض، انحياز مرتفع) وتقدير مونت كارلو الكامل (تباين مرتفع، انحياز منخفض)، على غرار TD(λ). بدمج هذا المُقدِّر مع أمثَلة المنطقة الموثوقة للسياسة ودالة القيمة معاً، تمكّنت الشبكات العصبية لأول مرة من تعلُّم حركات ثلاثية الأبعاد معقدة — كالجري على قدمين والعَدْو الرباعي والنهوض من الأرض.
الأثر
صار GAE لبنة أساسية في التعلم المعزّز العميق الحديث. خوارزمية PPO — أوسع خوارزميات تدرُّج السياسة انتشاراً اليوم — تعتمد عليه في تقدير الأفضلية. سواء في وكلاء الألعاب أو التحكم الروبوتي أو ضبط النماذج اللغوية الكبيرة بالتغذية الراجعة البشرية، مقبض الانحياز والتباين الذي يوفّره GAE يشتغل بصمت في الخلفية كلما حُسب تدرُّج سياسة.
تخيّل أنك مدرِّب لاعب كرة قدم. بعد كل مباراة أمامك خياران: إما أن تراجع المباراة كاملةً لتحكم على ما نجح — تقييم دقيق لكنه مُشوَّش لأنّ عوامل كثيرة تتداخل. أو أن تُقيّم كل ركلة لحظة حدوثها — سريع لكنه قد يخدعك، لأنّ تمريرة ذكية ربما تصنع هدفاً بعد ثلاث لعبات.
GAE أشبه بمراجعة أبرز اللقطات بأوزان متفاوتة: اللعبات الأخيرة تأخذ الحصة الأكبر من انتباهك، لكنك تُلقي نظرة أيضاً على ما تلاها. مقبض اسمه λ يتحكم في مدى نظرك إلى الأمام — ارفعه لترى الصورة الكاملة (مع تشويش أكثر)، أو اخفضه لتقييم فوري (مع احتمال خطأ أعلى)، أو اضبطه في المنتصف لتحصل على أفضل ما في الطريقتين.
المشكلة: تدرُّجات السياسة مُشوَّشة
في ، يجمع — سلاسل من الحالات والأفعال والمكافآت — ثم يستثمرها في تحسين سياسته. يُحدّد الاتجاه الذي ينبغي أن نُعدّل فيه معاملات السياسة حتى تُولّد المسارات اللاحقة مكافأة تراكمية أعلى.
لكنّ المشكلة أنّ تدرُّج السياسة الخام يعتمد على العائد الكلي بعد كل فعل، وهذا العائد مجموع مكافآت مستقبلية كثيرة، كلٌّ منها يخضع لعشوائية والسياسة. الأمر أشبه بقياس ارتفاع موجة وسط عاصفة — كل قياس صحيح لكنه يتأرجح بشدة. هذا التباين المرتفع يعني أنك تحتاج ملايين العينات قبل أن تبرز إشارة التدرُّج فوق الضوضاء.
الحلّ المباشر أن تطرح خطاً مرجعياً — عادةً — من العائد. ما يتبقّى هو : أي كم كان هذا الفعل تحديداً أفضل أو أسوأ من متوسط الأفعال الممكنة في هذه . الأفضلية إشارة أنظف بكثير، لأنّ الخط المرجعي يمتصّ الجزء الأكبر من العشوائية.
اللبنة الأساسية: باقي الفرق الزمني
قبل أن نبني ، نحتاج أن نفهم لبنته الأساسية: باقي . حين يتخذ الوكيل الفعل في الحالة ، يحصل على المكافأة ويصل إلى الحالة . باقي الفرق الزمني يقيس المفاجأة: إلى أيّ حد جاءت النتيجة الفعلية أفضل أو أسوأ ممّا توقّعته دالة القيمة.
تصوّر الأمر وكأنك تتفقّد رصيدك البنكي. كنت تتوقع رصيداً بقيمة . بعد عملية واحدة، دخل حسابك وصار رصيدك المستقبلي المتوقع . الباقي هو الفارق — ذلك المكسب أو الخسارة التي لم تكن في الحسبان.
لو كانت دالة القيمة مثالية، لكان تقديراً غير منحاز لـلأفضلية. لكن في الواقع تقريبية (نُمثّلها عادةً بـ)، لذا يحمل قدراً من الانحياز — في المقابل، لأنه رقم واحد لكل خطوة زمنية، يظلّ تباينه منخفضاً. هذا هو الطرف ذو التباين المنخفض والانحياز المرتفع.
على الطرف الآخر، يمكنك تجاهل كلياً والاعتماد على عائد الكامل — أي جمع كل المكافآت الفعلية حتى نهاية . النتيجة غير منحازة لكن تباينها ضخم لأنها تتأثر بكل حدث عشوائي لاحق.
ما يفعله تقدير الأفضلية المعمَّم هو أنه يرسم مساراً سلساً بين هذين الطرفين.
معادلة GAE: مزيج مُرجَّح بـ λ
الفكرة المحورية هي حساب متوسط موزون أُسِّيًّا من تقديرات الأفضلية متعددة الخطوات. تقدير الخطوة الواحدة يستخدم باقي فرق زمني واحداً، وتقدير الخطوتين يسلسل باقيَين، وتقدير k خطوة يسلسل k بواقٍ. تقدير الأفضلية المعمَّم يمزج كل هذه التقديرات بأوزان تتناقص أُسِّيًّا وفق العامل :
لاحظ التشابه الواضح مع TD(λ) من التعلم بالفرق الزمني. في TD(λ)، تمزج آثار الأهلية بين تحديثات القيمة أحادية الخطوة ومتعددة الخطوات. تقدير الأفضلية المعمَّم يأخذ الفكرة ذاتها — المزج الأُسِّي — ويُطبّقها على دالة الأفضلية في تدرُّجات السياسة بدلاً من تحديثات القيمة.
ما يجعل الأمر أنيقاً هو بساطته: مُعامل واحد يتحكم في كامل طيف . عملياً، القيم – تُعطي نتائج ممتازة — فهي قريبة من أسلوب مونت كارلو (إشارة غنية متعددة الخطوات) لكن مع تلاشٍ كافٍ لكبح التباين.
مقبضان: γ مقابل λ
في تقدير الأفضلية المعمَّم مُعاملان يؤثران كلاهما في مقايضة الانحياز والتباين، لكن كلٌّ منهما يؤدي دوراً مختلفاً:
-
γ (غاما) — . يُخفّض وزن المكافآت البعيدة زمنياً. كلما انخفض γ صار الوكيل أقصر نظراً: يقلّ التباين (لأنّ مكافآت أقل تدخل الحساب) لكن يزداد الانحياز (لأنّ الوكيل يتجاهل العواقب المؤجلة). فكّر في γ على أنه الأفق الزمني الذي يهتم خلاله الوكيل بالنتائج.
-
λ (لامبدا) — تلاشي الأثر. يُخفّض وزن بواقي الفرق الزمني البعيدة. كلما انخفض λ اعتمد تقدير الأفضلية أكثر على تنبؤات دالة القيمة (تباين منخفض، انحياز مرتفع). فكّر في λ على أنه مقياس ثقتك بدالة القيمة مقارنةً بالتجربة الفعلية.
عملياً، كلاهما يُضبط بين 0.9 و0.99. الوصفة الشائعة: ، .
الحالتان الطرفيّتان: ماذا يحدث عند حدود λ
ما يُميّز تقدير الأفضلية المعمَّم أنّ قيمتَيه الحدّيتين تُعيدان إنتاج مُقدِّرَين معروفَين تماماً:
حين λ = 0: ينهار المجموع اللانهائي إلى وحده — باقي الفرق الزمني بخطوة واحدة. وهو نفس تقدير الأفضلية البسيط . تباينه منخفض لأنه يعتمد على انتقالة واحدة فقط، لكنّ انحيازه مرتفع إن لم تكن دالة القيمة دقيقة.
حين λ = 1: يصبح المجموع ، ويتبسّط تلسكوبياً إلى — أي عائد مونت كارلو المُخصَّم ناقص الخط المرجعي. الانحياز هنا صفري (بشرط صحة الخصم)، لكنّ التباين ضخم لأنه يعتمد على كل مكافأة مستقبلية.
أيّ قيمة لـ بين 0 و1 تُعطيك نقطة على الطيف المتصل بين هذين القطبَين.
تدريب مستقر: مناطق موثوقة لكلتا الشبكتين
الحصول على مُقدِّر أفضلية جيد وحده لا يكفي. الإسهام الثاني للورقة هو تطبيق أمثَلة على كلتا الشبكتين: شبكة السياسة وشبكة دالة القيمة.
على صعيد السياسة، يُقيّد TRPO كل تحديث بحيث تبقى السياسة الجديدة قريبة من سابقتها (وفق مقياس ). الهدف هو تفادي الانهيارات الكارثية التي قد يُسبّبها تحديث واحد سيّئ.
على صعيد دالة القيمة، تستخدم الورقة قيداً مماثلاً. السبب أنّ دالة القيمة تظهر داخل تقدير الأفضلية: لو تغيّرت بحدّة بين تكرار وآخر، لفقدت إشارة الأفضلية موثوقيتها. الأمر أشبه بمعايرة أداة قياس قبل كل استخدام — إن انحرفت الأداة فقراءاتك كلها بلا معنى.
وهناك ملاحظة جوهرية: يجب تحديث دالة القيمة بعد حساب تدرُّج السياسة، مع استخدام دالة القيمة القديمة عند تقدير الأفضلية. لو حدّثت أولاً وأفرطت في ملاءمتها، لاقتربت بواقي الفرق الزمني جميعها من الصفر، ولتلاشى تدرُّج السياسة.
تدرُّج السياسة الكامل مع GAE
تدرُّج السياسة يُرشدنا إلى الاتجاه الذي ينبغي تعديل معاملات السياسة فيه لرفع المكافأة المتوقعة. حين ندمج تقدير الأفضلية المعمَّم كمُقدِّر لـلأفضلية، يأخذ التدرُّج الشكل التالي:
يمكن قراءة هذه المعادلة كتوجيه بسيط لـ: لكل فعل اتخذه الوكيل، إن أشار تقدير الأفضلية إلى أنه أفضل من المتوسط فزِد احتماله، وإن كان أسوأ فقلِّله. حجم الأفضلية يُحدّد قوة التحديث. ولأنّ GAE يضبط التباين، تبقى هذه التحديثات مستقرة بما يكفي لتحقيق تقدّم متواصل حتى في المهام المعقدة.
GAE في شيفرة برمجية
مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.
import numpy as np
def compute_gae(rewards, values, gamma=0.99, lam=0.95):
"""حساب أفضليات GAE لمسار واحد.
rewards: مصفوفة المكافآت r_t (الطول T)
values: مصفوفة القيم V(s_t) (الطول T+1، تشمل الحالة النهائية)
gamma: عامل الخصم
lam: لامبدا GAE (مقبض الانحياز والتباين)
"""
T = len(rewards)
advantages = np.zeros(T)
gae = 0.0 # المجموع الجاري، يُبنى من النهاية
for t in reversed(range(T)):
delta = rewards[t] + gamma * values[t+1] - values[t] # باقي الفرق الزمني
gae = delta + gamma * lam * gae # تجميع البواقي المُرجَّحة
advantages[t] = gae
returns = advantages + values[:T] # أفضلية GAE + الخط المرجعي = الهدف
return advantages, returns
# الحيلة: التكرار العكسي حتى تُعيد كل خطوة استخدام المجموع من t+1.
# هذا يجعل الحساب كاملاً O(T) — خطّي في طول المسار.التجارب: حركة ثلاثية الأبعاد من الصفر
اختبرت الورقة تقدير الأفضلية المعمَّم على بعض أصعب مهام التحكم المستمر في ذلك الوقت، باستخدام محاكي الفيزياء MuJoCo:
-
المشّاء ثنائي القدمين — روبوت بشري يتعلّم المشي والجري. مع 33 بُعداً للحالة و10 أبعاد للفعل، يحتاج الوكيل إلى تنسيق مفاصل الورك والركبة والكاحل في آن واحد.
-
العدّاء رباعي الأرجل — روبوت بأربع أرجل يتعلّم العَدْو. عدد المفاصل ونقاط التلامس أكبر بكثير.
-
النهوض من الأرض — روبوت بشري يبدأ مُلقى أرضاً ويتعلّم الوقوف. هذه المهمة تتطلب استراتيجية متعددة المراحل يصعب على الأساليب أحادية الخطوة التعامل معها.
النتيجة الجوهرية: λ = 0 (فرق زمني بخطوة واحدة) أعطى أداءً ضعيفاً في جميع المهام بسبب الانحياز المفرط، بينما λ بين 0.9 و0.99 مع عامل خصم مناسب حقّقت أفضل منحنيات التعلم. هذا أكّد أنّ النقطة الوسطى في مقايضة الانحياز والتباين حاسمة في المسائل الصعبة.
الخوارزمية الكاملة في لمحة
بعد أن استعرضنا كل المكوّنات، لنرَ كيف تتكامل. خوارزمية أمثَلة السياسة المعتمدة على GAE تُكرّر الحلقة التالية:
الإرث: المحرك داخل PPO وما بعده
أبرز أثر لـتقدير الأفضلية المعمَّم هو التي نشرها المؤلف الرئيسي ذاته بعد عام. استعاض PPO عن الأمثَلة المعقدة من الرتبة الثانية في TRPO بـ مقطوعة أبسط بكثير، لكنه أبقى على GAE كمُقدِّر لـلأفضلية دون تغيير. اليوم، يكاد كل تنفيذ لـ PPO — سواء في وكلاء الألعاب أو التحكم الروبوتي أو للنماذج اللغوية — يحسب الأفضليات بالمعادلة ذاتها من هذه الورقة.
ويمتد التأثير أبعد من ذلك:
-
أنابيب RLHF لـ Claude وGPT وغيرها من تستخدم PPO مع GAE لحساب الأفضليات أثناء على بيانات التفضيل البشري.
-
الروبوتات — أنظمة تعلُّم الروبوتات الواقعية تعتمد على GAE بشكل اعتيادي عند تدريب سياسات الحركة والتحكم.
-
ذكاء الألعاب — OpenAI Five (في Dota 2) ووكلاء ألعاب معقدة أخرى اعتمدت على GAE لتحقيق تدريب مستقر عبر مليارات الخطوات.
2015
نشر TRPO
قدّم شولمان أمثَلة المنطقة الموثوقة مع ضمانات تحسين أُحادية الاتجاه عبر تحديثات مُقيَّدة بتباعد KL. ورقة GAE ستبني لاحقاً على هذا الأساس.
2016
نشر GAE (في ICLR)
أثبتت ورقة GAE أنّ ترجيح بواقي الفرق الزمني بـ λ يُقلّص التباين في تقدير تدرُّج السياسة بصورة ملحوظة، ما أتاح تعلُّم حركات ثلاثية الأبعاد معقدة.
2017
نشر PPO
أمثَلة السياسة القريبة بسّطت TRPO بدالة هدف مقطوعة، مع الإبقاء على GAE مُقدِّراً معيارياً للأفضلية.
2019
OpenAI Five يهزم أبطال العالم في Dota 2
PPO+GAE على نطاق ضخم — ما يعادل 45,000 سنة من خبرة اللعب، وGAE يُوفّر تقديرات أفضلية مستقرة طوال عملية التدريب.
2022
InstructGPT وChatGPT
ضبط النماذج اللغوية عبر التعلم المعزّز من التغذية الراجعة البشرية يعتمد على PPO+GAE لمواءمة مخرجات النموذج مع تفضيلات البشر، ما نقل GAE إلى عصر النماذج اللغوية الكبيرة.
المرجعSchulman, Moritz, Levine, Jordan, Abbeel. High-Dimensional Continuous Control Using Generalized Advantage Estimation. ICLR, 2016.
مصطلحات هذه الورقة
- الميزةAdvantage
- تقليل التباينVariance Reduction
- تدرج السياسة التشغيليةPolicy Gradient
- الفارق الزمني الحسابيTemporal Difference
- دالة تقييم العوائدValue Function
- الموازنة بين الانحياز والتباعدBias-Variance Tradeoff
- منطقة الثقةTrust Region
- المكافأةReward
- مُعامل الخصمDiscount Factor
- أثر الأهليةEligibility Trace