التعلم المعزز2016متوسط11 دقيقة قراءة

التحكم المستمر في الأبعاد العالية باستخدام تقدير الأفضلية المعمَّم

High-Dimensional Continuous Control Using Generalized Advantage Estimation

Schulman, J. · Moritz, P. · Levine, S. · Jordan, M. · Abbeel, P. — ICLR

المشكلة

أساليب تدرُّج تُحسِّن مباشرةً الهدف الذي نريده — التراكمية — وتتكامل بسلاسة مع الشبكات العصبية. لكن أمامها عقبتان أساسيتان: أولاً، العالي في تقديرات التدرُّج يفرض الحاجة إلى كمّ هائل من البيانات. ثانياً، يفقد استقراره لأنّ توزيع البيانات يتبدّل مع كل تحسُّن في السياسة. الحلّ المعتاد هو الاستعانة بدالة القيمة ، لكنّ ذلك يُدخل انحيازاً. فكيف نُوازن بين الانحياز والتباين؟

الإسهام

تقدير الأفضلية المعمَّم (GAE): مجموع أُسِّي مُرجَّح من بواقي الفرق الزمني يُقدِّر دالة الأفضلية. مُعامل واحد λ ∈ [0,1] يتحرّك بسلاسة بين تقدير الخطوة الواحدة (تباين منخفض، انحياز مرتفع) وتقدير مونت كارلو الكامل (تباين مرتفع، انحياز منخفض)، على غرار TD(λ). بدمج هذا المُقدِّر مع أمثَلة المنطقة الموثوقة للسياسة ودالة القيمة معاً، تمكّنت الشبكات العصبية لأول مرة من تعلُّم حركات ثلاثية الأبعاد معقدة — كالجري على قدمين والعَدْو الرباعي والنهوض من الأرض.

الأثر

صار GAE لبنة أساسية في التعلم المعزّز العميق الحديث. خوارزمية PPO — أوسع خوارزميات تدرُّج السياسة انتشاراً اليوم — تعتمد عليه في تقدير الأفضلية. سواء في وكلاء الألعاب أو التحكم الروبوتي أو ضبط النماذج اللغوية الكبيرة بالتغذية الراجعة البشرية، مقبض الانحياز والتباين الذي يوفّره GAE يشتغل بصمت في الخلفية كلما حُسب تدرُّج سياسة.

تخيّل أنك مدرِّب لاعب كرة قدم. بعد كل مباراة أمامك خياران: إما أن تراجع المباراة كاملةً لتحكم على ما نجح — تقييم دقيق لكنه مُشوَّش لأنّ عوامل كثيرة تتداخل. أو أن تُقيّم كل ركلة لحظة حدوثها — سريع لكنه قد يخدعك، لأنّ تمريرة ذكية ربما تصنع هدفاً بعد ثلاث لعبات.

GAE أشبه بمراجعة أبرز اللقطات بأوزان متفاوتة: اللعبات الأخيرة تأخذ الحصة الأكبر من انتباهك، لكنك تُلقي نظرة أيضاً على ما تلاها. مقبض اسمه λ يتحكم في مدى نظرك إلى الأمام — ارفعه لترى الصورة الكاملة (مع تشويش أكثر)، أو اخفضه لتقييم فوري (مع احتمال خطأ أعلى)، أو اضبطه في المنتصف لتحصل على أفضل ما في الطريقتين.

المشكلة: تدرُّجات السياسة مُشوَّشة

في ، يجمع — سلاسل من الحالات والأفعال والمكافآت — ثم يستثمرها في تحسين سياسته. يُحدّد الاتجاه الذي ينبغي أن نُعدّل فيه معاملات السياسة حتى تُولّد المسارات اللاحقة مكافأة تراكمية أعلى.

لكنّ المشكلة أنّ تدرُّج السياسة الخام يعتمد على العائد الكلي بعد كل فعل، وهذا العائد مجموع مكافآت مستقبلية كثيرة، كلٌّ منها يخضع لعشوائية والسياسة. الأمر أشبه بقياس ارتفاع موجة وسط عاصفة — كل قياس صحيح لكنه يتأرجح بشدة. هذا التباين المرتفع يعني أنك تحتاج ملايين العينات قبل أن تبرز إشارة التدرُّج فوق الضوضاء.

الحلّ المباشر أن تطرح خطاً مرجعياً — عادةً V(s)V(s) — من العائد. ما يتبقّى هو A(s,a)=Q(s,a)V(s)A(s,a) = Q(s,a) - V(s): أي كم كان هذا الفعل تحديداً أفضل أو أسوأ من متوسط الأفعال الممكنة في هذه . الأفضلية إشارة أنظف بكثير، لأنّ الخط المرجعي يمتصّ الجزء الأكبر من العشوائية.

افتح في المختبر
اسحب λ بين 0 و1 لترى كيف يتغيّر التوازن بين الانحياز والتباين. عند λ=0 يميل الميزان نحو الانحياز، وعند λ=1 يميل نحو التباين.
تستيقظ التجربة عند وصولك…

اللبنة الأساسية: باقي الفرق الزمني

قبل أن نبني ، نحتاج أن نفهم لبنته الأساسية: باقي . حين يتخذ الوكيل الفعل ata_t في الحالة sts_t، يحصل على المكافأة rtr_t ويصل إلى الحالة st+1s_{t+1}. باقي الفرق الزمني يقيس المفاجأة: إلى أيّ حد جاءت النتيجة الفعلية أفضل أو أسوأ ممّا توقّعته دالة القيمة.

تصوّر الأمر وكأنك تتفقّد رصيدك البنكي. كنت تتوقع رصيداً بقيمة V(st)V(s_t). بعد عملية واحدة، دخل حسابك rtr_t وصار رصيدك المستقبلي المتوقع V(st+1)V(s_{t+1}). الباقي δt\delta_t هو الفارق — ذلك المكسب أو الخسارة التي لم تكن في الحسبان.

δt=rt+γV(st+1)V(st)\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)
باقي الفرق الزمني — مفاجأة الخطوة الواحدةr_t = المكافأة الفورية · γV(s_{t+1}) = التنبؤ المُخصَّم بكل ما سيأتي · V(s_t) = ما كنا نتوقعه · الفرق = كم كان الواقع أفضل أو أسوأ من التوقع

لو كانت دالة القيمة VV مثالية، لكان δt\delta_t تقديراً غير منحاز لـلأفضلية. لكن في الواقع VV تقريبية (نُمثّلها عادةً بـ)، لذا يحمل δt\delta_t قدراً من الانحياز — في المقابل، لأنه رقم واحد لكل خطوة زمنية، يظلّ تباينه منخفضاً. هذا هو الطرف ذو التباين المنخفض والانحياز المرتفع.

على الطرف الآخر، يمكنك تجاهل VV كلياً والاعتماد على عائد الكامل — أي جمع كل المكافآت الفعلية حتى نهاية . النتيجة غير منحازة لكن تباينها ضخم لأنها تتأثر بكل حدث عشوائي لاحق.

ما يفعله تقدير الأفضلية المعمَّم هو أنه يرسم مساراً سلساً بين هذين الطرفين.

معادلة GAE: مزيج مُرجَّح بـ λ

الفكرة المحورية هي حساب متوسط موزون أُسِّيًّا من تقديرات الأفضلية متعددة الخطوات. تقدير الخطوة الواحدة يستخدم باقي فرق زمني واحداً، وتقدير الخطوتين يسلسل باقيَين، وتقدير k خطوة يسلسل k بواقٍ. تقدير الأفضلية المعمَّم يمزج كل هذه التقديرات بأوزان تتناقص أُسِّيًّا وفق العامل γλ\gamma\lambda:

A^tGAE(γ,λ)=l=0(γλ)lδt+l\hat{A}_t^{GAE(\gamma,\lambda)} = \sum_{l=0}^{\infty} (\gamma\lambda)^l \, \delta_{t+l}
تقدير الأفضلية المعمَّم — المعادلة الجوهريةكل باقي فرق زمني مستقبلي δ يُرجَّح بـ (γλ)ˡ — البواقي القريبة لها الوزن الأكبر والبعيدة تتلاشى · λ=0 يُبقي فقط δ_t (خطوة واحدة، تباين منخفض، انحياز مرتفع) · λ=1 يجمع كل البواقي (مونت كارلو، تباين مرتفع، انحياز منخفض) · λ في المنتصف ينتقل بسلاسة بينهما

لاحظ التشابه الواضح مع TD(λ) من التعلم بالفرق الزمني. في TD(λ)، تمزج آثار الأهلية بين تحديثات القيمة أحادية الخطوة ومتعددة الخطوات. تقدير الأفضلية المعمَّم يأخذ الفكرة ذاتها — المزج الأُسِّي — ويُطبّقها على دالة الأفضلية في تدرُّجات السياسة بدلاً من تحديثات القيمة.

ما يجعل الأمر أنيقاً هو بساطته: مُعامل واحد يتحكم في كامل طيف . عملياً، القيم λ0.95\lambda \approx 0.950.970.97 تُعطي نتائج ممتازة — فهي قريبة من أسلوب مونت كارلو (إشارة غنية متعددة الخطوات) لكن مع تلاشٍ كافٍ لكبح التباين.

افتح في المختبر
اضبط λ وراقب كيف تتوزّع الأوزان على بواقي الفرق الزمني المستقبلية. عند λ=0 لا يُستخدم إلا الباقي الأول، وعند λ=1 تحصل جميع البواقي على أوزان متقاربة.
تستيقظ التجربة عند وصولك…

مقبضان: γ مقابل λ

في تقدير الأفضلية المعمَّم مُعاملان يؤثران كلاهما في مقايضة الانحياز والتباين، لكن كلٌّ منهما يؤدي دوراً مختلفاً:

  • γ (غاما). يُخفّض وزن المكافآت البعيدة زمنياً. كلما انخفض γ صار الوكيل أقصر نظراً: يقلّ التباين (لأنّ مكافآت أقل تدخل الحساب) لكن يزداد الانحياز (لأنّ الوكيل يتجاهل العواقب المؤجلة). فكّر في γ على أنه الأفق الزمني الذي يهتم خلاله الوكيل بالنتائج.

  • λ (لامبدا) — تلاشي الأثر. يُخفّض وزن بواقي الفرق الزمني البعيدة. كلما انخفض λ اعتمد تقدير الأفضلية أكثر على تنبؤات دالة القيمة (تباين منخفض، انحياز مرتفع). فكّر في λ على أنه مقياس ثقتك بدالة القيمة مقارنةً بالتجربة الفعلية.

عملياً، كلاهما يُضبط بين 0.9 و0.99. الوصفة الشائعة: γ=0.99\gamma = 0.99، λ=0.95\lambda = 0.95.

افتح في المختبر
استكشف كيف تؤثّر تركيبات (γ, λ) المختلفة في الوزن الفعلي لكل خطوة مستقبلية. اللون الفاتح يعني وزناً مرتفعاً، والداكن يعني وزناً منخفضاً.
تستيقظ التجربة عند وصولك…

الحالتان الطرفيّتان: ماذا يحدث عند حدود λ

ما يُميّز تقدير الأفضلية المعمَّم أنّ قيمتَيه الحدّيتين تُعيدان إنتاج مُقدِّرَين معروفَين تماماً:

حين λ = 0: ينهار المجموع اللانهائي إلى δt\delta_t وحده — باقي الفرق الزمني بخطوة واحدة. وهو نفس تقدير الأفضلية البسيط rt+γV(st+1)V(st)r_t + \gamma V(s_{t+1}) - V(s_t). تباينه منخفض لأنه يعتمد على انتقالة واحدة فقط، لكنّ انحيازه مرتفع إن لم تكن دالة القيمة دقيقة.

حين λ = 1: يصبح المجموع l=0γlδt+l\sum_{l=0}^{\infty} \gamma^l \delta_{t+l}، ويتبسّط تلسكوبياً إلى l=0γlrt+lV(st)\sum_{l=0}^{\infty} \gamma^l r_{t+l} - V(s_t) — أي عائد مونت كارلو المُخصَّم ناقص الخط المرجعي. الانحياز هنا صفري (بشرط صحة الخصم)، لكنّ التباين ضخم لأنه يعتمد على كل مكافأة مستقبلية.

أيّ قيمة لـ λ\lambda بين 0 و1 تُعطيك نقطة على الطيف المتصل بين هذين القطبَين.

افتح في المختبر
حرّك λ من 0 إلى 1 وراقب تحوُّل تقدير GAE من أفضلية الخطوة الواحدة إلى أفضلية مونت كارلو الكاملة. المنطقة المظلّلة تُمثّل مدى التباين.
تستيقظ التجربة عند وصولك…

تدريب مستقر: مناطق موثوقة لكلتا الشبكتين

الحصول على مُقدِّر أفضلية جيد وحده لا يكفي. الإسهام الثاني للورقة هو تطبيق أمثَلة على كلتا الشبكتين: شبكة السياسة وشبكة دالة القيمة.

على صعيد السياسة، يُقيّد TRPO كل تحديث بحيث تبقى السياسة الجديدة قريبة من سابقتها (وفق مقياس ). الهدف هو تفادي الانهيارات الكارثية التي قد يُسبّبها تحديث واحد سيّئ.

على صعيد دالة القيمة، تستخدم الورقة قيداً مماثلاً. السبب أنّ دالة القيمة تظهر داخل تقدير الأفضلية: لو تغيّرت بحدّة بين تكرار وآخر، لفقدت إشارة الأفضلية موثوقيتها. الأمر أشبه بمعايرة أداة قياس قبل كل استخدام — إن انحرفت الأداة فقراءاتك كلها بلا معنى.

وهناك ملاحظة جوهرية: يجب تحديث دالة القيمة بعد حساب تدرُّج السياسة، مع استخدام دالة القيمة القديمة عند تقدير الأفضلية. لو حدّثت VV أولاً وأفرطت في ملاءمتها، لاقتربت بواقي الفرق الزمني δt\delta_t جميعها من الصفر، ولتلاشى تدرُّج السياسة.

تدرُّج السياسة الكامل مع GAE

تدرُّج السياسة يُرشدنا إلى الاتجاه الذي ينبغي تعديل معاملات السياسة فيه لرفع المكافأة المتوقعة. حين ندمج تقدير الأفضلية المعمَّم كمُقدِّر لـلأفضلية، يأخذ التدرُّج الشكل التالي:

gE[t=0θlogπθ(atst)  A^tGAE(γ,λ)]g \approx \mathbb{E}\left[\sum_{t=0}^{\infty} \nabla_\theta \log \pi_\theta(a_t|s_t) \;\hat{A}_t^{GAE(\gamma,\lambda)}\right]
تدرُّج السياسة مع تقدير الأفضلية المعمَّم∇log π = الاتجاه الذي يجعل الفعل a_t أكثر احتمالاً · Â^GAE = كم كان الفعل أفضل من المتوسط · Â موجبة → اجعله أكثر احتمالاً، Â سالبة → اجعله أقل احتمالاً

يمكن قراءة هذه المعادلة كتوجيه بسيط لـ: لكل فعل اتخذه الوكيل، إن أشار تقدير الأفضلية إلى أنه أفضل من المتوسط فزِد احتماله، وإن كان أسوأ فقلِّله. حجم الأفضلية يُحدّد قوة التحديث. ولأنّ GAE يضبط التباين، تبقى هذه التحديثات مستقرة بما يكفي لتحقيق تقدّم متواصل حتى في المهام المعقدة.

GAE في شيفرة برمجية

حساب أفضليات GAE — حيلة المرور العكسيpython

مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.

import numpy as np

def compute_gae(rewards, values, gamma=0.99, lam=0.95):
    """حساب أفضليات GAE لمسار واحد.

    rewards: مصفوفة المكافآت r_t          (الطول T)
    values:  مصفوفة القيم V(s_t)           (الطول T+1، تشمل الحالة النهائية)
    gamma:   عامل الخصم
    lam:     لامبدا GAE (مقبض الانحياز والتباين)
    """
    T = len(rewards)
    advantages = np.zeros(T)
    gae = 0.0  # المجموع الجاري، يُبنى من النهاية

    for t in reversed(range(T)):
        delta = rewards[t] + gamma * values[t+1] - values[t]  # باقي الفرق الزمني
        gae = delta + gamma * lam * gae  # تجميع البواقي المُرجَّحة
        advantages[t] = gae

    returns = advantages + values[:T]  # أفضلية GAE + الخط المرجعي = الهدف
    return advantages, returns

# الحيلة: التكرار العكسي حتى تُعيد كل خطوة استخدام المجموع من t+1.
# هذا يجعل الحساب كاملاً O(T) — خطّي في طول المسار.

التجارب: حركة ثلاثية الأبعاد من الصفر

اختبرت الورقة تقدير الأفضلية المعمَّم على بعض أصعب مهام التحكم المستمر في ذلك الوقت، باستخدام محاكي الفيزياء MuJoCo:

  • المشّاء ثنائي القدمين — روبوت بشري يتعلّم المشي والجري. مع 33 بُعداً للحالة و10 أبعاد للفعل، يحتاج الوكيل إلى تنسيق مفاصل الورك والركبة والكاحل في آن واحد.

  • العدّاء رباعي الأرجل — روبوت بأربع أرجل يتعلّم العَدْو. عدد المفاصل ونقاط التلامس أكبر بكثير.

  • النهوض من الأرض — روبوت بشري يبدأ مُلقى أرضاً ويتعلّم الوقوف. هذه المهمة تتطلب استراتيجية متعددة المراحل يصعب على الأساليب أحادية الخطوة التعامل معها.

النتيجة الجوهرية: λ = 0 (فرق زمني بخطوة واحدة) أعطى أداءً ضعيفاً في جميع المهام بسبب الانحياز المفرط، بينما λ بين 0.9 و0.99 مع عامل خصم مناسب حقّقت أفضل منحنيات التعلم. هذا أكّد أنّ النقطة الوسطى في مقايضة الانحياز والتباين حاسمة في المسائل الصعبة.

افتح في المختبر
منحنيات تعلّم تجريبية لقيم λ مختلفة على مهمة حركة. لاحظ كيف يتوقف λ=0 عن التحسُّن مبكراً، بينما يصل λ=0.96 إلى أعلى أداء.
تستيقظ التجربة عند وصولك…

الخوارزمية الكاملة في لمحة

بعد أن استعرضنا كل المكوّنات، لنرَ كيف تتكامل. خوارزمية أمثَلة السياسة المعتمدة على GAE تُكرّر الحلقة التالية:

افتح في المختبر
تابع حلقة تدريب GAE + TRPO خطوةً بخطوة: جمع البيانات، حساب الأفضليات، تحديث السياسة، ثم ملاءمة دالة القيمة.
تستيقظ التجربة عند وصولك…

الإرث: المحرك داخل PPO وما بعده

أبرز أثر لـتقدير الأفضلية المعمَّم هو التي نشرها المؤلف الرئيسي ذاته بعد عام. استعاض PPO عن الأمثَلة المعقدة من الرتبة الثانية في TRPO بـ مقطوعة أبسط بكثير، لكنه أبقى على GAE كمُقدِّر لـلأفضلية دون تغيير. اليوم، يكاد كل تنفيذ لـ PPO — سواء في وكلاء الألعاب أو التحكم الروبوتي أو للنماذج اللغوية — يحسب الأفضليات بالمعادلة ذاتها من هذه الورقة.

ويمتد التأثير أبعد من ذلك:

  • أنابيب RLHF لـ Claude وGPT وغيرها من تستخدم PPO مع GAE لحساب الأفضليات أثناء على بيانات التفضيل البشري.

  • الروبوتات — أنظمة تعلُّم الروبوتات الواقعية تعتمد على GAE بشكل اعتيادي عند تدريب سياسات الحركة والتحكم.

  • ذكاء الألعاب — OpenAI Five (في Dota 2) ووكلاء ألعاب معقدة أخرى اعتمدت على GAE لتحقيق تدريب مستقر عبر مليارات الخطوات.

  1. 2015

    نشر TRPO

    قدّم شولمان أمثَلة المنطقة الموثوقة مع ضمانات تحسين أُحادية الاتجاه عبر تحديثات مُقيَّدة بتباعد KL. ورقة GAE ستبني لاحقاً على هذا الأساس.

  2. 2016

    نشر GAE (في ICLR)

    أثبتت ورقة GAE أنّ ترجيح بواقي الفرق الزمني بـ λ يُقلّص التباين في تقدير تدرُّج السياسة بصورة ملحوظة، ما أتاح تعلُّم حركات ثلاثية الأبعاد معقدة.

  3. 2017

    نشر PPO

    أمثَلة السياسة القريبة بسّطت TRPO بدالة هدف مقطوعة، مع الإبقاء على GAE مُقدِّراً معيارياً للأفضلية.

  4. 2019

    OpenAI Five يهزم أبطال العالم في Dota 2

    PPO+GAE على نطاق ضخم — ما يعادل 45,000 سنة من خبرة اللعب، وGAE يُوفّر تقديرات أفضلية مستقرة طوال عملية التدريب.

  5. 2022

    InstructGPT وChatGPT

    ضبط النماذج اللغوية عبر التعلم المعزّز من التغذية الراجعة البشرية يعتمد على PPO+GAE لمواءمة مخرجات النموذج مع تفضيلات البشر، ما نقل GAE إلى عصر النماذج اللغوية الكبيرة.

المرجعSchulman, Moritz, Levine, Jordan, Abbeel. High-Dimensional Continuous Control Using Generalized Advantage Estimation. ICLR, 2016.

مصطلحات هذه الورقة