التعلم المعزز2015متقدم12 دقيقة قراءة

أمثَلة السياسة بمنطقة الثقة

Trust Region Policy Optimization

Schulman, J. · Levine, S. · Moritz, P. · Jordan, M. I. · Abbeel, P. — ICML

المشكلة

الطريقة المعتادة في أساليب مُتّجه ميل السياسة هي تحديث السياسة بخطوة في اتجاه مُتّجه ميل المتوقعة. المشكلة تكمن في حجم هذه الخطوة: إن كانت صغيرة جداً زحف التعلّم ببطء مُحبِط، وإن كانت كبيرة انهارت السياسة فجأة. الأخطر من ذلك أن السياسة حين تنهار تبدأ بجمع بيانات سيئة، فتُنتَج منها مُتّجهات ميل مضلّلة تزيد الطين بلّة وتدفع السياسة إلى مزيد من الانهيار — حلقة مفرغة لا خروج منها. بحلول عام 2015 كانت هذه الهشاشة هي العقبة الكبرى أمام تطبيق أساليب مُتّجه الميل على مهام التحكم المستمر المعقدة.

الإسهام

يُقدِّم TRPO إجراءً تكرارياً ذا أساس نظري متين يضمن أن كل خطوة تحديث تُحسِّن السياسة ولا تُسيئها. الفكرة أن الخوارزمية في كل تكرار تُعظِّم دالة هدف بديلة تعتمد على الأفضلية المتوقعة للسياسة الجديدة مُرجَّحة بنسب أخذ العينات بالأهمية، لكنها تفرض قيداً على تباعد كولباك-لايبلر يمنع السياسة الجديدة من الابتعاد كثيراً عن القديمة. يُطبَّق هذا القيد عملياً بأسلوب التدرج المترافق مع جداءات متجه فيشر وبحث خطي ارتجاعي. المحصّلة خوارزمية عملية تُدرِّب سياسات الشبكات العصبية على مهام التحكم المستمر وألعاب Atari بتقدّم مستقر ورتيب دون الحاجة لضبط دقيق للمعاملات الفوقية.

الأثر

أرسى TRPO نموذج الذي يُهيمن اليوم على أمثَلة السياسات. أثمر مباشرةً عن PPO الذي بسّط القيد إلى دالة هدف مقصوصة وأصبح العمود الفقري للتعلّم المعزَّز من التغذية الراجعة البشرية ولنماذج مثل ChatGPT وClaude، وكذلك عن تقدير الأفضلية المعمَّم (GAE) لتقليل ، وعن السياسات البصرية الحركية لتعلّم الروبوتات من البكسلات. كل خوارزمية تعلّم معزَّز حديثة تعمل وفق السياسة تعود بضمانات استقرارها إلى الأساس النظري الذي وضعه TRPO.

تخيّل أنك تسير على حافة جبلية ضيقة وسط ضباب كثيف. أسلوب التقليدي يشبه المشي بخطوات واسعة في هذا الضباب — خطوة خاطئة واحدة تكفي لتسقط من الحافة، ولا عودة بعدها.

ما يفعله TRPO هو أنه يربطك بحبل أمان مُثبَّت في موقعك الحالي. تستطيع أن تستكشف بحرية ضمن نطاق الحبل — وهذا هو ما نسمّيه منطقة الثقة — مطمئناً أنك إن زلّت فالحبل يمسكك. وكلما وجدت موطئ قدم أفضل تُعيد تثبيت الحبل هناك وتستأنف الاستكشاف.

الضباب لا ينقشع أبداً، لكن مع كل خطوة آمنة أنت تضمن أنك لم تنزل أدنى مما كنت. هذا الضمان هو ما يصنع الفرق بين تقدّم مطّرد وانهيار كامل.

المشكلة: خطوة سيئة واحدة والسياسة لا تتعافى أبداً

في أساليب مُتّجه ميل السياسة نُمثِّل السياسة πθ\pi_\theta بمجموعة معاملات θ\theta ونُحدِّثها لتعظيم المكافأة التراكمية المتوقعة. قاعدة التحديث تبدو بسيطة للغاية: θθ+αθJ(θ)\theta \leftarrow \theta + \alpha \nabla_\theta J(\theta). لكن خلف هذه البساطة يختبئ خلل جوهري.

خطوة أكبر قليلاً مما ينبغي قد تدفع السياسة نحو منطقة تتخذ فيها قرارات كارثية. القرارات الكارثية تُنتج مسارات رديئة، والمسارات الرديئة تُعطي مُتّجهات ميل مُضلِّلة، وهذه بدورها تدفع السياسة أبعد في الاتجاه الخاطئ. هذه الحلقة المفرغة — دوّامة انهيار الأداء — هي الفشل النموذجي لأساليب مُتّجه الميل التقليدية.

جذر المشكلة أن فضاء المعاملات لا يعكس فضاء السلوك. تغيير طفيف في θ\theta قد يمرّ دون أثر يُذكر على السياسة، أو قد يقلب قراراتها رأساً على عقب. المعياري لا يملك أي طريقة للتمييز بين الحالتين — كل ما يراه هو المسافة بين المعاملات، لا المسافة بين السلوكيات.

افتح في المختبر
حرِّك شريط حجم الخطوة. الخطوات الصغيرة تُحرز تقدّماً بطيئاً، لكن خطوة واحدة كبيرة تُشعل دوّامة انهيار لا يتعافى منها مُتّجه الميل التقليدي. أما TRPO فيظلّ في مأمن.
تستيقظ التجربة عند وصولك…

الأساس النظري: تحسُّن مضمون

نقطة الانطلاق في TRPO هي مبرهنة فرق الأداء (كاكيد ولانغفورد، 2002). تقول المبرهنة شيئاً أنيقاً: الفرق في المكافأة الإجمالية بين أي سياستين π\pi' وπ\pi يُمكن التعبير عنه بدقة على أنه المتوقعة للسياسة π\pi' على π\pi، محسوبة وفق توزيع الحالات الذي تُنتجه π\pi' نفسها:

المبرهنة دقيقة رياضياً لكنها دائرية من الناحية العملية — لأن حساب dπd^{\pi'} يتطلب تشغيل السياسة الجديدة π\pi'، وهي بالضبط ما نحاول بناءه. شولمان وزملاؤه يكسرون هذه الدائرية ببناء Lπ(π)L_\pi(\pi') تستعيض عن توزيع حالات السياسة الجديدة بتوزيع حالات السياسة القديمة. ثم يُثبتون حداً أدنى يقول: التحسّن الحقيقي J(π)J(π)J(\pi') - J(\pi) لا يقلّ عن Lπ(π)CDKLmax(π,π)L_\pi(\pi') - C \cdot D_{KL}^{max}(\pi, \pi')، حيث CC ثابت عقوبة وDKLmaxD_{KL}^{max} أكبر قيمة لتباعد كولباك-لايبلر عبر جميع الحالات.

المعنى العملي واضح: إذا ارتفعت الدالة البديلة وبقيت السياستان قريبتين بمقياس KL، فالأداء الفعلي مضمون الارتفاع. بهذا تتحوّل مسألة الصعبة إلى مسألة أمثَلة مقيّدة يمكن التعامل معها.

J(π)J(π)=Eτπ ⁣[t=0γtAπ(st,at)]J(\pi') - J(\pi) = \mathbb{E}_{\tau \sim \pi'}\!\left[\sum_{t=0}^{\infty} \gamma^t\, A_\pi(s_t, a_t)\right]
مبرهنة فرق الأداءالتحسّن الدقيق لـ π' على π يساوي الأفضلية المخصومة المتوقعة للأفعال التي تتّخذها π'، مُقيَّمة بدالة قيمة π. كل حالة مستقبلية مؤثّرة في النتيجة.

الدالة الهدف البديلة: أمثَلة ما يمكننا حسابه

بما أننا لا نستطيع سحب عيّنات من توزيع حالات السياسة الجديدة — فهي لم تعمل بعد — يستعيض TRPO عنه بتوزيع حالات السياسة القديمة. تعتمد الدالة البديلة على لإعادة ترجيح الأفعال:

الفكرة ببساطة: «لو أعدتُ تشغيل المسارات التي جمعتها سابقاً وتظاهرت أن السياسة الجديدة هي من اختارت تلك الأفعال، كم ستكون الأفضلية أفضل؟» نسبة الاحتمالات πθ(as)πθold(as)\frac{\pi_\theta(a|s)}{\pi_{\theta_{old}}(a|s)} تُعوِّض عن الفرق في احتمالات اختيار الأفعال بين السياستين.

Lθold(θ)=Esdπold,  aπold ⁣[πθ(as)πθold(as)Aθold(s,a)]L_{\theta_{old}}(\theta) = \mathbb{E}_{s \sim d^{\pi_{old}},\; a \sim \pi_{old}} \!\left[\frac{\pi_\theta(a|s)}{\pi_{\theta_{old}}(a|s)}\, A_{\theta_{old}}(s,a)\right]
دالة الهدف البديلةالنسبة π_θ / π_old تُعيد ترجيح كل فعل مأخوذ كعيّنة. حين تجعل السياسة الجديدة فعلاً جيداً أرجح (النسبة > 1) ترتفع قيمة الدالة البديلة. الحالات مسحوبة من السياسة القديمة فلا حاجة لتشغيلات جديدة.

لكن الدالة البديلة وحدها خطيرة. بدون قيد سيدفع المُحسِّن نسب الاحتمالات إلى قيم متطرفة، فتبتعد السياسة الجديدة ابتعاداً كبيراً عن القديمة. عندها يفقد تصحيح أخذ العينات بالأهمية موثوقيته، وتتوقف الدالة البديلة عن عكس الأداء الحقيقي. في جوهر الأمر، هذه هي مشكلة الانهيار نفسها لكن بصياغة رياضية مختلفة.

حلّ TRPO: فرض قيد على تباعد كولباك-لايبلر بين السياستين بحيث يبقى ضمن منطقة ثقة صغيرة.

maxθ  Lθold(θ)s.t.DˉKL(θold,θ)δ\max_\theta \; L_{\theta_{old}}(\theta) \quad \text{s.t.} \quad \bar{D}_{KL}(\theta_{old}, \theta) \le \delta
مسألة أمثَلة TRPOعظِّم الدالة البديلة بشرط ألّا يتجاوز تباعد كولباك-لايبلر ميزانية δ (عادةً 0.01). الخط فوق D_KL يعني «المتوسط عبر الحالات». بهذا نستبدل حجم الخطوة α الصعب الضبط بقيد له معنى مباشر يحدّ من مقدار تغيّر السياسة.
افتح في المختبر
الشكل البيضاوي يمثّل منطقة الثقة (KL ≤ δ). حرِّك δ لترى كيف أن توسيع المنطقة يسمح للمُحسِّن بالوصول إلى قيمة أفضل للدالة البديلة — لكنه يُخاطر بتجاوز الحدّ الآمن.
تستيقظ التجربة عند وصولك…

حلّ المسألة المقيَّدة: المُتّجه الطبيعي يلتقي بالتدرج المترافق

مسألة TRPO هي مسألة أمثَلة مقيَّدة على آلاف أو ملايين المعاملات. السؤال العملي: كيف نحلّها؟

الخطوة 1: تقريب قيد KL. بالقرب من المعاملات الحالية، يمكن تقريب تباعد كولباك-لايبلر بصيغة تربيعية تعتمد على مصفوفة FF: DˉKL(θold,θ)12(θθold)TF(θθold)\bar{D}_{KL}(\theta_{old}, \theta) \approx \frac{1}{2} (\theta - \theta_{old})^T F (\theta - \theta_{old}). بهذا التقريب تتحوّل منطقة الثقة من قيد مجرّد على التوزيعات الاحتمالية إلى شكل إهليلجي ملموس في فضاء المعاملات — تخيّلها كمنطقة بيضاوية على خريطة تُحدّد النطاق الآمن للحركة.

الخطوة 2: إيجاد اتجاه التحديث. حين نُقرِّب الدالة الهدف خطياً تربيعياً، يتبيّن أن اتجاه التحديث الأمثل هو F1gF^{-1} g حيث gg هو مُتّجه ميل السياسة — وهذا بالضبط ما يُعرف بـ. ما يُميّز هذا المُتّجه أنه يأخذ في الحسبان هندسة التوزيع الاحتمالي للسياسة: يخطو بحذر في الاتجاهات التي تكون فيها السياسة حسّاسة، ويخطو بجرأة أكبر حيث تكون متينة. الأمر أشبه بسائق يُبطئ عند المنعطفات الحادة ويُسرع على الطريق المستقيم.

الخطوة 3: . حساب F1gF^{-1} g مباشرةً يتطلب عكس مصفوفة بملايين العناصر — أمر غير عملي. بدلاً من ذلك يستخدم TRPO خوارزمية التدرج المترافق لحلّ الجملة الخطية Fx=gF x = g بشكل تكراري، ولا يحتاج في ذلك إلا لجداءات متجه-مصفوفة FvF v التي تُحسب بكفاءة عبر التفاضل التلقائي.

الخطوة 4: . التقريب التربيعي لـ KL لا يصدق إلا محلياً، لذا يُجري TRPO بحثاً خطياً للتأكد: يُجرّب خطوة المُتّجه الطبيعي الكاملة أولاً، ويتحقق من أن قيد KL مُحقَّق فعلاً وأن الدالة البديلة تحسّنت. إن لم يتحقق ذلك يُقلِّص الخطوة بعامل (عادةً 0.8) ويُعيد المحاولة.

θnew=θold+2δgTF1g  F1g\theta_{new} = \theta_{old} + \sqrt{\frac{2\delta}{g^T F^{-1} g}}\; F^{-1} g
تحديث TRPO — خطوة مُتّجه طبيعي مُقيَّسةg = مُتّجه ميل السياسة · F⁻¹g = اتجاه المُتّجه الطبيعي · العامل √(2δ / gᵀF⁻¹g) يُقيّس الخطوة لتملأ منطقة الثقة بالضبط. عملياً يُحسَب F⁻¹g بالتدرج المترافق وتُصقَل الخطوة بالبحث الخطي.
افتح في المختبر
المُتّجه التقليدي (الأزرق) يتجاهل هندسة السياسة فيتجاوز الهدف. المُتّجه الطبيعي (الأخضر) يسير مع خطوط تساوي KL ويخطو بأمان داخل منطقة الثقة.
تستيقظ التجربة عند وصولك…

خوارزمية TRPO خطوة بخطوة

دورة تحديث TRPO الكاملة تجمع كل ما سبق في إطار واحد. في كل تكرار تجمع الخوارزمية مسارات من البيئة، وتُقدِّر الأفضليات، وتحلّ مسألة أمثَلة مقيَّدة، وتُحدِّث السياسة — مع ضمان أن الأداء لن يتراجع أبداً.

افتح في المختبر
انقر للتنقّل بين مراحل تكرار TRPO لترى الخوارزمية وهي تعمل.
تستيقظ التجربة عند وصولك…
تحديث TRPO: الحلقة الجوهريةpython

مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.

import numpy as np

def conjugate_gradient(Fvp, g, n_iters=10):
    """حل Fx = g دون بناء F، باستخدام جداءات المتجه مع فيشر فقط."""
    x = np.zeros_like(g)
    r = g.copy()           # البواقي
    p = g.copy()           # اتجاه البحث
    for _ in range(n_iters):
        Fp = Fvp(p)        # جداء متجه-فيشر عبر التفاضل التلقائي
        alpha = (r @ r) / (p @ Fp + 1e-8)
        x += alpha * p
        r_new = r - alpha * Fp
        beta = (r_new @ r_new) / (r @ r + 1e-8)
        p = r_new + beta * p
        r = r_new
    return x               # ≈ F⁻¹g (المُتّجه الطبيعي)

def trpo_update(policy, trajectories, delta=0.01):
    """تكرار واحد من TRPO — دالة بديلة + قيد KL."""
    # 1. تقدير الأفضليات من المسارات المُجمَّعة
    advantages = estimate_advantages(trajectories)

    # 2. حساب مُتّجه ميل السياسة g = ∇ L(θ)
    g = compute_policy_gradient(policy, trajectories, advantages)

    # 3. اتجاه المُتّجه الطبيعي عبر التدرج المترافق
    Fvp = lambda v: fisher_vector_product(policy, trajectories, v)
    nat_grad = conjugate_gradient(Fvp, g)

    # 4. تقييس الخطوة لملء منطقة الثقة: √(2δ / gᵀ F⁻¹g)
    step_size = np.sqrt(2 * delta / (g @ nat_grad + 1e-8))
    full_step = step_size * nat_grad

    # 5. بحث خطي ارتجاعي
    for j in range(10):
        trial = policy.params + (0.8 ** j) * full_step
        if kl_divergence(policy.params, trial) <= delta \
           and surrogate(trial) >= surrogate(policy.params):
            policy.params = trial
            break  # وجدنا خطوة آمنة ومُحسِّنة

لماذا نقيس المسافة بتباعد كولباك-لايبلر لا بالمسافة الإقليدية؟

الانحدار التدريجي المعياري يُقيِّد الخطوة في فضاء المعاملات: θnewθold2ϵ\|\theta_{new} - \theta_{old}\|_2 \le \epsilon. لكن المسافة بين المعاملات مقياس سيّئ للمسافة بين السلوكيات. خذ مثلاً سياسة softmax على فعلين بقيم [0,0][0, 0]: تغييرها إلى [0.01,0.01][0.01, 0.01] لا يُحدث أثراً يُذكر، بينما تغييرها إلى [0,100][0, 100] يجعلها حتمية تماماً — ومع ذلك قد يكون كلا التغييرين على المسافة الإقليدية ذاتها من [0,0][0, 0].

تباعد كولباك-لايبلر يقيس التغيّر في توزيع الأفعال — وهذا هو ما يهمّنا فعلاً. خطوة بمقدار δ\delta في فضاء KL تضمن أن احتمال كل فعل لا يتغيّر إلا بمقدار محدود. مصفوفة معلومات فيشر، التي ترسم هندسة KL محلياً، تقوم بالتقييس تلقائياً: تجعل الخطوة حذرة في الاتجاهات ذات الحساسية العالية ومُتساهلة في الاتجاهات ذات الحساسية المنخفضة. تخيّل خريطة تُبيّن لك أين الطريق ضيّق فتُبطئ، وأين هو واسع فتُسرع.

افتح في المختبر
المسافة الإقليدية نفسها في فضاء المعاملات، لكن التغيّر في السياسة مختلف تماماً. تباعد كولباك-لايبلر يلتقط الفجوة السلوكية الحقيقية.
تستيقظ التجربة عند وصولك…

أخذ العيّنات: المسار الواحد مقابل التشعّب

يعرض TRPO أسلوبين لأخذ العيّنات بغرض تقدير الدالة البديلة:

المسار الواحد — وهو الأسلوب الأبسط. شغِّل السياسة الحالية لجمع مسارات كاملة، ثم استخدم أزواج الحالة-الفعل جميعها لتقدير الدالة الهدف والقيد. هذا ما تعتمده أغلب التطبيقات العملية، وهو الأنسب للبيئات التي تكون فيها إعادة الضبط مُكلفة.

التشعّب — أسلوب أكفأ في استخدام العيّنات، يصلح للبيئات سهلة الإعادة. من كل حالة مسحوبة كعيّنة تتفرّع عدة تشغيلات بأفعال مختلفة. الفائدة أنك تقارن أفعالاً انطلقت من الحالة ذاتها، فيقلّ التباين في التقديرات لأنك تعزل أثر الأفعال عن أثر اختلاف الحالات.

التجارب: من الروبوتات المحاكاة إلى ألعاب Atari

اختبر شولمان وزملاؤه TRPO في مجالين يُمثِّلان تحديات حقيقية:

التحكم المستمر (MuJoCo). روبوتات محاكاة تتعلّم السباحة والقفز والمشي. تفوّق TRPO باستمرار على أساليب مُتّجه الميل التقليدية وعلى أسلوب الإنتروبيا المتقاطعة، وتعلّم أنماط مشي مستقرة مع تحسّن رتيب في المكافأة. النتيجة الأبرز أن الأداء لم ينهار قط أثناء ، حتى مع أدنى حدّ من ضبط المعاملات الفوقية.

ألعاب Atari. تعلّم TRPO أيضاً لعب ألعاب Atari مباشرةً من بكسلات الشاشة، مستخدماً بوصفها السياسة. صحيح أنه لم يُضاهِ أعلى درجات DQN في جميع الألعاب، لكنه أثبت أن خوارزمية واحدة تعمل وفق السياسة تستطيع التعامل مع مستمرة ومتقطّعة معاً — وهذه ميزة عمومية لا يُستهان بها.

الإرث: من TRPO إلى PPO وما بعده

الأناقة النظرية لـ TRPO لها ثمن حسابي: حلّ التدرج المترافق والبحث الخطي يجعلان كل تحديث أغلى بكثير من خطوة مُتّجه ميل عادية. هذا ما دفع شولمان لتطوير عمل لاحق هو أمثَلة السياسة القريبة (PPO)، الذي يستعيض عن قيد منطقة الثقة الصارم بـدالة هدف بديلة مقصوصة يمكن أمثَلتها بأساليب من الدرجة الأولى فقط.

صار PPO الخوارزمية السائدة عملياً في التعلّم المعزَّز — يُشغِّل التعلّم المعزَّز من التغذية الراجعة البشرية لنماذج مثل ChatGPT وClaude وغيرها — لكن نجاحه قائم بالكامل على الإطار المفاهيمي الذي أسّسه TRPO. كذلك ألهم TRPO مباشرةً تقدير الأفضلية المعمَّم (GAE)، الذي يوفّر تقديرات أفضلية منخفضة التباين أصبحت اليوم معياراً في كل أساليب مُتّجه ميل السياسة.

  1. 2002

    كاكيد ولانغفورد

    أثبتا مبرهنة فرق الأداء وقدّما أسلوب تكرار السياسة المحافظ، وبيّنا أن السياسات يمكن تحسينها مع ضمان ألّا تتجاوز خسارة الأداء حدّاً معلوماً.

  2. 2015

    TRPO (شولمان وزملاؤه)

    أمثَلة السياسة بمنطقة الثقة يحوّل الحدّ النظري إلى خوارزمية عملية للشبكات العصبية باستخدام الدوال البديلة وقيود KL والتدرج المترافق والبحث الخطي.

  3. 2016

    GAE (شولمان وزملاؤه)

    تقدير الأفضلية المعمَّم يُوفِّر موازنة سلسة بين الانحياز والتباين في تقدير الأفضلية، ويُحسِّن كفاءة TRPO في استخدام العيّنات تحسيناً ملحوظاً.

  4. 2017

    PPO (شولمان وزملاؤه)

    أمثَلة السياسة القريبة يُبسِّط منطقة ثقة TRPO إلى دالة هدف مقصوصة، فيُتيح الأمثَلة من الدرجة الأولى مع الحفاظ على ضمان الاستقرار الجوهري.

  5. 2022

    التعلّم المعزَّز من التغذية الراجعة البشرية يُشغِّل ChatGPT

    PPO — الوريث المباشر لـ TRPO — يصبح محرّك الأمثَلة وراء النماذج اللغوية المضبوطة بالتعليمات، ليُوائم الذكاء الاصطناعي مع تفضيلات البشر على نطاق واسع.

ما تركه TRPO ليس مجرد خوارزمية — بل فكرة أن أمثَلة السياسة ينبغي أن تكون آمنة بطبيعة تصميمها. في كل مرة يُضبط فيها نموذج لغوي بالتعلّم المعزَّز من التغذية الراجعة البشرية، فإن الآلية الكامنة تفرض مناطق ثقة بشكل أو بآخر لتضمن أن النموذج يتحسّن دون أن يفقد ما تعلّمه.

المرجعSchulman, Levine, Moritz, Jordan, Abbeel. Trust Region Policy Optimization. ICML, 2015.

مصطلحات هذه الورقة