التعلم المعزز2020متقدم11 دقيقة قراءة

التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال

Conservative Q-Learning for Offline Reinforcement Learning

Kumar, A. · Zhou, A. · Tucker, G. · Levine, S. — NeurIPS

المشكلة

الفكرة وراء واعدة: استخلاص سياسات جيدة من بيانات مُجمَّعة سابقاً، دون الحاجة إلى تفاعل جديد مع البيئة. وهذا ضروري في مجالات كالرعاية الصحية والقيادة الذاتية والروبوتات، حيث التجريب المباشر مُكلف أو خطير. المشكلة أن خوارزميات التعلُّم المعزَّز التقليدية التي تعمل خارج تنهار تماماً في هذا السيناريو: فهي تُبالغ في تقدير قيم Q لأزواج حالة-فعل غير موجودة في البيانات، لأن السياسة المُتعلَّمة تستكشف مناطق لم تمرّ بها سياسة السلوك الأصلية. هذا الانزياح التوزيعي يدفع دالة Q إلى توهُّم قيم عالية لأفعال لم يسبق رؤيتها، فتظهر سياسات تبدو ممتازة على الورق لكنها تفشل فشلاً ذريعاً عند التطبيق.

الإسهام

التعلُّم المُحافِظ — منظِّم بسيط يُضاف إلى أي خوارزمية تعلُّم Q أو ناقد-ممثل، فيتعلّم دالة Q متحفّظة يُثبَت نظرياً أنها حدّ أدنى للقيمة الحقيقية. الآلية مباشرة: يُخفض CQL قيم Q للأفعال ، ويرفعها للأفعال الموجودة فعلاً في البيانات. المحصلة دالة Q لا تُبالغ أبداً في تقدير أداء السياسة، فيصبح تحسين السياسة من بيانات ثابتة آمناً. حقق CQL عوائد أعلى بمقدار 2 إلى 5 أضعاف مقارنة بالأساليب السابقة على معايير D4RL.

الأثر

تحوّل CQL إلى خط الأساس المرجعي في أبحاث التعلُّم المعزَّز دون اتصال، ويكاد لا تخلو ورقة لاحقة في هذا المجال من الإشارة إليه. مبدؤه المُحافِظ — قلّل تقديرك عمداً لما لا تعرفه — أثّر مباشرة في محوِّل القرار وIQL، وأرسى نموذج التشاؤم في مواجهة عدم اليقين. بفضل CQL أصبح التعلُّم المعزَّز دون اتصال قابلاً للتطبيق في الروبوتات والتحكم الواقعي حيث لا مجال للتجريب المباشر. والأهم أن فكرة التنظيم المُحافِظ تجاوزت حدود التعلُّم المعزَّز لتشمل أي سياق يُشكّل فيه الانزياح التوزيعي تهديداً للنماذج المُتعلَّمة.

تخيّل طبيبة درست آلاف الملفات الطبية لكنها لم تعالج مريضاً واحداً بنفسها. حين تصادف حالة جديدة، قد تندفع نحو وصف علاج تجريبي جريء لأن قراءاتها توحي بأنه قد يحقق نتائج مبهرة.

لكن مرشداً حكيماً ينبّهها: «أنتِ لم تشاهدي هذا العلاج على أرض الواقع. افترضي أن نتائجه ستكون أضعف قليلاً مما تقوله الأدلة، والتزمي بالعلاجات المُوثَّقة جيداً في ملفاتك.»

هذا بالضبط ما يفعله CQL مع في : يُلزمه بأن يكون متشائماً تجاه أفعال لم يجرّبها من قبل، فينجذب تلقائياً نحو الأفعال المدعومة بالبيانات — ويتفادى الثقة المفرطة التي قد تقود إلى كوارث.

التحدي: التعلُّم دون عالم للتجريب فيه

في التعلُّم المعزَّز التقليدي، يتفاعل الوكيل مع : يتخذ أفعالاً، ويراقب ، ويتحسّن تدريجياً. هذه الحلقة — نفِّذ، لاحِظ، تعلَّم، كرِّر — هي المحرّك الأساسي للتعلُّم المعزَّز. لكن في كثير من التطبيقات الواقعية تستحيل هذه الحلقة. لا يمكنك ترك سيارة ذاتية القيادة تصطدم آلاف المرات حتى تتعلّم. ولا يمكنك تجريب جرعات دوائية على مرضى حقيقيين. ولا يمكنك السماح لروبوت بتدمير معدّات مكلفة أثناء الاستكشاف.

التعلُّم المعزَّز دون اتصال يكسر هذه الحلقة تماماً. بدلاً من التفاعل مع البيئة، يحصل الوكيل على ثابتة D\mathcal{D} تضمّ انتقالات (s,a,r,s)(s, a, r, s') سبق أن جمعتها معيّنة πβ\pi_\beta. الهدف لا يتغيّر — تعلُّم أفضل سياسة ممكنة — لكن الوكيل لا يستطيع تجريب أفعال جديدة ولا زيارة حالات جديدة. عليه أن يستخرج أفضل استراتيجية من البيانات التي بين يديه، تماماً كطالب شطرنج يدرس مباريات كبار الأساتذة دون أن يلمس رقعة اللعب.

افتح في المختبر
التعلُّم المعزَّز المتصل يتفاعل مع البيئة في حلقة. التعلُّم المعزَّز دون اتصال يحصل على مجموعة بيانات ثابتة ويتعلّم دون أي تفاعل إضافي.
تستيقظ التجربة عند وصولك…

الفخ: فرط تقدير قيم Q تحت الانزياح التوزيعي

لماذا تفشل خوارزميات التقليدية حين نستخدمها دون اتصال؟ السبب حلقة مفرغة خبيثة بين و****.

دالة Q — أي Q(s,a)Q(s, a) — تُقدِّر العائد التراكمي المتوقع عند اتخاذ الفعل aa في الحالة ss ثم التصرّف بالشكل الأمثل بعد ذلك. يُحدَّث هذا التقدير عبر ، التي تتضمّن عملية max\max على الأفعال في الحالة التالية:

Q(s,a)r+γmaxaQ(s,a)Q(s,a) \leftarrow r + \gamma \max_{a'} Q(s', a')
تحديث بلمان المعياري — مصدر فرط التقديرعملية max\max تختار أعلى قيمة Q من بين جميع الأفعال الممكنة aa' في الحالة التالية. حين تكون QQ تقريبية (كما هو الحال مع الشبكات العصبية)، تميل هذه العملية إلى التقاط الأفعال التي يكون فيها خطأ التقريب موجباً، فينشأ انحياز تصاعدي منهجي.

في التعلُّم المعزَّز المتصل، فرط التقدير مشكلة مزعجة لكنها قابلة للعلاج — لأن الوكيل سيُجرّب الفعل المُبالَغ في قيمته عاجلاً أو آجلاً، ويكتشف أن مكافأته متواضعة، فيُعدّل تقديره. البيئة هنا تلعب دور المُراجِع الواقعي.

لكن في التعلُّم المعزَّز دون اتصال، لا يوجد مراجع. الوكيل لن يُجرّب الفعل أبداً، فيظلّ تقدير دالة Q المنتفخ كما هو. والأسوأ أن السياسة تنجذب تحديداً نحو هذه الأفعال لأنها تبدو الأعلى قيمةً. هنا تبدأ الحلقة المفرغة:

أولاً، تُبالغ دالة Q في تقدير الأفعال خارج التوزيع — أي الأفعال الغائبة عن البيانات. ثانياً، تختار السياسة هذه الأفعال تحديداً لأنها تحمل أعلى قيمة ظاهرية. ثالثاً، ينقل تحديث بلمان القيم المنتفخة إلى حالات أخرى. رابعاً، تنهار مصداقية دالة Q بالكامل.

في النهاية يحصل الوكيل على سياسة تختار بثقة عمياء أفعالاً لا سند لها في البيانات — كطالب يتفوّق في اختبار تجريبي لأنه حفظ الإجابات الخاطئة.

افتح في المختبر
راقب لولب فرط التقدير أثناء تشكُّله: حين لا تتدخّل البيئة للتصحيح، تنتفخ قيم Q للأفعال خارج التوزيع دون أي رادع.
تستيقظ التجربة عند وصولك…

فكرة CQL: كن متشائماً تجاه المجهول

الفكرة الجوهرية لـCQL بسيطة وأنيقة: أضف حدّ يدفع قيم Q للأسفل على الأفعال التي قد تختارها السياسة، ويرفعها على الأفعال الموجودة فعلاً في مجموعة البيانات. القوة الأولى تمنع فرط التقدير للأفعال غير المُختبَرة، والثانية تحافظ على دقة التقديرات للأفعال المدعومة بالبيانات.

تخيّل نحّاتاً يعمل بيديه في آنٍ واحد: إحداهما تضغط الصلصال نحو الأسفل في المناطق التي لا دليل عليها — فتكبت القيم المُتوهَّمة — والأخرى ترفعه حيث تُوفّر البيانات أرضية صلبة — فتحمي القيم الحقيقية. المحصلة سطح لـدالة Q مُتحفّظ عمداً: قد يُقلّل من القيمة الحقيقية، لكنه لن يُبالغ فيها بشكل خطير أبداً.

من الناحية الرسمية، يُضيف CQL حدّ تنظيم R(θ)\mathcal{R}(\theta) إلى دالة هدف خطأ بلمان المعيارية. هذا الحدّ يتكوّن من شقّين: الأول يُصغّر قيم دالة Q تحت توزيع أخذ العينات μ(as)\mu(a|s) — أي يخفض القيم على الأفعال التي تُرشّحها السياسة. والثاني يُعظّم قيم Q تحت توزيع مجموعة البيانات π^β(as)\hat{\pi}_\beta(a|s) — أي يرفع القيم على الأفعال التي نملك عنها بيانات فعلية:

minQ    α(EsD[logaexp(Q(s,a))]Es,aD[Q(s,a)])CQL regularizer+12Es,a,sD[(Q(s,a)B^πQ(s,a))2]Standard Bellman error\min_Q \;\; \alpha \underbrace{\Big( \mathbb{E}_{s \sim \mathcal{D}} \big[ \log \sum_a \exp(Q(s,a)) \big] - \mathbb{E}_{s,a \sim \mathcal{D}}[Q(s,a)] \Big)}_{\text{CQL regularizer}} + \frac{1}{2} \underbrace{\mathbb{E}_{s,a,s' \sim \mathcal{D}} \Big[ \big(Q(s,a) - \hat{\mathcal{B}}^\pi Q(s,a) \big)^2 \Big]}_{\text{Standard Bellman error}}
دالة هدف CQL (صيغة CQL(H)) — المنظِّم المُحافِظ + خطأ بلمانالحدّ الأول داخل المنظِّم هو الأقصى اللطيف (logexp\log\sum\exp) على جميع الأفعال — يدفع قيم Q للأسفل بشكل شامل. الحدّ الثاني يرفع قيم Q على أفعال مجموعة البيانات تحديداً. المعامل الفائق α\alpha يتحكّم في درجة تحفّظ دالة Q. أما B^π\hat{\mathcal{B}}^\pi فهو مؤثّر بلمان التجريبي.
افتح في المختبر
اضبط α لترى كيف يوازن منظِّم CQL بين خفض قيم Q خارج التوزيع والحفاظ على القيم داخل التوزيع. كلما زاد α كانت الدالة أكثر تحفّظاً.
تستيقظ التجربة عند وصولك…

الضمان: حدّ أدنى قابل للإثبات لقيمة السياسة

النتيجة النظرية الأهم في CQL هي أن دالة Q المُتعلَّمة Q^π\hat{Q}^\pi تُشكّل لدالة Q الحقيقية QπQ^\pi عند كل زوج حالة-فعل تزوره السياسة. عملياً، هذا يعني أنه حين يُقيّم الوكيل سياسةً ما عبر Q^\hat{Q}، فإن تقديره سيكون أقلّ من الواقع دائماً — ولن يُبالغ فيه أبداً:

V^π(s)=Eaπ(s)[Q^π(s,a)]Vπ(s)s\hat{V}^\pi(s) = \mathbb{E}_{a \sim \pi(\cdot|s)}[\hat{Q}^\pi(s,a)] \leq V^\pi(s) \quad \forall s
ضمان الحدّ الأدنى في CQL — القيمة المُقدَّرة لا تتجاوز القيمة الحقيقية أبداًV^π(s)\hat{V}^\pi(s) هي القيمة المُقدَّرة للسياسة في الحالة ss، مُحتسَبة عبر دالة Q المُحافِظة. Vπ(s)V^\pi(s) هي القيمة الحقيقية. تسري هذه المتباينة على الحالات التي تزورها السياسة، فتمنع الوكيل من الانجذاب نحو سياسات لا تبدو جيدة إلا بسبب قيم Q المنتفخة.

ما الفائدة العملية من ذلك؟ في التعلُّم المعزَّز دون اتصال لا تستطيع تقييم السياسة بتشغيلها في البيئة الحقيقية، فأنت مُجبر على الحكم عليها من خلال دالة Q وحدها. لو كانت هذه الدالة تُبالغ في التقدير، فستختار سياسة سيئة تبدو جيدة. ضمان الحدّ الأدنى في CQL يجعل دالة Q حَكَماً موثوقاً وإن كان حذراً.

الأمر أشبه بمدقّق مالي يُقدّم دائماً تقييمات متحفّظة: قد تكون قيمة الشركة أعلى مما يقوله التقرير، لكنها لن تكون أقلّ منه أبداً. يمكنك اتخاذ قرارات استثمارية مطمئنة بناءً على هذا التدقيق — ربما تُفوِّت بعض الفرص، لكنك لن تُفاجأ بخسائر كارثية.

صيغتان: CQL للأفعال المنفصلة والمستمرة

لـCQL صيغتان عمليتان تعتمدان على طبيعة : هل هو منفصل (كألعاب أتاري) أم مستمر (كالتحكم الروبوتي)؟

CQL(H) — مُصمَّمة للأفعال المستمرة. تستخدم هذه الصيغة السياسة الحالية π\pi بوصفها توزيع أخذ العينات μ\mu، فيدفع حدّ التنظيم قيم Q للأسفل تحديداً على الأفعال التي تُرجّحها السياسة المُتعلَّمة. الحرف "H" يرمز إلى مكافأة الإنتروبيا الموروثة من (SAC)، أي أن CQL(H) في جوهره هو SAC مع دالة Q متحفّظة. تُحدَّث السياسة ودالة Q بالتناوب.

CQL(ρ) — مُصمَّمة للأفعال المنفصلة، أو حين تريد حدّ تنظيم ثابتاً لا يعتمد على السياسة. هنا μ\mu توزيع مسبق ثابت (منتظم على الأفعال مثلاً)، ممّا يُبسّط التنفيذ كثيراً لأن حدّ التنظيم لا يتغيّر مع تحديث السياسة. وتُطبَّق حيلة logexp\log\sum\exp مباشرة على مجموعة الأفعال المنفصلة.

افتح في المختبر
قارن بين CQL(H) للتحكم المستمر وCQL(ρ) للأفعال المنفصلة. بدّل بين الصيغتين لترى كيف يعمل المنظِّم بشكل مختلف.
تستيقظ التجربة عند وصولك…

التطبيق: إضافة CQL إلى الخوارزميات القائمة

من أبرز نقاط قوة CQL بساطة تطبيقه. لتحويل أي خوارزمية تعلُّم Q أو إلى نسختها المُحافِظة، كل ما تحتاجه هو بضعة أسطر إضافية في حساب خسارة دالة Q. خسارة خطأ بلمان تبقى كما هي تماماً، وتُضاف عقوبة CQL فوقها.

عملياً، التنفيذ يتطلب ثلاث خطوات: أخذ عينات أفعال من السياسة الحالية (أو بشكل منتظم في الحالة المنفصلة)، ثم حساب قيم QQ على تلك الأفعال، وأخيراً إضافة عقوبة logexp\log\sum\exp مطروحاً منها متوسط QQ لأفعال مجموعة البيانات. الناتج عادةً 5 إلى 10 أسطر إضافية فوق تنفيذ SAC أو معياري.

منظِّم CQL — الإضافة الجوهرية لأي خسارة تعلُّم Qpython

مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.

# ── منظِّم CQL (يُضاف إلى خسارة خطأ بلمان المعيارية) ──
# أخذ عينات أفعال عشوائية لعقوبة logsumexp
random_actions = torch.FloatTensor(batch_size, num_random, action_dim).uniform_(-1, 1)
# قيم Q على الأفعال العشوائية (تدفع Q للأسفل بشكل واسع)
q_random = critic(states, random_actions)  # [B, num_random]
# قيم Q على أفعال مجموعة البيانات (ترفع Q على التوزيع الداخلي)
q_data = critic(states, actions)            # [B, 1]
# عقوبة CQL: logsumexp(Q) - E_data[Q]
cql_penalty = torch.logsumexp(q_random, dim=1).mean() - q_data.mean()
# الخسارة الكلية = خطأ بلمان المعياري + alpha * عقوبة CQL
total_loss = bellman_loss + alpha * cql_penalty

النتائج: CQL يتصدّر معايير التعلُّم المعزَّز دون اتصال

اختُبر CQL على مجموعة D4RL — المنصة المرجعية القياسية للتعلُّم المعزَّز دون اتصال. تتضمّن D4RL مهام حركة (HalfCheetah وHopper وWalker2d) مع مجموعات بيانات بمستويات جودة مختلفة: عشوائية، ومتوسطة، ومتوسطة مع إعادة تشغيل، وخبيرة. وتشمل أيضاً ألعاب أتاري لتقييم التحكم في فضاءات الأفعال المنفصلة.

النتائج كانت واضحة: حقق CQL عوائد مُعيَّرة أعلى بمقدار 2 إلى 5 أضعاف مقارنة بالأساليب السابقة كـBCQ وBEAR و. وكانت الفجوة أكبر ما يكون على مجموعات البيانات متوسطة الجودة والمختلطة — أي السيناريوهات التي يبلغ فيها الانزياح التوزيعي أشدّه وتتعثر فيها الأساليب الأخرى أكثر.

وفي ألعاب أتاري، تفوّق CQL على خوارزمية DQN المتصلة التي تدرّبت 200 مليون خطوة، مستخدماً 1% فقط من البيانات (مليونا انتقال). وهذا يُثبت أن التعلُّم المُحافِظ دون اتصال قادر على مضاهاة التعلُّم المتصل أو التفوّق عليه حين تكون البيانات المتاحة غنية بالمعلومات.

افتح في المختبر
CQL مقابل أساليب التعلُّم المعزَّز دون اتصال السابقة على مهام D4RL الحركية. بدّل بين أنواع مجموعات البيانات لترى أين تكون أفضلية CQL الأكبر.
تستيقظ التجربة عند وصولك…

الروابط: كيف يُبنى CQL على تعلُّم Q والناقد-الممثل اللطيف

CQL لا يستبدل تعلُّم Q ولا الناقد-الممثل اللطيف — بل يبني فوقهما. العلاقة إضافية بالمعنى الحرفي: خُذ صيغة تعلُّم Q التي تعمل بها، أبقِ خسارة خطأ بلمان دون تعديل، وأضف حدّ تنظيم CQL.

من تعلُّم Q يرث CQL الآلية الجوهرية: تحسين دالة Q تكرارياً عبر معادلة بلمان مع . عملية max\max على الأفعال التالية — وهي مصدر فرط التقدير في الوضع دون اتصال — تظلّ موجودة كما هي، لكن CQL يُقاومها بدلاً من إزالتها.

من SAC، يرث CQL(H) إطار أقصى إنتروبيا: حيث تسعى السياسة إلى تعظيم العائد المتوقع مصحوباً بمكافأة إنتروبيا تُشجّع الاستكشاف في الوضع المتصل. أما دون اتصال، فيتحوّل حدّ الإنتروبيا ليصبح جزءاً من حدّ تنظيم CQL ذاته — فحدّ logexp\log\sum\exp هو في جوهره الأقصى اللطيف من SAC، لكن أُعيد توظيفه هنا لمعاقبة الأفعال بدلاً من تشجيع تنوّعها.

هذا التصميم المُعياري (modular) هو ما جعل تبنّي CQL سريعاً: لم يحتج الباحثون لتعلُّم خوارزمية جديدة من الصفر. أضافوا حدّ عقوبة واحداً إلى الكود الذي يعملون به فعلاً.

افتح في المختبر
بنية CQL: الهيكل المعياري لـSAC/DQN مع إضافة حدّ تنظيم CQL في خطوة حساب خسارة دالة Q.
تستيقظ التجربة عند وصولك…

لماذا يهمّ هذا: من النظرية إلى الروبوتات الحقيقية

قبل CQL، كان التعلُّم المعزَّز دون اتصال أقرب إلى فكرة أكاديمية منه إلى أداة عملية. الخوارزميات كانت تعمل على معايير بسيطة، لكنها تنهار أمام مجموعات بيانات واقعية بجودة متفاوتة وتغطية ناقصة للحالات وتنوّع في سياسات السلوك. غيّر CQL المشهد بتقديم حلّ مبدئي واضح — التقدير المُحافِظ — يتوسّع ليشمل مجالات معقدة.

في الروبوتات، أتاح CQL تعلُّم سياسات المناورة والحركة من بيانات غير متجانسة تمزج عروضاً بشرية بمتحكّمات مُبرمَجة واستكشاف عشوائي. وفي الرعاية الصحية، انسجم المبدأ المُحافِظ طبيعياً مع منطق الحذر الطبي: سياسة العلاج ينبغي ألّا تكون أكثر تفاؤلاً ممّا تُبرّره الأدلة السريرية.

أرسى CQL أيضاً نموذج التشاؤم في مواجهة عدم اليقين الذي بات يتخلّل أبحاث التعلُّم المعزَّز دون اتصال كلها. كل أسلوب رئيسي لاحق — IQL وTD3+BC ومحوِّل القرار — إما يبني مباشرة على أفكار CQL أو طُوِّر بديلاً لمقاربته. وبأكثر من 4000 استشهاد، تُمثّل هذه الورقة نقطة تحوّل حقيقية في المجال.

المسار الزمني: الطريق إلى CQL ومنه

  1. 2005

    أسس التعلُّم المعزَّز الدُّفعي

    صاغ إرنست ولانغه وريدميلر التعلُّم المعزَّز الدُّفعي (دون اتصال) رسمياً بوصفه تعلُّماً من مجموعة بيانات ثابتة دون تفاعل مع البيئة. وأظهرت خوارزمية Fitted Q-Iteration أن تحديثات بلمان تعمل مبدئياً دون اتصال، لكنها تعاني من عدم تطابق التوزيع.

  2. 2018

    الناقد-الممثل اللطيف (SAC)

    قدّم هارنويا وزملاؤه التعلُّم المعزَّز بأقصى إنتروبيا، حيث تُضاف مكافأة إنتروبيا إلى الهدف المعياري. سرعان ما أصبح SAC أقوى خوارزمية متصلة للتحكم المستمر، ثم شكّل لاحقاً الأساس الذي بُني عليه CQL(H).

  3. 2019

    BCQ وBEAR — التعلُّم دون اتصال بقيود

    قيّد فوجيموتو وزملاؤه (BCQ) وكومار وزملاؤه (BEAR) السياسة المُتعلَّمة لتبقى قريبة من سياسة السلوك الأصلية، ممّا يمنع اختيار أفعال خارج التوزيع. النتائج كانت مقبولة لكن القيود كانت مفرطة — لم تتمكّن السياسة من التحسّن كثيراً بالمقارنة مع السياسة التي جمعت البيانات.

  4. 2020

    CQL (هذه الورقة)

    غيّر المقاربة جذرياً: بدلاً من تقييد السياسة، انتقل إلى تنظيم دالة Q نفسها. CQL لا يمنع الأفعال خارج التوزيع صراحةً، بل يُخفض قيم Q لها فتتجنّبها السياسة تلقائياً. حقق عوائد أفضل بـ2 إلى 5 أضعاف مقارنة بـBCQ وBEAR.

  5. 2021

    محوِّل القرار وIQL

    أعاد تشِن وزملاؤه صياغة التعلُّم المعزَّز دون اتصال بوصفه مسألة نمذجة تسلسلات. واقترح كوستريكوف وزملاؤه تعلُّم Q الضمني (IQL) الذي يتفادى تماماً الاستعلام عن أفعال خارج التوزيع. كلا العملين انطلق من رؤية CQL بأن الانزياح التوزيعي هو العقبة المحورية.

  6. 2023

    التعلُّم المعزَّز دون اتصال على نطاق واسع

    طبّقت فرق في غوغل وبيركلي أساليب مبنية على CQL في روبوتات حقيقية، لتعلّم مهام المناورة من آلاف مسارات العرض التوضيحي. وتبيّن أن المبدأ المُحافِظ شرط أساسي للنشر الآمن في بيئات حقيقية.

المرجعKumar, Zhou, Tucker, Levine. Conservative Q-Learning for Offline Reinforcement Learning. NeurIPS, 2020.

مصطلحات هذه الورقة