ذاكرة التجارب
Replay Buffer
بنية بيانات دائرية تخزّن الانتقالات الأخيرة (عادةً مليون انتقال) التي يسحب منها الوكيل دفعات مصغرة عشوائية لتدريب شبكته، مما يكسر الترابط الزمني ويُحسّن كفاءة البيانات.
A circular data structure that stores the most recent transitions (typically one million) from which the agent samples random mini-batches to train its network, breaking temporal correlation and improving data efficiency.
تُرجم أيضاًالمخزن المؤقت لإعادة التشغيل، ذاكرة الإعادة
أول ظهور في هذه المجموعة: التحكم المستمر بالتعلُّم المعزِّز العميق (2015)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- تحويل الصور دون أزواج متطابقة باستخدام شبكات تنافسية ذات اتساق دوري2017في السماء ✦
- التحكم المستمر بالتعلُّم المعزِّز العميق2015في السماء ✦
- التعلّم المعزّز العميق بأسلوب Q المزدوج2016في السماء ✦
- التحكم بمستوى بشري عبر التعلم العميق بالتعزيز2015في السماء ✦
- إتقان مجالات متنوّعة عبر نماذج العالم2023في السماء ✦
- إعادة تشغيل الخبرة بأثر رجعي2017في السماء ✦
- MuZero: إتقان ألعاب Atari وGo والشطرنج وShogi بالتخطيط عبر نموذج مُتعلَّم2020في السماء ✦
- Open X-Embodiment: مجموعات بيانات التعلّم الروبوتي ونماذج RT-X2024في السماء ✦
- إعادة التجربة بالأولوية2015في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦
- Rainbow: دمج التحسينات في التعلُّم المعزَّز العميق2018في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد2018في السماء ✦