إعادة تشغيل التجارب
Experience Replay
تقنية تخزّن تجارب الوكيل السابقة (حالة، فعل، مكافأة، حالة تالية) في ذاكرة مؤقتة، ثم تسحب دفعات عشوائية منها للتدريب. تكسر الارتباط الزمني بين العيّنات وتعيد استخدام كل تجربة عدة مرات.
A technique that stores past agent experiences (state, action, reward, next state) in a buffer, then samples random batches for training. Breaks temporal correlation and reuses each experience multiple times.
تُرجم أيضاًذاكرة إعادة التشغيل، مخزن التجارب المؤقت
أول ظهور في هذه المجموعة: تعلُّم دالة الجودة (Q-Learning) (1992)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- تحويل الصور دون أزواج متطابقة باستخدام شبكات تنافسية ذات اتساق دوري2017في السماء ✦
- التحكم المستمر بالتعلُّم المعزِّز العميق2015في السماء ✦
- محوِّل القرار: التعلّم المعزَّز عبر نمذجة التسلسلات2021في السماء ✦
- التعلّم المعزّز العميق بأسلوب Q المزدوج2016في السماء ✦
- التحكم بمستوى بشري عبر التعلم العميق بالتعزيز2015في السماء ✦
- بنية الشبكة المزدوجة للتعلُّم المعزَّز العميق2016في السماء ✦
- عُد أولاً، ثم استكشِف2021في السماء ✦
- إعادة تشغيل الخبرة بأثر رجعي2017في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- MuZero: إتقان ألعاب Atari وGo والشطرنج وShogi بالتخطيط عبر نموذج مُتعلَّم2020في السماء ✦
- إعادة التجربة بالأولوية2015في السماء ✦
- تعلُّم دالة الجودة (Q-Learning)1992في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦
- Rainbow: دمج التحسينات في التعلُّم المعزَّز العميق2018في السماء ✦
- TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد2018في السماء ✦