شبكة الهدف
Target Network
نسخة منفصلة من شبكة Q تُجمَّد أوزانها لآلاف الخطوات ثم تُحدَّث دورياً من الشبكة الرئيسية، مما يُثبّت هدف الأمثَلَة ويمنع التشعّب الناجم عن ملاحقة هدف متحرك.
A separate copy of the Q-network whose weights are frozen for thousands of steps then periodically updated from the main network, stabilizing the optimization target and preventing divergence from chasing a moving target.
تُرجم أيضاًالشبكة المُجمَّدة، شبكة الهدف المُثبّتة
أول ظهور في هذه المجموعة: التحكم المستمر بالتعلُّم المعزِّز العميق (2015)
يظهر في هذه الأوراق
- BYOL: مقاربة جديدة للتعلُّم الذاتي الإشراف بتمهيد التمثيلات الكامنة2020في السماء ✦
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- التحكم المستمر بالتعلُّم المعزِّز العميق2015في السماء ✦
- التعلّم المعزّز العميق بأسلوب Q المزدوج2016في السماء ✦
- التحكم بمستوى بشري عبر التعلم العميق بالتعزيز2015في السماء ✦
- إتقان مجالات متنوّعة عبر نماذج العالم2023في السماء ✦
- بنية الشبكة المزدوجة للتعلُّم المعزَّز العميق2016في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦
- Rainbow: دمج التحسينات في التعلُّم المعزَّز العميق2018في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد2018في السماء ✦