مُعامل الخصم
Discount Factor
عدد بين 0 و1 يحدد مقدار أهمية المكافآت المستقبلية مقارنة بالمكافآت الفورية في معادلة بيلمان.
A number between 0 and 1 determining how much future rewards matter relative to immediate rewards in the Bellman Equation.
تُرجم أيضاًعامل التخفيض الزمني، عامل التخميد الحسابي للمكافآت المؤجلة، نسبة ترجيح الحاضر على المستقبل
أول ظهور في هذه المجموعة: التعلُّم بالتنبؤ عبر أساليب الفارق الزمني (1988)
يظهر في هذه الأوراق
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- التحكم المستمر بالتعلُّم المعزِّز العميق2015في السماء ✦
- محوِّل القرار: التعلّم المعزَّز عبر نمذجة التسلسلات2021في السماء ✦
- إتقان مجالات متنوّعة عبر نماذج العالم2023في السماء ✦
- بنية الشبكة المزدوجة للتعلُّم المعزَّز العميق2016في السماء ✦
- التحكم المستمر في الأبعاد العالية باستخدام تقدير الأفضلية المعمَّم2016في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- تعلُّم التلاعب البارع داخل اليد الآلية2019في السماء ✦
- MuZero: إتقان ألعاب Atari وGo والشطرنج وShogi بالتخطيط عبر نموذج مُتعلَّم2020في السماء ✦
- بين عمليات ماركوف القرارية وشبه الماركوفية — إطار التجريد الزمني في التعلّم المعزَّز1999في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- تعلُّم دالة الجودة (Q-Learning)1992في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦
- Rainbow: دمج التحسينات في التعلُّم المعزَّز العميق2018في السماء ✦
- خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية1992في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- التعلُّم بالفرق الزمني و TD-Gammon1995في السماء ✦
- التعلُّم بالتنبؤ عبر أساليب الفارق الزمني1988في السماء ✦
- TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد2018في السماء ✦