دالة تقييم العوائد
Value Function
دالة رياضية تحسب إجمالي العوائد والمكافآت المتوقعة مستقبلاً عند الانطلاق من وضعية أو حالة معينة.
Value Function
تُرجم أيضاًدالة حساب القيمة المتوقعة للحالة، معيار الجدوى الاستراتيجية للموقع
أول ظهور في هذه المجموعة: طريقة مونتي كارلو (1949)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- مستوى الأستاذ الأكبر في StarCraft II باستخدام التعلّم المعزّز متعدّد الوكلاء2019في السماء ✦
- اكتشاف خوارزميات أسرع لضرب المصفوفات بالتعلّم المعزَّز2022في السماء ✦
- خوارزمية تعلّم مُعزَّز عامة تتقن الشطرنج والشوغي والغو عبر اللعب الذاتي2018في السماء ✦
- محوِّل القرار: التعلّم المعزَّز عبر نمذجة التسلسلات2021في السماء ✦
- DeepSeek-R1: تحفيز قدرات الاستدلال في النماذج اللغوية الكبيرة عبر التعلم المعزز2025في السماء ✦
- التقرير التقني لـ DeepSeek-V32024في السماء ✦
- التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة2023في السماء ✦
- إتقان مجالات متنوّعة عبر نماذج العالم2023في السماء ✦
- البرمجة الديناميكية1957في السماء ✦
- التحكم المستمر في الأبعاد العالية باستخدام تقدير الأفضلية المعمَّم2016في السماء ✦
- إعادة تشغيل الخبرة بأثر رجعي2017في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- تعلُّم التلاعب البارع داخل اليد الآلية2019في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- طريقة مونتي كارلو1949في السماء ✦
- MuZero: إتقان ألعاب Atari وGo والشطرنج وShogi بالتخطيط عبر نموذج مُتعلَّم2020في السماء ✦
- بين عمليات ماركوف القرارية وشبه الماركوفية — إطار التجريد الزمني في التعلّم المعزَّز1999في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- خوارزمية تحسين السياسة القريبة (PPO)2017في السماء ✦
- إعادة التجربة بالأولوية2015في السماء ✦
- خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية1992في السماء ✦
- نفِّذ ما أستطيع، لا ما أقول: ربط اللغة بقدرات الروبوت الفعلية2022في السماء ✦
- التعلُّم بالفرق الزمني و TD-Gammon1995في السماء ✦
- TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد2018في السماء ✦