مسار تتابع الحالات والأفعال
Trajectory
السجل الزمني المتتابع الحاوي على تفاصيل الحالات والأفعال والمكافآت التي مر بها العميل خلال جولته.
Trajectory
تُرجم أيضاًخط سير العميل داخل البيئة، التسلسل الزمني للتجربة التدريبية
أول ظهور في هذه المجموعة: طريقة مونتي كارلو (1949)
يظهر في هذه الأوراق
- تعلُّم التحكّم الثنائي الدقيق بعتاد منخفض التكلفة2023في السماء ✦
- محوِّل القرار: التعلّم المعزَّز عبر نمذجة التسلسلات2021في السماء ✦
- التعلم المعزز العميق من التفضيلات البشرية2017في السماء ✦
- DeepSeek-R1: تحفيز قدرات الاستدلال في النماذج اللغوية الكبيرة عبر التعلم المعزز2025في السماء ✦
- سياسة الانتشار: تعلُّم السياسات البصرية-الحركية بانتشار الأفعال2023في السماء ✦
- إتقان مجالات متنوّعة عبر نماذج العالم2023في السماء ✦
- التحكم المستمر في الأبعاد العالية باستخدام تقدير الأفضلية المعمَّم2016في السماء ✦
- عُد أولاً، ثم استكشِف2021في السماء ✦
- إعادة تشغيل الخبرة بأثر رجعي2017في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- طريقة مونتي كارلو1949في السماء ✦
- MuZero: إتقان ألعاب Atari وGo والشطرنج وShogi بالتخطيط عبر نموذج مُتعلَّم2020في السماء ✦
- Open X-Embodiment: مجموعات بيانات التعلّم الروبوتي ونماذج RT-X2024في السماء ✦
- بين عمليات ماركوف القرارية وشبه الماركوفية — إطار التجريد الزمني في التعلّم المعزَّز1999في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- خوارزمية تحسين السياسة القريبة (PPO)2017في السماء ✦
- Reflexion: وكلاء لغويون بالتعزيز اللفظي2023في السماء ✦
- خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية1992في السماء ✦
- التدريب الشامل لسياسات بصرية-حركية عميقة2016في السماء ✦