السياسة
Policy
في التعلم المعزز، الاستراتيجية التي تربط الحالات بالأفعال. في RLHF، النموذج اللغوي ذاته — يربط الأوامر بالإجابات.
In RL, the strategy that maps states to actions. In RLHF, the language model itself — mapping prompts to responses.
تُرجم أيضاًاستراتيجية العمل، سياسة التوليد، سياسة النموذج، منهجية الاختيار والترجيح، نموذج السياسة
أول ظهور في هذه المجموعة: طريقة مونتي كارلو (1949)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- تعلُّم التحكّم الثنائي الدقيق بعتاد منخفض التكلفة2023في السماء ✦
- إتقان لعبة غو دون أي معرفة بشرية2017في السماء ✦
- اكتشاف خوارزميات أسرع لضرب المصفوفات بالتعلّم المعزَّز2022في السماء ✦
- خوارزمية تعلّم مُعزَّز عامة تتقن الشطرنج والشوغي والغو عبر اللعب الذاتي2018في السماء ✦
- مشكلات ملموسة في أمان الذكاء الاصطناعي2016في السماء ✦
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- التحكم المستمر بالتعلُّم المعزِّز العميق2015في السماء ✦
- التعلم المعزز العميق من التفضيلات البشرية2017في السماء ✦
- التعلّم المعزّز العميق بأسلوب Q المزدوج2016في السماء ✦
- التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة2023في السماء ✦
- التحكم بمستوى بشري عبر التعلم العميق بالتعزيز2015في السماء ✦
- بنية الشبكة المزدوجة للتعلُّم المعزَّز العميق2016في السماء ✦
- البرمجة الديناميكية1957في السماء ✦
- التحكم المستمر في الأبعاد العالية باستخدام تقدير الأفضلية المعمَّم2016في السماء ✦
- عُد أولاً، ثم استكشِف2021في السماء ✦
- إعادة تشغيل الخبرة بأثر رجعي2017في السماء ✦
- الاستكشاف المدفوع بالفضول عبر التنبؤ ذاتي الإشراف2017في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- تدريب النماذج اللغوية على اتّباع التعليمات باستخدام التغذية الراجعة البشرية2022في السماء ✦
- في المعلومات والكفاية الإحصائية1951في السماء ✦
- تعلُّم التلاعب البارع داخل اليد الآلية2019في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- طريقة مونتي كارلو1949في السماء ✦
- كفاءة التدرّج الطبيعي في التعلّم1998في السماء ✦
- بين عمليات ماركوف القرارية وشبه الماركوفية — إطار التجريد الزمني في التعلّم المعزَّز1999في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- خوارزمية تحسين السياسة القريبة (PPO)2017في السماء ✦
- إعادة التجربة بالأولوية2015في السماء ✦
- تعلُّم دالة الجودة (Q-Learning)1992في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦
- Reflexion: وكلاء لغويون بالتعزيز اللفظي2023في السماء ✦
- خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية1992في السماء ✦
- RLAIF: توسيع التعلّم المعزَّز بتغذية راجعة آلية بدلاً من البشر2023في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- الأمثَلة بالتلدين المحاكى1983في السماء ✦
- التعلُّم بالفرق الزمني و TD-Gammon1995في السماء ✦
- التدريب الشامل لسياسات بصرية-حركية عميقة2016في السماء ✦
- WebGPT: الإجابة عن الأسئلة بمساعدة متصفّح ويب وتغذية راجعة بشرية2021في السماء ✦
- نماذج العالَم2018في السماء ✦