التعلم المعزز
Reinforcement Learning
نموذج تعلم آلي يتعلم فيه الوكيل اتخاذ قرارات متتالية عبر التفاعل مع بيئة تُعيد له إشارات مكافأة أو عقوبة، بهدف تعظيم المكافأة التراكمية.
تُرجم أيضاًالتعلم التعزيزي، التعلم بالمكافأة، التعلم القائم على المكافأة والعقاب، التعلم التدعيمي التفاعلي، تدريب بالتعلُّم المعزز
أول ظهور في هذه المجموعة: طريقة مونتي كارلو (1949)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- أمان الذكاء الاصطناعي عبر المناظرة2018في السماء ✦
- ألباكا: نموذج قوي وقابل للتكرار يتّبع التعليمات2023في السماء ✦
- إتقان لعبة غو دون أي معرفة بشرية2017في السماء ✦
- إتقان لعبة غو باستخدام الشبكات العصبية العميقة والبحث الشجري2016في السماء ✦
- اكتشاف خوارزميات أسرع لضرب المصفوفات بالتعلّم المعزَّز2022في السماء ✦
- خوارزمية تعلّم مُعزَّز عامة تتقن الشطرنج والشوغي والغو عبر اللعب الذاتي2018في السماء ✦
- مشكلات ملموسة في أمان الذكاء الاصطناعي2016في السماء ✦
- الذكاء الاصطناعي الدستوري: نحو نماذج آمنة بإشراف ذاتي مبني على مبادئ2022في السماء ✦
- تعلُّم التمثيلات عبر الترميز التنبُّئي التبايُني2018في السماء ✦
- التعلُّم المُحافِظ لدالة Q للتعلُّم المعزَّز دون اتصال2020في السماء ✦
- التحكم المستمر بالتعلُّم المعزِّز العميق2015في السماء ✦
- محوِّل القرار: التعلّم المعزَّز عبر نمذجة التسلسلات2021في السماء ✦
- التعلُّم العميق2015في السماء ✦
- التعلم المعزز العميق من التفضيلات البشرية2017في السماء ✦
- DeepSeek-R1: تحفيز قدرات الاستدلال في النماذج اللغوية الكبيرة عبر التعلم المعزز2025في السماء ✦
- التقرير التقني لـ DeepSeek-V32024في السماء ✦
- التحكم بمستوى بشري عبر التعلم العميق بالتعزيز2015في السماء ✦
- إتقان مجالات متنوّعة عبر نماذج العالم2023في السماء ✦
- بنية الشبكة المزدوجة للتعلُّم المعزَّز العميق2016في السماء ✦
- البرمجة الديناميكية1957في السماء ✦
- ELECTRA: تدريب مُرمِّزات النصوص مسبقاً بالتمييز بدلاً من التوليد2020في السماء ✦
- التحكم المستمر في الأبعاد العالية باستخدام تقدير الأفضلية المعمَّم2016في السماء ✦
- نظام الترجمة الآلية العصبية من جوجل: ردم الفجوة بين الترجمة البشرية والآلية2016في السماء ✦
- عُد أولاً، ثم استكشِف2021في السماء ✦
- إعادة تشغيل الخبرة بأثر رجعي2017في السماء ✦
- الاستكشاف المدفوع بالفضول عبر التنبؤ ذاتي الإشراف2017في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- تدريب النماذج اللغوية على اتّباع التعليمات باستخدام التغذية الراجعة البشرية2022في السماء ✦
- في المعلومات والكفاية الإحصائية1951في السماء ✦
- تعلُّم التلاعب البارع داخل اليد الآلية2019في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- قطيع نماذج Llama 32024في السماء ✦
- طريقة مونتي كارلو1949في السماء ✦
- MuZero: إتقان ألعاب Atari وGo والشطرنج وShogi بالتخطيط عبر نموذج مُتعلَّم2020في السماء ✦
- كفاءة التدرّج الطبيعي في التعلّم1998في السماء ✦
- كيف تتعلّم النماذج اللغوية الكبيرة الاستدلال2024في السماء ✦
- بين عمليات ماركوف القرارية وشبه الماركوفية — إطار التجريد الزمني في التعلّم المعزَّز1999في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- خوارزمية تحسين السياسة القريبة (PPO)2017في السماء ✦
- إعادة التجربة بالأولوية2015في السماء ✦
- تعلُّم دالة الجودة (Q-Learning)1992في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦
- Rainbow: دمج التحسينات في التعلُّم المعزَّز العميق2018في السماء ✦
- اختبار الفريق الأحمر للنماذج اللغوية للحدّ من أضرارها: المنهجيات وأنماط التوسّع والدروس المستفادة2022في السماء ✦
- Reflexion: وكلاء لغويون بالتعزيز اللفظي2023في السماء ✦
- خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية1992في السماء ✦
- التعلُّم المتبقّي العميق للتعرّف على الصور2015في السماء ✦
- RLAIF: توسيع التعلّم المعزَّز بتغذية راجعة آلية بدلاً من البشر2023في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- دراسات في التعلُّم الآلي باستخدام لعبة الداما1959في السماء ✦
- نفِّذ ما أستطيع، لا ما أقول: ربط اللغة بقدرات الروبوت الفعلية2022في السماء ✦
- أَرِني، انتبِه وأخبرني: توليد وصف الصور بالانتباه البصري2015في السماء ✦
- الأمثَلة بالتلدين المحاكى1983في السماء ✦
- التعلُّم بالفرق الزمني و TD-Gammon1995في السماء ✦
- التعلُّم بالتنبؤ عبر أساليب الفارق الزمني1988في السماء ✦
- شجرة الأفكار: الحل المتأنّي للمسائل باستخدام النماذج اللغوية الكبيرة2023في السماء ✦
- أمثَلة السياسة بمنطقة الثقة2015في السماء ✦
- الآلات الحاسبة والذكاء1950في السماء ✦
- التدريب الشامل لسياسات بصرية-حركية عميقة2016في السماء ✦
- Voyager: وكيل مُجسَّد مفتوح النهاية يعمل بالنماذج اللغوية الكبيرة2023في السماء ✦
- WebGPT: الإجابة عن الأسئلة بمساعدة متصفّح ويب وتغذية راجعة بشرية2021في السماء ✦
- نماذج العالَم2018في السماء ✦