الاستكشاف (تجربة أفعال جديدة)
Exploration
رغبة العميل الذكي في تجربة أفعال ومسارات جديدة غير مجربة لاستكشاف فرص وعوائد أفضل في البيئة.
Exploration
تُرجم أيضاًالبحث العشوائي عن فرص أفضل، التقصّي البيئي المفتوح
أول ظهور في هذه المجموعة: حسابات معادلة الحالة باستخدام الحواسيب السريعة (1953)
يظهر في هذه الأوراق
- الأساليب غير المتزامنة للتعلُّم المعزَّز العميق2016في السماء ✦
- إتقان لعبة غو دون أي معرفة بشرية2017في السماء ✦
- إتقان لعبة غو باستخدام الشبكات العصبية العميقة والبحث الشجري2016في السماء ✦
- اكتشاف خوارزميات أسرع لضرب المصفوفات بالتعلّم المعزَّز2022في السماء ✦
- خوارزمية تعلّم مُعزَّز عامة تتقن الشطرنج والشوغي والغو عبر اللعب الذاتي2018في السماء ✦
- الأمثَلة البايزية التطبيقية لخوارزميات التعلم الآلي2012في السماء ✦
- مشكلات ملموسة في أمان الذكاء الاصطناعي2016في السماء ✦
- الذكاء الاصطناعي الدستوري: نحو نماذج آمنة بإشراف ذاتي مبني على مبادئ2022في السماء ✦
- التحكم المستمر بالتعلُّم المعزِّز العميق2015في السماء ✦
- التعلّم المعزّز العميق بأسلوب Q المزدوج2016في السماء ✦
- التحكم بمستوى بشري عبر التعلم العميق بالتعزيز2015في السماء ✦
- إتقان مجالات متنوّعة عبر نماذج العالم2023في السماء ✦
- الاسترخاء العشوائي وتوزيعات غيبس والاستعادة البايزية للصور1984في السماء ✦
- عُد أولاً، ثم استكشِف2021في السماء ✦
- إعادة تشغيل الخبرة بأثر رجعي2017في السماء ✦
- Hyperband: نهج مبتكر لضبط المعاملات الفائقة مستوحى من مسائل قطّاع الطريق2018في السماء ✦
- الاستكشاف المدفوع بالفضول عبر التنبؤ ذاتي الإشراف2017في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- تعلُّم التلاعب البارع داخل اليد الآلية2019في السماء ✦
- حسابات معادلة الحالة باستخدام الحواسيب السريعة1953في السماء ✦
- MuZero: إتقان ألعاب Atari وGo والشطرنج وShogi بالتخطيط عبر نموذج مُتعلَّم2020في السماء ✦
- بين عمليات ماركوف القرارية وشبه الماركوفية — إطار التجريد الزمني في التعلّم المعزَّز1999في السماء ✦
- خوارزمية تحسين السياسة القريبة (PPO)2017في السماء ✦
- تعلُّم دالة الجودة (Q-Learning)1992في السماء ✦
- QT-Opt: تعلُّم تعزيزي عميق قابل للتوسيع للتحكّم الآلي بالرؤية الحاسوبية2018في السماء ✦
- Rainbow: دمج التحسينات في التعلُّم المعزَّز العميق2018في السماء ✦
- خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية1992في السماء ✦
- الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي2018في السماء ✦
- الأمثَلة بالتلدين المحاكى1983في السماء ✦
- التعلُّم بالفرق الزمني و TD-Gammon1995في السماء ✦
- TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد2018في السماء ✦
- Voyager: وكيل مُجسَّد مفتوح النهاية يعمل بالنماذج اللغوية الكبيرة2023في السماء ✦
- WebArena: بيئة ويب واقعية لبناء وكلاء مستقلّين2023في السماء ✦