المعجم

التعلُّم المعزز من التغذية الراجعة البشرية

RLHF

تقنية تدريب يُجمع فيها آلاف التفضيلات البشرية بين أزواج الاستجابات لتدريب نموذج مكافأة، ثمّ يُستخدم هذا النموذج لتحسين سياسة الذكاء الاصطناعي عبر التعلُّم المعزز.

A training technique where thousands of human preferences between response pairs train a reward model, which then optimizes the AI policy via reinforcement learning.

تُرجم أيضاًRLHF، التعزيز بالتقييم البشري، التعلم المعزز بالتغذية الراجعة البشرية، التعلم المعزز بالتقييم البشري، التعلم المعزز بتقييم بشري

أول ظهور في هذه المجموعة: تعلُّم التلخيص من التغذية الراجعة البشرية (2020)

يظهر في هذه الأوراق