قصّ المكافآت
Reward Clipping
تحويل جميع المكافآت إلى القيم {−1, 0, +1} لتوحيد أحجام التدرجات عبر مهام مختلفة ذات مقاييس نتائج متباينة، مما يُتيح استخدام مجموعة معلمات فائقة واحدة.
Transforming all rewards to {−1, 0, +1} to standardize gradient magnitudes across different tasks with varying score scales, enabling the use of a single set of hyperparameters.
تُرجم أيضاًتحديد سقف المكافأة
أول ظهور في هذه المجموعة: التحكم بمستوى بشري عبر التعلم العميق بالتعزيز (2015)
يظهر في هذه الأوراق