Glossary

Reward Clipping

قصّ المكافآت

تحويل جميع المكافآت إلى القيم {−1, 0, +1} لتوحيد أحجام التدرجات عبر مهام مختلفة ذات مقاييس نتائج متباينة، مما يُتيح استخدام مجموعة معلمات فائقة واحدة.

Transforming all rewards to {−1, 0, +1} to standardize gradient magnitudes across different tasks with varying score scales, enabling the use of a single set of hyperparameters.

Also translated asتحديد سقف المكافأة

First appears in this corpus in: Human-Level Control Through Deep Reinforcement Learning (2015)

Appears in these papers