Return Conditioning
الاشتراط على العائد
آلية يُحدَّد فيها العائد المرغوب كمُدخَل للنموذج ليولّد أفعالاً تتوافق مع مسارات حقّقت عوائد مشابهة في بيانات التدريب، مما يُتيح التحكّم في مستوى مهارة الوكيل.
A mechanism where a desired return is specified as input to the model, prompting it to generate actions consistent with training trajectories that achieved similar returns, enabling control over the agent's skill level.
Also translated asالتحكّم بالعائد، التوجيه بالعائد
First appears in this corpus in: Decision Transformer: Reinforcement Learning via Sequence Modeling (2021)
Appears in these papers