REINFORCE Algorithm
خوارزمية REINFORCE
خوارزمية تعلّم معزّز أساسية تُحدِّث السياسة مباشرةً بضرب تدرّج لوغاريتم الاحتمال في العائد التراكمي، فتعزّز الأفعال التي أدّت إلى مكافآت عالية.
A foundational RL algorithm that updates the policy directly by multiplying the log-probability gradient by the cumulative return, reinforcing actions that led to high rewards.
Also translated asخوارزمية التعزيز بتدرج السياسة، خوارزمية ويليامز
First appears in this corpus in: Google's Neural Machine Translation System: Bridging the Gap Between Human and Machine Translation (2016)
Appears in these papers