خوارزمية REINFORCE
REINFORCE Algorithm
خوارزمية تعلّم معزّز أساسية تُحدِّث السياسة مباشرةً بضرب تدرّج لوغاريتم الاحتمال في العائد التراكمي، فتعزّز الأفعال التي أدّت إلى مكافآت عالية.
A foundational RL algorithm that updates the policy directly by multiplying the log-probability gradient by the cumulative return, reinforcing actions that led to high rewards.
تُرجم أيضاًخوارزمية التعزيز بتدرج السياسة، خوارزمية ويليامز
أول ظهور في هذه المجموعة: نظام الترجمة الآلية العصبية من جوجل: ردم الفجوة بين الترجمة البشرية والآلية (2016)
يظهر في هذه الأوراق