خوارزمية REINFORCE
REINFORCE
أول خوارزمية عملية تُمكّن الشبكات العصبية من التعلّم عبر المكافآت فقط دون إجابات صحيحة. الفكرة: جرّب أفعالًا عشوائية، وإن حصلت على مكافأة جيدة، عدّل الأوزان لجعل تسلسل الأفعال الذي أدّى لهذه المكافأة أكثر احتمالًا في المستقبل. رياضيًّا: اضرب المكافأة في تدرّج لوغاريتم احتمال الفعل المتّخذ.
The first practical policy gradient algorithm, updating weights by multiplying the reward by the gradient of the log-probability of the action taken, without requiring an environment model.
تُرجم أيضاًخوارزمية التعزيز الإحصائي، مُقدِّر دالّة الرصيد السياسي، تعزيز ويليامز
أول ظهور في هذه المجموعة: خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية (1992)
يظهر في هذه الأوراق
- إتقان لعبة غو باستخدام الشبكات العصبية العميقة والبحث الشجري2016في السماء ✦
- طرق مُتَّجَه ميل السياسة في التعلُّم المعزَّز مع تقريب الدوال1999في السماء ✦
- خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية1992في السماء ✦
- RLAIF: توسيع التعلّم المعزَّز بتغذية راجعة آلية بدلاً من البشر2023في السماء ✦