المعجم

خوارزمية REINFORCE

REINFORCE

أول خوارزمية عملية تُمكّن الشبكات العصبية من التعلّم عبر المكافآت فقط دون إجابات صحيحة. الفكرة: جرّب أفعالًا عشوائية، وإن حصلت على مكافأة جيدة، عدّل الأوزان لجعل تسلسل الأفعال الذي أدّى لهذه المكافأة أكثر احتمالًا في المستقبل. رياضيًّا: اضرب المكافأة في تدرّج لوغاريتم احتمال الفعل المتّخذ.

The first practical policy gradient algorithm, updating weights by multiplying the reward by the gradient of the log-probability of the action taken, without requiring an environment model.

تُرجم أيضاًخوارزمية التعزيز الإحصائي، مُقدِّر دالّة الرصيد السياسي، تعزيز ويليامز

أول ظهور في هذه المجموعة: خوارزميات إحصائية بسيطة لتتبُّع التدرُّج في التعلُّم بالتعزيز للشبكات العصبية (1992)

يظهر في هذه الأوراق