Stochastic Policy
السياسة العشوائية
بدلًا من أن تختار الشبكة فعلًا واحدًا حتميًّا، تُخرج توزيعًا احتماليًّا على جميع الأفعال المتاحة (مثلًا: يمين 60%، يسار 30%، أعلى 10%). ثم يُسحب الفعل عشوائيًّا وفقًا لهذه النسب. العشوائية ضرورية لأنّ العميل يحتاج إلى تجريب أفعال مختلفة لاكتشاف أيّها يعطي مكافآت أعلى.
A policy that outputs a probability distribution over actions rather than a single deterministic action, providing the exploration needed for learning.
Also translated asالسياسة الاحتمالية، سياسة المعاينة التوزيعية
First appears in this corpus in: Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning (1992)
Appears in these papers
- Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning1992in the sky ✦
- Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning1992in the sky ✦
- Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor2018in the sky ✦