سياسة الهدف (المُتعلَّمة)
Target Policy
السياسة التي يسعى الوكيل لتعلّمها وتحسينها. في Q-Learning هي دائماً السياسة الجشعة (اختيار الفعل الأعلى قيمة Q) بصرف النظر عن سياسة السلوك المُتّبعة.
The policy the agent is trying to learn and improve. In Q-Learning this is always the greedy policy (pick the highest Q-value action) regardless of the behavior policy being followed.
تُرجم أيضاًالسياسة المستهدفة، سياسة التقييم المثلى
أول ظهور في هذه المجموعة: تعلُّم دالة الجودة (Q-Learning) (1992)
يظهر في هذه الأوراق
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- IMPALA: بنية فاعل-متعلّم موزَّعة وقابلة للتوسّع مع تصحيح خارج السياسة بأوزان الأهمية2018في السماء ✦
- تعلُّم دالة الجودة (Q-Learning)1992في السماء ✦
- TD3: معالجة خطأ تقريب الدوال في أساليب الممثّل-الناقد2018في السماء ✦