الناقد التكيّفي الحدسي
Adaptive Heuristic Critic
بنية تعلم معزز مبكرة صممها سوتون (1984) تستخدم خطأ الفارق الزمني المُخصَّم لتقييم السياسة — وهي السلف المباشر لبنى الممثل-الناقد الحديثة.
An early reinforcement learning architecture designed by Sutton (1984) that uses discounted TD error for policy evaluation — the direct ancestor of modern actor-critic architectures.
تُرجم أيضاًالناقد الاستدلالي التكيفي
أول ظهور في هذه المجموعة: التعلُّم بالتنبؤ عبر أساليب الفارق الزمني (1988)
يظهر في هذه الأوراق