التدرج الحتمي العميق للسياسة
DDPG
خوارزمية تعلّم معزَّز خارج السياسة قائمة على بنية الفاعل والناقد، تُوسِّع التدرج الحتمي للسياسة إلى فضاءات الأفعال المستمرة باستخدام شبكات عصبية عميقة.
An off-policy actor–critic reinforcement learning algorithm that extends deterministic policy gradients to continuous action spaces using deep neural networks.
تُرجم أيضاًDDPG، Deep Deterministic Policy Gradient، خوارزمية التدرج الحتمي العميق