الفاعل-الناقد المَرِن
Soft Actor-Critic
خوارزمية تعلّم معزَّز عميق خارج السياسة تتعلّم سياسة عشوائية تُعظّم المكافأة المتوقعة والإنتروبيا معاً. تجمع بين شبكتي Q (ناقدين توأمين) وسياسة غاوسية مسحوقة عبر tanh وتحديثات هدف مَرِنة بمتوسط بولياك.
An off-policy deep RL algorithm that learns a stochastic policy maximizing expected reward plus policy entropy. Combines twin Q-networks, a squashed Gaussian policy via tanh, and soft target updates using Polyak averaging.
تُرجم أيضاًSAC، الممثّل-الناقد المرن
أول ظهور في هذه المجموعة: الفاعل-الناقد المَرِن: تعلُّم معزَّز عميق خارج السياسة بأقصى إنتروبيا مع فاعل عشوائي (2018)
يظهر في هذه الأوراق