Glossary

Soft Actor-Critic

الفاعل-الناقد المَرِن

خوارزمية تعلّم معزَّز عميق خارج السياسة تتعلّم سياسة عشوائية تُعظّم المكافأة المتوقعة والإنتروبيا معاً. تجمع بين شبكتي Q (ناقدين توأمين) وسياسة غاوسية مسحوقة عبر tanh وتحديثات هدف مَرِنة بمتوسط بولياك.

An off-policy deep RL algorithm that learns a stochastic policy maximizing expected reward plus policy entropy. Combines twin Q-networks, a squashed Gaussian policy via tanh, and soft target updates using Polyak averaging.

Also translated asSAC، الممثّل-الناقد المرن

First appears in this corpus in: Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor (2018)

Appears in these papers