Glossary

On-Policy

خوارزمية التعلم من السياسة الحالية

خوارزميات تعزيز تتعلم وتحدث استراتيجيتها بالاعتماد الحصري على الأفعال المباشرة التي يتخذها العميل حالياً في البيئة.

On-Policy

Also translated asالتعلم التدعيمي الملتزم باستراتيجية العمل، مواءمة الأفعال المباشرة الحية

First appears in this corpus in: Policy Gradient Methods for Reinforcement Learning with Function Approximation (1999)

Appears in these papers