المعجم

البحث الموجَّه عن السياسة

Guided Policy Search

خوارزمية بحث عن السياسة تُحوِّل المسألة إلى تعلّم بإشراف عبر التناوب بين: (1) أمثَلة مسارات بمتحكمات بسيطة تصل إلى الحالة الكاملة، و(2) تدريب سياسة شبكة عصبية على تقليد تلك المسارات من الملاحظات فقط.

A policy search algorithm that converts the problem into supervised learning by alternating between: (1) trajectory optimization with simple controllers that access full state, and (2) training a neural network policy to imitate those trajectories from observations alone.

تُرجم أيضاًالبحث الإرشادي عن السياسة، GPS

أول ظهور في هذه المجموعة: التدريب الشامل لسياسات بصرية-حركية عميقة (2016)

يظهر في هذه الأوراق