البحث الموجَّه عن السياسة
Guided Policy Search
خوارزمية بحث عن السياسة تُحوِّل المسألة إلى تعلّم بإشراف عبر التناوب بين: (1) أمثَلة مسارات بمتحكمات بسيطة تصل إلى الحالة الكاملة، و(2) تدريب سياسة شبكة عصبية على تقليد تلك المسارات من الملاحظات فقط.
A policy search algorithm that converts the problem into supervised learning by alternating between: (1) trajectory optimization with simple controllers that access full state, and (2) training a neural network policy to imitate those trajectories from observations alone.
تُرجم أيضاًالبحث الإرشادي عن السياسة، GPS
أول ظهور في هذه المجموعة: التدريب الشامل لسياسات بصرية-حركية عميقة (2016)
يظهر في هذه الأوراق