نموذج الرؤية-اللغة-الفعل
Vision-Language-Action Model
نموذج يأخذ مدخلات بصرية وتعليمات لغوية ويُخرِج مباشرةً أفعالاً روبوتية منخفضة المستوى، موحِّداً الإدراك وفهم اللغة والتحكم الحركي في بنية واحدة من طرف إلى طرف.
A model that takes visual input and language instructions and directly outputs low-level robot actions — unifying perception, language understanding, and motor control in a single end-to-end architecture.
تُرجم أيضاًنموذج VLA، نموذج الرؤية والفعل اللغوي
أول ظهور في هذه المجموعة: RT-1: محوِّل الروبوتات للتحكم الواقعي على نطاق واسع (2022)
يظهر في هذه الأوراق
- Open X-Embodiment: مجموعات بيانات التعلّم الروبوتي ونماذج RT-X2024في السماء ✦
- π₀: نموذج تدفُّقي للرؤية واللغة والفعل للتحكم العام بالروبوتات2024في السماء ✦
- RT-1: محوِّل الروبوتات للتحكم الواقعي على نطاق واسع2022في السماء ✦
- RT-2: نماذج الرؤية-اللغة-الفعل تنقل معرفة الويب إلى التحكم الروبوتي2023في السماء ✦