المعجم

نموذج الرؤية-اللغة-الفعل

Vision-Language-Action Model

نموذج يأخذ مدخلات بصرية وتعليمات لغوية ويُخرِج مباشرةً أفعالاً روبوتية منخفضة المستوى، موحِّداً الإدراك وفهم اللغة والتحكم الحركي في بنية واحدة من طرف إلى طرف.

A model that takes visual input and language instructions and directly outputs low-level robot actions — unifying perception, language understanding, and motor control in a single end-to-end architecture.

تُرجم أيضاًنموذج VLA، نموذج الرؤية والفعل اللغوي

أول ظهور في هذه المجموعة: RT-1: محوِّل الروبوتات للتحكم الواقعي على نطاق واسع (2022)

يظهر في هذه الأوراق