المعجم

نموذج الرؤية واللغة

Vision-Language Model

شبكة عصبية مُدرَّبة على معالجة الصور والنصوص معاً، عادةً على بيانات بحجم الإنترنت. تستطيع وصف الصور والإجابة عن أسئلة بصرية وأداء مهام متعددة الوسائط.

A neural network trained to jointly process images and text, typically on internet-scale data. VLMs can caption images, answer visual questions, and perform various multimodal tasks.

تُرجم أيضاًالمعالج البصري اللغوي الـمدمج، النموذج البصري اللغوي، بنية الربط الدلالي بين الصور والنصوص، نموذج بصري-لغوي، نموذج رؤية-لغة، نموذج مُشترك للرؤية واللغة

أول ظهور في هذه المجموعة: VQA: الإجابة البصرية عن الأسئلة (2015)

يظهر في هذه الأوراق