Glossary

Vision-Language Model

نموذج الرؤية واللغة

شبكة عصبية مُدرَّبة على معالجة الصور والنصوص معاً، عادةً على بيانات بحجم الإنترنت. تستطيع وصف الصور والإجابة عن أسئلة بصرية وأداء مهام متعددة الوسائط.

A neural network trained to jointly process images and text, typically on internet-scale data. VLMs can caption images, answer visual questions, and perform various multimodal tasks.

Also translated asالمعالج البصري اللغوي الـمدمج، النموذج البصري اللغوي، بنية الربط الدلالي بين الصور والنصوص، نموذج بصري-لغوي، نموذج رؤية-لغة، نموذج مُشترك للرؤية واللغة

First appears in this corpus in: VQA: Visual Question Answering (2015)

Appears in these papers