نموذج الرؤية واللغة
Vision-Language Model
شبكة عصبية مُدرَّبة على معالجة الصور والنصوص معاً، عادةً على بيانات بحجم الإنترنت. تستطيع وصف الصور والإجابة عن أسئلة بصرية وأداء مهام متعددة الوسائط.
A neural network trained to jointly process images and text, typically on internet-scale data. VLMs can caption images, answer visual questions, and perform various multimodal tasks.
تُرجم أيضاًالمعالج البصري اللغوي الـمدمج، النموذج البصري اللغوي، بنية الربط الدلالي بين الصور والنصوص، نموذج بصري-لغوي، نموذج رؤية-لغة، نموذج مُشترك للرؤية واللغة
أول ظهور في هذه المجموعة: VQA: الإجابة البصرية عن الأسئلة (2015)
يظهر في هذه الأوراق
- ALIGN: توسيع نطاق تعلّم التمثيلات البصرية والبصرية-اللغوية بإشراف نصّي مُشوَّش2021في السماء ✦
- BLIP-2: بناء تدريب مسبق للرؤية واللغة انطلاقاً من مرمِّزات صور ونماذج لغوية كبيرة مُجمَّدة2023في السماء ✦
- تعلُّم نماذج بصرية قابلة للنقل عبر الإشراف باللغة الطبيعية2021في السماء ✦
- وكيل واحد لكل المهام2022في السماء ✦
- Open X-Embodiment: مجموعات بيانات التعلّم الروبوتي ونماذج RT-X2024في السماء ✦
- π₀: نموذج تدفُّقي للرؤية واللغة والفعل للتحكم العام بالروبوتات2024في السماء ✦
- VQA: الإجابة البصرية عن الأسئلة2015في السماء ✦