متعدد الوسائط
Multimodal
نموذج يستطيع معالجة أنواع متعددة من المدخلات — كالنص والصور والصوت — بدلاً من النص وحده، مما يمنحه فهماً أوسع للعالم.
A model that can process multiple types of input — such as text, images, and audio — rather than text alone, giving it a broader understanding of the world.
تُرجم أيضاًشامل الوسائط، عابر الوسائط، عابر للوسائط، متعدد الأنماط، مُتعدِّد الأنماط
أول ظهور في هذه المجموعة: VQA: الإجابة البصرية عن الأسئلة (2015)
يظهر في هذه الأوراق
- BLIP-2: بناء تدريب مسبق للرؤية واللغة انطلاقاً من مرمِّزات صور ونماذج لغوية كبيرة مُجمَّدة2023في السماء ✦
- تعلُّم نماذج بصرية قابلة للنقل عبر الإشراف باللغة الطبيعية2021في السماء ✦
- سياسة الانتشار: تعلُّم السياسات البصرية-الحركية بانتشار الأفعال2023في السماء ✦
- Flamingo: نموذج لغوي بصري للتعلّم بأمثلة قليلة2022في السماء ✦
- Gemini: عائلة نماذج فائقة القدرات تجمع بين وسائط متعددة2023في السماء ✦
- التقرير التقني لـ GPT-42023في السماء ✦
- HuggingGPT: كيف يقود ChatGPT فريقاً من النماذج المتخصّصة على Hugging Face2023في السماء ✦
- ImageBind: فضاء تضمين واحد يربط كل الأنماط2023في السماء ✦
- الضبط التعليمي البصري2023في السماء ✦
- Perceiver: إدراك عام بالانتباه التكراري2021في السماء ✦
- VQA: الإجابة البصرية عن الأسئلة2015في السماء ✦