نموذج كبير متعدد الوسائط
Large Multimodal Model
نموذج ذكاء اصطناعي واسع النطاق قادر على فهم وتوليد المحتوى عبر وسائط متعددة كالنص والصورة، يجمع عادةً بين مرمِّز بصري ونموذج لغوي كبير.
A large-scale AI model capable of understanding and generating content across multiple modalities such as text and images, typically combining a vision encoder with a large language model.
تُرجم أيضاًLMM، نموذج لغوي-بصري كبير
أول ظهور في هذه المجموعة: الضبط التعليمي البصري (2023)
يظهر في هذه الأوراق