المعجم

الدمج متعدد الوسائط

Multimodal Fusion

عملية الجمع بين تمثيلات من وسائط مختلفة (كالصور والنصوص) في تمثيل موحد يستفيد من المعلومات في كلتا الوسيطتين. في VQA، تُدمج سمات الصورة مع سمات السؤال للتنبؤ بالإجابة.

The process of combining representations from different modalities (such as images and text) into a unified representation that leverages information from both. In VQA, image features are fused with question features to predict the answer.

تُرجم أيضاًدمج الوسائط، الاندماج متعدد الأنماط

أول ظهور في هذه المجموعة: VQA: الإجابة البصرية عن الأسئلة (2015)

يظهر في هذه الأوراق