الرؤية الحاسوبية2015متوسط10 دقيقة قراءة
VQA: الإجابة البصرية عن الأسئلة
VQA: Visual Question Answering
Antol, S. · Agrawal, A. · Lu, J. · Mitchell, M. · Batra, D. · Zitnick, C. L. · Parikh, D. — ICCV
المشكلة
بحلول 2015 كانت نماذج قادرة على توليد جملة عامة تصف المشهد، لكن لم تكن هناك طريقة صارمة لاختبار ما إذا كان النظام يفهم الصورة حقاً. وصفٌ مثل «رجل في ملعب» لا يكشف ما إذا كان النموذج يعرف أي رياضة يمارسها، أو كم شخصاً يشاهده، أو ما حالة الطقس. لم يكن هناك معيار تقييم واسع النطاق ومفتوح يختبر الفهم البصري الدقيق من خلال اللغة الطبيعية.
الإسهام
VQA: مهمة جديدة، ومجموعة بيانات ضخمة، ومجموعة نماذج مرجعية. المهمة تتطلب الإجابة عن أسئلة مفتوحة بلغة طبيعية حول الصور. تحتوي على نحو 0.25 مليون صورة من COCO ونحو 0.76 مليون سؤال ونحو 10 ملايين إجابة بشرية. النماذج المرجعية تجمع بين شبكة التفافية (VGGNet) لاستخلاص سمات الصورة ونموذج أو LSTM لترميز السؤال، ثم تدمج التمثيلين بالضرب عنصراً بعنصر وتصنّف الإجابة من بين أكثر 1000 إجابة شيوعاً. أفضل نموذج مرجعي (deeper LSTM Q + norm I) حقق دقة 58.16% في الإجابات المفتوحة — وهو بعيد جداً عن أداء البشر البالغ 83.30%.
الأثر
حدّدت VQA معيار الفهم الذي قاد عقداً من الأبحاث. كشفت أن الدمج البسيط بين سمات الشبكة الالتفافية وLSTM لا يكفي — النماذج تحتاج إلى آليات انتباه وتأريض بصري واستدلال. أصبح تحدي VQA المنافسة المرجعية التي حفّزت شبكات الانتباه المُكدَّس والانتباه من أسفل لأعلى، وصولاً إلى نماذج الرؤية واللغة مثل CLIP وLLaVA التي اقتربت من أداء البشر.
تخيّل أنك في متحف مع مُرشد سياحي. الدليل الصوتي المسجَّل يكتفي بعبارة مثل «هذه لوحة لحديقة» — وهذا بالضبط ما تفعله نماذج وصف الصور. لكن المرشد الحقيقي يستطيع أن يجيبك عن أي سؤال يخطر ببالك: «في أي فصل رُسمت؟»، «كم شخصاً في المشهد؟»، «هل استخدم الرسّام ألواناً دافئة أم باردة؟»
VQA تحوّل الذكاء الاصطناعي إلى ذلك المرشد: النظام يتلقّى صورة وسؤالاً بلغة طبيعية، وعليه أن يجيب. الأسئلة هنا تتجاوز ما يذكره أي وصف عام — فهي تسأل عن تفاصيل الخلفية، والعلاقات المكانية بين العناصر، وتتطلّب ، بل وأحياناً قراءة نصوص ظاهرة داخل الصورة نفسها.
لماذا VQA؟ حدود وصف الصور
قبل ظهور VQA، كان الأسلوب السائد لتقييم فهم الصور هو وصف الصور: اطلب من النموذج أن يولّد جملة تصف المشهد. لكن هذا الأسلوب يعاني من مشكلتين أساسيتين:
- سطحيّ بطبيعته. النموذج قد يقول «كلب على أريكة» دون أن يميّز سلالته أو لونه أو ماذا يفعل تحديداً.
- صعب التقييم. وصفان صحيحان للمشهد نفسه قد يستخدمان كلمات مختلفة كلياً، فتفشل المقاييس الآلية في الحكم عليهما.
VQA تقلب المعادلة تماماً: بدلاً من أن تطلب من النظام أن يتطوّع بمعلومات، أنت تسأله أسئلة محدّدة. الإجابات قصيرة عادةً — كلمة إلى ثلاث كلمات — فيصبح التقييم واضحاً ومباشراً. والأهم أن كل سؤال يستهدف جانباً مختلفاً من الصورة، فتختبر VQA طيفاً واسعاً من قدرات الفهم البصري لا يقترب منه وصف الصور التقليدي.
مجموعة البيانات: 0.76 مليون سؤال، 10 ملايين إجابة
بُنيت مجموعة بيانات VQA على صور MS-COCO، وهي صور فوتوغرافية حقيقية لمشاهد من الحياة اليومية. لكل صورة، كتب عمّال على منصة Amazon Mechanical Turk ثلاثة أسئلة مفتوحة، ثم أجاب عن كل سؤال عشرة أشخاص مختلفين. هذا التعدّد في الإجابات ضروري لأنه يعكس الغموض الطبيعي في اللغة — فقد يُجيب أحدهم «اثنان» وآخر «2» وثالث «زوج»، وجميعها صحيحة. بفضل هذا التنوّع يمكن بناء مرن يُعطي درجات جزئية بدلاً من الحكم الثنائي صحيح/خطأ.
إلى جانب الصور الحقيقية، تتضمّن المجموعة — رسوم قصاصات فنية لأشخاص وعناصر في تكوينات مختلفة — والهدف هو فصل قدرة الاستدلال عن التعرّف البصري منخفض المستوى. فلو نجح نموذج في الرسوم المبسّطة وأخفق في الصور الحقيقية، فالمشكلة على الأرجح في البصرية لا في المنطق. والعكس يدلّ على قوة بصرية مع ضعف في الاستدلال.
ما أنواع الأسئلة التي تطرحها VQA؟
الأسئلة في VQA تغطّي طيفاً واسعاً من مهارات الفهم البصري:
- نعم/لا — مثل «هل في الصورة قطة؟» وتختبر على أبسط مستوياته.
- العدّ — مثل «كم سيارة متوقّفة؟» وتحتاج تحديد مواقع العناصر ثم عدّها.
- اللون والسمات — مثل «ما لون المظلة؟» وتتطلّب تمييزاً دقيقاً للخصائص البصرية.
- المكان — مثل «ما الذي يقع يسار الشخص؟» وتختبر فهم العلاقات المكانية.
- النشاط — مثل «أي رياضة تُلعب؟» وتتطلّب استدلالاً على مستوى المشهد ككل.
- المعرفة العامة — مثل «هل هذا يوم مناسب لنزهة؟» وتتجاوز ما هو مرئي مباشرةً إلى الاستدلال بالمعرفة العامة.
هذا التنوّع هو ما يجعل VQA تحدّياً حقيقياً. نموذج يُجيد التعرّف على الأشياء فقط سيُخفق في الأسئلة المكانية وأسئلة المعرفة العامة، ونموذج يقرأ النصوص فقط سيُخفق في كل ما هو بصري. حلّ VQA يستلزم ذكاءً متعدد الوسائط فعلياً.
مقياس التقييم: قياس درجة التوافق
لأن الإجابات في VQA مفتوحة وليست اختياراً من قائمة، تقترح الورقة مقياس تقييم مرناً يأخذ في الحسبان أن البشر أنفسهم يختلفون في إجاباتهم. كل سؤال يصاحبه 10 إجابات بشرية، والنموذج يحصل على درجة بحسب عدد المُعلِّقين الذين أعطوا الإجابة نفسها:
النماذج المرجعية: كيف تدمج صورة مع سؤال؟
السؤال المعماري المحوري في VQA هو: كيف ندمج الصورة مع متجه سمات السؤال للوصول إلى إجابة؟ هذا هو جوهر ما يُعرف بـ.
تستعرض الورقة عدة نماذج مرجعية، كلٌّ منها أقوى ممّا قبله:
- الصورة فقط — يتجاهل السؤال تماماً ويتنبّأ بالإجابة الأكثر شيوعاً لصور مشابهة. الهدف هنا قياس الانحياز البصري المحض.
- السؤال فقط — يتجاهل الصورة ويتنبّأ من نص السؤال وحده. يكشف هذا في البيانات (مثلاً: «ما لون ___؟» ← «أبيض» غالباً صحيحة).
- سؤال + صورة (حقيبة كلمات) — يُرمَّز السؤال كمجموعة كلمات، وتُستخلص سمات الصورة من شبكة VGGNet ، ثم يُدمج التمثيلان.
- LSTM + صورة — تُستبدل حقيبة الكلمات بشبكة LSTM تقرأ السؤال كلمةً بكلمة فتلتقط ترتيب الكلمات وسياقها.
- LSTM أعمق + صورة مُسوّاة — شبكة LSTM من طبقتين بـ من 2048 بُعداً، تُدمج مع سمات الصورة بعد عبر .
الدمج: الضرب عنصراً بعنصر
آلية الدمج هنا أبسط ممّا قد تتوقّع. متجه سمات الصورة (من الأخيرة في VGGNet، بأبعاد 4096) ومتجه سمات السؤال (من الحالة الخفية الأخيرة لشبكة LSTM، مُسقَط إلى 1024 أو 2048 بُعداً) يُدمجان بـالضرب عنصراً بعنصر.
الفكرة تشبه مرشِّحاً انتقائياً: متجه السؤال يعمل كقناع يُضخّم السمات المرتبطة بالسؤال ويُخمد ما عداها. فإذا كان السؤال عن اللون مثلاً، تُعزَّز الأبعاد الحسّاسة للألوان في متجه الصورة؛ وإذا كان عن العدّ، تحصل الأبعاد المكانية على وزن أكبر.
بعد الدمج، يمرّ المتجه الناتج عبر ( من 1000 عصبون لكل منهما، مع وتنشيط tanh)، ثم طبقة نهائية تختار الإجابة من بين أكثر 1000 إجابة شيوعاً.
الفكرة في شيفرة برمجية
مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.
import numpy as np
def softmax(x):
e = np.exp(x - x.max(axis=-1, keepdims=True))
return e / e.sum(axis=-1, keepdims=True)
def vqa_predict(image_features, question_tokens, W_embed, W_lstm, W1, b1, W2, b2):
"""
image_features: (4096,) من الطبقة الأخيرة في VGGNet
question_tokens: قائمة فهارس الكلمات
"""
# الخطوة 1: ترميز السؤال بشبكة LSTM
h = np.zeros(1024) # الحالة الخفية لـ LSTM
for token in question_tokens:
word_vec = W_embed[token] # (300,) تضمين الكلمة
h = lstm_step(h, word_vec, W_lstm) # تحديث الحالة الخفية
q_features = h # الحالة النهائية = تمثيل السؤال
# الخطوة 2: تسوية سمات الصورة
img_norm = image_features / (np.linalg.norm(image_features) + 1e-8)
# الخطوة 3: الدمج بالضرب عنصراً بعنصر
fused = img_norm * q_features # "المرشّح الانتقائي"
# الخطوة 4: التصنيف على أكثر 1000 إجابة
hidden = np.tanh(W1 @ fused + b1) # طبقة MLP الأولى
logits = W2 @ hidden + b2 # (1000,)
probs = softmax(logits)
return np.argmax(probs) # فهرس الإجابة المتوقعةالنتائج: كم تبعد النماذج عن البشر؟
النتائج ترسم صورة واضحة عن الفجوة بين الآلة والإنسان. أفضل نموذج مرجعي وصل إلى 58.16% في الإجابات المفتوحة، بينما بلغ أداء البشر 83.30%. لكن حين ننظر إلى التفصيل حسب نوع السؤال تتّضح الصورة أكثر:
في أسئلة نعم/لا، تؤدّي النماذج أداءً لا بأس به (نحو 75%) لأن فضاء الإجابة ثنائي والانحياز البصري يساعد. أما في أسئلة العدّ فينخفض الأداء كثيراً (نحو 33%) لأن العدّ يحتاج تحديداً دقيقاً لموقع كل عنصر. وفي الأسئلة المفتوحة الأخرى — كالألوان والأنشطة والعناصر — تحقّق النماذج نحو 42%: أفضل من التخمين العشوائي لكنها بعيدة جداً عن الفهم الحقيقي.
النتيجة الأكثر دلالة: النموذج الذي يعتمد على نص السؤال فقط — دون أن يرى الصورة إطلاقاً — حقّق 48.09%. هذا يعني أن نصف الأسئلة تقريباً يمكن تخمين إجاباتها من الأنماط اللغوية وحدها. كشف هذا انحيازاً لغوياً عميقاً في المجموعة، وكان الدافع المباشر لإنشاء VQA v2.0 التي أضافت لكل سؤال صوراً مكمِّلة ذات إجابات معاكسة لإجبار النماذج على النظر فعلاً.
مشكلة الانحياز اللغوي
المشاهد المجردة: فصل الاستدلال عن التعرّف البصري
من أذكى القرارات التصميمية في VQA تضمين مشاهد مجرّدة — رسوم قصاصات فنية — إلى جانب الصور الحقيقية. في الصورة الحقيقية يواجه النموذج تحدّيات بصرية كثيرة: إضاءة متفاوتة، عناصر محجوبة جزئياً، ملمس معقّد. أما في المشهد المجرّد فالعناصر أيقونات واضحة لا غموض فيها.
هذا الفصل يسمح بتشخيص مصدر الخطأ بدقة: هل المشكلة في التعرّف البصري — أي أن النموذج لا «يرى» ما في الصورة أصلاً — أم في الاستدلال — أي أنه يرى العناصر لكنه لا يستطيع ربطها للإجابة عن السؤال؟ هذا التشخيص كان مؤثّراً لأنه أظهر أن الاستدلال يبقى التحدّي الأصعب حتى حين يكون التعرّف البصري مثالياً.
ما كشفته VQA عن فهم الذكاء الاصطناعي
كشفت VQA عن ثلاث نقاط ضعف جوهرية في أنظمة 2015:
- لا توجد آلية . تُنتج متجه سمات واحداً يمثّل الصورة بأكملها، دون أي طريقة للتركيز على المنطقة التي يسأل عنها السؤال. هذا القصور ألهم مباشرةً شبكات الانتباه المُكدَّس (2016) ونموذج الانتباه من أسفل لأعلى ومن أعلى لأسفل (2018).
- لا يوجد استدلال مكاني. الضرب عنصراً بعنصر يتعامل مع سمات الصورة كحقيبة مسطّحة من الخصائص ويتجاهل البنية المكانية تماماً — النموذج حرفياً لا يستطيع التمييز بين «يسار» و«يمين».
- لا يوجد استدلال تركيبي. أسئلة من نوع «ما لون الشيء الصغير بجانب الصندوق الأحمر؟» تحتاج سلسلة خطوات استدلال متتابعة، وعملية ضرب واحدة لا تستطيع التعبير عن ذلك.
كل واحدة من هذه الفجوات فتحت اتجاهاً بحثياً كاملاً. VQA لم تحلّ مشكلة الفهم البصري — لكنها منحت المجال جعل التقدّم قابلاً للقياس.
الإرث: من VQA إلى نماذج الرؤية واللغة
2015
VQA v1.0
مجموعة البيانات الأصلية وتعريف المهمة. 0.25 مليون صورة و0.76 مليون سؤال. النماذج المرجعية تحقق 58% مقابل 83% للبشر.
2016
شبكات الانتباه المُكدَّس (SAN)
انتباه متعدد الخطوات على مناطق الصورة بتوجيه من السؤال. أثبتت أن النظر إلى المكان الصحيح لا يقل أهمية عن التعرف على الأشياء.
2017
VQA v2.0 — جعل «البصري» مهماً حقاً
أضافت لكل سؤال صوراً مكمّلة تعطي إجابات معاكسة، فأجبرت النماذج على النظر إلى الصورة فعلاً بدلاً من التخمين من المسبقات اللغوية.
2018
الانتباه من أسفل لأعلى ومن أعلى لأسفل
استخدمت كشف الأشياء (Faster R-CNN) لاقتراح مناطق بارزة، ثم يختار الانتباه أيّها يستحق التركيز. فازت بتحدي VQA.
2021
CLIP
تدريب تبايُني على 400 مليون زوج صورة-نص تعلَّم مفاهيم بصرية من الإشراف اللغوي الطبيعي — ما أتاح النقل بدون أمثلة إلى مهام شبيهة بـVQA.
2023
LLaVA وGPT-4V
نماذج رؤية ولغة كبيرة تجمع بين نماذج لغوية ضخمة ومُرمِّزات بصرية، اقتربت من مستوى أداء البشر في VQA بل تجاوزته أحياناً.
النماذج المرجعية في VQA تبدو بسيطة بمقاييس اليوم. لكن مجموعة البيانات وإطار التقييم اللذين أرستهما الورقة تحوّلا إلى ساحة الاختبار التي طوّر عليها مجال الرؤية واللغة أدواته بأكملها — من آليات الانتباه إلى النماذج متعددة الوسائط القائمة على ، وصولاً إلى الكبيرة المعاصرة.
المرجعAntol, Agrawal, Lu, Mitchell, Batra, Zitnick, Parikh. VQA: Visual Question Answering. ICCV, 2015.
مصطلحات هذه الورقة
- الإجابة البصرية عن الأسئلةVisual Question Answering
- النموذج متعدد الأنماطMultimodal Model
- تصنيف وفهرسة الصورImage Classification
- الشبكة العصبية الالتفافيةConvolutional Neural Network (CNN)
- شبكة الذاكرة الطويلة قصيرة المدىLSTM
- التضمينEmbedding
- سوفت ماكسSoftmax
- الحقيقة الأرضيةGround Truth
- القاموس المفتوحOpen Vocabulary
- التعهيد الجماعيCrowdsourcing