الإجابة البصرية عن الأسئلة
Visual Question Answering
مهمة رؤية ولغة يتلقى فيها النموذج صورة وسؤالاً بلغة طبيعية ويجب عليه توليد إجابة نصية. يصوغ RT-2 التحكم الروبوتي كمسألة إجابة بصرية.
A vision-language task where the model receives an image and a natural language question and must generate a textual answer. RT-2 formats robot control as a VQA problem.
تُرجم أيضاًالإجابة على الأسئلة المرئية، الاستفسار البصري
أول ظهور في هذه المجموعة: VQA: الإجابة البصرية عن الأسئلة (2015)
يظهر في هذه الأوراق
- BLIP-2: بناء تدريب مسبق للرؤية واللغة انطلاقاً من مرمِّزات صور ونماذج لغوية كبيرة مُجمَّدة2023في السماء ✦
- Flamingo: نموذج لغوي بصري للتعلّم بأمثلة قليلة2022في السماء ✦
- HuggingGPT: كيف يقود ChatGPT فريقاً من النماذج المتخصّصة على Hugging Face2023في السماء ✦
- RT-2: نماذج الرؤية-اللغة-الفعل تنقل معرفة الويب إلى التحكم الروبوتي2023في السماء ✦
- VQA: الإجابة البصرية عن الأسئلة2015في السماء ✦