محوِّل الاستعلام
Q-Former
محوِّل خفيف قابل للتعلّم يقع بين مرمِّز الصور المُجمَّد والنموذج اللغوي الكبير المُجمَّد. يستخدم مجموعة من تضمينات الاستعلام القابلة للتعلّم لاستخلاص السمات البصرية الأكثر صلة بمهام اللغة عبر طبقات الانتباه المتبادل.
A lightweight trainable Querying Transformer that sits between a frozen image encoder and a frozen LLM. It uses a set of learnable query embeddings to extract the visual features most relevant to language tasks via cross-attention layers.
تُرجم أيضاًQ-Former، كيو فورمر
أول ظهور في هذه المجموعة: BLIP-2: بناء تدريب مسبق للرؤية واللغة انطلاقاً من مرمِّزات صور ونماذج لغوية كبيرة مُجمَّدة (2023)
يظهر في هذه الأوراق