Q-Former
محوِّل الاستعلام
محوِّل خفيف قابل للتعلّم يقع بين مرمِّز الصور المُجمَّد والنموذج اللغوي الكبير المُجمَّد. يستخدم مجموعة من تضمينات الاستعلام القابلة للتعلّم لاستخلاص السمات البصرية الأكثر صلة بمهام اللغة عبر طبقات الانتباه المتبادل.
A lightweight trainable Querying Transformer that sits between a frozen image encoder and a frozen LLM. It uses a set of learnable query embeddings to extract the visual features most relevant to language tasks via cross-attention layers.
Also translated asQ-Former، كيو فورمر
First appears in this corpus in: BLIP-2: Bootstrapping Language-Image Pre-Training with Frozen Image Encoders and Large Language Models (2023)
Appears in these papers