Multiquery Attention
انتباه الاستعلام الأحادي
آلية انتباه يتشارك فيها جميع رؤوس الاستعلام زوج مفتاح-قيمة واحداً بدلاً من أن يمتلك كل رأس زوجه الخاص. يقلّص ذاكرة التخزين المؤقت للمفاتيح والقيم بمقدار كبير أثناء الاستدلال.
An attention mechanism where all query heads share a single key-value pair instead of each having its own. Dramatically reduces KV Cache memory during inference.
Also translated asالانتباه أحادي الاستعلام، MQA
First appears in this corpus in: The Falcon Series of Open Language Models (2023)
Appears in these papers