انتباه الاستعلام المتعدّد
Multi-Query Attention
تعديل على الانتباه متعدّد الرؤوس حيث تتشارك جميع الرؤوس إسقاط مفتاح وقيمة واحداً بينما يحتفظ كل رأس بإسقاط استعلام خاصّ به. يُقلّل الذاكرة والحوسبة أثناء التوليد الانحداري بشكل كبير.
A modification of multi-head attention where all heads share one key and one value projection while each head retains its own query projection. Dramatically reduces memory and compute during autoregressive generation.
تُرجم أيضاًالانتباه متعدّد الاستعلامات، MQA
أول ظهور في هذه المجموعة: PaLM: توسيع نمذجة اللغة عبر نظام Pathways (2022)
يظهر في هذه الأوراق