ذاكرة المفاتيح والقيم
KV Cache
في المحوِّلات، تُخزَّن مصفوفات المفاتيح والقيم لكل الرموز السابقة أثناء الاستدلال الارتجاعي. هذه الذاكرة تنمو خطياً مع طول التسلسل، مستهلكة ذاكرة المعالج الرسومي ومبطئة عملية التوليد. مامبا تتجنّبها كلياً بحالة مخفية ثابتة الحجم.
In Transformers, the Key and Value matrices from all previous tokens are stored during autoregressive inference. This cache grows linearly with sequence length, consuming GPU memory and slowing generation. Mamba avoids this entirely with a fixed-size hidden state.
تُرجم أيضاًالكاش الحوسبي لتسريع التوليد النصي، ذاكرة KV المؤقتة، ذاكرة استرجاع الحسابات السياقية السابقة، مخبأة المفاتيح والقيم
أول ظهور في هذه المجموعة: GQA: تدريب نماذج الانتباه متعدد الاستعلامات المُعمَّم من نقاط تفتيش الانتباه متعدد الرؤوس (2023)
يظهر في هذه الأوراق
- التقرير التقني لـ DeepSeek-V32024في السماء ✦
- GQA: تدريب نماذج الانتباه متعدد الاستعلامات المُعمَّم من نقاط تفتيش الانتباه متعدد الرؤوس2023في السماء ✦
- مامبا: نمذجة التسلسلات في زمن خطّي باستخدام فضاءات حالة انتقائية2023في السماء ✦
- Mistral 7B2023في السماء ✦
- إدارة الذاكرة بكفاءة لخدمة النماذج اللغوية الكبيرة باستخدام PagedAttention2023في السماء ✦
- تسريع الاستدلال في المُحوِّلات باستخدام فك الترميز التخميني2023في السماء ✦