المعجم

الانتباه عالي الكفاءة

Efficient Attention

تطبيقات لآلية الانتباه تتجنب تخزين مصفوفة الانتباه الكاملة n×n في الذاكرة، مما يُخفِّض استهلاك الذاكرة من O(n²) إلى O(n). يستخدم LLaMA كلاً من الانتباه الموفّر للذاكرة وFlashAttention.

Attention implementations that avoid storing the full n×n attention matrix in memory, reducing memory usage from O(n²) to O(n). LLaMA uses both memory-efficient attention and FlashAttention.

تُرجم أيضاًالانتباه الفعّال، الانتباه الموفّر للذاكرة

أول ظهور في هذه المجموعة: LLaMA: نماذج أساسية مفتوحة وعالية الكفاءة للغة (2023)

يظهر في هذه الأوراق