الانتباه عالي الكفاءة
Efficient Attention
تطبيقات لآلية الانتباه تتجنب تخزين مصفوفة الانتباه الكاملة n×n في الذاكرة، مما يُخفِّض استهلاك الذاكرة من O(n²) إلى O(n). يستخدم LLaMA كلاً من الانتباه الموفّر للذاكرة وFlashAttention.
Attention implementations that avoid storing the full n×n attention matrix in memory, reducing memory usage from O(n²) to O(n). LLaMA uses both memory-efficient attention and FlashAttention.
تُرجم أيضاًالانتباه الفعّال، الانتباه الموفّر للذاكرة
أول ظهور في هذه المجموعة: LLaMA: نماذج أساسية مفتوحة وعالية الكفاءة للغة (2023)
يظهر في هذه الأوراق