المعجم

FlashAttention

FlashAttention

خوارزمية واعية بنمط الوصول للذاكرة تحسب الانتباه الدقيق دون تجسيد مصفوفة الانتباه الكاملة n×n في ذاكرة المعالج الرسومي. تُخفّض استهلاك الذاكرة من O(n²) إلى O(n) وتُسرّع زمن التنفيذ. استُخدمت في تدريب LLaMA.

An IO-aware algorithm that computes exact attention without materializing the full n×n attention matrix in GPU memory. Reduces memory usage from O(n²) to O(n) and speeds up wall-clock time. Used in LLaMA training.

تُرجم أيضاًالانتباه السريع، انتباه فلاش

أول ظهور في هذه المجموعة: FlashAttention-2: انتباه أسرع بتوازٍ أفضل وتوزيع عمل أذكى (2023)

يظهر في هذه الأوراق