التجزئة الداخلية
Internal Fragmentation
هدر الذاكرة الناتج عن تخصيص كتلة أكبر مما يحتاجه الطلب فعليًّا. في خدمة النماذج اللغوية الكبيرة، يحدث ذلك حين يُحجز فضاء بحجم أقصى طول تسلسل بينما الطلب الفعلي أقصر بكثير.
Memory waste that occurs when an allocated block is larger than what the request actually needs. In LLM serving, this happens when space is reserved for the maximum sequence length but the actual request is much shorter.
تُرجم أيضاًالهدر الداخلي
أول ظهور في هذه المجموعة: إدارة الذاكرة بكفاءة لخدمة النماذج اللغوية الكبيرة باستخدام PagedAttention (2023)
يظهر في هذه الأوراق