تأخير الاستدلال
Inference Latency
الوقت الإضافي المستغرق لتوليد المخرجات بسبب الحسابات المُضافة. LoRA لا يُضيف أي تأخير لأن مصفوفاته تُدمَج في الأوزان الأصلية.
Additional time required to generate outputs due to added computation. LoRA adds zero latency because its matrices merge into the original weights.
تُرجم أيضاًزمن الاستجابة، وقت الاستنتاج
أول ظهور في هذه المجموعة: تسريع الاستدلال في المُحوِّلات باستخدام فك الترميز التخميني (2023)
يظهر في هذه الأوراق