Sparse Transformer
المحوِّل المتفرق
نسخة من المحوِّل تستخدم أنماط انتباه متفرقة (كثيف ومُحلَّل وخُطوي) بدلاً من الانتباه الكامل، مما يُقلّل التعقيد الحسابي ويسمح بمعالجة سلاسل أطول بكثير.
A Transformer variant using sparse attention patterns (dense, factorized, and strided) instead of full attention, reducing computational complexity and enabling processing of much longer sequences.
Also translated asترانسفورمر متفرق، محوِّل ذو انتباه متفرق
First appears in this corpus in: Jukebox: A Generative Model for Music (2020)
Appears in these papers