Pre-Norm
التسوية المسبقة
أسلوب تطبيق تسوية الطبقة قبل كل وحدة فرعية (انتباه أو MLP) بدلاً من بعدها، مما يُثبّت تدريب النماذج العميقة.
Applying layer normalization before each sub-layer (attention or MLP) instead of after, which stabilizes training for deep models.
Also translated asالتسوية قبل الوحدة الفرعية
First appears in this corpus in: Language Models Are Unsupervised Multitask Learners (2019)
Appears in these papers