Glossary

Pre-Norm

التسوية المسبقة

أسلوب تطبيق تسوية الطبقة قبل كل وحدة فرعية (انتباه أو MLP) بدلاً من بعدها، مما يُثبّت تدريب النماذج العميقة.

Applying layer normalization before each sub-layer (attention or MLP) instead of after, which stabilizes training for deep models.

Also translated asالتسوية قبل الوحدة الفرعية

First appears in this corpus in: Language Models Are Unsupervised Multitask Learners (2019)

Appears in these papers