التسوية المسبقة
Pre-Norm
أسلوب تطبيق تسوية الطبقة قبل كل وحدة فرعية (انتباه أو MLP) بدلاً من بعدها، مما يُثبّت تدريب النماذج العميقة.
Applying layer normalization before each sub-layer (attention or MLP) instead of after, which stabilizes training for deep models.
تُرجم أيضاًالتسوية قبل الوحدة الفرعية
أول ظهور في هذه المجموعة: النماذج اللغوية: تعلُّم مهام متعددة بلا إشراف (2019)
يظهر في هذه الأوراق