طبقات متوازية
Parallel Layers
تعديل على كتلة المحوِّل حيث يعمل الانتباه والشبكة الأمامية بالتوازي على نفس المدخل المُطبَّع بدلاً من التتابع. يُسرّع التدريب بنحو 15% على نطاق واسع مع الحفاظ على جودة النموذج.
A Transformer block modification where attention and FFN run in parallel on the same LayerNorm'd input instead of sequentially. Speeds up training by ~15% at large scale while maintaining model quality.
تُرجم أيضاًالصيغة المتوازية للمحوِّل، كتلة متوازية