Glossary

Parallel Layers

طبقات متوازية

تعديل على كتلة المحوِّل حيث يعمل الانتباه والشبكة الأمامية بالتوازي على نفس المدخل المُطبَّع بدلاً من التتابع. يُسرّع التدريب بنحو 15% على نطاق واسع مع الحفاظ على جودة النموذج.

A Transformer block modification where attention and FFN run in parallel on the same LayerNorm'd input instead of sequentially. Speeds up training by ~15% at large scale while maintaining model quality.

Also translated asالصيغة المتوازية للمحوِّل، كتلة متوازية