رموز لكل معامل
Tokens Per Parameter
النسبة D/N بين عدد رموز التدريب وعدد المعاملات. التدريب الأمثل حوسبياً يتطلب نحو 20 رمزاً لكل معامل.
The ratio D/N of training tokens to model parameters. Compute-optimal training requires roughly 20 tokens per parameter.
تُرجم أيضاًنسبة الرموز إلى المعاملات، كثافة التدريب
أول ظهور في هذه المجموعة: قوانين التوسُّع في النماذج اللغوية العصبية (2020)
يظهر في هذه الأوراق