المعجم

رموز لكل معامل

Tokens Per Parameter

النسبة D/N بين عدد رموز التدريب وعدد المعاملات. التدريب الأمثل حوسبياً يتطلب نحو 20 رمزاً لكل معامل.

The ratio D/N of training tokens to model parameters. Compute-optimal training requires roughly 20 tokens per parameter.

تُرجم أيضاًنسبة الرموز إلى المعاملات، كثافة التدريب

أول ظهور في هذه المجموعة: قوانين التوسُّع في النماذج اللغوية العصبية (2020)

يظهر في هذه الأوراق