Tokens Per Parameter
رموز لكل معامل
النسبة D/N بين عدد رموز التدريب وعدد المعاملات. التدريب الأمثل حوسبياً يتطلب نحو 20 رمزاً لكل معامل.
The ratio D/N of training tokens to model parameters. Compute-optimal training requires roughly 20 tokens per parameter.
Also translated asنسبة الرموز إلى المعاملات، كثافة التدريب
First appears in this corpus in: Scaling Laws for Neural Language Models (2020)
Appears in these papers