Glossary

Tokens Per Parameter

رموز لكل معامل

النسبة D/N بين عدد رموز التدريب وعدد المعاملات. التدريب الأمثل حوسبياً يتطلب نحو 20 رمزاً لكل معامل.

The ratio D/N of training tokens to model parameters. Compute-optimal training requires roughly 20 tokens per parameter.

Also translated asنسبة الرموز إلى المعاملات، كثافة التدريب

First appears in this corpus in: Scaling Laws for Neural Language Models (2020)

Appears in these papers