Byte-Pair Encoding
ترميز أزواج البايت
خوارزمية ترميز نصي تدمج تكرارياً أكثر أزواج الرموز الفرعية شيوعاً حتى الوصول لحجم مفردات محدد. يستخدم LLaMA ترميز SentencePiece بأزواج البايت مع 32 ألف مفردة، ويقسم الأرقام إلى خانات فردية لتحسين الاستدلال الحسابي.
A text tokenization algorithm that iteratively merges the most frequent pairs of sub-word units until reaching a target vocabulary size. LLaMA uses SentencePiece BPE with a 32K vocabulary, splitting numbers into individual digits for better arithmetic reasoning.
Also translated asBPE، ترميز الأزواج البايتية، خوارزمية الأزواج البايتية
First appears in this corpus in: RoBERTa: A Robustly Optimized BERT Pretraining Approach (2019)
Appears in these papers