مـُجزئ النصوص
Tokenizer
المكون البرمجي المكلف بتقسيم وتحويل النص اللفظي البشري إلى سلسلة من الرموز والأرقام الفهرسية المفهومة للنموذج.
Tokenizer
تُرجم أيضاًوحدة ترميز الكلمات، خوارزمية فك العبارات إلى رموز رقمية
أول ظهور في هذه المجموعة: إثراء متجهات الكلمات بمعلومات الوحدات الفرعية (2017)
يظهر في هذه الأوراق
- BLOOM: نموذج لغوي متعدد اللغات مفتوح الوصول بـ 176 مليار معامل2022في السماء ✦
- تقييم النماذج اللغوية الكبيرة المُدرَّبة على الشيفرات البرمجية2021في السماء ✦
- سلسلة Falcon من النماذج اللغوية المفتوحة2023في السماء ✦
- إثراء متجهات الكلمات بمعلومات الوحدات الفرعية2017في السماء ✦
- النماذج اللغوية المضبوطة بالتعليمات تتعلَّم بدون أمثلة2022في السماء ✦
- Gemma: نماذج مفتوحة الأوزان مبنية على أبحاث وتقنيات Gemini2024في السماء ✦
- النماذج اللغوية: تعلُّم مهام متعددة بلا إشراف2019في السماء ✦
- النماذج اللغوية قادرة على التعلّم بأمثلة قليلة2020في السماء ✦
- قطيع نماذج Llama 32024في السماء ✦
- LLaMA: نماذج أساسية مفتوحة وعالية الكفاءة للغة2023في السماء ✦
- RoBERTa: منهج مُحسَّن بمتانة للتدريب المسبق على غرار BERT2019في السماء ✦
- التعرّف على الكلام بمتانة عالية من خلال إشراف ضعيف على نطاق واسع2022في السماء ✦