الضبط الدقيق الخاضع للإشراف
Supervised Fine-Tuning
مرحلة تدريب يُعاد فيها ضبط نموذج مُدرَّب مسبقاً على مجموعة بيانات مُعلَّمة بشرياً من أزواج مدخلات-مخرجات، لتوجيه سلوكه نحو مهام محددة.
A training stage where a pre-trained model is re-tuned on a human-labeled dataset of input-output pairs to steer its behavior toward specific tasks.
تُرجم أيضاًSFT، التدريب الإشرافي الدقيق، التدريب الدقيق بالإشراف، التنقيح الإشرافي، الضبط الدقيق الإشرافي، الضبط الموجَّه
أول ظهور في هذه المجموعة: تعلُّم التلخيص من التغذية الراجعة البشرية (2020)
يظهر في هذه الأوراق
- ألباكا: نموذج قوي وقابل للتكرار يتّبع التعليمات2023في السماء ✦
- تقييم النماذج اللغوية الكبيرة المُدرَّبة على الشيفرات البرمجية2021في السماء ✦
- التقرير التقني لـ DeepSeek-V32024في السماء ✦
- التحسين المباشر للتفضيلات: نموذجك اللغوي هو سرًّا نموذج مكافأة2023في السماء ✦
- سلسلة Falcon من النماذج اللغوية المفتوحة2023في السماء ✦
- وكيل واحد لكل المهام2022في السماء ✦
- Gemini: عائلة نماذج فائقة القدرات تجمع بين وسائط متعددة2023في السماء ✦
- Gemma: نماذج مفتوحة الأوزان مبنية على أبحاث وتقنيات Gemini2024في السماء ✦
- التقرير التقني لـ GPT-42023في السماء ✦
- تدريب النماذج اللغوية على اتّباع التعليمات باستخدام التغذية الراجعة البشرية2022في السماء ✦
- تعلُّم التلخيص من التغذية الراجعة البشرية2020في السماء ✦
- Llama 2: نماذج أساسية مفتوحة الأوزان ونماذج محادثة مُحاذَاة2023في السماء ✦
- قطيع نماذج Llama 32024في السماء ✦
- Mixtral: مزيج الخبراء2024في السماء ✦
- RLAIF: توسيع التعلّم المعزَّز بتغذية راجعة آلية بدلاً من البشر2023في السماء ✦