نماذج اللغة2025متقدم11 دقيقة قراءة

DeepSeek-R1: تحفيز قدرات الاستدلال في النماذج اللغوية الكبيرة عبر التعلم المعزز

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

DeepSeek-AI · Guo, D. · Yang, D. · Zhang, H. · Song, J. · Wang, P. · Zhu, Q. · Xu, R. · Zhang, R. · Ma, S. · Bi, X. — arXiv / Nature

المشكلة

الطريقة المعتادة لتعليم النماذج اللغوية الكبيرة الاستدلال تعتمد على تجهيز حلول بشرية مفصّلة خطوة بخطوة ثم تدريب عليها الخاضع للإشراف. المشكلة أن هذا مكلّف، لا يتوسّع بسهولة، ويضع سقفًا لأداء النموذج عند مستوى البشر — فالنموذج لن يكتشف أبدًا أساليب لم يفكّر فيها المُعلِّمون أنفسهم. أضف إلى ذلك أن نماذج المكافأة العصبية المستخدمة في RLHF تصبح عُرضة للاستغلال والتلاعب كلما كَبُر حجم .

الإسهام

DeepSeek-R1-Zero: نموذج لغوي كبير دُرِّب فقط دون أي ضبط دقيق خاضع للإشراف. بالاعتماد على خوارزمية GRPO ومكافآت قائمة على قواعد ثابتة (صحة الإجابة + التنسيق)، يُطوّر النموذج من تلقاء نفسه سلوكيات استدلالية متقدمة: مراجعة ذاتية، وتحقّق من الحل، وتبديل ديناميكي للأساليب. ثم يأتي DeepSeek-R1 ليبني على هذا الأساس عبر مسار متعدد المراحل (بداية باردة ← تعلم معزز ← ترشيح بالرفض ← ضبط دقيق ← تعلم معزز) لتحسين وضوح النص ومعالجة خلط اللغات مع الحفاظ على قوة الاستدلال. يمكن أيضًا أنماط الاستدلال هذه إلى نماذج أصغر (من 1.5 إلى 70 مليار معامل).

الأثر

أثبت DeepSeek-R1 أن التعلم المعزز وحده قادر على تحقيق قدرات استدلالية تُنافس نموذج o1 من OpenAI — دون الحاجة لتوصيفات بشرية مكلّفة. سجّل 79.8% على AIME 2024 و97.3% على MATH-500 وتفوّق على 96.3% من المتسابقين البشريين على Codeforces. إصداره مفتوح المصدر تحت رخصة MIT فتح الباب أمام الجميع للوصول إلى نماذج استدلال متقدمة، وأشعل موجة بحثية عالمية في توظيف التعلم المعزز لتطوير الاستدلال.

تدريب بالطريقة التقليدية يشبه مدرسة القيادة: معلّم بشري يجلس بجانبك يُريك كل منعطف وكل تغيير مسار. مهما تدرّبت، لن تتجاوز مستوى معلّمك.

نهج DeepSeek-R1 مختلف تمامًا — أشبه بـمحاكاة سباقات: أعطِ المتدرّب سيارة وحلبة وساعة توقيت، ولا تقل له شيئًا عن الأسلوب. بعد آلاف اللفّات سيكتشف بنفسه أفضل خطوط السباق ونقاط الفرملة واستراتيجيات التجاوز التي لم تخطر على بال المعلّم — لأن التغذية الراجعة الوحيدة هي الساعة.

«لحظة الإلهام» هي حين يضغط السائق فجأة على المكابح في منتصف اللفة ويقول لنفسه «لحظة، المنعطف السابق كان خاطئًا»، فيُعيد حساباته ويجد مسارًا أسرع — كل ذلك وحده دون أي توجيه.

المشكلة: الحلول البشرية تضع سقفًا للاستدلال

قبل DeepSeek-R1، كانت الطريقة المعتادة لتعليم النماذج اللغوية الكبيرة الاستدلال تمرّ بمرحلتين: أولًا ضبط دقيق خاضع للإشراف على آلاف الحلول التي كتبها بشر خطوة بخطوة، ثم لتحسين جودة المخرجات. هذا المسار يعاني من ثلاثة قيود جوهرية:

  • صعوبة التوسّع. إنتاج عالية الجودة عملية مكلّفة. الخبراء يقضون دقائق في حل كل مسألة، والبيانات الناتجة لا تُغطي إلا جزءًا ضئيلًا من الأساليب الاستدلالية الممكنة.

  • مشكلة السقف. النموذج يتعلّم تقليد طريقة تفكير البشر، وبالتالي لا يمكنه أن يتجاوز مستوى بيانات التدريب. أساليب جديدة — كأن يُخصّص النموذج رموزًا إضافية للتحقّق من إجابته، أو يُبدّل نهجه تلقائيًا — لم تظهر في البيانات فلن يتعلّمها أبدًا.

  • . نماذج المكافأة العصبية المستخدمة في RLHF يمكن خداعها: النموذج يتعلّم اختصارات تحصل على درجات عالية دون استدلال حقيقي. وإعادة تدريب نموذج المكافأة تحتاج موارد وجهدًا بشريًا إضافيًا، ما يُدخلنا في حلقة مفرغة.

افتح في المختبر
قارن بين المسار التقليدي (ضبط دقيق ثم RLHF) ونهج DeepSeek بالتعلم المعزز الخالص. انقر على كل مرحلة لترى الفرق.
تستيقظ التجربة عند وصولك…

المحرّك: التحسين التجميعي النسبي للسياسة (GRPO)

ينطلق DeepSeek-R1-Zero من نموذج أساسي مُدرَّب مسبقًا (DeepSeek-V3-Base بـ 671 مليار معامل إجمالي و37 مليارًا نشطًا عبر بنية ) ويُطبّق عليه التعلم المعزز مباشرة — بلا أي ضبط دقيق خاضع للإشراف. الخوارزمية المستخدمة هي GRPO ()، وقد صُمّمت لتبسيط PPO بالتخلّص من الحاجة إلى منفصل.

الفكرة بسيطة: لكل سؤال، تُولّد GRPO مجموعة من الإجابات المرشّحة (عادةً 16 إجابة). بعضها صحيح وبعضها خاطئ. بدلًا من الاحتياج لدالة قيمة مُتعلَّمة لتقدير جودة إجابة غير مكتملة، تُقارن GRPO كل إجابة بباقي إجابات المجموعة: إن كانت مكافأتك أعلى من المتوسط تُعزَّز، وإن كانت أقل تُضعَف. كل ناتج تُحسَب نسبةً لمجموعته — ومن هنا جاءت تسمية «التجميعي النسبي».

تخيّلها كـترتيب صفّي: بدلًا من مُصحّح خارجي (نموذج القيمة في PPO)، يُقيّم الطلاب أنفسهم مقارنة ببعضهم. الحلّ الأفضل في كل دفعة يحصل على أقوى إشارة تعزيز.

JGRPO(θ)=E[1Gi=1Gmin(πθ(oiq)πθold(oiq)Ai,  clip(πθ(oiq)πθold(oiq),1ε,1+ε)Ai)βDKL(πθπref)]J_{GRPO}(\theta) = \mathbb{E}\left[\frac{1}{G}\sum_{i=1}^{G} \min\left(\frac{\pi_\theta(o_i|q)}{\pi_{\theta_{old}}(o_i|q)} A_i,\; \text{clip}\left(\frac{\pi_\theta(o_i|q)}{\pi_{\theta_{old}}(o_i|q)}, 1-\varepsilon, 1+\varepsilon\right) A_i\right) - \beta\, D_{KL}(\pi_\theta \| \pi_{ref})\right]
هدف GRPO — تعظيم الميزة عبر المجموعة مع البقاء قريبًا من السياسة المرجعيةG = حجم المجموعة (16 ناتجًا لكل سؤال) · Aᵢ = ميزة الناتج i نسبةً للمجموعة · clip يحافظ على استقرار التحديثات · D_KL يمنع الانحراف الكبير عن السياسة المرجعية
Ai=rimean({r1,r2,,rG})std({r1,r2,,rG})A_i = \frac{r_i - \text{mean}(\{r_1, r_2, \ldots, r_G\})}{\text{std}(\{r_1, r_2, \ldots, r_G\})}
الميزة النسبية التجميعية — لا حاجة لنموذج قيمةمكافأة كل ناتج rᵢ تُحوَّل ببساطة إلى درجة معيارية (z-score) داخل مجموعتها. إن كانت أعلى من المتوسط فالميزة موجبة، وإن كانت أقل فهي سالبة. هذا يُغني عن نموذج القيمة المكلّف الذي تحتاجه PPO.
افتح في المختبر
تابع عملية GRPO خطوة بخطوة. انقر «عيّنة» لتوليد مجموعة إجابات، ثم شاهد كيف تُحسَب الميزات.
تستيقظ التجربة عند وصولك…

تصميم المكافأة: قواعد بسيطة بلا حكّام عصبيين

من أهم القرارات التصميمية في DeepSeek-R1-Zero تجنّب نماذج العصبية في مهام الاستدلال. السبب واضح: هذه النماذج عُرضة لـاختراق المكافأة — أي أن النموذج يتعلّم استغلال ثغرات الحَكَم بدلًا من أن يتحسّن فعلًا. وإعادة تدريب نموذج المكافأة تستنزف موارد حوسبية وتزيد تعقيد المسار.

البديل الذي اختاره DeepSeek-R1-Zero هو مكافآت مبنية على قواعد ثابتة بمكوّنين بسيطين:

  • مكافأة الدقة: هل وصل النموذج للإجابة الصحيحة؟ في الرياضيات تُستخرَج الإجابة النهائية وتُقارَن بالحل المرجعي. في البرمجة يُنفَّذ الكود على حالات اختبار. النتيجة ثنائية: 1 للصحيح و0 للخطأ.

  • مكافأة التنسيق: هل وضع النموذج استدلاله داخل وسوم <think>...</think> و<answer>...</answer>؟ هذا يضمن فصل عملية التفكير عن الإجابة بشكل صريح، ما يجعلها قابلة للتحليل والفهم.

المكافأة الكلية هي ببساطة مجموع هاتين الإشارتين. لا نموذج مكافأة مُتعلَّم، لا بيانات تفضيلات بشرية، لا حلقة إعادة تدريب. البساطة هنا مقصودة: فهي تقضي على مشكلة اختراق المكافأة التي تُلاحق الأساليب العصبية.

Rrule=Raccuracy+RformatR_{rule} = R_{accuracy} + R_{format}
المكافأة الإجمالية القائمة على القواعد — بسيطة عمدًاالدقة: ثنائية (0 أو 1) حسب صحة الإجابة · التنسيق: ثنائي حسب الاستخدام الصحيح لوسوم التفكير والإجابة · لا يتدخّل أي نموذج مكافأة عصبي
افتح في المختبر
فعّل وعطّل مكوّنات المكافأة لترى كيف تؤثّر على إشارة التدريب.
تستيقظ التجربة عند وصولك…

السلوكيات الناشئة: النموذج يُعلّم نفسه التفكير

أبرز ما كشفه DeepSeek-R1-Zero هو أن أساليب الاستدلال المتقدمة تظهر من تلقاء نفسها من التعلم المعزز الخالص — دون أي توجيه بشري. مع تقدّم التدريب تبرز ثلاث ظواهر لافتة:

  • النموذج يُطيل وقت تفكيره بنفسه. متوسط طول الاستجابة ينمو تدريجيًا من نحو 3,000 إلى أكثر من 10,000 رمز. لم يطلب منه أحد أن يفكّر أطول — اكتشف وحده أن تخصيص رموز أكثر للاستدلال يرفع المكافأة.

  • الاستدلال التأملي. كلمات مثل «انتظر» و«خطأ» و«لكن» و«تحقّق» و«أعِد» تتضاعف 5 إلى 7 مرات خلال التدريب. النموذج يتعلّم التوقّف والتشكيك في منطقه وتعديل مساره — وهذا نوع من التفكير فوق المعرفي (metacognition) لم يُعلَّمه أحد.

  • «لحظة الإلهام». عند خطوة التدريب 8,000 تقريبًا، يبدأ النموذج فجأة باستخدام عبارات مثل «انتظر، انتظر… هذه لحظة إلهام» — يُعيد التفكير في نهجه وهو في منتصف الحل. تواتر كلمة «انتظر» يقفز بشكل حاد، ما يُشير إلى تحوّل نوعي في استراتيجية الاستدلال. هذه اللحظة ليست مبرمجة، بل تنبثق من إشارة المكافأة وحدها.

دقة AIME 2024 ترتفع من 15.6% إلى 77.9% خلال التدريب. ومع التصويت بالأغلبية على 16 عيّنة تصل إلى 86.7% — متجاوزة متوسط درجات المتسابقين البشريين.

افتح في المختبر
شاهد كيف ينمو طول الاستجابة والاستدلال التأملي مع تقدّم التدريب. اسحب شريط الخطوات لتستكشف.
تستيقظ التجربة عند وصولك…

من R1-Zero إلى R1: تنقيح على مراحل

أثبت DeepSeek-R1-Zero أن التعلم المعزز الخالص ناجح، لكنه يأتي بمشكلات عملية: نصّ الاستدلال صعب القراءة، والنموذج يخلط بين الصينية والإنجليزية بشكل عشوائي داخل الواحدة. كذلك لا يُجيد المهام غير الاستدلالية كالكتابة الإبداعية والأسئلة المفتوحة.

يُعالج DeepSeek-R1 هذه المشكلات عبر مسار من أربع مراحل:

  • المرحلة 1 — ضبط دقيق . تُجمع مجموعة بيانات صغيرة تضمّ آلاف مسارات الاستدلال الواضحة المكتوبة بضمير المتكلّم. مُعلِّمون بشريون يُعيدون صياغة مخرجات R1-Zero بأسلوب حواري («أحتاج أن أفكّر في…» بدلًا من «نُلاحظ أن…»)، ثم يُولّد نموذج لغوي مزيدًا من البيانات بالأسلوب نفسه. تُستخدم هذه البيانات في مرحلة ضبط دقيق قصيرة تمنح التعلم المعزز نقطة انطلاق أفضل.

  • المرحلة 2 — تعلم معزز أول مع اتساق لغوي. تدريب بالتعلم المعزز يُركّز على الاستدلال كما في R1-Zero، لكن مع إضافة مكافأة اتساق اللغة: وهي نسبة كلمات اللغة المستهدفة في سلسلة التفكير. الهدف دفع النموذج للالتزام بلغة واحدة طوال استدلاله.

  • المرحلة 3 — ترشيح بالرفض + ضبط دقيق. يُولّد النموذج المُدرَّب حلولًا كثيرة ولا يُحتفظ إلا بالصحيحة حسنة التنسيق. نحو 600 ألف عيّنة استدلال و200 ألف عيّنة من مهام أخرى (كتابة وأسئلة وترجمة) تُشكّل معًا مجموعة ضبط دقيق جديدة.

  • المرحلة 4 — تعلم معزز ثانٍ. جولة أخيرة من التعلم المعزز تجمع بين مكافآت قائمة على القواعد (للاستدلال) ومكافآت مبنية على نماذج (للإفادة والأمان)، فينتج نموذج يستدل جيدًا ويتبع التعليمات.

Rlanguage=N(Wordstarget)N(Words)R_{language} = \frac{N(\text{Words}_{target})}{N(\text{Words})}
مكافأة اتساق اللغة — نسبة كلمات اللغة المستهدفةتحسب نسبة الكلمات المكتوبة باللغة المستهدفة (كالصينية أو الإنجليزية) داخل سلسلة التفكير. تُضاف إلى المكافأة الكلية لمنع خلط اللغات. بسيطة لكنها فعّالة — تجارب الحذف أظهرت أنها تحافظ على اتساق اللغة مع تراجع طفيف فقط في أداء الاستدلال.
افتح في المختبر
انقر على كل مرحلة لتستكشف المسار الكامل من V3-Base إلى DeepSeek-R1 النهائي.
تستيقظ التجربة عند وصولك…

التقطير: نقل الاستدلال إلى نماذج أصغر

نموذج ضخم يستدل ببراعة شيء مفيد، لكن نموذجًا صغيرًا يستدل جيدًا هو الذي يُحدث الفارق — يمكنه العمل على واحد، أو على الجهاز مباشرة، أو في الحوسبة الطرفية. قام DeepSeek بـ قدرات R1 الاستدلالية إلى ستة نماذج أصغر تتراوح أحجامها بين 1.5 و70 مليار ، مبنية على بنيتي Qwen وLlama.

عملية التقطير واضحة ومباشرة: يُجرى ضبط دقيق للنموذج الأصغر على نحو 800 ألف استدلال عالي الجودة أنتجها R1. النموذج الطالب لا يحتاج تعلمًا معززًا — فبيانات الضبط الدقيق تحمل بالفعل أنماط الاستدلال التي اكتشفها التعلم المعزز.

الاكتشاف الأهم: الاستدلال المُقطَّر يتفوّق على التعلم المعزز من الصفر في النماذج الصغيرة. حين جرّب الباحثون تطبيق التعلم المعزز مباشرة على Qwen-32B (النهج نفسه الذي نجح مع النموذج ذي 671 مليار معامل)، كانت النتائج أضعف من التقطير البسيط من R1. الدلالة واضحة: اكتشاف أساليب الاستدلال المتقدمة يحتاج حجمًا كبيرًا، لكن بمجرد اكتشافها يمكن نقلها بكفاءة إلى بنيات أصغر.

افتح في المختبر
قارن النماذج المُقطَّرة بنظيراتها الأساسية على معايير AIME وMATH.
تستيقظ التجربة عند وصولك…

الفكرة نفسها في الكود

حساب ميزة GRPO مُبسَّطًاpython

مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.

import numpy as np

def compute_grpo_advantages(rewards: list[float]) -> list[float]:
    """حساب الميزات النسبية التجميعية لدفعة من المخرجات.

    مكافأة كل ناتج تُحوَّل إلى درجة معيارية (z-score) داخل مجموعتها:
    advantage_i = (r_i - mean(group)) / std(group)

    إن كانت مكافأتك أعلى من متوسط المجموعة تُعزَّز.
    وإن كانت أقل تُضعَف. لا حاجة لنموذج قيمة.
    """
    rewards = np.array(rewards)
    mean = rewards.mean()
    std = rewards.std() + 1e-8  # تجنّب القسمة على صفر
    return ((rewards - mean) / std).tolist()

def rule_based_reward(answer: str, ground_truth: str, has_tags: bool) -> float:
    """دالة المكافأة الكاملة لـ DeepSeek-R1-Zero.
    لا نموذج مكافأة عصبي — فقط صحة الإجابة + التنسيق.
    """
    accuracy = 1.0 if answer.strip() == ground_truth.strip() else 0.0
    format_ok = 1.0 if has_tags else 0.0
    return accuracy + format_ok

# مثال: 4 مخرجات مُعيَّنة لسؤال رياضيات واحد
rewards = [
    rule_based_reward("42", "42", True),   # صحيح + منسّق → 2.0
    rule_based_reward("42", "42", False),   # صحيح بلا وسوم → 1.0
    rule_based_reward("17", "42", True),    # خاطئ + منسّق   → 1.0
    rule_based_reward("99", "42", False),   # خاطئ + بلا وسوم → 0.0
]
advantages = compute_grpo_advantages(rewards)
# [1.34, 0.0, 0.0, -1.34] — الإجابة الصحيحة المنسّقة
# تحصل على أقوى إشارة تعزيز؛ والخاطئة بلا تنسيق
# تحصل على أقوى إشارة إضعاف.

النتائج والأثر

يحقّق DeepSeek-R1 أداءً يُكافئ نموذج o1-1217 من OpenAI على معايير الاستدلال المختلفة، مع كونه مفتوح المصدر بالكامل (رخصة MIT). في الرياضيات سجّل 79.8% على AIME 2024 (مقابل 79.2% لـ o1) و97.3% على MATH-500 (مقابل 96.4% لـ o1). في البرمجة وصل إلى تصنيف 2029 على Codeforces، أي ضمن أعلى 96.3% من المتسابقين البشريين. وعلى معايير المعرفة مثل MMLU-Pro حقّق 84.0%.

النماذج المُقطَّرة لا تقلّ إبهارًا: DeepSeek-R1-Distill-Qwen-32B يتفوّق على OpenAI-o1-mini في معظم معايير الاستدلال رغم أنه أصغر بكثير. والنموذج المُقطَّر بـ 7 مليارات معامل يتفوّق على نماذج غير استدلالية أكبر منه عشر مرات.

تكلفة التدريب لافتة بكفاءتها: نحو 147 ألف ساعة معالج رسومي H800 إجمالًا (أي نحو 294 ألف دولار أمريكي)، وهو جزء يسير مما تحتاجه نماذج الاستدلال المغلقة المصدر المكافئة.

  1. 2017

    المُحوِّل (Transformer)

    البنية التي أسّست لكل ما جاء بعدها — الانتباه الذاتي يحلّ محل التكرار، مما أتاح التوازي الضخم وانطلاق عصر التوسّع.

  2. 2017

    PPO (التحسين التقريبي للسياسة)

    خوارزمية التعلم المعزز التي أصبحت المعيار في RLHF — تحديثات مستقرة للسياسة عبر دالة هدف بديلة مقصوصة. تحتاج نموذج قيمة مُتعلَّم.

  3. 2022

    InstructGPT / RLHF

    الضبط الدقيق ثم RLHF أصبحا الوصفة المعيارية لمرحلة ما بعد التدريب. أسلوب قوي لكنه يعتمد على حلول بشرية ونماذج مكافأة عصبية.

  4. 2022

    التحفيز بسلسلة الأفكار

    أظهر Wei وزملاؤه أن مطالبة النماذج اللغوية بـ«لنفكّر خطوة بخطوة» يُحسّن الاستدلال بشكل ملحوظ. لكن النموذج لا يتعلّم الاستدلال فعلًا — بل يُوجَّه إليه.

  5. 2024

    DeepSeek-V3 (671 مليار، مزيج خبراء)

    النموذج الأساسي الذي بُني عليه R1. يضمّ 671 مليار معامل إجمالًا مع 37 مليارًا نشطًا لكل رمز عبر بنية مزيج الخبراء. يستخدم انتباهًا كامنًا متعدد الرؤوس لاستدلال فعّال.

  6. 2025

    DeepSeek-R1 (هذه الورقة)

    التعلم المعزز الخالص يُطلق استدلالًا ناشئًا. GRPO مع مكافآت قائمة على القواعد تُنتج مراجعة ذاتية وتحقّقًا دون أي حلول بشرية. مفتوح المصدر تحت رخصة MIT.

  7. 2025

    OpenAI o1

    نموذج الاستدلال من OpenAI ونقطة المقارنة الرئيسية. قوي لكنه مغلق المصدر ومكلّف. DeepSeek-R1 يُكافئه أو يتفوّق عليه في معظم معايير الاستدلال.

المرجعDeepSeek-AI et al.. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv / Nature, 2025.

مصطلحات هذه الورقة