نظرية المعلومات1951متوسط8 دقيقة قراءة

في المعلومات والكفاية الإحصائية

On Information and Sufficiency

Kullback, S. · Leibler, R. A. — Annals of Mathematical Statistics

المشكلة

بحلول 1951 كان شانون قد أسّس مفهوم الإنتروبيا — الحد الأدنى من البتات لترميز رسالة — لكن ظلّ سؤال مفتوح: إذا استخدمنا توزيعاً احتمالياً تقريبياً بدل التوزيع الحقيقي، كم نخسر من معلومات؟ كان الإحصائيون بحاجة إلى مقياس رياضي صارم يجيب عن سؤالين: ما مقدار الفجوة بين نموذجي والواقع؟ ومتى يحتفظ ملخّص للبيانات — الإحصاءة الكافية — بكامل المعلومات الموجودة في البيانات الأصلية؟

الإسهام

قدّم كولباك ولايبلر مقياساً يُعرف اليوم (أو الإنتروبيا النسبية). الفكرة بسيطة: إذا كانت البيانات تأتي فعلياً من توزيع P لكنك صمّمت ترميزك على أساس توزيع Q، فكم بتّاً إضافياً ستحتاج في المتوسط؟ أثبت الباحثان أن هذا المقياس لا يكون سالباً أبداً (متراجحة غيبس)، ولا يساوي صفراً إلا حين يتطابق التوزيعان تماماً. ثم ربطاه بمفهوم الكفاية: الإحصاءة تكون كافية إذا وفقط إذا حافظت على كامل KL بين أي فرضيتين. بذلك وحّدا نظرية المعلومات والكفاية الإحصائية في إطار رياضي واحد.

الأثر

أصبح تباعد KL من أكثر الأدوات الرياضية حضوراً في الذكاء الاصطناعي الحديث. نجده أساساً لدالة خسارة الإنتروبيا التقاطعية في مهام ، ومُنظِّماً في بنية VAE، ودالةَ هدفٍ في t-SNE لتصوير البيانات، ومكوِّناً محورياً في RLHF لمواءمة النماذج اللغوية الكبيرة، وأساساً نظرياً لمعايير اختيار النماذج كمعيار أكايكي (AIC). عملياً، كلّما قاس نظام تعلّم آلي الفجوة بين توزيع مُتعلَّم وتوزيع مُستهدَف، فغالباً تباعد KL موجود في الخلفية.

تخيّل أنك تقرّر كل صباح هل تأخذ مظلة معك أم لا، بناءً على نشرة الطقس. لو كانت النشرة دقيقة تماماً، فقراراتك ستكون مثالية — مظلة أيام المطر، ولا شيء أيام الشمس. لكن لو أخبرتك النشرة أن احتمال المطر 10% بينما الحقيقة 60%، فستُفاجأ بالمطر مراراً.

تباعد كولباك-لايبلر يقيس بالضبط هذا النوع من الكُلفة: كم «مفاجأة إضافية» تتحمّلها — في المتوسط — لأن النمط الذي استعددت له لا يطابق الواقع. الموضوع ليس عن يوم واحد بل عن الثمن التراكمي لاعتمادك على احتمالي خاطئ.

حين يكون التباعد صفراً فتوقّعك هو الواقع. وكلما زاد التباعد، زاد عدد المرّات التي تتبلّل فيها.

السؤال المحوري: كم يبعد نموذجي عن الواقع؟

في 1948 أثبت كلود شانون أن أي مصدر يُنتج رموزاً وفق توزيع P يحتاج على الأقل إلى H(P)H(P) بتّ لكل رمز في المتوسط — وهذا ما نسمّيه . السؤال الطبيعي هنا: ماذا يحصل لو لم نكن نعرف التوزيع الحقيقي P وصمّمنا ترميزنا بناءً على توزيع آخر Q؟ الإجابة أننا سنحتاج إلى H(P,Q)H(P, Q) بتّ لكل رمز، وهذه الكمّية تُسمى ، وهي دائماً أكبر من أو تساوي H(P)H(P).

الفرق H(P,Q)H(P)H(P, Q) - H(P) هو البتات المُهدرة — أي الثمن الذي ندفعه لأننا اعتمدنا على الخاطئ. ما فعله كولباك ولايبلر هو صياغة هذا الفرق كمقياس رياضي متكامل بخصائص دقيقة، وبذلك وصلا بين نظرية المعلومات لشانون من جهة، والإحصاء الكلاسيكي واختبار الفرضيات من جهة أخرى.

افتح في المختبر
حرّك شريط Q لتغيير التوزيع التقريبي، ولاحظ كيف تتّسع فجوة الإنتروبيا التقاطعية كلّما ابتعد Q عن P.
تستيقظ التجربة عند وصولك…

الصيغة الرياضية: قياس ضياع المعلومات

قبل الصيغة، لنبنِ الفكرة خطوة بخطوة. لكل نتيجة ممكنة x اسأل نفسك: كم زادت «مفاجأتي» لأنني اعتمدت على Q بدلاً من P؟ ثم اضرب هذه المفاجأة الزائدة في حدوث x فعلاً وفق P. بعد ذلك اجمع كل القيم. المجموع الناتج هو تباعد كولباك-لايبلر — متوسط المفاجأة المُهدرة عبر جميع النتائج.

DKL(PQ)=xP(x)logP(x)Q(x)D_{\text{KL}}(P \| Q) = \sum_{x} P(x) \log \frac{P(x)}{Q(x)}
تباعد كولباك-لايبلر — ثمن استخدام التوزيع الخاطئP(x) = الاحتمال الحقيقي لحدوث x · log P(x)/Q(x) = المفاجأة الإضافية لكل حدث · المجموع = متوسط المفاجأة الإضافية عبر جميع الأحداث.

حين نتعامل مع توزيعات متصلة، يتحوّل المجموع إلى : DKL(PQ)=p(x)logp(x)q(x)dxD_{\text{KL}}(P \| Q) = \int p(x) \log \frac{p(x)}{q(x)} \, dx، حيث pp وqq دالّتا الكثافة الاحتمالية. التفسير يبقى نفسه تماماً: متوسط المعلومات الإضافية لكل عيّنة.

افتح في المختبر
عدّل التوزيعين P وQ وراقب حساب تباعد KL لحظياً. لاحظ أنه غير متناظر — أي أن D(P‖Q) ≠ D(Q‖P).
تستيقظ التجربة عند وصولك…

الخصائص: ما يفعله تباعد KL وما لا يفعله

لـتباعد KL أربع خصائص يحتاج كل ممارس أن يستوعبها:

  • لا يكون سالباً أبداً. DKL(PQ)0D_{\text{KL}}(P \| Q) \geq 0 دائماً. هذه متراجحة غيبس، ومعناها البديهي أنك لا تربح شيئاً من استخدام التوزيع الخاطئ — بل تخسر فقط.

  • الصفر يعني تطابقاً تاماً. DKL(PQ)=0D_{\text{KL}}(P \| Q) = 0 إذا وفقط إذا تطابق PP وQQ في كل مكان تقريباً. بمعنى آخر: لا تختفي الكُلفة إلا حين يكون نموذجك مطابقاً للواقع.

  • غير متناظر. DKL(PQ)DKL(QP)D_{\text{KL}}(P \| Q) \neq D_{\text{KL}}(Q \| P) بشكل عام. وهذه نقطة جوهرية: تباعد KL ليس مسافة بالمعنى الرياضي الدقيق. كُلفة تقريب P بواسطة Q تختلف عن كُلفة تقريب Q بواسطة P.

  • يتجزّأ على المتغيرات المستقلة. إذا كان التوزيعان مُركَّبين من مكوّنات مستقلة عن بعضها، فالتباعد الكلي يساوي مجموع تباعدات المكوّنات المنفردة.

افتح في المختبر
بدّل بين D(P‖Q) وD(Q‖P) لتشاهد اللاتناظُر عملياً. القيمتان قد تكونان مختلفتين اختلافاً كبيراً.
تستيقظ التجربة عند وصولك…

التباعد الأمامي مقابل العكسي: تغطية القمم أم ملاحقتها؟

لهذا اللاتناظر حدس بصري قوي. تخيّل أن P مزيج من توزيعين غاوسيين — أي منحنى بقمّتين — وQ توزيع غاوسي بقمة واحدة فقط.

التباعد الأمامي D(PQ)D(P \| Q): يُعاقَب Q بشدة أينما كان P موجوداً لكن Q غائباً. النتيجة؟ يتمدّد Q ليُغطّي القمتين معاً، حتى لو ملأ الوادي الفارغ بينهما باحتمال لا معنى له. هذا ما نسمّيه سلوك تغطية القمم (mode-covering).

التباعد العكسي D(QP)D(Q \| P): يُعاقَب Q أينما وضع احتمالاً لكن P هناك صفري. النتيجة؟ ينكمش Q ويتركّز على قمة واحدة ويتجاهل الأخرى كلياً — لا يريد أن يضع احتمالاً في مكان فارغ. هذا سلوك ملاحقة القمة (mode-seeking).

فهم هذا الفرق ضروري حين تختار المناسبة، سواء في أو الاستدلال التبايُني أو تحسين في .

افتح في المختبر
بدّل بين التباعد الأمامي والعكسي. راقب كيف يتغير شكل Q من تغطية القمم (انتشار واسع) إلى ملاحقة القمة (انكماش على قمة واحدة).
تستيقظ التجربة عند وصولك…

الكفاية الإحصائية: حين يحفظ الملخّص كل المعلومات

النصف الثاني من الورقة يربط تباعد KL بمفهوم الكفاية الإحصائية. والفكرة بسيطة: الإحصاءة الكافية هي ملخَّص للبيانات يحتفظ بكل ما يلزم للتمييز بين الفرضيات، دون أن يُضيّع أي معلومة مفيدة.

فكّر في الأمر كضغط صورة. الضغط ذو الفاقد يرمي تفاصيل لن تسترجعها. أما الضغط «الكافي» فلا يرمي إلا — كل جزء حقيقي من الإشارة يبقى سليماً. بلغة رياضية: الإحصاءة T(X)T(X) تكون كافية للتمييز بين PP وQQ إذا وفقط إذا كان DKL(PTQT)=DKL(PQ)D_{\text{KL}}(P_{T} \| Q_{T}) = D_{\text{KL}}(P \| Q). بمعنى أن ضغط البيانات عبر TT لا يُنقص التباعد — أي لا تضيع معلومات.

DKL(PXQX)DKL(PT(X)QT(X))D_{\text{KL}}(P_X \| Q_X) \geq D_{\text{KL}}(P_{T(X)} \| Q_{T(X)})
متراجحة معالجة البيانات — المعلومات لا تزداد أبداًأي دالة T(X) نُطبّقها على البيانات لا يمكنها إلا أن تُنقص التباعد أو تُبقيه كما هو — لا يمكنها زيادته أبداً. المساواة تتحقّق فقط حين تكون T إحصاءة كافية.
افتح في المختبر
انقر على كل خطوة ضغط لترى كيف يتغير التباعد. الإحصاءة الكافية تحفظه كاملاً؛ الملخَّص ذو الفاقد لا يفعل.
تستيقظ التجربة عند وصولك…

تباعد KL في التعلم الآلي الحديث

تباعد KL حاضر — أحياناً بشكل صريح وأحياناً مُتخفٍّ — في معظم زوايا الحديث:

  • الإنتروبيا التقاطعية كدالة خسارة. حين تُصغّر الإنتروبيا التقاطعية بين التصنيفات الحقيقية وتوقّعات النموذج، فأنت عملياً تُصغّر تباعد KL. كل مُصنِّف درّبته يقوم على هذا المبدأ.

  • (VAE). دالة خسارته تتكوّن من حدّين: خسارة إعادة البناء، وحدّ DKL(q(zx)p(z))D_{\text{KL}}(q(z|x) \| p(z)) الذي يدفع نحو التوزيع الأوّلي. هذا الحدّ تحديداً هو ما يجعل منتظماً وقابلاً للتوليد.

  • t-SNE. تُصغّر هذه الخوارزمية تباعد KL بين احتمالات الجوار في الأبعاد العالية وما يقابلها في الأبعاد المنخفضة. هذه الكُلفة غير المتناظرة هي السبب في أن t-SNE يحفظ البنية المحلية لكنه لا يضمن البنية الشاملة.

  • (RLHF). يُضاف حدّ عقوبة KL ليمنع السياسة المضبوطة من الانحراف كثيراً عن النموذج الأساسي، فيُحقّق توازناً بين تحسين الأداء والحفاظ على الاستقرار.

افتح في المختبر
انقر على كل تطبيق لترى كيف يظهر تباعد KL في دالة خسارته.
تستيقظ التجربة عند وصولك…

الفكرة ذاتها في شيفرة برمجية

تباعد KL لتوزيعات منفصلة، من الصفرpython

مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.

import numpy as np

def kl_divergence(p, q):
    """حساب D_KL(P || Q) لتوزيعات منفصلة P وQ.
    كلاهما يجب أن يكون مصفوفة احتمالات مجموعها 1."""
    p = np.asarray(p, dtype=float)
    q = np.asarray(q, dtype=float)

    # نجمع فقط حيث p > 0 (بالاتفاق 0 × log(0) = 0)
    mask = p > 0
    return np.sum(p[mask] * np.log(p[mask] / q[mask]))

def cross_entropy(p, q):
    """H(P, Q) = H(P) + D_KL(P || Q)."""
    p = np.asarray(p, dtype=float)
    q = np.asarray(q, dtype=float)
    mask = p > 0
    return -np.sum(p[mask] * np.log(q[mask]))

# مثال: عملة عادلة P مقابل عملة منحازة Q
P = np.array([0.5, 0.5])       # التوزيع الحقيقي
Q = np.array([0.9, 0.1])       # نموذجنا الخاطئ

print(f"H(P)        = {-np.sum(P * np.log(P)):.4f} nات")
print(f"H(P, Q)     = {cross_entropy(P, Q):.4f} نات")
print(f"D_KL(P||Q)  = {kl_divergence(P, Q):.4f} نات")   # الفجوة
print(f"D_KL(Q||P)  = {kl_divergence(Q, P):.4f} نات")   # مختلف!

لماذا غيَّر كل شيء

  1. 1948

    إنتروبيا شانون

    كلود شانون يُعرّف إنتروبيا المعلومات — الحد الأدنى من البتات لترميز مصدر. الأساس الرياضي الذي سيُبنى عليه تباعد KL لاحقاً.

  2. 1951

    تباعد كولباك-لايبلر

    كولباك ولايبلر يصوغان الإنتروبيا النسبية ويُثبتان نظرية الكفاية. سبع صفحات فقط أطلقت عقوداً من الأبحاث.

  3. 1974

    معيار أكايكي المعلوماتي (AIC)

    أكايكي يبني معياره الشهير لاختيار النماذج على أساس تباعد KL — الفكرة أن النموذج الأفضل هو الأقرب إلى التوزيع الحقيقي.

  4. 2006

    الجذور المفاهيمية للمرمّز التلقائي المتغيّر

    أساليب الاستدلال التبايُني المبنية على تباعد KL تنضج. حدّ KL يترسّخ كمُنظِّم أساسي في نماذج المتغيرات الكامنة.

  5. 2008

    t-SNE

    فان دير ماتن وهنتون يستخدمان تباعد KL لتصوير البيانات العالية الأبعاد مع الحفاظ على علاقات الجوار. أكثر ورقة تصوير بيانات استشهاداً في التعلم الآلي.

  6. 2014

    نشر المرمّز التلقائي المتغيّر

    كينغما ووِلينغ ينشران بنية VAE، حيث يلعب تباعد KL دور المُنظِّم الصريح الذي يُبقي الفضاء الكامن منتظماً وقابلاً للتوليد.

  7. 2017

    PPO والتعلم المعزّز بعقوبة KL

    خوارزمية PPO تستخدم قيد KL لضمان استقرار تحديثات السياسة. لاحقاً يتبنّى RLHF للنماذج اللغوية نفس المبدأ.

  8. 2022

    RLHF في ChatGPT

    عقوبة تباعد KL تصبح أداة محورية في مواءمة النماذج اللغوية الكبيرة — ورقة إحصائية من 1951 تُشكّل الآن ملامح أبحاث أمان الذكاء الاصطناعي.

من ورقة بسبع صفحات في حوليّات الإحصاء الرياضي إلى قلب دالة الخسارة في كل نموذج لغوي كبير — تباعد كولباك-لايبلر هو الخيط الذي يصل نظرية المعلومات لشانون بمفهوم الكفاية عند فيشر وصولاً إلى ثورة التعلم العميق. في كل مرة يتعلّم نموذج، فهو — بشكل ما — يُغلق فجوة KL.

المرجعKullback, Leibler. On Information and Sufficiency. Annals of Mathematical Statistics, 1951.

مصطلحات هذه الورقة