نظرية المعلومات1951متوسط8 دقيقة قراءة
في المعلومات والكفاية الإحصائية
On Information and Sufficiency
Kullback, S. · Leibler, R. A. — Annals of Mathematical Statistics
المشكلة
بحلول 1951 كان شانون قد أسّس مفهوم الإنتروبيا — الحد الأدنى من البتات لترميز رسالة — لكن ظلّ سؤال مفتوح: إذا استخدمنا توزيعاً احتمالياً تقريبياً بدل التوزيع الحقيقي، كم نخسر من معلومات؟ كان الإحصائيون بحاجة إلى مقياس رياضي صارم يجيب عن سؤالين: ما مقدار الفجوة بين نموذجي والواقع؟ ومتى يحتفظ ملخّص للبيانات — الإحصاءة الكافية — بكامل المعلومات الموجودة في البيانات الأصلية؟
الإسهام
قدّم كولباك ولايبلر مقياساً يُعرف اليوم (أو الإنتروبيا النسبية). الفكرة بسيطة: إذا كانت البيانات تأتي فعلياً من توزيع P لكنك صمّمت ترميزك على أساس توزيع Q، فكم بتّاً إضافياً ستحتاج في المتوسط؟ أثبت الباحثان أن هذا المقياس لا يكون سالباً أبداً (متراجحة غيبس)، ولا يساوي صفراً إلا حين يتطابق التوزيعان تماماً. ثم ربطاه بمفهوم الكفاية: الإحصاءة تكون كافية إذا وفقط إذا حافظت على كامل KL بين أي فرضيتين. بذلك وحّدا نظرية المعلومات والكفاية الإحصائية في إطار رياضي واحد.
الأثر
أصبح تباعد KL من أكثر الأدوات الرياضية حضوراً في الذكاء الاصطناعي الحديث. نجده أساساً لدالة خسارة الإنتروبيا التقاطعية في مهام ، ومُنظِّماً في بنية VAE، ودالةَ هدفٍ في t-SNE لتصوير البيانات، ومكوِّناً محورياً في RLHF لمواءمة النماذج اللغوية الكبيرة، وأساساً نظرياً لمعايير اختيار النماذج كمعيار أكايكي (AIC). عملياً، كلّما قاس نظام تعلّم آلي الفجوة بين توزيع مُتعلَّم وتوزيع مُستهدَف، فغالباً تباعد KL موجود في الخلفية.
تخيّل أنك تقرّر كل صباح هل تأخذ مظلة معك أم لا، بناءً على نشرة الطقس. لو كانت النشرة دقيقة تماماً، فقراراتك ستكون مثالية — مظلة أيام المطر، ولا شيء أيام الشمس. لكن لو أخبرتك النشرة أن احتمال المطر 10% بينما الحقيقة 60%، فستُفاجأ بالمطر مراراً.
تباعد كولباك-لايبلر يقيس بالضبط هذا النوع من الكُلفة: كم «مفاجأة إضافية» تتحمّلها — في المتوسط — لأن النمط الذي استعددت له لا يطابق الواقع. الموضوع ليس عن يوم واحد بل عن الثمن التراكمي لاعتمادك على احتمالي خاطئ.
حين يكون التباعد صفراً فتوقّعك هو الواقع. وكلما زاد التباعد، زاد عدد المرّات التي تتبلّل فيها.
السؤال المحوري: كم يبعد نموذجي عن الواقع؟
في 1948 أثبت كلود شانون أن أي مصدر يُنتج رموزاً وفق توزيع P يحتاج على الأقل إلى بتّ لكل رمز في المتوسط — وهذا ما نسمّيه . السؤال الطبيعي هنا: ماذا يحصل لو لم نكن نعرف التوزيع الحقيقي P وصمّمنا ترميزنا بناءً على توزيع آخر Q؟ الإجابة أننا سنحتاج إلى بتّ لكل رمز، وهذه الكمّية تُسمى ، وهي دائماً أكبر من أو تساوي .
الفرق هو البتات المُهدرة — أي الثمن الذي ندفعه لأننا اعتمدنا على الخاطئ. ما فعله كولباك ولايبلر هو صياغة هذا الفرق كمقياس رياضي متكامل بخصائص دقيقة، وبذلك وصلا بين نظرية المعلومات لشانون من جهة، والإحصاء الكلاسيكي واختبار الفرضيات من جهة أخرى.
الصيغة الرياضية: قياس ضياع المعلومات
قبل الصيغة، لنبنِ الفكرة خطوة بخطوة. لكل نتيجة ممكنة x اسأل نفسك: كم زادت «مفاجأتي» لأنني اعتمدت على Q بدلاً من P؟ ثم اضرب هذه المفاجأة الزائدة في حدوث x فعلاً وفق P. بعد ذلك اجمع كل القيم. المجموع الناتج هو تباعد كولباك-لايبلر — متوسط المفاجأة المُهدرة عبر جميع النتائج.
حين نتعامل مع توزيعات متصلة، يتحوّل المجموع إلى : ، حيث و دالّتا الكثافة الاحتمالية. التفسير يبقى نفسه تماماً: متوسط المعلومات الإضافية لكل عيّنة.
الخصائص: ما يفعله تباعد KL وما لا يفعله
لـتباعد KL أربع خصائص يحتاج كل ممارس أن يستوعبها:
-
لا يكون سالباً أبداً. دائماً. هذه متراجحة غيبس، ومعناها البديهي أنك لا تربح شيئاً من استخدام التوزيع الخاطئ — بل تخسر فقط.
-
الصفر يعني تطابقاً تاماً. إذا وفقط إذا تطابق و في كل مكان تقريباً. بمعنى آخر: لا تختفي الكُلفة إلا حين يكون نموذجك مطابقاً للواقع.
-
غير متناظر. بشكل عام. وهذه نقطة جوهرية: تباعد KL ليس مسافة بالمعنى الرياضي الدقيق. كُلفة تقريب P بواسطة Q تختلف عن كُلفة تقريب Q بواسطة P.
-
يتجزّأ على المتغيرات المستقلة. إذا كان التوزيعان مُركَّبين من مكوّنات مستقلة عن بعضها، فالتباعد الكلي يساوي مجموع تباعدات المكوّنات المنفردة.
التباعد الأمامي مقابل العكسي: تغطية القمم أم ملاحقتها؟
لهذا اللاتناظر حدس بصري قوي. تخيّل أن P مزيج من توزيعين غاوسيين — أي منحنى بقمّتين — وQ توزيع غاوسي بقمة واحدة فقط.
التباعد الأمامي : يُعاقَب Q بشدة أينما كان P موجوداً لكن Q غائباً. النتيجة؟ يتمدّد Q ليُغطّي القمتين معاً، حتى لو ملأ الوادي الفارغ بينهما باحتمال لا معنى له. هذا ما نسمّيه سلوك تغطية القمم (mode-covering).
التباعد العكسي : يُعاقَب Q أينما وضع احتمالاً لكن P هناك صفري. النتيجة؟ ينكمش Q ويتركّز على قمة واحدة ويتجاهل الأخرى كلياً — لا يريد أن يضع احتمالاً في مكان فارغ. هذا سلوك ملاحقة القمة (mode-seeking).
فهم هذا الفرق ضروري حين تختار المناسبة، سواء في أو الاستدلال التبايُني أو تحسين في .
الكفاية الإحصائية: حين يحفظ الملخّص كل المعلومات
النصف الثاني من الورقة يربط تباعد KL بمفهوم الكفاية الإحصائية. والفكرة بسيطة: الإحصاءة الكافية هي ملخَّص للبيانات يحتفظ بكل ما يلزم للتمييز بين الفرضيات، دون أن يُضيّع أي معلومة مفيدة.
فكّر في الأمر كضغط صورة. الضغط ذو الفاقد يرمي تفاصيل لن تسترجعها. أما الضغط «الكافي» فلا يرمي إلا — كل جزء حقيقي من الإشارة يبقى سليماً. بلغة رياضية: الإحصاءة تكون كافية للتمييز بين و إذا وفقط إذا كان . بمعنى أن ضغط البيانات عبر لا يُنقص التباعد — أي لا تضيع معلومات.
تباعد KL في التعلم الآلي الحديث
تباعد KL حاضر — أحياناً بشكل صريح وأحياناً مُتخفٍّ — في معظم زوايا الحديث:
-
الإنتروبيا التقاطعية كدالة خسارة. حين تُصغّر الإنتروبيا التقاطعية بين التصنيفات الحقيقية وتوقّعات النموذج، فأنت عملياً تُصغّر تباعد KL. كل مُصنِّف درّبته يقوم على هذا المبدأ.
-
(VAE). دالة خسارته تتكوّن من حدّين: خسارة إعادة البناء، وحدّ الذي يدفع نحو التوزيع الأوّلي. هذا الحدّ تحديداً هو ما يجعل منتظماً وقابلاً للتوليد.
-
t-SNE. تُصغّر هذه الخوارزمية تباعد KL بين احتمالات الجوار في الأبعاد العالية وما يقابلها في الأبعاد المنخفضة. هذه الكُلفة غير المتناظرة هي السبب في أن t-SNE يحفظ البنية المحلية لكنه لا يضمن البنية الشاملة.
-
(RLHF). يُضاف حدّ عقوبة KL ليمنع السياسة المضبوطة من الانحراف كثيراً عن النموذج الأساسي، فيُحقّق توازناً بين تحسين الأداء والحفاظ على الاستقرار.
الفكرة ذاتها في شيفرة برمجية
مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.
import numpy as np
def kl_divergence(p, q):
"""حساب D_KL(P || Q) لتوزيعات منفصلة P وQ.
كلاهما يجب أن يكون مصفوفة احتمالات مجموعها 1."""
p = np.asarray(p, dtype=float)
q = np.asarray(q, dtype=float)
# نجمع فقط حيث p > 0 (بالاتفاق 0 × log(0) = 0)
mask = p > 0
return np.sum(p[mask] * np.log(p[mask] / q[mask]))
def cross_entropy(p, q):
"""H(P, Q) = H(P) + D_KL(P || Q)."""
p = np.asarray(p, dtype=float)
q = np.asarray(q, dtype=float)
mask = p > 0
return -np.sum(p[mask] * np.log(q[mask]))
# مثال: عملة عادلة P مقابل عملة منحازة Q
P = np.array([0.5, 0.5]) # التوزيع الحقيقي
Q = np.array([0.9, 0.1]) # نموذجنا الخاطئ
print(f"H(P) = {-np.sum(P * np.log(P)):.4f} nات")
print(f"H(P, Q) = {cross_entropy(P, Q):.4f} نات")
print(f"D_KL(P||Q) = {kl_divergence(P, Q):.4f} نات") # الفجوة
print(f"D_KL(Q||P) = {kl_divergence(Q, P):.4f} نات") # مختلف!لماذا غيَّر كل شيء
1948
إنتروبيا شانون
كلود شانون يُعرّف إنتروبيا المعلومات — الحد الأدنى من البتات لترميز مصدر. الأساس الرياضي الذي سيُبنى عليه تباعد KL لاحقاً.
1951
تباعد كولباك-لايبلر
كولباك ولايبلر يصوغان الإنتروبيا النسبية ويُثبتان نظرية الكفاية. سبع صفحات فقط أطلقت عقوداً من الأبحاث.
1974
معيار أكايكي المعلوماتي (AIC)
أكايكي يبني معياره الشهير لاختيار النماذج على أساس تباعد KL — الفكرة أن النموذج الأفضل هو الأقرب إلى التوزيع الحقيقي.
2006
الجذور المفاهيمية للمرمّز التلقائي المتغيّر
أساليب الاستدلال التبايُني المبنية على تباعد KL تنضج. حدّ KL يترسّخ كمُنظِّم أساسي في نماذج المتغيرات الكامنة.
2008
t-SNE
فان دير ماتن وهنتون يستخدمان تباعد KL لتصوير البيانات العالية الأبعاد مع الحفاظ على علاقات الجوار. أكثر ورقة تصوير بيانات استشهاداً في التعلم الآلي.
2014
نشر المرمّز التلقائي المتغيّر
كينغما ووِلينغ ينشران بنية VAE، حيث يلعب تباعد KL دور المُنظِّم الصريح الذي يُبقي الفضاء الكامن منتظماً وقابلاً للتوليد.
2017
PPO والتعلم المعزّز بعقوبة KL
خوارزمية PPO تستخدم قيد KL لضمان استقرار تحديثات السياسة. لاحقاً يتبنّى RLHF للنماذج اللغوية نفس المبدأ.
2022
RLHF في ChatGPT
عقوبة تباعد KL تصبح أداة محورية في مواءمة النماذج اللغوية الكبيرة — ورقة إحصائية من 1951 تُشكّل الآن ملامح أبحاث أمان الذكاء الاصطناعي.
من ورقة بسبع صفحات في حوليّات الإحصاء الرياضي إلى قلب دالة الخسارة في كل نموذج لغوي كبير — تباعد كولباك-لايبلر هو الخيط الذي يصل نظرية المعلومات لشانون بمفهوم الكفاية عند فيشر وصولاً إلى ثورة التعلم العميق. في كل مرة يتعلّم نموذج، فهو — بشكل ما — يُغلق فجوة KL.
المرجعKullback, Leibler. On Information and Sufficiency. Annals of Mathematical Statistics, 1951.
مصطلحات هذه الورقة
- تباعد KLKL Divergence
- العشوائية الدلاليةEntropy
- العشوائية المتقاطعةCross Entropy
- التوزيع الإحصائيDistribution
- التباعدDivergence
- الأرجحيةLikelihood
- المعلومات المتبادلةMutual Information
- الاحتماليةProbability
- الكسب المعلوماتيInformation Gain
- الإحصاء الكافيSufficient Statistic