التعلم الذاتي الإشراف2021متوسط11 دقيقة قراءة
VICReg: تنظيم التباين والثبات والتغاير للتعلّم الذاتي الإشراف
VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learning
Bardes, A. · Ponce, J. · LeCun, Y. — ICLR 2022
المشكلة
تعتمد أساليب التعلّم الذاتي الإشراف القائمة على بنيات التضمين المشترك على تدريب شبكتين لإنتاج تمثيلات متشابهة لمناظر مختلفة من الصورة ذاتها. التحدّي المحوري هو انهيار التمثيل: يمكن للشبكتين أن تغشّا بإخراج متّجهات ثابتة لكل مدخل، فتحقّقان توافقاً تاماً دون تعلّم أي شيء مفيد. بحلول عام 2021 وُجدت حلول — خسائر تبايُنية تحتاج دُفعات ضخمة من الأزواج السلبية، ومرمِّزات زخم، ووقف للتدرّجات، وحيل في تسوية الدُّفعات — لكنها جميعاً اعتمدت على آليات ضمنية يصعب تفسيرها. لم يقدّم أيٌّ منها تفسيراً واضحاً ومبدئياً وقابلاً للتركيب يُبيّن لماذا يُمنع الانهيار.
الإسهام
يُقدّم VICReg دالة خسارة تتكوّن من ثلاثة حدود صريحة وقابلة للتفسير: حدّ (متوسط مربّع الخطأ بين التضمينات المُزدوجة)، وحدّ (خسارة مفصلية تُبقي الانحراف المعياري لكل بُعد تضمين فوق عتبة محدّدة)، وحدّ التغاير (معاقبة معاملات التغاير غير القُطرية لفكّ ارتباط الأبعاد). تمنع هذه الحدود معاً الانهيار الكامل (جميع المخرجات متطابقة) والانهيار المعلوماتي (الأبعاد تُرمّز المعلومة ذاتها بشكل مكرّر). يُحقّق VICReg أداءً مُكافئاً لأحدث الأساليب على ImageNet ومهام لاحقة دون الحاجة إلى مشاركة الأوزان أو مرمِّزات الزخم أو وقف التدرّجات أو دُفعات ضخمة أو تسوية على مستوى السمات — ما يجعله أكثر أساليب التعلّم الذاتي الإشراف مرونةً معمارية في عصره.
الأثر
أثبت VICReg أن منع الانهيار في التعلّم الذاتي الإشراف لا يتطلّب حيلاً معمارية — يكفي تنظيم صريح وبسيط. تمّ تبنّي حدّ التباين في أساليب أخرى مثل BYOL وSimSiam لتحسين الاستقرار. وأتاح تصميم الخسارة القابل للتركيب توسيعات متعددة الوسائط — كإقران الصورة بالنص أو الصوت بالطيف الترددي — لأن الفروع لا تحتاج لتشارك البنية. أثّرت مبادئ VICReg مباشرةً في DINOv2 الذي وسّع الرؤية الذاتية الإشراف إلى مستوى النماذج الأساسية. ووضوح الورقة المفاهيمي — تسمية أنماط الإخفاق الثلاثة وحلّ كلٍّ منها بحدّ واحد — أصبح نموذجاً يُحتذى في تصميم أهداف التعلّم الذاتي الإشراف.
تخيّل أوركسترا يُطلب من كل عازف فيها أن يعزف اللحن ذاته من توزيع مختلف للنوتة الموسيقية. ثلاثة أشياء قد تسوء: (1) يعزف الجميع نوتة واحدة إلى الأبد — انهيار. (2) يعزفون اللحن بشكل صحيح لكن كل آلة تُصدر الصوت نفسه — تكرار. (3) يعزفون نوتات مختلفة لكنهم يختلفون على اللحن — غياب الثبات.
VICReg هو قائد الأوركسترا الذي يفرض ثلاث قواعد: اعزفوا اللحن ذاته (الثبات)، كل آلة يجب أن تُصدر صوتاً فعلاً (التباين)، وكل آلة تعزف دورها الخاص ولا تنسخ جارتها (التغاير). بهذه القواعد الثلاث تُقدّم الأوركسترا عرضاً غنياً ومتناغماً — دون حاجة لأن يراقب أحدٌ أحداً.
مشكلة الانهيار: لماذا لا يكفي الاتفاق وحده
يعمل التعلّم الذاتي الإشراف الحديث للصور بإنشاء منظورين من الصورة نفسها — عادةً عبر اقتصاص عشوائي وتغييرات في اللون وتشويش ضبابي — ثم تدريب مرمِّز لإنتاج تمثيلات متشابهة لكلا المنظورين. الحدس سليم: إذا أنتج قصّان من الصورة ذاتها تضمينات متقاربة، فلا بد أن المرمِّز يلتقط المحتوى الدلالي لا التفاصيل الخاصة بالقصّ.
لكن هناك اختصار مدمِّر. لو أخرج المرمِّز المتّجه الثابت ذاته لكل مدخل، يصبح التشابه بين المنظورين مثالياً — مسافة صفرية. تُصغَّر الخسارة ويرضى المُحسِّن والتمثيلات عديمة الفائدة تماماً. هذا هو انهيار التمثيل.
في الواقع ثمة شكلان من الانهيار. الانهيار الكامل هو أن تتقارب جميع المخرجات نحو نقطة واحدة — كل صورة تُنتج المتّجه ذاته. أما الانهيار المعلوماتي فأكثر خفاءً: المتّجهات تتغيّر لكن جميع أبعادها تحمل المعلومة نفسها، كأن متّجهاً من 8192 بُعداً لا يملك فعلياً سوى درجة حرية واحدة. كلا الشكلين قاتل للمهام اللاحقة.
قبل VICReg انقسمت الحلول إلى معسكرين. الأساليب التبايُنية مثل SimCLR أضافت قوة طاردة: ادفع تضمينات الصور المختلفة بعيداً عن بعضها. هذا ينجح لكنه يحتاج دُفعات ضخمة من الأزواج السلبية — مُكلفة في الذاكرة والحساب. أما الحيل المعمارية مثل مرمِّز الزخم في BYOL أو وقف التدرّج في SimSiam فقد تجنّبت الانهيار عبر انحيازات ضمنية، لكن لم يفهم أحد تماماً لماذا تعمل. كلا النهجين ربط منع الانهيار بخيارات معمارية محدّدة فقيّد المرونة.
طرح VICReg سؤالاً مختلفاً: هل يمكننا منع الانهيار بشكل صريح — بحدود تنظيم واضحة ذات معانٍ قابلة للتفسير — دون تقييد البنية المعمارية؟
بنية VICReg: المرمِّز والموسِّع ومنظوران
يستخدم VICReg بنية تضمين مشترك ذات فرعين. لكل فرع جزءان: مرمِّز (عادةً ResNet-50) يُنتج التمثيلات ، وموسِّع (شبكة MLP من 3 طبقات بأبعاد 8192) يُحوّل التمثيلات إلى تضمينات حيث تعمل دالة الخسارة.
تسير عملية التدريب ببساطة. لصورة معطاة، يُولّد تحويلان عشوائيان و منظورين و. يمر كل منظور عبر المرمِّز ثم الموسِّع فيُنتج التضمين و. تُحسب خسارة VICReg على و.
بعد انتهاء التدريب المسبق يُستبعَد الموسِّع. تُستخدم تمثيلات المرمِّز وحدها في المهام اللاحقة. ودور الموسِّع هو توفير فضاء أعلى بُعداً يُمكّن بين الأبعاد من تقليل التبعيّات (لا الارتباطات الخطية فحسب) في متّجهات التمثيل بشكل أفعل.
حدود الخسارة الثلاثة: التباين والثبات والتغاير
تتكوّن دالة خسارة VICReg من مجموع ثلاثة حدود، يمنع كلٌّ منها نمط إخفاق محدّداً. تخيّلها ثلاثة حرّاس، يراقب كلٌّ منهم نوعاً مختلفاً من الغشّ. ليكن دُفعة من تضمين بأبعاد ، و يُمثّل متّجه جميع القيم عند البُعد عبر الدُّفعة.
الحدّ الأول — الثبات (s): يجب أن يتّفق التضمينان المُقترنان. هذا أبسط الحدود: يُصغّر متوسط مربّع الخطأ بين تضمينات منظورين لنفس الصورة. بدون هذا الحدّ لن يكون لدى الشبكة سبب لتعلّم أي شيء عن المدخل.
الحدّ الثاني — التباين (v): كل بُعد يجب أن يبقى حيّاً. هذا هو الإسهام الأساسي لـVICReg. لكل بُعد في التضمين يُحسَب الانحراف المعياري عبر الدُّفعة. إذا هبط عن قيمة مستهدفة ، تُفعَّل عقوبة. إنها خسارة مفصلية — لا عقوبة حين يكون الانحراف المعياري فوق العتبة بالفعل.
لماذا الانحراف المعياري وليس التباين؟ لأنه حين تقترب التضمينات من الانهيار (كل القيم قريبة من المتوسط)، يقترب التباين من الصفر وتدرُّجه أيضاً يقترب من الصفر — فلا يستطيع المُحسِّن الدفع عكسياً. أما الانحراف المعياري فتدرُّجه أشدّ انحداراً بالقرب من الصفر، ما يمنح المُحسِّن سرعة الإفلات التي يحتاجها.
الحدّ الثالث — التغاير (c): يجب ألّا تنسخ الأبعاد بعضها. حتى لو امتلك كل بُعد تبايناً عالياً، تبقى التمثيلات عديمة الفائدة إذا تحرّكت جميع الأبعاد معاً — فيصبح التضمين ذو الـ8192 بُعداً أحادي البُعد فعلياً. يُعاقب حدّ التغاير المعاملات غير القُطرية في مصفوفة التغاير، دافعاً الارتباطات بين الأبعاد المختلفة نحو الصفر.
تجميع الأجزاء: هدف VICReg الكامل
تجمع الخسارة الكلية بين الحدود الثلاثة بمعاملات ترجيح. والنقطة الجوهرية أن حدّي التباين والتغاير يُطبَّقان على كل فرع بشكل مستقل — وليس عبر الفروع. هذا الاستقلال هو ما يُتيح لـVICReg العمل ببنيات مختلفة تماماً بل وبأنماط مدخلات مختلفة على كل فرع.
مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.
# z_a, z_b: تضمينات [N, D] من منظورين مُعزَّزين
# --- خسارة الثبات ---
sim_loss = mse_loss(z_a, z_b)
# --- خسارة التباين ---
std_a = torch.sqrt(z_a.var(dim=0) + 1e-4)
std_b = torch.sqrt(z_b.var(dim=0) + 1e-4)
var_loss = torch.mean(F.relu(1 - std_a)) + torch.mean(F.relu(1 - std_b))
# --- خسارة التغاير ---
z_a = z_a - z_a.mean(dim=0) # توسيط
z_b = z_b - z_b.mean(dim=0)
cov_a = (z_a.T @ z_a) / (N - 1)
cov_b = (z_b.T @ z_b) / (N - 1)
cov_loss = off_diagonal(cov_a).pow(2).sum() / D + off_diagonal(cov_b).pow(2).sum() / D
# --- الخسارة الكلية ---
loss = 25 * sim_loss + 25 * var_loss + 1 * cov_lossما لا يحتاجه VICReg: الحرية المعمارية
معظم أساليب التعلّم الذاتي الإشراف في ذلك الوقت تطلّبت قيداً معمارياً واحداً على الأقل لمنع الانهيار. SimCLR يحتاج دُفعات ضخمة من الأزواج السلبية. BYOL يحتاج مرمِّز زخم — نسخة من الشبكة تتعقّب أوزانها ببطء أوزان المرمِّز الرئيسي. SimSiam يحتاج عملية وقف تدرّج على أحد الفروع. Barlow Twins يحتاج تسوية الدُّفعة للتضمينات قبل حساب الارتباطات المتبادلة. SwAV يحتاج خطوة تجميع آنية مع موازنة Sinkhorn-Knopp.
VICReg لا يحتاج أيّاً من هذا. لأن التباين والتغاير يُحسبان على كل فرع بشكل مستقل، يمكن للفرعين أن يمتلكا بنيتين مختلفتين وأوزاناً مختلفة بل ويعالجا أنماط مدخلات مختلفة (صور على فرع ونصوص أو صوت على الآخر). هذه الوِحدوية هي الميزة العملية الأهم لـVICReg.
العلاقة بـBarlow Twins: جذور مشتركة وفلسفة مختلفة
يستعير VICReg آلية فكّ ارتباط التغاير من Barlow Twins. كلاهما يُعاقب المعاملات غير القُطرية في مصفوفة شبيهة بالتغاير. لكنهما يختلفان في نقطة جوهرية.
يحسب Barlow Twins مصفوفة ارتباط متبادل بين تضمينات الفرعين ثم يدفعها نحو مصفوفة الوحدة. لهذا نتيجتان: القطر (الأبعاد المتطابقة عبر الفرعين) يجب أن يساوي 1، والعناصر غير القُطرية (الأبعاد المختلفة) يجب أن تساوي 0. التسوية اللازمة لجعل الارتباطات ذات معنى تربط الفرعين ببعضهما.
أما VICReg فيحسب مصفوفة التغاير لكل فرع على حدة، ويستخدم حدّ تباين منفصلاً لمنع الانكماش. هذا الفصل يعني أن الفرعين يمكن أن يمتلكا إحصاءات مخرجات مختلفة تماماً — وهي ميزة حاسمة في التعلّم متعدد الوسائط حيث تضمينات الصور وتضمينات النصوص تعيش بطبيعتها عند مقاييس مختلفة.
النتائج: منافسة دون حيل
يُحقّق VICReg دقة 73.2% بالمرتبة الأولى على تقييم ImageNet الخطي — مُطابقاً Barlow Twins تماماً وعلى بُعد أقل من 1% من BYOL (74.3%). في التقييم شبه الموجَّه بـ1% و10% من التسميات، يُطابق VICReg أو يتجاوز قليلاً Barlow Twins. وفي مهام النقل شاملةً تصنيف المشاهد في Places205 واكتشاف الأجسام في VOC07 وتقسيم النماذج في COCO، يبقى الأداء منافساً باستمرار.
النتيجة الأكثر كشفاً تخصّ التعلّم متعدد الوسائط. عند إقران الصور بتعليقات نصية على MS-COCO، يتفوّق VICReg على كلٍّ من الأساس التبايُني (VSE++) وBarlow Twins في مهام الاسترجاع — لأن تنظيم الفروع المستقل يتعامل مع الإحصاءات المختلفة لمرمِّزي الصور والنصوص بسلاسة أكبر.
اكتشاف آخر مهم: إضافة حدّ التباين من VICReg إلى BYOL حسّن أداءه بنسبة 0.9% عند 100 حقبة، ما يُشير إلى أن حتى الأساليب التي تمنع الانهيار ضمنياً تعاني من انكماش خفيّ في التباين يمكن لأرضية تباين صريحة أن تُصلحه.
خيارات التصميم الأساسية ودراسات الاستئصال
تُقدّم الورقة دراسات استئصال مُعمَّقة تكشف أيّ المكوّنات تهمّ حقاً. بدون تنظيم التباين تنهار التمثيلات فوراً بغض النظر عن المكوّنات الأخرى. بدون تنظيم التغاير تحقّق الشبكة 57.5% فقط — وظيفية لكن بعيدة عن المنافسة. كلاهما ضروري ولا يكفي أيٌّ منهما وحده.
لبُعد الموسِّع تأثير جذري: يرتفع الأداء من 55.9% عند بُعد 256 إلى 68.6% عند 8192 ويتشبّع حول 16384. هذا يؤكّد الحدس بأن فكّ الارتباط في فضاء أعلى بُعداً أفعل في تقليل التبعيّات.
VICReg متين أمام تغيّر حجم الدُّفعة: ينخفض الأداء 1.3% فقط عند تقليل حجم الدُّفعة من 2048 إلى 128 — ميزة كبيرة مقارنةً بالأساليب التبايُنية كـSimCLR التي تعتمد على مجموعات سلبية كبيرة داخل الدُّفعة. لا حاجة لأي تسوية للتضمينات: إزالة التوحيد أو تسوية l2 تُحسّن الأداء فعلياً، وهذا فريد بين أساليب التعلّم الذاتي الإشراف.
السياق والإرث: من التبايُن إلى التنظيم الصريح
2020
SimCLR و MoCo v2
الأساليب التبايُنية تُحقّق نتائج قوية لكنها تحتاج دُفعات ضخمة (SimCLR) أو بنوك ذاكرة (MoCo) لتوفير أزواج سلبية كافية.
2020
BYOL — بدون أزواج سلبية
BYOL يُثبت إمكانية تجنّب الانهيار دون أزواج سلبية باستخدام مرمِّز زخم ووقف التدرّج. لكن سبب نجاح هذا يظل غامضاً.
2021
Barlow Twins — هدف فكّ الارتباط
يقترح زبونتار وآخرون تقليل التكرار عبر الارتباط المتبادل لمنع الانهيار المعلوماتي. لكن الحساب العابر للفروع يُقيّد الاستخدام متعدد الوسائط.
2021
VICReg (هذه الورقة)
يُوحِّد باردِس وبونس ولوكون منع الانهيار في ثلاثة حدود صريحة وقابلة للتفسير. بدون قيود معمارية. متعدد الوسائط بالتصميم.
2023
DINOv2 — توسيع الرؤية الذاتية الإشراف
يبني DINOv2 من Meta AI على مبادئ VICReg لتدريب نماذج أساسية للرؤية على نطاق واسع تُنتج سمات بصرية عامة الغرض دون ضبط دقيق.
المرجعBardes, Ponce, LeCun. VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learning. ICLR, 2022.
مصطلحات هذه الورقة
- التعلم ذاتي الإشرافSelf-Supervised Learning
- انهيار التمثيلاتRepresentation Collapse
- التباينVariance
- التباين المشتركCovariance
- مصفوفة التباين المشتركCovariance Matrix
- الثباتInvariance
- فكّ الارتباطDecorrelation
- التكرار اللغويRedundancy
- التعلم التبايُنيContrastive Learning
- فضاء التضمينEmbedding Space
- رأس الإسقاطProjection Head
- البنية الأساسيةBackbone
- تعزيز البياناتData Augmentation
- خسارة المِفصلHinge Loss
- متوسط مربع الخطأMean Squared Error