الرؤية الحاسوبية2021متوسط11 دقيقة قراءة

SegFormer: تصميم بسيط وفعّال للتجزئة الدلالية باستخدام المحوِّلات

SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers

Xie, E. · Wang, W. · Yu, Z. · Anandkumar, A. · Alvarez, J. M. · Luo, P. — NeurIPS

المشكلة

بحلول 2021، كانت أساليب مثل SETR قد أثبتت أن المحوِّلات قادرة على التجزئة الدلالية، لكنها واجهت مشكلتين أساسيتين. المشكلة الأولى أن مرمِّزات ViT تستخرج سمات بمقياس واحد وبدقة مكانية منخفضة، فتضيع التفاصيل الدقيقة التي تحتاجها مهمة مثل كل بكسل. المشكلة الثانية أن هذه الأساليب تعتمد على مفكّكات معقدة متعددة المراحل وترميز موضعي ثابت ينهار فوراً حين تختلف دقة صور الاختبار عن صور . في المقابل، الشبكات الالتفافية مثل DeepLab وفّرت سمات متعددة المقاييس لكنها عاجزة عن التقاط السياق الشامل للمشهد. ما كان ينقص الميدان هو بنية تجمع قدرة المحوِّلات على الفهم الشامل مع كفاءة الشبكات الالتفافية في التعامل مع المقاييس المتعددة — دون أعباء أيٍّ منهما.

الإسهام

قدّم SegFormer إطاراً موحَّداً يجمع مرمِّز محوِّل هرمي (Mix Transformer / MiT) مع مفكّك خفيف مبني بالكامل على طبقات MLP. الإطار يتضمّن ثلاثة ابتكارات: (1) تضمينات رُقع متراكبة تحافظ على التواصل المكاني عبر حدود الرُّقع. (2) انتباه ذاتي فعّال يخفض التعقيد من O(N2)O(N^2) إلى O(N2/R)O(N^2/R) باختزال التسلسل. (3) شبكة Mix-FFN تستغني عن الثابت بوضع التفاف بعمق 3×33 \times 3 يُرمّز الموضع ضمنياً، فيصبح النموذج مستقلاً عن الدقة. النتيجة عائلة نماذج (B0–B5) تبدأ من 3.8 مليون معامل بسرعة 48 إطاراً/ثانية، وتصل إلى 84.7 مليون معامل بدقة 84.0% mIoU على Cityscapes — أصغر 5 مرات وأفضل بـ 2.2% من أقوى نتيجة سابقة على ADE20K.

الأثر

أثبت SegFormer أن التجزئة الدلالية بالمحوِّلات لا تحتاج مفكّكات معقدة ولا ترميزاً موضعياً ثابتاً ولا ميزانيات حوسبة ضخمة. صُنّف ضمن أكثر عشر ورقات تأثيراً في NeurIPS 2021 وأصبح مرجعاً أساسياً في أبحاث التجزئة الدلالية. تصميم مرمِّزه الهرمي أثّر في البنيات التي جاءت بعده، والنموذج مُستخدَم على نطاق واسع عبر مكتبة HuggingFace Transformers في تطبيقات تمتد من القيادة الذاتية إلى التصوير الطبي. فلسفة التصميم — أن البساطة ميزة وليست تنازلاً — غيّرت نظرة المجتمع البحثي إلى مهام بالمحوِّلات.

تخيّل أنك رسّام خرائط وطُلب منك تصنيف كل متر مربع في صورة أقمار اصطناعية: غابة، نهر، مبنى، طريق. أمامك خياران. الأول تلسكوب يرى السياق البعيد — «هذا الأخضر جزء من غابة تمتد لكيلومترات» — لكنه ثقيل وبطيء، وعدسته ثابتة لا تستطيع تقريبها أو إبعادها.

الخيار الثاني عدسة مكبّرة — سريعة وممتازة لقراءة لافتة شارع، لكنها لا تعرف هل هذا الشارع في مدينة أم في صحراء.

SegFormer يمنحك حلاً ثالثاً: أربع عدسات متداخلة كل واحدة ترى المشهد بمقياس مختلف، مع صينية مزج بسيطة تدمج ما تراه العدسات الأربع. لا تلسكوب ثقيل ولا عدسة ثابتة. النتيجة: رسّام خرائط سريع وخفيف يُصنّف كل بكسل بدقة.

التحدّي: تصنيف كل بكسل

مهمتها تعيين تصنيف لكل بكسل في الصورة — سماء، طريق، شخص، سيارة — بحيث لا يبقى بكسل واحد بلا تسمية. الفرق عن التصنيف العادي واضح: التصنيف يُجيب عن «ما الموجود في هذه الصورة؟»، أما التجزئة فتُجيب عن «أين يقع كل شيء بالضبط؟»

هذه المهمة تحتاج قدرتين متناقضتين. الأولى الدقة المحلية: النموذج يجب أن يلتقط الحدود الدقيقة — مثلاً أين ينتهي الرصيف بالضبط ويبدأ العشب. والثانية السياق الشامل: النموذج يحتاج أن يفهم المشهد ككل — فمنطقة بكسلات زرقاء قد تكون سماءً أو محيطاً بحسب ما يحيط بها.

الأساليب المبنية على مثل DeepLab وU-Net تتميّز في استخراج السمات المحلية بفضل الخاص بالالتفاف، لكنها تعجز عن التقاط العلاقات بعيدة المدى. في المقابل، أساليب مثل SETR تملك شاملاً وقوياً، لكنها تُخرج سمات بمقياس واحد وتعتمد على مفكّكات ثقيلة وترميز موضعي ثابت.

SegFormer يحلّ هذا التناقض بفلسفة تصميمية واحدة: البساطة هي الكفاءة.

افتح في المختبر
خط أنابيب SegFormer الكامل: مرمِّز هرمي يُنتج سمات متعددة المقاييس، ومفكّك MLP خفيف يدمجها في قناع تجزئة. انقر على المراحل لاستكشافها.
تستيقظ التجربة عند وصولك…

المرمِّز: محوِّل المزج (MiT)

قلب SegFormer هو المسمّى Mix Transformer أو MiT. الفرق الجوهري بينه وبين ViT أن ViT يعالج الصورة كاملة بدقة واحدة، بينما MiT مصمَّم كـهرم من أربع مراحل. كل مرحلة تعمل بدقة مكانية أقل من سابقتها — 1/4 ثم 1/8 ثم 1/16 ثم 1/32 من حجم الصورة الأصلية — مع زيادة عدد قنوات السمات في كل مرحلة.

تخيّل الأمر كمبنى من أربعة طوابق. الطابق الأرضي فيه غرف صغيرة كثيرة (دقة مكانية عالية، قنوات قليلة) تلتقط التفاصيل الدقيقة كالحواف والنسيج. كلما صعدت طابقاً وجدت غرفاً أقل لكنها أوسع (دقة أقل، قنوات أكثر) تلتقط الأنماط الدلالية الأشمل. أما المصعد الذي ينقلك بين الطوابق فهو المتراكبة بخطوة يقوم بتصغير الدقة وإعادة التضمين في آن واحد.

كل طابق يحتوي على كتل محوِّل فيها ابتكاران أساسيان: الفعّال وMix-FFN. هذان الابتكاران يحلّان محل الانتباه الذاتي المعياري وطبقات التغذية الأمامية بنسختين مصمَّمتين خصيصاً لمهام التنبؤ الكثيف.

الابتكار الأول: تضمينات الرُّقع المتراكبة

المحوِّل البصري ViT يقسم الصورة إلى رُقع غير متراكبة — كأنك تقصّ صورة بمقص إلى بلاطات بحواف حادة. هذا التقسيم فعّال حسابياً، لكنه يخلق مشكلة: بكسلات متجاورة تقع على جانبَي خط القص تفقد علاقتها المكانية تماماً. في التجزئة الدلالية حيث الحدود بين الأشياء هي الأهم، هذا عيب خطير.

SegFormer يستبدل هذا التقسيم بـتضمينات رُقع متراكبة — وهي عملية التفاف يكون فيها حجم النواة أكبر من . في المرحلة الأولى يُستخدم التفاف بحجم 7×77 \times 7 وخطوة 4 وحشو 3 لاستخراج رُقع متراكبة. في المراحل التالية يُستخدم التفاف 3×33 \times 3 بخطوة 2 وحشو 1 لدمج السمات. ولأن الرُّقع المتجاورة تتشارك بكسلات فعلية، يحتفظ النموذج بالتواصل المكاني عبر الحدود.

النموذج الذهني بسيط: بدل أن تقصّ الصورة بمقص فتحصل على بلاطات منفصلة بحواف حادة، مرّر نافذة منزلقة عبرها فتحصل على مشاهد متراكبة سلسة. هذا التراكب يضمن أن معلومات الحواف لا تضيع أبداً.

افتح في المختبر
قارن بين تضمينات الرُّقع غير المتراكبة والمتراكبة. لاحظ كيف تحافظ الرُّقع المتراكبة على معلومات الحدود بين المناطق المتجاورة.
تستيقظ التجربة عند وصولك…

الابتكار الثاني: الانتباه الذاتي الفعّال

الانتباه الذاتي المعياري تكلفته تربيعية: كل رمز ينتبه لكل رمز آخر، بتعقيد O(N2)O(N^2) حيث NN هو عدد المواضع المكانية. لنأخذ مثالاً عملياً: صورة بحجم 512×512512 \times 512 بعد تقليلها إلى ربع الدقة تعطينا N=128×128=16,384N = 128 \times 128 = 16{,}384 رمزاً. مصفوفة الانتباه وحدها ستحتوي على أكثر من 268 مليون عنصر — تكلفة غير عملية لمهام التنبؤ الكثيف.

الحل في SegFormer هو انتباه اختزال التسلسل (SRA)، وفكرته مباشرة: قبل حساب الانتباه، أعِد تشكيل مصفوفتي المفتاح والقيمة (K وV) ثم طبّق إسقاطاً خطياً يختزل طول التسلسل بمعامل RR. مصفوفة الاستعلام (Q) تبقى بدقتها الكاملة، فيبقى المخرج بالدقة المكانية الكاملة — لكن تكلفة الانتباه تنخفض من O(N2)O(N^2) إلى O(N2/R)O(N^2 / R).

النموذج الذهني: تخيّل اجتماعاً فيه عدد كبير من الأشخاص. بدل أن يتحدّث كل شخص مع كل شخص آخر (أي N2N^2 محادثة)، تُعيّن N/RN/R مندوباً يلخّص كل منهم آراء مجموعته، ثم يتحدّث كل فرد مع هؤلاء المندوبين فقط. المندوبون يحتفظون بجوهر المعلومات، والاجتماع ينتهي أسرع بكثير.

K^=Reshape ⁣(NR,CR)(K);K^=Linear(CR,C)(K^)\hat{K} = \text{Reshape}\!\left(\frac{N}{R}, C \cdot R\right)(K);\quad \hat{K} = \text{Linear}(C \cdot R, C)(\hat{K})
اختزال التسلسل — إعادة تشكيل K (وV) قبل الانتباهمصفوفة المفتاح KK بأبعاد (N,C)(N, C) تُعاد تشكيلها إلى (N/R,CR)(N/R, C \cdot R)، ثم تُسقَط خطياً إلى (N/R,C)(N/R, C). الأمر نفسه يُطبَّق على VV. بهذا يُختزل طول التسلسل من NN إلى N/RN/R مع الحفاظ على بُعد القنوات. نسبة الاختزال RR تتدرّج كالتالي: [64,16,4,1][64, 16, 4, 1] من المرحلة الأولى إلى الرابعة — أي اختزال قوي في المراحل ذات الدقة العالية حيث الرموز كثيرة، ولا اختزال في المرحلة الأعمق.
Attention(Q,K^,V^)=Softmax ⁣(QK^ ⁣dhead)V^\text{Attention}(Q, \hat{K}, \hat{V}) = \text{Softmax}\!\left(\frac{Q\,\hat{K}^{\!\top}}{\sqrt{d_{\text{head}}}}\right)\hat{V}
الانتباه الذاتي الفعّال — انتباه معياري بعد اختزال K وVبعد الاختزال، مصفوفة الانتباه تصبح بأبعاد N×(N/R)N \times (N/R) بدلاً من N×NN \times N. كل موضع استعلام لا يزال ينتبه لملخّص يمثّل المدى المكاني الكامل، فيحتفظ بالسياق الشامل، لكن تكلفة الحساب أقل بمعامل RR. في المرحلة الأولى حيث R=64R = 64، نحصل على اختزال هائل بمقدار 64 ضعفاً في تكلفة الانتباه.
افتح في المختبر
اسحب نسبة الاختزال R لترى كيف يُقلّص اختزال التسلسل مصفوفة الانتباه مع الحفاظ على دقة المخرج.
تستيقظ التجربة عند وصولك…

الابتكار الثالث: Mix-FFN تُغني عن الترميز الموضعي

المحوِّلات المعيارية تحتاج ترميزاً موضعياً لتعرف أين يقع كل رمز في التسلسل — بدونه يتعامل الانتباه مع جميع المواضع كأنها متطابقة. ViT يستخدم تضمينات موضعية ثابتة أو مُتعلَّمة مرتبطة بدقة محددة، لكن حين تأتي صورة اختبار بدقة مختلفة يجب استيفاء هذه التضمينات، وهذا يُضعف الأداء.

الملاحظة المفتاحية في SegFormer: بحجم 3×33 \times 3 يُرمّز الموضع ضمنياً دون أي إضافة صريحة. كيف؟ لأن الالتفاف يعمل على الجوارات المحلية، والحشو الصفري عند حواف الصورة يخلق عدم تناظر يُسرّب معلومة الموقع المكاني للنموذج. النتيجة أن النموذج يعرف أين يقع كل رمز دون الحاجة لأي ترميز موضعي صريح.

شبكة Mix-FFN تُدخل هذا الالتفاف بالعمق 3×33 \times 3 بين طبقتَي MLP الخطيتين. هذا الإدراج البسيط يؤدي وظيفتين معاً: يمزج المعلومات المكانية (فيحلّ محل الترميز الموضعي) ويُضيف انحيازاً استقرائياً محلياً يساعد المحوِّل في التقاط الأنماط الدقيقة دون الحاجة لانتباه كامل.

xout=MLP(GELU(DWConv3×3(MLP(xin))))+xinx_{\text{out}} = \text{MLP}\bigl(\text{GELU}(\text{DWConv}_{3\times3}(\text{MLP}(x_{\text{in}})))\bigr) + x_{\text{in}}
Mix-FFN — الالتفاف بالعمق يحلّ محل الترميز الموضعيxinx_{\text{in}} هو مخرج الانتباه الذاتي الفعّال. طبقة MLP الأولى تُسقط البيانات إلى بُعد أعلى، ثم التفاف بالعمق 3×33 \times 3 يمزج الجيران المكانيين (مُسرّباً معلومات الموضع)، تليه دالة تنشيط GELU، ثم طبقة MLP الثانية تُعيد الإسقاط للبُعد الأصلي. الوصلة المتبقية تُضاف إلى المدخل. لا حاجة لترميز موضعي — والنموذج يعمل بأي دقة دون استيفاء.
افتح في المختبر
استكشف كيف تُعالج Mix-FFN السمات: الالتفاف بالعمق يُسرّب المعلومات المكانية عبر الحشو الصفري، فيُلغي الحاجة إلى الترميز الموضعي.
تستيقظ التجربة عند وصولك…

المفكّك: بساطة MLP الشاملة

أُطر التجزئة السابقة كانت تعتمد على مفكّكات ثقيلة فيها وحدات انتباه و ورفع دقة متعدد الخطوات. مفكّك SegFormer على النقيض تماماً — بسيط بشكل لافت: أربع طبقات MLP فقط تدمج السمات متعددة المقاييس.

يأخذ خرائط السمات الأربع من المرمِّز (F1F_1 إلى F4F_4، بدقة تتراوح من 1/4 إلى 1/32) ويعالجها في أربع خطوات. أولاً يُسقط كل خريطة سمات إلى بُعد قنوات موحّد CC عبر MLP منفصل (وهو عملياً ). ثانياً يرفع دقة الخرائط الأربع جميعها إلى 1/4 — أعلى دقة في الهرم. ثالثاً يربطها على بُعد القنوات، فتتّحد التفاصيل المحلية الدقيقة من F1F_1 مع السياق الدلالي الشامل من F4F_4. وأخيراً طبقة MLP إضافية تدمج كل هذا وتُخرج درجات التصنيف لكل بكسل.

لماذا ينجح مفكّك بهذه البساطة؟ لأن المرمِّز هو من يقوم بالعمل الشاق. المحوِّل الهرمي يُنتج سمات تتدرّج من الانتباه المحلي في الطبقات الأولى (حواف ونسيج) إلى الانتباه الشامل في الطبقات العميقة (هوية الأشياء وسياق المشهد). المفكّك ببساطة يمزج هذه المشاهد المتكاملة — لا حاجة لانتباه إضافي ولا التفاف إضافي.

افتح في المختبر
شاهد كيف يدمج مفكّك MLP أربعة مقاييس من السمات. بدّل كل مقياس لترى كيف تساهم التفاصيل المحلية والسياق الشامل في التنبؤ النهائي.
تستيقظ التجربة عند وصولك…

التوسيع: من B0 إلى B5

SegFormer ليس نموذجاً واحداً بل عائلة من ستة إصدارات — B0 حتى B5 — تتوسّع بتغيير عمق المرمِّز وعرض القنوات وعدد رؤوس الانتباه. أما المفكّك فيبقى شبه ثابت في جميع الإصدارات.

في الطرف الأصغر، SegFormer-B0 نموذج مصغّر بـ 3.8 مليون معامل يحقق 37.4% mIoU على ADE20K بسرعة 48 إطاراً في الثانية — مناسب للنشر على أجهزة الحافة. في الطرف الأكبر، SegFormer-B5 يصل إلى 84.7 مليون معامل ويحقق 51.8% mIoU على ADE20K و84.0% على Cityscapes — أفضل النتائج المنشورة وقتها بحجم أصغر 4 مرات من SETR وسرعة أعلى 5 مرات.

الفكرة الجوهرية هنا أن كفاءة هذه البنية مصدرها التصميم وليس تصغير النموذج. حتى الإصدار الأكبر يبقى فعّالاً لأن البنية الهرمية والانتباه الذاتي الفعّال ومفكّك MLP تتخلّص من الحسابات غير الضرورية في كل مرحلة. لهذا يستطيع SegFormer التوسّع دون أن يصطدم بالعوائق الحسابية التي أعاقت أساليب التجزئة السابقة القائمة على المحوِّلات.

افتح في المختبر
قارن إصدارات SegFormer من B0 إلى B5: المعاملات والعمليات الحسابية ودقة mIoU. انقر على نموذج لرؤية تكوين مرمِّزه.
تستيقظ التجربة عند وصولك…

المتانة: لا ترميز موضعي، لا هشاشة

من أهم المزايا العملية لتصميم SegFormer الخالي من الترميز الموضعي هي المتانة أمام تغيّرات الدقة وتشوّهات المدخلات. المؤلفون اختبروا ذلك على معيار Cityscapes-C الذي يُطبّق 16 نوعاً من التشويش — ضجيج غاوسي، ضبابية حركة، ضباب، ثلج، وغيرها — على صور التحقق.

SegFormer أظهر متانة أعلى بوضوح مقارنة بالأساليب الالتفافية (DeepLabv3+ وHRNet) وأساليب المحوِّلات (SETR). غياب الترميز الموضعي الثابت يعني أن النموذج لا ينكسر حين تختلف دقة الاختبار عن التدريب. تضمينات الرُّقع المتراكبة تحافظ على البنية المحلية حتى في وجود الضجيج. والالتفاف بالعمق في Mix-FFN يوفّر تساوي الإزاحة الذي يقاوم الاضطرابات المكانية بطبيعته.

هذه المتانة ليست مصادفة — بل نتيجة مباشرة لكل قرار تصميمي اتُّخذ في هذه البنية. كل ابتكار في SegFormer — الرُّقع المتراكبة، الاستغناء عن الترميز الموضعي، Mix-FFN، الانتباه الذاتي الفعّال — لا يُحسّن الدقة فحسب بل يزيد الموثوقية في الظروف الحقيقية.

الانتباه الذاتي الفعّال — اختزال التسلسل بأسلوب PyTorchpython

مبسَّط لإظهار الفكرة — ليس التنفيذ الحقيقي.

def efficient_self_attention(x, R):
    """x: (B, N, C) السمات، R: نسبة الاختزال"""
    B, N, C = x.shape
    Q = linear_q(x)                    # (B, N, C)  — الدقة الكاملة

    # اختزال طول التسلسل لـ K وV
    K = x.reshape(B, N // R, C * R)    # (B, N/R, C*R)
    K = linear_k(K)                    # (B, N/R, C)  — مضغوط

    V = x.reshape(B, N // R, C * R)
    V = linear_v(V)                    # (B, N/R, C)

    # انتباه معياري بعد اختزال K وV
    attn = softmax(Q @ K.T / sqrt(d))  # (B, N, N/R) — أرخص R مرة
    out = attn @ V                     # (B, N, C)   — الدقة الكاملة
    return out

السياق: الطريق إلى SegFormer

  1. 2015

    U-Net — المخطّط الأول للمرمِّز والمفكّك

    أسّس بنية متناظرة من مرمِّز ومفكّك مع وصلات تخطّي للتجزئة الطبية الحيوية. فكرة دمج السمات عبر وصلات التخطّي ألهمت فلسفة مفكّك SegFormer لاحقاً.

  2. 2017

    DeepLabv3 — الالتفاف الموسّع للسياق

    استخدم التجميع الهرمي المكاني الموسّع (ASPP) لالتقاط سياق متعدد المقاييس دون خفض الدقة المكانية. أثبت أن دمج السمات على مقاييس مختلفة عامل حاسم في دقة التجزئة.

  3. 2020

    ViT — المحوِّلات تدخل عالم الرؤية

    أثبت أن المحوِّلات وحدها تستطيع منافسة الشبكات الالتفافية في تصنيف الصور. لكنه يُخرج سمات بمقياس واحد ويحتاج ترميزاً موضعياً ثابتاً — قيدان أساسيان في مهام التنبؤ الكثيف.

  4. 2021

    PVT — المحوِّل الهرمي

    قدّم استخراج سمات متعدد المقاييس وانتباه اختزال مكاني. SegFormer يبني مباشرة على ابتكارات PVT ويُضيف إليها الرُّقع المتراكبة وشبكة Mix-FFN.

  5. 2021

    Swin Transformer — النوافذ المنزاحة

    قدّم انتباه النوافذ المنزاحة للرؤية الهرمية الفعّالة. يُنتج سمات متعددة المقاييس كـ SegFormer، لكنه يعتمد نمط انتباه مختلف ويحتفظ بترميز موضعي نسبي.

  6. 2021

    SegFormer (هذه الورقة)

    جمع مرمِّز محوِّل هرمي مع مفكّك MLP شامل. بلا ترميز موضعي، مع رُقع متراكبة وانتباه فعّال. حقّق أفضل النتائج على ADE20K وCityscapes بكفاءة غير مسبوقة.

المرجعXie, Wang, Yu, Anandkumar, Alvarez, Luo. SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers. NeurIPS, 2021.

مصطلحات هذه الورقة