محوِّل المزج
Mix Transformer
المرمِّز الهرمي في بنية SegFormer، يتكوّن من أربع مراحل تُنتج سمات بدقات مكانية متعددة (1/4 إلى 1/32) باستخدام تضمينات رُقع متراكبة وانتباه ذاتي فعّال وشبكة Mix-FFN.
The hierarchical encoder in SegFormer, consisting of four stages that produce features at multiple spatial resolutions (1/4 to 1/32) using overlapping patch embeddings, efficient self-attention, and Mix-FFN.
تُرجم أيضاًMiT، Mix Vision Transformer