محوِّل الرؤية (ViT)
Vision Transformer (ViT)
تكييف بنية المحولات اللغوية لمعالجة الصور البصرية عبر تقسيم المشهد إلى مربعات صغيرة والتعامل معها ككلمات.
An architecture that processes images by splitting them into patches treated as tokens and feeding them into a standard Transformer encoder with no convolutions.
تُرجم أيضاًبنية المحولات المخصصة لمعالجة الصور، محول البيانات البصرية الشبكي، محوِّل الصور، ViT، محوِّل الرؤية (ViT)
أول ظهور في هذه المجموعة: ImageNet: قاعدة بيانات صور هرمية واسعة النطاق (2009)
يظهر في هذه الأوراق
- BEiT: التدريب المسبق بأسلوب BERT لمحوِّلات الصور2021في السماء ✦
- التوجيه الديناميكي بين الكبسولات2017في السماء ✦
- شبكة التفافية لعصر العشرينيات2022في السماء ✦
- تدريب محوِّلات الصور الكفوءة بيانياً والتقطير عبر الانتباه2021في السماء ✦
- Depth Anything: إطلاق قوة البيانات غير الموسومة واسعة النطاق2024في السماء ✦
- خصائص ناشئة في محوِّلات الرؤية ذاتية الإشراف2021في السماء ✦
- DINOv2: تعلُّم سمات بصرية متينة بدون إشراف2023في السماء ✦
- وكيل واحد لكل المهام2022في السماء ✦
- Gemini: عائلة نماذج فائقة القدرات تجمع بين وسائط متعددة2023في السماء ✦
- التسوية بالمجموعات2018في السماء ✦
- ImageBind: فضاء تضمين واحد يربط كل الأنماط2023في السماء ✦
- ImageNet: قاعدة بيانات صور هرمية واسعة النطاق2009في السماء ✦
- الاكتشاف الرمزي لخوارزميات الأمثَلة2023في السماء ✦
- قطيع نماذج Llama 32024في السماء ✦
- تباين الزخم للتعلّم التمثيلي البصري غير الخاضع للإشراف2020في السماء ✦
- SegFormer: تصميم بسيط وفعّال للتجزئة الدلالية باستخدام المحوِّلات2021في السماء ✦
- تجزئة أي شيء2023في السماء ✦
- SGDR: النزول الاشتقاقي العشوائي مع إعادة التشغيل الدافئة2017في السماء ✦
- أرِني وأخبرني: مولّد وصف الصور بالشبكات العصبية2015في السماء ✦
- نماذج توليد الفيديو بوصفها محاكيات للعالم2024في السماء ✦
- محوِّل Swin: محوِّل رؤية هرمي باستخدام النوافذ المُنزاحة2021في السماء ✦
- صورة تساوي 16×16 كلمة: المحوِّلات للتعرف على الصور على نطاق واسع2020في السماء ✦