المعجم

محوِّل الرؤية (ViT)

Vision Transformer (ViT)

تكييف بنية المحولات اللغوية لمعالجة الصور البصرية عبر تقسيم المشهد إلى مربعات صغيرة والتعامل معها ككلمات.

An architecture that processes images by splitting them into patches treated as tokens and feeding them into a standard Transformer encoder with no convolutions.

تُرجم أيضاًبنية المحولات المخصصة لمعالجة الصور، محول البيانات البصرية الشبكي، محوِّل الصور، ViT، محوِّل الرؤية (ViT)

أول ظهور في هذه المجموعة: ImageNet: قاعدة بيانات صور هرمية واسعة النطاق (2009)

يظهر في هذه الأوراق