مرمِّز الصور
Image Encoder
شبكة عصبية تعالج صورة مُدخلة وتُنتج تمثيلاً كثيفاً للسمات. في SAM يعمل محوِّل رؤية ضخم (ViT-H) مُدرَّب مسبقاً بأسلوب المُرمِّز التلقائي المُقنَّع كمرمِّز صور.
A neural network that processes an input image and produces a dense feature representation (embedding). In SAM, a ViT-H pre-trained with MAE serves as the image encoder.
تُرجم أيضاًمرمِّز الصورة، وحدة ترميز الصورة
أول ظهور في هذه المجموعة: ALIGN: توسيع نطاق تعلّم التمثيلات البصرية والبصرية-اللغوية بإشراف نصّي مُشوَّش (2021)
يظهر في هذه الأوراق