مرمِّز بصري
Vision Encoder
مكوِّن شبكة عصبية يحوِّل الصور الخام إلى تمثيلات سمات مهيكلة، وعادةً يكون محوِّل رؤية (ViT) أو شبكة التفافية.
A neural network component that converts raw images into structured feature representations, typically a Vision Transformer (ViT) or convolutional neural network.
تُرجم أيضاًالمرمِّز البصري، مرمِّز الرؤية
أول ظهور في هذه المجموعة: Flamingo: نموذج لغوي بصري للتعلّم بأمثلة قليلة (2022)
يظهر في هذه الأوراق
- BLIP-2: بناء تدريب مسبق للرؤية واللغة انطلاقاً من مرمِّزات صور ونماذج لغوية كبيرة مُجمَّدة2023في السماء ✦
- سياسة الانتشار: تعلُّم السياسات البصرية-الحركية بانتشار الأفعال2023في السماء ✦
- Flamingo: نموذج لغوي بصري للتعلّم بأمثلة قليلة2022في السماء ✦
- Gemini: عائلة نماذج فائقة القدرات تجمع بين وسائط متعددة2023في السماء ✦
- الضبط التعليمي البصري2023في السماء ✦
- RT-1: محوِّل الروبوتات للتحكم الواقعي على نطاق واسع2022في السماء ✦
- RT-2: نماذج الرؤية-اللغة-الفعل تنقل معرفة الويب إلى التحكم الروبوتي2023في السماء ✦