Reconstruction Target
هدف إعادة البناء
ما يتنبأ به فاكّ الترميز للمواضع المُقنَّعة. في MAE يُستخدم قيم بكسلات خام أو مُسوّاة وهو أبسط وأسرع من أسلوب BEiT الذي يتنبأ برموز بصرية منفصلة من مُرمِّز dVAE مُدرَّب مسبقاً.
What the decoder predicts for masked positions. MAE uses raw or normalized pixel values — simpler and faster than BEiT's approach of predicting discrete visual tokens from a pre-trained dVAE tokenizer.
Also translated asمُستهدَف الاسترجاع، هدف إعادة التركيب
First appears in this corpus in: Masked Autoencoders Are Scalable Vision Learners (2022)
Appears in these papers