BEiT: BERT Pre-Training of Image Transformers
Hangbo Bao, Li Dong, +2
How BEiT bridges BERT and vision by predicting discrete visual tokens from masked image patches — the first masked image modeling approach for Vision Transformers, achieving 83.2% on ImageNet-1K.
