Skip to main content

> ML_LITERATURE // DOSOVITSKIY-2020-IMAGE-WORTH-16X16-WORDS-VIT_v1.0

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (ViT)

Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, Neil Houlsby · International Conference on Learning Representations (ICLR) (2020)

seminal-architecture2020foundationalthirdPartyReproduced

Temel Katkı (Principal Contribution)

Standart bir Transformer kodlayıcısını doğrudan düzleştirilmiş 16x16 görüntü yamaları dizilerine uygulayarak tümevarımsal konvolüsyonel yanlılık zorunluluğunu kırdı.

Operasyonel ve Mühendislik Uygunluğu

Çok modlu LLM'ler (GPT-4V, Gemini, Claude 3.5 Sonnet, LLaVA), denetimsiz modeller (DINOv2, MAE) ve CLIP genelinde standart görsel omurga.

Temel Varsayımlar (Assumptions)

  • Büyük veri setlerinde (JFT-300M / ImageNet-21k) önceden eğitildiğinde, genel öz dikkat uzamsal konvolüsyonel tümevarımsal yanlılıkları aşar

Kısıtlar ve Sınırlamalar (Limitations)

  • Yoğun veri artırma veya ön eğitim olmadan küçük veri setlerinde (ImageNet-1k) sıfırdan eğitildiğinde ciddi performans düşüşü

Bağlantılı Algoritmalar, Mimariler ve Kütüphaneler

İlgili Algoritmalar:
İlgili Mimariler:
Uygulayıcı Kütüphaneler: