> ML_ARCHITECTURE // VISION-TRANSFORMER-VIT_v1.0
Vision Transformer (ViT / DINOv2 / MAE)
Evrişimsel tümevarımsal önyargılar olmadan doğrudan düzleştirilmiş 16x16 görüntü yamaları üzerinde çalışan saf transformer mimarisi; görsel temsil ön eğitimi için devasa ölçekleme sağlar.
Vision Transformersimage
Tüm Mimarilere DönMimari Özeti ve Temel Özellikler
Evrişimsel tümevarımsal önyargılar olmadan doğrudan düzleştirilmiş 16x16 görüntü yamaları üzerinde çalışan saf transformer mimarisi; görsel temsil ön eğitimi için devasa ölçekleme sağlar.
Uygulayıcı Kütüphaneler
Temel Literatür (Seminal Papers)
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (ViT)Alexey Dosovitskiy, Lucas Beyer (2020) · International Conference on Learning Representations (ICLR)
Masked Autoencoders Are Scalable Vision Learners (MAE)Kaiming He, Xinlei Chen (2022) · IEEE Conference on Computer Vision and Pattern Recognition (CVPR)
DINOv2: Learning Robust Visual Features without SupervisionMaxime Oquab, Timothée Darcet (2023) · arXiv preprint
Mimari Kısıtlar ve Sınırlamalar
- Verimli yürütme için uyumlu derin öğrenme çerçevesi ve donanım hızlandırıcısı gerektirir.
