> ML_LITERATURE // OQUAB-2023-DINOV2-LEARNING-ROBUST-VISUAL-FEATURES-WITHOUT-SUPERVISION_v1.0
DINOv2: Learning Robust Visual Features without Supervision
Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Mahmoud Assran, Nicolas Ballas, Wojciech Galuba, Russell Howes, Po-Yao Huang, Shang-Wen Li, Ishan Misra, Michael Rabbat, Vasu Sharma, Gabriel Synnaeve, Hu Xu, Hervé Jegou, Julien Mairal, Patrick Labatut, Armand Joulin, Piotr Bojanowski · arXiv preprint (2023)
Principal Contribution
Scaled self-supervised visual representation pre-training to 1B parameters on 142M curated images (LVD-142M), producing universal visual features outperforming supervised models across all downstream vision tasks.
Operational Relevance
Serves as qualified reference for deploying task-feature-extraction, task-depth-estimation, task-image-segmentation in production.
Assumptions
- Spatial feature coherence and data manifold structure adhere to continuous representation hypotheses
Limitations
- Computational complexity scales with spatial resolution and parameter capacity
