Skip to main content

> ML_LITERATURE // OQUAB-2023-DINOV2-LEARNING-ROBUST-VISUAL-FEATURES-WITHOUT-SUPERVISION_v1.0

DINOv2: Learning Robust Visual Features without Supervision

Maxime Oquab, Timothée Darcet, Théo Moutakanni, Huy Vo, Marc Szafraniec, Vasil Khalidov, Pierre Fernandez, Daniel Haziza, Francisco Massa, Alaaeldin El-Nouby, Mahmoud Assran, Nicolas Ballas, Wojciech Galuba, Russell Howes, Po-Yao Huang, Shang-Wen Li, Ishan Misra, Michael Rabbat, Vasu Sharma, Gabriel Synnaeve, Hu Xu, Hervé Jegou, Julien Mairal, Patrick Labatut, Armand Joulin, Piotr Bojanowski · arXiv preprint (2023)

seminal-architecture2023foundationalthirdPartyReproduced

Principal Contribution

Scaled self-supervised visual representation pre-training to 1B parameters on 142M curated images (LVD-142M), producing universal visual features outperforming supervised models across all downstream vision tasks.

Operational Relevance

Serves as qualified reference for deploying task-feature-extraction, task-depth-estimation, task-image-segmentation in production.

Assumptions

  • Spatial feature coherence and data manifold structure adhere to continuous representation hypotheses

Limitations

  • Computational complexity scales with spatial resolution and parameter capacity

Connected Algorithms, Architectures & Tools

Related Algorithms:
Related Architectures:
Implementing Libraries: