Skip to main content

> ML_DATASET // LAION-5B-MULTIMODAL-DATASET_v1.0

LAION-5B: Open Large-Scale Multimodal Dataset

LAION e.V. (Schuhmann et al. 2022) · Multimodal Foundation Pretraining · 5.85 billion CLIP-filtered image-URL and alt-text pairs (2.3B English, 2.2B multilingual)

Multimodal Foundation PretrainingCC-BY-4.0 (Metadata index)5.85 billion CLIP-filtered image-URL and alt-text pairs (2.3B English, 2.2B multilingual)open

Dataset Profile & Characteristics

Label Type:Web image URLs paired with HTML alt-text and CLIP similarity embeddings
Languages:en, multilingual
License Tier:permissive-open-source
Modalities:image, text

Intended Use

  • Pretraining open text-to-image diffusion models (Stable Diffusion v1-v2) and open CLIP encoders

Prohibited / Discouraged Use

  • Training facial recognition surveillance backbones

Bias, Leakage & Privacy Risk Analysis

Privacy / Sensitive Data Risks:

Web crawl metadata index; contains links to unredacted public web images and personal photographs.

Known Bias:

Internet web scraper biases; NSFW and offensive content filtered heuristically.

Known Benchmark Leakage:

Large-scale deduplication required to prevent memorization of stock photo agency collections.

Compatible Tools & Libraries