Skip to main content

> ML_DATASET // COCO-CAPTIONS-DATASET_v1.0

MS COCO Captions (Chen et al. 2015)

Microsoft / COCO Consortium · Vision-Language & Image Captioning · 330,000 images with 5 independent human crowdsourced English captions per image (1.5M+ captions)

Vision-Language & Image CaptioningCC-BY-4.0330,000 images with 5 independent human crowdsourced English captions per image (1.5M+ captions)open

Dataset Profile & Characteristics

Label Type:5 descriptive English reference sentences per image
Languages:en
License Tier:permissive-open-source
Modalities:image, text

Intended Use

  • Benchmarking visual language models, image captioning, and CIDEr / BLEU-4 metrics

Prohibited / Discouraged Use

  • Evaluating multi-page complex document reasoning

Bias, Leakage & Privacy Risk Analysis

Privacy / Sensitive Data Risks:

Everyday scenes depicting people in public spaces.

Known Bias:

Crowd-worker descriptive linguistic style; concise literal object enumeration.

Known Benchmark Leakage:

Karpathy split standard partitions 113K train / 5K val / 5K test.

Compatible Tools & Libraries