> ML_DATASET // COCO-CAPTIONS-DATASET_v1.0
MS COCO Captions (Chen et al. 2015)
Microsoft / COCO Consortium · Vision-Language & Image Captioning · 330,000 images with 5 independent human crowdsourced English captions per image (1.5M+ captions)
Vision-Language & Image CaptioningCC-BY-4.0330,000 images with 5 independent human crowdsourced English captions per image (1.5M+ captions)open
Dataset Profile & Characteristics
Label Type:5 descriptive English reference sentences per image
Languages:en
License Tier:permissive-open-source
Modalities:image, text
Intended Use
- Benchmarking visual language models, image captioning, and CIDEr / BLEU-4 metrics
Prohibited / Discouraged Use
- Evaluating multi-page complex document reasoning
Bias, Leakage & Privacy Risk Analysis
Privacy / Sensitive Data Risks:
Everyday scenes depicting people in public spaces.
Known Bias:
Crowd-worker descriptive linguistic style; concise literal object enumeration.
Known Benchmark Leakage:
Karpathy split standard partitions 113K train / 5K val / 5K test.
