> ML_DATASET // SQUAD-V2_v1.0
SQuAD 2.0 (Stanford Question Answering Dataset)
Stanford NLP Group (Rajpurkar et al.) · Natural Language Processing & Reading Comprehension · 150,000+ questions across 500+ Wikipedia articles
Natural Language Processing & Reading ComprehensionCC-BY-SA-4.0150,000+ questions across 500+ Wikipedia articlesopen
Dataset Profile & Characteristics
Label Type:Extractive span answer or unanswerable indicator
Languages:en
License Tier:copyleft
Modalities:text
Intended Use
- Reading comprehension benchmarking
- Extractive question answering evaluation
Prohibited / Discouraged Use
- General generative chat evaluation
Bias, Leakage & Privacy Risk Analysis
Privacy / Sensitive Data Risks:
Wikipedia public domain textual excerpts; zero PII.
Known Bias:
Wikipedia editorial tone and topic selection bias.
Known Benchmark Leakage:
Unanswerable negative questions were crowd-worker generated with subtle phrasing overlap.
