Skip to main content

> ML_DATASET // SQUAD-V2_v1.0

SQuAD 2.0 (Stanford Question Answering Dataset)

Stanford NLP Group (Rajpurkar et al.) · Natural Language Processing & Reading Comprehension · 150,000+ questions across 500+ Wikipedia articles

Natural Language Processing & Reading ComprehensionCC-BY-SA-4.0150,000+ questions across 500+ Wikipedia articlesopen

Dataset Profile & Characteristics

Label Type:Extractive span answer or unanswerable indicator
Languages:en
License Tier:copyleft
Modalities:text

Intended Use

  • Reading comprehension benchmarking
  • Extractive question answering evaluation

Prohibited / Discouraged Use

  • General generative chat evaluation

Bias, Leakage & Privacy Risk Analysis

Privacy / Sensitive Data Risks:

Wikipedia public domain textual excerpts; zero PII.

Known Bias:

Wikipedia editorial tone and topic selection bias.

Known Benchmark Leakage:

Unanswerable negative questions were crowd-worker generated with subtle phrasing overlap.

Compatible Tools & Libraries