Skip to main content

> ML_DATASET // NATURAL-QUESTIONS-GOOGLE_v1.0

Natural Questions (NQ - Google Research 2019)

Google Research (Kwiatkowski et al.) · Open-Domain Question Answering & Search · 307,373 training examples from real Google Search queries paired with Wikipedia pages

Open-Domain Question Answering & SearchCC-BY-4.0307,373 training examples from real Google Search queries paired with Wikipedia pagesopen

Dataset Profile & Characteristics

Label Type:Long answer HTML paragraph span and short answer factoid span
Languages:en
License Tier:permissive-open-source
Modalities:text

Intended Use

  • Benchmarking dense retrieval (DPR), RAG retrieval, and open-domain question answering

Prohibited / Discouraged Use

  • Evaluating creative story generation

Bias, Leakage & Privacy Risk Analysis

Privacy / Sensitive Data Risks:

Real user queries aggregated and anonymized by Google Search; Wikipedia context.

Known Bias:

Information-seeking query distribution of web search engine users.

Known Benchmark Leakage:

Standard open-domain splits vetted for dense passage retrieval benchmarks.

Compatible Tools & Libraries