> ML_DATASET // NATURAL-QUESTIONS-GOOGLE_v1.0
Natural Questions (NQ - Google Research 2019)
Google Research (Kwiatkowski et al.) · Open-Domain Question Answering & Search · 307,373 training examples from real Google Search queries paired with Wikipedia pages
Open-Domain Question Answering & SearchCC-BY-4.0307,373 training examples from real Google Search queries paired with Wikipedia pagesopen
Dataset Profile & Characteristics
Label Type:Long answer HTML paragraph span and short answer factoid span
Languages:en
License Tier:permissive-open-source
Modalities:text
Intended Use
- Benchmarking dense retrieval (DPR), RAG retrieval, and open-domain question answering
Prohibited / Discouraged Use
- Evaluating creative story generation
Bias, Leakage & Privacy Risk Analysis
Privacy / Sensitive Data Risks:
Real user queries aggregated and anonymized by Google Search; Wikipedia context.
Known Bias:
Information-seeking query distribution of web search engine users.
Known Benchmark Leakage:
Standard open-domain splits vetted for dense passage retrieval benchmarks.
