> ML_DATASET // OGBN-ARXIV-CITATION-NETWORK_v1.0
OGB: ogbn-arxiv Citation Network (Hu et al. 2020)
Open Graph Benchmark / Stanford University (Jure Leskovec et al.) · Large-Scale Graph Machine Learning · 169,343 arXiv computer science papers and 1,166,243 directed citation edges across 40 categories
Large-Scale Graph Machine LearningCC-BY-4.0169,343 arXiv computer science papers and 1,166,243 directed citation edges across 40 categoriesopen
Dataset Profile & Characteristics
Label Type:40 primary subject areas with 128-dimensional word2vec sentence embeddings
Languages:en
License Tier:permissive-open-source
Modalities:graph, text
Intended Use
- Realistic large-scale node classification benchmarking with strict temporal partitioning
Prohibited / Discouraged Use
- Random split evaluation without temporal conditioning
Bias, Leakage & Privacy Risk Analysis
Privacy / Sensitive Data Risks:
arXiv public computer science paper metadata; zero personal data.
Known Bias:
Computer science domain; time-evolving citation dynamics.
Known Benchmark Leakage:
Strict chronological temporal split (train <= 2017, val 2018, test >= 2019) prevents future leak.
