Skip to main content

> ML_DATASET // OGBN-ARXIV-CITATION-NETWORK_v1.0

OGB: ogbn-arxiv Citation Network (Hu et al. 2020)

Open Graph Benchmark / Stanford University (Jure Leskovec et al.) · Large-Scale Graph Machine Learning · 169,343 arXiv computer science papers and 1,166,243 directed citation edges across 40 categories

Large-Scale Graph Machine LearningCC-BY-4.0169,343 arXiv computer science papers and 1,166,243 directed citation edges across 40 categoriesopen

Dataset Profile & Characteristics

Label Type:40 primary subject areas with 128-dimensional word2vec sentence embeddings
Languages:en
License Tier:permissive-open-source
Modalities:graph, text

Intended Use

  • Realistic large-scale node classification benchmarking with strict temporal partitioning

Prohibited / Discouraged Use

  • Random split evaluation without temporal conditioning

Bias, Leakage & Privacy Risk Analysis

Privacy / Sensitive Data Risks:

arXiv public computer science paper metadata; zero personal data.

Known Bias:

Computer science domain; time-evolving citation dynamics.

Known Benchmark Leakage:

Strict chronological temporal split (train <= 2017, val 2018, test >= 2019) prevents future leak.

Compatible Tools & Libraries