Skip to main content

> ML_LITERATURE // ZAHARIA-2010-SPARK-CLUSTER-COMPUTING-WITH-WORKING-SETS_v1.0

Spark: Cluster Computing with Working Sets

Matei Zaharia, Mosharaf Chowdhury, Michael J. Franklin, Scott Shenker, Ion Stoica · USENIX Workshop on Hot Topics in Cloud Computing (HotCloud) (2010)

systems2010industry-standardnotAssessed

Principal Contribution

Introduced Resilient Distributed Datasets (RDDs), enabling in-memory iterative data reuse across distributed cluster memory.

Operational Relevance

Directly guides deployment choices and architecture selection for task-data-processing, task-distributed-ml.

Assumptions

  • Standard empirical regularity and statistical stability hold across evaluation domains

Limitations

  • Performance characteristics depend on domain distribution and compute allocation parameters

Connected Algorithms, Architectures & Tools

Related Algorithms:
Related Architectures:
Implementing Libraries: