概述
Apache Spark 是一个开源的、大规模分布式通用计算引擎,最初由加州大学伯克利分校 AMPLab 于 2009 年开发,2013 年捐献给 Apache 基金会并成为顶级项目。
Spark 的核心设计思想是基于内存的迭代计算,通过引入 RDD(Resilient Distributed Dataset,弹性分布式数据集)抽象,克服了 Hadoop MapReduce 在迭代计算场景下需要反复读写磁盘的性能瓶颈。相比 MapReduce,Spark 在内存中的计算速度可快 100 倍,在磁盘上也能快 10 倍。
2019/5/7大约 11 分钟