Spark VS Mapreduce

Spark

  1. 基于内存的计算
  2. 高性能要求

增加了Driver新组件

  1. Client收到应用请求,首先会拉起Driver,主要是用于Spark的工作流程规划和TASK下发。

RDD算子

  1. 执行类的算子
  2. 逻辑操作类的算子