对比:
持久化 | Checkpoint | |
位置 | Persist 和 Cache 只能保存在本地的磁盘和内存中(或者堆外内存--实验中) | 保存数据到 HDFS 这类可靠的存储上 |
生命周期 | Cache和Persist的RDD会在程序结束后会被清除或者手动调用unpersist方法 | Checkpoint的RDD在程序结束后依然存在,不会被删除 |
血统、依赖链 | Persist和Cache,不会丢掉RDD间的依赖链/依赖关系,因为这种缓存是不可靠的, 如果出现了一些错误(例如 Executor 宕机),需要通过回溯依赖链重新计算出来 | Checkpoint会斩断依赖链,因为Checkpoint会把结果保存在HDFS这类存储中, 更加的安全可靠,一般不需要回溯依赖链 |
图示详解(Lineage):
RDD的Lineage(血统、依赖链)会记录RDD的元数据信息和转换行为,当该RDD的部分分区数据丢失时,它可以根据这些信息来重新运算和恢复丢失的数据分区。在进行故障恢复时,Spark会对读取Checkpoint的开销和重新计算RDD分区的开销进行比较,从而自动选择最优的恢复策略。