Appearance
Spark 专题
起步入口3 组
专题序列3 个
关联文章9 篇
起步入口先选入口
起步入口先建立执行模型认知理解惰性计算、Stage 和任务触发,是后面看性能问题的前提。
起步入口再看性能和长尾问题适合处理 Shuffle、数据倾斜和 Join 问题时继续往下看。
阅读路径按场景进入
入门打底先建立执行模型和惰性计算直觉适合先理解 Stage、Task、窄依赖和宽依赖这些基本概念。
核心原理把 Shuffle 和数据倾斜机制看懂适合理解为什么同一条 SQL 或同一个 Job 会出现长尾和资源倾斜。
工程实战围绕离线任务调优继续落地适合开始做批量 ETL、宽表 Join 和大规模离线任务优化时继续往下用。
案例排障从长尾任务和 Shuffle 过重现象进入适合离线任务已经出现严重长尾、倾斜和执行时间失控时快速进入。
专题序列Spark 专题本专题共 3 个序列 / 9 篇文章扩容后的文章会继续按序列归档在这里,适合先选一条主线再往下读。
2 篇文章Spark 执行模型与性能优化适合沿着执行模型、Shuffle、Join 和数据倾斜这条线连续看。起步文章:Spark 作业执行与惰性计算
- Spark 作业执行与惰性计算
- Spark Shuffle、数据倾斜和 Join 优化
- RDD、DataFrame、Dataset 怎么选
- cache、persist 和 checkpoint 怎么区分
- 资源提交和动态分配怎么调优
- 窄依赖和宽依赖怎么影响执行计划
- Executor 内存模型怎么影响 OOM
- 广播变量和累加器什么时候该用
延伸相关入口如果你更关心数仓表设计和 SQL 层优化,可以继续到 Hive 专题;如果你正从离线计算走向实时链路,也可以继续看 Flink 专题。