Skip to content
3 个序列 / 9 篇文章
搜索与分析专题Spark 专题数据与中间件 · 3 个序列 · 9 篇文章沿着执行模型、Shuffle、Join 优化和数据倾斜这条线补齐离线计算能力。
所属领域数据与中间件
专题内序列3 个
专题文章9 篇
高频标签
选型对比 · 1MyBatis · 1

Spark 专题

起步入口3 组
专题序列3 个
关联文章9 篇
起步入口先选入口
起步入口先建立执行模型认知理解惰性计算、Stage 和任务触发,是后面看性能问题的前提。
起步入口再看性能和长尾问题适合处理 Shuffle、数据倾斜和 Join 问题时继续往下看。
起步入口把离线问题接到数仓和实时链路适合把 Spark 放回 Hive、Flink 和整条分析链路里继续理解的人。
阅读路径按场景进入
入门打底先建立执行模型和惰性计算直觉适合先理解 Stage、Task、窄依赖和宽依赖这些基本概念。
核心原理把 Shuffle 和数据倾斜机制看懂适合理解为什么同一条 SQL 或同一个 Job 会出现长尾和资源倾斜。
工程实战围绕离线任务调优继续落地适合开始做批量 ETL、宽表 Join 和大规模离线任务优化时继续往下用。
案例排障从长尾任务和 Shuffle 过重现象进入适合离线任务已经出现严重长尾、倾斜和执行时间失控时快速进入。
专题序列Spark 专题本专题共 3 个序列 / 9 篇文章扩容后的文章会继续按序列归档在这里,适合先选一条主线再往下读。
延伸相关入口如果你更关心数仓表设计和 SQL 层优化,可以继续到 Hive 专题;如果你正从离线计算走向实时链路,也可以继续看 Flink 专题。

把零散经验整理成可查、可复用、可持续更新的企业级知识门户