Appearance
Hive 专题
起步入口3 组
专题序列3 个
关联文章9 篇
起步入口先选入口
起步入口先补表设计和文件布局离线数仓任务很多性能问题都始于分区、分桶和文件格式没设计好。
起步入口再补 SQL 调优适合开始处理大表 Join、扫描量和任务耗时问题时继续往下看。
阅读路径按场景进入
入门打底先建立分区分桶和文件格式直觉适合先理解为什么 Hive 的性能问题常常始于表设计不合理。
核心原理把扫描量和执行代价看明白适合理解 Join、文件数量、分区裁剪和数据倾斜对任务耗时的影响。
工程实战围绕数仓表设计继续落地适合开始做离线数仓、明细层与汇总层建模时继续往下用。
案例排障从扫描量高和任务慢现象进入适合离线任务已经出现扫描暴涨、长尾任务和文件过多问题时快速进入。
专题序列Hive 专题本专题共 3 个序列 / 9 篇文章扩容后的文章会继续按序列归档在这里,适合先选一条主线再往下读。
2 篇文章Hive 表设计与 SQL 调优适合先把分区分桶和文件格式看明白,再进入 SQL 调优与常见坑。起步文章:Hive 分区、分桶和文件格式怎么选
- Hive 分区、分桶和文件格式怎么选
- Hive SQL 调优与常见坑
- Metastore 和分区裁剪到底在解决什么问题
- Hive 小文件治理怎么做
- MapJoin、数据倾斜和 SQL 优化怎么配合
- 分区表为什么也可能查得很慢
- 小文件过多为什么会拖垮 Hive
- ORC、Parquet 和 TextFile 怎么选
延伸相关入口如果你更关心离线执行和批处理优化,可以继续到 Spark 专题;如果你正在从离线转向实时链路,也可以继续看 Flink 专题。