Skip to content
3 个序列 / 9 篇文章
搜索与分析专题Hive 专题数据与中间件 · 3 个序列 · 9 篇文章重点整理分区分桶、文件格式、离线数仓表设计和 SQL 调优。
所属领域数据与中间件
专题内序列3 个
专题文章9 篇
高频标签
选型对比 · 2MySQL · 2Spark · 1

Hive 专题

起步入口3 组
专题序列3 个
关联文章9 篇
起步入口先选入口
起步入口先补表设计和文件布局离线数仓任务很多性能问题都始于分区、分桶和文件格式没设计好。
起步入口再补 SQL 调优适合开始处理大表 Join、扫描量和任务耗时问题时继续往下看。
起步入口把数仓问题接到计算链路适合已经不只关心表设计,而是要把 Hive 放回离线和实时数据链路里理解的人。
阅读路径按场景进入
入门打底先建立分区分桶和文件格式直觉适合先理解为什么 Hive 的性能问题常常始于表设计不合理。
核心原理把扫描量和执行代价看明白适合理解 Join、文件数量、分区裁剪和数据倾斜对任务耗时的影响。
工程实战围绕数仓表设计继续落地适合开始做离线数仓、明细层与汇总层建模时继续往下用。
案例排障从扫描量高和任务慢现象进入适合离线任务已经出现扫描暴涨、长尾任务和文件过多问题时快速进入。
专题序列Hive 专题本专题共 3 个序列 / 9 篇文章扩容后的文章会继续按序列归档在这里,适合先选一条主线再往下读。
延伸相关入口如果你更关心离线执行和批处理优化,可以继续到 Spark 专题;如果你正在从离线转向实时链路,也可以继续看 Flink 专题。

把零散经验整理成可查、可复用、可持续更新的企业级知识门户