Skip to content
Hive 数仓表与 SQL 执行成本 · 第 3 篇 / 共 4 篇
领域数据与中间件
专题Hive 专题
当前序列Hive 数仓表与 SQL 执行成本
阅读位置第 3 篇 / 共 4 篇当前专题第 3 个序列 / 共 3 个序列

ORC、Parquet 和 TextFile 怎么选

很多团队第一次处理“ORC、Parquet 和 TextFile 怎么选”时,最容易犯的错,就是把问题看成二选一,然后急着下结论。

但真正落到 离线数仓链路 里,判断通常不只看一个点,而是要同时把 表分区、文件数量和 SQL 执行成本 放到同一张表里看。

先说结论

  • 不要先追求唯一标准答案,先看 表分区、文件数量和 SQL 执行成本 这几个维度哪个更敏感。
  • 把 离线数仓链路 里的调用链和失败路径一起看,结论会比只背术语稳得多。
  • 真正靠谱的做法,是让方案、观测和兜底动作同时成套出现。

一、先把对比维度拆开

这个问题真正难的地方,不是概念本身,而是不同团队关注的优先级不同。

更稳的拆法通常是:

  • 先看正确性和一致性
  • 再看资源成本和复杂度
  • 最后看与上下游系统的配合成本

如果这三层没有拆开,讨论很容易停留在“大家都觉得自己对”。

二、放回真实场景再做判断

在 离线数仓链路 里,很多方案本身并没有绝对优劣,真正决定选择的,往往是:

  • 你的数据规模和流量波动有多大
  • 当前系统更怕性能抖动,还是更怕一致性失真
  • 团队能不能长期维护这套方案

也就是说,选型最好不是“背答案”,而是把业务约束写清楚后再做取舍。

三、工程上更稳的落地方式

比较成熟的做法通常是:

  1. 先把核心约束写成判断清单
  2. 用一两个典型链路做压测或验证
  3. 给失败场景准备兜底和回退手段

这样做的价值在于,即使后面流量、团队或业务形态变化,方案也更容易继续演进。

四、最常见的误判

这类问题最常见的误区有三个:

  • 只看当前实现成本,不看长期治理成本
  • 只看单机表现,不看集群和上下游联动
  • 只看正常路径,不看失败恢复和回滚动作

一旦把这些边界补上,很多“纠结很久的问题”其实会很快清楚。

一句话总结

ORC、Parquet 和 TextFile 怎么选 这类问题,本质上不是记忆题,而是约束题。把 表分区、文件数量和 SQL 执行成本 这些关键因素拆开看,结论才会更稳。

延伸阅读相关文章优先当前专题,再补跨专题关联。
同一序列 · 顺着当前主线继续读动态分区写入需要关注哪些配置适合把分区表、小文件、存储格式和动态分区写入放在一条 Hive 数仓治理主线上看。Hive 专题 · Hive 数仓表与 SQL 执行成本同一序列 · 回看前文会更完整小文件过多为什么会拖垮 Hive适合把分区表、小文件、存储格式和动态分区写入放在一条 Hive 数仓治理主线上看。Hive 专题 · Hive 数仓表与 SQL 执行成本同专题其他序列 · 共享标签:选型对比Hive 分区、分桶和文件格式怎么选适合先把分区分桶和文件格式看明白,再进入 SQL 调优与常见坑。Hive 专题 · Hive 表设计与 SQL 调优同专题其他序列 · Hive 元数据与治理细节Hive 小文件治理怎么做适合把 Metastore、小文件和倾斜优化放在一起看。Hive 专题 · Hive 元数据与治理细节跨专题关联 · 同场景:方案选型半同步复制和异步复制怎么选适合把 next-key lock、一致性读、复制延迟和分库分表边界放回同一条一致性主线上判断。MySQL 专题 · MySQL 事务、锁与高可用边界跨专题关联 · 同场景:方案选型分词器、Tokenizer 和 IK 到底怎么选适合把分词、复杂查询和深分页放到一起深入看。Elasticsearch 专题 · Elasticsearch 查询与分析细节
继续阅读Hive 数仓表与 SQL 执行成本当前序列第 3 篇 / 共 4 篇当前专题第 3 个序列 / 共 3 个序列
往前看
上一篇小文件过多为什么会拖垮 Hive回到当前序列上一章上一序列Hive 元数据与治理细节从第 1 篇开始:Metastore 和分区裁剪到底在解决什么问题
往后看
下一篇动态分区写入需要关注哪些配置继续当前序列下一章下一序列Spark 作业执行与性能判断从第 1 篇开始:窄依赖和宽依赖怎么影响执行计划

把零散经验整理成可查、可复用、可持续更新的企业级知识门户