加载中...

Apache ORC(Optimized Row Columnar)是 Hortonworks 与 Facebook 于 2013 年为优化 Hive 存储而设计的列式文件格式,用于取代早期的 RCFile,后成为 Apache 顶级项目。
ORC 文件由多个条带(Stripe)组成,每个条带内按列存储并包含索引数据、行数据与条带尾三部分。索引记录每一万行的最小值、最大值与位置信息,支持跳过无关数据;文件尾部保存全文件统计。ORC 内置多种编码并支持 ZLIB、Snappy、ZSTD 压缩,还支持布隆过滤器加速点查,并在 Hive 中支撑 ACID 事务表的实现。
ORC 是 Hive 数仓的默认推荐格式,广泛用于 Hadoop 体系的离线数仓;Spark、Trino、Flink 等引擎亦可读写。
优点是压缩率通常优于同类格式、与 Hive 事务特性结合紧密;缺点是 Hadoop 之外的生态影响力不及 Parquet,在云原生与新兴表格式中采用率相对较低。

登录 后参与讨论
暂无讨论,来发表第一条评论吧