加载中...

Apache Iceberg 是一种面向超大规模分析数据集的开放表格式(Open Table Format),最初由 Netflix 开发以解决 Hive 表在正确性与性能上的顽疾,2018 年捐赠给 Apache 基金会并毕业为顶级项目。它在 Parquet、ORC 等文件之上定义了一层表级元数据规范。
Iceberg 通过快照(Snapshot)机制提供 ACID 事务与串行化隔离,写入以原子方式切换元数据指针,读写互不阻塞;支持时间旅行查询与版本回滚;模式演进(增删改列)只改元数据、不重写数据;隐藏分区将分区逻辑从查询中解耦;清单文件记录列级统计,查询引擎据此高效裁剪文件。
Spark、Flink、Trino、StarRocks、Doris 等主流引擎均支持 Iceberg。2024 年 Databricks 收购 Iceberg 商业化公司 Tabular,Snowflake 亦全面拥抱 Iceberg,它与 Delta Lake、Apache Hudi 并列为三大湖仓表格式,且事实标准地位日益突出。

登录 后参与讨论
暂无讨论,来发表第一条评论吧