加载中...

Apache Hudi(Hadoop Upserts Deletes and Incrementals)是最初由 Uber 开发并捐赠给 Apache 基金会的数据湖存储框架,在廉价存储之上引入了数据库式的表语义。
Hudi 将数据组织为带时间线(Timeline)的表,通过记录每次提交的元数据实现 ACID 事务与快照隔离。它提供两种表类型:Copy on Write 在写入时合并生成新的列式文件,读取性能好;Merge on Read 先写行式日志文件再异步合并,写入延迟更低。核心能力包括 Upsert(按主键更新)、增量拉取(Incremental Query)与数据删除,适合满足 GDPR 等合规删除需求。
Hudi 常与 Spark、Flink 配合,用于构建准实时数据湖:上游通过 CDC 捕获数据库变更,经流式作业写入 Hudi 表,下游用 Presto/Trino、Hive 等引擎查询。它与 Apache Iceberg、Delta Lake 并称三大数据湖表格式。
优点是对更新删除场景支持成熟、增量处理能力强;缺点是概念与调优参数较多,小文件管理和合并策略需要精细配置。

登录 后参与讨论
暂无讨论,来发表第一条评论吧