加载中...
以原始格式存储海量结构化、半结构化和非结构化数据的集中式存储库,延迟 Schema 定义到查询时(Schema-on-Read)。与数据仓库的 Schema-on-Write 相比,存储成本更低、灵活性更高,但查询质量依赖数据治理水平。

| 类型 | 数据架构 / 大数据存储 |
| 术语提出者 | James Dixon, Pentaho, 2010 年 |
| 主流存储格式 | Parquet, ORC, Delta Lake, Apache Iceberg |
数据湖这个词由 Pentaho 联合创始人 James Dixon 于 2010 年提出,他把数据水库(Data Mart)比作预先装瓶的水,把数据湖比作天然湖泊,用的时候直接取原水。Hadoop HDFS 的普及让廉价存储大量原始数据成为可能,AWS S3 进一步降低了门槛。主流存储格式:Apache Parquet 是列式格式,对分析查询友好;Apache Iceberg 和 Delta Lake 加入 ACID 事务、时间旅行(Time Travel)、Schema 演化,让数据湖具备了接近数据仓库的可靠性。[1]
没有治理的数据湖会变成数据沼泽(Data Swamp):数据杂乱堆放,没有分类、没有 Schema 文档、没有数据质量检测,查询时根本不知道哪个字段可信。防止数据沼泽需要配套建设数据目录(Data Catalog,如 Apache Atlas、AWS Glue Catalog)、数据血缘(Lineage)追踪和定期质量检查,这是实践中最容易被低估的工作量。

| 类型 | 数据架构 / 大数据存储 |
| 术语提出者 | James Dixon, Pentaho, 2010 年 |
| 主流存储格式 | Parquet, ORC, Delta Lake, Apache Iceberg |
登录 后参与讨论
暂无讨论,来发表第一条评论吧