加载中...
数据仓库是面向分析而非事务处理的数据存储体系,将来自多个业务系统的数据经过 ETL 清洗整合后,按主题存储,为商业智能(BI)和决策支持提供统一的数据源。与 OLTP 数据库的设计目标根本不同。

| 概念提出者 | Bill Inmon,1990年代 |
| 核心技术 | 列式存储、向量化执行、星型/雪花模型 |
| 代表产品 | Redshift、BigQuery、Snowflake、ClickHouse |
OLTP(联机事务处理)数据库的优化目标是大量并发的短事务,每次只读写少量行,查询按主键精确命中。数据仓库的工作负载完全相反:查询少但每次扫描的数据量巨大(可能数十亿行),不做更新只追加历史数据,需要对多个维度做聚合分析(「按地区、按季度、按产品类别统计销售额」)。
这种差异导致数据仓库几乎无一例外地采用列式存储:聚合查询只需读取涉及的几列,而不是每行的所有字段;同列数据类型相同,可以用差分编码、字典压缩等方式大幅压缩;向量化执行引擎能用 SIMD 指令并行处理整批数据。[1]
传统数据仓库的代表是 Teradata 和 Netezza,昂贵但成熟。云时代的主流方案是:

| 概念提出者 | Bill Inmon,1990年代 |
| 核心技术 | 列式存储、向量化执行、星型/雪花模型 |
| 代表产品 | Redshift、BigQuery、Snowflake、ClickHouse |
登录 后参与讨论
暂无讨论,来发表第一条评论吧