加载中...

| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
Apache Hive是建立在 Hadoop 之上的数据仓库基础设施,它让用户能用类 SQL 的查询语言(HiveQL)分析存储在 HDFS 上的海量数据,而无需编写复杂的 MapReduce 程序,大大降低了大数据分析的门槛。
Hive 的核心是将 SQL 查询翻译为底层的分布式计算任务。早期它把 HiveQL 转换为 MapReduce 作业执行,后来支持 Tez、Spark 等更高效的执行引擎。Metastore 是 Hive 的关键组件,负责存储表结构、分区与字段等元数据。
Hive 主要面向离线数据仓库与批量分析,适合 T+1 报表、数据汇总与 ETL 加工。由于基于批处理,它延迟较高,不适合实时查询。在企业数仓分层架构中,Hive 常用于构建 ODS、DWD、DWS 等数据层,是离线数仓的事实标准。

| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧