加载中...
Apache Hive 是构建在 Hadoop 之上的开源数据仓库软件,它把 HDFS 上的海量文件抽象成表,允许用户用类 SQL 语言(HiveQL)进行查询与分析,底层将查询翻译为分布式计算任务执行,是大数据离线分析的经典工具。

| 类型 | 数据仓库软件 |
| 初始发布 | 2010年 |
| 开发者 | Apache 软件基金会 |
| 查询语言 | HiveQL |
| 底层存储 | HDFS |
Apache Hive 是一个建立在 Hadoop 之上的开源数据仓库系统,由 Facebook 于 2008 年前后开发并贡献给 Apache 基金会。它让分析人员能够用熟悉的类 SQL 语法查询存储在 HDFS 中的 PB 级数据,而无需手写复杂的 MapReduce 程序。
Hive 的核心思想是在分布式文件之上叠加一层表结构与元数据管理,把非结构化或半结构化的大文件映射为二维表。用户提交 HiveQL 语句后,Hive 会将其编译成底层执行引擎的作业(如 MapReduce、Tez 或 Spark)在集群上并行运行。Hive 更适合高吞吐的批量离线分析,而不擅长低延迟的实时查询。
Hive 广泛应用于离线数据仓库、日志分析、报表统计与 ETL 加工。在典型的数据平台中,它常作为批处理层,承接埋点日志、交易流水等大规模历史数据的聚合汇总,并把结果输出给 BI 报表或下游系统。
问:Hive 能替代传统数据库吗?答:不能。Hive 面向大数据批量分析,查询延迟通常在秒到分钟级,不支持高并发的行级增删改,不适合在线事务处理,与传统关系库定位互补。
问:Hive 与 Trino、Impala 有什么区别?答:三者都能查询 HDFS 数据,但 Hive 侧重高吞吐批处理,Trino、Impala 侧重交互式低延迟查询,实践中常共用同一份 Metastore 元数据。

| 类型 | 数据仓库软件 |
| 初始发布 | 2010年 |
| 开发者 | Apache 软件基金会 |
| 查询语言 | HiveQL |
| 底层存储 | HDFS |
登录 后参与讨论
暂无讨论,来发表第一条评论吧