加载中...

Apache Impala 是 Cloudera 于 2012 年发布并开源的分布式 SQL 查询引擎,灵感来自 Google Dremel 论文,目标是在 Hadoop 数据上提供低延迟的交互式查询,2017 年成为 Apache 顶级项目。
Impala 完全绕开 MapReduce,用 C++ 实现常驻的守护进程(impalad)直接读取 HDFS、Kudu、HBase 中的数据。每个节点上的 impalad 均可接收查询并担任协调者,将执行计划分发给其他节点并行处理;配合 LLVM 运行时代码生成技术,把查询逻辑编译为本地机器码执行,显著降低解释开销。它复用 Hive Metastore 的元数据,与 Hive 表无缝互通。
Impala 常见于 Cloudera CDH/CDP 平台,用于数据分析师对 Hive 数仓做秒级即席查询,搭配 Parquet 与 Kudu 效果最佳。
优点是延迟低、与 Hadoop 生态集成深;缺点是内存消耗大、容错能力弱,且社区活跃度随 Hadoop 生态收缩而下降。

登录 后参与讨论
暂无讨论,来发表第一条评论吧