加载中...

Trino 是开源的分布式 SQL 查询引擎,面向大规模数据的交互式分析。它本身不存储数据,通过连接器直接查询各类数据源,坚持计算与存储分离,以低延迟的 MPP 内存流水线执行著称。
项目起源于 Facebook 2012 年开发的 Presto,用于替代 Hive 的慢速批处理查询。2018 年底,Presto 原创始团队离开 Facebook 后维护社区分支 PrestoSQL;因商标问题,PrestoSQL 于 2020 年 12 月更名为 Trino。原 PrestoDB 仍由 Linux 基金会下的 Presto 基金会维护,两者自此独立演进。
集群由一个 Coordinator(解析、优化、调度)与多个 Worker(执行)组成,采用基于代价的优化器与流水线式内存执行。连接器生态丰富:Hive/Iceberg/Delta Lake 等数据湖表格式、MySQL、PostgreSQL、Kafka、Elasticsearch 等,一条 SQL 可跨源连接多个系统(联邦查询)。较新版本加入容错执行模式(FTE),使其也能承担可靠的批处理(ETL)任务。
Trino 广泛用于数据湖上的即席分析与 BI 查询,Amazon Athena 等云服务亦基于该技术体系构建。

登录 后参与讨论
暂无讨论,来发表第一条评论吧