加载中...

MPP(Massively Parallel Processing,大规模并行处理)是分析型数据库领域的经典体系结构:由多台独立节点组成集群,每个节点拥有自己的 CPU、内存与存储(Shared Nothing,无共享),数据水平切分到各节点,查询被分解后在所有节点上并行执行。
数据通常按哈希或范围分布键切分存放;查询进入后由协调节点生成分布式执行计划,各节点扫描并计算本地数据分片,涉及跨节点的 Join 或聚合时通过网络重分布(Shuffle)或广播小表完成,最后汇总结果。理想情况下性能随节点数近似线性扩展。与依赖共享存储的 SMP 架构相比,MPP 消除了集中式瓶颈;与 MapReduce 相比,MPP 采用流水线执行、中间结果不落盘,延迟低得多,但大作业容错较弱。
Teradata、Greenplum、Vertica、ClickHouse 集群、Doris、StarRocks、Redshift 等分析型数据库均属 MPP 体系。
MPP 是现代 OLAP 的基石;其短板在于数据倾斜敏感、扩缩容需重分布数据,云时代常与存算分离结合演进。

登录 后参与讨论
暂无讨论,来发表第一条评论吧