加载中...

| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
Apache Spark是一个开源的统一分布式计算引擎,以内存计算为核心,显著提升了大规模数据处理的速度。相比 MapReduce 将中间结果落盘,Spark 把数据缓存在内存中迭代,迭代类任务可快上数十倍。
Spark 提供统一的多场景能力:Spark SQL 处理结构化数据与数仓查询,Spark Streaming 与 Structured Streaming 支持流式计算,MLlib 提供机器学习算法,GraphX 用于图计算。
Spark 广泛用于 ETL、交互式数据分析、实时计算与大规模机器学习训练。它可运行在 YARN、Mesos、Kubernetes 之上,并读写 HDFS、Hive、Kafka 等多种数据源,已成为企业大数据平台的主流计算引擎。

| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧