加载中...
| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
MapReduce是 Google 提出、并由 Hadoop 实现的分布式计算编程模型,用于在大规模集群上并行处理海量数据。它将复杂的并行计算抽象为两个简单的函数,极大降低了分布式编程的门槛。
一个 MapReduce 作业分为两个核心阶段:
两阶段之间存在 Shuffle 过程,负责将 Map 输出按键分区、排序并传输给对应的 Reduce 任务,是性能与网络开销的关键环节。
MapReduce 的优势在于良好的扩展性与容错性:任务失败可自动在其他节点重试,集群可线性扩容。但它将中间结果写入磁盘,迭代计算效率较低,这也是 Spark 用内存计算取而代之的主要原因。
MapReduce 适合一次性的大规模离线批处理,如词频统计、日志聚合、倒排索引构建与数据清洗。经典示例 WordCount 至今仍是理解分布式计算的入门教材。
| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧