加载中...
| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
批处理是一种将数据积累到一定规模后,集中一次性处理的计算模式。它通常处理有界、静态的大规模历史数据,以高吞吐量为目标,适合对时效要求不高但数据量巨大的离线分析任务。
批处理与流式计算是大数据的两种基本范式:批处理重吞吐、重完整性,适合离线报表与数据仓库构建;流处理重时效、重实时性,适合在线监控与即时响应。现代框架如 Flink 提出流批一体,用统一引擎兼顾两类场景。
批处理广泛用于数据仓库 ETL、离线报表、账单结算、模型训练与大规模数据清洗。典型技术包括 Hadoop MapReduce、Hive 与 Spark,常配合调度系统(如 Airflow、DolphinScheduler)按周期自动运行。
| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧