加载中...

| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
Hadoop是 Apache 基金会旗下的开源分布式系统框架,起源于 Google 发表的 GFS 与 MapReduce 论文。它让普通商用服务器集群也能可靠地存储和处理海量数据,是现代大数据生态的奠基者。
Hadoop 的设计哲学是「移动计算而非移动数据」,即把计算任务调度到数据所在节点执行,减少网络传输开销。它通过数据多副本与任务重试机制实现高容错,即便部分节点宕机,作业仍能正常完成。
Hadoop 适合海量数据的离线批处理,如日志分析、数据仓库构建与 ETL。围绕它衍生出 Hive、HBase、Pig、Sqoop、Oozie 等丰富组件。尽管 Spark、Flink 等新框架在计算性能上更优,HDFS 至今仍是许多企业数据湖的底层存储基石。

| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧