加载中...
| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
HDFS(Hadoop Distributed File System)是 Hadoop 的分布式文件系统,专为存储超大规模数据集而设计。它运行在廉价商用硬件之上,通过冗余副本提供高容错与高吞吐的数据访问能力。
HDFS 采用主从架构:
文件被切分为固定大小的数据块(默认 128MB),每块默认保存三个副本分布在不同节点与机架上。这种机制兼顾了容错性与读取的并行度。
HDFS 遵循「一次写入、多次读取」的访问模型,适合批量顺序读取而非频繁随机修改。它面向高吞吐而非低延迟,因此不适合存储大量小文件或要求实时响应的场景。
HDFS 常作为数据湖与数据仓库的底层存储,承载日志、归档与中间计算结果。Hive、Spark、Flink 等上层引擎均可直接读写 HDFS。为缓解 NameNode 单点压力,后续版本引入了联邦机制与高可用主备方案。
| 类别 | 大数据 |
| 领域 | 大数据 / 数据科学 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧