加载中...

Apache Nutch 是开源网络爬虫与搜索框架,由 Doug Cutting 与 Mike Cafarella 于 2002 年创建,最初目标是打造一个透明、可复现的开源网页搜索引擎,后成为 Apache 顶级项目。
为了让 Nutch 抓取和索引数十亿网页,开发者参照 Google 发表的 GFS 与 MapReduce 论文实现了分布式文件系统与计算框架,这部分代码在 2006 年独立出来成为 Hadoop——Nutch 因此被称为 Hadoop 的摇篮。
Nutch 提供抓取调度、URL 规范化与过滤、页面解析(集成 Apache Tika)、链接图计算与增量抓取,遵循 robots 协议;抓取结果可交给 Solr 或 Elasticsearch 建立索引,插件机制便于扩展。
在通用搜索由巨头垄断后,Nutch 主要用于垂直领域抓取、学术研究与构建领域搜索引擎,Common Crawl 早期也曾使用其技术栈。

登录 后参与讨论
暂无讨论,来发表第一条评论吧