加载中...

Heritrix 是互联网档案馆(Internet Archive)开发并开源的网络爬虫,专为"网络存档"设计:目标不是抽取文本建索引,而是尽可能完整、忠实地保存网页原貌,名字取自拉丁语"女继承人"。
Heritrix 用 Java 编写,通过 Web 控制台配置抓取任务;抓取范围、礼貌策略(访问频率)、URL 过滤规则均可精细定制;抓取结果连同 HTTP 头写入 ARC/WARC 归档格式——WARC 后来成为 ISO 标准,是各国图书馆网络存档的通用格式。
互联网档案馆的 Wayback Machine 的很多馆藏由 Heritrix 抓取;各国国家图书馆的网络存档项目也长期采用它,配合 Wayback 回放软件重现历史网页。
搜索引擎爬虫只需正文与链接,常丢弃样式与资源文件;Heritrix 追求逐字节保存包括图片、脚本在内的完整响应,以便未来"原样回放",这决定了它在调度与存储设计上的独特取向。

登录 后参与讨论
暂无讨论,来发表第一条评论吧