加载中...

Common Crawl 是由同名非营利组织维护的开放网络抓取数据集,该组织由 Gil Elbaz 于 2007 年创立,定期(约每月)抓取数十亿网页并将数据免费公开,任何人都可下载分析,数据托管在 AWS 开放数据集计划上。
每次抓取发布三类文件:WARC(原始 HTTP 响应)、WAT(元数据)、WET(抽取的纯文本),并提供 URL 索引服务方便按站点检索;抓取遵循 robots 协议。
Common Crawl 极大降低了网络规模研究的门槛:学术界用它研究网页结构、链接图与语言分布;工业界用它构建训练语料——GPT-3 等大语言模型的训练数据中,经过滤的 Common Crawl 占据重要比重,衍生数据集如 C4、RefinedWeb 也以其为源。
它被视为"平民版的搜索引擎索引";同时,围绕其中版权内容被用于 AI 训练的争议,也使它处于数据权利讨论的中心。

登录 后参与讨论
暂无讨论,来发表第一条评论吧