加载中...
现代搜索引擎通过爬虫、索引、排序三个核心环节,在毫秒内从数千亿网页中找到最相关的结果。Google PageRank 是奠基性算法,但今天的排序已综合数百个信号,BERT 神经网络让搜索引擎真正理解自然语言查询意图。

| 类型 | 信息检索系统 |
| 核心数据结构 | 倒排索引 |
| 关键算法演进 | PageRank(1998)→ 学习排序(2005)→ BERT(2019) |
搜索引擎的起点是网络爬虫(Spider/Crawler),持续抓取网页并发现新链接。Google 自称每天处理超过 300 亿个 URL。爬取的网页经过解析后,提取文字内容,建立倒排索引(Inverted Index):这是一个词语到「包含该词语的文档列表」的映射,是全文检索的基础数据结构。
为了支持数千亿网页规模的索引,Google 开发了 Bigtable(分布式列式存储)和 MapReduce(并行计算框架),这两篇论文(2004-2006 年)直接催生了 Hadoop 和大数据生态。[1]
PageRank(1998)将网页间的链接视为「投票」,被权威网页链接的网页获得更高分数,这一算法让 Google 击败当时的 Yahoo 和 AltaVista。但链接信号容易被 SEO 操控,Google 后续引入了数百个额外信号:点击率、停留时长、移动端友好性、页面加载速度等。
2019 年 Google 将 BERT 引入搜索,让系统能理解查询中介词、代词的语义(如「巴西旅行者去美国需要签证」和「美国人去巴西需要签证」不再返回相同结果)。2023 年起,搜索结果页开始融入大语言模型生成的摘要(SGE/AI Overviews),改变了传统「十个蓝链接」的布局。

| 类型 | 信息检索系统 |
| 核心数据结构 | 倒排索引 |
| 关键算法演进 | PageRank(1998)→ 学习排序(2005)→ BERT(2019) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧