加载中...
RAG 将信息检索与语言生成结合:用向量检索找到最相关的文档片段,再把这些片段作为上下文塞给 LLM 来生成答案。它是解决 LLM 知识截止日期和幻觉问题最成熟的工程方案。

| 类型 | LLM 应用架构模式 |
| 关键组件 | 向量数据库、Embedding 模型、Reranker |
| 常用工具 | LangChain、LlamaIndex、Pinecone、Weaviate |
LLM 的知识固化在训练数据里,有两个关键限制:一是知识截止日期(GPT-4 训练数据到 2023 年底),无法回答最新事件;二是对于私有领域知识(公司内部文档、个人笔记),模型完全不知道,胡说八道(幻觉)的概率极高。
RAG 的解决思路:把外部知识库变成向量数据库,用户提问时先在库里检索最相关的段落,拼接到提示词里作为「参考资料」,让 LLM 基于这些资料回答。相比直接问 LLM,RAG 的答案可以追溯来源,幻觉率明显下降。[1]
一个生产级 RAG 系统远比「检索 + 生成」复杂:
随着 GPT-4 Turbo 128K、Gemini 1.5 Pro 百万 token 上下文的出现,有人质疑「长上下文是否会替代 RAG」。实测结论:超长上下文确实能在文档内找到信息(Needle in a Haystack 测试),但成本高、延迟大,RAG 在大规模知识库(百万文档)场景仍然不可替代。

| 类型 | LLM 应用架构模式 |
| 关键组件 | 向量数据库、Embedding 模型、Reranker |
| 常用工具 | LangChain、LlamaIndex、Pinecone、Weaviate |
登录 后参与讨论
暂无讨论,来发表第一条评论吧