加载中...
语义分块是检索增强生成中的文档切分策略,依据文本语义边界而非固定长度来划分片段,使每个块内容主题集中、更利于向量检索。它能提升检索相关性和生成答案的准确性。

| 中文名 | 语义分块 |
| 英文名 | Semantic Chunking |
| 所属领域 | 检索增强生成 |
| 切分依据 | 语义相似度 |
| 目标 | 提升检索相关性 |
语义分块(Semantic Chunking)是一种在检索增强生成(RAG)系统中对长文档进行切分的方法,其核心思想是按照文本的语义连贯性来确定切分点,而不是简单地按固定字符数或固定 token 数硬切。这样得到的每个文本块在主题上更集中,更适合作为检索和生成的基本单元。
在构建 RAG 知识库时,需要先把文档切成小块,再对每块生成向量嵌入并存入向量库。若采用固定长度切分,常常会把一句话或一个完整论述从中间切断,导致块内语义破碎、检索时相关性下降。语义分块通过分析句子之间的语义相似度,在主题发生明显转折的位置设定边界,尽量让每个块都是一个语义完整的单元。
语义分块广泛用于企业知识库问答、文档助手、法律与医疗文本检索等 RAG 应用中。当文档结构松散、主题跳跃频繁时,它相比固定长度切分能明显提升检索命中率,减少无关内容混入上下文,从而降低模型答非所问和产生幻觉的概率。
问:语义分块一定比固定长度切分好吗?答:多数情况下检索质量更高,但它计算开销更大。对结构规整的文档,按标题或段落切分可能已经足够。
问:块应该切多大?答:没有固定答案,需权衡召回覆盖与上下文精度,通常结合嵌入模型能力和下游模型上下文窗口做实验调优。

| 中文名 | 语义分块 |
| 英文名 | Semantic Chunking |
| 所属领域 | 检索增强生成 |
| 切分依据 | 语义相似度 |
| 目标 | 提升检索相关性 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧