它是什么
把长文档拆成大小合适的小块再建索引,切法直接决定了之后能检索到哪一段。
为什么重要
同样是「上传一份 PDF 问问题答不准」,很多人先去怪模型,其实第一步该看切分。切分是知识库效果最容易被忽略的一环,也是最不该省的一步。
打个比方
像给一本书做书签:如果一刀切下去正好把一段话劈成两半,读者按书签找过去就永远读不懂。
举个例子
把一学期的教研方案丢进知识库,按固定字数硬切后提问「期中以后如何分层布置作业」,召回的多半是半句话;改成按标题层级和段落边界切,并让相邻块有少量重叠,答案通常立刻变得可用。
常见误解
误解:切得越碎检索越准。 事实:碎块会丢掉上下文,答案可能缺前提;过大又混进无关内容,同样干扰判断。
误解:块大小是唯一要调的参数。 事实:切分依据(标题、段落、表格)、重叠长度、是否保留标题层级同样关键。
误解:切好一次就不用再管了。 事实:资料更新后要重新切分和建索引,这一步常被忘掉,导致检索仍命中旧版本。
误解:表格和扫描件也能照常切。 事实:表格被横向切开就会错行,扫描件得先识别成文本再切,否则基本无效。
延伸阅读(相关概念)
本页内容更新于 2026 年 9 月 30 日。概念条目会随模型能力变化而修订。