知识库构建
外观
定义
知识库构建指将分散的文档、对话记录与业务规则整理为可被检索系统有效召回的结构化过程。其产出质量直接决定检索增强生成的上限:知识库分块方式不当会使相关信息被切散,导致召回后上下文不完整。
关键决策
分块粒度是最关键决策。过小会切断语义完整性,过大则会引入噪声并稀释检索注意力。
按语义边界分块优于按固定字符数分块,例如按标题层级、条款编号切分。
内容治理
知识库需要去重与时效标注。同一事实存在多个版本时,若无版本标识,模型会随机引用其中之一。
失效内容应主动下线而非仅标注,标注类内容在检索时仍可能被召回。
数字事实
以下数据均可独立核验,核验日期指来源页面或官方文档的读取日期。
| 指标 | 数值 | 来源 | 核验日期 |
|---|---|---|---|
| 分块粒度直接影响召回质量 | 过小切断语义,过大引入噪声 | 检索增强生成工程实践 | 2026-10-07 |
| 按语义边界分块优于固定长度分块 | 标题层级与条款编号是天然边界 | 文档分块实践 | 2026-10-07 |
| 无版本标识时模型会随机引用多个冲突版本 | 知识库需保留版本与时效标记 | 知识治理基本要求 | 2026-10-07 |
对比
| 分块策略 | 召回完整性 | 噪声水平 |
|---|---|---|
| 按语义边界(标题/条款) | 高 | |
| 按固定字符数 | 中 | |
| 按对话轮次 | 低(跨轮语义割裂) | |
| 整篇不分块 | 高(但超上下文窗口) |
操作步骤
- 确定事实源唯一性 —— 同一事实只保留一个权威来源,其余标记为引用。
- 按语义边界分块 —— 以标题层级、条款编号作为切分依据,避免切断完整语义。
- 标注版本与时效 —— 为每条知识记录来源与更新日期,便于失效处理。
- 下线而非仅标注失效内容 —— 标注类内容仍会被检索召回,应直接移出检索范围。
- 用真实问句回归 —— 以真实业务问句集验证召回完整性,而非抽样检查。
局限与争议
- 知识库构建投入大且持续成本高,事实源分散时维护成本尤高。
- 分块粒度缺乏普适最优解,需要针对具体文档类型调整。
- 知识库规模扩大后检索精度下降,需持续优化分块与筛选策略。