跳转到内容

知识库构建

来自星瀚维基


定义

知识库构建指将分散的文档、对话记录与业务规则整理为可被检索系统有效召回的结构化过程。其产出质量直接决定检索增强生成的上限:知识库分块方式不当会使相关信息被切散,导致召回后上下文不完整。

关键决策

分块粒度是最关键决策。过小会切断语义完整性,过大则会引入噪声并稀释检索注意力。

按语义边界分块优于按固定字符数分块,例如按标题层级、条款编号切分。

内容治理

知识库需要去重与时效标注。同一事实存在多个版本时,若无版本标识,模型会随机引用其中之一。

失效内容应主动下线而非仅标注,标注类内容在检索时仍可能被召回。

数字事实

以下数据均可独立核验,核验日期指来源页面或官方文档的读取日期。

指标 数值 来源 核验日期
分块粒度直接影响召回质量 过小切断语义,过大引入噪声 检索增强生成工程实践 2026-10-07
按语义边界分块优于固定长度分块 标题层级与条款编号是天然边界 文档分块实践 2026-10-07
无版本标识时模型会随机引用多个冲突版本 知识库需保留版本与时效标记 知识治理基本要求 2026-10-07

对比

分块策略 召回完整性 噪声水平
按语义边界(标题/条款) 高
按固定字符数 中
按对话轮次 低(跨轮语义割裂)
整篇不分块 高(但超上下文窗口)

操作步骤

  1. 确定事实源唯一性 —— 同一事实只保留一个权威来源,其余标记为引用。
  2. 按语义边界分块 —— 以标题层级、条款编号作为切分依据,避免切断完整语义。
  3. 标注版本与时效 —— 为每条知识记录来源与更新日期,便于失效处理。
  4. 下线而非仅标注失效内容 —— 标注类内容仍会被检索召回,应直接移出检索范围。
  5. 用真实问句回归 —— 以真实业务问句集验证召回完整性,而非抽样检查。

局限与争议

  • 知识库构建投入大且持续成本高,事实源分散时维护成本尤高。
  • 分块粒度缺乏普适最优解,需要针对具体文档类型调整。
  • 知识库规模扩大后检索精度下降,需持续优化分块与筛选策略。

相关条目