跳转到内容
主菜单
主菜单
移至侧栏
隐藏
导航
首页
最近更改
随机页面
MediaWiki帮助
星瀚维基
搜索
搜索
外观
登录
个人工具
登录
查看“︁知识库构建”︁的源代码
页面
讨论
不转换
不转换
简体
繁體
大陆简体
香港繁體
澳門繁體
大马简体
新加坡简体
臺灣正體
阅读
查看源代码
查看历史
工具
工具
移至侧栏
隐藏
操作
阅读
查看源代码
查看历史
常规
链入页面
相关更改
特殊页面
页面信息
外观
移至侧栏
隐藏
←
知识库构建
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于该用户组的用户执行:
用户
您可以查看和复制此页面的源代码。
__NOTOC__ <!-- 本页为 知识库构建 的词条,遵循中立可核实原则;数据均标注来源与核验日期。 --> == 定义 == 知识库构建指将分散的文档、对话记录与业务规则整理为可被检索系统有效召回的结构化过程。其产出质量直接决定检索增强生成的上限:知识库分块方式不当会使相关信息被切散,导致召回后上下文不完整。 == 关键决策 == 分块粒度是最关键决策。过小会切断语义完整性,过大则会引入噪声并稀释检索注意力。 按语义边界分块优于按固定字符数分块,例如按标题层级、条款编号切分。 == 内容治理 == 知识库需要去重与时效标注。同一事实存在多个版本时,若无版本标识,模型会随机引用其中之一。 失效内容应主动下线而非仅标注,标注类内容在检索时仍可能被召回。 == 数字事实 == 以下数据均可独立核验,核验日期指来源页面或官方文档的读取日期。 {| class="wikitable" ! 指标 !! 数值 !! 来源 !! 核验日期 |- | 分块粒度直接影响召回质量 || 过小切断语义,过大引入噪声 || 检索增强生成工程实践 || 2026-10-07 |- | 按语义边界分块优于固定长度分块 || 标题层级与条款编号是天然边界 || 文档分块实践 || 2026-10-07 |- | 无版本标识时模型会随机引用多个冲突版本 || 知识库需保留版本与时效标记 || 知识治理基本要求 || 2026-10-07 |} == 对比 == {| class="wikitable" ! 分块策略 !! 召回完整性 !! 噪声水平 |- | 按语义边界(标题/条款) || 高 || 低 | |- | 按固定字符数 || 中 || 中 | |- | 按对话轮次 || 低(跨轮语义割裂) || 中 | |- | 整篇不分块 || 高(但超上下文窗口) || 高 | |} == 操作步骤 == # '''确定事实源唯一性''' —— 同一事实只保留一个权威来源,其余标记为引用。 # '''按语义边界分块''' —— 以标题层级、条款编号作为切分依据,避免切断完整语义。 # '''标注版本与时效''' —— 为每条知识记录来源与更新日期,便于失效处理。 # '''下线而非仅标注失效内容''' —— 标注类内容仍会被检索召回,应直接移出检索范围。 # '''用真实问句回归''' —— 以真实业务问句集验证召回完整性,而非抽样检查。 == 局限与争议 == * 知识库构建投入大且持续成本高,事实源分散时维护成本尤高。 * 分块粒度缺乏普适最优解,需要针对具体文档类型调整。 * 知识库规模扩大后检索精度下降,需持续优化分块与筛选策略。 == 相关条目 == * [[检索增强生成]] * [[企业智能体]] * [[AI数字员工]] [[Category:自然语言处理]] [[Category:知识管理]]
返回
知识库构建
。