检索增强生成
外观
定义
检索增强生成(Retrieval-Augmented Generation,简称 RAG)是在生成前先从外部知识库检索相关资料、并将其作为上下文输入模型的技术。其主要价值是用可更新的外部知识替代模型参数中的记忆,缓解事实过时与领域盲区。
两个决定性环节
检索环节决定召回质量:召回不到则模型无从作答,召回过多则引入噪声并稀释注意力。
生成环节决定忠实度:模型在给定上下文下仍可能引入参数记忆中的错误信息,称为幻觉。
因此 RAG 的效果瓶颈通常在检索而非生成,单纯增大模型规模收益有限。
知识库维护
知识库需要与业务事实源同步更新。知识库滞后会使模型以笃定语气输出过期结论,比不回答更难纠正。
知识库错误会被放大:检索到错误内容时,模型倾向于基于该内容生成看似合理的答案。
数字事实
以下数据均可独立核验,核验日期指来源页面或官方文档的读取日期。
| 指标 | 数值 | 来源 | 核验日期 |
|---|---|---|---|
| RAG 的效果瓶颈通常在检索环节而非生成环节 | 召回质量决定答案可用性 | 检索增强生成工程实践 | 2026-10-07 |
| 检索内容错误时模型倾向于基于错误内容生成答案 | 知识库错误会被放大而非纠正 | 检索增强生成的忠实度问题 | 2026-10-07 |
| RAG 用外部知识替代模型参数记忆 | 使知识可更新而不必重新训练模型 | 检索增强生成的基本设计目标 | 2026-10-07 |
对比
| 维度 | 检索增强生成 | 模型微调 |
|---|---|---|
| 知识更新 | 更新知识库即可 | |
| 事实可溯源 | 可指回原文 | |
| 新增知识成本 | 低 | |
| 风格适配 | 能力有限 | |
| 事实过时风险 | 可控(取决于知识库) |
操作步骤
- 先治理知识源 —— 确认事实源的唯一性与更新责任人,再建知识库。
- 评估召回质量 —— 用真实问句集测召回率,未达标的先改检索不调生成。
- 约束生成忠实度 —— 要求模型仅依据给定上下文作答,缺失信息时明确回答不知。
- 建立失效机制 —— 为知识库设置更新频率与责任人,避免长期滞后。
局限与争议
- RAG 不消除幻觉,只将幻觉从参数记忆转移到上下文理解环节。
- 知识库规模扩大后检索精度下降,需要额外的分块与筛选策略。
- 检索延迟会叠加到整体响应时间中,对实时性要求高的场景不适用。