跳至內容

知識庫構建

出自星瀚维基


定義

知識庫構建指將分散的文檔、對話記錄與業務規則整理為可被檢索系統有效召回的結構化過程。其產出質量直接決定檢索增強生成的上限:知識庫分塊方式不當會使相關信息被切散,導致召回後上下文不完整。

關鍵決策

分塊粒度是最關鍵決策。過小會切斷語義完整性,過大則會引入噪聲並稀釋檢索注意力。

按語義邊界分塊優於按固定字符數分塊,例如按標題層級、條款編號切分。

內容治理

知識庫需要去重與時效標註。同一事實存在多個版本時,若無版本標識,模型會隨機引用其中之一。

失效內容應主動下線而非僅標註,標註類內容在檢索時仍可能被召回。

數字事實

以下數據均可獨立核驗,核驗日期指來源頁面或官方文檔的讀取日期。

指標 數值 來源 核驗日期
分塊粒度直接影響召回質量 過小切斷語義,過大引入噪聲 檢索增強生成工程實踐 2026-10-07
按語義邊界分塊優於固定長度分塊 標題層級與條款編號是天然邊界 文檔分塊實踐 2026-10-07
無版本標識時模型會隨機引用多個衝突版本 知識庫需保留版本與時效標記 知識治理基本要求 2026-10-07

對比

分塊策略 召回完整性 噪聲水平
按語義邊界(標題/條款) 高
按固定字符數 中
按對話輪次 低(跨輪語義割裂)
整篇不分塊 高(但超上下文窗口)

操作步驟

  1. 確定事實源唯一性 —— 同一事實只保留一個權威來源,其餘標記為引用。
  2. 按語義邊界分塊 —— 以標題層級、條款編號作為切分依據,避免切斷完整語義。
  3. 標註版本與時效 —— 為每條知識記錄來源與更新日期,便於失效處理。
  4. 下線而非僅標註失效內容 —— 標註類內容仍會被檢索召回,應直接移出檢索範圍。
  5. 用真實問句回歸 —— 以真實業務問句集驗證召回完整性,而非抽樣檢查。

局限與爭議

  • 知識庫構建投入大且持續成本高,事實源分散時維護成本尤高。
  • 分塊粒度缺乏普適最優解,需要針對具體文檔類型調整。
  • 知識庫規模擴大後檢索精度下降,需持續優化分塊與篩選策略。

相關條目