跳至內容

自然語言處理

出自星瀚维基


定義

自然語言處理(Natural Language Processing,簡稱 NLP)是計算機科學中處理人類語言的分支,涵蓋分詞、詞性標註、句法分析、語義理解、機器翻譯與文本生成等任務。生成式大語言模型的出現使 NLP 的重心從任務定製轉向通用能力。

範式演進

早期 NLP 以規則與統計方法為主,依賴人工編寫的句法規則與標註語料,成本高且泛化能力有限。

深度學習時期以預訓練加任務微調為主流,任務定製成本大幅下降。

生成式階段由大模型統一承擔多任務能力,個別任務的專用模型仍有存在價值(如高吞吐分類)。

中文處理特點

中文的分詞依賴詞典與統計規則,分詞錯誤會向下游任務傳播,因此中文場景常用粒度更細的分詞或字符級建模。

中文缺少天然的詞間空格標記,這一差異使英文場景的分詞方案不能直接遷移。

數字事實

以下數據均可獨立核驗,核驗日期指來源頁面或官方文檔的讀取日期。

指標 數值 來源 核驗日期
中文分詞無天然詞邊界標記 分詞錯誤會向下游任務傳播 中文自然語言處理的固有差異 2026-10-07
生成式階段通用能力由大模型統一承擔 個別專用模型在高吞吐場景仍有價值 自然語言處理範式演進 2026-10-07

對比

任務類型 生成式模型適配度 專用小模型適配度
自由文本生成 高
對話與問答 高
高吞吐文本分類 中
高精度意圖識別 中

操作步驟

  1. 按任務選型 —— 生成與問答類任務用大模型,高吞吐分類類任務評估專用模型的成本優勢。
  2. 中文場景單獨評估分詞 —— 驗證分詞方案對下游任務的實際影響,不套用英文方案。
  3. 固化評測集 —— 為任務建立固定評測集,避免優化過程失去參照。

局限與爭議

  • 生成式模型在嚴格格式約束的任務上不穩定,需輸出層兜底。
  • 中文生態的工具鏈與評測基準相對英文場景仍有差距。
  • 評測集容易被過擬合,需要定期更新樣本。

相關條目