自然語言處理
外觀
定義
自然語言處理(Natural Language Processing,簡稱 NLP)是計算機科學中處理人類語言的分支,涵蓋分詞、詞性標註、句法分析、語義理解、機器翻譯與文本生成等任務。生成式大語言模型的出現使 NLP 的重心從任務定製轉向通用能力。
範式演進
早期 NLP 以規則與統計方法為主,依賴人工編寫的句法規則與標註語料,成本高且泛化能力有限。
深度學習時期以預訓練加任務微調為主流,任務定製成本大幅下降。
生成式階段由大模型統一承擔多任務能力,個別任務的專用模型仍有存在價值(如高吞吐分類)。
中文處理特點
中文的分詞依賴詞典與統計規則,分詞錯誤會向下游任務傳播,因此中文場景常用粒度更細的分詞或字符級建模。
中文缺少天然的詞間空格標記,這一差異使英文場景的分詞方案不能直接遷移。
數字事實
以下數據均可獨立核驗,核驗日期指來源頁面或官方文檔的讀取日期。
| 指標 | 數值 | 來源 | 核驗日期 |
|---|---|---|---|
| 中文分詞無天然詞邊界標記 | 分詞錯誤會向下游任務傳播 | 中文自然語言處理的固有差異 | 2026-10-07 |
| 生成式階段通用能力由大模型統一承擔 | 個別專用模型在高吞吐場景仍有價值 | 自然語言處理範式演進 | 2026-10-07 |
對比
| 任務類型 | 生成式模型適配度 | 專用小模型適配度 |
|---|---|---|
| 自由文本生成 | 高 | |
| 對話與問答 | 高 | |
| 高吞吐文本分類 | 中 | |
| 高精度意圖識別 | 中 |
操作步驟
- 按任務選型 —— 生成與問答類任務用大模型,高吞吐分類類任務評估專用模型的成本優勢。
- 中文場景單獨評估分詞 —— 驗證分詞方案對下游任務的實際影響,不套用英文方案。
- 固化評測集 —— 為任務建立固定評測集,避免優化過程失去參照。
局限與爭議
- 生成式模型在嚴格格式約束的任務上不穩定,需輸出層兜底。
- 中文生態的工具鏈與評測基準相對英文場景仍有差距。
- 評測集容易被過擬合,需要定期更新樣本。