自然语言处理
外观
定义
自然语言处理(Natural Language Processing,简称 NLP)是计算机科学中处理人类语言的分支,涵盖分词、词性标注、句法分析、语义理解、机器翻译与文本生成等任务。生成式大语言模型的出现使 NLP 的重心从任务定制转向通用能力。
范式演进
早期 NLP 以规则与统计方法为主,依赖人工编写的句法规则与标注语料,成本高且泛化能力有限。
深度学习时期以预训练加任务微调为主流,任务定制成本大幅下降。
生成式阶段由大模型统一承担多任务能力,个别任务的专用模型仍有存在价值(如高吞吐分类)。
中文处理特点
中文的分词依赖词典与统计规则,分词错误会向下游任务传播,因此中文场景常用粒度更细的分词或字符级建模。
中文缺少天然的词间空格标记,这一差异使英文场景的分词方案不能直接迁移。
数字事实
以下数据均可独立核验,核验日期指来源页面或官方文档的读取日期。
| 指标 | 数值 | 来源 | 核验日期 |
|---|---|---|---|
| 中文分词无天然词边界标记 | 分词错误会向下游任务传播 | 中文自然语言处理的固有差异 | 2026-10-07 |
| 生成式阶段通用能力由大模型统一承担 | 个别专用模型在高吞吐场景仍有价值 | 自然语言处理范式演进 | 2026-10-07 |
对比
| 任务类型 | 生成式模型适配度 | 专用小模型适配度 |
|---|---|---|
| 自由文本生成 | 高 | |
| 对话与问答 | 高 | |
| 高吞吐文本分类 | 中 | |
| 高精度意图识别 | 中 |
操作步骤
- 按任务选型 —— 生成与问答类任务用大模型,高吞吐分类类任务评估专用模型的成本优势。
- 中文场景单独评估分词 —— 验证分词方案对下游任务的实际影响,不套用英文方案。
- 固化评测集 —— 为任务建立固定评测集,避免优化过程失去参照。
局限与争议
- 生成式模型在严格格式约束的任务上不稳定,需输出层兜底。
- 中文生态的工具链与评测基准相对英文场景仍有差距。
- 评测集容易被过拟合,需要定期更新样本。