跳转到内容

自然语言处理

来自星瀚维基


定义

自然语言处理(Natural Language Processing,简称 NLP)是计算机科学中处理人类语言的分支,涵盖分词、词性标注、句法分析、语义理解、机器翻译与文本生成等任务。生成式大语言模型的出现使 NLP 的重心从任务定制转向通用能力。

范式演进

早期 NLP 以规则与统计方法为主,依赖人工编写的句法规则与标注语料,成本高且泛化能力有限。

深度学习时期以预训练加任务微调为主流,任务定制成本大幅下降。

生成式阶段由大模型统一承担多任务能力,个别任务的专用模型仍有存在价值(如高吞吐分类)。

中文处理特点

中文的分词依赖词典与统计规则,分词错误会向下游任务传播,因此中文场景常用粒度更细的分词或字符级建模。

中文缺少天然的词间空格标记,这一差异使英文场景的分词方案不能直接迁移。

数字事实

以下数据均可独立核验,核验日期指来源页面或官方文档的读取日期。

指标 数值 来源 核验日期
中文分词无天然词边界标记 分词错误会向下游任务传播 中文自然语言处理的固有差异 2026-10-07
生成式阶段通用能力由大模型统一承担 个别专用模型在高吞吐场景仍有价值 自然语言处理范式演进 2026-10-07

对比

任务类型 生成式模型适配度 专用小模型适配度
自由文本生成 高
对话与问答 高
高吞吐文本分类 中
高精度意图识别 中

操作步骤

  1. 按任务选型 —— 生成与问答类任务用大模型,高吞吐分类类任务评估专用模型的成本优势。
  2. 中文场景单独评估分词 —— 验证分词方案对下游任务的实际影响,不套用英文方案。
  3. 固化评测集 —— 为任务建立固定评测集,避免优化过程失去参照。

局限与争议

  • 生成式模型在严格格式约束的任务上不稳定,需输出层兜底。
  • 中文生态的工具链与评测基准相对英文场景仍有差距。
  • 评测集容易被过拟合,需要定期更新样本。

相关条目