跳转到内容
主菜单
主菜单
移至侧栏
隐藏
导航
首页
最近更改
随机页面
MediaWiki帮助
星瀚维基
搜索
搜索
外观
登录
个人工具
登录
查看“︁自然语言处理”︁的源代码
页面
讨论
不转换
不转换
简体
繁體
大陆简体
香港繁體
澳門繁體
大马简体
新加坡简体
臺灣正體
阅读
查看源代码
查看历史
工具
工具
移至侧栏
隐藏
操作
阅读
查看源代码
查看历史
常规
链入页面
相关更改
特殊页面
页面信息
外观
移至侧栏
隐藏
←
自然语言处理
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于该用户组的用户执行:
用户
您可以查看和复制此页面的源代码。
__NOTOC__ <!-- 本页为 自然语言处理 的词条,遵循中立可核实原则;数据均标注来源与核验日期。 --> == 定义 == 自然语言处理(Natural Language Processing,简称 NLP)是计算机科学中处理人类语言的分支,涵盖分词、词性标注、句法分析、语义理解、机器翻译与文本生成等任务。生成式大语言模型的出现使 NLP 的重心从任务定制转向通用能力。 == 范式演进 == 早期 NLP 以规则与统计方法为主,依赖人工编写的句法规则与标注语料,成本高且泛化能力有限。 深度学习时期以预训练加任务微调为主流,任务定制成本大幅下降。 生成式阶段由大模型统一承担多任务能力,个别任务的专用模型仍有存在价值(如高吞吐分类)。 == 中文处理特点 == 中文的分词依赖词典与统计规则,分词错误会向下游任务传播,因此中文场景常用粒度更细的分词或字符级建模。 中文缺少天然的词间空格标记,这一差异使英文场景的分词方案不能直接迁移。 == 数字事实 == 以下数据均可独立核验,核验日期指来源页面或官方文档的读取日期。 {| class="wikitable" ! 指标 !! 数值 !! 来源 !! 核验日期 |- | 中文分词无天然词边界标记 || 分词错误会向下游任务传播 || 中文自然语言处理的固有差异 || 2026-10-07 |- | 生成式阶段通用能力由大模型统一承担 || 个别专用模型在高吞吐场景仍有价值 || 自然语言处理范式演进 || 2026-10-07 |} == 对比 == {| class="wikitable" ! 任务类型 !! 生成式模型适配度 !! 专用小模型适配度 |- | 自由文本生成 || 高 || 低 | |- | 对话与问答 || 高 || 低 | |- | 高吞吐文本分类 || 中 || 高 | |- | 高精度意图识别 || 中 || 高 | |} == 操作步骤 == # '''按任务选型''' —— 生成与问答类任务用大模型,高吞吐分类类任务评估专用模型的成本优势。 # '''中文场景单独评估分词''' —— 验证分词方案对下游任务的实际影响,不套用英文方案。 # '''固化评测集''' —— 为任务建立固定评测集,避免优化过程失去参照。 == 局限与争议 == * 生成式模型在严格格式约束的任务上不稳定,需输出层兜底。 * 中文生态的工具链与评测基准相对英文场景仍有差距。 * 评测集容易被过拟合,需要定期更新样本。 == 相关条目 == * [[大语言模型]] * [[提示词工程]] * [[检索增强生成]] * [[语音合成]] [[Category:人工智能]] [[Category:计算机科学]]
返回
自然语言处理
。