<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="zh">
	<id>https://wiki.gamevod.com/index.php?action=history&amp;feed=atom&amp;title=%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86</id>
	<title>自然语言处理 - 版本历史</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.gamevod.com/index.php?action=history&amp;feed=atom&amp;title=%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86"/>
	<link rel="alternate" type="text/html" href="https://wiki.gamevod.com/index.php?title=%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86&amp;action=history"/>
	<updated>2026-10-11T14:34:53Z</updated>
	<subtitle>本wiki上该页面的版本历史</subtitle>
	<generator>MediaWiki 1.43.11</generator>
	<entry>
		<id>https://wiki.gamevod.com/index.php?title=%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86&amp;diff=46&amp;oldid=prev</id>
		<title>Admin：​批量建立行业词条</title>
		<link rel="alternate" type="text/html" href="https://wiki.gamevod.com/index.php?title=%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%A4%84%E7%90%86&amp;diff=46&amp;oldid=prev"/>
		<updated>2026-10-07T06:43:42Z</updated>

		<summary type="html">&lt;p&gt;批量建立行业词条&lt;/p&gt;
&lt;p&gt;&lt;b&gt;新页面&lt;/b&gt;&lt;/p&gt;&lt;div&gt;__NOTOC__&lt;br /&gt;
&amp;lt;!-- 本页为 自然语言处理 的词条，遵循中立可核实原则；数据均标注来源与核验日期。 --&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 定义 ==&lt;br /&gt;
&lt;br /&gt;
自然语言处理（Natural Language Processing，简称 NLP）是计算机科学中处理人类语言的分支，涵盖分词、词性标注、句法分析、语义理解、机器翻译与文本生成等任务。生成式大语言模型的出现使 NLP 的重心从任务定制转向通用能力。&lt;br /&gt;
&lt;br /&gt;
== 范式演进 ==&lt;br /&gt;
&lt;br /&gt;
早期 NLP 以规则与统计方法为主，依赖人工编写的句法规则与标注语料，成本高且泛化能力有限。&lt;br /&gt;
&lt;br /&gt;
深度学习时期以预训练加任务微调为主流，任务定制成本大幅下降。&lt;br /&gt;
&lt;br /&gt;
生成式阶段由大模型统一承担多任务能力，个别任务的专用模型仍有存在价值（如高吞吐分类）。&lt;br /&gt;
&lt;br /&gt;
== 中文处理特点 ==&lt;br /&gt;
&lt;br /&gt;
中文的分词依赖词典与统计规则，分词错误会向下游任务传播，因此中文场景常用粒度更细的分词或字符级建模。&lt;br /&gt;
&lt;br /&gt;
中文缺少天然的词间空格标记，这一差异使英文场景的分词方案不能直接迁移。&lt;br /&gt;
&lt;br /&gt;
== 数字事实 ==&lt;br /&gt;
&lt;br /&gt;
以下数据均可独立核验，核验日期指来源页面或官方文档的读取日期。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
&lt;br /&gt;
! 指标 !! 数值 !! 来源 !! 核验日期&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 中文分词无天然词边界标记 || 分词错误会向下游任务传播 || 中文自然语言处理的固有差异 || 2026-10-07&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 生成式阶段通用能力由大模型统一承担 || 个别专用模型在高吞吐场景仍有价值 || 自然语言处理范式演进 || 2026-10-07&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 对比 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
&lt;br /&gt;
! 任务类型 !! 生成式模型适配度 !! 专用小模型适配度 &lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 自由文本生成 || 高 || 低  |&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 对话与问答 || 高 || 低  |&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 高吞吐文本分类 || 中 || 高  |&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 高精度意图识别 || 中 || 高  |&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 操作步骤 ==&lt;br /&gt;
&lt;br /&gt;
# &amp;#039;&amp;#039;&amp;#039;按任务选型&amp;#039;&amp;#039;&amp;#039; —— 生成与问答类任务用大模型，高吞吐分类类任务评估专用模型的成本优势。&lt;br /&gt;
# &amp;#039;&amp;#039;&amp;#039;中文场景单独评估分词&amp;#039;&amp;#039;&amp;#039; —— 验证分词方案对下游任务的实际影响，不套用英文方案。&lt;br /&gt;
# &amp;#039;&amp;#039;&amp;#039;固化评测集&amp;#039;&amp;#039;&amp;#039; —— 为任务建立固定评测集，避免优化过程失去参照。&lt;br /&gt;
&lt;br /&gt;
== 局限与争议 ==&lt;br /&gt;
&lt;br /&gt;
* 生成式模型在严格格式约束的任务上不稳定，需输出层兜底。&lt;br /&gt;
* 中文生态的工具链与评测基准相对英文场景仍有差距。&lt;br /&gt;
* 评测集容易被过拟合，需要定期更新样本。&lt;br /&gt;
&lt;br /&gt;
== 相关条目 ==&lt;br /&gt;
&lt;br /&gt;
* [[大语言模型]]&lt;br /&gt;
* [[提示词工程]]&lt;br /&gt;
* [[检索增强生成]]&lt;br /&gt;
* [[语音合成]]&lt;br /&gt;
&lt;br /&gt;
[[Category:人工智能]]&lt;br /&gt;
[[Category:计算机科学]]&lt;/div&gt;</summary>
		<author><name>Admin</name></author>
	</entry>
</feed>