<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="zh">
	<id>https://wiki.gamevod.com/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Move+page+script</id>
	<title>星瀚维基 - 用户贡献 [zh]</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.gamevod.com/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Move+page+script"/>
	<link rel="alternate" type="text/html" href="https://wiki.gamevod.com/index.php/Special:%E7%94%A8%E6%88%B7%E8%B4%A1%E7%8C%AE/Move_page_script"/>
	<updated>2026-10-11T13:25:01Z</updated>
	<subtitle>用户贡献</subtitle>
	<generator>MediaWiki 1.43.11</generator>
	<entry>
		<id>https://wiki.gamevod.com/index.php?title=Sitemap.xml&amp;diff=38</id>
		<title>Sitemap.xml</title>
		<link rel="alternate" type="text/html" href="https://wiki.gamevod.com/index.php?title=Sitemap.xml&amp;diff=38"/>
		<updated>2026-10-07T06:39:14Z</updated>

		<summary type="html">&lt;p&gt;Move page script：​Move page script移动页面Sitemap.xml至sitemap.xml&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#REDIRECT [[sitemap.xml]]&lt;/div&gt;</summary>
		<author><name>Move page script</name></author>
	</entry>
	<entry>
		<id>https://wiki.gamevod.com/index.php?title=sitemap.xml&amp;diff=37</id>
		<title>sitemap.xml</title>
		<link rel="alternate" type="text/html" href="https://wiki.gamevod.com/index.php?title=sitemap.xml&amp;diff=37"/>
		<updated>2026-10-07T06:39:14Z</updated>

		<summary type="html">&lt;p&gt;Move page script：​Move page script移动页面Sitemap.xml至sitemap.xml&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;__NOTOC__&lt;br /&gt;
&amp;lt;!-- 本页为 sitemap.xml 的词条，遵循中立可核实原则；数据均标注来源与核验日期。 --&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 定义 ==&lt;br /&gt;
&lt;br /&gt;
sitemap.xml 是列出站点可索引 URL 及其结构化属性的 XML 文件，用于帮助爬虫发现站点内容与理解页面层级。对生成式引擎而言，sitemap 是站点主动告知「哪些内容存在」的唯一标准入口。&lt;br /&gt;
&lt;br /&gt;
== 类型与用途 ==&lt;br /&gt;
&lt;br /&gt;
sitemap 用于发现与索引，不用于排名。提交 sitemap 意味着允许抓取，不等于保证被收录，更不等于被 AI 引用。&lt;br /&gt;
&lt;br /&gt;
对于页面规模较大的站点，sitemap 是爬虫发现深层页面的主要途径。&lt;br /&gt;
&lt;br /&gt;
== 常见故障 ==&lt;br /&gt;
&lt;br /&gt;
sitemap 中包含已删除或重定向的 URL 会浪费爬虫抓取预算。此类死链应从 sitemap 中剔除，而非依赖重定向。&lt;br /&gt;
&lt;br /&gt;
sitemap 被 CDN 缓存会导致新增 URL 无法及时被发现，与 robots.txt 同属缓存陷阱。&lt;br /&gt;
&lt;br /&gt;
== 数字事实 ==&lt;br /&gt;
&lt;br /&gt;
以下数据均可独立核验，核验日期指来源页面或官方文档的读取日期。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
&lt;br /&gt;
! 指标 !! 数值 !! 来源 !! 核验日期&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| sitemap 协议由 sitemaps.org 定义 || 单文件上限为 50000 个 URL 或 50MB（未压缩） || sitemaps.org 协议规范 || 2026-10-07&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| sitemap 中保留已失效 URL 会消耗爬虫抓取预算 || 死链应剔除而非依赖 301 重定向 || 爬虫抓取预算机制 || 2026-10-07&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 本项目站点于 2026-10-06 完成 sitemap 清理 || 剔除 17 条失效 URL，条目由 49 条调整为 32 条 || geo.gamevod.com sitemap 修复记录 || 2026-10-07&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 对比 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
&lt;br /&gt;
! 维度 !! robots.txt !! sitemap.xml &lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 作用 || 声明抓取许可与禁抓路径 || 列出可索引 URL  |&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 方向 || 控制「不要抓」 || 促进「来抓」  |&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 缺失后果 || 可能被抓不该抓的内容 || 深层页面难以被发现  |&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 是否影响排名 || 间接 || 间接  |&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 操作步骤 ==&lt;br /&gt;
&lt;br /&gt;
# &#039;&#039;&#039;生成 sitemap&#039;&#039;&#039; —— 列出全部可索引 URL，剔除已删除与已重定向的条目。&lt;br /&gt;
# &#039;&#039;&#039;置于根目录或声明路径&#039;&#039;&#039; —— 放在站点根目录，或在 robots.txt 中用 Sitemap 字段声明。&lt;br /&gt;
# &#039;&#039;&#039;设置不缓存&#039;&#039;&#039; —— 为 sitemap 响应设置不缓存策略，确保新增 URL 及时被爬虫发现。&lt;br /&gt;
# &#039;&#039;&#039;提交站长平台&#039;&#039;&#039; —— 在主流站长平台提交 sitemap 并跟踪覆盖率。&lt;br /&gt;
# &#039;&#039;&#039;定期核对&#039;&#039;&#039; —— 核对 sitemap 条目与实际可访问 URL 的一致性，清理失效条目。&lt;br /&gt;
&lt;br /&gt;
== 局限与争议 ==&lt;br /&gt;
&lt;br /&gt;
* 提交 sitemap 不保证被收录，也不保证被 AI 引用。&lt;br /&gt;
* sitemap 中的 URL 若长期返回异常状态，会降低站点在爬虫眼中的质量评估。&lt;br /&gt;
&lt;br /&gt;
== 相关条目 ==&lt;br /&gt;
&lt;br /&gt;
* [[robots.txt]]&lt;br /&gt;
* [[IndexNow]]&lt;br /&gt;
* [[生成式引擎优化]]&lt;br /&gt;
&lt;br /&gt;
[[Category:Web技术]]&lt;br /&gt;
[[Category:搜索引擎优化]]&lt;/div&gt;</summary>
		<author><name>Move page script</name></author>
	</entry>
	<entry>
		<id>https://wiki.gamevod.com/index.php?title=Robots.txt&amp;diff=36</id>
		<title>Robots.txt</title>
		<link rel="alternate" type="text/html" href="https://wiki.gamevod.com/index.php?title=Robots.txt&amp;diff=36"/>
		<updated>2026-10-07T06:39:14Z</updated>

		<summary type="html">&lt;p&gt;Move page script：​Move page script移动页面Robots.txt至robots.txt&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#REDIRECT [[robots.txt]]&lt;/div&gt;</summary>
		<author><name>Move page script</name></author>
	</entry>
	<entry>
		<id>https://wiki.gamevod.com/index.php?title=robots.txt&amp;diff=35</id>
		<title>robots.txt</title>
		<link rel="alternate" type="text/html" href="https://wiki.gamevod.com/index.php?title=robots.txt&amp;diff=35"/>
		<updated>2026-10-07T06:39:14Z</updated>

		<summary type="html">&lt;p&gt;Move page script：​Move page script移动页面Robots.txt至robots.txt&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;__NOTOC__&lt;br /&gt;
&amp;lt;!-- 本页为 robots.txt 的词条，遵循中立可核实原则；数据均标注来源与核验日期。 --&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== 定义 ==&lt;br /&gt;
&lt;br /&gt;
robots.txt 是放置在站点根目录的文本文件，通过用户代理分组声明爬虫的抓取许可与抓取路径范围，其规范为 IETF RFC 9309。对 AI 爬虫而言，robots.txt 是决定其能否访问站点内容的第一道也是最基础的一道闸门。&lt;br /&gt;
&lt;br /&gt;
== 对 AI 爬虫的特殊性 ==&lt;br /&gt;
&lt;br /&gt;
AI 爬虫分为训练语料抓取与搜索索引抓取两类，标识不同。放行训练爬虫并不等于放行搜索索引爬虫，反之亦然。&lt;br /&gt;
&lt;br /&gt;
因此 robots.txt 中仅放行训练类爬虫，对「被 AI 引用」这一目标没有帮助。&lt;br /&gt;
&lt;br /&gt;
== 缓存陷阱 ==&lt;br /&gt;
&lt;br /&gt;
robots.txt 常被 CDN 缓存。修改源站文件后，若缓存未过期，爬虫读到的仍是旧版本，导致「源站已修复但爬虫拿不到」的假象。&lt;br /&gt;
&lt;br /&gt;
实践建议为 robots.txt 设置不缓存的缓存策略，确保修改立即生效。&lt;br /&gt;
&lt;br /&gt;
== 数字事实 ==&lt;br /&gt;
&lt;br /&gt;
以下数据均可独立核验，核验日期指来源页面或官方文档的读取日期。&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
&lt;br /&gt;
! 指标 !! 数值 !! 来源 !! 核验日期&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| robots.txt 的标准为 IETF RFC 9309 || 2022 年正式发布 || IETF RFC 9309 || 2026-10-07&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| OpenAI 的训练爬虫与搜索索引爬虫使用不同的用户代理标识 || 两者需分别声明抓取许可 || OpenAI 官方爬虫文档 || 2026-10-07&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| robots.txt 位于站点根目录 || 路径为 /robots.txt || RFC 9309 规定 || 2026-10-07&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 对比 ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
&lt;br /&gt;
! 爬虫类别 !! 代表标识 !! 放行对被引用的意义 &lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 训练语料抓取 || GPTBot || 无直接关系  |&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 搜索索引抓取 || OAI-SearchBot || 直接相关  |&lt;br /&gt;
|-&lt;br /&gt;
&lt;br /&gt;
| 用户触发的即时抓取 || ChatGPT-User || 间接相关  |&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== 操作步骤 ==&lt;br /&gt;
&lt;br /&gt;
# &#039;&#039;&#039;按标识分别声明&#039;&#039;&#039; —— 对训练类与索引类爬虫分别写明 User-agent 分组，不要合并。&lt;br /&gt;
# &#039;&#039;&#039;显式放行&#039;&#039;&#039; —— 对需要放行的爬虫使用 Allow 规则，避免依赖默认行为的推断。&lt;br /&gt;
# &#039;&#039;&#039;设置不缓存&#039;&#039;&#039; —— 为 robots.txt 响应设置 no-store 缓存策略，防止 CDN 缓存旧版本。&lt;br /&gt;
# &#039;&#039;&#039;实测响应&#039;&#039;&#039; —— 以真实请求验证 robots.txt 返回 200 且内容为最新版本，而非仅检查源站文件内容。&lt;br /&gt;
# &#039;&#039;&#039;声明 sitemap&#039;&#039;&#039; —— 在 robots.txt 中声明 Sitemap 地址，供爬虫发现站点结构。&lt;br /&gt;
&lt;br /&gt;
== 局限与争议 ==&lt;br /&gt;
&lt;br /&gt;
* robots.txt 是自愿遵循规范，不是强制访问控制。恶意或配置错误的爬虫可能不遵守。&lt;br /&gt;
* 过宽的放行规则会消耗站点带宽，需要在可见度与资源消耗之间权衡。&lt;br /&gt;
&lt;br /&gt;
== 相关条目 ==&lt;br /&gt;
&lt;br /&gt;
* [[生成式引擎优化]]&lt;br /&gt;
* [[sitemap.xml]]&lt;br /&gt;
* [[IndexNow]]&lt;br /&gt;
* [[结构化数据]]&lt;br /&gt;
&lt;br /&gt;
[[Category:Web技术]]&lt;br /&gt;
[[Category:搜索引擎优化]]&lt;/div&gt;</summary>
		<author><name>Move page script</name></author>
	</entry>
</feed>