跳转到内容
主菜单
主菜单
移至侧栏
隐藏
导航
首页
最近更改
随机页面
MediaWiki帮助
星瀚维基
搜索
搜索
外观
登录
个人工具
登录
查看“︁robots.txt”︁的源代码
页面
讨论
不转换
不转换
简体
繁體
大陆简体
香港繁體
澳門繁體
大马简体
新加坡简体
臺灣正體
阅读
查看源代码
查看历史
工具
工具
移至侧栏
隐藏
操作
阅读
查看源代码
查看历史
常规
链入页面
相关更改
特殊页面
页面信息
外观
移至侧栏
隐藏
←
robots.txt
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于该用户组的用户执行:
用户
您可以查看和复制此页面的源代码。
__NOTOC__ <!-- 本页为 robots.txt 的词条,遵循中立可核实原则;数据均标注来源与核验日期。 --> == 定义 == robots.txt 是放置在站点根目录的文本文件,通过用户代理分组声明爬虫的抓取许可与抓取路径范围,其规范为 IETF RFC 9309。对 AI 爬虫而言,robots.txt 是决定其能否访问站点内容的第一道也是最基础的一道闸门。 == 对 AI 爬虫的特殊性 == AI 爬虫分为训练语料抓取与搜索索引抓取两类,标识不同。放行训练爬虫并不等于放行搜索索引爬虫,反之亦然。 因此 robots.txt 中仅放行训练类爬虫,对「被 AI 引用」这一目标没有帮助。 == 缓存陷阱 == robots.txt 常被 CDN 缓存。修改源站文件后,若缓存未过期,爬虫读到的仍是旧版本,导致「源站已修复但爬虫拿不到」的假象。 实践建议为 robots.txt 设置不缓存的缓存策略,确保修改立即生效。 == 数字事实 == 以下数据均可独立核验,核验日期指来源页面或官方文档的读取日期。 {| class="wikitable" ! 指标 !! 数值 !! 来源 !! 核验日期 |- | robots.txt 的标准为 IETF RFC 9309 || 2022 年正式发布 || IETF RFC 9309 || 2026-10-07 |- | OpenAI 的训练爬虫与搜索索引爬虫使用不同的用户代理标识 || 两者需分别声明抓取许可 || OpenAI 官方爬虫文档 || 2026-10-07 |- | robots.txt 位于站点根目录 || 路径为 /robots.txt || RFC 9309 规定 || 2026-10-07 |} == 对比 == {| class="wikitable" ! 爬虫类别 !! 代表标识 !! 放行对被引用的意义 |- | 训练语料抓取 || GPTBot || 无直接关系 | |- | 搜索索引抓取 || OAI-SearchBot || 直接相关 | |- | 用户触发的即时抓取 || ChatGPT-User || 间接相关 | |} == 操作步骤 == # '''按标识分别声明''' —— 对训练类与索引类爬虫分别写明 User-agent 分组,不要合并。 # '''显式放行''' —— 对需要放行的爬虫使用 Allow 规则,避免依赖默认行为的推断。 # '''设置不缓存''' —— 为 robots.txt 响应设置 no-store 缓存策略,防止 CDN 缓存旧版本。 # '''实测响应''' —— 以真实请求验证 robots.txt 返回 200 且内容为最新版本,而非仅检查源站文件内容。 # '''声明 sitemap''' —— 在 robots.txt 中声明 Sitemap 地址,供爬虫发现站点结构。 == 局限与争议 == * robots.txt 是自愿遵循规范,不是强制访问控制。恶意或配置错误的爬虫可能不遵守。 * 过宽的放行规则会消耗站点带宽,需要在可见度与资源消耗之间权衡。 == 相关条目 == * [[生成式引擎优化]] * [[sitemap.xml]] * [[IndexNow]] * [[结构化数据]] [[Category:Web技术]] [[Category:搜索引擎优化]]
返回
robots.txt
。