# 你的 robots.txt 是 2023 年的战争纪念碑——多数网站无视了实时回答机器人

> 原标题：Sites that block AI training crawlers mostly ignore the answer time bots

- 来源：Hacker News 首页
- 发布时间：2026-07-07T15:52:48.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/42948
- 原文：https://sitedex.dev/insights/robots-txt-2023-war-memorial

## 摘要

Sitedex 扫描了前一万名网站的 robots.txt 文件。能确定写入日期的 GPTBot 屏蔽规则里，有 38% 集中在 2023 年第四季度，也就是 GPTBot 上线和纽约时报起诉 OpenAI 之后。87% 的网站后来都加过新规则，但几乎全是针对训练爬虫。Anthropic、OpenAI 和 Perplexity 各运行两个机器人：一个用...

## 推荐理由

文章用数据讲了一个很具体的漏洞：站长们忙着在 2023 年底封训练爬虫，却几乎没人管回答时来偷内容的机器人。观点有数据撑腰，也戳中了从业者的盲区。分数没上 80，是因为 Sitedex 本身不算顶级信源，而且正文没提供完整报告，没法核实数据深度。

## 锐评

Sitedex 扫了一万个头部网站的 robots.txt，发现这文件基本是 2023 年的战争纪念碑。能查到写入日期的 GPTBot 屏蔽规则里，38% 都挤在 2023 年第四季度，正好是 GPTBot 上线和纽约时报起诉 OpenAI 之后。大家当时吓一跳，赶紧加了几行代码把训练爬虫挡在门外，这个反应很合理。

但问题出在后面。87% 的网站后来都更新过规则，可加的全是新的训练爬虫，比如 ClaudeBot、PerplexityBot。而各家 AI 公司其实都跑着两种机器人：一种批量抓数据训练模型，另一种在用户提问时实时抓取页面来生成答案。后一种才是现在真正影响流量和潜在收费场景的。数据很打脸：在屏蔽了 Anthropic 训练爬虫的网站里，71% 对它的答题机器人 Claude-User 没写任何规则；对 OpenAI 的答题机器人，53% 的站没管；对 Perplexity 的，一半没管。故意放行答题机器人、只挡训练的网站不到 4%。

这说明多数站点的规则还停留在两年前的恐慌里，没跟上“答案即交易”的变化。不过文章没披露 Cloudflare 新计费方案的具体价格和上线时间，这点先别太激动。
