# Cloudflare 默认拦截 AI 爬虫，你的智能体读到的可能是假页面

> 原标题：Show HN: We beat Cloudflare's bot detection (open-source stealth browser)

- 来源：Hacker News 首页
- 发布时间：2026-07-11T00:26:16.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43651
- 原文：https://tilion.dev/blog/cloudflare-blocks-agents

## 摘要

从 2025 年 7 月 1 日起，Cloudflare 对新域名默认开启 AI 爬虫拦截。更麻烦的是，被拦下来的请求会返回一个 403 状态码，但带着完整的网页内容——就是那个“稍等片刻”的验证页面。语言模型会把这当成真实内容，自信地总结出根本不存在的答案。作者用普通请求测了 8 个主流反爬网站，结果 0 次拿到真实内容，8 次都拿到了可被总结的拦截...

## 推荐理由

我会先打个折：文章没给出绕过工具在 Cloudflare 最新规则下的持续成功率数据，长期有效性存疑。但它的核心价值不在工具本身，而在于揭示了一个被忽视的数据污染路径——403 拦截页被当成正文喂给模型。这个发现对任何依赖网页抓取做知识库或 agent 的团队都是实打实的风险提示，加上有具体测试数字和开源代码，值得推荐。

## 锐评

这篇文章点出了一个很实际的坑：AI 爬虫被拦后拿到的不是报错，而是一个“请稍等”的验证页面。因为 HTTP 状态码是 403 但响应体是完整的 HTML，模型会把它当成目标网页的内容，自信地编造出根本不存在的职位、价格或房源。作者用普通请求测了 8 个主流反爬网站，结果 0 次拿到真实内容，8 次都拿到了可被总结的拦截页面，且没有任何信号提示请求失败。这个失败率是 100%，但系统完全不知情。

他们开源的工具 Fortress 能突破其中 5 个，包括 Cloudflare、PerimeterX 和 Akamai 保护的站点，能直接拿到 Indeed 的职位列表、Zillow 的 878 条房源和 StockX 的 GraphQL 定价接口。DataDome 和亚马逊的点击验证墙在开源版里还过不去，需要付费的云端层。

文章没给出 Fortress 的具体绕过原理，也没说明这种对抗能维持多久。对实际使用者来说，最关键的还是作者提出的修复思路：先检测拦截页面的特征签名，一旦识别就让它大声报错，别让模型对着验证页面瞎编。这个逻辑比工具本身更值得先落地。
