跳到正文
Hacker News 首页

Cloudflare 默认拦截 AI 爬虫,你的智能体读到的可能是假页面

Show HN: We beat Cloudflare's bot detection (open-source stealth browser)

从 2025 年 7 月 1 日起,Cloudflare 对新域名默认开启 AI 爬虫拦截。更麻烦的是,被拦下来的请求会返回一个 403 状态码,但带着完整的网页内容——就是那个“稍等片刻”的验证页面。语言模型会把这当成真实内容,自信地总结出根本不存在的答案。作者用普通请求测了 8 个主流反爬网站,结果 0 次拿到真实内容,8 次都拿到了可被总结的拦截...

推荐理由:我会先打个折:文章没给出绕过工具在 Cloudflare 最新规则下的持续成功率数据,长期有效性存疑。但它的核心价值不在工具本身,而在于揭示了一个被忽视的数据污染路径——403 拦截页被当成正文喂给模型。这个发现对任何依赖网页抓取做知识库或 agent 的团队都是实打实的风险提示,加上有具体测试数字和开源代码,值得推荐。

读原文 ↗导出 Markdown