# AI 爬虫用最蠢的方式狂刷 git.kernel.org，每天 600 万次请求，98% 是废料

> 原标题：Creepy Crawlies

- 来源：Hacker News 首页
- 发布时间：2026-08-29T17:49:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53699
- 原文：https://people.kernel.org/monsieuricon/creepy-crawlies

## 摘要

Konstantin Ryabitsev 给了硬数据：git.kernel.org 每天收到 600 万次请求，98% 来自 AI 爬虫。这些爬虫不直接克隆仓库，而是把每个提交渲染成 HTML 再抓取，光 linux.git 的 922 个分支就能生成几十亿个有效网址，抓回来的却是 148 万次提交的重复内容。封 IP、封整个 ASN 都失败了，因为爬...

## 推荐理由

Kernel.org 维护者首次公开 AI 爬虫冲击的硬数字：14 个 CPU 核 24 小时被浪费在给爬虫渲染提交页面。信息密度高，行业共鸣强。因为是基础设施运维话题而非模型或产品更新，我会稍微打个折，但选题和表达都到位。

## 锐评

Konstantin Ryabitsev 这次给了硬数据，不是抱怨。git.kernel.org 每天 600 万次请求，98% 来自 AI 爬虫。最离谱的是爬取方式：不直接克隆仓库，而是把 linux.git 的 148 万次提交逐个渲染成 HTML 再解析。加上 922 个分支，能生成几十亿个有效网址，抓回来的却是大量重复内容。

后果很直接。在 5 个地理分布节点、总共 90 个核的服务器上，常年有 14 到 16 个核在专门给爬虫渲染提交页面，比所有合法访问（包括 git clone）消耗的 CPU 还多。封 IP、封整个 ASN 都失败了，因为爬虫已经用上了电视和手机里的住宅代理 SDK，每次只发 4-5 个请求就换 IP，封不过来。

他们试过用 Anubis 工作量证明挡了一阵，难度设到 5 之后爬虫又回来了。正文没提现在难度调到多少、成本增加了多少，也没说是否考虑过直接限制 cgit 的 URL 生成能力。这点先别太激动，因为作者自己也承认，当初把一切开放给人类和守规矩的爬虫的设计，现在成了负担。
