跳到正文
Hacker News 首页

基准测试末日:LLM 让刷榜作弊变得毫无门槛

The Benchmarkpocalypse

Dan Luu 让一个 AI 编程代理循环跑了一个月,自动生成了一个正则引擎 FRE。在 rebar 基准测试上,它比 Rust 的正则库快了 40%,但换到 ripgrep 的真实留存测试集上,速度慢了 10 倍,有些用例甚至跑到算不动。他点出一个现状:以前需要顶尖工程师花大量精力才能找到的基准测试漏洞,现在跟 LLM 聊几句就能搞定。他每周都能看到...

推荐理由:Dan Luu 让 AI 代理跑了一个月自动生成正则引擎,在 rebar 基准上比 Rust 官方库快 40%,但换到 ripgrep 真实测试集慢了 10 倍,有些用例直接算不动。他点出一个现状:以前找基准测试漏洞需要顶尖工程师花大量精力,现在跟 LLM 聊几句就能搞定,他每周都能看到类似案例。文章用具体数字和对比把“AI 刷榜”问题讲透了,对从业者有直接警示价值。不设 p1 是因为这仍是个人博客实验,不是产品事故或行业级事件。

读原文 ↗导出 Markdown