# Snorkel 发布 Senior SWE-Bench：用高级工程师的标准来考编程智能体

> 原标题：Senior SWE-Bench: open-source benchmark that assesses agents as senior engineers

- 来源：Hacker News 首页
- 发布时间：2026-07-02T02:55:16.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41810
- 原文：https://senior-swe-bench.snorkel.ai/

## 摘要

这个基准测试不再给智能体塞一堆写死的需求文档，而是直接丢给它自然语言的功能请求和用户报错信息，像跟真人工程师沟通一样。为了能自动判分，他们搞了个“验证智能体”，会根据专家设计的模板自动写行为测试来检查提交的代码。评分不光看跑不跑得通，还加了个“品味分”，看代码风格是不是跟项目原本的习惯一致。数据集和评分方法都开源在 GitHub 上了。

## 推荐理由

这个基准把评测方式翻了个面：不给智能体塞写死的需求文档，而是丢给它自然语言的功能请求和报错信息，像跟真人工程师说话一样。判分也不只看代码能不能跑，还让一个验证智能体自动写行为测试，再打个'品味分'看代码风格是不是跟项目原本的习惯一致。数据集和评分方法都开源了，对做编程智能体的人来说是个直接可用的参照。不过刚发布，还没看到跨源讨论或头部模型跑分，效果先打个折。

## 锐评

Snorkel AI 搞的这个 Senior SWE-Bench，核心是把对 AI 编程智能体的考核从“初级工”升级到“高级工程师”。它不再提供那种写死了步骤的需求文档，而是给自然语言的功能请求和用户报错信息，这更贴近真实工作场景。为了能自动判分，他们弄了个“验证智能体”，会根据专家模板自动写行为测试来检查提交的代码，解决了灵活题目难以自动批改的老问题。

评分上，除了看代码跑不跑得通，还引入了一个“品味分”，用来判断代码风格、结构是不是跟项目原本的习惯一致。这个想法挺有意思，但正文没具体说品味分是怎么量化的，也没给出当前主流模型在这个基准上的具体得分和排名。数据集和评分方法都开源在 GitHub 上了，这点值得肯定。

目前还缺一些关键信息：这个基准的题目数量有多少，覆盖了哪些编程语言和框架，以及它的测试结果跟工程师实际表现的相关性有多强。如果题目量太小或者领域太窄，参考价值就会打折扣。另外，那个负责评分的验证智能体本身会不会出错，文章也没提。
