Snorkel 发布 Senior SWE-Bench:用高级工程师的标准来考编程智能体
Senior SWE-Bench: open-source benchmark that assesses agents as senior engineers
这个基准测试不再给智能体塞一堆写死的需求文档,而是直接丢给它自然语言的功能请求和用户报错信息,像跟真人工程师沟通一样。为了能自动判分,他们搞了个“验证智能体”,会根据专家设计的模板自动写行为测试来检查提交的代码。评分不光看跑不跑得通,还加了个“品味分”,看代码风格是不是跟项目原本的习惯一致。数据集和评分方法都开源在 GitHub 上了。
推荐理由:这个基准把评测方式翻了个面:不给智能体塞写死的需求文档,而是丢给它自然语言的功能请求和报错信息,像跟真人工程师说话一样。判分也不只看代码能不能跑,还让一个验证智能体自动写行为测试,再打个'品味分'看代码风格是不是跟项目原本的习惯一致。数据集和评分方法都开源了,对做编程智能体的人来说是个直接可用的参照。不过刚发布,还没看到跨源讨论或头部模型跑分,效果先打个折。