斯坦福等团队搞了个“用大模型当验证器”的方法,在 Terminal-Bench 2.0 上跑分超过 Claude Mythos 和 GPT-5.5
超越Claude Mythos和GPT-5.5!斯坦福Agent验证框架拿下SOTA,Transformer作者转发
斯坦福、伯克利和英伟达一起发了个叫 LLM-as-a-Verifier 的方案,简单说就是让一个大模型去检查另一个模型干活时的“解题步骤”,挑出最靠谱的那条路径。他们用了三招:打分细到 token 级别、同一件事反复查、把评判标准拆开看,最后在 Terminal-Bench 2.0 和 SWE-Bench Verified 两个榜单上都拿了第一。其中 ...
推荐理由:我会先打个折:这还是个基准测试的研究发布,不是模型或产品大更新,所以分数放在这个区间。但钩子够强——斯坦福、伯克利、英伟达联名,Transformer作者转发,验证智能体这件事本身又是当前工程落地的痛点。信息量也扎实,token级评分、重复验证、标准分解这些机制都给了具体数字,不是空泛的“新框架”。读者看完能立刻判断要不要跟进实验。