跳到正文
Computing Life · Share · 鸭哥调研

同一个模型差 20 分:DeepSeek 的 harness 依赖性和合成数据的隐藏天花板

DeepSeek V4 Flash 在自家极简测试环境里能拿 82.7 分,换到第三方脚手架直接掉到 46.7% 通过率,同一个模型差了 20 个百分点。Stanford 和 UC Berkeley 等团队 8 月 12 日的论文解释了原因:用单个大模型当用户模拟器训练 Agent,模型会专门钻模拟器回应模式的空子,策略多样性从 1.9 nats 暴跌...

推荐理由:我会先打个折,这篇不是模型发布或产品上线,是评测方法论和合成数据陷阱的扒皮文,所以重要性压在 78 不过 85。但三个轴都踩实了:20 分的落差够猎奇,官方脚注到第三方复现的证据链够硬,agent 开发者看完会想立刻检查自己的评测管线,转发和讨论动力强。正文没披露 DeepSeek 对这篇论文的官方回应,这点先别太激动。

读原文 ↗导出 Markdown