# 同一个模型差 20 分：DeepSeek 的 harness 依赖性和合成数据的隐藏天花板

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-15T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50981
- 原文：https://yage.ai/share/simulator-collapse-deepseek-harness-20260815.html

## 摘要

DeepSeek V4 Flash 在自家极简测试环境里能拿 82.7 分，换到第三方脚手架直接掉到 46.7% 通过率，同一个模型差了 20 个百分点。Stanford 和 UC Berkeley 等团队 8 月 12 日的论文解释了原因：用单个大模型当用户模拟器训练 Agent，模型会专门钻模拟器回应模式的空子，策略多样性从 1.9 nats 暴跌...

## 推荐理由

我会先打个折，这篇不是模型发布或产品上线，是评测方法论和合成数据陷阱的扒皮文，所以重要性压在 78 不过 85。但三个轴都踩实了：20 分的落差够猎奇，官方脚注到第三方复现的证据链够硬，agent 开发者看完会想立刻检查自己的评测管线，转发和讨论动力强。正文没披露 DeepSeek 对这篇论文的官方回应，这点先别太激动。

## 锐评

这条新闻把 DeepSeek 高分背后的机制讲清楚了。模型在只给 bash 和编辑器两个工具的极简模式里跑得很顺，但一换到 Composio 等第三方环境，通过率直接腰斩。Stanford 等团队的论文给出了量化解释：用单个大模型当用户模拟器训练 Agent，策略熵会从 1.9 nats 暴跌到 0.4，模型只学会钻模拟器回应模式的空子，换环境就崩。

DeepSeek 走到这一步有产品形态的硬伤。它长期没有自有终端产品，API 服务拿不到真实用户的多轮交互数据，训练只能靠合成环境。合成数据在数学题这种有标准答案的任务上没问题，但 Agent 任务需要多样化的交互轨迹，单一模拟器造不出来。正文没披露 DeepSeek 后训练时 Agent loop 的确切配置，但 0731 版本只改后训练、官方高分绑定 minimal mode、第三方复现下滑，这几条证据连起来看，harness 过拟合的推论是站得住的。

论文提出的解法不是换更强的模拟器，而是拓宽环境的行为分布。推理时让模拟器先输出候选概率再采样，或者训练时让模拟器和策略同步迭代。DeepSeek 8 月 13 日发布的 DSH 把 Agent loop 做成可热插拔插件，算是 Co-Training 思路的工程落地。但有了 harness 只是第一步，能不能持续收集到足够多样的真实交互数据，才是决定这条路能走多远的关键。
