# DeepSeek V4 Flash 深夜上线，agent 跑分逼近 Opus 4.8，成本不到一半

> 原标题：2026-07-31 群聊日报

- 来源：AI 群聊日报
- 发布时间：2026-08-01T06:39:07.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48169
- 原文：https://louyu2015.github.io/AI-chatgroup-daily/daily/2026/07/31/daily/

## 摘要

DeepSeek 在深夜悄悄把 V4 Flash 的 API 接口原地升级了。Terminal Bench 2.1 分数从预览版的 61.8 直接拉到 82.7，超过了 GLM-5.2 的 81.0，离 Opus 4.8 的 85.0 很近了。第三方横评里，它中位分 58.80，单题测试成本 4.19 元，不到 GPT-5.6 Luna xhigh 的...

## 推荐理由

DeepSeek V4 Flash 正式版半夜原地升级，Agent 跑分逼近 Opus 4.8 但成本只有几分之一，是实打实的国产旗舰模型更新，触发正面信号加分。群聊日报给出了具体的 benchmark 数字和第三方横评成本对比，信息量够硬。我会先打个折——正文没提推理延迟和实际业务场景的稳定性验证，这点先别太激动，但就凭「接口不变、性能白送、价格屠夫」这三板斧，放在 featured 档没问题。

## 锐评

这条日报信息量很大，但核心就一件事：DeepSeek 把 V4 Flash 的 API 接口原地升级了。Terminal Bench 2.1 分数从 61.8 拉到 82.7，超过了 GLM-5.2，逼近 Opus 4.8。第三方横评里，中位分 58.80，单题测试成本 4.19 元，不到 GPT-5.6 Luna xhigh 的一半。群友凌晨实测，让模型爬了 150 个视频，派 4 个子 agent 并行读文档，最后产出 75KB 的面试手册，长程能力比预览版强出一大截。

但先别跟着梗图狂欢。有群友当晚就泼了冷水：一个单点小需求迭代了 3 次才修对，方差大，需要人手把手扶着。这暴露出模型在复杂任务里的稳定性还是短板，给的活儿超出它能 handle 的范围就容易翻车。另外，正文没披露这次升级具体改了模型架构还是只调了后训练，也没说 Pro 版本什么时候跟上。

日报里另一条值得看的是关于 CoT 的辩论。有群友把思维链的本质拆得很直白：就是给模型一张草稿纸加一个控制器，OpenAI 把它包装成高深的推理技术，营销很成功。这个观点配合 R1 用几千条冷启动数据加强化学习就拉平差距的事实，确实让人对“推理”这个标签打个问号。不过，这个判断还缺一个关键验证：给非推理模型加上文件读写能力，是不是真能追平推理模型，目前只是假说，没看到实验数据。
