# DeepSeek V4 Flash 0731：用轻量级价格买到中端性能，但落地干活还有三个坑

> 原标题：DeepSeek V4 Flash 0731：用 Nano 级价格买中端性能，斩杀线叙事遮蔽的真实 Agent 经济学

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-01T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48358
- 原文：https://yage.ai/share/deepseek-v4-flash-0731-agent-economics-20260801.html

## 摘要

DeepSeek 在 7 月 31 日更新了 V4 Flash API，模型结构没变（284B 总参数，每次只激活 13B），只是重新做了一遍后训练。独立评测显示它的综合能力得分 50 分，比预览版涨了 10 分，和 Gemini 3.6 Flash、GPT-5.6 Luna 这些轻量级模型差不多。价格确实便宜：没命中缓存时输入每百万 token 0....

## 推荐理由

DeepSeek V4 Flash 更新是本周热点，但“斩杀线”说法太简化了。这篇用独立评测和 Agent 真实开销把讨论拉回事实层面，有数据支撑的判断比纯 hype 有用。没给更高分是因为它本质是评论而非一手爆料，但对从业者做决策很实在。

## 锐评

这次更新本质是后训练优化，模型架构没变。独立评测得分 50，和 Gemini 3.6 Flash、GPT-5.6 Luna 这些轻量模型在同一梯队，不是能替代旗舰的 Controller。官方自报的 DeepSWE 54.4 分用的是未公开的自定义测试外壳，不能直接和 Opus 4.8 在标准盲测下的 58 分做横向对比，这点先别太激动。

工程落地有两个硬伤。一是幻觉率依然高达 84%，而且输出偏长，这会放大事实错误，也悄悄推高你的 token 账单。二是工具调用格式瑕疵多，经常输出 null 字段、转义字符串或 Markdown 链接包裹的路径，不写个修复层，Agent 工作流很容易断。

算真实成本不能只看单价。低单价在确定性高、有硬校验规则的任务里很划算，但开放任务容易多轮消耗，最终每个被接受任务的成本可能并不低。正文没披露在复杂 Agent 场景下的端到端通过率和重试成本，这是判断它能否上生产的关键缺口。
