# DeepSeek V4 Flash 实战体感碾压 Sol，Anthropic 发布 Fable 5.1 但被指挤牙膏

> 原标题：2026-09-01 群聊日报

- 来源：AI 群聊日报
- 发布时间：2026-09-02T05:28:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54405
- 原文：https://louyu2015.github.io/AI-chatgroup-daily/daily/2026/09/01/daily/

## 摘要

群友用 DSH 加 DeepSeek V4 Flash 跑了两个月对比和一周 51 亿 token 的活，结论是实际干活比 GPT-5.6 Sol 舒服。Sol 想太多、输出假大空，V4 Flash 首 token 平均 2.3 秒，总花费才 ¥362.84。有人提出“订阅制健身房悖论”，认为卖月费的 harness 会悄悄限制使用强度，按量付费的才不...

## 推荐理由

群聊实测数据够扎实——51 亿 token 跑下来才花三百多块，首 token 2.3 秒，成功率接近百分百，对比 Sol 的啰嗦和假大空，结论很明确。但来源是匿名群聊记录，不是官方发布或可复现的基准测试，权威性要打个折。H、K、R 全中，放 featured 没问题。

## 锐评

这条日报最核心的信息不是“V4 Flash吊打Sol”，而是群友用真金白银和实际长程任务跑出来的数据，暴露了当前AI工具链的一个结构性问题：模型能力被它外面的那层壳（harness）严重扭曲了。@睿智的北极熊 的数据很扎实，一周51亿输入token、首token延迟2.3秒、缓存命中率99.8%，总花费才362.84元。这个成本低到足以改变个人开发者的工作流选择。但要注意，他对比的是“Sol用Codex”和“V4 Flash用DSH”，这不是公平的模型对比，而是整套工具链的对比。正文没披露Sol侧在同等任务下的具体花费和延迟，所以“碾压”的判断要打个折。

“订阅制健身房悖论”这个说法很尖锐，但逻辑上能自洽。卖月费的harness确实有动机悄悄限制重度用户的资源消耗，而按量付费的DSH巴不得你多烧token。这不是阴谋论，是商业激励的必然结果。不过正文里没有给出Codex或Sol主动降智的直接证据，更多是群友的体感抱怨，这点先别太激动。

Anthropic发Fable 5.1，缓存读取降价75%是实打实的利好，但Fable 5跑分不如Opus 5这件事，说明模型迭代的线性进步叙事已经崩了。Qwen 3.8-Max-0902同日刷榜也印证了这一点——各家都在特定benchmark上互有胜负，没有谁能全面领先。整体看，这天的信息密度很高，但缺的是对V4 Flash在非DSH环境、非中文长程任务下的对照测试，以及Sol在同等开放harness下的表现数据。
