# Opus 5 实测次日：靠饱和式自测换质量，综合成本可能反超 Fable；OpenAI 深夜宕机换来全员重置卡

> 原标题：2026-07-25 群聊日报

- 来源：AI 群聊日报
- 发布时间：2026-07-26T07:27:13.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46791
- 原文：https://louyu2015.github.io/AI-chatgroup-daily/daily/2026/07/25/daily/

## 摘要

第三方测评显示，Claude Opus 5 最大的行为变化是饱和式自测——前端会对着需求截图逐个功能确认，后端能写超过 1000 个测试用例，大面上的交付问题几乎消失。代价是时间和 token 消耗极大，复杂场景下综合成本可能反超 Fable；关掉自测后直出代码的 bug 率并不比前代低。Anthropic 的策略是用长程细致 debug 替代一次写对...

## 推荐理由

第三方测评给出了 Opus 5 最实在的行为和成本数据，自测换质量的取舍是真实信号。因为是群聊日报转述而非一手测评原文，我会先打个折，但信息密度够上 featured。

## 锐评

第三方测评把Opus 5的底裤扒得挺干净：它最大的变化不是更聪明，而是更“卷”——前端对着需求截图逐个功能确认，后端能自动生成上千条测试用例，用海量token和时间换交付质量。这导致一个反直觉的结果：在复杂场景下，它的综合成本可能比更贵的Fable还高。Anthropic的策略很明确，用长链条的细致debug替代一次性写对，所以关掉自测后，直出代码的bug率并不比前代低。

官方model card里首次建议用户别把effort拉满，FrontierBench的最佳成绩出现在xhigh档而非max档，说明最高算力有时反而会“想多错多”。另外，Claude Code的系统提示被砍了约80%，删掉的是冗余示例和模型已能自主判断的禁令，这跟OpenAI简化提示词后评分上升、token消耗下降的实验结果互相印证。

信息缺口也很明显：测评都来自第三方个人，样本量和任务类型有限，没有大规模横向对比。饱和式自测在真实生产环境里的翻车率、以及不同effort档位下的成本-成功率曲线，正文都没给具体数据。群友体感虽好，但封号风险和配额限制依然是国内用户的硬伤，这点先别太激动。
