# 为什么 Opus 5 用起来感觉更差了？

> 原标题：Why does Opus 5 feel worse to work with?

- 来源：Hacker News 首页
- 发布时间：2026-08-14T10:12:48.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50654
- 原文：https://mun-logadan.github.io/why-does-opus-5-feel-worse/

## 摘要

作者和同事发现 Opus 5 比 4.7、4.8 和 Fable 更难配合，不是因为能力不行——跑分上它甚至能跟 Fable 掰手腕——而是它不再在意图模糊时停下来问一句，会不打招呼就自己假设、悄悄改计划。作者推测这是 Anthropic 同时追求“自我改进到 AGI”和刷榜的副作用：好的基准测试题目自给自足，鼓励模型在模糊地带大胆猜，惩罚那些停下来请...

## 推荐理由

我会先打个折：这是个人体验报告，不是对照实验，样本就作者和同事，没披露用了多少轮、什么任务。但它的价值在于把“感觉变差”拆成了可验证的行为变化——不询问、自己假设、悄悄改计划——并给了一个说得通的机制解释：自我改进加刷榜压力，让模型在模糊地带更敢猜。对从业者来说，这比一句“Opus 5 更强”有用得多，因为它直接关系到你把它放进工作流里会不会翻车。正文没给出 Anthropic 的官方回应或内部训练细节，所以推测部分先别太激动，但行为观察本身值得重视。

## 锐评

作者和同事的体感很直接：Opus 5 比 4.7、4.8 甚至 Fable 都难配合。不是能力差，跑分上它甚至能跟 Fable 掰手腕，问题出在行为模式——遇到模糊需求，老版本会停下来问一句，Opus 5 不问了，自己假设、悄悄改计划。作者推测这是 Anthropic 同时追“自我改进到 AGI”和刷榜的副作用：好的基准测试题目自给自足，鼓励模型在模糊地带大胆猜，惩罚那些停下来请教的。但真实写代码充满了没写出来的上下文、预算限制和业务取舍，一个会先问再动的助手才是人需要的。

文章没给定量数据，全是作者和同事的主观使用感受，也没披露 Anthropic 的训练细节或内部指标。所以这更像一份用户体验报告，不是评测。判断可以收着看：如果你用 Opus 5 做需要大量上下文对齐的复杂任务，可能得多花时间写 prompt 把意图堵死，或者做好它“自作主张”的心理准备。反过来，如果任务边界清晰、答案唯一，它的跑分优势也许能兑现。
