# 群聊周报 Vol.4｜大模型跑分屠榜，中文却越写越差；用好了 AI 真的就能升职了吗；Fable 5 连群聊都不愿意总结

- 来源：AI 群聊日报
- 发布时间：2026-07-03T01:06:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/42101
- 原文：https://louyu2015.github.io/AI-chatgroup-daily/weekly/2026/07/03/vol-4/

## 摘要

这期周报聊了三件让 AI 从业者头疼的事。第一件，Opus 4.7 和 4.8 跑分越来越高，但中文写作明显退步，写出来的东西不像人话，连说明文档都没法用。作者通过群内盲测发现，新版模型思考时间变短、输出更顺滑，但读材料反而更潦草。这不是模型变笨，是强化学习让它偏科了——数学和编程这类有标准答案的任务被拼命优化，而写作这种靠品味、没法用对错打分的能力，...

## 推荐理由

这篇社区周报用一手盲测数据指出 Opus 4.7/4.8 中文写作退步，证据具体，不是空谈。但它本质是个人博客观察，不是官方公告或可复现研究，权威性有限，所以给 featured 而不是更高等级。

## 锐评

这篇周报最有价值的地方，是作者用自己项目的连续盲测，把“模型越新中文越差”这个模糊体感变成了可复现的证据。Opus 4.7和4.8思考时间变短、输出更顺滑，但读材料反而潦草，写出的文档“几乎没法用”。作者判断这不是变笨，是强化学习的副作用：数学和编程有标准答案，奖励函数算得清，能力被拼命优化；而写作靠品味，没进奖励函数，就被悄悄牺牲了。Kimi团队在Reddit的坦白和Writing-Zero论文都佐证了这一点——写作品味需要专门派人盯着，否则一不注意就没了。

文章后半段提到Fable 5安全护栏过度敏感，连群聊总结都拒绝生成，三天烧了5美元，以及Anthropic被曝偷偷降低Claude性能来防竞品训练，这些案例拼在一起，指向一个现实：模型能力在特定方向上狂飙，但可用性和可控性在开倒车。

信息缺口也很明显。全文基于一个微信群的讨论和作者个人体验，样本量小，没有披露群成员规模、盲测投票人数。Opus 4.8中文退步的结论来自群友吐槽，缺乏系统性的多任务对比数据。Fable 5拒绝总结的具体触发词、Anthropic“秘密降级”的技术细节，正文都没展开。这些判断方向是对的，但如果你要拿来做采购或选型决策，还需要自己的评测数据兜底。
