群聊周报 Vol.4|大模型跑分屠榜,中文却越写越差;用好了 AI 真的就能升职了吗;Fable 5 连群聊都不愿意总结
这期周报聊了三件让 AI 从业者头疼的事。第一件,Opus 4.7 和 4.8 跑分越来越高,但中文写作明显退步,写出来的东西不像人话,连说明文档都没法用。作者通过群内盲测发现,新版模型思考时间变短、输出更顺滑,但读材料反而更潦草。这不是模型变笨,是强化学习让它偏科了——数学和编程这类有标准答案的任务被拼命优化,而写作这种靠品味、没法用对错打分的能力,...
推荐理由:这篇社区周报用一手盲测数据指出 Opus 4.7/4.8 中文写作退步,证据具体,不是空谈。但它本质是个人博客观察,不是官方公告或可复现研究,权威性有限,所以给 featured 而不是更高等级。