跳到正文
AI 群聊日报

Anthropic 40 万条编程会话报告:管理者成功率超工程师;Gemini 3.5 Flash 输出截断根因是思考独白吃光 token

2026-06-22 群聊日报

Anthropic 分析了约 40 万条 Claude Code 真实会话,发现管理者在需要 git commit、PR 合并、测试通过等硬证据的“已验证成功”指标上得分最高,超过软件工程师。群里指出这有明显选择偏差——管理者只管灵光一现,不管边界情况死活。Sakana AI 发布多模型编排产品 Fugu,SWE Bench Pro 得分 73.7,特...

推荐理由:Anthropic 拿 40 万条真实会话做了量化分析,发现管理者在需要硬证据的指标上得分最高,群里已经指出选择偏差——管理者只管想法不管边界情况。HKR 三点都踩中了,但这是日报里的二手摘要,不是一手论文,所以给 72 分放在 featured 位置。

读原文 ↗导出 Markdown