# Anthropic 40 万条编程会话报告：管理者成功率超工程师；Gemini 3.5 Flash 输出截断根因是思考独白吃光 token

> 原标题：2026-06-22 群聊日报

- 来源：AI 群聊日报
- 发布时间：2026-06-23T07:39:32.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40255
- 原文：https://louyu2015.github.io/AI-chatgroup-daily/daily/2026/06/22/daily/

## 摘要

Anthropic 分析了约 40 万条 Claude Code 真实会话，发现管理者在需要 git commit、PR 合并、测试通过等硬证据的“已验证成功”指标上得分最高，超过软件工程师。群里指出这有明显选择偏差——管理者只管灵光一现，不管边界情况死活。Sakana AI 发布多模型编排产品 Fugu，SWE Bench Pro 得分 73.7，特...

## 推荐理由

Anthropic 拿 40 万条真实会话做了量化分析，发现管理者在需要硬证据的指标上得分最高，群里已经指出选择偏差——管理者只管想法不管边界情况。HKR 三点都踩中了，但这是日报里的二手摘要，不是一手论文，所以给 72 分放在 featured 位置。

## 锐评

这条日报信息量很大，但最值得点开的是Anthropic那篇报告。它基于40万条真实会话，发现管理者在需要硬证据的“已验证成功”指标上得分最高。群里一眼看穿选择偏差：管理者只追求那个“啊哈时刻”，不用管代码在极端情况下的死活。这个判断很关键，直接点出了这类统计的软肋——成功怎么定义，谁为失败兜底。

实操部分，Gemini 3.5 Flash输出截断的根因被挖出来了：是模型内部的思考独白吃光了token，导致正文没地方写。调大输出限制能缓解，但成本会涨到跟Pro差不多，而且还不稳定。这点对正在用Gemini干活的人很有用，能少踩一个坑。

Sakana AI的Fugu产品特意标注“不受美国出口管制”，摆明了要吃地缘政治的红利。OpenCode的数据面板也很有意思，日活13.6万，模型份额清一色国产，DeepSeek占了53.6%。这俩信息放一起看，能感觉到模型市场的分化正在加速。不过，Fugu的benchmark分数和实际交付之间还有多大距离，正文没细说，这点得留个心眼。
