Codex 修 bug 越修越多,群友实测三家 agent 并分享约束心法
2026-08-24 群聊日报
群友周末让 Codex、Claude Code 和 Grok Bot 跑同一批 issue,Claude 和 Grok 不到十小时完工,Codex 跑了 48 小时反而把 10 个 issue 膨胀成 80 个——它太谨小慎微,几行代码能修的事也要开新 issue,其中三成还是臆想出来的。群友当天退订了 Codex $200 档位。讨论转向怎么给模型设...
推荐理由:这条信息来自群聊日报,不是正式评测,所以我会先打个折。但它的信号很集中:三个编码 agent 同场竞技,Codex 不仅慢,还把简单问题复杂化,用户直接退订 $200 档位。这比任何跑分都更能说明当前 agent 在真实任务里的可靠性问题。Claude 和 Grok 不到 10 小时完工这个对比点也很扎实,给从业者一个直观的效率参照。正文没披露具体 issue 类型和复杂度,所以不能当严谨基准用,但作为一线用户的即时反馈,它的警示意义够强。