Mistral 这个 agent 最值钱的不是自动写测试,是那个 AGENTS.md 文件——光靠一份 markdown 写清执行步骤,质量分从 0.68 涨到 0.74。
真正卡住 agent 的从来不是模型能力,是没人把「先读源码、再选 skill、最后自问每个 public method 都测了吗」写下来。它按文件类型拆 skill、用 Rubocop 和 SimpleCov 做校验,这套结构比模型本身更可复制。但 0.74 这个分是自家仓库自家标准,换个大杂烩 monolith 未必站得住。