# Kwaipilot 开源 KAT-Coder-V2.5-Dev：35B 总参、3B 激活的 MoE 编程模型，专攻智能体编程任务

> 原标题：Kwaipilot/KAT-Coder-V2.5-Dev · Hugging Face

- 来源：r/LocalLLaMA
- 发布时间：2026-07-23T11:31:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46111
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1v4b9a8/kwaipilotkatcoderv25dev_hugging_face/

## 摘要

Kwaipilot 在 Hugging Face 上放出了 KAT-Coder-V2.5-Dev 的权重。这是一个总参数 35B、每次只激活 3B 的混合专家模型，用监督微调和强化学习专门训练来做智能体编程，也就是让模型自己调用工具、写代码、改代码。团队说在这个参数规模下做到了最好，还把异常工具调用标签的比例从 9.34% 压到了 0.28%，单轮连续...

## 推荐理由

KAT-Coder-V2.5-Dev在35B/3B MoE这个规格上给出了很具体的工具调用稳定性提升（异常率9.34%→0.28%），H和K都站得住。但团队太陌生，社区讨论几乎没有，R不成立，而且帖子没交代对比基线、RL细节和完整评测，分数就定在72，featured但别当定论。

## 锐评

这个模型最实在的亮点是把异常工具调用标签的比例从 9.34% 压到了 0.28%，单轮连续重复也从 0.34% 降到了 0%。对做智能体编程的人来说，这意味着模型乱调工具、卡死在循环里的情况会少很多，是个很实际的工程优化。

但 Reddit 上有人直接贴了对比表：他们测出来的 Qwen 3.6 35B 在 SWE-bench 上的分数是 64.4/57.0/40.6，而 Qwen 官方模型卡上写的是 73.4/67.2/49.5，差距不小。发帖人怀疑 KAT-Coder 的领先优势，很大一部分是因为训练时用了 Claude Code 作为交互框架，然后专门针对这个框架做微调，换个框架跑可能就没这么好看。

正文没披露其他编程基准测试的成绩，也没说明训练数据里有多少是 Claude Code 生成的轨迹。如果只看 SWE-bench 这一个指标，而且对比基线还被压低了，那“同参数规模最强”这个说法得打个折。想验证的话，最好在别的评测集和不同的工具框架下跑一遍。
