# Qwen3.6-27B 开源，参数只有前代旗舰的十五分之一，但在智能体编程上反超了 397B 模型

> 原标题：27B秒了自家397B旗舰，Qwen3.6-27B开源，智能体编程全面超越前代

- 来源：量子位 · 公众号
- 发布时间：2026-04-23T12:43:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/9679
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247885704&idx=3&sn=589e625a5a883b4860acd1fb717c5fed

## 摘要

Qwen 放出了 Qwen3.6-27B 的权重，一个 270 亿参数的稠密模型。官方说它在四项智能体编程基准上全面超过了自家上一代 3970 亿参数的旗舰 Qwen3.5-397B。具体看，SkillsBench 从 30.0 跳到 48.2，GPQA Diamond 拿到 87.8，AIME26 达到 94.1，说明模型在需要调用工具、写代码解决问...

## 推荐理由

这是一次有料的 Qwen 开源发布，给出了智能体编程和推理的硬分数，HKR 三项都站得住。我维持 84 分不往上加，因为正文只给了基准数字，没提上下文窗口、推理成本或独立复现结果，这些缺口让判断先打个折。

## 锐评

这条消息最抓人的地方是参数规模差了近 15 倍，但 27B 的小模型在需要调用工具、写代码解决问题的场景里把自家 397B 旗舰比下去了。SkillsBench 从 30.0 拉到 48.2，GPQA Diamond 87.8、AIME26 94.1，这几个数说明模型在工具使用和推理类任务上确实有提升。

不过正文只给了分数，没交代测试是怎么跑的、有没有针对基准做专门优化，也没说对比的 397B 模型用的是哪个版本、什么配置。这种“小打大”的结论要成立，得看两边是不是在同等条件下比的。另外，模型用了 Thinking Preservation 和 Gated DeltaNet，但文章没解释这两个技术具体怎么帮模型省参数、提效果，对想复现的人来说信息缺口不小。

整体看，这是一个值得关注的效率信号，但缺验证细节和消融实验，暂时只能当官方自报的成绩看。
