跳到正文
AI HOT 精选

通义千问 Qwen3.7-Max 编程能力排到全球第二,Code Arena 得分 1541,仅次于 Claude

Qwen3.7-Max 成为全球第二AI编程模型

Qwen3.7-Max 在 Code Arena 编程评测上拿了 1541 分,排名第二,只比 Claude 低。官方说它能连续跑 35 小时的任务、单次调用工具超过 1000 次,原本要两周的项目几小时就能搞定。不过正文没披露具体测试环境、任务类型和对比模型的详细分数,实际生产表现还得看后续验证。

推荐理由:这条消息的钩子很清晰,就是“编程第二”这个位置。给出的分数和任务时长是硬指标,虽然都来自阿里云自己的一篇发布,没有第三方交叉验证,但作为产品更新和基准测试的成绩单,信息量够、指向明确。我会先打个折——没有独立评测之前,这个“第二”更多是厂商宣称,但它的确提供了一个可被检验的标靶,值得放进 featured 让从业者自己去盯后续实测。

读原文 ↗导出 Markdown