# 通义千问 Qwen3.7-Max 编程能力排到全球第二，Code Arena 得分 1541，仅次于 Claude

> 原标题：Qwen3.7-Max 成为全球第二AI编程模型

- 来源：AI HOT 精选
- 发布时间：2026-05-26T06:45:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/27977
- 原文：https://x.com/alibaba_cloud/status/2059163881361048011

## 摘要

Qwen3.7-Max 在 Code Arena 编程评测上拿了 1541 分，排名第二，只比 Claude 低。官方说它能连续跑 35 小时的任务、单次调用工具超过 1000 次，原本要两周的项目几小时就能搞定。不过正文没披露具体测试环境、任务类型和对比模型的详细分数，实际生产表现还得看后续验证。

## 推荐理由

这条消息的钩子很清晰，就是“编程第二”这个位置。给出的分数和任务时长是硬指标，虽然都来自阿里云自己的一篇发布，没有第三方交叉验证，但作为产品更新和基准测试的成绩单，信息量够、指向明确。我会先打个折——没有独立评测之前，这个“第二”更多是厂商宣称，但它的确提供了一个可被检验的标靶，值得放进 featured 让从业者自己去盯后续实测。

## 锐评

阿里云放出的 Qwen3.7-Max 在 Code Arena 上拿了 1541 分，排名第二，仅次于 Claude。这个分数说明它在编程评测里表现不错，但正文没披露 Claude 的具体分数，也没说测试用的什么任务类型、代码规模和环境配置，所以这个“第二”的含金量还得看后续细节。

官方强调它能连续跑 35 小时、单次调用工具超过 1000 次，原本两周的项目几小时搞定。这些数字听起来挺省钱，但全是厂商自述，没有第三方验证或客户案例支撑。工具调用 1000 次不代表每次都正确，35 小时连续跑也不等于产出质量高。

目前这条消息还停留在标题新闻阶段，缺的东西不少：具体定价、对比模型的详细分数、实际生产环境下的成功率和用户反馈。在官方出完整技术报告或独立评测出来前，这条只能当产品预告看。
