# 通义千问发布 Qwen3.7-Max，主打长时间自主干活和跨平台编程

> 原标题：Qwen3.7：智能体前沿

- 来源：AI HOT 精选
- 发布时间：2026-05-20T02:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23838
- 原文：https://qwen.ai/blog?id=qwen3.7

## 摘要

Qwen 团队推出了 Qwen3.7-Max，一个专为智能体场景设计的闭源模型。它最显眼的能力是能长时间自主执行任务，官方演示了一个连续跑 35 小时、调用上千次工具的内核优化任务。在编程方面，它在 Terminal Bench 2.0 上拿了 69.7 分，超过了 DeepSeek-V4-Pro Max 的 67.9 分；在 SWE-Pro 这类复杂...

## 推荐理由

Qwen Studio 发了 Qwen3.7，一口气覆盖聊天、图像视频理解、图像生成、文档处理、网页搜索、工具调用和工件生成，摆明要往智能体方向走。我会先打个折：正文没给任何 benchmark、定价、上下文窗口或延迟数据，所以没法判断实际可用性和成本。亮点是工具调用和工件生成这两项，说明模型不只是聊天，而是被设计成能进业务流程干活。这点先别太激动，等看到具体评测和接入方式再说。

## 锐评

Qwen3.7-Max 把自己定位成“智能体专用模型”，最抓眼球的证据是官方演示了一个连续跑 35 小时、调用上千次工具的内核优化任务。这个数字说明模型能在长时间自主执行中保持连贯推理，不是那种跑几步就断片的玩具。编程智能体方面，它在 Terminal Bench 2.0 上拿了 69.7 分，超过 DeepSeek-V4-Pro Max 的 67.9 分；SWE-Pro 这类复杂软件工程任务上 60.6 分，比对手高 1-2 分，属于小幅领先。通用智能体基准如 MCP-Mark 和 Skillbench 也都有 2-5 分的优势，但幅度不算碾压。

要注意的是，这篇博客是产品发布文，不是技术报告。正文没披露上下文长度上限、API 定价、具体开放时间，也没说明 35 小时任务是否可复现、有没有人工干预。所有基准测试用的都是内部脚手架或特定框架（如 Claude Code），跨框架泛化能力虽然提了，但没给量化对比。STEM 推理部分，GPQA Diamond 92.4 分、HLE 41.4 分确实高，但 CritPT 只有 11.4 分，说明模型在批判性推理这种需要挑错的任务上还有明显短板。

整体看，Qwen3.7-Max 在智能体场景上确实往前拱了一步，尤其是长程自主执行和跨框架兼容性。但缺少上下文长度、成本和可复现细节，让这些数字的实用参考价值打了折扣。等 API 上线后看实际延迟和费用，才能判断是不是真能进生产流程。
