# 阶跃星辰发布 Step 5 Preview，一个 600B 参数的 MoE 旗舰模型，主打编程和金融任务

> 原标题：Step 5 Preview: Advancing the Pareto Frontier

- 来源：Hacker News 首页
- 发布时间：2026-09-20T04:35:59.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57700
- 原文：https://www.stepfun.com/step-5-preview

## 摘要

阶跃星辰推出了 Step 5 Preview，一个总参数量 6000 亿、每次推理激活 270 亿参数的混合专家模型。它支持 100 万 token 的上下文窗口和图像输入，主要瞄准让模型进业务流程干活的场景。在 DeepSWE v1.1 编程测试里拿了 67.7 分，超过了 Kimi K3 和 GLM-5.3，但落后于 GPT-6 Astra 和 C...

## 推荐理由

Step 5 Preview 是阶跃星辰的 6000 亿参数混合专家模型，在 DeepSWE v1.1 编程测试上拿了 67.7 分，小胜 Kimi K3 和 GLM-5.3，但还落后 GPT-6 Astra 和 Claude Opus 5 约 6-7 分。给了 78 分，因为这是国内模型在 agent 编程方向一次有具体数字的推进，但还没到改写行业格局的程度。我会先打个折：正文没提推理延迟和实际部署成本，100 万 token 上下文在实际业务流程里表现如何也未知，所以分数没给更高。

## 锐评

阶跃星辰这次放出的 Step 5 Preview，是一个总参数 6000 亿、每次推理只激活 270 亿参数的混合专家模型，支持 100 万 token 上下文和图像输入，主要瞄准让模型进业务流程干活的场景。从跑分看，它在 DeepSWE 编程测试里拿了 67.7 分，超过了 Kimi K3 和 GLM-5.3，但比 GPT-6 Astra 和 Claude Opus 5 低了 6 分多。在自家 StepCodeBench 上也是类似格局：国内领先，但跟美国两家头部模型有 12 到 15 分的差距。金融测试 FrontierFinance 倒是亮点，66.4 分仅次于 Claude Opus 5，比 GPT-6 Astra 高出 11 分。

官方引用了 Artificial Analysis 的智力指数 44 分，并放了一张成本对比图，声称在同等智力水平下，单任务成本比同类模型低不少。但正文没披露 API 定价、具体发布时间和训练细节，所以这个成本优势目前只能看图表趋势，没法自己算账。如果是真的挺省钱，那对高频调用场景会有吸引力。

还缺什么：没有公开的安全对齐报告，也没说明 100 万 token 长上下文在实际任务里的召回率表现。另外，Terminal-Bench 和 ALE-CLI 这类更贴近真实 agent 操作的测试里，它跟 GPT-6 Astra 的差距还比较大，说明在复杂多步执行上仍有提升空间。
