# 阶跃星辰发了 Step 3.7 Flash，一个 196B 参数的 MoE 模型，主打推理省钱

> 原标题：阶跃星辰Step 3.7 Flash发布，专为高效推理设计

- 来源：AI HOT 精选
- 发布时间：2026-06-02T03:45:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/31713
- 原文：https://x.com/StepFun_ai/status/2061655529731342402

## 摘要

这个模型用了多矩阵分解注意力，把 KV-cache 的占用压到 DeepSeek 同类模型的 22% 左右，显存压力小很多。另外还把注意力和前馈网络解耦，方便在硬件上跑得更顺。模型走 Apache 2.0 协议，已经在 Fireworks AI 上可用，官方说能用来搭智能体应用。不过正文没给出具体跑分和延迟数据，实际效果还得看第三方实测。

## 推荐理由

HKR 三项都站得住：Step 3.7 Flash 有 196B MoE 和约 22% KV-cache 成本的具体数字，不是纯宣传稿。不过它还没到一线旗舰模型的体量，所以给 78 分放在 featured 里。

## 锐评

阶跃星辰放了个 Step 3.7 Flash，196B 的 MoE 模型，主打推理省钱。它用多矩阵分解注意力把 KV-cache 占用压到 DeepSeek 同类模型的 22% 左右，显存压力小很多，还把注意力和前馈网络解耦，让硬件跑起来更顺。模型走 Apache 2.0，已经在 Fireworks AI 上可用，官方说能搭智能体应用。

但正文没给出任何基准跑分、吞吐量或延迟数据，也没说在什么硬件上测出这个 22%。没有第三方验证，这个数字只能当官方口径看。另外，196B 总参数量不小，实际部署成本除了 KV-cache 还要看激活参数和通信开销，光压缓存不一定等于整体省钱。

还缺的是：跟同尺寸模型的横向对比、具体推理场景的延迟表现、以及智能体应用到底能跑多稳。等第三方实测出来再判断性价比。
