# Fireworks 实测 DeepSeek-V4.1-Flash：写代码能力看齐 GPT-6 Astra，单次成本只要 1/15

> 原标题：Fireworks 评测 DeepSeek-V4.1-Flash：DeepSWE 达 GPT-6 Astra 水准、成本仅 1/15

- 来源：AI HOT 精选
- 发布时间：2026-09-15T00:36:35.301Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56568
- 原文：https://fireworks.ai/blog/DeepSeek-V4.1-Flash-Astra

## 摘要

Fireworks 跑了一遍 DeepSeek-V4.1-Flash 的完整测试。在衡量自动修 bug、写代码能力的 DeepSWE 基准上，它的 pass@1 得分是 74.34%，跟 GPT-6 Astra 的 74.12% 在同一档，但每次任务成本只要 0.43 美元，比 Astra 便宜 15 倍，比 Claude Opus 5 便宜 28 倍...

## 推荐理由

DeepSeek V4.1-Flash 在 DeepSWE 上跟 GPT-6 Astra 平起平坐，成本却砍了一个数量级，是本周最强的性价比信号。扣分是因为数据来自 Fireworks 自己的评测，不是独立第三方，而且原文被 cookie 墙截断，看不到完整方法和误差范围，所以结论先打个折。

## 锐评

Fireworks 跑了一遍 DeepSeek-V4.1-Flash，最亮眼的数据在 DeepSWE 基准上：pass@1 得分 74.34%，跟 GPT-6 Astra 的 74.12% 几乎一样，但每次任务成本 0.43 美元，比 Astra 便宜 15 倍，比 Claude Opus 5 便宜 28 倍。这个基准主要测模型自动修 bug、写代码的能力，所以对做编程助手或自动化开发流程的团队来说，这个性价比很值得关注。

模型本身是 552B 参数的混合专家架构，用了“分体式激活”设计——读入信息时激活 8B 参数，输出时激活 16B 参数，还做了 KV 缓存优化来压延迟。在 Terminal-Bench 2.1 上它比 Astra 低 1 分，但成本只有对方的 1/12。

需要留个心眼：这是 Fireworks 自己发布的评测，不是独立第三方跑出来的。文章提到还测了 HLE 和一个“预言路由器”评估，但没公布具体分数，只说结果“有意思”。这种选择性披露让人没法判断模型在更难的推理任务上到底什么水平。另外，DeepSWE 和 Terminal-Bench 都是相对窄的代码场景，不代表它在通用对话、长文本理解或事实准确性上也能打平 Astra。
