# DeepSeek V4 Flash 0731 在 ARC-AGI-2 上跑出 61.4%，单任务成本 0.04 美元

> 原标题：DeepSeek V4 Flash 0731

- 来源：Hacker News 首页
- 发布时间：2026-08-07T17:56:20.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/49363
- 原文：https://arcprize.org/results/deepseek-v4-flash-0731

## 摘要

DeepSeek 把 V4 Flash 0731 提交到了 ARC Prize 的官方排行榜，用了三种推理强度来跑分。最猛的那一档在 ARC-AGI-1 半私有集上拿了 89.0%，单任务成本 0.02 美元；在更难的 ARC-AGI-2 上拿了 61.4%，成本翻倍到 0.04 美元。推理强度一降，分数掉得很明显，低强度版本在 ARC-AGI-2 上...

## 推荐理由

DeepSeek 把 V4 Flash 0731 提交到 ARC Prize 排行榜，用三档推理预算跑分，高预算在 ARC-AGI-2 上拿到 61.4%，是目前公开最高分，单任务成本 0.04 美元。文章给了具体数字和成本对比，信息密度高。没给更高分是因为这还只是排行榜提交，没有论文或技术细节，验证强度有限。

## 锐评

DeepSeek 把 V4 Flash 0731 提交到了 ARC Prize 的官方排行榜，用三种推理强度跑分。最猛那档在 ARC-AGI-1 半私有集上拿了 89.0%，单任务成本 0.02 美元；在更难的 ARC-AGI-2 上拿了 61.4%，成本翻倍到 0.04 美元。这个成本看着不高，但要注意，推理强度一降，分数掉得很明显——低强度版本在 ARC-AGI-2 上只剩 46%，说明模型很依赖大量推理计算来维持表现，不是那种轻量跑也能稳住的类型。

正文没披露模型规模、具体架构，也没给 ARC-AGI-3 的结果。ARC-AGI-3 是今年新出的更难的测试集，缺这块数据就没法判断模型在最新基准上的真实水平。另外，提交方是 DeepSeek 自己，不是第三方独立评测，分数可以参考，但别当最终结论。
