# DeepSeek V4 Pro 在 FoodTruck Bench 上追平 GPT-5.2，晚了十周但成本只要十七分之一

> 原标题：DeepSeek V4 Pro matches GPT-5.2 on FoodTruck Bench, our agentic benchmark — 10 weeks later, ~17× cheaper

- 来源：r/LocalLLaMA
- 发布时间：2026-05-05T06:51:49.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14390
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t47qbw/deepseek_v4_pro_matches_gpt52_on_foodtruck_bench/

## 摘要

Reddit 上有人发帖说，DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的智能体评测里排到第四，中位数得分跟 GPT-5.2 只差 3%，但跑一轮任务的成本大概是后者的十七分之一。这个评测跑了 30 天，模型要用 34 种工具、带持久记忆、每天还得做反思，比较贴近真实业务流程。帖子还提到小米的 MiMo v2.5 Pro ...

## 推荐理由

这篇是一个 Reddit 用户自己搭的 benchmark 结果，不是官方发布，所以我会先打个折。但内容本身挺有意思：DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的 30 天 agent 测试里排第 4，跟 GPT-5.2 的中位数只差 3%，API 成本却低了大约 17 倍。测试用了 34 个工具、持久记忆和每日反思，不是简单的一问一答。小米 MiMo v2.5 Pro 也进了前 6，5 次全存活，中位 ROI 1019%，单次跑完只要 $2.41。正文没披露样本量和方差，所以“匹配 GPT-5.2”这个结论先别太激...

## 锐评

这条消息来自 Reddit，发帖人自己搭了个叫 FoodTruck Bench 的评测，让模型在 30 天里用 34 种工具、带记忆、每天做反思，模拟真实业务流程。DeepSeek V4 Pro 中位数得分跟 GPT-5.2 只差 3%，但跑一轮任务的成本大概是后者的十七分之一，省钱效果明显。小米的 MiMo v2.5 Pro 也进了前六，生存率满分，投资回报率中位数超过十倍，单次成本两块四美元。

不过得打个折：帖子原文被 Reddit 屏蔽了，我们看不到具体分数、样本量、任务细节和误差范围。发帖人是谁、有没有利益关系也不清楚。这个 benchmark 本身没有第三方验证，工具数量和任务设计是否合理都只能听他一面之词。

如果数据属实，DeepSeek V4 Pro 在需要长时间、多步骤、带记忆的业务场景里确实能打，成本优势是实打实的。但缺了原始数据和复现条件，这个结论只能当参考，别急着下判断。
