# deepseek-chat 升级为 DeepSeek-V2-0628，推理与角色扮演能力提升

> 原标题：deepseek-chat

- 来源：DeepSeek · API 更新日志
- 发布时间：2024-06-27T16:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/qtntymqcluy1fkj3p4qmmr175
- 原文：https://api-docs.deepseek.com/zh-cn/updates#deepseek-chat-3

## 摘要

deepseek-chat 模型升级为 DeepSeek-V2-0628，推理能力提升，角色扮演能力显著增强。HumanEval Pass@1 从 79.88% 提升至 84.76%，MATH ACC@1 从 55.02% 提升至 71.02%，BBH 从 78.56% 提升至 83.40%。

## 推荐理由

DeepSeek 升级后的数学基准提升幅度高于代码与推理基准，在 Arena-Hard 中对 GPT-4-0314 的胜率也有提升。

## 锐评

MATH ACC@1 从 55.02% 窜到 71.02%，一口气涨了 16 个点，这几个指标里我最不信的就是它。

HumanEval 和 BBH 都只微调了不到 5 个点，偏偏数学单项猛拔一大截，专项刷题的痕迹挺重的。基准测试涨得这么偏，实际业务推理很难有同等幅度的感知。deepseek-chat 这一版的账面收益，大部分也就是让榜单好看点。
