# DeepSeek 开源首个视觉模型 V4-Flash-Vision-Exp，多模态 Agent 能力接近 Opus-4.8

> 原标题：DeepSeek-V4-Flash-Vision-Exp 模型已开源，多模态 Agent 能力接近 Opus-4.8

- 来源：AI HOT 精选
- 发布时间：2026-08-31T11:35:24.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53903
- 原文：https://www.ithome.com/0/996/637.htm

## 摘要

DeepSeek 在 Hugging Face 上放出了 V4 系列第一个能看图的模型，用 MIT 协议开源。它支持 JPEG、PNG、GIF、WebP 图片输入，能做图片描述、截图识字、读图表这些事。仓库里给了模型文件、分词器和一个极简的 PyTorch 推理代码，覆盖了视觉编码器、MoE（混合专家）、DFlash 注意力等核心模块。官方说这是个实验...

## 推荐理由

DeepSeek 放出了 V4 系列第一个多模态实验模型，MIT 协议，能看图、识字、读图表。官方说 Agent 能力接近 Opus-4.8，但正文没给出具体 benchmark 数字和对比细节，所以分数先打个折。即使这样，一个中国大模型直接对标 Claude 旗舰款，还给了可跑的推理代码，重要性依然很高。

## 锐评

DeepSeek 放出了 V4 系列第一个能看图的模型，用 MIT 协议开源，这意味着你可以直接拿来商用或二次开发，不用纠结授权问题。它支持 JPEG、PNG、GIF、WebP 这些常见图片格式，能干图片描述、截图识字、读图表这类活。仓库里给了模型文件、分词器和一个极简的 PyTorch 推理代码，覆盖了视觉编码器、MoE（混合专家，一种用多个小专家协作来降低计算量的架构）、DFlash 注意力等核心模块，想自己部署或魔改的人可以直接跑起来。

官方说它在纯文本任务上和 V4-Flash 正式版持平，原有能力没丢；在需要视觉理解的 Agent 基准测试里比 V4-Flash 大幅提升，多模态 Agent 能力已接近 Opus-4.8。这个“接近”具体差多少、在哪些场景差，正文没给具体数字，这点先别太激动。另外，模型名字里带“Exp”实验标签，说明它还不是稳定版，API 8 月 21 号才上线，现在开放权重更多是让社区先试起来。

还缺什么：没有披露模型参数量、推理延迟、显存占用，也没有跟自家 V4-Flash 正式版或 Opus-4.8 的逐项对比数据。如果你打算用在生产环境，建议先在自己业务场景里跑一轮评测，别只看基准跑分。
