DeepSeek 开源首个视觉模型 V4-Flash-Vision-Exp,多模态 Agent 能力接近 Opus-4.8
DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8
DeepSeek 在 Hugging Face 上放出了 V4 系列第一个能看图的模型,用 MIT 协议开源。它支持 JPEG、PNG、GIF、WebP 图片输入,能做图片描述、截图识字、读图表这些事。仓库里给了模型文件、分词器和一个极简的 PyTorch 推理代码,覆盖了视觉编码器、MoE(混合专家)、DFlash 注意力等核心模块。官方说这是个实验...
推荐理由:DeepSeek 放出了 V4 系列第一个多模态实验模型,MIT 协议,能看图、识字、读图表。官方说 Agent 能力接近 Opus-4.8,但正文没给出具体 benchmark 数字和对比细节,所以分数先打个折。即使这样,一个中国大模型直接对标 Claude 旗舰款,还给了可跑的推理代码,重要性依然很高。