DeepSeek 发布 V4.1-Flash:新架构让模型自带看图能力,不再外挂视觉模块
DeepSeek 发布 V4.1-Flash:新架构带来原生视觉理解与大幅降价
DeepSeek 推出了 V4.1-Flash,换了一套叫“因果编码器-解码器”的新架构,直接把视觉理解做进了模型里,不用再单独接一个看图组件。模型总规模 552B 参数,是个混合专家模型,处理你输入的内容时只激活 8B 参数,生成回答时激活 16B。官方说价格降了不少,但正文没给出具体降幅和跑分数据,我会先打个折,等第三方实测出来再看。
推荐理由:DeepSeek 发了 V4.1-Flash,换了一套因果编码器-解码器架构,把视觉理解原生集成进去,不用再外接看图模块。552B 总参数,推理时只激活 8B/16B,部署压力不大。官方说价格降了不少,但正文没给具体降幅和跑分,我会先打个折,等第三方实测出来再看。