跳到正文

#多模态

今日 1 条

今天 · 9月30日星期三 · 1 条

TechCrunch · AI

Marissa Mayer 推出照片驱动 AI 助手 Dazzle,从相机胶卷读懂你

前 Yahoo CEO Marissa Mayer 推出个人 AI 助手 Dazzle,去年 12 月完成 800 万美元种子轮融资,其上下文来源只有手机相机胶卷,而非邮件和日历。Dazzle 可通过 App 或短信交互,能扫描近期照片填充日历、根据照片库推荐旅行和礼物,并声称会丢弃被标记为敏感的个人信息。

昨天 · 9月29日星期二

AI HOT 精选

Anthropic 发布 Claude Sonnet 5.5,跑分全面超过前代,速度提升 30% 以上,成本还降了 30%

Anthropic 把 Sonnet 5.5 设成了 claude.ai 免费层的默认模型,Simon Willison 实测让它用 WebGL 画了个骑自行车的 3D 鹈鹕,效果不错。这个模型在所有基准测试上都压过了 Sonnet 5,而且跑得更快、更便宜——大部分任务成本能降 30%。不过“max”思考模式还是和 Opus 5.5 一样有 bug:...

推荐理由:把最新 Sonnet 放到免费层不是常规模型更新,是产品策略转向。Simon 的实测给了具体数字(烧了 1.28 美元、渲染成本 5.74 美分、延迟 41 秒),max 模式 bug 跟 Opus 5.5 一致也是个有用的信号——说明底层推理架构可能没变。

AI HOT 精选

Anthropic 发布 Claude Sonnet 5.5,速度比上代快 30% 以上

Anthropic 推出了 Claude Sonnet 5.5,官方说运行速度比 Sonnet 5 快了超过 30%,写东西也更清楚,主要瞄准修 bug、写文档、做幻灯片和表格这类需要快速来回改的活儿。同时发布的 Opus 5.5 则定位在需要谨慎判断的复杂任务上,Haiku 5.5 还要再等几周。正文没提具体定价和延迟数据,所以这 30% 到底在什么...

推荐理由:Anthropic 这次模型线更新,Sonnet 5.5 的 30% 速度提升是个具体数字,产品线分工也说得明白。没给到 85 分是因为正文没披露定价、延迟基准测试,也没说这 30% 是在什么条件下测出来的,我会先打个折。

9月28日星期一

AI HOT 精选

微软雇人审查 Copilot 用户的提示词和上传图片,审阅员被大量色情请求淹没

404 Media 拿到一批内部文件,发现微软雇了至少几百名外包人员,专门看用户发给 Copilot 的提示词和上传的图片。他们的任务不是过滤不安全内容,而是评判生成质量——比如 AI 把胸部放大了,够不够大。审阅员每天被各种性请求刷屏:要求把裙子改短、生成儿童卡通角色的足控图、制作厌食症相关内容。用户上传的人脸从不打码,很多提示词看起来根本没经过当事...

推荐理由:404 Media 拿到的内部文件证据扎实,不是传闻。这篇报道把 Copilot 内容审阅的真实运作方式扒了出来,隐私、伦理、合规三个维度全中。分数没给到 85 以上,是因为它是一篇调查报道,不是产品发布或模型更新,对行业的直接冲击有限,但足以让用户和从业者重新审视自己用的工具。

9月26日星期六

Hacker News 首页

给 LLM 套个 Jev 式外壳:强制单 token 输出,用 logprobs 做选择题,还能看图片

作者受 Jev 启发写了个 Python 封装,核心思路是让 LLM 只输出一个 token(比如 A/B/C),然后读它的 logprobs 来快速做选择题。这样避免了模型长篇大论,速度很快。作者还加了图片支持,用 Gemma 4 12B 在 RTX 3090 上跑摄像头画面,每秒能处理 1 帧,每帧同时问三个问题(有没有人、室内还是室外、亮度如何)...

9月25日星期五

Ben's Bites

AI 花一上午做了个 50 年科技设备时间线

Ben Tossell 用 Codex 和 Factory 花一上午搭了个网站,展示 1976 到 2026 年间 87 款经典设备,所有图片由 Astra 生成,只用了 40 条指令和 7 个子代理。网站已收到 1455 票。项目灵感来自一个“被遗忘的设备”想法,又参考了 Cole 的时间线拖拽演示,代理们自己找参考图、生成新图,还补上了 2009 ...

TechCrunch · AI

PrismML 把压缩了 4 倍的微型语言模型塞进了高通智能眼镜

PrismML 在高通骁龙峰会上展示了一个叫 Bonsai 的 1-bit 语言模型,能直接在智能眼镜上跑,不用联网。这个模型有 20 亿参数,同时处理图像和文字,戴着眼镜看到什么可以直接问。他们的核心本事是把大模型体积压到原来的四分之一,跑分还几乎不掉。这家公司的长远目标是做开放权重的端侧 AI,不把隐私押在云厂商的承诺上。不过目前还没有哪款智能眼镜...

Google DeepMind

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次切换的动态视觉形象。

推荐理由:原文给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 语言支持,可据此判断企业级多模态交互的落地形态。

9月24日星期四

The Verge · AI

Meta 亮出 Muse Charm:一个不带表带的 AI 小屏设备,靠指纹唤醒语音

Meta 在 Connect 大会结尾快速展示了一款叫 Muse Charm 的独立 AI 硬件,专门跑自家的 Muse 智能体。它长得像一块摘掉表带的厚智能手表,配了根挂绳。右上角有指纹传感器,按下去就能直接说话下指令,不用掏手机解锁。正面至少开了三个麦克风孔,还塞了一颗小摄像头。正文没公布价格、续航和上市时间,目前只是露个脸。

推荐理由:Meta 在 Connect 大会结尾快速亮了一款叫 Muse Charm 的独立 AI 硬件,长得像摘掉表带的厚智能手表,挂绳一穿就能戴。右上角指纹传感器按下去直接说话下指令,正面开了至少三个麦克风孔,还藏了一颗小摄像头。我会先打个折:正文没公布价格、续航和上市时间,目前只是露个脸,所以信息量偏薄。但 Meta 在 Ray-Ban 智能眼镜之后又试了一种新形态,把自家 Muse 智能体塞进一个独立设备里,这个动作本身对做 AI 硬件的人有参考价值,分数就定在 72。

Computing Life · Share · 鸭哥调研

Qwen-Image-2.1:版本号从3.0跳回2.1,一个模型把生图、改字、抠透明底全包了

Qwen在9月20日开源了7B参数的图像模型Qwen-Image-2.1,它把文生图、局部编辑和原生输出透明PNG这三件事收进了同一个管线里。最显眼的是版本号从7月的3.0反向跳回2.1,这背后是团队在2026年把产品分成了两条线:3.0是只提供API的闭源商业版,2.1则是继续走开源研究路线的分支。模型内置了一个能处理透明通道的自编码器,生成图片时直...

推荐理由:Qwen把一个模型同时干三件事——生成、编辑、出透明图——这比换个壳实在,版本号反跳也不是噱头,而是2026年双线策略的明确信号。对做图的人来说,少切一次工具就是省时间,点击欲和共鸣都够,分数不往上拉是因为正文没给透明通道在实际场景里的量化效果,先保守一点。

The Verge · AI

Meta 要把 Muse AI 助手塞进智能眼镜,喊名字就能唤醒

Muse 上线才两周,Meta 就说正在把它往智能眼镜里搬,包括 Connect 大会上新发布的款式。用法很简单:喊一声 Muse,就能让它带着你做运动、记吃了什么,或者帮你看看眼前的东西值不值得买。眼镜还会加一个听力增强功能,Meta 说已经过了 FDA 认证,给轻度到中度听损的成年人用。不过正文没提什么时候上线,也没说哪些型号能用上 Muse。

推荐理由:把 Muse 搬上眼镜是 Meta 把 AI 助手从手机推向穿戴设备的关键一步,三个用例也够实在。但正文没给上线时间和支持型号,我会先打个折,分数刚好卡在 featured 门槛上。

The Verge · AI

Meta 给 Muse AI 加了邮箱和视频通话,让它更像一个能替你干活的助手

Meta 给 Muse AI 塞了两项新能力:每个 Muse 智能体都会有一个自己的邮箱,能收发邮件、处理任务,你也可以直接往这个邮箱发指令。Mac 版应用还会获得操控电脑的权限,让 Muse 直接操作你的桌面。另外,Muse 很快会支持视频通话,不再只是打字聊天。正文没披露上线时间和收费方式。

9月23日星期三

AI HOT 精选

小米开源 MiMo-V2.6 Pro 和 Flash 两个全模态模型,Pro 在多数 Agent 基准上追平 Claude Opus 5 和 GPT-5....

小米把 MiMo-V2.6 Pro 和 Flash 两个全模态模型开源了。Pro 在 Artificial Analysis Intelligence Index 上拿了 46 分,是目前开源模型里最高的,在多数 Agent 基准测试里表现跟 Claude Opus 5 和 GPT-5.6 Sol 差不多。训练用的是规模化强化学习,但正文没披露参数量、...

推荐理由:小米把 MiMo-V2.6 Pro 和 Flash 开源了,Pro 在 Agent 基准上表现跟 Claude Opus 5、GPT-5.6 Sol 差不多,Intelligence Index 拿了 46 分,是目前开源最高。我会先打个折:正文没写参数量、训练数据和成本,没法判断实际落地性价比。但国产旗舰模型开源本身信号够强,对开发者和开源生态都有直接价值,按政策给满权重。

Hacker News 首页

RxFilm Studio:一个 AI 导演帮你搞定产品视频的配乐、配音、字幕和渲染

RxFilm Studio 是一个 macOS 原生应用,把产品视频制作的全流程塞进一个窗口。AI 代理充当“导演”,负责生成配乐(用的 Lyria,但正文没说是哪个模型)、多角色配音、自动字幕(支持翻译,可导出 VTT/SRT)、静态图片,最后通过 Remotion 输出 4K 60fps 视频。每次编辑都会先提方案让你审核。1.9.0 版免费,仅支...

AI HOT 精选

蚂蚁开源两个6B模型,一个做设计图生成,一个做图层编辑

蚂蚁开源了 Ming-Image-0.1-Design 系列,包含两个 6B 参数模型,分别负责设计图生成和图层编辑。6B 参数属于中等规模,比动辄几十B的大模型更轻量,部署成本低。但原文页面被拦截,正文没披露模型架构、训练数据、评测指标,也没说跟现有方案比效果如何。目前能确认的是:开源、两个模型、覆盖从生成到编辑的流程。具体能不能打,得等代码和权重放...

AI HOT 精选

Qwen-Image-2.1 在 Arena 图像编辑和文生图两个开源榜都拿了第一

通义千问的 Qwen-Image-2.1 在 Arena 的图像编辑和文生图榜单上都是开源模型第一。图像编辑得分 1367,总榜排第 16,只比第 15 名的 GPT-Image-1.5-high-fidelity 低 3 分。正文没提参数量、模型架构和具体开放时间,这点先别太激动。

推荐理由:Qwen-Image-2.1 在 Arena 图像编辑榜拿到开源第一、总榜第 16,只落后 GPT-Image-1.5 三分,这是实打实的跨模型对比信号。分数定在 78 而不是更高,是因为正文完全没提参数量、模型架构和发布时间——信息缺口不小,我会先打个折。

9月22日星期二

AI HOT 精选

Qwen-Image-2.1 开源,图像编辑榜排开源第一,总分只比 GPT-Image-1.5 高保真版低 3 分

通义千问把 Qwen-Image-2.1 的权重放出来了。在 Arena 的图像编辑榜上拿了 1367 分,开源模型里排第一,总榜第 16。这个分数离第 15 名的 GPT-Image-1.5-high-fidelity 只差 3 分,差距很小。文生图榜也拿了开源第一。正文没提参数量、具体架构和用的什么开源协议,这些关键信息得等后续披露。

推荐理由:Qwen-Image-2.1 权重放出来了,Arena 图像编辑榜开源第一、总榜第 16,离 GPT-Image-1.5 高保真版就差 3 分,文生图榜也是开源第一。分数没给更高是因为正文没提参数量、架构和开源协议,我们只能按榜单成绩打分——光看这个分差,确实值得关注。

Latent Space

小米 MiMo-V2.6-Pro 登顶开源模型榜,训练只花了 300 万美元

小米发了 MiMo-V2.6 系列,Pro 版在 Artificial Analysis 的智能指数上拿了 46 分,排开源模型第一。训练成本 300 万美元,按每次任务 0.13 美元算,性价比踩在了前沿线上。Flash 版主打效率,UltraSpeed 版输出速度拉到了 20 倍。技术报告讲了他们怎么在三个方向上堆强化学习的算力:一是用全异步架构把...

推荐理由:小米的 MiMo-V2.6-Pro 在 Artificial Analysis 开源模型榜上拿了第一,训练只花了 300 万美元,单次任务成本 0.13 美元,性价比踩在了前沿线上。Flash 版和 UltraSpeed 版分别补了效率和速度的位,技术报告还讲了全异步强化学习架构怎么堆算力。正文没提具体评测细节和实际业务场景验证,分数先按现有信息给。

AI HOT 精选

小米 MiMo-V2.6-Pro 在 Code Arena WebDev 排到第10名左右,开源模型里排第3

小米发了两个全模态模型 MiMo-V2.6-Pro 和 Flash。Pro 版在 Code Arena 的网页开发榜上拿了 1628 分,比上一代 MiMo-V2.5-Pro 的 1475 分涨了 153 分,整体排第10名上下,在 MIT 许可的开源权重模型里大概排第3。Flash 版的跑分和参数量正文都没提。

推荐理由:小米 MiMo-V2.6-Pro 在 Code Arena WebDev 榜上排第10名上下,开源权重模型里约第3,分数比上代涨了 153 分,有具体数字支撑。Flash 版参数量和跑分正文都没提,信息有缺口,所以重要性给到 78 比较合适,先别往更高拔。

9月21日星期一

AI HOT 精选

Qwen-Image-2.1 发布,一个 7B 模型同时搞定生图和改图

Qwen-Image-2.1 是个 7B 参数的原生图像模型,一个检查点就能做图像生成和编辑,不用来回切模型。它最多能塞 10 张参考图进去,还内置了一个专门帮你优化提示词的 LLM,省得自己反复调 prompt。模型已经接入了 diffusers 和 ComfyUI,Hugging Face 上也有免安装的网页 demo 可以直接试。不过正文没提训练...

推荐理由:通义千问扔了个 7B 的原生图像模型,一个检查点就能生成和编辑,还塞了个帮你优化提示词的 LLM,组合挺新鲜。分数没给到 85 以上,是因为正文没提训练数据、推理速度,也没给实际的画质对比,这些关键信息都缺着,所以我会先打个折。

9月20日星期日

AI HOT 精选

Qwen-Image-2.1 开源了,一个 7B 模型包揽生图和修图,还能直接跑在 ComfyUI 里

阿里 Qwen 放出了 Qwen-Image-2.1 的开源权重,原生支持 ComfyUI 节点。一个 7B 参数的模型同时干生图和编辑两件事,最高能出 2K 分辨率的图,单次指令最多可以参考 10 张图来改图,还支持带透明通道的 RGBA 输出。正文没提硬件要求和具体授权协议,想本地跑的话得自己试水。

推荐理由:阿里 Qwen 放出一个 7B 的统一生图/编辑模型,原生支持 ComfyUI,能出 2K 图、带透明通道,对本地生图社区是直接利好。分数没给更高,是因为正文没提硬件门槛和授权协议,实际跑起来的门槛还不清楚,这点先别太激动。

Hacker News 首页

阶跃星辰发布 Step 5 Preview,一个 600B 参数的 MoE 旗舰模型,主打编程和金融任务

阶跃星辰推出了 Step 5 Preview,一个总参数量 6000 亿、每次推理激活 270 亿参数的混合专家模型。它支持 100 万 token 的上下文窗口和图像输入,主要瞄准让模型进业务流程干活的场景。在 DeepSWE v1.1 编程测试里拿了 67.7 分,超过了 Kimi K3 和 GLM-5.3,但落后于 GPT-6 Astra 和 C...

推荐理由:Step 5 Preview 是阶跃星辰的 6000 亿参数混合专家模型,在 DeepSWE v1.1 编程测试上拿了 67.7 分,小胜 Kimi K3 和 GLM-5.3,但还落后 GPT-6 Astra 和 Claude Opus 5 约 6-7 分。给了 78 分,因为这是国内模型在 agent 编程方向一次有具体数字的推进,但还没到改写行业格局的程度。我会先打个折:正文没提推理延迟和实际部署成本,100 万 token 上下文在实际业务流程里表现如何也未知,所以分数没给更高。

9月18日星期五

AI HOT 精选

OpenRouter 实测 20 个生图模型:最便宜 0.006 美元一张,最贵 0.134 美元,价差 22 倍

OpenRouter 用同一句提示词跑了 20 个图像生成模型,直接看实际扣了多少钱。最便宜的是 GPT Image 2,一张 1024 方形图只要 0.006 美元;最贵的是 Gemini 3 Pro Image,要 0.134 美元。各家计费单位不一样,有的按 token、有的按像素、有的按张数,光看标价根本没法比,得实际跑一张看账单。测试里 6 ...

推荐理由:OpenRouter 用同一句提示词跑了 20 个图像模型,直接看实际扣了多少钱。最便宜的一张 1024 方形图只要 0.006 美元,最贵的要 0.134 美元,价差超过 20 倍。各家计费单位还不一样,有的按 token、有的按像素、有的按张数,光看标价根本没法比,得实际跑一张看账单。这种一手数据对选模型的人来说比任何 benchmark 都管用,我会先打个折——测试只跑了一组提示词,不同复杂度下排名可能会变,但至少给了个真实的比价起点。

Hacker News 首页

PrismML 把 27B 模型压到 5.9GB,跑分只掉了不到 2%

PrismML 开源了 Bonsai 2 27B,这是基于 Qwen3.8 27B 做的三值量化版。它把模型权重压缩到只有 -1、0、+1 三种值,再配合 FP16 的分组缩放,每个权重只占 1.76 比特,整个模型文件只有 5.9GB,比原版小了 9 倍多。跑分方面,综合基准测试得分 83.9,保留了原版 85.4 分 98.2% 的水平,在编程、智...

TechCrunch · AI

Pinterest 测试 AI 换装功能:拍张房间照片,AI 帮你换家具和灯光

Pinterest 正在内测一个叫 Restyle 的 AI 功能,用户上传自己房间的照片,AI 就能把里面的家具、装饰和灯光全换掉,效果图里出现的商品可以直接跳转购买。说白了就是把“收藏灵感”这一步直接连到“下单”,缩短从看到买的路径。正文没披露上线时间和支持地区,所以离真正能用还有多远不好说。

9月17日星期四

AI HOT 精选

DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型,主打 KV cache 压缩

DeepSeek 发了 V4.1-Flash,一个 552B 参数的 MoE 多模态模型,核心卖点是 KV cache 压缩——就是减少长文本推理时显存占用,让大模型跑长上下文更省显存。论文刚挂 arXiv,压缩比和跑分都没给,标题说“Pushing the Limits”,方向是推理效率。正文没披露具体压缩效果和评测结果,这点先别太激动。

9月16日星期三

AI HOT 精选

DeepSeek V4 不是一个大模型,是一堆模型,只有两个能看图

OpenRouter 发了一篇指南,把 DeepSeek V4 家族里哪个型号能读图、哪个只能读文字列清楚了。V4 不是单个模型,而是一个系列,包括 V4.1 Flash、V4 Pro 0813、V4 Flash 0731、V4 Flash Vision Exp 等。能接受图片输入的只有两个:V4.1 Flash(原生支持,输入 $0.15/百万 to...

9月15日星期二

TechCrunch · AI

前TikTok高管做了个AI教你怎么摆姿势的App

前TikTok高管推出了一款叫Superpose的相机App,你拍张自拍或照片,AI会分析后生成4种可能的姿势,解决“手不知道放哪”的尴尬。去年Google在Pixel手机上也有类似功能叫Camera Coach,但Superpose只专注教人摆姿势。正文没披露它用的是什么模型、是否免费、以及具体上线日期。

Hacker News 首页

开源项目:用树莓派听鸟叫,实时画成19世纪版画风

一个开源项目,用树莓派加麦克风本地识别鸟鸣(不用联网),听到鸟叫就在墨水屏上显示一张19世纪风格的鸟类版画。识别靠BirdNET,画图靠Stable Diffusion,代码和模型全开源。全文没提支持多少种鸟,也没说识别延迟多长。

r/LocalLLaMA

jinfer:一个纯 Java 写的 AI 推理引擎,把大模型塞进 jar 包,不用装 Python

mukel90 发了个新项目 jinfer,是个完全用 Java 写的推理引擎,支持聊天、视觉、语音转文字、文本嵌入、重排序和语音合成。它不依赖 Python、ONNX 或任何外部进程,能直接读写 gguf 和 safetensors 格式的模型。作者说 CPU 上的性能已经能和 llama.cpp 掰手腕,GPU 支持还在开发中。项目已经接入了 Sp...

Computing Life · Share · 鸭哥调研

三条 AI 新闻:会画界面的模型、给自己写说明书的 agent、脱离厂商云的企业编程

Runway 放出了 Solaris 的研究预览,这个系统不写前端代码,靠模型逐帧把界面画出来,用户的点击拖拽直接驱动下一帧画面。目前只有官方精剪的演示视频和一个候补名单,没有公测、定价和 API,第三方实测也还没出现。官方自报用户偏好度比传统代码界面高,但成本对比的参照系是更贵的视频扩散模型,不代表比普通网页渲染省钱。Google Research ...

推荐理由:三条打包,Solaris 是主钩子。Runway 逐帧画界面的思路确实新鲜,但目前只有官方精剪演示和候补名单,没公测、没定价、没 API,第三方实测也还没影,成本对比还绕开了普通网页渲染。所以我会先打个折,重要性给 78。Google 的 WikiSkill 让 agent 从失败里自己总结技能文档,机制具体,但正文没披露规模验证。GitHub 的 Copilot 企业版编码模式把数据留在本地,对合规敏感的公司是刚需,不过细节还不多。整体有话题性,但都缺实测,tier 放 featured 合适。

9月14日星期一

Hacker News 首页

30 个 SVG 画图题,看 2025-2026 年的大模型谁能画好“鹈鹕骑自行车”风格的图

Tom Gally 用 Claude Fable 5.1 搭了个站,把 Simon Willison 那个经典的“鹈鹕骑自行车”测试扩展成了 30 道 SVG 画图题,比如“章鱼弹管风琴”、“长颈鹿组装落地钟”。2026 年跑了 6 个模型,2025 年跑了 10 个。页面直接贴模型返回的原始 SVG,没做主观打分,你自己看图画得怎么样。每张图下面标了...

推荐理由:Simon Willison 那个经典的鹈鹕骑自行车测试,社区里玩了好几年了。Tom Gally 这次把它扩成 30 道题,还跑了 2025 和 2026 两批模型,信息量挺大。页面没做主观打分,就让你自己看图判断,这点反而实在——省得被一个分数带偏。缺点是你得一张张翻,没法一眼扫出排名,但当成一个原始素材库来用,价值很高。

9月12日星期六

Latent Space

DeepSeek V4.1-Flash:763B 参数,用编码器-解码器新架构把预填充和解码拆开跑,还自带视觉

DeepSeek 在 9 月 10 号发了 V4.1-Flash,虽然叫 4.1,Sebastian Raschka 直接说这该叫 V5。模型总参数 763B,用了混合专家(MoE)和因果编码器-解码器架构,把处理输入和生成输出拆成了两个阶段:预填充时激活 8B 参数,解码时激活 16B 参数,稀疏度只有 1% 到 2%。这么一拆,KV 缓存占用最多能...

推荐理由:DeepSeek 发了 V4.1-Flash,763B 的因果编码器-解码器 MoE,预填充 8B 激活、解码 16B 激活,稀疏度 1%-2%,还带了视觉。Sebastian Raschka 说这该叫 V5,说明架构改动不小。国内旗舰模型架构更新,加上外部技术圈同步讨论,HKR 三条都踩中。没给 90 以上是因为刚发,还没看到实际跑分和落地反馈,先打个折。

AI HOT 精选

DeepSeek 开源 V4.1-Flash:用不对称算力给编程 Agent 省 prefill 成本

DeepSeek 放出了 V4.1-Flash 的开放权重,一个 552B 参数的 MoE 模型,用了 Causal Encoder-Decoder 架构,专门为编程 Agent 调过。它把算力拆成两块:prefill 阶段激活 8B 参数,decode 阶段激活 16B,外加 KV 缓存效率也做了优化。跑分上,Terminal Bench 2.1 拿...

推荐理由:DeepSeek 开源了 V4.1-Flash,一个 552B 的 MoE,用 CED 架构把 prefill 和 decode 拆开,专门降编程 agent 的延迟。Terminal Bench 2.1 的分数是实打实的,Baseten 的分析也补了部署视角。没给到 85 分以上是因为这是第三方解读,不是官方技术报告,部分细节还得等一手资料验证。

9月11日星期五

AI HOT 精选

DeepSeek V4.1 Flash 实测:降价还带视觉,游戏和城市生成都能跑

文章标题说 DeepSeek V4.1 Flash 大幅降价、原生支持视觉能力,作者用游戏和城市生成任务测了表现。但正文被微信屏蔽,看不到具体降了多少、视觉能力什么规格、生成质量如何。如果真降价且视觉好用,对做多模态或生成类应用的团队是个好消息,但这点先别太激动——没披露细节前只能当传闻看。

9月10日星期四

AI HOT 精选

WorkBuddy 上线 DeepSeek V4.1-Flash,免费试用两周

WorkBuddy 把 DeepSeek V4.1-Flash 接进了自家平台,新用户能免费试用两周。这个版本通过 DeepSeek API 调用,支持原生多模态(能直接处理图片、文字等混合输入)。但公告没提相比之前版本快了多少、便宜了多少,也没说试用期后怎么收费。