跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 1–20 条 · 共 514 条

昨天 · 9月29日星期二

AI HOT 精选

Anthropic 发布 Claude Sonnet 5.5,跑分全面超过前代,速度提升 30% 以上,成本还降了 30%

Anthropic 把 Sonnet 5.5 设成了 claude.ai 免费层的默认模型,Simon Willison 实测让它用 WebGL 画了个骑自行车的 3D 鹈鹕,效果不错。这个模型在所有基准测试上都压过了 Sonnet 5,而且跑得更快、更便宜——大部分任务成本能降 30%。不过“max”思考模式还是和 Opus 5.5 一样有 bug:...

推荐理由:把最新 Sonnet 放到免费层不是常规模型更新,是产品策略转向。Simon 的实测给了具体数字(烧了 1.28 美元、渲染成本 5.74 美分、延迟 41 秒),max 模式 bug 跟 Opus 5.5 一致也是个有用的信号——说明底层推理架构可能没变。

AI HOT 精选

Anthropic 发布 Claude Sonnet 5.5,速度比上代快 30% 以上

Anthropic 推出了 Claude Sonnet 5.5,官方说运行速度比 Sonnet 5 快了超过 30%,写东西也更清楚,主要瞄准修 bug、写文档、做幻灯片和表格这类需要快速来回改的活儿。同时发布的 Opus 5.5 则定位在需要谨慎判断的复杂任务上,Haiku 5.5 还要再等几周。正文没提具体定价和延迟数据,所以这 30% 到底在什么...

推荐理由:Anthropic 这次模型线更新,Sonnet 5.5 的 30% 速度提升是个具体数字,产品线分工也说得明白。没给到 85 分是因为正文没披露定价、延迟基准测试,也没说这 30% 是在什么条件下测出来的,我会先打个折。

9月28日星期一

AI HOT 精选

微软雇人审查 Copilot 用户的提示词和上传图片,审阅员被大量色情请求淹没

404 Media 拿到一批内部文件,发现微软雇了至少几百名外包人员,专门看用户发给 Copilot 的提示词和上传的图片。他们的任务不是过滤不安全内容,而是评判生成质量——比如 AI 把胸部放大了,够不够大。审阅员每天被各种性请求刷屏:要求把裙子改短、生成儿童卡通角色的足控图、制作厌食症相关内容。用户上传的人脸从不打码,很多提示词看起来根本没经过当事...

推荐理由:404 Media 拿到的内部文件证据扎实,不是传闻。这篇报道把 Copilot 内容审阅的真实运作方式扒了出来,隐私、伦理、合规三个维度全中。分数没给到 85 以上,是因为它是一篇调查报道,不是产品发布或模型更新,对行业的直接冲击有限,但足以让用户和从业者重新审视自己用的工具。

9月25日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次切换的动态视觉形象。

推荐理由:原文给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 语言支持,可据此判断企业级多模态交互的落地形态。

9月24日星期四

The Verge · AI

Meta 亮出 Muse Charm:一个不带表带的 AI 小屏设备,靠指纹唤醒语音

Meta 在 Connect 大会结尾快速展示了一款叫 Muse Charm 的独立 AI 硬件,专门跑自家的 Muse 智能体。它长得像一块摘掉表带的厚智能手表,配了根挂绳。右上角有指纹传感器,按下去就能直接说话下指令,不用掏手机解锁。正面至少开了三个麦克风孔,还塞了一颗小摄像头。正文没公布价格、续航和上市时间,目前只是露个脸。

推荐理由:Meta 在 Connect 大会结尾快速亮了一款叫 Muse Charm 的独立 AI 硬件,长得像摘掉表带的厚智能手表,挂绳一穿就能戴。右上角指纹传感器按下去直接说话下指令,正面开了至少三个麦克风孔,还藏了一颗小摄像头。我会先打个折:正文没公布价格、续航和上市时间,目前只是露个脸,所以信息量偏薄。但 Meta 在 Ray-Ban 智能眼镜之后又试了一种新形态,把自家 Muse 智能体塞进一个独立设备里,这个动作本身对做 AI 硬件的人有参考价值,分数就定在 72。

Computing Life · Share · 鸭哥调研

Qwen-Image-2.1:版本号从3.0跳回2.1,一个模型把生图、改字、抠透明底全包了

Qwen在9月20日开源了7B参数的图像模型Qwen-Image-2.1,它把文生图、局部编辑和原生输出透明PNG这三件事收进了同一个管线里。最显眼的是版本号从7月的3.0反向跳回2.1,这背后是团队在2026年把产品分成了两条线:3.0是只提供API的闭源商业版,2.1则是继续走开源研究路线的分支。模型内置了一个能处理透明通道的自编码器,生成图片时直...

推荐理由:Qwen把一个模型同时干三件事——生成、编辑、出透明图——这比换个壳实在,版本号反跳也不是噱头,而是2026年双线策略的明确信号。对做图的人来说,少切一次工具就是省时间,点击欲和共鸣都够,分数不往上拉是因为正文没给透明通道在实际场景里的量化效果,先保守一点。

The Verge · AI

Meta 要把 Muse AI 助手塞进智能眼镜,喊名字就能唤醒

Muse 上线才两周,Meta 就说正在把它往智能眼镜里搬,包括 Connect 大会上新发布的款式。用法很简单:喊一声 Muse,就能让它带着你做运动、记吃了什么,或者帮你看看眼前的东西值不值得买。眼镜还会加一个听力增强功能,Meta 说已经过了 FDA 认证,给轻度到中度听损的成年人用。不过正文没提什么时候上线,也没说哪些型号能用上 Muse。

推荐理由:把 Muse 搬上眼镜是 Meta 把 AI 助手从手机推向穿戴设备的关键一步,三个用例也够实在。但正文没给上线时间和支持型号,我会先打个折,分数刚好卡在 featured 门槛上。

9月23日星期三

AI HOT 精选

小米开源 MiMo-V2.6 Pro 和 Flash 两个全模态模型,Pro 在多数 Agent 基准上追平 Claude Opus 5 和 GPT-5....

小米把 MiMo-V2.6 Pro 和 Flash 两个全模态模型开源了。Pro 在 Artificial Analysis Intelligence Index 上拿了 46 分,是目前开源模型里最高的,在多数 Agent 基准测试里表现跟 Claude Opus 5 和 GPT-5.6 Sol 差不多。训练用的是规模化强化学习,但正文没披露参数量、...

推荐理由:小米把 MiMo-V2.6 Pro 和 Flash 开源了,Pro 在 Agent 基准上表现跟 Claude Opus 5、GPT-5.6 Sol 差不多,Intelligence Index 拿了 46 分,是目前开源最高。我会先打个折:正文没写参数量、训练数据和成本,没法判断实际落地性价比。但国产旗舰模型开源本身信号够强,对开发者和开源生态都有直接价值,按政策给满权重。

AI HOT 精选

Qwen-Image-2.1 在 Arena 图像编辑和文生图两个开源榜都拿了第一

通义千问的 Qwen-Image-2.1 在 Arena 的图像编辑和文生图榜单上都是开源模型第一。图像编辑得分 1367,总榜排第 16,只比第 15 名的 GPT-Image-1.5-high-fidelity 低 3 分。正文没提参数量、模型架构和具体开放时间,这点先别太激动。

推荐理由:Qwen-Image-2.1 在 Arena 图像编辑榜拿到开源第一、总榜第 16,只落后 GPT-Image-1.5 三分,这是实打实的跨模型对比信号。分数定在 78 而不是更高,是因为正文完全没提参数量、模型架构和发布时间——信息缺口不小,我会先打个折。

9月22日星期二

AI HOT 精选

Qwen-Image-2.1 开源,图像编辑榜排开源第一,总分只比 GPT-Image-1.5 高保真版低 3 分

通义千问把 Qwen-Image-2.1 的权重放出来了。在 Arena 的图像编辑榜上拿了 1367 分,开源模型里排第一,总榜第 16。这个分数离第 15 名的 GPT-Image-1.5-high-fidelity 只差 3 分,差距很小。文生图榜也拿了开源第一。正文没提参数量、具体架构和用的什么开源协议,这些关键信息得等后续披露。

推荐理由:Qwen-Image-2.1 权重放出来了,Arena 图像编辑榜开源第一、总榜第 16,离 GPT-Image-1.5 高保真版就差 3 分,文生图榜也是开源第一。分数没给更高是因为正文没提参数量、架构和开源协议,我们只能按榜单成绩打分——光看这个分差,确实值得关注。

Latent Space

小米 MiMo-V2.6-Pro 登顶开源模型榜,训练只花了 300 万美元

小米发了 MiMo-V2.6 系列,Pro 版在 Artificial Analysis 的智能指数上拿了 46 分,排开源模型第一。训练成本 300 万美元,按每次任务 0.13 美元算,性价比踩在了前沿线上。Flash 版主打效率,UltraSpeed 版输出速度拉到了 20 倍。技术报告讲了他们怎么在三个方向上堆强化学习的算力:一是用全异步架构把...

推荐理由:小米的 MiMo-V2.6-Pro 在 Artificial Analysis 开源模型榜上拿了第一,训练只花了 300 万美元,单次任务成本 0.13 美元,性价比踩在了前沿线上。Flash 版和 UltraSpeed 版分别补了效率和速度的位,技术报告还讲了全异步强化学习架构怎么堆算力。正文没提具体评测细节和实际业务场景验证,分数先按现有信息给。

AI HOT 精选

小米 MiMo-V2.6-Pro 在 Code Arena WebDev 排到第10名左右,开源模型里排第3

小米发了两个全模态模型 MiMo-V2.6-Pro 和 Flash。Pro 版在 Code Arena 的网页开发榜上拿了 1628 分,比上一代 MiMo-V2.5-Pro 的 1475 分涨了 153 分,整体排第10名上下,在 MIT 许可的开源权重模型里大概排第3。Flash 版的跑分和参数量正文都没提。

推荐理由:小米 MiMo-V2.6-Pro 在 Code Arena WebDev 榜上排第10名上下,开源权重模型里约第3,分数比上代涨了 153 分,有具体数字支撑。Flash 版参数量和跑分正文都没提,信息有缺口,所以重要性给到 78 比较合适,先别往更高拔。

9月21日星期一

AI HOT 精选

Qwen-Image-2.1 发布,一个 7B 模型同时搞定生图和改图

Qwen-Image-2.1 是个 7B 参数的原生图像模型,一个检查点就能做图像生成和编辑,不用来回切模型。它最多能塞 10 张参考图进去,还内置了一个专门帮你优化提示词的 LLM,省得自己反复调 prompt。模型已经接入了 diffusers 和 ComfyUI,Hugging Face 上也有免安装的网页 demo 可以直接试。不过正文没提训练...

推荐理由:通义千问扔了个 7B 的原生图像模型,一个检查点就能生成和编辑,还塞了个帮你优化提示词的 LLM,组合挺新鲜。分数没给到 85 以上,是因为正文没提训练数据、推理速度,也没给实际的画质对比,这些关键信息都缺着,所以我会先打个折。

9月20日星期日

AI HOT 精选

Qwen-Image-2.1 开源了,一个 7B 模型包揽生图和修图,还能直接跑在 ComfyUI 里

阿里 Qwen 放出了 Qwen-Image-2.1 的开源权重,原生支持 ComfyUI 节点。一个 7B 参数的模型同时干生图和编辑两件事,最高能出 2K 分辨率的图,单次指令最多可以参考 10 张图来改图,还支持带透明通道的 RGBA 输出。正文没提硬件要求和具体授权协议,想本地跑的话得自己试水。

推荐理由:阿里 Qwen 放出一个 7B 的统一生图/编辑模型,原生支持 ComfyUI,能出 2K 图、带透明通道,对本地生图社区是直接利好。分数没给更高,是因为正文没提硬件门槛和授权协议,实际跑起来的门槛还不清楚,这点先别太激动。

Hacker News 首页

阶跃星辰发布 Step 5 Preview,一个 600B 参数的 MoE 旗舰模型,主打编程和金融任务

阶跃星辰推出了 Step 5 Preview,一个总参数量 6000 亿、每次推理激活 270 亿参数的混合专家模型。它支持 100 万 token 的上下文窗口和图像输入,主要瞄准让模型进业务流程干活的场景。在 DeepSWE v1.1 编程测试里拿了 67.7 分,超过了 Kimi K3 和 GLM-5.3,但落后于 GPT-6 Astra 和 C...

推荐理由:Step 5 Preview 是阶跃星辰的 6000 亿参数混合专家模型,在 DeepSWE v1.1 编程测试上拿了 67.7 分,小胜 Kimi K3 和 GLM-5.3,但还落后 GPT-6 Astra 和 Claude Opus 5 约 6-7 分。给了 78 分,因为这是国内模型在 agent 编程方向一次有具体数字的推进,但还没到改写行业格局的程度。我会先打个折:正文没提推理延迟和实际部署成本,100 万 token 上下文在实际业务流程里表现如何也未知,所以分数没给更高。

9月18日星期五

AI HOT 精选

OpenRouter 实测 20 个生图模型:最便宜 0.006 美元一张,最贵 0.134 美元,价差 22 倍

OpenRouter 用同一句提示词跑了 20 个图像生成模型,直接看实际扣了多少钱。最便宜的是 GPT Image 2,一张 1024 方形图只要 0.006 美元;最贵的是 Gemini 3 Pro Image,要 0.134 美元。各家计费单位不一样,有的按 token、有的按像素、有的按张数,光看标价根本没法比,得实际跑一张看账单。测试里 6 ...

推荐理由:OpenRouter 用同一句提示词跑了 20 个图像模型,直接看实际扣了多少钱。最便宜的一张 1024 方形图只要 0.006 美元,最贵的要 0.134 美元,价差超过 20 倍。各家计费单位还不一样,有的按 token、有的按像素、有的按张数,光看标价根本没法比,得实际跑一张看账单。这种一手数据对选模型的人来说比任何 benchmark 都管用,我会先打个折——测试只跑了一组提示词,不同复杂度下排名可能会变,但至少给了个真实的比价起点。

9月15日星期二

Computing Life · Share · 鸭哥调研

三条 AI 新闻:会画界面的模型、给自己写说明书的 agent、脱离厂商云的企业编程

Runway 放出了 Solaris 的研究预览,这个系统不写前端代码,靠模型逐帧把界面画出来,用户的点击拖拽直接驱动下一帧画面。目前只有官方精剪的演示视频和一个候补名单,没有公测、定价和 API,第三方实测也还没出现。官方自报用户偏好度比传统代码界面高,但成本对比的参照系是更贵的视频扩散模型,不代表比普通网页渲染省钱。Google Research ...

推荐理由:三条打包,Solaris 是主钩子。Runway 逐帧画界面的思路确实新鲜,但目前只有官方精剪演示和候补名单,没公测、没定价、没 API,第三方实测也还没影,成本对比还绕开了普通网页渲染。所以我会先打个折,重要性给 78。Google 的 WikiSkill 让 agent 从失败里自己总结技能文档,机制具体,但正文没披露规模验证。GitHub 的 Copilot 企业版编码模式把数据留在本地,对合规敏感的公司是刚需,不过细节还不多。整体有话题性,但都缺实测,tier 放 featured 合适。

9月14日星期一

Hacker News 首页

30 个 SVG 画图题,看 2025-2026 年的大模型谁能画好“鹈鹕骑自行车”风格的图

Tom Gally 用 Claude Fable 5.1 搭了个站,把 Simon Willison 那个经典的“鹈鹕骑自行车”测试扩展成了 30 道 SVG 画图题,比如“章鱼弹管风琴”、“长颈鹿组装落地钟”。2026 年跑了 6 个模型,2025 年跑了 10 个。页面直接贴模型返回的原始 SVG,没做主观打分,你自己看图画得怎么样。每张图下面标了...

推荐理由:Simon Willison 那个经典的鹈鹕骑自行车测试,社区里玩了好几年了。Tom Gally 这次把它扩成 30 道题,还跑了 2025 和 2026 两批模型,信息量挺大。页面没做主观打分,就让你自己看图判断,这点反而实在——省得被一个分数带偏。缺点是你得一张张翻,没法一眼扫出排名,但当成一个原始素材库来用,价值很高。

9月12日星期六

Latent Space

DeepSeek V4.1-Flash:763B 参数,用编码器-解码器新架构把预填充和解码拆开跑,还自带视觉

DeepSeek 在 9 月 10 号发了 V4.1-Flash,虽然叫 4.1,Sebastian Raschka 直接说这该叫 V5。模型总参数 763B,用了混合专家(MoE)和因果编码器-解码器架构,把处理输入和生成输出拆成了两个阶段:预填充时激活 8B 参数,解码时激活 16B 参数,稀疏度只有 1% 到 2%。这么一拆,KV 缓存占用最多能...

推荐理由:DeepSeek 发了 V4.1-Flash,763B 的因果编码器-解码器 MoE,预填充 8B 激活、解码 16B 激活,稀疏度 1%-2%,还带了视觉。Sebastian Raschka 说这该叫 V5,说明架构改动不小。国内旗舰模型架构更新,加上外部技术圈同步讨论,HKR 三条都踩中。没给 90 以上是因为刚发,还没看到实际跑分和落地反馈,先打个折。

AI HOT 精选

DeepSeek 开源 V4.1-Flash:用不对称算力给编程 Agent 省 prefill 成本

DeepSeek 放出了 V4.1-Flash 的开放权重,一个 552B 参数的 MoE 模型,用了 Causal Encoder-Decoder 架构,专门为编程 Agent 调过。它把算力拆成两块:prefill 阶段激活 8B 参数,decode 阶段激活 16B,外加 KV 缓存效率也做了优化。跑分上,Terminal Bench 2.1 拿...

推荐理由:DeepSeek 开源了 V4.1-Flash,一个 552B 的 MoE,用 CED 架构把 prefill 和 decode 拆开,专门降编程 agent 的延迟。Terminal Bench 2.1 的分数是实打实的,Baseten 的分析也补了部署视角。没给到 85 分以上是因为这是第三方解读,不是官方技术报告,部分细节还得等一手资料验证。