跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

514 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 41–60 条 · 共 514 条

8月17日星期一

AI HOT 精选

Qwen 3.8 27B 模型实测:能力很强,但默认推理强度会让它疯狂过度思考

Simon Willison 上手了阿里 Qwen 团队新发的 27B 模型,发现它默认的“超高”推理强度是个坑。一个简单的画圆指令,模型会花几分钟生成一段精美的动画 SVG,完全偏离原意;画一张“鹈鹕骑自行车”的 SVG,默认设置下烧掉 22,276 个推理 token,耗时 21 分钟才出图。关掉推理后,同样的任务只需两分多钟。他建议上手就调低或关...

推荐理由:Simon Willison 上手 Qwen 3.8 27B 发现默认推理强度是个坑,用画圆和鹈鹕骑自行车两个例子把 token 消耗和时间成本摆得很清楚。数字硬、对比直接,对本地部署用户是实打实的避坑指南。没给更高是因为核心发现是一个配置问题而非模型能力缺陷,但 78 分放在 featured 里完全撑得住。

8月16日星期日

TechCrunch · AI

一名女性指控继父用 Grok 把她 11 岁的童年照变成了 7000 多张露骨图片

一位化名 Jane Doe 4 的女性加入了田纳西州三名青少年对 xAI 的集体诉讼。她指控继父用 Grok 把她 11 岁时的照片生成了超过 7000 张露骨图片,执法部门突袭搜查发现这些图片两天后,继父自杀身亡。她认为这类工具不加限制地扩散,正在把日常生活变成儿童性虐待素材。此前三名青少年起诉 xAI,称 Grok 连防止生成真人(包括未成年人)露...

推荐理由:这不是产品更新或论文,而是一起集体诉讼的新增原告陈述。案件用一起具体的家庭悲剧,把 Grok 的内容审核边界问题钉在了法庭文件里。7000 多张图片、11 岁的源照片、继父自杀——每个细节都在追问 xAI 到底把真人保护的红线画在了哪里。正文没披露 Grok 具体用了什么安全过滤机制,也没说 xAI 的回应,但案件本身已经足够让从业者重新审视'生成真人露骨内容'这个功能缺口。

8月15日星期六

AI HOT 精选

MOSS-VL:把实时互动当核心能力来做的开源视觉模型,边看边说

复旦团队开源了一个叫 MOSS-VL 的视觉语言模型家族,最大的不同是它把“实时互动”——也就是模型一边接收画面一边说话——当作一等能力来设计。它用了一种叫门控交叉注意力的机制,把视觉信息放在解码序列外面处理,所以生成第一个字的延迟比同底座的 Qwen3-VL-8B 低了 2.8 到 5.1 倍,画面信息越多优势越明显。实时版 MOSS-VL-Real...

推荐理由:复旦开源了一个把实时交互当一等能力的视觉语言模型家族,不是事后加流式输出,而是从架构上就为低延迟设计。门控交叉注意力让视觉信息不进解码序列,首字延迟比 Qwen3-VL-8B 低 2.8 到 5.1 倍,帧数越多优势越大,这点对机器人、直播这类场景挺实在。我会先打个折:开源 VLM 现在不缺选手,MOSS-VL 的领先主要在工程实现上,报告里没看到它在通用多模态榜单上把同尺寸模型甩开,所以影响力偏垂直。H 和 K 都站得住,R 弱一些,整体给 featured 没问题。

Computing Life · Share · 鸭哥调研

给 DeepSeek V4 接一个 3B 的视觉前端,今天就能跑

DeepSeek V4 的 API 不收图片,但 Liquid AI 新出的 LFM2.5-VL-3B 可以当它的眼睛。作者在自家车库摄像头上零样本测了一把,判断门开没开准确率 94.3%,本地跑完只要 1.5 秒。图片不出设备,只有“门开了”这类文字结果上云做推理。这套感知和推理分开的架构,在延迟、隐私和成本上的优势,就算 DeepSeek 以后自己...

推荐理由:作者用 Liquid 的 LFM2.5-VL-3B 给 DeepSeek V4 搭了一个感知前端,在真实车库摄像头上测出 94.3% 准确率和 1.5 秒延迟,数据具体、架构清晰。文章还顺带梳理了 DeepSeek 在视觉上的研究脉络(VL2、被撤回的 Thinking with Vision 等),把“为什么现在需要外挂眼睛”这件事讲透了。我会先打个折:测试场景只有一个车库门,泛化到什么程度正文没展开,这点先别太激动。但整体上,这套感知和推理分离的做法在成本、隐私和延迟上的优势是实打实的,对正在找 DeepSeek 视觉替代方案的开发者来说,是一...

8月14日星期五

AI HOT 精选

通义千问开源 Qwen3.8 系列:27B 稠密模型参数更少但跑分反超,2.4T 混合专家模型权重也放出来了

Qwen3.8-27B 是一个原生就能看图、读文档的多模态稠密模型,参数量只有 27B,但基准测试全面超过了上一代 Qwen3.7-Plus。它原生支持 262K 上下文窗口,用 YaRN 技术可以拉到 1M tokens,等于一次能塞进三体三部曲的量。许可证是 Apache 2.0,商用友好。同时放出的还有 Max 版本 Qwen3.8-2.4T-A...

推荐理由:阿里通义千问放出 Qwen3.8 系列:一个 27B 的稠密多模态模型,基准测试压过了上一代 Qwen3.7-Plus,原生 262K 上下文,Apache 2.0 许可证,还附带一个 2.4T 参数的 MoE Max 版本。这是国内开源大模型当天的重要发布,必须收录。分数没给到 90 以上,是因为正文没披露具体评测细节和实际推理成本,我会先打个折,等看到实测数据再调整。

8月13日星期四

AI 群聊日报

闭源模型的推理过程被批量扒光,Coze CLI 偷偷劫持本地 AI 工具

今天最值得看的是闭源模型的加密思维链被大规模提取。研究人员发现,把 Claude Opus 4.8 的加密推理块直接扔给同厂的 Haiku 4.5,后者就能逐字解码。这个方法在 Claude、GPT、Gemini 三家的 API 上都跑通了,用 Haiku 解码一万条轨迹的成本大概是 720 美元。另一篇论文更狠,说就算不接触加密块,光看模型公开输出的...

推荐理由:这条信息来自群聊日报,属于二手摘要,但信号很强:三篇论文指向同一个问题,且给出了可复现的方法和成本。我会先打个折,因为原文没披露具体实验细节和样本量,但核心判断——加密思维链可被跨模型解码——有足够的事实支撑。对从业者来说,这比一般的模型能力更新更值得警惕。

8月12日星期三

Google DeepMind

Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。

推荐理由:原文给出 SL2T 的训练规模、基准成绩与隐私设计,可据此判断手语翻译进入消费级产品的可行边界。

AI HOT 精选

Google Gemini 独立 App 月活用户突破 10 亿,追上 ChatGPT 6 月的水平

Google CEO Sundar Pichai 在 X 上宣布,Gemini 独立 App 的月活用户数超过了 10 亿,这是 Google 第 14 个达到这个量级的产品。这个数字只算独立 App,没把搜索里的 AI 模式等其他入口算进去。ChatGPT 在今年 6 月刚跨过 10 亿月活,Gemini 现在跟得很紧。使用数据方面:63% 的用户用...

推荐理由:Gemini 独立 App 月活破 10 亿,跟 ChatGPT 几乎前后脚,是消费级 AI 的一个重要节点。分数定在 78 而不是更高,因为这是增长指标,不是能力突破,而且 63% 视觉使用率没交代具体怎么算的,我会先打个折。

8月11日星期二

纽约时报中文网

Meta 把付费模型 Muse Spark 免费开放了,新模型叫 Muse Glimmer

Meta 发布了一个叫 Muse Glimmer 的开放权重模型,它和上个月推出的付费闭源模型 Muse Spark 几乎一样,能生成代码、文字和图片。开放权重意味着你可以下载模型文件自己跑,但底层代码没全公开,不算彻底的开源。扎克伯格同时发了篇 14 页的文章,核心观点是超级智能不该被几家大公司攥在手里,并宣布拿 10 亿美元投给数据中心所在的社区。...

推荐理由:Meta 把付费闭源模型 Muse Spark 的能力几乎原样搬到了一个叫 Muse Glimmer 的开放权重版本里,你可以下载模型文件自己部署,但底层训练代码没给,不算彻底开源。扎克伯格同步发了篇长文,核心就一句话:超级智能不该锁在几家公司手里,并宣布拿 10 亿美元投给数据中心所在的社区。我会先打个折——开放权重不等于开源,别看到“开放”就以为什么都能改;但如果是真的和付费版性能接近,那对想自己跑模型又不想被 API 绑住的团队来说挺省钱。正文没披露 Glimmer 和 Spark 的具体评测对比数字,这点先别太激动,等跑分出来再看。

8月10日星期一

AI HOT 精选

SGLang 第一时间适配 Meta 的本地智能体模型 Muse Glimmer,单卡 RTX 5090 跑到每秒 1452 个 token

Meta 发布了 Muse Glimmer,一个 300 亿参数的多模态模型,专门为在本地硬件上跑智能体工作流设计。SGLang 推理框架在发布当天就提供了支持,并做了针对性优化。在单张 RTX 5090 显卡上,用 NVFP4 量化格式搭配 DFlash 投机解码技术,每个用户的解码速度能达到每秒 236 个 token,总吞吐量冲到每秒 1452 ...

推荐理由:Meta 发新模型本身是行业事件,但这篇文章的重点是 SGLang 的推理优化,不是模型本身。好在性能数字够硬,236 tok/s 和 1452 tok/s 这两个数让它的信息密度够上 featured。不过受众窄,只对搞本地推理的人有吸引力,所以 r 给了 false。

Hacker News 首页

Meta 开源 Muse Glimmer:一个能在本地单 GPU 上跑的 30B agent 模型

Meta 把 Muse Glimmer 的权重以 Apache 2.0 协议放出来了。这是一个 30B 参数的模型,专门为常驻本地的 agent 工作流设计,小到能在 Mac 或 PC 的单张消费级显卡上跑。用 4-bit 量化能把模型压到 20 GB 以下,在 24 GB 或 32 GB 显存里还能留出空间给 KV cache 和视觉编码器。训练上,...

推荐理由:Meta 把 Muse Glimmer 的权重以 Apache 2.0 协议放出来了,一个 30B 参数、专为本地 agent 工作流设计的模型。4-bit 量化后不到 20 GB,能在单张消费级显卡上跑,还留出显存给 KV cache 和视觉编码器。定位很明确——不是通用聊天模型,而是常驻本地的 agent 引擎。我会先打个折:目前只有发布博客的信息,没有第三方跑分和实际部署反馈,所以分数没往上拉。但开源协议、显存占用和本地 agent 这个组合,对自部署和隐私敏感场景确实有吸引力。

8月6日星期四

AI HOT 精选

阿里云发布 Qwen-Image-3.0,高分辨率生图起步价 0.03 美元

Qwen-Image-3.0 主打生产环境可用,能吞下 4500 个 token 的提示词,相当于一篇小作文。官方说文字准确率超过 100%,logo 不会出现乱码或破损,原生支持 12 种语言。高分辨率生图起步价 0.03 美元,按量付费。不过正文只给了标题和链接,没提模型架构、推理速度和具体跑分,这个准确率数字先别太当真,等第三方实测再说。

推荐理由:Qwen 第一个专门的图像生成模型,0.03 美元起步、4500 token 提示词上限、12 种语言支持,这几个点确实有区分度。分数没给更高是因为信息源只有一条推文,正文没披露模型架构、推理速度和第三方跑分,那个“>100% 文字准确率”的说法先打个折,等实测再看。

Product Hunt · AI

Mistral 发布 Shieldstral:一个 3B 开源多模态护栏,能在推理时用自然语言定义安全策略

Mistral 这周在 Product Hunt 上架了 Shieldstral,一个 30 亿参数的开源多模态安全护栏。你可以直接用大白话写安全规则,它就能同时检查文字、图片或混合内容,最后只吐一个 token 告诉你过还是不过。一张 16GB 显存的消费级显卡就能在本地跑起来。Product Hunt 页面给了基础介绍和截图,但没提具体延迟、准确率...

推荐理由:Mistral 扔了个 30 亿参数的多模态安全护栏出来,能本地跑,规则用人话写就行,对应用开发者很实用。但 Product Hunt 页面没给延迟和准确率数据,能不能直接上生产还得打个问号,所以分数没给更高。

AI HOT 精选

Simon Willison 用 Claude Fable 5 一次性生成了完整的《Raccoon Heist》3D 游戏

Simon Willison 把 2022 年的一条老推文和两张概念图丢给 Claude Fable 5,没再给任何指令,模型自己选型 Three.js、调用 OpenAI 的 gpt-image-2 生成贴图,做出了一个能在浏览器里玩的 3D 浣熊盗窃游戏。整个过程在手机上完成,通过 GitHub Pages 部署。游戏本身玩法还比较基础,但零人工干...

推荐理由:Simon Willison 的第一手实验本身就是质量信号。一条老推文加两张概念图,Claude Fable 5 自主搞定技术栈、贴图生成和部署,信息密度很高。没给更高分是因为游戏玩法还比较基础,正文也没披露生成过程的失败次数或修正轮数,实际稳定性存疑。

8月5日星期三

Hacker News 首页

Qwen 发布 Image 3.0 Pro:一次生成带小字、多图排版的复杂版面,生图价格每千张 4 美元

这个模型能一口气处理 4500 个 token 的输入,直接生成报纸、菜单、故事板这类信息密度很高的图,而且图里还能再套图。它能把文字稳定渲染到 10 像素那么小,支持 12 种语言和 20 多种字体,对皮肤毛孔、发丝、微表情的还原也接近照片质感。输出价格是 1K 图 0.04 美元,2K 图 0.075 美元,但每分钟只能请求 1 次,所以想跑大批量...

推荐理由:Qwen 这次给的规格很具体——4500 token 输入、图里套图、10 像素文字稳定渲染,不是画饼。0.04 美元一张 1K 图的价格有竞争力,但每分钟 1 次的请求限制直接把批量场景堵死了,所以分数上我会先打个折。对做海报、菜单、故事板的人来说,小字和多语言支持是刚需,值得上手测,但别指望拿来跑流水线。

Hacker News 首页

Mistral 发布 Shieldstral:一个 3B 参数、开放权重的多模态内容审核模型

Mistral 推出了 Shieldstral,一个 30 亿参数、开放权重的模型,专门用来检查文字和图片内容是否违规。它可以在本地或边缘设备上跑,负责审核用户输入和模型输出。官方博文没给跑分、延迟数据,也没提价格,只把它定位成一个安全过滤器。我会等第三方评测,但 3B 这个尺寸对于自己部署审核来说确实够轻量。

推荐理由:Mistral 发了个 Shieldstral,30 亿参数、开放权重,专门做图文内容审核,能在本地或边缘设备上跑。尺寸够轻量,对想自己搭安全过滤的团队是个新选项。但官方博文没给任何基准测试、延迟数据或价格,现在没法判断它实际好不好用——这点先别太激动,等第三方跑完分再说。

8月4日星期二

AI HOT 精选

商汤开源 SenseNova U1,一个模型同时搞定推理和出图

商汤放出了一个叫 SenseNova U1 的开源模型,把逻辑推理和图像生成塞进了同一条流水线。它能直接把一句提示词变成带图的结构化幻灯片,也能一步步边想边画,比如演示怎么分六步画出一条龙。模型代码和权重已经挂在 HuggingFace、GitHub 和 SenseNova Studio 上。正文没提参数量、训练数据和跑分,实际效果和资源消耗得自己试了...

推荐理由:商汤开源了 SenseNova U1,把推理和图像生成统一到一个模型里,给了几个具体 demo,不是只发个标题。但正文没提参数量、训练数据和跑分,实际能力上限没法判断,所以分数没给到 85 以上。不过权重和代码都放出来了,对开源社区是个实在的贡献,值得关注。

AI 群聊日报

Qwen 3.8 Max 跑分追平 Fable 5,权重下周开源;群里 agent 自己会下本地模型了

Qwen 3.8 Max 正式发布,2.4 万亿参数,Terminal Bench 2.1 得分 86.6,PaperBench 93.0 超过 Fable 5 的 88.8。群里有人充了 500 块的 token 额度一天就用完了,实际体感大概在 Luna 和 Terra 之间,主要优势还是便宜。下周 Qwen 3.8 Max 和 27B 模型都会开...

推荐理由:Qwen 3.8 Max 正式发布,2.4 万亿参数,PaperBench 93.0 超过 Fable 5 的 88.8,Terminal Bench 86.6,下周权重开源。群聊日报给了具体跑分和真实体感——有人充 500 块一天用完,实际能力大概在 Luna 和 Terra 之间,主要卖点是便宜。信息量足,但来源是群聊,权威性要打个折,所以没给更高分。

Latent Space

阿里通义千问发布 Qwen3.8-Max 和 27B,下周开源模型权重

阿里甩出了 Qwen3.8-Max,一个 2.4 万亿参数的超大模型,主打编程和长时间自主干活。官方说它能连续 10 多天自己写代码不崩,还能在 125 小时内独立跑完一套 AI 研究流程,最后效果比原论文的基准还高了 2.71 分。在模拟一整年经营的电商测试里,它赚了 4.16 倍的回报。API 价格是输入每百万 token 2 美元,输出 6 美元...

推荐理由:阿里这次放出的 Qwen3.8-Max 主打长时间自主干活,给的数字挺具体——125 小时独立跑研究、10 多天连续写代码、电商模拟回报 4.16 倍。我会先打个折,因为目前只有官方博客和 Latent Space 的二手报道,没有独立复现或第三方验证,所以分数没给到 95。但 2.4T 参数这个体量加上 agent 方向的明确指标,放在本周确实值得放在头条。

AI HOT 精选

欧盟 AI 透明度规则今天生效,不标 AI 内容最高罚 1500 万欧元

从今天起,在欧盟运营的科技公司必须给 AI 生成的文字、音频、视频和深度伪造内容打上标签,并告诉用户他们正在跟机器对话。违规罚款最高 1500 万欧元,或者全球年营业额的 3%。欧盟还发布了一套官方标签图标,公司可以直接用,不用自己设计。

推荐理由:这是欧盟 AI 法案透明度规则正式生效的日子,罚款上限明确,属于现有法规的执行节点而非新规出台。对在欧洲运营的 AI 公司和内容平台是直接的合规事件,HKR 三项都踩中,但因为是执行层面而非政策新增,所以重要性给到 78,放在 featured 里。