跳到正文

#多模态

今日 1 条

9月10日星期四

AI HOT 精选

DeepSeek-V4.1-Flash 在硅基流动上线,552B 参数、1M 上下文,KV 缓存砍到 V4 Flash 的四分之一

硅基流动当天就接入了 DeepSeek-V4.1-Flash。这是个 552B 参数的混合专家模型,实际干活时预填充阶段激活约 80 亿参数,解码阶段约 160 亿参数,自带视觉能力,一次能处理 100 万 token 的上下文。最实在的一点是 KV 缓存占用只有 V4 Flash 的四分之一,部署成本会低不少。MIT 许可证,商用也方便。

推荐理由:硅基流动当天上线 DeepSeek-V4.1-Flash,KV 缓存降到 V4 Flash 的四分之一,这是个很直接的省钱信号。552B MoE、8B/16B 激活参数、1M 上下文、MIT 许可证这些关键信息都给了,但正文没放基准测试或实际跑分数据,所以分数没往上调,维持在 78。

AI HOT 精选

DeepSeek 发布 V4.1-Flash,把 AI 智能体的内存开销砍到前代的四分之一

DeepSeek 新模型 V4.1-Flash 主要解决长文本处理太烧钱的问题。它把 GPU 高速内存里的 KV 缓存(模型处理过的上下文暂存区)压到了前代 V4-Flash 的四分之一,卸载到硬盘或主机内存的部分更是缩到约八分之一。具体做法是把模型拆成编码器和解码器:读入信息时每 token 只激活 80 亿参数,生成文字时才用到 160 亿,输入端...

推荐理由:DeepSeek 发了 V4.1-Flash,专打 agent 场景的内存成本——KV 缓存压到前代的四分之一。给了具体架构数字,不是画饼。先放在 featured 而不是 p1,因为目前只有单一信源,还没形成交叉报道集群,而且正文没披露实际延迟和吞吐量,我会先打个折。

AI HOT 精选

DeepSeek 发布 V4.1-Flash:新架构让模型自带看图能力,不再外挂视觉模块

DeepSeek 推出了 V4.1-Flash,换了一套叫“因果编码器-解码器”的新架构,直接把视觉理解做进了模型里,不用再单独接一个看图组件。模型总规模 552B 参数,是个混合专家模型,处理你输入的内容时只激活 8B 参数,生成回答时激活 16B。官方说价格降了不少,但正文没给出具体降幅和跑分数据,我会先打个折,等第三方实测出来再看。

推荐理由:DeepSeek 发了 V4.1-Flash,换了一套因果编码器-解码器架构,把视觉理解原生集成进去,不用再外接看图模块。552B 总参数,推理时只激活 8B/16B,部署压力不大。官方说价格降了不少,但正文没给具体降幅和跑分,我会先打个折,等第三方实测出来再看。

AI HOT 精选

DeepSeek 出了个 V4.1-Flash,用新架构把视觉理解直接做进模型里,KV 缓存砍到原来的 1/4

V4.1-Flash 是 DeepSeek 新架构里最小的一个模型,总参数 552B,但干活时输入只激活 8B、输出激活 16B,属于 MoE 的省电模式。它换了一套叫 Causal Encoder-Decoder 的架构,视觉理解不再外挂,而是原生支持。最实在的变化是 KV 缓存:跟上一代比,HBM 占用降到 1/4,SSD 存储降到 1/8,意味着...

推荐理由:我会先打个折:正文没给具体 benchmark 和推理延迟数据,所以性能到底怎么样还得等实测。但架构切换这件事本身就够硬——Causal Encoder-Decoder 加原生视觉,KV 缓存直接砍到原来的零头,对实际部署的人比单纯跑分更有吸引力。加上 DeepSeek 的发布自带流量,选它上头条没毛病。

9月9日星期三

AI HOT 精选

OpenAI 发了两个新图模型:Flare 快一半,Sunburst 改图更稳,但 ChatGPT 用户没法手动选

OpenAI 把 ChatGPT 生图升级到 2.5 版,这次直接给了两个模型。Flare 主打快,延迟比上代低了 50%;Sunburst 主打编辑控制,改图时只动你让改的地方,其他部分尽量不动,但生成时间更长。API 定价输入每百万 token 8 美元,输出 30 美元,新增了“xhigh”和“max”画质档位,一张 1024x1024 的图在 ...

推荐理由:OpenAI 把生图拆成 Flare 和 Sunburst 两个模型,一个砍延迟,一个保编辑一致性,思路清楚。延迟降 50% 和 API 定价都给了具体数字,能直接评估成本。但 Plus 用户暂时用不了 Sunburst,实际编辑效果还没法大规模验证,所以分数先打个折,等更多实测出来再看。

AI HOT 精选

OpenRouter 发了个教程:一行代码换模型,用 Gemini 改图

OpenRouter 发了个教程,教开发者怎么用一行 API 调 Gemini 的图片编辑模型。默认模型叫 Nano Banana 2(就是 google/gemini-3.1-flash-image),你传一张原图和一段文字指令,接口直接返回改好的图。教程给了完整的 Python 和 TypeScript 代码示例:本地文件转 base64 或者传一...

Product Hunt · AI

ChatGPT 图片生成升级到 2.5:宣称画质更锐、出图更快、控制更强

OpenAI 在 Product Hunt 上发布了 ChatGPT Images 2.5,口号是“更清晰的画面、更快的生成、更好的创意控制”。但正文只有这几句宣传语,没有透露任何技术细节或评测数据——比如用了什么模型架构、分辨率提升多少、生成速度具体快了多少、控制能力怎么体现,全都没说。所以目前只能当个预告看,等有人实测了再判断是不是真升级。如果你常...

9月8日星期二

Ben's Bites

OpenAI 发布 GPT-6 系列首个模型 Astra:跑分高但表现不稳定,作者烧了 40 亿 token 说“啥也没造出来”

OpenAI 推出了 GPT-6 系列的第一个模型 Astra。它在 ARC-AGI-3 和 Zapier 的 AutomationBench 上拿了最高分,定价跟 Fable 5.1 一样。但作者周末烧了 40 亿 token(相当于处理了海量文本),觉得“啥也没造出来”,承认可能是自己不会用。Astra 是个“尖刺型”模型——某些任务很强,但不是稳...

OpenAI News

OpenAI 发布 ChatGPT Images 2.5,生图速度翻倍,还加了个手绘板功能

OpenAI 推出了新的图像模型 Images 2.5。最直接的变化是生图延迟比上一代低了最多 50%,出图更快。画质上,光照更自然、材质细节更丰富,多轮改图时也能更稳地保住画面主体不走样。目前每周通过 ChatGPT 和 API 生成的图片已经超过 30 亿张。这次还加了一个叫 Sketch 的新功能,允许你在 ChatGPT 里直接画草图当参考,让...

推荐理由:OpenAI 正式发了 Images 2.5,延迟最多降 50%,画质上光照和材质更自然,多轮改图时主体更稳,还加了 Sketch 草图输入。每周 30 亿张的量说明这已经是大众工具了。这次更新是实打实的体验升级,不是换皮,三个维度都踩中了。没给更高分是因为这算迭代优化,不是范式级变化。

9月6日星期日

量子位 · 公众号

网友把 GPT-6 当导演、Seedance 当摄影,攒出一条 AI 动画流水线

有人把 GPT-6 Astra 和字节的 Seedance 2.5 串了起来,让 Astra 在 Blender 里搭场景、做预演、定机位,再把参考帧丢给 Seedance 生成动漫风格的打斗镜头,最后 Astra 自己动手剪辑出片。同一套流程还拍了火影同人短片,以及把一部中国短剧翻成美国版。Fable 5.1 和 Gemini 3.8 Flash 也...

推荐理由:一个把 OpenAI 和字节最新模型串起来做自动拍片的动手实验,流程清晰、有成品,但缺少稳定性、成本和对比数据,更像个人 workflow 分享而非产品更新,刚好够 featured 门槛。

Hacker News 首页

GPT-6 Astra 操控机械臂:放积木又快又省,插拼图还是卡在最后一步

Robocurve 让 GPT-6 Astra 直接控制 YAM 机械臂做了两个任务,跟 Claude Fable 5.1 正面比了一场。放红色积木进碗里,Astra 20 次成了 19 次(95%),Fable 5.1 只成了 8 次(40%)。Astra 平均每次花 2.5 分钟、0.94 美元,时间和成本都不到 Fable 5.1(6.8 分钟、...

推荐理由:这是一次带名字、带数字、带价格的实物对比,不是公关稿。两个任务一个分出高下、一个双双翻车,反而让数据更可信。对正在评估模型能不能进物理世界干活的人来说,这篇可以直接存下来当 benchmark 参考。没给 p1 是因为这只是第三方单次测试,不是官方发布,而且只测了两个任务,样本量还撑不起通用结论。

9月5日星期六

r/LocalLLaMA

Ling-3.0-flash-VL:给文本模型加上眼睛,还能当视觉Agent用

AntLingAGI 在 Ling-3.0-flash 基础上加了视觉理解和视觉 Agent 能力,新模型叫 Ling-3.0-flash-VL。官方说它在视觉感知、STEM 推理、文档理解、多模态 Agent 任务、前端代码生成和医疗报告解读上都表现不错。但权重还没放出来,评论区在问 HuggingFace 链接和参数量,帖子都没提。如果你打算跑本地...

9月4日星期五

The Verge · AI

AI 生成的食物图为什么总像恐怖片里的东西

越来越多餐厅和品牌用 AI 做食物宣传图,结果出来的东西像噩梦:甜甜圈虾、蠕虫面条、脑花冰淇淋。扩散模型根本不懂食物结构,只是把像素乱拼一通。正文没提具体用了哪个模型或怎么修,但结论很清楚:AI 在食物上翻车翻得特别惨。

TechCrunch · AI

AI 生成的菜单图看着完美,但顾客觉得“不对劲”

餐厅用 AI 生成菜单插图,图片对称光滑、毫无瑕疵,但顾客直觉上觉得食物像“外星人做的披萨”。问题出在模型训练数据只选了“好看”的窄样本,导致食物缺乏真实感。Reality Defender 的 CTO 说 AI 根本没理解食物的核心原理。正文没提具体用了哪些模型或数据量,但现象本身值得注意——生成式 AI 在视觉上已经能骗过第一眼,但骗不过人的直觉。

9月3日星期四

OpenAI News

Playco 用 GPT-6 Astra 做游戏原型,手动修复减少 50%

Playco 用 GPT-6 Astra 做了一个叫 Playbot 的 AI 游戏开发 IDE,直接连 Unity 和 Godot 引擎,让模型自己编辑场景、跑测试、找 bug。他们先搭了一个灰色方块原型,然后让模型一次性生成三个不同主题的游戏世界,大部分第一次跑就能玩。相比上一代模型,手动修复量砍了一半。空间推理、UI 响应和手感都有提升。模型还能...

9月2日星期三

Hacker News 首页

World Labs 发布 Atlas:一个能原生理解 3D 空间的世界模型

Atlas 是一个从零预训练的多模态自回归扩散 Transformer,把文字、图片、视频和 3D 信息塞进同一个空间上下文里处理。它能拿一两张参考图拼出一个连贯的 3D 场景,并且支持像素级精准的镜头控制,最长能生成 1 分钟的 1440p 视频。在只有 2 到 3 张图的稀疏视角 3D 重建任务上,Atlas 直接超过了那些专门训练的重建模型;给的...

推荐理由:World Labs 放出了 Atlas,一个从零预训练的多模态世界模型,把文字、图片、视频和 3D 统一到一个空间上下文里。最硬核的指标是稀疏视角 3D 重建:只用 2 到 3 张图就干掉了专门训练的重建模型,这个结论可验证,不是空话。没给 95 分是因为目前只是一篇博客,正文没披露训练数据规模、算力消耗和实际延迟,我会先打个折。另外,它能生成最长 1 分钟的 1440p 视频,但视频质量和一致性没有第三方评测,这点先别太激动。整体来看,对做 3D 和具身智能的人是个强信号,但离落地还有信息缺口。

TechCrunch · AI

Google 推出 Pics,一款靠打字出图的 AI 设计工具,直接对标 Canva

Google 发布了一个叫 Pics 的 AI 设计工具,能根据文字描述直接生成海报、社交帖子和插图。它用的是自家的 Nano Banana 图片模型,会先推给 Workspace 企业用户和 Google AI Pro/Ultra 付费用户。跟 Canva 或 Adobe Express 最大的区别是,Pics 没有创作者模板市场,所有东西都是 AI...

推荐理由:Google 出了个叫 Pics 的 AI 设计工具,你打字描述,它直接出海报、社交图。底层是自家的 Nano Banana 模型,先给 Workspace 企业用户和 Google AI Pro/Ultra 付费用户用。跟 Canva 最大的区别是它没有创作者模板市场,所有东西靠 AI 生成。我会先打个折:文章没讲清楚能不能精细编辑、团队协作怎么样,更像功能预告而不是完整产品评测。如果是真的,对懒得翻模板的人挺省事,但设计团队先别急着切过去。

AI HOT 精选

Gemini 现在能看视频学操作,然后自己上手点按、打字、滚动页面

Google DeepMind 给 Gemini 加了一个新能力:给它看一段操作界面的录屏,它就能看懂步骤,然后自己去完成同样的点击、输入和滚动。不是只描述画面,而是真的执行多步任务,比如填网页表单或在手机 App 里下单。这个功能已经在 Gemini 应用和 Google AI Studio 开放测试。不过正文没提延迟和成功率——UI 自动化智能体在...

推荐理由:Google DeepMind 给 Gemini 加了个挺直接的能力:给它看操作录屏,它就能学会步骤,自己去完成填表、下单这类多步 UI 任务。已经在 Gemini 应用和 AI Studio 开放测试,这点让实验门槛很低。但正文没提延迟和成功率——对 UI 自动化智能体来说,这两个数直接决定能不能用,我会先打个折,等实测数据出来再说。

The Verge · AI

Google 推出 Pics:一个更 AI 的 Canva,直接塞进 Workspace

Google 今天上线了 Pics,一个面向 Workspace 用户的 AI 图片编辑和生成工具,直接对标 Canva。主打商业场景:产品图、背景替换、文字排版。正文没披露定价和具体上线日期,但方向很清楚——Google 想把生成能力塞进办公套件里。对做 AI 产品的人来说,值得关注的是它怎么嵌入现有工作流、怎么定价,以及能不能真的替代 Canva。

AI HOT 精选

Google Workspace 里直接生图改图,新工具叫 Google Pics

Google 在 Workspace 里塞了一个叫 Google Pics 的 AI 图像工具,写文档做幻灯片时不用切应用就能生成和编辑图片。正文没披露底层模型、定价和可用地区,只说了“好用”。对做文档和幻灯片的团队来说,少一次上下文切换就是实打实的效率提升。

8月31日星期一

AI 群聊日报

Astra 前端一次直出泄露,Coding 增长经济学,以及 Claude 安全降级误删 700GB 数据

OpenAI 正在灰度测试 Astra 模型,能零样本一次生成完整前端网页,测试者直呼“前端已解决”。Anthropic 在赶 Fable 5.1,两边已经开始用同一张 SVG 图隔空比细节稳定性。另一边,Claude Code 的安全机制把危险的文件清理任务降级给更弱的 Opus 4.8,结果它正确识别了主目录不能删,下一秒还是删掉了 700GB 数...

推荐理由:Astra 对 Fable 5.1 的隔空对决是本周最好看的叙事,四个技术方向让消息有料,“前端已解决”这种说法又足够刺激。但信源是群聊日报,转述的是微信文章和推文截图,没有一手技术报告,所以我会先打个折——方向值得盯,结论别急着全信。

8月30日星期日

Computing Life · Share · 鸭哥调研

多模态模型的价值,不在看懂图,在会自己去看

8月,Meta、Z.ai和DeepSeek三家实验室不约而同地展示了同一种多模态模型用法:模型先观察视频或截图,调用工具生成网页、幻灯片或小游戏,再回头审视自己做出来的东西。这跟2023年RAG从静态检索变成模型主动搜索的转折很像,但这次闭环方向反了——模型是先产出,再自己看一遍来验证。评测方式也跟着变了,Meta的WildArtifactBench不...

推荐理由:三家实验室独立演示了同一个多模态用法,把视觉从被动理解变成主动验证,类比2023年 agentic RAG 的范式转移很有说服力。扣分是因为这是评论性综述而非一手研究,但判断准确、信息密度高,对从业者有直接启发。

8月26日星期三

AI HOT 精选

通义千问开源 Qwen3.8-Flash,125B 总参数每次只激活 6B,训练成本降到前代的九分之一

阿里通义放出了 Qwen3.8-Flash 的完整权重,这是个多模态的 MoE 模型,总参数量 125B,但每次推理只激活其中 6B 参数,所以跑起来很轻。训练成本只有 Qwen3.7-Plus 的九分之一,性能还全面反超。生产版 API 定价是输入每百万 token 0.16 美元、输出 0.47 美元,原生支持 262K 上下文,可以拉到 1M。官...

推荐理由:阿里通义开源了 Qwen3.8-Flash,一个 125B 总参数但每次只激活 6B 的 MoE 多模态模型,训练成本只有前代 Qwen3.7-Plus 的九分之一,性能还全面反超,API 定价也给了具体数字。这种用极低激活参数换高性能、低成本的路线,对国内做模型选型和成本控制的技术团队很有参考价值,加上 Qwen4 架构预览,信息量够硬,HKR 全中。

TechCrunch · AI

那个匿名屠榜的 Ox Alpha 模型,背后是 Z.ai

周末大家还在猜 Ox Alpha 是谁做的,现在确认了:是 Z.ai 的 GLM 系列最新版。这个模型之前匿名挂在 OpenRouter 上,一上线就冲到排行榜第一。Z.ai 说会在周三放出模型权重,开发者可以直接拿来用。官方定位是给写代码、长时间跑任务(agentic work)和需要结合图文推理的场景准备的。我会先打个折,具体跑分和实测表现正文没给...

推荐理由:匿名模型登顶后揭晓身份,本身就有新闻性;Z.ai 还承诺周三开源权重,并明确把模型定位在代码、agent 和多模态推理上。分数没给更高是因为正文没给具体跑分和实测数据,实际能力还得等上手验证。

AI HOT 精选

通义千问放出 Qwen3.8-Flash,125B 参数每次只用 6B,训练费打骨折

Qwen3.8-Flash 是 Qwen4 架构的早期预览版,总参数 125B,但每次推理只激活 6B 参数,相当于用很小的算力跑一个大模型。原生上下文窗口 262K,能拉到 1M。训练成本只有 Qwen3.7-Plus 的九分之一,官方说写代码和办公任务表现反而更好。权重已经开放。正文没给具体跑分和开源协议细节,这点先别太激动。

推荐理由:通义千问放出 Qwen3.8-Flash,是 Qwen4 架构的早期预览版。125B 总参数只激活 6B,训练成本降到前代的九分之一,官方说写代码和办公任务表现更好,权重已开放。效率数字很具体,但正文没披露具体跑分和开源协议细节,这点先别太激动,实际效果得自己跑一下。

8月25日星期二

Hacker News 首页

Qwen 明天开源 Qwen3.8-Flash-Next:总参数 125B、激活 6B 的 MoE 多模态模型

Qwen 在 ModelScope 上预告了 Qwen3.8-Flash-Next,一个基于下一代 Qwen4 架构的多模态 MoE 模型,总参数 125B,每次推理只激活约 6B 参数。这次提前放出来是为了让社区先看看 Qwen4 的设计思路。明天(2026-08-26 15:00 UTC)正式开源,会同时放出 FP8 版本。正文没披露跑分、推理速度...

推荐理由:Qwen 提前放出了 Qwen4 架构的预告,125B 总参、6B 激活的 MoE 设计是实打实的新信息,在国内开源圈关注度很高。扣分是因为明天才正式开源,现在没跑分、没推理速度数据,我会先打个折——等明天 FP8 版本放出来再看实际表现。

Hugging Face 博客

Gradio 出了个 gr.Workflow:把 AI 流水线变成能拖拽的画布,每一步结果都看得见

Gradio 新推出的 gr.Workflow 让你用节点图的方式搭 AI 流水线,每个中间步骤的结果都会直接显示在画布上,不用再靠打印日志来排查哪一步出了错。它同时也是一个 REST API,每个节点自带接口,一行命令就能部署到 Hugging Face Spaces。文章展示了四个可跑的 Demo:用 Qwen-Image-Edit 做图片编辑、把...

OpenAI News

OpenAI 封禁了一批俄罗斯账号,它们伪装成以色列智库搞舆论渗透

OpenAI 封掉了一批来自俄罗斯的 ChatGPT 账号。这些账号在幕后操纵一个叫“国际伯克研究所(IBI)”的假智库,网站自称设在以色列,实际上文章是从正经学术作品里抄来、篡改署名,再用机器翻译成英文的。操作者用俄语给模型下指令,让它生成英文的社交媒体帖子和评论,还特意要求模型藏好俄语痕迹。他们搞了一个“主权指数”,排名上捧俄罗斯、踩西方国家。Op...

推荐理由:OpenAI 自己端掉了一个俄罗斯的隐蔽影响力行动,核心是把 ChatGPT 当成了虚假信息流水线的一环。操作者建了个假智库网站,用俄语指挥模型生成英文帖子和评论,还特意要求抹掉俄语痕迹,手法比一般的灌水账号要精细。我会先打个折,因为这就是一次常规的安全拔线,不是模型本身出了新能力或新漏洞,但对做安全攻防和地缘信息战分析的人来说,这份第一手拆解比很多第三方报告都实在。

8月22日星期六

Hacker News 首页

好莱坞创作者正在拿自己的手艺训练 AI,时薪 25 到 150 美元

《卫报》采访了一批给 AI 公司打工的好莱坞概念设计师、配音演员和编剧。他们按小时收费,帮 Runway、Sora 这类公司训练模型,让 AI 学会模仿自己的创作风格。受访者很清楚这是在“给自己的职业挖坟”,但面对高时薪和行业不景气,还是接了活。文章没披露合同总规模和具体训练数据量,更像一份行业情绪记录,而不是量化岗位流失的预测。

推荐理由:一篇冲突感很强的行业情绪记录,讲好莱坞概念设计师、配音演员、编剧给 Runway、Sora 打工训练模型,亲手教 AI 学自己的风格。标题和受访者原话张力十足,但正文没给出合同总规模、训练数据量这些硬数字,更像特写而非硬新闻。H 和 R 都打中了,K 缺位,落在 featured 合理。

8月21日星期五

8月18日星期二

Hacker News 首页

Muse Glimmer:把智能体塞进你设备的,其实是一套伪装成 30B 模型的内存层级

Meta 的 Muse Glimmer 是个约 300 亿参数的多模态模型,专门为在手机或电脑上离线跑智能体任务设计。它的原始 BF16 模型有 55 GiB,根本塞不进消费级显卡,所以 Meta 直接给了 4-bit 量化版,把语言模型压到了 20 GB 以下。架构上最特别的是它的注意力机制:总共 52 层里,只有每第四层会看全部上下文,其余 39 ...

推荐理由:一篇扎实的架构拆解,把量化代价、注意力分层、QK 归一化这些关键点都讲清楚了。但它是第三方分析而非官方发布,纯技术视角对非端侧方向的从业者不太友好,所以放在 featured 刚好。

8月17日星期一

AI HOT 精选

Qwen 3.8 27B 模型实测:能力很强,但默认推理强度会让它疯狂过度思考

Simon Willison 上手了阿里 Qwen 团队新发的 27B 模型,发现它默认的“超高”推理强度是个坑。一个简单的画圆指令,模型会花几分钟生成一段精美的动画 SVG,完全偏离原意;画一张“鹈鹕骑自行车”的 SVG,默认设置下烧掉 22,276 个推理 token,耗时 21 分钟才出图。关掉推理后,同样的任务只需两分多钟。他建议上手就调低或关...

推荐理由:Simon Willison 上手 Qwen 3.8 27B 发现默认推理强度是个坑,用画圆和鹈鹕骑自行车两个例子把 token 消耗和时间成本摆得很清楚。数字硬、对比直接,对本地部署用户是实打实的避坑指南。没给更高是因为核心发现是一个配置问题而非模型能力缺陷,但 78 分放在 featured 里完全撑得住。

8月16日星期日

TechCrunch · AI

一名女性指控继父用 Grok 把她 11 岁的童年照变成了 7000 多张露骨图片

一位化名 Jane Doe 4 的女性加入了田纳西州三名青少年对 xAI 的集体诉讼。她指控继父用 Grok 把她 11 岁时的照片生成了超过 7000 张露骨图片,执法部门突袭搜查发现这些图片两天后,继父自杀身亡。她认为这类工具不加限制地扩散,正在把日常生活变成儿童性虐待素材。此前三名青少年起诉 xAI,称 Grok 连防止生成真人(包括未成年人)露...

推荐理由:这不是产品更新或论文,而是一起集体诉讼的新增原告陈述。案件用一起具体的家庭悲剧,把 Grok 的内容审核边界问题钉在了法庭文件里。7000 多张图片、11 岁的源照片、继父自杀——每个细节都在追问 xAI 到底把真人保护的红线画在了哪里。正文没披露 Grok 具体用了什么安全过滤机制,也没说 xAI 的回应,但案件本身已经足够让从业者重新审视'生成真人露骨内容'这个功能缺口。

8月15日星期六

AI HOT 精选

MOSS-VL:把实时互动当核心能力来做的开源视觉模型,边看边说

复旦团队开源了一个叫 MOSS-VL 的视觉语言模型家族,最大的不同是它把“实时互动”——也就是模型一边接收画面一边说话——当作一等能力来设计。它用了一种叫门控交叉注意力的机制,把视觉信息放在解码序列外面处理,所以生成第一个字的延迟比同底座的 Qwen3-VL-8B 低了 2.8 到 5.1 倍,画面信息越多优势越明显。实时版 MOSS-VL-Real...

推荐理由:复旦开源了一个把实时交互当一等能力的视觉语言模型家族,不是事后加流式输出,而是从架构上就为低延迟设计。门控交叉注意力让视觉信息不进解码序列,首字延迟比 Qwen3-VL-8B 低 2.8 到 5.1 倍,帧数越多优势越大,这点对机器人、直播这类场景挺实在。我会先打个折:开源 VLM 现在不缺选手,MOSS-VL 的领先主要在工程实现上,报告里没看到它在通用多模态榜单上把同尺寸模型甩开,所以影响力偏垂直。H 和 K 都站得住,R 弱一些,整体给 featured 没问题。

Computing Life · Share · 鸭哥调研

给 DeepSeek V4 接一个 3B 的视觉前端,今天就能跑

DeepSeek V4 的 API 不收图片,但 Liquid AI 新出的 LFM2.5-VL-3B 可以当它的眼睛。作者在自家车库摄像头上零样本测了一把,判断门开没开准确率 94.3%,本地跑完只要 1.5 秒。图片不出设备,只有“门开了”这类文字结果上云做推理。这套感知和推理分开的架构,在延迟、隐私和成本上的优势,就算 DeepSeek 以后自己...

推荐理由:作者用 Liquid 的 LFM2.5-VL-3B 给 DeepSeek V4 搭了一个感知前端,在真实车库摄像头上测出 94.3% 准确率和 1.5 秒延迟,数据具体、架构清晰。文章还顺带梳理了 DeepSeek 在视觉上的研究脉络(VL2、被撤回的 Thinking with Vision 等),把“为什么现在需要外挂眼睛”这件事讲透了。我会先打个折:测试场景只有一个车库门,泛化到什么程度正文没展开,这点先别太激动。但整体上,这套感知和推理分离的做法在成本、隐私和延迟上的优势是实打实的,对正在找 DeepSeek 视觉替代方案的开发者来说,是一...

8月14日星期五

AI HOT 精选

通义千问开源 Qwen3.8 系列:27B 稠密模型参数更少但跑分反超,2.4T 混合专家模型权重也放出来了

Qwen3.8-27B 是一个原生就能看图、读文档的多模态稠密模型,参数量只有 27B,但基准测试全面超过了上一代 Qwen3.7-Plus。它原生支持 262K 上下文窗口,用 YaRN 技术可以拉到 1M tokens,等于一次能塞进三体三部曲的量。许可证是 Apache 2.0,商用友好。同时放出的还有 Max 版本 Qwen3.8-2.4T-A...

推荐理由:阿里通义千问放出 Qwen3.8 系列:一个 27B 的稠密多模态模型,基准测试压过了上一代 Qwen3.7-Plus,原生 262K 上下文,Apache 2.0 许可证,还附带一个 2.4T 参数的 MoE Max 版本。这是国内开源大模型当天的重要发布,必须收录。分数没给到 90 以上,是因为正文没披露具体评测细节和实际推理成本,我会先打个折,等看到实测数据再调整。

8月13日星期四

AI 群聊日报

闭源模型的推理过程被批量扒光,Coze CLI 偷偷劫持本地 AI 工具

今天最值得看的是闭源模型的加密思维链被大规模提取。研究人员发现,把 Claude Opus 4.8 的加密推理块直接扔给同厂的 Haiku 4.5,后者就能逐字解码。这个方法在 Claude、GPT、Gemini 三家的 API 上都跑通了,用 Haiku 解码一万条轨迹的成本大概是 720 美元。另一篇论文更狠,说就算不接触加密块,光看模型公开输出的...

推荐理由:这条信息来自群聊日报,属于二手摘要,但信号很强:三篇论文指向同一个问题,且给出了可复现的方法和成本。我会先打个折,因为原文没披露具体实验细节和样本量,但核心判断——加密思维链可被跨模型解码——有足够的事实支撑。对从业者来说,这比一般的模型能力更新更值得警惕。

8月12日星期三

Google DeepMind

Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。

推荐理由:原文给出 SL2T 的训练规模、基准成绩与隐私设计,可据此判断手语翻译进入消费级产品的可行边界。

AI HOT 精选

Google Gemini 独立 App 月活用户突破 10 亿,追上 ChatGPT 6 月的水平

Google CEO Sundar Pichai 在 X 上宣布,Gemini 独立 App 的月活用户数超过了 10 亿,这是 Google 第 14 个达到这个量级的产品。这个数字只算独立 App,没把搜索里的 AI 模式等其他入口算进去。ChatGPT 在今年 6 月刚跨过 10 亿月活,Gemini 现在跟得很紧。使用数据方面:63% 的用户用...

推荐理由:Gemini 独立 App 月活破 10 亿,跟 ChatGPT 几乎前后脚,是消费级 AI 的一个重要节点。分数定在 78 而不是更高,因为这是增长指标,不是能力突破,而且 63% 视觉使用率没交代具体怎么算的,我会先打个折。