跳到正文

#多模态

今日 1 条

6月10日星期三

AI HOT 精选

Anthropic 发布 Claude Fable 5,在高风险领域会自动降级到旧模型

Claude Fable 5 是 Anthropic 目前最强的模型,在编程、知识问答、科研和视觉测试里几乎全面领先,任务越复杂优势越大。但它在网络安全、生物化学和模型蒸馏这些敏感领域做了限制:一旦触及,会自动切回能力更保守的 Opus 4.8,平均每 20 次对话触发一次。另外,Anthropic 把完全版 Mythos 5 开放给了少数可信的网络安...

推荐理由:Anthropic 发新模型,重要性本来就在 85–94 这个区间。HKR 三项全过:安全降级这个钩子够特别,降级对象和触发频率都写清楚了,而且 Claude 用户群对“能力强但可能被安全机制打断”这事很敏感。唯一扣分点是来源只有 X,信息不够硬,所以没给到最高档。

AI HOT 精选

Claude Fable 5 和 Mythos 5 发布:编程最强、能打游戏,但安全限制会误拦 5% 的对话

Anthropic 发了两个新模型:Claude Fable 5 和 Claude Mythos 5。Fable 5 是面向普通用户的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只通过美国政府合作项目开放。Fable 5 在软件工程、知识工作和视觉任务上都是新标杆——Stripe 测试时,它一天干完了原本一个团队两个月的代码迁移活;在...

推荐理由:Anthropic 一次发了两个模型,Fable 5 是普通用户能用的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只走美国政府合作渠道。Fable 5 在软件工程、知识工作和视觉任务上都刷了新纪录——Stripe 拿它做代码迁移,一天干完原本一个团队两个月的活。药物设计速度也快了 10 倍,这个数字挺夸张,但正文没披露具体测试条件和对比基线,先打个折看。定价方面,Fable 5 每百万 token 输入 10 美元、输出 50 美元,比前代贵了不少,得算算性价比。整体看,这是一次 Claude 主线模型的实质性更新,有定价、有基准...

The Verge · AI

Anthropic 放出首个 Mythos 级模型 Claude Fable 5,之前因网络安全能力太强被扣着没发

Anthropic 发布了 Claude Fable 5,说这是他们迄今公开的最强模型。它在软件工程、知识类工作和视觉任务上表现突出,任务越长越复杂,领先优势越明显。Fable 5 是 Mythos 系列第一个大规模公开的模型,之前这个系列因为网络安全能力太强,公司觉得放出来太危险。这次能发,是因为加了新安全机制,会在特定高风险领域直接拦截回答。正文没...

推荐理由:Anthropic 把之前自己判定为太危险的 Mythos 系列第一次公开了,这件事本身就够大。Fable 5 在长任务软件工程上拉开的差距有具体数字,不是公关话术。新加的安全拦截器是它能公开的关键,但正文没细说拦截机制到底多可靠、会不会误伤,这点先别太激动。整体来看,这是今年模型发布里少数能同时炸到技术圈和安全圈的一次。

TechCrunch · AI

Anthropic 把最强模型 Mythos 砍掉危险能力后,以 Claude Fable 5 的名字向公众开放

Anthropic 第一次把自家最强的 Mythos 模型开放给普通人用,但加了一道硬锁:在网络安全、生物、化学和模型蒸馏(用大模型教小模型)这些高风险领域,Fable 5 会直接拒答,退回到更保守的 Claude Opus 4.8。这个模型擅长写代码、知识类工作和图像理解。今年四月 Mythos 刚露面时只给少数合作伙伴试用,原因就是怕被拿去搞网络攻...

推荐理由:Anthropic 把内部最强模型放出来给普通人用,本身就是产品层面的实质性动作,安全机制也说得够细。HKR 三条全中。没给更高分是因为正文没放跑分对比,也没提价格,实际能力和性价比还得等实测。

6月9日星期二

AI HOT 精选

Google 放出 Gemini 3.5 Live Translate,话没说完就开始翻,支持 70 多种语言

Google 发了 Gemini 3.5 Live Translate,一个实时语音转语音翻译模型。它不等对方把整句话讲完,边听边翻,用流式更新把结果推出来,延迟压到几秒,还能保留原声的语速、音高和语调。支持 70 多种语言,目前通过 Gemini Live API、Google Meet 预览版和 iOS/Android 的 Google 翻译 Ap...

推荐理由:HKR 三项都成立:Google 把实时语音翻译绑定了 70+ 语言和说话人未结束就开始的流式输出。分数留在 82,因为正文没披露具体上线范围、定价和基准测试结果,实际效果和可用性还得等验证。

AI HOT 精选

Gemma 4 12B 发布:一个模型直接看懂图文和音频,不用外挂编码器

Google DeepMind 开源了 Gemma 4 12B,一个 120 亿参数的多模态模型。它最大的变化是去掉了传统的独立视觉/音频编码器,把所有输入统一交给 Transformer 处理,架构更简单。模型能直接听懂语音,不再需要先转文字。官方说它用 Apache 2.0 协议开源,在 16GB 显存或统一内存的笔记本上就能跑。性能方面,正文没给...

推荐理由:我会先打个折:正文没给性能对比和具体 benchmark,所以没法判断它到底多强。但架构上的变化是实打实的——把视觉和音频编码器都砍掉,统一用 Transformer 处理,等于简化了管线,也降低了工程复杂度。能在 16GB 显存或统一内存的笔记本上跑,对个人开发者和中小企业是个实在的卖点。原生语音输入意味着不用再串一个 ASR 模块,做语音助手或实时对话应用会更轻量。Apache 2.0 协议也扫清了商用顾虑。整体看,这是一个有明确技术亮点的开源发布,但缺少性能验证,激动之前得等实测数据。

AI HOT 精选

一位开发者用 GPT-5.5 替代 OCR 流程,把 2.3 万篇 ChinaRxiv 论文免费开放并配上更完整的英文翻译

这件事的起点很简单:有人觉得传统的 OCR(光学字符识别)管道太复杂,直接用 GPT-5.5 来读论文、做翻译,结果把 23,000 多篇 ChinaRxiv 上的论文免费放出来了,还带了比之前更完整的英文翻译。正文没披露具体成本、延迟和翻译质量对比,所以没法判断这套方案在准确率和开销上到底比 OCR 好多少。如果是真的省钱又省事,对需要批量处理中文论...

推荐理由:我会先打个折:这不是 OpenAI 官方模型发布,而是一个开发者用例,所以推荐分在 78–84 这个区间。HKR 三项都踩中了——用 GPT-5.5 砍掉 OCR 管道是个很具体的钩子,23,000+ 篇论文的规模也给了实感,对做文档处理和研究的人确实有用。但正文没披露成本、延迟和翻译质量对比,这点先别太激动,没法判断准确率和开销到底比 OCR 好多少。如果是真的省钱又省事,那对批量处理中文论文的场景挺有参考价值。

AI HOT 精选

腾讯混元开源 UniRL:一套强化学习框架同时管图像生成和语言模型,还带了两个新算法

UniRL 把扩散模型、流匹配模型、大语言模型和视觉语言模型的强化学习训练塞进了同一个后训练循环里,流程就是生成、打分、算优势、更新参数再同步。框架把模型和算法拆成两个独立维度,可以自由组合,目前已经用在 Hunyuan-Image 3 和 Bagel 上。这次一并开源了两个算法:Flow-DPPO 给流/扩散模型加了基于精确散度的信任域约束,训练更稳...

推荐理由:UniRL 不是新模型发布,而是一个多模态强化学习的训练框架,把扩散、流匹配、LLM 和 VLM 的 RL 训练流程统一了。框架设计上把模型和算法解耦,搭配开源的两个算法(Flow-DPPO 和 DRPO),对做多模态对齐和微调的从业者来说,省了自己搭轮子的功夫。信息量够、开源动作实在,但属于基础设施层发布,不是旗舰模型,所以重要性给到 81,放在 featured 位置。

AI HOT 精选

一个编程 Agent 串起两个 HuggingFace Space,自动生成了一个巴黎地标 3D 画廊

作者让一个编程 agent 自己动手,把 ideogram-ai/ideogram4 和 VAST-AI/TripoSplat 这两个 Space 串了起来。流程是:先用 ideogram4 生成巴黎地标的图片,再把图片喂给 TripoSplat,从单张图片重建出 3D 高斯泼溅文件(.ply),接着转成体积小约 3 倍的 .ksplat 格式,最后用...

推荐理由:我会先打个折:这不是模型或平台发布,而是一篇 Hugging Face Spaces 的实操教程。但作者把两个现成 Space 串起来,让 agent 自己跑通从文字到 3D 场景的流程,还给出了约 3 倍的压缩数据,对做 agent 编排和轻量 3D 管线的人挺实用。正文没披露生成质量和延迟的具体测试,这点先别太激动。整体放在 featured 档位合适。

6月8日星期一

AI HOT 精选

Runway 发布 Aleph 2.0 视频编辑模型,上传视频后一键改横竖比例

Runway 在桌面网页版上线了 Aleph 2.0 编辑模型。你上传一段已有的视频,选一个想要的宽高比,模型会自动把多出来的画面区域补上,让视频看起来就像原本是按这个比例拍的。正文没披露生成分辨率、处理时长和收费方式,实际效果得自己试。

推荐理由:Runway Aleph 2.0 是个中等体量的视频产品更新,机制讲得清楚,但没给定价、画质评测和铺开范围。HKR 三项都踩中了,放在 featured 门槛的低位。我会先打个折:正文没披露生成分辨率、处理时长和收费方式,实际省不省时间、效果自不自然,得自己上手试。

AI HOT 精选

微软AI负责人说超级智能快来了,但不会抢你饭碗

Mustafa Suleyman 在播客里聊了几个事。他判断超级智能不会造成大规模失业,但没给出具体论证。微软去年10月跟 OpenAI 签了新合同,一边继续合作,一边拿到了独立研发超级智能的许可,已经建了团队、在训前沿模型,本周 Build 大会还发了7个全模态模型。他点名批评 Anthropic 把 Claude 说成有意识,认为现在消费者对 AI...

推荐理由:Mustafa Suleyman 在播客里抛了个大判断——超级智能不会造成大规模失业,但正文没给出具体论证,这点先别太激动。信息量主要靠两个事实撑着:一是微软去年10月跟OpenAI签的新合同,既续了合作又拿到了独立研发超级智能的许可,团队和前沿模型训练都已经在跑了;二是本周Build大会发了7个全模态模型。他还点名批评Anthropic把Claude说成有意识,认为现在消费者对AI的理解还太浅。整体是CEO访谈,不是产品发布,所以分数卡在78-84这个区间。

r/LocalLLaMA

有人盯着我的检测 API 打了半年对抗攻击,这三种套路最常得手

Bordair 的作者把检测 API 挂了六个月,从真实流量里抓出三类反复出现的攻击模式:多轮铺垫、利用对话惯性往前推、以及直接给模型换人设。上个月公开的对抗游戏里大概产生了 6700 次攻击,说明这些手法不是实验室玩具,已经在线上跑了。正文没披露具体绕过率和误报率,这点先别太激动。

推荐理由:这篇文章来自一线实战,不是纸上谈兵。作者把检测 API 暴露在真实流量里半年,抓出多轮铺垫、对话惯性推进、换人设三类攻击模式,上个月对抗游戏里还产生了约 6700 次攻击,说明这些手法已经在线上跑了。对做安全检测的从业者来说,这些实战经验比 benchmark 更有参考价值。不过正文没披露具体绕过率和误报率,效果到底怎么样还得打个问号,所以分数没给更高。

AI HOT 精选

高德发布 ABot-Earth0.5,用一张卫星图 10 分钟就能生成 3D 城市

高德搞了个叫 ABot-Earth0.5 的模型,号称是全球第一个原生 3D 的城市世界模型。它已经覆盖了 190 多个国家和地区。用起来很简单,你扔给它一张卫星图或者一段文字描述,它就能在普通消费级显卡上,大概 10 分钟给你生成一大片公里级的 3D 城市场景。出来的素材是 3DGS 格式,能直接拖进 Unity、虚幻引擎这些软件里接着用。按他们算的...

推荐理由:高德这个ABot-Earth0.5把3D城市生成的门槛压得很低:消费级显卡、10分钟、公里级、直接出可编辑资产。我会先打个折,正文没披露生成精度和几何一致性有多高,也没给实际案例对比,所以“全球首个原生3D城市世界模型”这个说法先别太激动。但即便只做到七八成,对需要大量3D场景的团队来说也挺省钱。H/K/R三条都踩实了,重要性给80合理。

FT · 科技

FT 报道称 AI 监控技术突破让克里姆林宫警觉,但正文被付费墙拦截,关键细节缺失

FT 这篇文章的标题和摘要片段提到,AI 能利用闭路电视画面识别目标,俄罗斯在伊朗最高领袖遇刺后暂停了一套监控系统。但文章正文返回了 403 错误,被付费墙挡在外面,所以系统名称、模型机制、供应商和时间线这些核心信息都没法核实。目前能看到的只有 RSS 摘要里的那几句,我会先打个折:标题里的“突破”和“警觉”听起来很重,但没看到具体技术方案和验证数据之...

推荐理由:FT 的标题和摘要片段提到 AI 能利用闭路电视画面识别目标,俄罗斯在伊朗最高领袖遇刺后暂停了一套监控系统。但文章正文返回了 403 错误,被付费墙挡在外面,所以系统名称、模型机制、供应商和时间线这些核心信息都没法核实。目前能看到的只有 RSS 摘要里的那几句,我会先打个折:标题里的“突破”和“警觉”听起来很重,但没看到具体技术方案和验证数据之前,只能当一条有悬念的线索。

6月7日星期日

AI HOT 精选

北海道农民雇了个叫 Codex 的工程师,用 AI 干了 8 件农活

北海道农民富安弘毅把 ChatGPT 和 Codex 当工程师用,做了 8 件事:拍照识别西兰花病害、用卫星 NDVI 数据看作物长势、拿 ESP32 加 LINE 机器人远程开关温室卷帘、给农场群聊写了个管温度和排期的机器人、从聊天记录里自动统计播种数量、研究 RTK-GPS 自动转向原理并算了自建要花多少钱、用 Airtable 搭了农场管理数据库...

推荐理由:我会先打个折:全文只有一个人、一个农场,没有产量对比或省了多少工时的数字,所以不能当行业证据用。但它的价值不在严谨,而在把 AI 写代码这件事从屏幕拉到了泥地里——一个农民没找外包、没学编程,直接用 Codex 做出了 8 个能跑的工具。这种'非程序员用 AI 写代码干物理世界的活'的案例现在还很少,对国内做 agent 和 coding 方向的人是个挺新鲜的参照。

量子位 · 公众号

快手可灵提出 VLM-as-Teacher:生成视频时让视觉模型当老师,在线微调 LoRA 来遵守文字规则

这篇文章的正文被微信环境异常页挡住了,看不到具体技术细节。从标题和现有摘要看,快手可灵和城大合作了一个叫 VLM-as-Teacher 的方法。思路是在测试阶段用视觉语言模型(VLM)给视频生成模型(VGM)的 LoRA 模块打分反馈,边生成边优化,让模型学会按文字规则推理。他们搞了个 VBVR-Bench 基准,分数从 0.666 提到了 0.781...

推荐理由:正文被微信环境异常页挡住了,看不到技术细节,这点先打个折。但从标题和摘要看,快手可灵和城大搞的 VLM-as-Teacher,思路是在测试阶段让视觉语言模型给视频生成模型的 LoRA 打分,边跑边调,让模型学会按文字规则推理。VBVR-Bench 上分数从 0.666 提到 0.781,说明规则遵循能力有明显提升。方法本身有巧思,不是换模型架构,而是在推理时加一层在线优化,对可控视频生成是个实用方向。信息缺口在于没看到具体实现和消融实验,等正文能看了再补判断。

量子位 · 公众号

京东开源 JoyAI-Echo,5 分钟 AI 长视频不崩,推理速度提了 7.5 倍

京东放出了一个叫 JoyAI-Echo 的开源框架,专门解决 AI 生成 5 分钟长视频时画面容易崩、前后不一致的问题。它用跨模态记忆模块把视频里的角色、场景信息存下来,保证长镜头里不会突然变脸或换衣服。训练上用了 DMD 后训练技术,推理速度比原来快了大概 7.5 倍,生成一段视频的成本和时间都压下来了。输出端还做了实时超分,能把 720P 画面直接...

推荐理由:我会先打个折:正文没提第三方评测或用户实测,所有性能数据都来自京东自己,所以效果得等上手再看。但这条消息本身有料——JoyAI-Echo用记忆模块存角色和场景信息,解决长视频变脸换衣服的老毛病,推理还快了7.5倍,成本往下走。对做视频生成的团队来说,开源就意味着能拿来改、能压成本,这点挺实在。先给80分,等有实测对比再往上调。

6月6日星期六

AI HOT 精选

OpenCV 5 发布,换了一套能跑大模型的神经网络引擎

OpenCV 5 最大的变化是换了一套全新的 DNN 引擎,从原来的逐层执行改成基于计算图的架构,能做算子融合,跑 Transformer、视觉语言模型和大语言模型都成了原生能力。ONNX 算子的覆盖率从 4.x 时期不到 23% 一下子拉到 80% 以上,以前很多导不进来的模型现在能直接用了。另外硬件加速层也重新整理了,厂商可以直接插优化后的计算内核...

推荐理由:HKR 三项都站得住:OpenCV 加原生大模型支持是个实打实的跨界信号,计算图引擎和 ONNX 覆盖率暴涨是硬核知识增量,本地推理和兼容性又切中部署痛点。作为大版本更新,重要性够上 featured,但还没到模型实验室发新作那种必写级别。

r/LocalLLaMA

开源模型这周炸了:25+ 个开放权重模型一口气放出,覆盖文本、图像、语音

Victor M 在 X 上整理了一份清单,过去一周有超过 25 个开放权重的模型发布,几乎覆盖了所有模态。其中最扎眼的是 NVIDIA 的 Nemotron 3 Ultra,一个 550B 参数的混合架构(Mamba-MoE),每次推理只激活 55B 参数,上下文窗口能塞进 100 万个 token。不过正文被 Reddit 的安全策略拦住了,具体还...

推荐理由:我会先打个折:消息源是 X 上的个人整理,Reddit 原文还被安全策略拦了,具体细节没法交叉验证。但一周 25+ 个开放权重模型这个密度本身就值得关注,NVIDIA 那个 550B 的 Nemotron 用 Mamba-MoE 架构,激活参数只有 55B,上下文能塞 100 万 token,如果实测靠谱,推理成本会省不少。这点先别太激动,等完整评测出来再说。

机器之心 · 公众号

大晓机器人和南洋理工发布 PhysX-Omni,一个框架直接生成能进仿真器跑的 3D 物体

这篇推文本身因为微信环境验证没抓到正文,我只能根据标题和已有英文摘要来说。PhysX-Omni 是一个 3D 生成框架,特点是生成出来的模型不是只能看,而是直接带物理属性,能区分刚体、软体和带关节的物体,扔进仿真器就能跑。配套的数据集 PhysXVerse 有超过 8700 个物理 3D 资产,覆盖 2900 多个类别。对做机器人仿真的人来说,省掉了手...

推荐理由:标题说打通全链路,但正文没抓到,只能按摘要判断。PhysX-Omni 解决的是仿真资产从能看升级到能跑的问题,省掉了手动标物理属性的脏活。8700+ 资产和 2900+ 类别说明数据集有一定覆盖面,不过没披露资产质量、仿真精度和实际跑分,效果还得等模型放出来再看。大晓机器人和南洋理工的组合在机器人圈有认知度,但放到整个 AI 圈声量中等,所以卡在 featured 门槛上。

机器之心 · 公众号

视频AI能一次生成5分钟了,京东开源JoyAI-Echo,告别抽卡式出片

京东放出了JoyAI-Echo,一个能一口气生成最长5分钟视频加音频的框架,而且全量开源。它主打跨镜头画面和声音的一致性,支持局部重绘,用8步DMD蒸馏来提速,最高能输出1472×2560分辨率的片子。不过原文因为微信环境验证没过去,具体效果和实测数据暂时看不到,这点先别太激动。

推荐理由:JoyAI-Echo把长视频生成的门槛拉到了5分钟,而且代码全放出来,不是只发篇论文。跨镜头画面和声音一致性、局部重绘、8步蒸馏提速这些点都踩在视频AI从业者的痛点上。不过原文因为微信环境验证没过去,具体效果和实测数据暂时看不到,这点先别太激动。单源覆盖、没有独立评测,分数放在78–84区间比较合理。

AI HOT 精选

Google AI 本周连发六弹:笔记本能跑的多模态模型、帮你读论文的科研助手、还有开源实时音乐模型

Google AI 这周一口气更新了六样东西。Nano Banana 2 和 Pro 版正式上线,走 Gemini 企业平台、API 和 AI Studio 就能用。Co-Scientist 是一个多智能体系统,专门帮科研人员自动生成和优化新假设,相当于有个助手帮你读文献、想点子。Google Labs 出了个 dreambeans,会扒你的 Goog...

推荐理由:HKR 三项都踩中了:帖子一口气打包了 Google AI 六个更新,本地部署和开源这两个点对从业者很实在。正文没给基准测试、授权条款和定价细节,所以分数卡在 76,没往上走。

AI HOT 精选

Gemini Live 现在能边聊边改图,摄像头对着什么就实时生成新画面

Gemini 应用里的 Live 模式加了实时生图和编辑功能。你打开摄像头,告诉它你想看到什么,它就能当场改画面,比如换墙色、加家具、把眼前场景变成梗图。正文没提生成一张图要多久、支持哪些画风,也没说免费额度怎么算。

推荐理由:Gemini Live 现在能边看边改图了,你开着摄像头说“把墙刷成蓝色”或者“加个沙发”,它当场给你变出来。这功能听着挺唬人,但正文没交代生成延迟、画风支持范围,也没提免费额度,所以实际用起来卡不卡、花不花钱,都得打个问号。HKR 全过:标题有实时交互的噱头,操作门槛低到只剩张嘴,而且直接冲着修图软件和创意工具去的,竞争味很浓。

Hacker News 首页

General Instinct 开源 InstinctRazor:把 245GB 的大模型压到 48GB,能在本地设备上跑

General Instinct 开源了 InstinctRazor,一个专门给边缘设备用的模型压缩方案。他们拿 Qwen3.5-122B-A10B 开刀,这个模型原本是 BF16 格式的混合专家模型(MoE),体积大约 245GB。压缩后变成一个 48GiB 的 GGUF 文件,比 Gemma-4-26B-A4B 还小,但在 MMLU-Pro 和 G...

推荐理由:我会先打个折:这是 YC 的 Launch HN,不是独立评测,性能数据得等第三方复现。但亮点很实在——把一个 245GB 的 MoE 模型压到 48GiB,还能在消费级显存上跑 8k 上下文。正文没披露压缩后推理速度有多快,也没说 MMLU-Pro 具体掉了多少分,这点先别太激动。不过思路本身对想在本地跑大模型的团队挺省钱,所以放在 featured 合适。

6月5日星期五

AI HOT 精选

Meta 把未启用的人脸识别代码塞进了智能眼镜 App,已推送到超 5000 万台设备

安全研究员从 Meta 智能眼镜的配套 App 里拆出了一套叫 NameTag 的人脸识别功能代码。这套代码虽然没开启,但核心组件已经通过应用更新,静默分发到了下载量超 5000 万次的设备上。它的工作流程是:用三个 AI 模型分别完成人脸检测、图像裁剪和把人脸转成生物特征模板(faceprints),然后跟手机本地数据库做比对。识别成功会弹通知,没认...

推荐理由:这篇东西挖出了 Meta 智能眼镜 App 里藏着的 NameTag 人脸识别代码,虽然没开启,但核心组件已经通过更新静默塞进了超 5000 万次下载的设备里。我会先打个折:它毕竟不是官方发布或重大事故,只是一篇基于代码拆解的深度报道,所以重要性我给到 82,刚好跨过 featured 门槛。HKR 三条全过:热点是隐藏代码加 5000 万设备规模,知识量有三模型本地比对的具体流程,关联度则踩中了中美算力差距和效率竞赛的从业者神经。正文没确认功能已对用户开放,所以分数没再往上拉。

r/LocalLLaMA

微软没出 Qwen3.6-27B 或 Gemma-4-31B 这种尺寸的模型,而是发了一组 MAI 系列

Reddit 上有人吐槽微软应该发类似 Qwen3.6-27B 或 Gemma-4-31B 这种中等体量的开源模型,结果他们放出来的是七个 MAI 模型。其中 MAI-Thinking-1 参数规模标的是 1T A35B,上下文窗口 256K;MAI-Code-1-Flash 是 137B A5B,同样 256K 窗口。帖子正文被网络策略挡了,看不到更...

推荐理由:微软一口气放出 7 个 MAI 模型,带推理和代码变体,256K 上下文窗口,信息量够得上 HKR-K 和 R。帖子拿 Qwen3.6 和 Gemma-4 当参照物,说微软早该发这类中型模型,这个追赶角度撑起了 H。不过来源是 Reddit 吐槽帖,正文还被网络策略挡了,缺基准测试、许可证和定价细节,所以停在 featured 档,上不了 P1。

机器之心 · 公众号

东南大学和北大搞了个机器人精细操作评测框架,说传统只看成功率的办法会把能力高估七成

这篇推文本身被微信的环境验证挡住了,正文内容没抓到。从标题和已有的英文摘要看,MetaFine 是一个诊断式的元评测框架,专门拆开看机器人在精细操作上的理解、感知和行为三个环节,而不是只给一个“成功/失败”的二元结果。研究团队说,传统只看最终成功率的评测方式,对精细操作能力的评估会虚高最多 70%。具体怎么测的、用了哪些任务和模型,正文没披露,没法展开。

推荐理由:标题和摘要抛出的 70% 虚高数字很有冲击力,MetaFine 的三轴诊断思路也确实比只看成功率进了一步。但正文被微信环境验证挡住,具体任务、模型和实验细节全是缺口,没法核实。所以它是一篇有钩子、有新知但信息不完整的二次评论帖,放在 featured 门槛上刚好,不宜再拔高。

量子位 · 公众号

姚顺雨现身腾讯云大会,回应腾讯 AI 落后质疑

姚顺雨在腾讯云 AI 产业应用大会上说,混元 3 把预训练和强化学习的基础设施重做了一遍,数据和评估方式也换了,还把最强的后训练人员先调去改进元宝。他点名代码 agent、多模态和具身智能是腾讯接下来的重点方向。

推荐理由:这是一篇大会发言和路线图信号,不是带规格、跑分或上线日期的新模型发布。信息增量在于腾讯把后训练精锐先押在元宝上,以及重做基础设施这个表态,但缺少可验证的指标。放在 featured 低位,是因为它给中国大厂 AI 战略更新提供了一个有争议锚点的注脚,而不是一个硬核技术首发。

AI HOT 精选

Google 开源了实时音乐模型 MRT2,在 MacBook 上延迟不到 200 毫秒

Google AI for Developers 放出了一个叫 Magenta RealTime 2(MRT2)的实时音乐模型,权重开放,推理引擎也开源了。你可以用 MIDI 键盘弹、打字给提示词,甚至用手势控制它来生成音乐。它在 MacBook 上原生跑,延迟压到了 200 毫秒以内,这个速度对实时演奏来说基本跟手。配套还给了应用和插件套件,到手就能...

推荐理由:HKR 三项都过:Google Magenta MRT2 有实打实的实时音频钩子、开放权重和低于 200ms 的本地延迟。对创意 AI 开发者吸引力很强,但本质上是一封公开信和政策诉求,不是已生效的法律,法案文本和执行时间表都没披露,所以放在 featured 而不是更高一级。

AI HOT 精选

Boson AI 和 LMSYS 把 Higgs Audio v3 TTS 跑在了 SGLang-Omni 上,一个 4B 参数的语音合成模型,主打低延迟...

Higgs Audio v3 TTS 是 Boson AI 的语音合成模型,参数量大约 4B,底层用了 Qwen3-4B。它支持 100 种语言,在内部测试集上词错率/字错率能压到个位数。这个模型专门为语音助手那种边说边生成的场景设计,不等句子结束就能开始合成,后续文本到了还能保持声音、情绪和节奏连贯。开发者可以直接在输入文本里插标签来控制 20 多种...

推荐理由:H 和 K 靠 4B/100 语言/流式合成这几个硬指标撑住。R 偏弱,因为文章没给延迟、定价和权重,更像一个能力宣告而非可立刻复用的发布,所以放在 featured 低位。

6月4日星期四

AI HOT 精选

neolab 发布 Nex-N2-Pro,一个 397B 参数的混合专家推理模型,跑分自称摸到 GPT-5.5 水平

这个模型基于 Qwen3.5-397B-A17B 改造,总参数量 397B,用了混合专家架构(MoE,把任务分给不同子模型处理,省算力)。它能处理 26 万多字的长上下文,也支持图像识别。官方说它在 Terminal Bench 2.1、GDPVal、SWE-Verified 这几个测试集上拿了最高分,性能对标 GPT-5.5 和 Claude Opu...

推荐理由:HKR 三项都过:标题的 benchmark 钩子够强,正文也给了模型尺寸、上下文和 token 缩减的具体数字。但这是一封公开信和政策呼吁,不是已生效的法律,法案文本和执行时间表都没披露,所以放在 featured 而不是更高。

新智元 · 公众号

分子之心发布 MMDesign,声称靶点命中率超过 90%

分子之心推出了一个叫 MMDesign 的 AI 平台,专门用来从头设计生物大分子药物。他们在 12 个治疗靶点上做了测试,每个靶点只挑了 14 到 50 个分子去做湿实验验证,结果有 11 个靶点都测出了特异性结合,算下来靶点成功率超过了 90%。不过正文因为访问环境异常没加载出来,具体用了什么模型架构、训练数据规模、以及和哪些国际顶尖模型做了对比,...

推荐理由:我会先打个折:正文没披露这 12 个靶点具体是什么、难度如何,也没说湿实验的具体指标和对照组,所以 90% 这个数先别太激动。但亮点在于,每个靶点只筛了 14 到 50 个分子就进湿实验,如果数据属实,意味着前期筛选成本压得很低。对做 AI 制药的人来说,这比跑分更有参考价值。整体偏产品发布,但数字够具体,放在 featured 档合理。

新智元 · 公众号

MiniMax M3 在开源模型榜冲上第一,硅谷 CEO 深夜转发,但中文社区对实际表现吵起来了

MiniMax 的新模型 M3 在第三方评测平台 Artificial Analysis 的开源榜单上排到了第一。文章说它支持一次性处理 100 万 token 的上下文,预训练用了百 T 级别的数据,并承诺在 10 天内开源模型权重和完整技术报告。不过,这篇微信文章本身因为环境验证问题无法看到正文,所以具体的评测细节、中文社区到底在吵什么、以及硅谷 ...

推荐理由:MiniMax M3在Artificial Analysis上冲到了开源模型第一,但中文社区对评测含金量吵得很凶。我会先打个折:权重和完整报告还没放出来,现在只能看官方给的数据。1M上下文和100T预训练规模听着挺猛,但正文没披露具体架构和训练成本,这点先别太激动。10天内开源这个承诺如果兑现,对开发者是实打实的利好;如果跳票,那现在的排名就先当个热闹看。

机器之心 · 公众号

谷歌放出 Gemma 4 12B,120 亿参数模型能在 16G 显存的笔记本上跑

谷歌发了 Gemma 4 系列的新成员,一个 120 亿参数的中等尺寸模型。它主打本地运行,16GB 显存或统一内存的笔记本就能带起来。架构上没走传统多模态那套编码器路线,直接原生支持音频输入,还带了一个叫 MTP 的推测解码模块来压延迟。模型用 Apache 2.0 协议开源。不过正文因为环境验证没加载出来,具体跑分、训练数据、实际推理速度这些关键信...

推荐理由:Gemma 4 12B 的卖点很直给:一个不算小的模型,能在普通笔记本上跑,还用了 Apache 2.0 协议。这对想自己折腾、又不想被云服务绑住的开发者来说,是个实在的更新。我会先打个折,正文没提具体推理速度和实际任务表现,光看参数和硬件门槛还不够,得等实测。但就凭“16G 笔记本能跑”这个钩子和宽松的开源协议,值得推给关注本地部署和成本控制的读者。

量子位 · 公众号

CVPR 2026 上,小鹏给英伟达、特斯拉和 Waymo 讲了一遍自己的物理 AI 技术栈

小鹏在 CVPR 2026 上公开了他们的世界模型技术栈,包含 X-World、X-Foresight 和 X-Cache 三个部分。X-Cache 能砍掉约 70% 的重复计算,相当于让模型推理时少做无用功。第二代 VLA 模型用了超过 4 万亿个 token 训练,这个量级说明训练数据投入很大。车端推理延迟压到了 80 毫秒,对实时驾驶决策来说这个...

推荐理由:我会先打个折,这毕竟是小鹏在顶会上的技术展示,不是独立验证过的第三方评测,所以分数没给到 85 以上。但选题确实抓人:CVPR 舞台上让北美自动驾驶三巨头听一家中国公司讲物理 AI,本身就制造了对比。信息量也够,X-Cache 的七成重复计算缩减、4 万亿 token 的训练规模、80 毫秒的车端延迟,都是能直接拿来讨论的指标。正文没披露 X-Cache 具体在什么场景下测出这个节省比例,也没说 80 毫秒是平均还是 P99,这点先别太激动。整体看,对做自动驾驶和端侧模型的人有参考价值,也踩中了中美技术竞争的神经,所以放在 featured 位置。

AI HOT 精选

Ideogram 4.0 开源,跑分自称全球最强,文字渲染和排版控制是亮点

Ideogram 发布了 4.0 版本,一个 93 亿参数的开源文生图模型。它把文字和图像信息放在同一条处理流水线上(单流 DiT 架构),并用了 Qwen3-VL-8B 当文本编码器。最突出的能力是能在图里准确写出长段文字,适合做海报和封面。另外,它训练时让模型理解了元素的位置关系,你用提示词就能指定版式和对象布局。在 DesignArena 的人工...

推荐理由:Ideogram 4.0把9.3B参数的文生图模型开源了,架构是单流DiT,在DesignArena人类偏好排名里拿了第4。我会先打个折——正文没披露训练数据规模和具体推理成本,所以实际部署的性价比还不好算。但一个开源模型能在人类评价里挤进前排,说明图像生成的质量门槛又在往下掉,对做应用的人来说是个省钱信号。

FT · 科技

英国议员起诉马斯克的 xAI,想用假色情图片案测试 AI 公司要不要为模型输出负责

英国工党议员 Jess Asato 把马斯克旗下 xAI 告了,起因是系统生成了她的虚假性相关图片。这案子被当成一个测试案例,核心是想搞清楚:AI 模型开发者到底要不要为模型吐出的内容承担法律责任。不过目前公开信息很少——正文没披露具体是哪个模型、图片是怎么生成的、索赔金额多少,也没说法庭排期。

推荐理由:我会先打个折:正文没披露具体是哪个模型、怎么生成的、索赔多少钱,所以信息有缺口。但这件事本身够硬——议员告 AI 公司,而且是在英国拿法律试水,直接问“模型产出谁担责”。FT 的报道把 xAI、马斯克、虚假性影像和法律责任测试绑在一起,话题性很强。因为缺技术细节和金额,分数压在 78–84 这个区间是合理的,不用往上拔。

Hacker News 首页

谷歌发布 Gemma 4 12B:一个去掉独立图像编码器的多模态模型

谷歌在官方博客宣布了 Gemma 4 12B,主打“统一、无编码器”的多模态设计。简单说,它不再像传统模型那样给图片单独配一个视觉编码器,而是让同一个模型直接处理文字和图像。博客里没给架构细节、训练数据、基准跑分、定价和开源协议,只提了一句“能在笔记本上跑高性能多模态智能”。这点先别太激动——12B 参数在笔记本上跑通常需要量化或剪枝,但正文没披露用了...

推荐理由:Google 发了 Gemma 4 12B,说它是统一的无编码器多模态模型,意思是不再单独接一个视觉编码器,结构上更省事。但这条消息目前只有标题和 HN 讨论热度,正文没披露参数量怎么分配、训练用了什么数据、推理成本降了多少,也没给任何跑分。我会先打个折,把它放在 80 分上下,因为钩子够强,但事实太少,不值得冲太高。

6月3日星期三

r/LocalLLaMA

谷歌放出 Gemma 4 系列,12B 模型能看图文、听音频,上下文窗口拉到 256K

谷歌 DeepMind 把 Gemma 4 系列的开源权重挂上了 Hugging Face,一共五个尺寸。其中 12B 这个版本支持文本、图片和音频三种输入,同时放出了指令微调版和预训练版。它原生支持系统提示词和函数调用,上下文窗口最长能到 256K token,意味着一次可以塞进很长的文档或对话记录。不过 Reddit 原帖被网络策略拦截,正文没披露...

推荐理由:Gemma 4 这次把开放权重、多模态和 256K 长上下文一起端上来,比常规版本更新更有看头。我会先打个折:正文没给具体 benchmark 和 license 细节,官方博客也没同步,所以判断先停在 83 分。如果是真的,12B 这个尺寸能跑图、能听音频,对本地玩家挺省钱。

MIT Technology Review · AI

特朗普签了新 AI 行政令,Anduril 和 Meta 在给美军做能“用眼神下命令”的 AR 眼镜

特朗普废掉旧令不到两周,又签了一份新的 AI 行政令。核心变化是:要求科技公司在发布前沿模型前 30 天,自愿把模型交给政府审查,但不设强制许可证。对比之前被搁置的版本(要求提前 90 天提交),这次明显缩水了,不过也算从完全不管迈向了轻度监管。另一条消息是,军工公司 Anduril 和 Meta 正在给美军搞一款 AR 头显原型,想实现用眼球追踪和语...

推荐理由:我会先打个折:行政令是“自愿”送审,不是强制,别当成立法看。但 30 天这个数字给了企业一个明确的时间窗口,比之前模糊的“提前沟通”要具体。另一条更硬——Anduril 和 Meta 的原型头显让士兵用眼动和语音指挥无人机打击,这已经不是实验室概念了。两条放一起,一条在收紧模型发布,一条在把 AI 往杀伤链里塞,反差够大,从业者得知道。