跳到正文

全部动态

今日 8 条

4月24日星期五

彭博科技

DeepSeek 发布新一代旗舰模型预览版,距上次出圈正好一年

DeepSeek 放出了新旗舰模型的预览版本,官方说法是“迄今最强的开源平台”。目前只确认了开源定位和预览状态,正文没披露参数量、上下文长度、跑分成绩和正式发布时间。我会先打个折——能看到的硬信息还太少,先别太激动。

推荐理由:DeepSeek 在去年炸场之后又推新旗舰预览,开源这张牌继续打,话题度够高,所以给到 featured。但文章实质信息很少——没参数、没上下文窗口、没基准成绩、没时间表,只能确认“预览版”和“开源”两点,知识增量弱,重要性就压在 75 这个低位。我会先打个折:标题唬人,内容还撑不起更高的分数。

X · @dotey(宝玉)

DeepSeek 发了 V4 预览版并开源,百万上下文直接标配,不再分版本加价

DeepSeek 放出了 V4 系列模型的预览版,代码也同步开源。这次最实在的变化是,百万 token 的上下文窗口成了所有官方服务的默认配置,Pro 和 Flash 两个型号都一样,没有高价门槛。V4-Pro 是旗舰,推理能力追平了顶尖闭源模型,世界知识得分仅次于 Gemini-Pro-3.1;V4-Flash 是轻量经济版,推理接近 Pro,但知识...

推荐理由:DeepSeek 是国内头部的模型厂商,这次 V4 预览版把百万上下文做成全服务标配并开源,属于实质性发布。HKR 三项都满足:正文有机制解释和迁移截止日期,而且这种定价策略的调整让它值得当天就作为 P1 处理。

Hacker News 首页

GPT-5.5 在漏洞挖掘上追平了没公开的 Mythos,而且人人都能用

安全公司 XBOW 用真实漏洞库测了 GPT-5.5,漏报率压到 10%,比 GPT-5 的 40% 和 Opus 4.6 的 18% 都低。更关键的是,GPT-5.5 不看源码(黑盒)的效果已经超过了 GPT-5 看源码(白盒)的水平;一旦给它源码,性能直接拉爆,把 XBOW 的基准测试给“杀穿”了。在模拟登录这类实操任务里,它登录成功的交互轮次只有...

推荐理由:我会先打个折:数据来自 XBOW 自家的漏洞基准,不是 OpenAI 官方发布,所以不能当定论。但信息量够硬——GPT-5.5 在黑盒条件下漏报率只有 10%,比 GPT-5 有源码时的 40% 低了一大截,也比 Opus 4.6 的 18% 强。视觉敏锐度 97.5%,登录目标系统需要的尝试次数直接砍半,说明模型在真实攻击链里的效率明显跳了一级。XBOW 把它类比成 Mythos 级别的能力,这点先别太激动,正文没披露测试环境是否隔离、样本量多大、有没有针对性微调。不过对做攻防和安全评估的人来说,这个信号足够盯紧了:模型在没看到源码的情况下已经能...

4月23日星期四

量子位 · 公众号

Qwen3.6-27B 开源,参数只有前代旗舰的十五分之一,但在智能体编程上反超了 397B 模型

Qwen 放出了 Qwen3.6-27B 的权重,一个 270 亿参数的稠密模型。官方说它在四项智能体编程基准上全面超过了自家上一代 3970 亿参数的旗舰 Qwen3.5-397B。具体看,SkillsBench 从 30.0 跳到 48.2,GPQA Diamond 拿到 87.8,AIME26 达到 94.1,说明模型在需要调用工具、写代码解决问...

推荐理由:这是一次有料的 Qwen 开源发布,给出了智能体编程和推理的硬分数,HKR 三项都站得住。我维持 84 分不往上加,因为正文只给了基准数字,没提上下文窗口、推理成本或独立复现结果,这些缺口让判断先打个折。

彭博科技

腾讯发布新基础模型,这是它从 OpenAI 挖来核心研究员后的首次大考

腾讯宣布了一次重大的基础模型升级,但正文没披露模型名称、参数量、跑分成绩和具体发布时间。这是它从 OpenAI 挖来一位顶尖研究员后,第一次把新模型拿出来亮相,所以外界很关注这次升级到底成色如何。

推荐理由:Bloomberg 的信源有分量,而且把腾讯这次模型发布直接说成是对 OpenAI 挖角成果的首次检验,所以 H 和 R 都站得住。K 过不了,因为全文除了“发了”之外,模型名、规模、基准成绩、上线时间一概没给,属于有钩子没肉。

Hacker News 首页

代码模型修 bug 时总爱把整个函数重写一遍

作者用程序给 BigCodeBench 的 400 道题植入单点 bug,发现很多模型在修 bug 时会过度编辑——明明改一行就能修好,它却把半个函数重写了,甚至加一堆没必要的检查。文章用 token 级编辑距离来量化这种“改多了”的程度,并尝试通过训练让模型学会只做最小改动。正文没披露最终测试结果和模型排名,也没说训练后到底省了多少编辑量。

推荐理由:这篇文章的切入点很巧,用 400 道题的 bug 注入实验把“模型修 bug 时过度改写”这个模糊感受变成了可量化的编辑距离。对 AI 编程工具的用户来说,多改一行正确代码就是多一份审查成本和上线风险,所以相关性直接拉满。不过正文截取没给出具体结果、模型排名和效果幅度,我会先打个折——知道问题存在,但不知道严重到什么程度、哪些模型更爱乱改,这点先别太激动。

4月22日星期三

Hacker News 首页

Qwen 开源 27B 稠密模型,编程能力超过自家 397B 的 MoE 老旗舰

Qwen 放出了 Qwen3.6-27B,一个 270 亿参数的稠密模型,主打编程,而且直接开源。它最狠的地方是跑分超过了上一代 3970 亿总参数(每次激活 170 亿)的 MoE 模型 Qwen3.5-397B-A17B。在 SWE-bench Verified 上拿了 77.2 分,比老旗舰的 76.2 高;在 Terminal-Bench 2....

推荐理由:Qwen3.6-27B 是一次有分量的开源模型发布,权重直接可下,编程基准分数明确,而且走的是稠密路线而非更大的 MoE。对 AI 从业者来说,这意味着用更低的部署成本去试一个旗舰级编程模型。HKR 三项都站得住,按规则,国内大模型的重要发布应该和同等美国实验室的发布给到同一档分数。

4月21日星期二

机器之心 · 公众号

匿名模型 MotuBrain 在 WorldArena 和 RoboTwin2.0 两个榜单同时登顶,圈内都在猜它是谁

MotuBrain 这个模型在 WorldArena 上拿了 63.77 的 EWM 分数,在 RoboTwin2.0 的干净和随机两种设置下分别得了 95.8 和 96.1 分,两项都是第一。它在运动质量、流分数和运动平滑度这些细分指标上也排在最前面。RoboTwin 的 50 个任务里它平均做到 96.0 分,第二名是 92.3 分,差距不算小。这...

推荐理由:H 抓的是匿名模型双榜第一这个反常事件,圈内打听本身就说明信息差和关注度。K 把具体分数和领先幅度摆出来,同时点明关键信息缺失——谁做的、怎么训的都不知道,读者能自己判断可信度。R 落在具身智能的核心争议上:一个模型同时做世界预测和动作输出到底行不行,这次有了可复现的 benchmark 证据。分数定在 81,因为结果本身有冲击力,但所有权、规模、训练数据和可复现性全缺,不能给更高。

Latent Space

月之暗面发布 Kimi K2.6 开源模型,在长任务执行上对标 Claude Opus 4.6

月之暗面推出了 Kimi K2.6,一个总参数 1 万亿的混合专家模型,每次推理激活 320 亿参数,支持 25.6 万 token 的上下文窗口。它主打的是长时间、多步骤的智能体任务,官方宣称能连续跑 12 小时以上、调用超 4000 次工具、并行管理 300 个子智能体。在 SWE-Bench Pro 编程基准上得分 58.6,HLE 带工具得分 ...

推荐理由:我会先打个折:SWE-Bench Pro 58.6 这个数正文没给对比基线,不知道和 Opus 4.6 的差距到底多大,这点先别太激动。但 Kimi K2.6 真正值得盯的不是基座跑分,而是它把 agent 执行时长拉到 12 小时、能并行跑 300 个子代理,这在开源模型里算往前拱了一步。国内大模型旗舰发布本身就自带信号,加上抢在 DeepSeek v4 前出牌,对关注开源模型进展的人有信息差价值,所以给到 P1。

4月20日星期一

r/LocalLLaMA

用免费 Colab T4 和 Mac 给苹果端侧 3B 模型训练 LoRA 适配器

作者搭了一套 QLoRA 流程来微调苹果那个跑在手机上的 3B 模型,把显存需求从大约 24GB 压到 1GB 内存加 5GB 显存,免费版 Colab T4 或者一台 24GB 内存的 Mac 就能跑。帖子说 A100 跑 LoRA、T4 跑 QLoRA、Mac 跑 QLoRA 训出来的适配器效果差不多,都能把准确率从 40% 左右拉到 75%,如果...

推荐理由:一篇带名字的第一手实验,内存和准确率数字可复现,HKR 三项全中,比普通教程贴强。分数没上 85 是因为来源只是单篇 Reddit 帖子,权威性有限,跑分范围也窄。

r/LocalLLaMA

Reddit 网友拿 9 个模型做功能规划对比,Claude Opus 4.6 生成的规格书最贵也最详细

一位 Reddit 用户让 9 个模型给一款 Go 语言记账 App 设计“负载追踪”功能,再用 Claude Code 给生成的规格文档打分排名。Claude Opus 4.6 排第一,产出一份 19KB 的规格书,过程中读了 44 次代码,花了 2.47 美元;GLM 5.1 排第二,Qwen 3.6 35B fp8+vLLM 排第三。作者自己强调...

推荐理由:这是一次有名有姓的个人实测,给出了真实工作流里的数据,所以 H、K、R 三项都站得住。但天花板不高:只测了一个功能、排名由 Claude Code 自己打分、正文没提人工验收结果,我会先打个折,放在 featured 里偏低的位置。

r/LocalLLaMA

TRELLIS.2 图片转 3D 模型现在能在苹果芯片 Mac 上跑了,不用 NVIDIA 显卡

有开发者把微软的 TRELLIS.2 移植到了 Apple Silicon 上,用一张照片就能生成约 40 万个顶点的 3D 网格。在 24GB 内存的 M4 Pro 上跑一次大概 3 分半钟,其中贴图烘焙只要 18 秒。这次移植把原来五个依赖 CUDA 的扩展换成了 PyTorch MPS 和自定义后端,不再需要 NVIDIA 显卡或云端算力。不过正...

推荐理由:这是社区移植,不是微软官方发布,但三个点都站得住:不用 NVIDIA 就能在 Mac 上做图生 3D,给了 M4 Pro 24GB 的具体跑分,而且重写 5 个 CUDA 扩展这件事本身就说明工作量。来源是 Reddit 帖子,权威性一般,但信息够具体,先按 featured 处理。

量子位 · 公众号

苏度科技估值超20亿美元,发布具身模型Sudo R1:零真实机器人数据训练,首次抓取成功率约98%

苏度科技放出了他们的具身智能首秀Sudo R1,说是在完全没有用真实机器人数据训练的情况下,直接零样本测试了200多次,对100多种没见过的物体(包括透明、金属、软的和反光的东西)首次抓取成功率约98%,试两次基本能到100%。整个演示跑了60分钟。他们用的方法是在高保真模拟器里结合世界模型和强化学习来训练,相当于先在虚拟世界里把技能练好再搬到真机上。...

推荐理由:这条我会先打个折,因为所有指标都是自报的,没第三方验证。但零真机数据、zero-shot 直接上真机抓出 98% 首次成功率,这个说法本身就够硬,而且给了 200 多次测试、100 多个没见过的物体、60 分钟连续跑,数字具体,不是空口号。它正好打在机器人行业最疼的地方:真实数据又贵又慢,仿真到真机迁移一直是个坑。正文没披露融资金额、基准怎么定义的、谁做的第三方验证,所以分数没给更高。

纽约时报中文网

荣耀人形机器人“闪电”半马跑出50分26秒,比人类世界纪录快近7分钟

荣耀的人形机器人“闪电”在北京半马跑出50分26秒,比乌干达选手基普利莫保持的人类纪录(57分20秒)快了将近7分钟。它身高1.65米,腿长约0.9米,中途撞上护栏摔倒,靠人扶起来后继续跑完。去年最快的机器人成绩是2小时40分42秒,今年直接压缩到不到三分之一,进步幅度很大。俄勒冈州立大学的机器人教授费恩认为,这主要说明中国在机器人硬件工程和系统稳定性...

推荐理由:这条消息的钩子很直接:一台人形机器人半马跑进50分26秒,比人类纪录快将近7分钟。我会先打个折——它中途撞护栏摔了,是在人帮忙扶起来之后才完赛的,所以不是完全自主跑完全程。但数字本身还是说明工程成熟度在往上走,去年同类最好成绩还要2小时40分,一年压缩到三分之一的时间,进步幅度值得盯。正文没披露控制方案和比赛规则细节,所以别急着往AI能力跃迁上解读,更多是机电、步态和系统集成的提升。对从业者来说,这条消息的参考价值在于一个可量化的性能标尺,而不是一篇公关稿。

Hacker News 首页

TRELLIS.2 图生 3D 模型现在能在 Mac 上跑了,不用 Nvidia 显卡

开发者 shivampkumar 把微软那个 40 亿参数的 TRELLIS.2 模型移植到了苹果芯片上,靠 PyTorch 的 MPS 后端驱动,一张图就能生成 3D 模型。他把原本依赖 Nvidia 硬件的 flash_attn、nvdiffrast 和自定义稀疏卷积算子全换成了纯 PyTorch 实现,包括稀疏 3D 卷积、SDPA 注意力机制和...

推荐理由:这不是微软官方模型发布,而是一个可复现的本地移植,对实际干活的人有参考价值。我会先打个折:3.5 分钟生成一个网格不算快,但考虑到不用联网、不用 Nvidia,这个结果挺实在。正文把替换掉的组件和替代方案都列清楚了,信息量够,所以放在 featured 而不是 p1。

4月19日星期日

r/LocalLLaMA

同一个 9B Qwen 模型,换套脚手架,Aider 编程得分从 19.1% 跳到 45.6%

作者拿 Qwen3.5-9B 的 Q4 量化版跑 Aider 的多语言编程基准(225 道题),只换了调用模型的外层脚手架,平均 pass@2 就从 19.11% 拉到了 45.56%。这个叫 little-coder 的脚手架不是新模型,它做了几件事:限制推理步数、加写文件前的安全锁、让模型主动扫描工作区文件,以及每轮塞一点针对性技能提示。核心观点是...

推荐理由:我会先打个折:证据确实薄,只有两次完整运行,没做消融也没换模型复现,所以别急着当结论用。但 hook 很实在——同一套 9B 权重,只靠 scaffold 设计就把 Aider 成绩翻了一倍多,说明 scaffold 和模型的匹配度可能比模型本身还关键。作者列出的四个机制(受限推理预算、拒绝覆盖已有文件的 Write guard、显式工作区发现、按轮注入小技能)也给了可复现的线索。对正在折腾本地小模型做代码 agent 的团队,这篇值得看一眼思路,但暂时别拿 45.6% 当稳定预期。

r/LocalLLaMA

实测 8 个模型当桌游主持人:27B 小模型叙事质量干翻了 405B 巨无霸

作者用 6 个固定跑团场景测了 8 个模型,让它们当桌游主持人。评分用了 8 项自动指标加 3 个 LLM 裁判打分,整轮测试只花了约 0.02 美元。最终 google/gemma-3-27b-it 以 4.33 的综合叙事分排第一。标题说 27B 赢了 405B,但正文被屏蔽了,没披露那个 405B 具体是哪个模型,也没给出完整排名。这点先别太激动...

推荐理由:这篇来自 Reddit 的个人评测,钩子够锋利——小模型在叙事质量上干翻大模型,HKR 三项全中。我把它留在 featured 而不是更高,是因为正文截断了,405B 具体是哪个模型、完整排名都没给出来,信息有缺口,先别太激动。

4月17日星期五

Hacker News 首页

实测 Claude 4.7 新分词器:技术文档的 token 消耗涨了 47%

作者用 Anthropic 的免费 token 计数接口,拿同一批内容分别喂给 Claude Opus 4.6 和 4.7,看 token 数涨了多少。7 份真实 Claude Code 用户会发的样本(包括 CLAUDE.md 文件、终端输出、代码 diff 等)加权后从 8254 个 token 涨到 10937 个,整体多了 32.5%。其中技术...

推荐理由:这篇不是官方通稿,是第三方实测,把“同价”背后的 token 膨胀算清楚了。我会先打个折:IFEval 只抽了 20 题,样本量不大,但真实文档 1.47 倍、中文日文几乎不涨这些数字对实际用量有参考价值。对用 Claude Code 的人,窗口烧得快、缓存命中变贵、限流更容易触发,这些比 IFEval 涨 5 个点更值得盯。正文没披露样本的具体内容,但加权方法和对照设置交代得够用。

新智元 · 公众号

宜信做了一个金融 Agent 的“外挂控制台”,单任务能跑 16 小时,计划下半年开源

宜信公开了一个金融 Agent 的工程方案,核心是一个叫 Harness 的控制层,让模型在 12 个会话窗口里接力干活,单个任务最长能跑 16 小时。目前自主交付率 65%,每个案子有 5 万 token 的上下文上限。他们给出的预估数据是审批提速超过 150%,单件成本降到人工的五分之一。文章说计划 2026 年下半年开源,但没给仓库地址、开源协议...

推荐理由:这篇东西我会先打个折,因为所有数据都是易鑫自己报的,仓库、许可证、可复现评测正文都没给。但它确实扔出了几个少见的量产数字:单任务跑16小时、跨12个会话、自主交付率65%,而且每单token压在5万以内,审批提速说能超150%,单均成本号称降到人工的五分之一。开源时间只提了2026年下半年,具体怎么开没说。真正值得盯的不是标题里的“更聪明”,而是他们怎么设计治理层来兜住这么长链条的Agent——这点正文有提,但细节不够。整体看,信息量够上推荐,但别当已验证的结论用。

Hacker News 首页

Qwen3.6-35B-A3B 在我笔记本上画的鹈鹕,比 Claude Opus 4.7 画的还好

Simon Willison 在他的 MacBook Pro M5 上跑了一个 20.9GB 的 Qwen3.6-35B-A3B 量化版模型,让它和 Anthropic 刚发的 Claude Opus 4.7 比画 SVG 鹈鹕。结果 Qwen 画的自行车骨架是对的,Opus 却把车架画错了,连试两次都没救回来。作者怕大家说模型厂商专门练过他的鹈鹕题,...

推荐理由:Simon Willison 自己做了个主观测试,用 Qwen3.6-35B-A3B 的量化版在笔记本上生成 SVG 鹈鹕图,然后说比 Claude Opus 4.7 画得好。他特意补了一句:这个玩笑基准跟模型整体实力的相关性,这次已经破了。所以别当通用结论看,就是个有趣的单点对比。文章给了具体配置和复现方法,信息够用,但没做系统评测,判断就挂在主观偏好上。

4月16日星期四

36 氪 · 直链

Anthropic 下周要把能找安全漏洞的 Mythos 模型拿给英国银行试用

Anthropic 计划下周通过“玻璃翼计划”,让部分英国金融机构提前用上它的 Mythos 模型。公司说这个模型很擅长识别甚至利用网络安全漏洞,所以这次不是公开发布,而是定向开放给银行。正文没披露模型的具体参数、收费方式和已有客户数量,目前能看到的信号就是一次受控的行业试用。

推荐理由:这条消息的钩子很硬——一个能找漏洞甚至可能利用漏洞的模型,先给银行看,不是全面上线,而是通过“玻璃翼计划”分阶段、只对特定机构开放。正文没披露参数、定价和具体覆盖多少家银行,所以实际影响有多大还不好说。我会先打个折:这更像一次受控分发,不是产品发布。但放在金融监管和模型安全治理的交叉点上,值得从业者盯紧后续。

Google DeepMind

Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中开放预览。

推荐理由:原文给出新语音模型的音频标签控制方式、Elo 分数与多平台开放入口,可据此判断语音生成的可控性变化。

4月13日星期一

Google DeepMind

Google DeepMind 发布 Gemini Robotics-ER 1.6 机器人推理模型

Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。

推荐理由:原文给出新模型在空间推理、多视角与仪表读数上的能力变化和开放入口,可据此判断机器人高层推理的进展。

4月12日星期日

X · @Yuchenj_UW

MiniMax 开源 M2.7,并公开了用模型自己跑研发流程的实验结果

MiniMax 把 M2.7 开源了,同时发了一篇博客讲他们怎么让模型参与自己的研发。他们做了两件事:一是搭了个研究助手 agent,帮研究员查文献、盯实验流程、看日志、改代码、提 merge request,现在能扛起 30% 到 50% 的研发工作量。二是让 M2.7 自己改自己的测试脚手架,全自动跑了 100 多轮,内部代码评测涨了 30%。博客...

推荐理由:MiniMax 把 M2.7 开源了,同时扔出一个挺敢说的数字:他们内部的研究代理已经扛了 30% 到 50% 的研发流程。具体怎么干?代理自己查文献、排实验、看日志、修代码、提合并请求,还在内部脚手架里自己改 harness,自动循环了 100 多轮,内部编码评测涨了 30%。我会先打个折——正文没披露许可证、仓库地址、基准测试上下文,也没说外部能不能复现,所以这些数字目前只能当内部说法看。但即便打对折,代理能稳定吃掉三成研发流程,这个信号也够强了。

4月10日星期五

最佳拍档

Sakana AI 开源 Shinka Evolve:让大模型自己写程序进化,用更少样本跑赢 AlphaEvolve

Sakana AI 开源了一个叫 Shinka Evolve 的框架,核心思路是让大语言模型像进化算法一样自己改代码、写新程序,不断迭代出更强的解法。它主要想解决谷歌 DeepMind 之前 AlphaEvolve 的一个痛点:太费资源,动不动就要评估上千个程序。Shinka Evolve 在经典的圆堆积问题上,用少得多的评估次数就超过了 AlphaE...

推荐理由:这篇值得 featured,但不到 P1。钩子清楚——用更少评估超越 AlphaEvolve,机制也讲得明白,比如用 UCB 老虎机在 GPT-5、Claude Sonnet 4.5、Gemini 之间动态选模,还加了程序交叉和全文件重写。对做 agent 的人来说,评估贵、任务设计和硬验证一直是头疼的事,文章直接点出系统仍需人类给题、自动发明问题和严格验证没解决,这点很实在。我会先打个折:关键指标、成本和主发布链接都没给,所以停在 80 分。

量子位 · 公众号

腾讯开源3B模型HiVG,用“分段打包”把SVG序列缩短六成,生成质量对标GPT和Claude

腾讯混元放出了一个30亿参数的开源模型HiVG,专门把图片转成SVG矢量图。它的核心思路是把绘图指令和坐标打包成“段token”,再用一个叫HMN的模块给坐标编码做初始化,让模型更懂几何关系。这样生成的SVG代码序列比传统方法短了62.7%到63.8%,省token就是省钱。在Image-to-SVG任务上,它的SSIM达到0.896、LPIPS低到0...

推荐理由:腾讯混元把 3B 小模型做到 SVG 指标能跟 GPT-5.2、Claude-4.5-Sonnet 掰手腕,靠的不是堆参数,而是把绘图命令和坐标打包成 segment token,再用 HMN 初始化坐标 embedding,序列长度直接砍掉六成多。文章给了 SSIM、LPIPS、CLIP-S 三组数,信息量够,不是空口说白话。不过 SVG 生成本身偏小众,离多数人的业务场景还有点距离,所以 novelty 和 knowledge 都到位,但 relevance 只能算一般。

4月9日星期四

量子位 · 公众号

腾讯推出MoT架构,2B参数的具身模型在22项评测里拿了16项第一

腾讯混元与Robotics X联合发布了HY-Embodied-0.5,核心是一个叫MoT-2B的模型。它总参数量4B,实际干活时只激活2B,在22项具身智能评测中拿了16项第一。训练数据量不小:用了超过1亿条具身数据、600B以上的预训练token、3000多万条中期训练样本,还引入了视觉隐空间token、双向注意力、RFT、强化学习和在线蒸馏。这模...

推荐理由:我会先打个折:这还是一次模型发布,不是那种当天就改变行业格局的大事,所以分数没拉到 85 以上。但它的钩子够强——腾讯说 MoT 比 MoE 更适合具身,而且一个激活参数只有 2B 的模型在 22 项评测里赢了 16 项,数字和训练细节也给得实在。对做端侧机器人的从业者来说,这套专门为具身重做的架构和训练链路比通用模型微调有意思得多,所以 H、K、R 都站得住。

X · @op7418(歸藏)

小扎挖的团队交卷了:Meta 发 Muse Spark,多模态推理但暂不开源

Meta 把之前挖来的团队做的第一个模型 Muse Spark 放出来了。它原生支持多模态推理,能看图、用工具、展示视觉思维链,还能让多个 Agent 并行干活。有个叫“沉思”的模式,就是协调多个 Agent 一起推理。在 Artificial Analysis 上的跑分比 Gemini 3.1 Pro、GPT-5.4 和 Claude Opus 4....

推荐理由:大厂新模型发布,加上“挖角团队首秀”的故事线,HKR 三项全中。分数卡在 featured 门槛附近,因为文章只给了能力声明和相对排名,参数规模、定价、铺开时间和访问范围都没披露,我会先打个折。

4月8日星期三

量子位 · 公众号

面壁智能、OpenBMB 和清华放出一个 2B 开源语音模型 VoxCPM 2,能说 9 种方言、30 种外语,还复刻了郭德纲的《莽撞人》贯口

VoxCPM 2 是个 20 亿参数的开源语音模型,主打低延迟和少样本复刻。官方说生成经常在 1 秒内完成,给一段 5 秒以上的参考音频就能模仿音色和风格,演示里用它念了语速极快的相声贯口《莽撞人》。技术上它没用传统的声学码本,而是走扩散自回归连续表征路线,支持去噪、LoRA 微调和全量微调。正文没披露具体的训练数据规模和硬件需求,也没给标准化的语音质...

推荐理由:面壁智能和清华 OpenBMB 放出的 VoxCPM 2 是一个 2B 开源语音模型,不是薄 demo。正文列了可复现条件:48kHz、9 种方言、30 种外语、≥5 秒参考音频、1 秒内生成,还支持降噪和 LoRA/全参微调。技术路线上走了 tokenizer-free 的扩散自回归连续表征,这点比模型尺寸更值得看。我会先打个折:正文没披露方言和外语的具体测试集与客观指标,也没给端侧实测延迟和内存占用,所以实际部署成本还要自己测。但整体信息量够,对盯中文开源语音栈的人有参考价值。

X · @Yuchenj_UW

GLM-5.1 在 SWE-Bench Pro 上跑分压过 GPT-5.4 和 Gemini 3.1 Pro,开源模型差距缩到半年

GLM-5.1 在 SWE-Bench Pro 编程基准上拿了 58.4 分,比 Opus 4.6 的 57.3、GPT-5.4 的 57.7 和 Gemini 3.1 Pro 的 54.2 都高。模型是 MIT 协议开源的,权重公开。发帖人说开源和闭源的差距现在大概只剩六个月。不过正文没交代各家模型是不是在完全一样的条件下跑的,也没提测试成本和复现细...

推荐理由:GLM-5.1 以开源权重身份在 SWE-Bench Pro 上超过三个闭源旗舰,分数差虽然不大,但够拿来讨论了。问题在于信息全来自一条推文,没给评测设置、运行成本、是否同条件对比,这些才是判断分数含金量的关键。我会先打个折,把这条当信号看,不当结论用。

4月7日星期二

Latent Space

Gemma 4 首周下载量破 200 万,本地跑模型成了新趋势

Google 的 Gemma 4 上线第一周就冲到约 200 万次下载。做个对比:Gemma 3 过去一年总共 670 万次,Gemma 2 从 2024 年 6 月到现在 140 万次,而 Qwen 3.5 在大约一个半月里拿了约 2700 万次。这次最值得关注的是本地部署的速度——有人用 iPhone 17 Pro 跑 Gemma 4 E2B,通过...

推荐理由:这条消息的看点不是 Google 又发了个模型,而是首周 200 万下载这个数字本身,以及它和 Qwen 3.5 一个半月 2700 万的对比——开源模型的采用速度在明显变快。更实在的是有人已经在 iPhone 上跑出 40 tok/s,这对做端侧部署的人来说是个可参考的实测数据,不是公关稿里的理论值。我会先打个折:下载量不等于日活,正文也没披露留存或实际调用量,所以别直接当成市场份额来看。但生态支持列得挺全,至少说明主流推理框架没掉队,这点对选型有帮助。

4月3日星期五

X · @dotey(宝玉)

Google 发布 Gemma 4 开源模型家族,全系改用 Apache 2.0 协议

Google 把 Gemma 4 全系列换成了 Apache 2.0 协议,商用、修改、分发不再受限,之前自家协议里的灰色地带这次清掉了。系列包含四个尺寸:31B Dense、26B MoE(混合专家架构)、E4B 和 E2B。31B 在 Arena AI 开源模型文本榜排第三,26B 排第六,Google 说它们表现超过体量大 20 倍的模型。大模型...

推荐理由:这次发布的分量,许可证变更和模型规格差不多重。Apache 2.0 意味着小公司和独立开发者可以放心拿来改、拿来商用,不用再为法律条款头疼。四个尺寸里,31B 能跑在单张 H100 上,26B 是 MoE 架构,推理成本会更低,这两点对实际部署的人比跑分更有吸引力。原生支持函数调用和 JSON 输出,摆明了是冲着让模型直接进业务流程干活去的。正文没给详细评测链接和横向对比数据,所以先别急着说它性能碾压谁,但就开放程度和工程友好度来说,这波更新挺实在。

Google DeepMind

Google DeepMind 发布 Gemma 4 开源模型家族

Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,31B 在 Arena AI 文本榜位列全球开源模型第 3,26B 位列第 6。

推荐理由:Gemma 4 以 Apache 2.0 开源并覆盖端侧到工作站四种尺寸,可据此判断开源模型的部署与微调选择。

3月31日星期二

MIT Technology Review · AI

AI跑分这套玩法已经失灵了,我们得换个法子

作者直接点明:现在给AI打分的基准测试,和实际用起来的场景完全是两码事。那些98%准确率的漂亮分数,一旦塞进医院放射科这种需要多科室会诊、标准随时变动的真实流程里,反而会拖慢工作节奏。她研究了2022年以来英美亚多个行业的AI落地情况,提出一套叫HAIC的评估思路,核心是看AI在团队协作、长时间工作流里的表现,而不是单次答题。文章举了一个英国医院202...

推荐理由:这篇文章不是模型发布或技术报告,是一篇观点犀利的评论。我会先打个折:它没有给出可跑的 HAIC 测试集,但它的价值在于把“评测坏了”这个共识讲透,并给出四个具体改造方向——盯协调质量、盯错误能不能被发现、盯上下游后果,而不是盯着一个漂亮数字。两个长期案例让论点站得住,对正在搭内部评测体系的团队有直接参考意义。

3月24日星期二

Mistral AI

Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。

推荐理由:原文给出 4B 参数、9 种语言、70ms 延迟与定价,读者可据此判断企业语音智能体的成本与选型空间。

3月17日星期二

Mistral AI

Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

Mistral AI 发布 Mistral Small 4,这是首个把 Magistral 推理、Pixtral 多模态和 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。

推荐理由:Mistral Small 4 把推理、多模态与编码智能体合并进单一开源模型,可据此判断统一模型对部署成本的影响。

2月12日星期四

阮一峰的网络日志

阮一峰实测智谱 GLM-5:跟 Claude Opus 4.6、GPT-5.3-Codex 比编程,互有胜负

阮一峰拿四个编程任务对比了 GLM-5、Claude Opus 4.6 和 GPT-5.3-Codex。网页设计上 GLM-5 和 Opus 4.6 都挺好看,GPT-5.3 页眉没粘住往下拉就没了;3D 太阳系沙盒都能跑,但 GLM-5 缺了引力网格线,Opus 4.6 动画效果最好;愤怒的小鸟游戏 Opus 4.6 还原度最高,GLM-5 能玩但弹...

推荐理由:这篇文章靠单人实测和视频对比撑起来,不是标准化基准测试,所以我会先打个折。但它给了 4 个具体任务和明确的时间差,对正在挑编程模型的团队有直接参考价值。正文没披露 GLM-5 的规模、训练成本或更多样本量,这点先别太激动。整体看,它把一个国产旗舰拉到和两款闭源顶配同场比较,信息密度和时效性都够,放在 featured 档合理。

2月10日星期二

36 氪 · 直链

阿里千问发布 Qwen-Image-2.0,一个图像生成基础模型,已开放 API 邀测

千问推出了新一代图像生成基础模型 Qwen-Image-2.0。现在可以在阿里云百炼上申请 API 测试,也能在 Qwen Chat 上免费试用。不过正文没披露模型参数量、具体定价、评测跑分和正式公开时间,所以实际效果和成本还不好判断。

推荐理由:千问发了个新的图像生成基础模型,百炼 API 邀测和 Qwen Chat 免费体验都开了,HKR 三项全中:有实际可用的产品信号、有明确的接入路径、对国内模型用户有直接参考价值。没给到 78 分以上是因为正文缺了模型大小、价格这些关键信息,我会先打个折。

2月6日星期五

TechCrunch · AI

OpenAI 和 Anthropic 在同一天抢着发布能自己干活的编程模型,前后只差几分钟

OpenAI 推出了 GPT-5.3 Codex,一个专门给自家编程工具 Codex 用的新模型。按 OpenAI 的说法,这个模型让 Codex 从“能写代码、审代码”升级到“几乎能替开发者在电脑上干所有事”,甚至能在几天内从零做出功能复杂的游戏和应用。速度比上一代 GPT-5.2 快了 25%,而且 OpenAI 说这是第一个“自己参与造自己”的模...

推荐理由:这条消息的看点全在时间差——OpenAI 在 Anthropic 发布后几分钟就甩出自己的代理式编码模型,说明两边在让模型进开发流程这件事上咬得很紧。但正文能用的信息太少:没模型名、没跑分、没价格、没上下文窗口、也没说谁能用,只提了一嘴跟 Codex 有关。所以我会先打个折,重要性给到 75、放在 featured 低位,因为话题热度够,但证据太薄,暂时没法判断性能或性价比。