跳到正文

#部署/工程

今日 3 条

5月21日星期四

The Verge · AI

SpaceX IPO 文件曝光:Anthropic 每月花 12.5 亿美元租用马斯克的数据中心,一年就是 150 亿

SpaceX 在 S-1 上市申请里写明了这笔交易的价码:Anthropic 每月要付 12.5 亿美元,一直付到 2029 年 5 月,用来使用位于孟菲斯的 Colossus I 和 Colossus II 两座 AI 训练中心。一年算下来就是 150 亿美元,这个数字快赶上 SpaceX 2025 年全年 187 亿美元收入的两倍了。合同里还藏了一...

推荐理由:我会先打个折:150 亿美元是年化数字,实际是按月付 12.5 亿,合同到 2029 年 5 月。但即便这样,这笔钱也大到离谱,相当于 Anthropic 把训练算力的命脉交到了马斯克手里。S-1 文件是 SpaceX 上市披露,可信度没问题。正文没披露 Anthropic 具体拿多少 GPU、训练什么模型,但 Colossus I 和 II 是孟菲斯新建的超大规模训练中心,说明 Anthropic 在算力上下了重注。这点先别太激动,合同细节比如是否有退出条款、算力规格都没说,但光这个金额和合作方组合,就值得今天写。

r/LocalLLaMA

腾讯发布 Hy-MT2 翻译模型,覆盖 33 种语言,最小 1.8B 版压缩后仅 440MB

腾讯放出了 Hy-MT2 系列翻译模型,有 1.8B、7B 和 30B-A3B 三个尺寸,支持 33 种语言互译。1.8B 小模型用上 AngelSlim 1.25-bit 量化后,存储占用压到 440MB,推理速度还快了 1.5 倍,适合本地跑。不过 Reddit 原帖被屏蔽了,正文没披露具体翻译质量评测和更多技术细节,这点先别太激动。

推荐理由:我会先打个折:Reddit 信源比较散,所以分数没再往上拉。但 440MB 这个数字太直观了,比单纯列三个模型尺寸更有传播力,从业者一眼就能算出部署成本。正文没披露量化后的翻译质量损失,这点先别太激动,但“小模型干翻译”这个方向本身值得关注。

AI HOT 精选

腾讯开源 Hy-MT2 翻译模型,1.8B 小版量化后 440MB 就能在手机上跑,性能还超了微软商业 API

腾讯放出了 Hy-MT2 多语言翻译模型,支持 33 种语言互译。7B 和 30B-A3B 两个版本在开源模型里翻译质量最好,比很多参数大几十倍的模型还强。更实用的是 1.8B 轻量版,用 AngelSlim 1.25-bit 量化技术把体积压到 440MB,主流手机芯片就能本地跑,推理速度比上一代快 1.5 倍。官方说这个轻量版性能超过了微软等商业翻...

推荐理由:腾讯这次放出的Hy-MT2,最抓人的点是1.8B模型经1.25-bit量化后只有440MB,能在主流手机芯片上本地跑33种语言互译。这对移动端开发者来说,意味着离线翻译、隐私保护和零服务端成本都有了现成方案。我会先打个折:正文没披露翻译质量基准、实际延迟和开源协议,所以没法判断它在真实场景里到底多能打。但光凭这个体积和语言覆盖,已经是个值得关注的端侧AI信号,只是离旗舰级发布还差一口气。

Latent Space

OpenAI 用通用推理模型花不到 1000 美元,推翻了一个 80 年前的数学猜想

OpenAI 公布了一个内部通用推理模型(外界猜是 GPT 5.6)的成果:它找到了平面单位距离问题的新构造族,推翻了 1946 年 Erdős 提出的一个猜想。这个模型不是专门为数学训练的,就是普通的语言模型,但推理过程生成了约 125 页的总结。有外部观察者推测,这次运行只用了不到 32 小时,成本不到 1000 美元。数学家 Timothy Go...

推荐理由:HKR 三项都成立:一个内部推理模型声称驳倒了 1946 年的 Erdős 问题,输出约 125 页,这是很强的能力信号。不过成本和运行时间目前还是外部推测,正文没披露 OpenAI 自己的官方数字,所以分数没给到 95。

机器之心 · 公众号

VAST 和清华搞了个新方法,让 3D 生成把算力花在刀刃上,高斯点数量砍半画质还能打

这篇论文正文被微信环境验证挡住了,看不到具体技术细节。从标题和已知信息看,他们提出了一种叫 DeG 的 3D 生成方法,核心思路是让模型自己学会在物体细节丰富的地方多放高斯点、在平坦区域少放点,而不是均匀撒点。这样能用不到一半的高斯点数量,达到跟 TRELLIS 差不多的画面质量。相当于用更少的算力跑出同级别的 3D 模型,对做实时渲染或者要在手机上跑...

推荐理由:我会先打个折:正文只说了“部分场景”达到 TRELLIS 相近画质,没给全量对比,所以别直接当成全面超越。但 DeG 这套密度控制方法确实把“算力花在刀刃上”落到了具体机制里——用渲染损失梯度去学哪里该多放高斯球、哪里该省,比均匀撒点聪明。SIGGRAPH 论文本身有一定技术门槛,不过对做 3D 生成的人,这个效率提升方向值得跟。

机器之心 · 公众号

智谱在千卡集群部署 ZCube,同样 GPU 推理吞吐提升超 15%

智谱把自研的 ZCube 通信方案用到了 GLM-5.1 的线上推理集群里,规模是千卡级别。它替换了原来的 ROFT 组网方式,但没动 GPU、软件栈和业务代码。效果上,吞吐量提升了超过 15%,首 token 延迟的 P99 下降了 40.6%,交换机加光模块的成本省了三分之一。正文没披露具体是怎么做到省硬件成本的,也没给更细的测试条件,所以这个 1...

推荐理由:智谱在 GLM-5.1 千卡推理集群上部署 ZCube,不增 GPU、不改代码就把吞吐提了 15%,首 token 延迟的 P99 降了 40.6%。这是纯工程层面的组网逻辑改动,不是模型能力升级,所以重要性给 81、放在 featured 里比较合适——对搞推理部署的人有用,但不会像新模型发布那样震动整个行业。

彭博科技

Anthropic 要在三年内付给 SpaceX 近 450 亿美元,买算力跑 Claude

根据一份证券文件,Anthropic 跟马斯克的 SpaceX 签了份大单:未来三年支付差不多 450 亿美元,换取计算资源来支撑它的 Claude 模型。这笔钱摊下来每年约 150 亿美元,说明头部 AI 公司抢算力的成本已经拉到天文数字级别。不过正文被 Bloomberg 的机器人验证挡住了,具体是租 GPU 还是包数据中心、交付节奏和退出条款都没披露。

推荐理由:我会先打个折:450 亿美元是三年总承诺,不是一次性付款,但数字大到足以让任何 AI 公司重新算账。Anthropic 把算力押在 SpaceX 身上,说明它不想只靠 AWS 或 Google Cloud,分散供应商是明牌。不过正文没披露具体算力规格、交付时间表,也没说 SpaceX 的算力基础设施到底建到什么程度,这点先别太激动。Bloomberg 拿证券文件报出来,可信度比 PR 稿高,值得写。

TechCrunch · AI

Anthropic 每月要付给 xAI 12.5 亿美元买算力

Anthropic 租下了 xAI 在孟菲斯 Colossus 1 数据中心的全部算力,每月账单 12.5 亿美元,合同签到 2029 年 5 月。头两个月有折扣,因为 xAI 那边还在爬坡。这笔钱来自 SpaceX 的上市文件,xAI 自己说这是在把闲置算力变现。说白了,Grok 用户量最近掉得厉害,服务器空出来了,正好租给竞争对手回血。不过正文没披...

推荐理由:TechCrunch 爆出 Anthropic 每月要给 xAI 付 12.5 亿美元买算力,对手方和价格都挺意外。正文只给了金额,没写买了多少卡、签了多久、跑在什么环境里,所以信息缺口不小。我会先打个折:金额够大,但缺关键细节,没法给到 90 分以上。

r/LocalLLaMA

Cohere 联合创始人亲自回应:Command A+ 是他们第一个 MoE 开源模型,主打在 1-2 张 GPU 上跑得动

Cohere 的 Nick Frosst 在 Reddit 上发帖,正式推出了 Command A+。这是他们第一个混合专家(MoE)模型,用 Apache 2.0 协议开源。帖子里说,这个模型最大的卖点是效率,做了很极限的量化工作,在 1 到 2 张消费级 GPU 上就能跑得很流畅,对个人开发者和小团队比较友好。不过他也直说,模型的顶尖性能还有待打磨...

推荐理由:我会先打个折:正文没披露参数量、基准测试成绩和上下文窗口,这些关键指标全缺,所以重要性只能给到 74。亮点是 Cohere 终于把 Command-A 这条线捡起来,换成 MoE 架构还给了 Apache 2.0,量化后能在 1 或 2 张 GPU 上跑,对想自己部署的人是个实在消息。但信源只有 Reddit 讨论,没有官方技术报告或实测数据,这点先别太激动。

彭博科技

英伟达上季度每股赚 1.87 美元,超预期,下季度营收指引 910 亿

英伟达刚发了 2026 财年第一季度的财报,每股收益 1.87 美元,比华尔街预期的 1.77 美元高出一截。公司对截至 7 月的当季营收指引是 910 亿美元,也明显高于市场预估的 874 亿左右。这条视频本身是彭博的报道片段,正文没披露各业务线的具体表现和毛利率细节,所以没法判断增长是数据中心业务继续拉动的,还是有别的板块在补位。

推荐理由:Nvidia 财报是观察 AI 基础设施热度的关键节点,910 亿的指引给 HKR 三项都提供了实打实的信号。这不是模型或功能发布,所以放在 featured 档位没问题,信息质量够硬。

AI HOT 精选

英伟达一季度净利润 583 亿美元,同比涨了 211%,数据中心收入占了大头

英伟达 2027 财年第一财季(截止到 2026 年 4 月 26 日)总收入 816.15 亿美元,净利润 583.21 亿美元,同比直接翻了两倍多。增长主要靠数据中心业务,单这一块就进账 752 亿美元,同比涨了 92%。毛利率也拉到了 75% 左右,比去年同期高了 14 个百分点。公司预计下个季度收入能到 910 亿美元,上下浮动 2%。另外,董...

推荐理由:英伟达这份财报就是AI基础设施景气度的温度计。数据中心752亿美元的收入说明大厂还在疯狂囤卡,211%的利润增速比很多AI公司的营收涨得还快。我会先打个折:这是财务数据,不是新模型或新功能发布,所以重要性停在82分。但数字本身已经足够让关注算力成本和供应链的人必须看一眼。

AI HOT 精选

Meta裁掉8000人,再把7000人转去做AI

Meta这次不是单纯砍成本,而是把人力往AI方向挪。计划裁掉约8000个岗位,同时把约7000名员工调到AI相关职位,资源集中砸在AI基础设施、基础模型开发和商业化上,想打通从模型训练、产品落地到赚钱的整条链路。

推荐理由:我会先打个折:正文没披露具体时间表和官方确认文件,所以别当正式公告看。但信息量够硬——8000人裁撤、7000人转AI岗,资源明确砸向基础设施、基础模型和商业化,说明Meta不是在喊口号,是真在把人力往AI链条上搬。对从业者来说,这比单纯裁员数字更有信号意义:AI岗位在涨,非AI岗位在缩,职业迁移的压力很具体。因为缺官方背书,分数压在82,但话题性和信息密度都撑得起featured。

AI HOT 精选

Perplexity 上线查询感知压缩,上下文 token 最多砍掉 70% 但回答质量反而更好

Perplexity 把一项叫“查询感知压缩”的技术用到了线上。它能在搜索时把喂给模型的上下文 token 最多减少 70%,同时回答质量还提升了。核心逻辑是“更好的上下文优于更多的上下文”,也就是先理解你问什么,再挑最相关的信息塞进窗口,而不是一股脑全丢进去。正文没披露具体测试基准和压缩方法细节,所以实际效果我会先打个折,但能省下这么多 token ...

推荐理由:我会先打个折:正文只给了一条 X 帖子,没放基准测试和可复现的设置,所以别太激动。但这条信息本身够硬——Perplexity 在生产环境用查询感知压缩,最多砍掉 70% 上下文令牌,同时回答质量还变好了。对搞外挂资料库和搜索优化的从业者来说,这直接关系到省钱和降延迟,值得看一眼。

5月20日星期三

阿里技术 · 公众号

阿里平头哥发布真武 M890 AI 芯片,128 卡超节点服务器已在百炼平台上线

阿里平头哥的真武 M890 AI 芯片首次公开,主打 Agent 场景的算力底座。配套的 128 卡超节点服务器,卡间直连延迟低于 150 纳秒,机架带宽达到 Pb/s 级别。这套硬件已经在阿里云百炼平台跑起来了,支持通义千问、DeepSeek 和 Kimi 等模型。不过正文因为环境验证问题没加载出来,具体的芯片架构、制程、显存规格和实测性能数据暂时看...

推荐理由:HKR三项都踩中了,但得先打个折——消息源是阿里自己的技术文章,没有第三方实测、没提定价、也没说量产规模。所以分数就卡在featured门槛上,当个基础设施产品更新看比较合适。

新智元 · 公众号

摩尔线程 MUSA 生态更新:SDK 对齐 CUDA 12.8,SGLang 主线已合并

摩尔线程放出了自家 GPU 生态 MUSA 的最新进展。SDK 5.1.0 把兼容目标拉到了 CUDA 12.8,覆盖了 761 个驱动和运行时接口,意思是跑 CUDA 代码时能认的指令更多了。推理框架 SGLang 的主线代码已经合并了 MUSA 的支持,硬件支持排期在 2026 年第二季度。另外还提了一个叫 MUSACODE 的工具,能自动把库迁移...

推荐理由:我会先打个折:这还是一家厂商的生态更新,不是整个国产 GPU 阵营的集体突破。但文章把兼容 API 数量、SDK 版本对标和 SGLang 主线合入这几个点都摆出来了,比空谈“替代 CUDA”实在。老黄喝豆汁的梗让标题有了传播力,内文也没写成公关稿,对关注推理部署和算力自主的读者来说值得一看。

r/LocalLLaMA

用 4 张老 RTX 2080 Ti 在本地跑 DeepSeek-V4,预填充跑到 255 token/s

一个 Reddit 用户用 4 张 RTX 2080 Ti 显卡(总预算不到 2500 美元)在本地跑起了 DeepSeek-V4-Flash 模型。模型总参数 2840 亿,每次推理激活 130 亿参数。他用了 W8A8 量化(把权重和激活值都压到 8 位精度)来省显存,还自己写了适配老 Turing 架构的 CUDA 算子。机器配了 1TB 的 D...

推荐理由:一个 Reddit 用户用 4 块二手 RTX 2080 Ti 搭了一套不到 2500 美元的机器,跑 DeepSeek-V4-Flash(284B 参数,每次推理只激活 13B),通过 W8A8 量化和自己写的 Turing 内核优化,prefill 阶段跑到约 255 tok/s。我会先打个折:这是单用户自报数据,没有第三方复现,也没披露并发、上下文长度和 decode 阶段的吞吐,所以别直接当采购依据。但亮点在于它证明了老卡在量化+定制内核下还能打,对预算有限的团队是个有参考价值的思路。正文没提功耗和稳定性,这两点在实际部署里很关键。

AI HOT 精选

大模型 API 的补贴期结束了,三家厂商开始涨价

Tomasz Tunguz 对比了 Google、OpenAI 和 Anthropic 三家最新旗舰模型的 API 定价,发现补贴正在退潮。Google Gemini 3.1 Pro 最便宜,输入每百万 token 2 美元、输出 12 美元;OpenAI GPT-5.5 短暂补贴后涨到输入 5 美元、输出 30 美元;Anthropic Claude...

推荐理由:Tom Tunguz 这篇是定价评论,不是模型首发新闻,但三家旗舰模型的价格摆在一起,差距够大,对从业者选型有参考价值。我会先打个折,给 featured 而不是 must-write,因为正文没披露补贴具体怎么算、能撑多久,判断还缺一手数据。

AI HOT 精选

Gemini 3.5 Flash 发布:价格涨了,但谷歌打算把它塞进所有产品里

谷歌在 I/O 大会上直接发布了 Gemini 3.5 Flash,跳过预览阶段。输入价格涨到每百万 token 1.5 美元,输出 9 美元,分别是上一代 Flash 预览版的 3 倍和 Flash-Lite 的 6 倍,已经快追上自家的 Pro 型号了。涨价不是谷歌一家的事,OpenAI 和 Anthropic 的新模型也都在提价,各家似乎都在试探...

推荐理由:我会先打个折:正文只给了价格和全面铺开的意图,没提能力提升、跑分或上下文窗口,所以没法判断涨得值不值。但涨价幅度本身对开发者是硬信号,值得放进精选。

AI HOT 精选

OpenAI 卖算力期货:交钱锁定长期 GPU,正文没写价格和最低消费

OpenAI 上线 Guaranteed Capacity 服务,让客户提前锁定长期算力,避免高峰期排队。官方说法是帮企业在算力紧张时也能跑关键任务。但公告没披露价格、合同年限、最低配额,也没说锁的是哪种 GPU。我会先打个折——这更像给大客户吃定心丸,小团队暂时不用激动。

推荐理由:我会先打个折:正文没给价格、期限和容量配额,所以现在只能知道 OpenAI 开始卖算力预留,但不知道划不划算。H 来自 OpenAI 把算力稀缺变成一种可预订的服务,对 API 用户是个实在的钩子。K 只到产品名和规划机制这一步,缺关键商业细节。R 踩中了生产可靠性和预算规划这两个痛点,所以能进 featured,但信息缺口把分数压在中段。

AI HOT 精选

Google 把 Tensor 芯片的 AI 能力开放给开发者,Pixel 10 手机上的 TPU 现在可以直接跑模型了

Google 发布了 Tensor ML SDK 的公开测试版,开发者现在能把 PyTorch 或 TFLite 模型转换、编译后,直接调用 Pixel 10 系列手机里的 TPU 芯片来跑推理。整个流程通过 LiteRT 这个统一框架完成,不用再分别对接底层硬件驱动。官方还提供了一个模型库,里面有超过 100 个现成的经典模型和生成式 AI 模型,包...

推荐理由:HKR-K 很扎实:文章给出了 Pixel 10 TPU 上的具体工作流和一个 100+ 模型库。H 和 R 也够得上 featured,但这是个测试版开发者 SDK,不是旗舰模型或面向大众的产品发布,所以我会先打个折。

r/LocalLLaMA

英伟达放出 Nemotron-Labs-Diffusion 模型,用扩散解码把 8B 模型跑到 850 tok/s

英伟达发了 Nemotron-Labs-Diffusion 系列,包含 3B、8B 和 14B 三个稠密模型。这组模型同时支持传统的自回归解码和新的扩散并行解码,还带了一种叫 self-speculation 的加速技巧。最抓眼球的是 8B 版本在 GB200 上单并发能跑到每秒 850 个 token,作为对比,同样条件下自回归解码是 253 tok...

推荐理由:NVIDIA 这次没走自回归老路,拿扩散模型做了三个稠密 LLM,最小的 3B,最大的 14B。我会先打个折:目前只有 Reddit 帖子当信源,没有论文或技术报告,所以 850 tok/s 这个数先别太激动,正文没披露具体测试条件和 batch size。但方向本身有意思——扩散并行解码加上 self-speculation,理论上可以一次出多个 token,不用像自回归那样一个字一个字往外蹦,推理延迟能压下去。8B 模型在 GB200 上跑出这个速度,如果属实,对本地跑模型、做实时对话的人挺省钱。信息缺口也明显:没提训练数据、没提多语言能力、没...

AI HOT 精选

Gemini 3.5 Flash 发布,跑分超 3.1 Pro,生成速度是其他顶尖模型的 4 倍

Google 在 I/O 后开放了 Gemini 3.5 Flash,产品端和 API 都能用。官方说它在多数基准测试上比 3.1 Pro 强,编程能力提升明显,每秒吐 token 的速度是其他前沿模型的 4 倍。不过帖子没给具体跑分数字和测试条件,这点先别太激动。

推荐理由:Google 在 I/O 后放出了 Gemini 3.5 Flash,产品和 API 都能用。最抢眼的数字是每秒吐 token 的速度是其他前沿模型的 4 倍——我会先打个折,因为正文没披露跟哪些模型比、在什么条件下测的,也没给价格和上下文窗口。这点先别太激动,但速度翻几倍对降低延迟和成本确实有用,所以这条消息值得从业者看一眼。

AI HOT 精选

谷歌发布 Gemini 3.5 Flash,输出速度跑到每秒 289 个 token,是 GPT-5.5 的四倍

谷歌在 I/O 大会上推出了 Gemini 3.5 Flash,官方说它在很多基准测试里比自家 3.1 Pro 强。最直观的卖点是快:输出速度达到每秒 289 个 token,对比的是 Claude Opus 4.7 和 GPT-5.5 xhigh,快了大约四倍。谷歌内部还用 Antigravity 工具做了个实验,让 93 个子智能体协作,12 小时...

推荐理由:谷歌在 I/O 上扔了个速度炸弹:Gemini 3.5 Flash 每秒吐 289 个 token,号称是 GPT-5.5 xhigh 和 Claude Opus 4.7 的四倍。这个数字对做应用的人很直观——响应更快、排队更短、按 token 算钱可能也更省。不过正文没提价格、上下文窗口多大、以及能力上限在哪,所以先别把它当成全面碾压,目前就是个单项速度领先。

r/LocalLLaMA

KV 缓存量化实测:TurboQuant 被高估,q5 值得多看两眼,对称 q8 可能白占显存

Anbeeld 用一张 RTX 3090 跑 Qwen 3.6 27B,在 64k 和 128k 上下文长度下测了 KV 缓存量化。先说结论:q4_0 在尾部 token 上的 KLD 比 q5_0 差了 32%,精度掉得明显;turbo4 比普通 q4_0 还慢 17%,显存却没省下多少,有点名不副实。q5_0 在精度和压缩率之间平衡得不错,但正文没...

推荐理由:我会先打个折:这篇测试只跑了一张 RTX 3090 和一个模型,结论不能直接套到其他卡或模型上。但它的好处是给了具体数字,比如 q4_0 在长上下文时尾部偏差比 q5_0 高 32%,turbo4 反而比 q4_0 慢 17%,对称 q8 可能白占显存。这些发现对玩本地推理的人有参考价值,不是泛泛而谈的评测。正文没披露更多硬件或复现细节,所以先别太激动,但作为社区一手数据,值得推给关注推理优化的人看一眼。

AI HOT 精选

谷歌发布 Antigravity 2.0,用 93 个并行子智能体 12 小时搭出一个操作系统

谷歌在 I/O 大会上放出了 Antigravity 2.0 平台,已经对全球用户开放。现场演示里,他们让智能体从零构建了一个能跑起来的操作系统,只用了 12 小时。具体做法是同时跑 93 个子智能体,总共调了超过 1.5 万次模型、处理了 26 亿个 token,最后算下来 API 成本不到 1000 美元。平台本身集成了新的智能体系统和自然语音交互...

推荐理由:谷歌在 I/O 上放了个 Antigravity 2.0 的演示,让智能体用 12 小时、93 个并行子智能体、1.5 万次模型调用和 26 亿 token 搭出一个能跑的操作系统,API 成本不到 1000 美元。我会先打个折:这是发布会演示,不是可复现的公开测试,正文没披露可用性、定价和复现条件,所以别直接当成采购依据。但数字本身挺实在,12 小时和不到 1000 美元这两个数,对想用智能体做复杂工程的人是个参考锚点。标题够抓人,信息量也足,从业者会想点进去看细节,整体值得推。

AI HOT 精选

Gemini 3.5 Flash 发布,主打快速高效跑任务

Google 推出了 Gemini 3.5 Flash,官方说法是它在快速、高效完成任务上目前最强。定位是处理日常任务和多步骤创意项目,强调能应对现实世界的复杂情况。不过正文没披露价格、上下文窗口大小、跑分成绩和 API 可用条件,这些关键信息得等后续公布。

推荐理由:H 和 R 都过,因为这是 Google 新发的 Flash 模型,天然跟推理成本和延迟绑在一起。K 没过:正文没给价格、上下文窗口、基准分数,也没说 API 什么时候能用、有什么条件,所以分数只能压在 78–84 这个区间。我会先打个折,等具体数字出来再重新判断。

r/LocalLLaMA

6GB 显卡跑本地会议纪要的下限测试:Qwen3.5 0.8B 用 57 秒出结果,Granite 4 350M 快但会瞎编

一位用户在 RTX 3060 笔记本(6GB 显存)上拿 VoiceFlow 1.6.0 测了两款小模型,看谁能在本地把一段 4 分钟的会议转成纪要。Qwen3.5 0.8B 在 16K 上下文窗口下花了 57 秒完成总结,结果可用。Granite 4 350M 速度很快,0.6 到 2.8 秒就出稿,但会凭空捏造内容,比如编出币安和《星际迷航》的情节...

推荐理由:一个 Reddit 用户拿笔记本 3060 6GB 跑 VoiceFlow 1.6.0 做会议总结,Qwen3.5 0.8B 用 57 秒处理 4 分钟录音,Granite 4 350M 虽然快到 0.6-2.8 秒但会凭空编造内容。我会先打个折,这是单人单卡的一次性测试,不是系统评测,但 6GB 这个门槛和幻觉案例对想本地跑会议总结的人有直接参考价值,所以给 73 分 featured。

AI HOT 精选

NVIDIA 开源 LongLive 2.0,用 4-bit 量化把长视频生成跑进实时

NVIDIA 把 LongLive 2.0 整套训练和推理代码都放出来了,主打 FP4 量化加并行加速,在 50 亿参数的模型上能跑到每秒 45.7 帧,比很多短视频方案还快。它支持真实视频训练、蒸馏、多镜头生成、序列并行、KV 缓存优化和异步解码部署,专门解决以前长视频生成要么慢到没法用、要么只能做几秒片段的毛病。正文没披露具体显存占用和最长能生成多...

推荐理由:NVIDIA 研究员把 LongLive 2.0 完整开源了,不是只放个模型权重,而是给了训练加推理的全套工具。核心是把视频生成模型压到 4-bit 精度,在 50 亿参数规模下能跑到每秒 45.7 帧,这个速度意味着单卡就能玩长视频生成,不用堆机器。我会先打个折:论文里没看到跟 8-bit 或全精度方案的画质对比,所以省显存是实锤,画质掉多少还不清楚。但作为第一个把 4-bit 量化铺到长视频训练推理全流程的开源项目,对想低成本跑视频生成的人来说,值得立刻翻代码。

5月19日星期二

Hacker News 首页

Forge 给开源小模型加了五层护栏,把智能体任务准确率从 53% 拉到 99%

Forge 是一个 Python 框架,专门给自部署的大模型做工具调用和多步骤智能体流程。它给 Ministral 8B 这个开源小模型套了五层护栏,在 18 个多步骤智能体场景里把任务成功率从 53% 直接提到 99.3%。作者说这背后有篇被 ACM CAIS ’26 录用的论文撑腰,覆盖了 97 种模型和后端组合,每个场景跑了 50 次。不过正文没...

推荐理由:我会先打个折:这是单篇 Show HN 和 GitHub 仓库的展示,还没看到第三方复现或更严苛的对抗测试,所以别直接当生产保证。但它的价值很实在——用 5 层护栏把 Ministral 8B 在代理任务上的表现从不及格拉到接近满分,覆盖了 97 种配置,对想在自己服务器上跑小模型做工具调用的团队来说,省钱的想象空间很大。正文没披露护栏本身会引入多少额外延迟和计算开销,这点先别太激动。

AI HOT 精选

地平线开源了 4 亿参数的机器人控制模型 HoloMotion-1,能跳舞、搬箱子,端侧跑到 300 帧

地平线机器人实验室把一个人形机器人全身控制模型 HoloMotion-1 开源了,参数规模 4 亿,他们管它叫“机器人小脑”。这个模型用了 MoE 稀疏激活和 KV-cache 推理,把单步推理开销压下来,在端侧能跑到约 300FPS,比常见的 50Hz 控制频率高出一大截。训练数据来源比较杂,包括互联网视频、光学动捕、VR 遥操作和惯性动捕,经过统一...

推荐理由:HoloMotion-1 是一个开源机器人控制模型,4 亿参数能在端侧跑到约 300FPS,对做具身智能的团队来说是个可复现的参考。不过目前只看到动作生成能力,正文没披露在真实机器人上的成功率或延迟数据,实际部署效果还得等后续验证。整体偏技术发布,影响力集中在机器人圈子,放在 featured 档位合适。

Latent Space

想进顶尖 AI 实验室做预训练?先学会写一个比官方库还快的 GPU 内核

Vlad Feinberg 写了一篇求职笔记,把进前沿实验室的门槛讲得很直白:核心能力是底层性能调优,也就是能动手改内核(kernel),让模型训练真的跑得动。他给了一道具体的面试题——先推导 Chinchilla 缩放定律,并比较它在稠密模型和 MoE(混合专家)架构下的区别;然后用 JAX 从零实现,最后写一个 Pallas 内核,要求在专家维度 ...

推荐理由:这篇文章把“进前沿实验室做预训练”拆成了可操作的技能清单:手写 JAX 内核、自己推一遍 Chinchilla 定律、用 Pallas 给 MoE 的 up/down 投影做融合。我会先打个折——正文没披露这些建议是 Vlad Feinberg 的个人经验还是 Google 的普遍要求,也没说这些技能在面试里占多大权重。但光是这份清单本身,对想往预训练方向走的人就有参考价值,尤其是把“懂缩放定律”从一句空话落到“自己推导过”这个动作上。

量子位 · 公众号

摩尔线程发布国产全栈具身智能仿真平台,机器狗“小飞”全程在自家 GPU 上完成训练

摩尔线程推出了 MT Lambda 仿真平台,把物理引擎、渲染和 AI 模型训练整合到一起,用自家的 GPU 跑通了从模拟到真机的完整流程。现场演示的机器狗“小飞”在仿真里学会走路后,直接迁移到实物上就能跑。不过正文因为需要验证码没能完整抓取,具体的技术参数、训练时长和成功率数据都没披露,这点先别太激动。

推荐理由:我会先打个折:性能、定价、开放方式和第三方验证正文都没给,所以重要性只能停在 featured 低位。但这条消息本身信息量够——摩尔线程拿出的是一个国产 GPU 驱动的具身仿真方案,不是纯软件缝合,而且用机器狗“小飞”做了 100% 仿真训练到真机迁移的 demo,说明链路至少跑通了。对国内做机器人、做仿真的人来说,这相当于多了一个可能绕开 NVIDIA 生态的选项,哪怕现在还很早期,也值得标记一下。

量子位 · 公众号

Odyssey 放出 Agora-1 世界模型,能四个人同时在线打 FPS,比李飞飞团队还快一步

Odyssey 发布了一个叫 Agora-1 的世界模型,主打实时生成可玩的 FPS 场景,最多支持四个真人或 AI 玩家在同一张图里对战。它把物理模拟和画面渲染拆开跑,训练数据用的是《黄金眼》游戏内部状态,不是单纯看视频学样子。正文没披露具体延迟和硬件成本,所以实际跑起来卡不卡、贵不贵还不清楚。我会先打个折:多人联机听着很酷,但没看到公开可测的版本,...

推荐理由:我会先打个折:Odyssey不是顶级基础模型厂商,所以分数压在78-84这个区间。但Agora-1确实把世界模型从单人看风景推到了4人联机打枪,仿真和渲染分开跑这个架构选择也值得留意。正文没披露延迟数据和画面一致性表现,这点先别太激动。训练数据用了GoldenEye的内部状态,说明他们走的是用游戏引擎内部信息喂模型的路子,不是纯视频学习,这跟其他家路线不一样。

机器之心 · 公众号

Sebastian Raschka 梳理了 Gemma 4 到 DeepSeek V4 的架构变化,重点在省显存和长上下文

这篇文章是机器之心翻译的 Sebastian Raschka 博客,盘点了几款新模型的架构改动,核心都在想办法降低长上下文的显存开销。Gemma 4 的 E2B 方案在 128K 上下文、bfloat16 精度下,KV 缓存能省大约 2.7GB,这个数字挺实在的。另外还提到了 Laguna XS.2 和 ZAYA1-8B,但正文因为微信环境验证拦截,具...

推荐理由:这是一篇编译的架构趋势梳理,不是一手发布,但信息密度不错。我会先打个折,不往 breaking 级别推。HKR 三档都站得住:标题有明确的模型名钩子,正文有可引用的 KV Cache 节省数字,话题本身也直接关系到推理成本和部署预算。整体放在 featured 中段比较合适,既不过度拔高,也不低估它对从业者的参考价值。

FT · 科技

Google 联手黑石系云厂商推芯片,正文被付费墙挡住,具体芯片型号和部署方式没披露

FT 这篇报道的正文被安全验证页挡住了,只从现有摘要能看出:一家黑石投资的 AI 云厂商拿到了 50 亿美元投资,计划明年上线 500 兆瓦的数据中心容量。标题里提到 Google 在推芯片,但正文没披露用的是 TPU 还是自研 Arm 芯片、以什么形式合作——是租算力、联合部署还是单纯采购。这点先别太激动,等看到全文再判断。

推荐理由:我会先打个折:Google 芯片到底怎么合作、分多少钱,正文没披露,这点先别太激动。但 Blackstone 支持的 AI 云集团拿到 50 亿美元投资,明年要上 500MW 数据中心容量,规模不小。对 AI 从业者来说,这背后是算力成本压力和找 NVIDIA 替代方案的现实需求,所以值得放进 featured。

AI HOT 精选

谷歌和黑石联手搞了家 AI 云公司,先掏 50 亿美元,2027 年要跑起 500 兆瓦算力

谷歌要把自家的 TPU 芯片拿出来对外卖算力了,这次拉上了管钱的黑石。新公司名字还没公布,黑石先投 50 亿美元股权,算上杠杆总盘子预计 250 亿美元。目标是 2027 年让 500 兆瓦的数据中心跑起来,这个电量够一座中等城市用。他们手里已经锁了一批在建的数据中心,后续容量还会扩。这基本是冲着 CoreWeave 这类 AI 算力服务商去的,也会让...

推荐理由:谷歌和黑石联手搞 AI 云公司,黑石先掏 50 亿美元股权,总投资可能到 250 亿美元,目标是 2027 年把 500 兆瓦数据中心跑起来。我会先打个折:这不是模型或核心产品发布,而是基础设施层面的动作,但数字够硬、算力供应的角度够直接。正文没披露具体客户或定价细节,所以别急着把它当成 CoreWeave 的翻版。对从业者来说,这条消息的价值在于它把云容量问题摆到了台面上,而且给出了真金白银的时间表。

彭博科技

Google 和 Blackstone 要合资做 AI 云,用自家芯片跟 CoreWeave 抢生意

Google 和 Blackstone 打算成立一家新的 AI 云计算公司,专门用 Google 自己设计的芯片(也就是 TPU)来提供算力,目标是对标 CoreWeave 这类 GPU 云服务商。目前消息来自华尔街日报,Bloomberg 做了跟进。正文没披露这家新公司的股权结构、双方各投多少钱、具体什么时候上线,也没说会用哪一代 TPU。所以现在只...

推荐理由:HKR 三项都过了,但正文只确认了 AI 云合资公司和自研芯片这两点,股权结构、投资规模、上线时间一概没提。大厂在算力上互相卷,这条够上 featured,但信息缺口明显,到不了 P1。

彭博科技

Meta 在路易斯安那州砸 2000 亿美元建数据中心,靠 10 座天然气电厂供电

Meta 在路易斯安那州 Richland Parish 搞了一个 AI 数据中心,钱不是自己全掏,而是通过一笔 2000 亿美元的私募融资来支撑。这个园区的总电力需求最高能到 7.5 吉瓦,其中 5 吉瓦专门给计算设备用。为了喂饱这些机器,他们计划新建 10 座天然气发电厂来供电。这个规模非常夸张,相当于把未来几年的算力扩张押注在化石能源上。不过视频...

推荐理由:Meta这个数据中心项目把AI基建的烧钱程度又拉高了一个量级。2000亿美元融资和7.5吉瓦电力需求是实打实的硬数字,5吉瓦专供计算说明他们押注的是推理和训练长期需求,不是短期炒作。我会先打个折:正文没披露电力来源和具体时间表,7.5吉瓦能不能落地还得看当地电网和审批。如果是真的,这个单点耗电量已经超过很多小国家的总用电,能源成本会直接决定这个数据中心的经济账能不能算过来。

彭博科技

黄仁勋押注中国会重新对美国 AI 芯片开门,但没给时间表

英伟达 CEO 黄仁勋在跟特朗普一起参加完中国峰会后放话,说中国最终会允许进口美国 AI 芯片。这话听着更像是一种表态而非承诺——正文没披露任何具体时间点,也没说依据是什么。考虑到现在出口管制卡得很严,他这番话可能更多是在向市场喊话,别急着把英伟达的中国生意从账本上划掉。

推荐理由:H 和 R 都站得住:英伟达 CEO 公开预测中国会放开 AI 芯片进口,既有话题性又踩在地缘政治的关键点上。K 这边我会先打个折——文章没给出任何落地细节,时间、流程、型号全缺,只能算个人判断,够不上 actionable knowledge。整体放在 featured 档是合适的。

r/LocalLLaMA

llama.cpp 合并 MTP 投机解码,Qwen3.6 27B 在 Strix Halo 上跑到 2.44 倍速

llama.cpp 在 PR #22673 里正式合并了 MTP(多 token 预测)投机解码支持。实测 Qwen3.6 27B 用 Q8_0 量化,在 Strix Halo 上从 7.4 tok/s 提到 18.1 tok/s,速度翻了 2.44 倍;双 RTX 3090 的 Q8_0 方案也从 25.7 tok/s 涨到 55.9 tok/s,约...

推荐理由:HKR 三项都满足:llama.cpp 合入了 MTP 投机解码,用 Qwen3.6 27B 在 Strix Halo 和 RTX 3090 上跑出了实打实的加速数字。范围限定在本地推理优化,不是大模型发布,78 分放在 featured 合适。