跳到正文

#部署/工程

今日 3 条

5月8日星期五

彭博科技

英伟达计划向数据中心公司 IREN 投资最多 21 亿美元,联手建 AI 基础设施

英伟达和 IREN 签了份 AI 基础设施合作协议,英伟达会投进最多 21 亿美元。这笔钱用来一起建 AI 数据中心,但公告没写具体占多少股份、分几期付款,也没提建成后能增加多少算力。

推荐理由:彭博信源加上英伟达最高 21 亿美元的投资,HKR 三项都站得住。信息只到金额和合作方向,没给股权、付款和容量细节,所以停在 featured 档。

The Verge · AI

SpaceX 要在德州砸 550 亿美元建 AI 芯片厂

SpaceX 在奥斯汀的“Terafab”芯片工厂计划投资至少 550 亿美元,一份听证会文件显示后期总投资可能拉到 1190 亿美元。马斯克 3 月说过目标是年产能支撑 200GW 算力的芯片,但正文没披露具体用哪种制程工艺。

推荐理由:这条消息的钩子就是 SpaceX 跨界造芯片,数字大得离谱,所以 HKR 全中。我会先打个折:正文没披露工艺节点、时间表和已签约客户,没法判断是动真格还是画饼。550 亿到 1190 亿的投资区间,以及 200GW 算力目标,如果是真的挺省钱——但前提是得先有厂、有客户、有产能爬坡,这些信息目前全是缺口。

AI HOT 精选

冻结模型里藏着可读的行为信号,Cygnus 靠适配器把 Qwen-32B 的 ARC 得分从 82% 拉到近 95%

Proprioceptive AI 搞了个叫 Cygnus 的技术,给已经冻结的大模型外挂一个自感知适配器,不重新训练就能读出模型内部残留的行为信号。做法是把隐藏状态投影到一个用 gl(4,R) 李代数定义的数学空间里,从中分离出他们称为“暗模式”的精度信号。拿 Qwen-32B 试了一下,只用一张 RTX 3090,ARC-Challenge 准确率...

推荐理由:HKR 三项都成立:12.77 个点的提升数字扎实,李代数投影的做法够新,压缩 90% 视觉 Token 对实际部署很省钱。但来源是 X 上的帖子,正文没给出完整评测集和对照实验,复现性存疑,所以只给低 featured。真正值得盯的是后续有没有第三方复现,如果复现成立,这个“冻结模型+适配器”的省钱路线对多模态推理会是实打实的利好。

NVIDIA 博客

美国能源部长与英伟达谈 Genesis 任务:用 AI 给电网审批提速,从几年缩到几周

美国能源部和英伟达要在阿贡国家实验室建两台 AI 超算。小的一台叫 Equinox,用 10,000 块 Grace Blackwell GPU;大的一台叫 Solstice,计划上 100,000 块还没发布的 Vera Rubin GPU。英伟达的 Ian Buck 说 Solstice 的算力能干到 5,000 exaflops,这个数字听听就好...

推荐理由:HKR 三项都踩实了:GPU 型号和数量是硬信息,DOE 与 NVIDIA 的角色分工清楚,电网瓶颈那段把 AI 的落地价值讲得很具体。不过来源是 NVIDIA 官方博客,信息偏单向,所以放在 featured 而不是 must-write 的档位,82 分在这个区间里是合理的。

AI HOT 精选

antirez 开源了 DeepSeek 4 Flash 的本地推理引擎,专跑在苹果芯片的 Metal 上

Redis 作者 antirez 在 GitHub 上放出了一个叫 ds4 的项目,是一个让 DeepSeek 4 Flash 模型在 Mac 上本地跑的推理引擎。它直接调用苹果的 Metal Performance Shaders 来降低延迟和内存占用,相当于给模型配了个更底层的加速驱动,而不是简单套个壳。不过项目页面没给出具体的跑分数据,实际快多少...

推荐理由:我会先打个折:正文没给任何延迟或内存占用的实测数字,所以性能到底多好现在说不准。但值得盯的不是又一个模型壳,而是这套 Metal 本地推理栈——它把推理引擎直接做进苹果的图形加速框架里,思路比多数套壳方案更底层。对想在 Mac 上离线跑模型的人来说,这是个能省钱的路线,只是验证还得等社区跑出数据。

5月7日星期四

AI HOT 精选

中国 AI 实验室内部笔记:学生军团、快跟文化和被压缩的算力

作者走访了国内几家头部 AI 实验室,发现一个明显特点:核心贡献者里学生占比很高,他们没包袱、上手快,愿意做那些不炫但能让模型变好的脏活累活。这种文化让中国团队在追赶大模型、做智能体工作流时效率很高,但也被一些技术负责人认为会抑制从 0 到 1 的原创研究。文章提到,国内实验室在百亿级基础模型和十亿级垂直模型上都有布局,部分中文任务表现已超过 GPT-...

推荐理由:H/K/R 全过:一手实验室访问、具体的能力对比和模型规模信息、算力与部署的行业共鸣都很扎实。这不是模型发布或融资事件,属于强分析类内容,放在 78–84 分段合理。正文说“只看图片就能学压缩”和“压缩 90% 精度不掉”,这两个点如果后续有更细的消融实验或复现报告,价值还会更高。

AI HOT 精选

商汤 SenseNova-U1 开源 8 步蒸馏 LoRA,扩散模型推理从 23 秒压到 2 秒

商汤把扩散模型常用的 100 步生成流程蒸馏到只剩 8 步,GPU 上跑一张图从 23 秒降到 2 秒,快了 11 倍。做法是训了一个 LoRA 权重,直接挂到模型上就能用,不用改原模型结构。配套给了 ComfyUI 工作流,覆盖文生图、改图和交错生成。正文没提具体画质对比和什么显卡跑的,这点先别太激动。核心信号不是参数堆得多大,而是用蒸馏换延迟,让扩...

推荐理由:我会先打个折:这只是图像生成领域的推理加速,不是通用模型突破,所以放在featured而不是P1。但它的钩子很实在——用8步蒸馏LoRA把扩散模型从100步砍到8步,GPU推理从23秒压到2秒,还直接支持ComfyUI。对干活的人来说,这意味着同样的卡能多跑十几倍的图,或者低配机器也能玩。正文没披露蒸馏用了多少样本、LoRA参数量多大,这点先别太激动,但开源这一步本身就让验证成本很低。

量子位 · 公众号

浙大与阿里提出 MetaCompress:只看图片就能学会压缩 Token,多轮视觉问答压缩率 90% 且精度不掉

这篇 CVPR 2026 论文介绍了一个叫 MetaCompress 的框架,专门解决多轮视觉问答里图片 Token 太多、推理太贵的问题。它的做法是让模型只看输入图片,自己生成一张“压缩映射图”,直接决定哪些视觉 Token 该留、哪些该扔,不需要额外训练一个压缩网络。文章给出的核心数据是:能砍掉 90% 的视觉 Token,同时保持回答精度不降。还...

推荐理由:我会先打个折:正文说精度不掉,但没给出具体数值和基准对比,这点先别太激动。不过思路确实干净——不用文本引导,只靠图像自身信息决定哪些视觉 Token 可以扔,压缩率做到 90%,对多轮 VQA 这种反复调图的场景很实用。浙大和阿里联合出品,挂了 CVPR 2026,研究信号够强,不是产品通稿。开源了的话,做多模态推理优化的团队可以直接拉下来测延迟和显存变化。

r/LocalLLaMA

在单张 RTX 3090 Ti 上跑 Qwen3.5/3.6 的 NextN MTP 投机解码指南

Reddit 用户分享了一个 llama.cpp 实操指南,用单张 RTX 3090 Ti 跑 Qwen3.5 和 3.6 的 NextN MTP(多 token 预测,一种让模型一次猜好几个词来加速生成的技术)。目前需要打两个还没合并的 PR:#22400 和 #22673。实测 Qwen3.6-35B-A3B-MTP 模型在 350W 功耗、170...

推荐理由:我会先打个折:这是 Reddit 个人指南,依赖两个没合进主线的 PR,稳定性没保证。但亮点很实在——单卡 3090 Ti 跑 35B 模型冲到 157 tok/s,还点出了 nextn=q8_0 量化覆盖这个坑,漏掉会输出乱码。对想在家用显卡上榨性能的 AI 从业者来说,这份功耗、频率、KV 缓存设置都给了,可操作性强。正文没披露模型精度损失和长文本下的速度衰减,这点先别太激动。

Latent Space

Anthropic 租下 xAI 孟菲斯超算,年费或达 50 亿美元,Claude 推理能力几天内就要搬上去

Anthropic 在第二届开发者活动上宣布,将租用 xAI 在孟菲斯的 Colossus I 超算集群来跑 Claude 的推理任务,预计几天内就开始迁移。外界根据 300 兆瓦的功耗规模估算,这笔交易一年可能花掉 Anthropic 约 50 亿美元,相当于 xAI 变相成了一家提供算力租赁的云厂商。活动上没有发新模型,主要更新了三件事:一是 Cl...

推荐理由:这条消息最炸的点是 Anthropic 可能要从 SpaceX/xAI 租 300MW 算力,一年砸 50 亿美元——不过正文也说了这俩数字还不是官方口径,先打个折看。对开发者更实在的是 Claude Code 的 5 小时限额翻倍了,Pro、Max、Team 和席位制 Enterprise 都受益,Opus API 限额也往上调了,用起来没那么容易撞墙。整篇信息量够,既有大 deal 的传闻钩子,又有马上能用的产品变动,所以放在 featured 档。

机器之心 · 公众号

马斯克宣布 xAI 解散,Grok 并入 SpaceXAI,22 万张 GPU 算力租给 Anthropic

马斯克确认 xAI 解散,Grok 和 X 平台相关业务全部并入新实体 SpaceXAI。同时,SpaceX 和 Anthropic 签了协议,Claude 将接入 Colossus 1 超算——超过 22 万张 Nvidia GPU、300 兆瓦的算力集群。对用户来说最直接的变化是配额:Claude Code 的五小时速率限制翻倍,Pro 和 Max...

推荐理由:我会先打个折:目前只有单一信源,还没看到 Anthropic 或 SpaceX 的官方公告,所以先不拉满。但消息本身冲击力很强——xAI 解散、Grok 并入 SpaceXAI,Colossus 1 那 22 万张 GPU 和 300 兆瓦算力直接租给 Anthropic,等于把自家训练底座送给了对手。对开发者来说,Claude Code 五小时速率翻倍、Pro 和 Max 高峰配额限制移除是马上能感知的变化。正文没披露租约时长和价格,也没说 Grok 后续怎么迭代,这些缺口让消息还差一口气,但已经够格进 p1。

Computing Life · Share · 鸭哥调研

Anthropic 半年签下四笔算力大单,xAI 把自家超算中心整租给了对手

Anthropic 在六个月内接连锁定了 AWS Trainium、Google TPU、SpaceXAI Colossus 1 和 CoreWeave 的算力,覆盖了市面上三种主流芯片架构。同一时间,xAI 把拥有 22 万张 GPU 的 Colossus 1 数据中心全部租给了 Anthropic,而自家 GPU 利用率只有 11%。这两件事拼在一...

推荐理由:我会先打个折:这更像一篇策略分析,不是突发新闻,所以分数没给到 85 以上。但它的信息密度够硬——Anthropic 四处锁算力,xAI 却把自家超算租给对手,还带出 11% 利用率这个反直觉数字。对关注大模型算力战的人来说,这比单纯宣布合作要有意思得多。正文没披露租约的具体价格和时长,这点先别太激动,但现有的数字已经足够让从业者重新琢磨两家公司的算力策略了。

FT · 科技

Arm 预计自家 AI 芯片明年能卖 20 亿美元,但没公布客户和制程

Arm 第一次自己做 AI 芯片,就给出了明年 20 亿美元的销售预期。这个数字不小,但文章正文被付费墙挡住了,看不到具体是卖给谁、用什么工艺生产、什么时候交货。软银在背后撑腰,需求据说很强劲,不过在没有客户名单和定价的情况下,这个预测先打个折看。

推荐理由:FT 的信源加上 20 亿美元销售预期,让这条消息有硬信息量,所以 K 成立。Arm 从设计授权商变成芯片商,对行业格局有冲击,H 和 R 也站得住。但客户、价格、制程、交付节奏这些关键信息全是空白,我会先打个折,热度归热度,落地还早,所以放在 featured 这档刚好。

FT · 科技

SpaceX 要把数据中心算力租给 Anthropic

FT 报道 SpaceX 会向 Anthropic 出租数据中心容量,等于确认了双方有一笔算力租赁合作。Anthropic 加码算力是为了跟上用户增长,但正文被付费墙挡住,没披露具体租了多少、租多久、什么价格。

推荐理由:FT 确认 SpaceX 会向 Anthropic 出租数据中心容量。H 来自这对不常见的组合;K 有交易事实但没有规模和价格,信息缺口明显;R 直接关联算力稀缺和 Anthropic 的增长压力,所以能进 featured,但缺细节撑不到 78 分以上。

r/LocalLLaMA

Atlas 推理引擎开源,在 DGX Spark 上跑 Qwen3.6-35B-FP8 能稳定跑到每秒 100 多个 token

Avarok 把 Atlas 推理引擎开源了。它用 Rust 和 CUDA 写成,镜像只有约 2.5GB,冷启动不到两分钟。在一台 DGX Spark 上跑 Qwen3.5-35B,实测持续速度约 111 tok/s,作者说比 vLLM 快 3.0 到 3.3 倍。引擎专门为 Blackwell SM120/121 写了内核,支持 NVFP4、FP8 ...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,基准测试也没被第三方复现,所以分数压在了 featured 低位。但这条确实有料——开源推理引擎 Atlas 在 DGX Spark 上跑 Qwen3.5-35B 持续 111 tok/s,镜像才 2.5GB,冷启动不到两分钟,作者说测试时是 vLLM 的 3.0–3.3 倍。真正值得盯的是 Blackwell SM120/121 手写内核、NVFP4/FP8 和 MTP 解码这些底层优化,不是简单套壳。速度、体积、启动时间三个数字都给了,信息密度够,对想本地部署大模型的人有直接参考价值。

r/LocalLLaMA

Reddit 实测:双卡跑大模型,PCIe 带宽可能没你想的那么吃紧

用户 ziphnor 用两张 RTX 5060 Ti 16GB 跑 vLLM,开启张量并行(TP=2)处理 32k 上下文预填充。实测 PCIe 峰值带宽只跑到 3–4 GB/s,大约占满一条 PCIe 4.0 x4 通道的 40%–50%。预填充速度在不同设置下分别达到约 840–850、1500 和 1600–1700 tokens/s。帖子没提解...

推荐理由:这篇 Reddit 实测值得一看,因为它用具体数字回应了一个常见焦虑:双卡跑大模型,PCIe 带宽到底够不够。ziphnor 拿 2 张 RTX 5060 Ti 16GB 在 vLLM 里开张量并行,32k 上下文预填充时 PCIe 峰值只有 3–4 GB/s,就算把链路砍到 PCIe 4.0 x4,实际也只用了 40–50% 的带宽。三组模型的预填充速度分别约 840–850、1500、1600–1700 tokens/s,说明瓶颈不在 PCIe 线速上。我会先打个折:正文没披露解码阶段的带宽,那才是持续通信的大头,这点先别太激动。真正该盯的是张...

r/LocalLLaMA

Reddit 网友扒了 922 条 agent 任务记录,发现 DeepSeek v4 省钱的关键不在标价,在缓存命中率

一位 Reddit 用户分析了 922 条 agent 任务的实际调用记录,对比了 DeepSeek v4 Flash 和 Opus 4.7 的花费。两个模型每个任务都要吃掉大约 96 万 token,但 DeepSeek 单任务成本只要 0.01 美元,Opus 4.7 却要 1.52 美元。差距不在输入输出的标价,而在缓存:DeepSeek 的缓存...

推荐理由:这篇不是比谁模型强,是比谁缓存用得聪明。Reddit用户跑了922条智能体任务轨迹,发现DeepSeek v4 Flash单任务成本0.01美元,Opus 4.7要1.52美元,差了152倍。两边平均token消耗都接近96万,但DeepSeek缓存命中率97%,Opus只有87%;更关键的是缓存读写价格比,DeepSeek是0.02,对方是0.08。也就是说,标价看着便宜不算真便宜,能把重复计算省下来才是省钱的地方。正文没披露任务类型和采样方式,这点先别太激动,但缓存机制这个观察本身值得盯。

彭博科技

Anthropic 找 SpaceX 买算力,但没说是训练还是推理用

Anthropic 和马斯克的 SpaceX 签了一份算力合同,目的是撑住 Claude 越来越大的用量。报道没披露具体算力规模、合同金额、上线时间,也没说这批算力是拿来训练新模型还是跑线上推理。SpaceX 能不能挤进 Anthropic 的长期供应链,目前还看不出来。

推荐理由:我会先打个折,这条消息的新闻性在于“谁跟谁合作”,而不是合作本身有多扎实。Anthropic 把 SpaceX 拉进算力供应商名单,对缓解 Claude 的推理压力可能有帮助,但正文没披露任何具体数字或部署细节,所以现在还判断不了这是短期补缺还是长期供应链调整。真正值得盯的是后续会不会有训练或推理负载真的跑在 SpaceX 的设施上,以及合同规模能不能跟 AWS、Google Cloud 的量级比一比。目前只能当作一个信号来看,别太激动。

5月6日星期三

r/LocalLLaMA

单张 RTX 5090 跑通 Qwen3.6 27B:NVFP4 量化加 MTP 投机解码,200k 上下文实测 73.6 tok/s

一位 Reddit 用户在单张 32GB 显存的 RTX 5090 上,用 vLLM 跑通了 Qwen3.6 27B 的 NVFP4 量化版,并验证了 200k 上下文长度。配置上用了 fp8_e4m3 的 KV 缓存、FlashInfer 和 3 个投机 token 的 MTP。10 次 200k 上下文跑分平均生成速度 73.6 tok/s,首 t...

推荐理由:我会先打个折:来源是 Reddit 用户自测,不是官方报告,但配置和日志都贴出来了,可复现性不低。真正值得盯的是显存边界——KV 缓存占了 8.3GiB,整卡吃到约 30478MiB,几乎榨干 32GB。这说明 NVFP4 量化确实把 27B 模型压进了消费级显卡,而且 200k 上下文不是摆设,十次都跑稳了。不过 TTFT 70 秒意味着首 token 要等一分多钟,实际用起来体验会打折扣。这点先别太激动,等更多卡型验证。

TechCrunch · AI

AI 芯片需求把三星抬进万亿美元俱乐部

三星股价单日涨超 10%,市值突破 1 万亿美元,成为继台积电之后第二家达标的亚洲公司。直接催化剂是上周财报利润同比翻了八倍,核心逻辑是 AI 系统离不开三星的内存芯片,需求猛涨而供给跟不上,推高了芯片价格。另一个推手是前一天的消息:苹果正与三星和英特尔洽谈在美国本土生产设备芯片,如果三星拿到订单,将打破苹果几乎完全依赖台积电的局面。不过原文没披露具体...

推荐理由:HKR 三项都过,但 K 比较虚:文章只给了市值和排名,没交代股价变动、收入贡献或订单构成。我会先打个折,把它当 AI 基建的金融节点来看,放在 featured 门槛上。

NVIDIA 博客

NVIDIA 给 Spectrum-X 以太网加了多路径 RDMA,让超大规模 GPU 集群的流量不再堵在一条路上

NVIDIA 在 Spectrum-X 以太网平台上新增了 MRC(多路径 RDMA)支持,允许一个 RDMA 连接把流量分散到多条网络路径上,而不是死绑一条。这项技术已经在 Blackwell 集群里跑起来了,硬件层面能做到微秒级故障绕行和重路由。MRC 走的是 OCP 开放规范,支持多平面组网,目标是把集群规模推到几十万张 GPU。不过博客没给出具...

推荐理由:我会先打个折:这是英伟达自己的产品稿,不是第三方评测。MRC 把一条 RDMA 流拆到多条物理路径上跑,微秒级检测断连并硬件重路由,正文说已经在 Blackwell 部署里用了。这点先别太激动,因为没给第三方验证数据。真正值得看的是他们把这套东西推到 OCP 开放规范,配合多平面网络,目标是撑住几十万卡级别的训练集群——如果真能落地,对大规模训练的网络成本会有实打实的影响。

r/LocalLLaMA

Qwen 3.6 27B 用上 MTP 后推理速度提升 2.5 倍,48GB 显存可跑 26 万上下文

这篇帖子来自 Reddit 的 r/LocalLLaMA,作者分享了一个 llama.cpp 的 PR,为 Qwen 3.6 27B 模型添加了 MTP(多令牌预测)支持,实测推理速度提升了 2.5 倍。在 Mac M2 Max 96GB 上达到了 28 tok/s 的生成速度。关键细节在于使用了 turbo4 4.25-bit KV 缓存量化,这让一...

推荐理由:HKR 三项都站得住:提速和长上下文对本地 agent 是实打实的吸引力,帖子里机制和数字都列清楚了,成本优势也直接。不过只有 Reddit 单源,配置也有点折腾,所以放在 featured 低位。

Latent Space

硅谷开始认真卖服务了:Anthropic 和 OpenAI 各自成立公司,帮企业把模型塞进业务里

Anthropic 和 OpenAI 这周都宣布了新的企业服务公司。Anthropic 跟黑石等几家华尔街机构搞了个合资公司,总共融了 15 亿美元,每家出 3 亿。他们的做法是先派个小团队去客户那,搞清楚 Claude 能在哪发挥最大作用,然后工程师再上手定制系统。OpenAI 那边动作更大,成立了一家叫 The Deployment Company...

推荐理由:两家头部模型公司不约而同从卖模型转向亲自下场做服务,Anthropic 的合资公司拿了 15 亿美元,OpenAI 的部署公司融了约 40 亿、投前估值 100 亿。我会先打个折,正文没披露这些服务公司的具体业务模式、客户是谁、怎么收费,也没说跟现有云厂商的合作关系怎么处理。但光看资金规模和两家同时行动,这个信号够强,值得从业者留意。

机器之心 · 公众号

明略开源两套工具,让 Mac 跑本地模型和操控桌面

明略科技放出了两个开源项目:Cider 和 Mano-P 1.0,都是给苹果 M 系列芯片用的。Cider 是个推理加速引擎,在 M5 Pro 上跑 Qwen3-VL-2B 时,把生成第一个 token 前的等待时间缩短了 57% 到 61%。Mano-P 1.0 是个能操作电脑界面的模型,72B 版本在 OSWorld 测试里拿了 58.2 分。不过...

推荐理由:我会先打个折:明略不是一线模型实验室,所以分数没往上拉。但选题本身够实用——Mac 本地跑视觉模型和 GUI 智能体,还给了可复现的提速数据和内存门槛。Cider 的 prefill 加速和 Mano-P 在 OSWorld 的成功率都有具体数字,16GB 设备准确率下降也写明了,不是纯 PR 稿。对想在 Apple Silicon 上折腾本地推理的人,这篇值得看一眼。

r/LocalLLaMA

DeepSeek V4 便宜 17 倍,我实测了 10 天写代码哪些活能丢给本地模型

Reddit 用户 spencer_kw 把自己 10 天的编程工作流拆成 150 个任务,拿本地 Qwen 3.6 27B 和云端模型重新跑了一遍。结果 65% 的任务本地模型干得一样好,20% 勉强能用,只有 15% 必须上云端。他的 API 账单从每月 85 美元掉到 22 美元左右。这个测试说明省钱的关键不是盯着模型单价,而是按任务类型做分流—...

推荐理由:这篇不是模型发布,而是一个开发者拿自己的编码工作流做的成本实测,有日志、有复测、有分桶比例,信息量够。单一个 Reddit 帖子的样本量有限,普适性要打个折,所以放在 featured 而不是 P1。我会先看他的任务分类和路由逻辑,这点比“便宜 17 倍”本身更有参考价值。

TechCrunch · AI

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,说在法律、医学、金融这些领域更少胡说八道

OpenAI 发了 GPT-5.5 Instant,直接替掉了之前的 GPT-5.3 Instant,成了 ChatGPT 的默认模型。公司说新模型在法律、医学和金融这些容易出错的领域减少了幻觉(也就是瞎编答案),同时保持了上一代的低延迟。但正文没披露任何跑分、具体降低了多少幻觉率、覆盖哪些用户、以及价格有没有变。

推荐理由:我会先打个折:OpenAI 把新模型直接设为默认,动作不小,但正文只给了定性描述,没披露幻觉降低的具体幅度、评测方法、覆盖地区或价格。对从业者来说,知道默认模型变了是刚需,但能不能立刻用上、省不省钱、稳不稳定,这些关键信息都还缺着。所以重要性给到 88,属于必须知道但还不能全信的那一档。

r/LocalLLaMA

Gemma 4 出了 MTP 草稿模型,解码速度翻倍但输出质量不变

Google 在 Hugging Face 上放了 4 个 Gemma 4 的 MTP 检查点。MTP 的做法是拿一个小号草稿模型一次预测好几个 token,再由主模型并行验证,相当于让模型“先猜后验”,最终解码速度能提一倍,而且输出质量跟原来一模一样。不过 Reddit 原帖被网络策略挡了,正文没披露具体模型尺寸、硬件要求或实测延迟数据。

推荐理由:H、K、R 都站得住:钩子是 2 倍低延迟解码,有检查点和机制说明,不是画饼。它不是旗舰模型发布,属于实用更新,75 分放在 featured 低位合理。

5月5日星期二

r/LocalLLaMA

Heretic 1.3 发布:模型可复现、内置跑分、显存占用更低

Heretic 1.3 这个版本主要干了三件事。第一,它现在能把跑模型时的环境——PyTorch 版本、GPU 型号、驱动、加速库这些——都打包记录下来,别人照着做就能复现结果,不用再猜“为啥我跑出来不一样”。第二,它内置了一套跑分系统,直接用 lm-evaluation-harness 测 MMLU、EQ-Bench、GSM8K 和 HellaSwa...

推荐理由:我会先打个折:正文没给出 VRAM 具体降了多少,这点先别太激动。但 Heretic 这次更新确实踩到了两个实在需求——一是让模型运行环境可复现,把 PyTorch、GPU、驱动版本都记下来,方便排查问题;二是内置了 lm-evaluation-harness 基准测试,不用再自己搭评测流程。项目有 2 万星、1300 万次下载,社区验证度够高。缺憾是 VRAM 优化只提了方向没给数字,所以重要性停在 72 分,放在 featured 里合适。

OpenAI News

OpenAI 发布 MRC 网络协议,让超大规模 GPU 集群训练更抗断、更省电

OpenAI 把自家训练大模型用的网络方案 MRC(多路径可靠连接)通过 OCP 开源了。MRC 解决的是老问题:集群大到一定程度,网络抖动和链路故障会频繁卡死训练任务,GPU 空转烧钱。它的做法是把一次数据传输拆成几百条路径同时发(packet spraying),哪条路断了就在微秒级绕开,不用等全网重算路由。协议跑在 800Gb/s 网卡上,基于 ...

推荐理由:MRC 是个多路径可靠连接协议,简单说就是给 GPU 集群的通信多备几条路,一条断了还能走别的,训练不容易崩。OpenAI 通过 OCP 公开这个方案,对自建大规模训练集群的团队是个信号——他们可能也在解决类似的网络稳定性问题。但正文没给任何性能数据,延迟降多少、吞吐提多少、实际跑过多大的集群,全都没写。所以我会先打个折,这更像一个技术方向的路标,离能评估效果还差得远。

r/LocalLLaMA

微软 VibeVoice 语音合成与长音频转写被移植到纯 C++,推理不再需要 Python

LocalAI 把微软的 VibeVoice 模型用 ggml 重写成 C++ 版本,叫 vibevoice.cpp,支持 CPU、CUDA、Metal 和 Vulkan 推理,不用装 Python 环境。语音合成这边,给一段 30 秒的参考录音就能克隆声音,输出 24kHz 的语音。语音识别部分用的是一个 7B 模型,能处理长音频并区分不同说话人,结...

推荐理由:这条更新对做本地音频部署的人有用,给出了具体的运行数字和限制。我会先打个折:它来自社区移植,不是微软官方动作,而且缺少流式支持这点在实时场景里是硬伤。整体在 72–77 分 featured 档位合理,不值得当天必写,但值得放进雷达。

机器之心 · 公众号

马斯克 55 万张英伟达 GPU 的集群,实际有效利用率只有 11%

The Information 的报道说,xAI 手里大概 55 万张英伟达 GPU,但模型浮点运算利用率(MFU)只有 11%,折算下来相当于真正在干活的卡就 6 万张左右。文章把锅甩给了 HBM 显存读写、服务器之间通信、训练时空等和软件栈不统一这几个问题。作为对比,Meta 的利用率是 43%,Google 是 46%。不过原文因为微信环境验证失...

推荐理由:这篇不是模型发布或产品更新,是实打实的基础设施效率爆料。55万卡对11%利用率这个对比本身就够抓人,再加上Meta和Google的43%、46%做参照,信息密度高。我会先打个折:正文没披露xAI具体怎么算的MFU,也没说这个11%是瞬时值还是长期均值,但瓶颈拆解(HBM、跨节点通信、软件栈)让文章站得住脚,所以给到82分。

r/LocalLLaMA

MTPLX 让苹果芯片跑大模型快了一倍多,原生 MTP 推理引擎来了

一个叫 MTPLX 的推理引擎在 MacBook Pro M5 Max 上把 Qwen3.6-27B 的生成速度从每秒 28 个 token 提到了 63 个 token,快了 2.24 倍。测试用的是 4-bit MLX 量化,温度 0.6,top_p 0.95,top_k 20,最佳推测深度 D3。关键点是它直接用了模型自带的 MTP 头做推测解码...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,测试范围也限定在 Apple Silicon,验证面还窄。但 2.24 倍的吞吐提升是实打实的数字,而且 MTP heads 内置在模型里,不用额外加载一个 drafter 模型占内存,这点对 Mac 用户确实挺省钱。正文没披露更多模型或硬件的对比数据,所以先放在 featured 低位,等有更广的复现再往上调。

TechCrunch · AI

Cerebras 准备上市,估值可能冲到 266 亿美元,背后是跟 OpenAI 的深度绑定

AI 芯片公司 Cerebras 正在推进 IPO,目标估值至少 266 亿美元。它的核心卖点不是通用芯片,而是跟 OpenAI 绑得很紧的供应链关系。文章没披露 OpenAI 有没有持股、具体贡献了多少收入,也没说上市时间表。所以这轮估值更多是在赌 OpenAI 的算力需求会持续砸在 Cerebras 身上,而不是单纯看芯片本身的技术指标。

推荐理由:我会先打个折:正文其实没给出营收、持股和上市时间表,所以别把它当芯片概念股去追。真正有意思的是 OpenAI 供应链外溢出来的估值效应——一家靠绑定 OpenAI 起来的芯片公司能冲到 266 亿美元以上,说明市场在给 AI 算力渠道和合作关系定高价。这点先别太激动,但确实值得放进雷达里观察。

r/LocalLLaMA

FastDMS 把 KV 缓存压到 1/5~1/8,跑得比 vLLM BF16/FP8 还快

FastDMS 放出了一个 MIT 许可的实现,核心是把模型推理时占显存的 KV 缓存压到原来的 1/5 到 1/8。在 8K 上下文长度下,Llama-3.2-1B 用 6.4 倍压缩后困惑度是 9.200;Qwen3-8B 在压缩系数 c=1 时,KV 缓存从 1.406 GiB 直接降到 0.184 GiB。和很多只算字节数的方案不同,它真的把淘...

推荐理由:我会先打个折,这个项目目前只给了 Llama-3.2-1B 的复现实验,更大规模模型的验证还没看到,所以别急着当通用方案。但它的钩子确实强:KV 缓存压缩 6.4 倍,同时推理速度还比 vLLM 的 BF16/FP8 快,这跟“压缩必降速”的直觉对着干。正文给出了具体的 PPL 和显存占用对比,数字可追溯。真正值得盯的是它回收了被踢掉的物理槽位,不只是账面上少占点字节,这对长上下文推理的显存管理是实打实的改进。来源是开源实现和 Reddit 讨论,不是厂商通稿,信息可信度还行,但权威性一般,所以分数定在 80 这个区间。

5月4日星期一

r/LocalLLaMA

M3 Ultra 加 DGX Spark,能拼出一台 M5 Ultra-lite 吗?

Reddit 有人拿 DGX Spark 和 M3 Ultra 在 llama.cpp 里跑分,统一用 pp16384 上下文。Spark 比 M3 Ultra 快 1.4 到 3.4 倍,看模型:Qwen 27B 跑到 778 token/秒,M3 Ultra 是 340;Mistral 128B 跑到 241,M3 Ultra 只有 72。有个调参...

推荐理由:数据来自 Reddit 单帖,权威性打折扣,但测试设置清楚、模型覆盖广、提速幅度直观,对正在掂量买 M3 Ultra 还是 DGX Spark 跑本地推理的人有参考价值。我会先打个折,因为没看到多轮对话或长上下文压力测试,但就当前信息来说,featured 低空过关没问题。

r/LocalLLaMA

Mistral Medium 3.5 128B 和 Qwen 3.5 122B A10B 在 4 张 RTX 3080 20GB 上的跑分对比

一位 Reddit 用户用 4 张 RTX 3080 20GB 显卡跑了两个大模型。Mistral Medium 3.5 128B 在 llama.cpp 里把张量拆分(tensor split)打开后,生成速度从每秒 10.37 个 token 翻倍到 21.59。但 Qwen 3.5 122B A10B 这个混合专家模型(MoE,把任务分给不同子模...

推荐理由:HKR 三项全中。4×RTX 3080 这个配置本身就是个好钩子,帖子给了 llama.cpp 和 vLLM 下两组实打实的吞吐变化,不是空谈。Mistral 张量切分后速度翻倍,Qwen MoE 反而降速,这个对比把并行策略对 MoE 架构的差异暴露得很清楚。不过数据来自 Reddit 单次跑分,没交代精度和上下文长度,所以分数压在 72–77 这个区间,不往上拔。

r/LocalLLaMA

一个 4.5 亿参数的视觉模型在卫星上跑野火检测,瓶颈不是模型质量,是带宽

作者 PauLabartaBajo 搭了一套端到端的野火预防管线,把 4.5 亿参数的视觉语言模型 LFM2.5-VL 直接部署在卫星上做推理。核心约束是卫星下行带宽太窄,传不了大尺寸多光谱图像,所以方案反过来:在轨跑模型,只下传一份 JSON 格式的风险评估结果。管线用 Sentinel-2 的 RGB 和短波红外(SWIR)图像拼成输入——SWIR...

推荐理由:我会先打个折:这是单人 PoC,只在 22 个地点跑过模拟轨道,正文没披露真实卫星上的延迟和误报率,所以别当成熟方案看。但它的思路很清晰——把算力留在天上,只传结论不传图,带宽省得不是一点半点。用 450M 小模型而不是大模型,也说明在轨推理的硬件约束有多硬。对关注边缘部署和遥感落地的从业者,这个方向值得跟,但验证还差得远。

r/LocalLLaMA

一台 5 年老笔记本跑通 35B 模型:6GB 显存 + CPU 混合推理,插电 23 token/秒

Reddit 用户 abhinand05 在一台 5 年前的华硕 ROG Zephyrus G14 上跑起了 Qwen3.6-35B-A3B 模型。这台笔记本只有 RTX 2060 Max-Q 6GB 显存,搭配 24GB DDR4 内存和 Ryzen 7 处理器。插电时生成速度约 23 token/秒,不插电掉到 10 token/秒出头。能跑起来的...

推荐理由:我会先打个折:这只是单个Reddit用户的跑分,不是官方发布,别当基准看。但它的价值不在权威性,而在把CPU MoE、KV cache量化和ngram推测解码这三样东西组合起来,在6GB显存的旧机器上跑出可用的速度。正文没披露量化精度和功耗细节,这点先别太激动。对想用老设备玩大模型的从业者来说,这篇给了参数和思路,比单纯喊'能跑'有用得多。

r/LocalLLaMA

Intel 和 AMD 联手推 x64 新指令集 ACE,一次能算 1024 次乘法,但没硬件、没功耗、没发货时间

这篇帖子想讨论新的 x64 指令扩展能不能缓解 AI 硬件短缺,但 Reddit 原文被屏蔽了,看不到具体讨论。根据现有摘要,Intel 和 AMD 公布的 ACE 扩展用 2D 瓦片寄存器和外积算法,每时钟周期能做 1024 次乘法,对比现在 AVX 的 64 次,纸面吞吐量直接翻了 16 倍。不过先别太激动——目前没有任何 ACE 硬件上市,功耗、...

推荐理由:HKR 三项都站得住:切入点把 CPU 指令集改动和 AI 硬件荒挂上了钩,有反差;技术细节给了吞吐量倍数和实现机制,不是空谈。分数没给更高,是因为正文自己说了——支持 ACE 的硬件还没发布,功耗、框架适配、量产时间全是空白,现在只能当个技术预告看,别太激动。

5月3日星期日

r/LocalLLaMA

论文称用低成本 FPGA 跑 Qwen3-30B-A3B Q4 推理,生成速度 18 t/s,量产成本预计 150 美元

这篇论文讲的是 Hummingbird+,用低成本 FPGA 跑大模型推理。他们拿 Qwen3-30B-A3B 的 Q4 量化版测试,生成速度能到每秒 18 个 token,板子带 24GB 显存,作者说量产的话成本能压到 150 美元左右。不过帖子正文没披露具体是哪款 FPGA、功耗多少、测试条件是什么,Reddit 原帖还被网络屏蔽了,看不到讨论细...

推荐理由:这篇论文的钩子很直接:一块预计量产成本 150 美元的 FPGA,能把 Qwen3-30B-A3B 的 Q4 量化版跑到每秒 18 个 token,配 24GB 内存。对想本地跑大模型又嫌显卡贵的人来说,这个数字挺诱人。但我会先打个折——正文没披露用的是哪款 FPGA,也没给功耗数据,评测条件同样空白。没有这些,18 t/s 是在什么负载、什么精度损失下跑出来的就说不清。所以这条值得关注,但别急着下结论,等他们把板卡型号和功耗补上再说。