跳到正文

#部署/工程

今日 3 条

5月27日星期三

AI HOT 精选

TRL 新增增量权重同步:只传模型变化的部分,每步传输量从 1.2GB 降到 20-35MB

异步强化学习训练有个很现实的问题:每一步训练器都得把整个模型发给推理引擎。一个 7B 模型用 bf16 格式就要传 14GB,换成万亿参数模型更是要传 TB 级别的数据。Hugging Face 团队发现,在两次优化步骤之间,大约 99% 的 bf16 权重其实完全没变,真正变动的部分很小。他们合入了 TRL 的一个 PR,做法是把变动的权重打包成稀疏...

推荐理由:Hugging Face 在 TRL 里合了一个增量权重同步的 PR,用稀疏 safetensors 只传变化的部分,Qwen3-0.6B 单步载荷从 1.2GB 降到 20–35MB。对经常做分布式微调的人来说,这个压缩比很实在,能省带宽、省时间。正文没提更大规模模型或跨节点同步的实测数据,所以“万亿参数”目前更像一个能力上限的表述,实际效果还得看后续验证。整体是训练基础设施层面的改进,对从业者有用,但还没到必须全员关注的程度。

AI HOT 精选

小米 MiMo 2.5 Pro 永久降价,最高砍掉 99%,跟 DeepSeek V4 Pro 一个价

小米把 MiMo-V2.5 系列的 API 价格永久打下来了,最高降了 99%,现在和 DeepSeek V4 Pro 定价持平。花同样的钱,能用的 token 数多了 5 到 8 倍,计费方式也变简单了。老用户之前买的套餐额度会全部重置补满。降价的原因是他们在推理环节做了全栈优化,省下来的成本直接让出来了,具体技术细节后面会发博客。另外 MiMo-V...

推荐理由:HKR 三项都成立:99% 的降幅和直接点名 DeepSeek 同价,话题性够强;降价幅度和生效时间都是硬信息;API 成本压力是从业者每天在算的账。不过这只是调价公告,没有新模型或新能力,所以重要性停在 76 分,不往上拉了。

r/LocalLLaMA

PrismML 放出二值/三值 Bonsai Image 4B:1-bit 文生图扩散模型,浏览器里就能跑

PrismML 发布了 Bonsai Image 4B 的二值和三值版本,把文生图扩散 Transformer 的权重压到 1-bit 或三值,模型体积约 3GB。作为对比,FLUX.2 Klein 4B 大概要 16GB。Reddit 帖子里给了浏览器端 WebGPU 本地运行的 demo 链接,模型用 Apache-2.0 协议开源。不过帖子正文被...

推荐理由:PrismML 这个 Bonsai Image 4B 把文生图 DiT 压到 1-bit 和三值,模型约 3GB,能在浏览器 WebGPU 上完全本地跑,Apache-2.0 开源。我会先打个折:Reddit 信源、实验室发布,实际出图质量和速度还没第三方验证,这点先别太激动。但技术方向上,低比特量化做到浏览器可跑,对本地推理和隐私场景确实挺省钱,所以给 featured 低位。

5月26日星期二

彭博科技

高通要给字节跳动供 AI 数据中心芯片,但具体型号和规模都没说

彭博援引知情人士消息称,高通将向字节跳动供应芯片,用于后者的 AI 数据中心。报道正文被付费墙挡住,没披露芯片型号、订单量、单价和交付时间。我会先打个折:这消息目前只有方向,没有可验证的细节,别急着判断这对字节的算力储备有多大影响。

推荐理由:消息来自彭博社的知情人士,把高通、字节和 AI 数据中心串在了一起,所以 H、K、R 都成立。但芯片型号、采购规模和交付时间一概没提,信息缺口太大,只能给 featured 里的低分段,上不了 P1。

r/LocalLLaMA

dlmserve 开源:首个为扩散语言模型设计的推理引擎,支持 LLaDA-8B,吞吐量是 HuggingFace 的 2.5 倍

Reddit 上有人放出了一个叫 dlmserve 的开源项目,MIT 协议,专门给扩散语言模型做推理服务。它第一个支持的模型是 LLaDA-8B-Instruct,这种模型生成文本的方式和常见的自回归模型不一样,是一步步“去噪”出完整回答。引擎对外提供兼容 OpenAI 的 /v1/chat/completions 接口,方便直接替换。性能方面,在批...

推荐理由:我会先打个折:目前只有 Reddit 一个信源,生态还很早期,所以分数没往上拉。但这条信息本身对玩本地模型的人挺实用——扩散语言模型一直缺好用的推理引擎,dlmserve 直接说自己是第一个,还给了 batch=4 下 2.5 倍 HF 吞吐、12GB 显存可跑这些具体数字,不是空喊口号。MIT 协议和 OpenAI 兼容接口也让试错成本变低。这点先别太激动,但值得放进雷达让读者知道有这么个东西出现了。

AI HOT 精选

OpenRouter 拿到 1.13 亿美元 B 轮,周 token 处理量半年翻了五倍

OpenRouter 宣布完成 1.13 亿美元 B 轮融资,由 CapitalG 领投。公司同时给出一个业务数据:过去 6 个月,平台每周处理的 token 量从 5 万亿涨到 25 万亿,翻了五倍。这个数字说明接入 OpenRouter 做模型调用的生产流量在快速变大。正文没披露估值、具体估值逻辑和资金用途,也没提盈利情况。

推荐理由:HKR三项全中:OpenRouter是很多开发者实际在用的模型路由层,1.13亿美元加上25万亿周token量给出了实打实的规模数据。没给更高分是因为这本质上是融资加增长数字,不是新模型或新能力发布,对技术方向的冲击有限。

阿里技术 · 公众号

南大和阿里发现 DiT 里的残差流拖慢收敛,改用跨层路由后训练快了近 9 倍

南京大学 LAMDA 组和阿里智能引擎团队提出了一种叫 DAR 的方法,把 DiT 模型里固定的残差累积,换成了按时间步动态选择路径的跨层路由。在 ImageNet 256×256 上拿 SiT-XL/2 试,FID 从 9.67 降到了 7.56,而且只用原来大约九分之一的训练步数就达到了同等收敛质量。不过原文因为微信环境验证拦截,具体怎么实现路由、...

推荐理由:我会先打个折:这还是一个针对DiT架构的训练方法改进,不是新模型或产品发布,所以分数没往78以上走。但它的亮点很实在——把残差流这个大家默认的组件揪出来说是收敛瓶颈,然后用一个时间感知的路由去替代固定累加,效果是FID更好、收敛快近9倍。对正在烧钱训视觉模型的人,这个省钱省时间的信号够强,featured没问题。

量子位 · 公众号

面壁智能发布 ForgeTrain 和 MiniCPM5-1B,声称训练框架由 AI 自己编写,训练速度比英伟达 Megatron 快 10%

面壁智能放出了 ForgeTrain 训练框架和 MiniCPM5-1B 模型。ForgeTrain 最抓眼球的地方是,他们说是让 AI 自己写的代码,在同样硬件下比英伟达的 Megatron 训练快 10%。MiniCPM5-1B 是个 10 亿参数的小模型,FP16 权重约 2GB,压缩到 INT4/Q4 后约 0.5GB,主打端侧部署。不过原文因...

推荐理由:面壁智能说 ForgeTrain 是 AI 写的训练框架,同硬件下比英伟达 Megatron 快 10%,还发了 1B 参数的端侧模型 MiniCPM5-1B,FP16 权重约 2GB,压缩到 INT4/Q4 约 0.5GB。我会先打个折——“全球首例 AI 造 AI”这个说法正文没给出第三方复现,10% 的速度提升也没交代测的是什么任务、什么卡、什么 batch size。但即便保守看,一个 AI 生成的训练框架能跑起来还声称更快,本身就有信息量;1B 模型压到 0.5GB 对手机端部署也够直接。分数定在 80,是因为概念够新、数字够具体,但验证...

机器之心 · 公众号

面壁开源 MiniCPM5-1B 和训练框架 ForgeTrain,框架代码是 AI 自己写的,1B 模型跑分 17.9

面壁智能放出了两个东西:一个叫 MiniCPM5-1B 的端侧小模型,和一个叫 ForgeTrain 的训练框架。1B 模型在 AA-Index 上拿了 17.9 分,这个分数说明小体量也能有不错的综合能力。更特别的是 ForgeTrain,它的训练代码不是人写的,是让 AI 自动生成的,跑出来的结果跟英伟达的 Megatron 框架对得上,而且在 H...

推荐理由:HKR 三项都踩中了:AI 写训练框架这个钩子够新鲜,不是又一个千篇一律的模型发布;AA-Index 17.9 分和比 Megatron 快 10% 的 H100 数据让信息有骨头;话题又落在开源小模型和端侧部署上,读者会想点开看。不过它毕竟不是旗舰模型发布,所以分数放在 78 这个区间是合适的。

AI HOT 精选

面壁智能开源 MiniCPM5-1B,1B 参数在 AA-Index 上跑赢所有 2B 以下模型,量化后 0.5GB 能塞进手机和浏览器

面壁智能联合清华和 OpenBMB 开源了一个 1B 参数的小模型 MiniCPM5-1B。它在 AA-Index(一个综合评测榜单)上的得分超过了所有参数不到 2B 的模型,甚至比 3 个月前发布的 Qwen3.5-2B 效果还好,参数量却只有后者的一半。这个模型用 INT4 量化后权重文件只有 0.5GB,可以直接在手机和浏览器里跑。它的基础模型是...

推荐理由:HKR 三项都站得住:有具体参数、量化尺寸和端侧运行条件,反差也够。不过它终究是一次小模型发布,影响力到不了旗舰模型级别,所以 featured 和 78 分是合适的。

新智元 · 公众号

OpenAI 总裁回忆:奥特曼被罢免当天我就辞职了,起初觉得夺回公司只有一成胜算

Greg Brockman 在采访里复盘了 OpenAI 那场 72 小时宫斗。2023 年 11 月 17 号,董事会突然撤掉 Sam Altman 的 CEO 职位,同时把 Brockman 踢出董事会。他当天就辞职了,说当时估算把公司拿回来的概率只有 10%。正文因为微信页面需要验证,没能抓到更多细节,比如董事会具体用什么理由动手、员工联名信怎么...

推荐理由:这篇是 Brockman 对 2023 年 11 月那场宫斗的亲身复盘,不是第三方转述。他给出了辞职时间点和 10% 概率这两个新细节,对理解当时董事会决策的混乱程度有帮助。不过事件本身已经过去一段时间,信息增量集中在个人视角而非技术或产品层面,所以重要性停在 76 分这个区间是合理的。

r/LocalLLaMA

Shard:把 KV 缓存压到原来的十分之一,长上下文推理更省显存

Shard 这套方法能在 Llama-3.1-8B 上把 KV 缓存占的显存砍掉约 90%。具体来说,8K 上下文长度时压缩比约 10 倍,拉到 32K 时能到 11 倍。技术路线分两路:对 Key 矩阵先用 PCA 降维再做 int4 量化,对 Value 矩阵则用 Hadamard 旋转配合向量量化。论文在 NIAH 和 LongBench 两个基...

推荐理由:HKR 三项都站得住:10 倍 KV 缓存压缩是个好钩子,数字和模型、上下文长度、基准测试都列清楚了。信息目前只来自 Reddit 帖子,验证有限,所以分数压在 78–84 这个区间。正文没提压缩方法的具体实现和额外计算开销,这点先别太激动,等有人复现再说。

AI HOT 精选

OpenAI 被曝下月发 GPT-5.6,上下文窗口拉到 150 万 token

开发者在 OpenAI Codex 的后台日志里挖出了一个叫 iris-alpha 的未公开模型,对应 GPT-5.6,可能 6 月发布。最直观的变化是上下文窗口涨到 150 万 token,比现在 GPT-5.5 API 的 105 万多出约 43%。有人在辅助工具 OpenCode 里实测,喂到 90 万 token 还能流畅回话,甚至能处理超过 ...

推荐理由:这条消息来自 Codex 日志泄露,不是官方公告,所以我会先打个折。但 150 万 token 的上下文窗口和 iris-alpha 代号都是实打实的数字,对做 agent 和长文档处理的人有直接参考价值。正文没提发布时间和定价,这点先别太激动。整体属于值得从业者扫一眼的更新,但还没到必须立刻行动的程度。

AI HOT 精选

苹果被曝用定制版 1.2 万亿参数谷歌模型改造 Siri,简单问题仍跑本地

爆料说苹果下一代 Siri 的核心换成了一个定制的谷歌大模型,参数规模 1.2 万亿,比大家猜的 Gemini 3.5 Flash(约 3000 亿参数)大好几倍。复杂任务会交给这个大模型,简单查询还是留在手机上跑。苹果现在最头疼的是日常问题的响应速度,大模型再聪明,回慢了也没人用。另外,下个月 WWDC 可能会官宣 Apple Intelligenc...

推荐理由:这篇就一个 X 上的爆料,给了些架构细节但没附源文件、没提上线时间和功能范围,所以我会先打个折。1.2T 参数这个数字挺具体,但正文没解释是总参数还是激活参数,也没说模型怎么裁出来给手机用。简单查询跑本地、复杂任务走云端这个分工听着合理,不过延迟到底压到多少、在哪些机型上能跑都没交代。这点先别太激动,等有实测或官方确认再往上调。

5月25日星期一

r/LocalLLaMA

RTPurbo:用几百步训练把全注意力模型转成稀疏推理,长上下文预填充快 9.36 倍

这篇论文提出 RTPurbo,能把原本用全注意力的模型改成稀疏注意力来跑推理,而且只需要几百步训练。做法是只给“检索头”保留完整的 KV 缓存,其他头用一个 16 维的 token 索引器来近似,相当于大幅压缩了要存要算的内容。在 100 万 token 的长上下文场景下,预填充阶段最高快了 9.36 倍,解码阶段快了约 2.01 倍。正文没披露具体用...

推荐理由:我会先打个折:目前只有 Reddit 讨论,正文没披露模型规模、具体任务和代码,验证强度偏弱。但“几百步把全注意力转稀疏”这个思路本身挺省钱的,数字也够具体,对做长上下文推理优化的人值得看一眼。信息缺口明显,所以分数没往上拉。

量子位 · 公众号

Reasonix 给 DeepSeek V4 加了个缓存层,长代码任务里缓存命中率 99.82%,成本打到两折

正文页面被微信环境验证挡住了,看不到具体技术细节。从标题和摘要看,Reasonix 这个工具用了一种“只追加不修改”的循环机制来给 DeepSeek V4 做缓存。在长代码会话场景里,缓存命中率报到了 99.82%,相当于模型每次生成新内容时,前面绝大部分上下文都不用重复计算。一个原本要烧掉 400M token、花 61 美元的任务,用上这套缓存后账...

推荐理由:Reasonix 这个工具把 DeepSeek V4 长会话的缓存命中率拉到 99.82%,账单直接打两折,从 61 美元降到 12 美元。对用 DeepSeek 跑长任务的团队来说,成本降幅很实在。不过正文没披露测试场景的会话长度和任务类型,也没说这个命中率在不同负载下稳不稳,所以先别当通用结论。

Hacker News 首页

AI 芯片成本结构变了:内存开销已占到近三分之二

Epoch AI 估算,从 2024 年第一季度到 2025 年第四季度,高带宽内存(HBM)在 AI 芯片物料成本里的占比从 52% 涨到了 63%。这个数字是拿英伟达、AMD、谷歌和亚马逊四家的 AI 芯片按出货量加权平均算出来的。同期逻辑芯片的成本占比基本没动,在 13% 左右;先进封装从 19% 降到 15%,其他辅助部件从 15% 降到 9%...

推荐理由:这个标题本身就是一个有冲击力的结论,我会先打个折——因为正文只给了链接、68 分和 71 条评论,完全没写这个“近三分之二”是怎么算出来的、统计的是哪种芯片、在什么时间点。如果是真的,那意味着内存成本已经压过计算单元,对推理优化和硬件定价影响很大;但信息缺口太大,现在只能当一个值得追问的信号,不能当定论。

5月24日星期日

r/LocalLLaMA

OpenBMB 在华为昇腾 NPU 上把大模型从头训成 1.58-bit,8B 模型性能保住全精度 97%

OpenBMB 放出了 BitCPM-CANN,一个在华为昇腾 NPU 上原生跑通的 1.58-bit(三值)大模型训练方案。他们用和 MiniCPM4 一样的架构与数据,从零训了 0.5B、1B、3B、8B 四个尺寸。1B 到 8B 的模型在 11 个测试集上平均保住了全精度模型 95.7% 到 97.2% 的性能,3B 版本在 BBH 上打平,3B...

推荐理由:我会先打个折:目前只有 Reddit 帖子作为来源,没有吞吐量、显存占用或复现细节,所以先放在 featured 的底线。但这条信息本身挺实在——OpenBMB 在昇腾 NPU 上从零训练了四个 1.58-bit 的模型,不是推理时量化,而是训练阶段就压到极低比特。1B 到 8B 的性能保留率都在 95% 以上,说明这条路在国产硬件上走得通。对需要控制训练成本、又绑在昇腾生态里的团队来说,这是个值得跟的信号。

r/LocalLLaMA

KV 缓存量化对模型伤害不大,权重量化才是大头:Qwen3.6 27B 的一次小测试

Reddit 用户 hopbel 拿 Qwen3.6 27B 在 wikitext-2 上跑了一组 16k 上下文的近似 KLD 测试,想看看 KV 缓存量化和模型权重量化哪个更影响输出质量。他用 Q5_K_M 权重当基准,对比了两组配置:一组是 Q5_K_S 权重配 q4_0 的 KV 缓存,KLD 分数 0.016304;另一组是 Q4_K_XL ...

推荐理由:这篇 Reddit 帖子自己跑了一组对比实验,结论挺直接:KV 缓存量化带来的质量损失没那么可怕,模型本身的量化等级才是大头。数据给得清楚,Q5 模型加低精度 KV 缓存,KLD 反而比 Q4 模型加全精度 KV 缓存更低。我会先打个折,这只是一个模型在 wikitext-2 上的近似 KLD,不是严格消融实验,但作为一手测试,对玩本地部署的人有参考价值。正文没披露推理速度或显存占用的具体数字,这点比较可惜。

5月23日星期六

机器之心 · 公众号

FlashAR 用 0.05% 的训练数据,把自回归图像模型的生成速度提了 22.9 倍

浙大和阿德莱德大学搞了个 FlashAR,专门给预训练好的自回归图像模型加速。拿 Emu3.5-Image-34B 试了一下,生成一张 512×512 的图,原来要 130.10 秒,现在只要 5.68 秒,快了 22.9 倍。而且只用了原始训练数据量的 0.05% 做微调,GenEval 分数从 80.48 变成 80.29,画质基本没掉。正文没披露...

推荐理由:FlashAR 用极少量数据给预训练好的自回归图像模型做加速,速度提升 22.9 倍,质量几乎没掉,对在意推理延迟和成本的团队是个好消息。论文给了具体数字和 GenEval 对比,信息量够,但正文没披露这 0.05% 数据具体怎么选、不同分辨率下是否同样有效,这点先别太激动。整体是扎实的推理优化工作,不是顶级实验室的模型发布,放 featured 合适。

机器之心 · 公众号

Bengio 团队新论文:用多条并行思路链做递归推理,效果比单条串行推理好

这篇论文提出了 GRAM,一个会生成多条内部推理轨迹、再从中挑出最优解的递归模型。在极难数独测试上,GRAM 用 16 步递归、同时跑 20 条并行思路,准确率达到 97.0%;作为对比,传统串行递归模型 TRM 要跑到 320 步才做到 90.5%。简单说,就是让模型多想几条路再选,比闷头一条路走到黑更靠谱,而且推理步数还少得多。不过正文没披露具体的...

推荐理由:Bengio 团队这篇新论文拿数独极端难度当试金石,用 GRAM 把递归推理的上限拉高了一截。核心卖点是并行轨迹比长串行更有效:16 步递归配上 20 条并行采样,准确率 97.0%,而对比的串行方法要跑 320 步才到 90.5%。我会先打个折——这只是在单一任务上的结果,泛化到其他推理场景还没验证,正文也没披露并行采样的实际计算开销和延迟。但思路本身对做推理加速的人有参考价值,尤其是想用多条短路径替代一条长路径的时候。

Mistral AI

Mistral 收购 Physics AI 公司 Emmi AI

Mistral AI 宣布已达成收购 Physics AI 先驱 Emmi AI 的最终协议,以强化其作为工业企业 AI 转型伙伴的定位。Emmi AI 成立于奥地利,专注物理 AI 与大型工程模型,可加速工程工作流、以实时仿真替代多日计算并构建数字孪生。Emmi 的联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。

推荐理由:Mistral 通过收购 Physics AI 公司 Emmi 补强工业仿真能力,读者可了解其向工程与制造场景延伸的路径。

量子位 · 公众号

DeepSeek V4 继续打价格战,缓存输入每百万 token 只要两分五;宁德时代、京东、网易在谈投资,梁文锋说目标是通用人工智能

DeepSeek-V4-Pro 的 API 从 6 月 1 日起维持促销价,缓存输入每百万 token 收 0.025 元人民币,这个价格在同类模型里算很低了。彭博社的消息说 DeepSeek 正在谈一轮 700 亿人民币的融资,投前估值 450 亿美元,宁德时代、京东、网易都有意参与。创始人梁文锋对外表态,公司的目标还是通用人工智能(AGI)。不过原...

推荐理由:这条消息把两件事串起来了:一是 DeepSeek V4 的 API 价格直接砍到促销价,输入缓存命中每百万 Token 只要 0.025 元,对用 API 做产品的团队来说成本降幅明显;二是彭博说宁德时代、京东、网易都在看这轮 700 亿融资,投前估值 450 亿美元,梁文锋还放了话目标是 AGI。价格数字和融资规模都够具体,没有模糊表述,对关注模型成本和资本动向的从业者来说信息密度高,所以给了 90 分。

r/LocalLLaMA

club-rdna16:一个在 16GB AMD 显卡上实测本地大模型的仓库

这个仓库用一张 RX 6900 XT(16GB 显存)跑 llama.cpp,后端是 ROCm/HIP,专门验证 AMD 卡在本地跑大模型的实际表现。目前放出的一个亮点是 Qwen3.6 35B-A3B 这个 MoE 模型,用 q8 格式缓存 KV 状态,能稳定撑到 131k 上下文窗口。正文没披露具体的推理速度、功耗和温度数据,所以性能上限和日常可用...

推荐理由:这是一条 Reddit 帖子,不是论文或官方报告。作者把测试仓库公开了,但正文只给了能跑起来的配置条件,没放推理速度、显存占用曲线或可复现的完整日志。我会先打个折:它证明了 16GB A 卡跑大上下文 MoE 模型可行,这点挺省钱,但别急着当生产参考,信息缺口还很大。HKR 三项都踩中了,作为一条给本地 LLM 玩家的实操线索,上 featured 没问题。

AI HOT 精选

黄仁勋说 AI 基建年开支会冲到 4 万亿美元,比华尔街共识高了四倍

黄仁勋在英伟达财报电话会上抛出一个数字:超大规模云厂商的 AI 基建年开支会从现在的 1 万亿美元涨到 3 到 4 万亿,CFO 给的时间线是 2030 年前。华尔街分析师原本的共识是 2028 年才到 1.03 万亿,老黄直接翻了四倍。一季度谷歌、亚马逊、微软三家资本开支加起来已经超过 1100 亿美元,Meta 更是把全年预算拉到 1450 亿,结...

推荐理由:黄仁勋说的 3-4 万亿美元是 CEO 预测,不是已发生的模型发布或产品落地,所以分数压在 78-84 这个区间。数字本身有信号价值——它把云厂商的烧钱速度量化了,也间接给英伟达的营收预期撑腰。但正文没披露这个 4 万亿是怎么算出来的,也没说时间节点,这点先别太激动。

AI HOT 精选

智能体工作负载正在改写推理成本账本

SemiAnalysis 扒了 43.2 万条真实编码智能体的请求记录,输入 token 的中位数不是大家常说的 3.2 万或 6.4 万,而是 9.6 万。这个量级意味着模型在接到你的问题之前,已经吞下了比《了不起的盖茨比》全书还长的上下文。正文没披露用了哪些模型、成本曲线、采样方式和统计时间窗口,所以这个数字先当个参考,别急着拿它算账。

推荐理由:HKR 三项都过:SemiAnalysis 拿出了一个 43.2 万条编码智能体请求的数据集,中位输入 9.6 万 token,这个数据点本身够硬。但模型、成本曲线、采样方法全都没说,所以只能算强数据点,到不了必写级别。

r/LocalLLaMA

llama.cpp 新分支让 MoE 模型在 12GB 显存上跑得更快,RTX 2060 上速度从 19/22 tk/s 提到 26 tk/s

comanderxv 给 llama.cpp 开了个叫“experts first”的分支,专门优化混合专家模型(MoE)的显存调度。做法是把常用的专家模块提前缓存到显存里,实测用 RTX 2060(12GB 显存)跑 Qwen3.6-35B-A3B 模型,专家缓存命中率约 62%,生成速度从原来的 19 或 22 token/秒提升到了 26 tok...

推荐理由:HKR 三项都踩中了:钩子是一块 12GB 的老卡把 35B MoE 速度拉上来一截,有缓存机制和命中率数据撑着,话题又打在本地推理的成本神经上。不过这事目前还局限在本地推理的小圈子,所以放在 featured 档刚好,不用拔到必读。

5月22日星期五

Hacker News 首页

DeepSeek 把 V4 Pro 的 75 折促销变成永久降价了

DeepSeek 在定价页更新了一条脚注:V4 Pro 模型现在的 75 折优惠在 2026 年 5 月 31 日结束后,会直接变成正式价格,也就是原价的四分之一。具体来说,输入 token(没命中缓存)从每百万 1.74 美元降到 0.435 美元,输出 token 从 3.48 美元降到 0.87 美元。缓存命中的输入价格更便宜,只要 0.0036...

推荐理由:我会先打个折:这条消息的钩子很足,永久四分之一价直接挑动价格战神经,对开发者钱包影响大,所以 H、K、R 都成立。但正文没披露具体单价,信息缺了一块,没法判断实际便宜到什么程度,所以只够 featured 门槛,算不上必写的大新闻。

Dwarkesh Patel 播客

从逻辑门到 AI 芯片:Reiner Pope 的芯片设计黑板课

MatX 的 CEO Reiner Pope 从最底层的与、或、非逻辑门讲起,一步步拆解 AI 芯片到底怎么工作。他先用一个 4 比特乘 4 比特、再用 8 比特累加的例子,演示了乘法累加(MAC)运算在电路里长什么样——这其实就是矩阵乘法的基本动作,AI 芯片绝大部分时间都在干这个。接着聊到数据搬运比计算还贵,所以芯片里要用多路复用器(mux)来省连...

推荐理由:Dwarkesh 这次访谈没讲空话,Reiner Pope 从最底层的门电路开始,一步步解释怎么为 AI 推理专门设计芯片。我会先打个折:这不是产品发布或行业爆料,更像一堂硬核科普,所以分数不会给到新闻级。但内容密度很高,把脉动阵列、数据流和 ASIC 的取舍都讲透了,对做推理优化的人有实际参考价值。正文没披露 MatX 芯片的具体性能指标,这点先别太激动。

Mistral AI

Mistral 在 Studio 发布 Connectors,支持内置与自定义 MCP

Mistral 在 Studio 发布 Connectors,所有内置连接器和自定义 MCP 现可通过 API/SDK 用于全部模型与智能体调用。新功能包括直接工具调用、human-in-the-loop 审批流程,以及对连接器的创建、修改、列出和删除等编程访问。

推荐理由:原文给出 Connectors 的 API 用法与代码示例,读者可据此判断企业级 MCP 集成如何落地。

AI HOT 精选

首个在华为昇腾910B上全栈训练的1.58比特开源模型BitCPM-CANN发布

ModelBest、清华和OpenBMB搞了个BitCPM-CANN,从0.5B到8B都有,全程用华为昇腾910B NPU训练,没走英伟达路线。1.58比特三元量化意味着每个权重只取三种值,内存比BF16省了约6倍,能塞进手机、电脑和车载设备里跑。基准测试成绩保住了全精度模型的95-97%,这点挺实在。我会先打个折:正文没披露具体推理延迟和功耗数据,也...

推荐理由:HKR三项都站得住:昇腾910B全栈训练1.58比特开源模型这个角度够新,数据也扎实。没给P1是因为目前只有发布事实,缺少独立复现或实际落地效果的佐证,所以先放在featured。

Latent Space

AI 基础设施又添独角兽:Exa、Modal、TurboPuffer 三家同时拿到大额融资

这期主要聊了三家 AI 基础设施公司的融资进展。TurboPuffer 先确认年经常性收入达到 1 亿美元并且已经盈利,这个数字说明做向量数据库的生意可以自己造血了。Exa 完成了 2.5 亿美元的 C 轮融资,估值 22 亿美元,他们做的是 AI 搜索引擎。Modal 融了 3.55 亿美元,估值冲到 47 亿美元,业务是帮开发者更方便地跑模型和部署...

推荐理由:Latent Space 这条汇总把三笔 AI 基础设施融资串在一起,信息密度高。TurboPuffer 做到 1 亿美元年经常性收入并且盈利,说明向量搜索这类基础能力已经有客户愿意持续付费,不是纯烧钱。Exa 拿 2.5 亿美元 C 轮、估值 22 亿美元,Modal 拿 3.55 亿美元 C 轮、估值 47 亿美元,两笔都是大额后期融资,反映资本在往模型训练和推理的底层平台集中。对做 AI 应用的人来说,这些数字能帮你判断下游供应商的稳定性和议价空间。正文没展开各家具体技术指标或客户构成,所以估值背后的溢价逻辑只能看个大概,这点先别太激动。

AI HOT 精选

智谱发布 GLM-5.1 高速版,API 输出冲到每秒 400 个 token

智谱在 5 月 22 日给部分企业客户开放了 GLM-5.1-highspeed 接口,输出速度标称 400 tokens/s,说是目前大模型厂商里最快的。过去跑得快的模型通常能力会打折,这次智谱声称把旗舰模型的能力和低延迟同时塞进了生产环境。提速主要靠 GLM 团队和 TileRT 团队在三个层面做的系统优化:推理引擎重写了核心路径来提升单卡吞吐;调...

推荐理由:智谱扔出一个 400 tokens/s 的 API 速度数字,说是全球纪录,我会先打个折——正文没披露测试条件、并发数、上下文长度和定价,这些缺口让“纪录”暂时只能当个参考。但 GLM 和 TileRT 联手做系统级优化这件事本身有信息量,说明国产模型在推理加速上开始卷工程落地,不只是卷榜单。对从业者来说,速度快意味着同样任务花钱少、等得短,这点先别太激动,等看到实际压测和价格再判断值不值得切。

纽约时报中文网

特朗普松口卖芯片,北京反而拦着不让买

特朗普半年前批准英伟达向中国卖 H200 芯片,但北京至今没让任何一家公司下单,反而把企业往华为、寒武纪等国产替代上推。文章说这背后是中美技术脱钩的深度不信任:中国想借机逼本土芯片产业提速,企业则抱怨算力不够是最大瓶颈。现在国内芯片性能号称已追上 H200,但良率跟不上,所以很多公司只能租用境外数据中心的英伟达芯片远程训练模型——速度慢、数据泄露风险高...

推荐理由:HKR 三项全中:批准后六个月零采购,加上北京明确引导企业转向华为、寒武纪,这是很强的芯片政策信号。不过它毕竟不是模型发布或重大产品更新,所以分数放在 78–84 区间,82 合理。

Computing Life · Share · 鸭哥调研

DS4 引擎让 DeepSeek V4 Flash 在 Mac 上跑起来了,还解决了 agent 对话的“失忆”问题

DeepSeek V4 Flash 是个 284B 总参数、13B 激活的 MoE 模型,性能接近前沿水平,但主流推理引擎在 Mac 上都跑不了。antirez 专门为它写了 DS4 引擎,纯 C、Metal 优先,一个编译命令就能用。它最特别的地方是解决了 agent 工作流里的上下文断裂:模型生成工具调用时,DS4 会记住原话,下次 agent 返...

推荐理由:标题和摘要给的期待是“在 Mac 上本地跑 DeepSeek V4 Flash 的实操方案”,但正文只列了 DS4 引擎的三项机制名称,没给出模型大小、实际性能、Mac 兼容性要求,也没有可复现的测试结果。我会先打个折:对想动手试的开发者来说,知道有这些机制存在已经算有用信息,但离“能照着做”还差关键数据。H、K、R 三项都踩中了,信息缺口也明显,放在 featured 层级刚好——够吸引人点进去看,但读完会发现缺胳膊少腿。

Computing Life · Share · 鸭哥调研

智谱 GLM-5.1 API 跑到每秒 400 个 token,靠的不是优化,是换了一套执行逻辑

智谱在 5 月 22 日放出了 GLM-5.1 高速版 API,输出速度标称 400 tokens/s,是人类阅读速度的 80 倍以上。这个速度不是靠传统编译优化“调”出来的,而是底层的 TileRT 推理引擎把 GPU 的工作模式从“批处理车间”改成了“连续流水线”——取消计算步骤之间的等待和隔离,让数据持续流动,GPU 不再频繁启停。模型本身也做了...

推荐理由:400 tokens/s 是个好钩子,但正文没交代测试条件、并发数、输入长度和计费规则,所以速度先打个折看。TileRT 的说法有信息量,不过没展开具体怎么重构执行模型,技术细节偏薄。整体对从业者有提醒价值,但缺少独立验证,所以分数停在 78 不动。

r/LocalLLaMA

这篇论文主张:输入处理用低精度加速,输出生成用高精度保质量

论文 arXiv 2605.20315 提出一个混合精度策略:在预填充阶段用 W4A4 量化,理论上能把输入处理速度提升 4 倍;但解码阶段仍用原始高精度,因为激活值的量化误差会扰动采样出的 token,并在自回归生成中逐步累积,导致输出质量下降。正文没披露具体实验模型和数据集,也没给出实际延迟或吞吐数据,所以这 4 倍目前只是理论估算,实际能省多少还...

推荐理由:这篇论文的卖点是“前段省、后段稳”:预填充用 W4A4 量化,理论上能换来 4 倍加速,解码时再切回高精度,防止误差递归累积把回答搞崩。思路本身挺直接,但正文只给了理论增益,没披露实测吞吐、困惑度变化和具体硬件环境,所以实际能省多少、质量掉多少还不清楚。我会先打个折,等看到实测数据再判断值不值得跟。

NVIDIA 博客

NVIDIA 在 COMPUTEX 2026 拿了四个奖,Vera Rubin NVL72 号称推理能效比上代高 10 倍

NVIDIA 在 COMPUTEX 2026 上靠 Vera Rubin NVL72、Jetson Thor 和 Alpamayo 拿了四个 Best Choice 奖。Vera Rubin NVL72 把 36 颗 Vera CPU 和 72 颗 Rubin GPU 连在一起,NVIDIA 说它每瓦推理性能是上代的 10 倍,每个 token 的成本...

推荐理由:我会先打个折:这是 NVIDIA 自己活动博客发的,不是第三方实测,10 倍能效得看什么负载、跟谁比。但 Vera Rubin NVL72 的规格和能效数字本身够硬,对算力成本和采购节奏有直接参考价值,所以给 featured。正文没披露具体基准测试条件和上市时间,这点先别太激动。

5月21日星期四

r/LocalLLaMA

Fireworks 提出“Agent 执行税”:浏览器智能体跑任务时,22.9% 的推理算力都浪费了

Fireworks 在 WebVoyager 上跑了 720 个浏览器智能体任务,发现平均有 22.9% 的推理调用属于无效消耗,他们管这个叫“Agent 执行税”——也就是为了完成任务,模型多做的无用功。具体到各家模型:MiniMax M2.5 每成功完成一个任务的成本比 Gemini 低了 2.3 倍;GLM-5 的任务成功率做到 57.1%;Ki...

推荐理由:HKR 三项都站得住:它把一个跑分现象包装成了可复用的采购指标,有具体数字支撑,而且直接回应了从业者在选型时对隐性成本的焦虑。信源是 Fireworks 自己的博客和 Reddit 讨论,不是第三方独立评测,所以重要性停在 74 分 featured 档,没往上拉。

r/LocalLLaMA

LLM 硬件规划器:按你的用途、模型或预算挑一套跑本地模型的机器,或者给现有机子选模型

totosse17 做了一个叫 LLMRequirements 的硬件规划工具,整理了 60 多套装机方案、50 多个模型,还附了 130 多个有来源标注的每秒 token 生成速度、150 多个评测视频。它会标每套配置的待机功耗和满载功耗,价格覆盖多个地区,数据放在 GitHub 上公开更新。不过 Reddit 原帖正文被屏蔽了,具体界面长什么样、交...

推荐理由:这是一个 Reddit 社区作者做的本地 LLM 硬件规划器,不是大厂产品发布,但信息密度很高。我会先打个折:它更像一个持续更新的公开数据集和参考表,不是一键自动优化的工具。正文没披露数据更新频率的具体机制,但 130 多个 tok/s 来源和 150 多个评测视频让它比一般论坛帖子可信不少。对想自己攒机器跑模型的人来说,功耗和地区价格都列出来,省得自己到处翻,这点挺实在。