跳到正文

#部署/工程

今日 3 条

5月18日星期一

Import AI

AI界的震网病毒、有缺陷的Muon优化器,以及“正向对齐”

SentinelOne拆解了一个叫fast16.sys的老病毒,它专门篡改高精度计算软件在内存里的结果,可能被用来破坏核武器开发等工程模拟,在震网病毒出现前五年就已存在。Tilde Research发现流行的Muon优化器有个致命缺陷:训练初期会导致MLP层里超过四分之一的神经元永久“死亡”,再也救不回来。他们提出的替代方案Aurora优化器,在11亿...

推荐理由:HKR 三项全中:标题钩子够怪,fast16 和 Aurora 的实测数字也摆出来了,安全与优化器的利害关系讲得清楚。没给更高分是因为这期属于多话题的 newsletter 汇总,不是单一重大发布或行业事件。

r/LocalLLaMA

Qwen 3.6 27B 在 24G 显存上的部署实测:后端、量化方案与参数对比

作者用一张 RTX 3090 24GB 跑 Qwen 3.6 27B,最终留用了 ik_llama.cpp 搭配 Qwen3.6-27B-MTP-IQ4_KS.gguf 这个量化版本。在 156k 上下文、q8_0 KV 缓存并开启 MTP 的设置下,输入约 5900 token 的提示、生成 1024 token 时,预填充速度约 1261 tok/...

推荐理由:这是一篇个人实测,不是官方发布,所以传播面窄一些,但信息密度很高。作者在单张 3090 上把 Qwen 3.6 27B 压进 24GB 显存,还跑通了 156k 上下文,最终选了 ik_llama.cpp 加 IQ4_KS 量化。prefill 能到 1261 tok/s,decode 72.9 tok/s,对本地部署来说相当可用。后端对比部分把 llama.cpp 系和 vllm 的取舍讲清楚了,对想自己搭推理服务的人有直接参考价值。我会先打个折:这只是单人单卡的一次测试,没有多卡、没有生产环境压测,但作为选型参考够用了。

机器之心 · 公众号

华为 GTS 在 ICML 2026 发了一篇用推理熵值动态挑训练样本的方法,Amazon 和 Google 的作者也跟进了类似思路

这篇论文提出了一种叫 EDCO 的动态课程微调方法,核心是用模型推理时的“熵值”来判断样本难度,自动挑出当前模型最该学的数据,而不是靠人手动分阶段。他们搞了个前缀熵值估算,把每一条样本的评分时间从 2.24 秒压到了 0.37 秒,省了不少算力。文章本身因为微信环境异常没抓到正文,具体实验数据、在什么任务上验证的、以及 Amazon/Google 团队...

推荐理由:我会先打个折:这还是个训练方法论文,不是模型或产品发布,所以分数没给更高。但它的钩子很足——华为提出 EDCO,用推理熵动态挑样本,Amazon 和 Google 的人光速跟进,说明这个方向在圈内被盯上了。核心卖点是前缀熵估计,把单样本耗时从 2.24 秒砍到 0.37 秒,省了八成多时间,对做微调的人来说是实打实的成本优化。正文没披露这个方法在大规模多任务上的泛化验证,这点先别太激动,但思路本身对数据筛选和训练成本敏感的场景很有启发。

r/LocalLLaMA

vLLM 在混插 Blackwell/Ada 显卡集群上跑长上下文预填充,速度比 llama.cpp 快 4 到 6 倍

作者用 7 张混插显卡(RTX PRO 6000、PRO 5000、两张 5090 和三张改显存的 4090)测了三个推理引擎处理长上下文的效率。在 Qwen3.5-397B-A17B 模型上塞进 7.5 万 token 的上下文,vLLM 首 token 延迟 9.8 秒,预填充速度 7683 token/秒;llama.cpp 要 57.2 秒,速...

推荐理由:作者在 7 卡混合集群上测长上下文预填充,397B 模型塞进 75k tokens,vLLM 9.8 秒出第一个 token、跑到 7683 t/s,llama.cpp 要 57.2 秒、只有 1319 t/s。我会先打个折:这是单人单次跑分,没披露 prompt 复杂度、batch size 和精度配置,SGLang 的数据也没给全。但 6 倍的 TTFT 差距和近 6 倍的吞吐差距,对正在选推理框架的团队是个硬参考。正文没提功耗和显存占用,这点先别太激动。

r/LocalLLaMA

骁龙 8 Elite 跑混合专家模型实测:CPU 推理反而比 NPU 快

一位 Reddit 用户用 24GB 内存的荣耀 Magic 7 Pro(骁龙 8 Elite)跑了几个混合专家(MoE)模型。在 Q4 量化下,LFM2-24b-a2b 跑到约 24 token/秒,Gemma 约 11 token/秒。比较意外的是,他这套配置里 CPU 推理速度比 NPU 和 GPU 都快,正文没披露具体用的什么推理框架和功耗数据...

推荐理由:这条来自 Reddit 个人测试,不是官方数据,权威性弱,但信息量够:24GB 手机、Q4 量化、LFM2-24b-a2b 跑 24 token/s、Gemma 跑 11 token/s,CPU 比 NPU/GPU 快。对想在手机上本地部署的人有参考价值,不过只有一台设备的数据,别当普遍结论。给 featured 低分段,因为话题热、数据具体,但来源单一。

Google DeepMind

Google Antigravity 2.0 发布

Google 发布智能体开发平台 Google Antigravity 2.0。该平台在 Google DeepMind 官网被列为面向开发者的 agentic development platform,与 Gemini 应用、Google AI Studio 并列。原文未披露版本功能、参数或可用性细节。

5月17日星期日

量子位 · 公众号

一只机器狗,把英伟达的算力王座拱翻了

蔚蓝科技发了款消费级机器狗 BabyAlpha A3,用六颗芯片搭了个异构计算集群,直接在本地跑 7B 参数的大模型,推理速度到 280 TPS。视觉上配了 6600 万像素的摄像头,每秒能扫出 223.2 万个点云数据点,计划第三季度上市。不过正文因为环境验证没抓到具体内容,上面这些数字都来自外部摘要,实际表现和定价还没法核实。

推荐理由:我会先打个折:正文是单篇产品发布稿,没披露功耗、价格和对比基准,所以别太激动。但这条消息确实有料——蔚蓝科技在机器狗里塞了6颗芯片搭异构集群,本地跑70亿参数模型,推理速度标到280TPS,Q3就要上市。对做端侧部署和机器人的人来说,这等于给“离了英伟达行不行”提供了一个实物样本。信息缺口也很明显:没写具体芯片型号、没给功耗数据、没说明280TPS是在什么精度和batch size下测的,这些都会影响实际可用性。综合来看,角度抓人、事实具体、但验证信息不足,放在featured门槛上刚好。

r/LocalLLaMA

同批模型在 Strix Halo、RTX 3090 和 RTX 5070 上的实测对比

一位用户自己跑了 55 组本地推理测试,覆盖 Strix Halo、RTX 3090 和 RTX 5070 三块卡、五种推理后端,模型从 0.35B 小不点到 35B-A3B 混合专家都有。结论很直接:能塞进 12GB 显存的模型,RTX 5070 比 RTX 3090 快;但到了 14B 到 31B 这个区间,模型超过 12GB 又刚好能装进 24G...

推荐理由:这篇值得看,因为作者没抄官方数据,自己跑了 55 组对比。我会先打个折:来源是 Reddit 单人帖,不是严格受控实验,但结论很实用。12GB 显存以内 RTX 5070 解码比 3090 快,14B 到 31B 模型区间 3090 反超,说明大模型推理 3090 的大显存优势还在。Strix Halo 的加入让 AMD 方案也有了参照。正文没披露功耗和价格,所以别直接当购买建议,但作为选卡参考够直接。

Dwarkesh Patel 播客

预训练并行策略与翻车训练笔记

这篇笔记聊了两件事:预训练为什么容易跑崩,以及怎么把训练拆到多张 GPU 上。跑崩的核心原因有两个——破坏因果性和引入偏差。比如 MoE 路由里用专家选择(expert choice)分配 token,会让 token n 的去向依赖 token n+k 的路由结果,训练时看到了推理时看不到的信息;token 丢弃也会让后面的 token 影响前面的处...

推荐理由:Dwarkesh 这期笔记把预训练里容易翻车的地方摊开讲:expert choice 和 token dropping 会破坏因果性,FP16 集体通信能把一万次累加算偏,这些坑不踩过很难意识到。我会先打个折——它更像从业者之间的经验交换,不是系统性的技术报告,但给的数字(6ND、288GB、参数量×3)对算成本和排故障都有用。正文没展开具体实验验证,所以别当定量结论用。

5月16日星期六

Latent Space

Cerebras 上市市值冲到 600 亿美元,CFO 说已经在跑 OpenAI 的万亿参数内部模型

Cerebras 这次 IPO 收盘市值 600 亿美元,算是给坚持做大芯片的团队一个交代。CFO Bob Komin 公开说他们已经在服务万亿参数级别的模型,点名了 OpenAI 内部用的 5.4 和 5.5 版本,想打破“只适合小模型”的标签。不过正文没披露这些工作负载占多少流量、延迟在什么水平、单 token 成本多少,也没提晶圆供应受限的具体影...

推荐理由:Cerebras上市冲到600亿美元市值,CFO Bob Komin放话说他们已经在跑万亿参数的模型了,还点名了OpenAI内部用的5.4和5.5。我会先打个折:正文没披露5.4/5.5的具体规模、训练成本或实际性能,也没说Cerebras在这类模型里占多大份额,所以“服务万亿参数模型”更像一张路线图门票,别直接当成收入证明。但这条消息把IPO热度、算力硬件竞争和前沿模型进展串在一起,对关注推理芯片和训练基建的人挺有嚼头。

r/LocalLLaMA

Orthrus-Qwen3-8B:冻住 Qwen3-8B 主干,加一个扩散注意力头,一次前向最多吐出 7.8 倍的 token,输出分布数学上可证明不变

这个工作把 Qwen3-8B 的原始参数完全冻住,只额外训练一个扩散注意力头,让模型一次前向能生成多个 token,最高做到 7.8 倍。在 MATH-500 上实测 wall-clock 速度大约快了 6 倍。训练只动了 16% 的参数,用了不到 10 亿 token 的数据,在 8 张 H200 上跑了 24 小时。论文声称输出分布和原模型在数学上...

推荐理由:我会先打个折:这是单篇 Reddit 研究发布,没有论文或第三方复现,验证强度偏弱。但信息量够用——在 Qwen3-8B 冻结主干上加扩散注意力头,只训 16% 参数,8 张 H200 跑一天,MATH-500 上 token 吞吐最高提到 7.8 倍,墙钟时间约快 6 倍,而且输出分布可证明不变。这点先别太激动,正文没披露其他 benchmark 和更长序列下的表现,但推理加速和一致性这两点对本地跑模型的从业者来说很实在,所以放在 featured 里当个信号看。

彭博科技

Cerebras 上市首日涨了约 68%,公司市值冲到 670 亿美元左右,CEO 身家 32 亿美元

Cerebras Systems 在纳斯达克上市,是今年规模最大的 IPO。股价当天涨了约 68%,把公司市值推到了大约 670 亿美元。按这个市值算,CEO 手里的股份值 32 亿美元。这条是视频新闻,正文没披露具体的发行价、募资金额和公司营收数据,所以没法判断这个估值到底贵不贵。

推荐理由:Cerebras 这次 IPO 给 AI 算力生意标了个公开市场价:首日涨 68%,市值冲到约 670 亿美元。Bloomberg 这条是财富视角的短视频,不是技术深稿,所以信息量就这么多——正文没披露营收、毛利率或客户集中度,估值逻辑没法细拆。我会先打个折:数字好看,但别急着把它当成行业转折点。

5月15日星期五

r/LocalLLaMA

用 Jetson Orin NX SUPER 16GB 做了个完全离线的行李箱机器人,跑 Gemma 4 E4B,没联网也能聊

一个叫 Sparky 的行李箱机器人,核心是一块 Jetson Orin NX SUPER 16GB 的板子,跑的是 Gemma 4 E4B 模型(Q4_K_M 量化版,用 q8_0 做 KV 缓存)。首次响应延迟大概 200 毫秒,生成速度每秒 14 到 15 个 token,上下文窗口 12K。身上挂了 30 多个传感器,但没装 WiFi、蓝牙和蜂...

推荐理由:这是个 Reddit 上的个人项目帖,不是产品发布或论文,所以放在低 featured 档。我会先打个折:200ms 的缓存首 token 延迟和 14-15 tok/s 的生成速度,在 Jetson 上跑 4B 模型算是能用的水平,但别指望它反应飞快。30+ 传感器听起来唬人,正文没细说都是什么传感器、怎么融合的,这点先别太激动。真正有意思的是全离线跑 Gemma 4 E4B 还让机器人带“观点”,把本地推理做成了人格化交互,比单纯报参数好玩。

AI HOT 精选

X 把“为你推荐”的算法开源了,用的还是 Grok 同款 Transformer

X 在 GitHub 上公开了“For You”信息流的推荐管道,代码、预训练模型和内容理解服务都给了。核心是一套叫 Phoenix 的 Transformer 模型,基于 Grok 架构,负责给候选帖子打分。它会看用户最近跟谁互动,同时预测点赞、回复、转发这些行为的概率,揉成一个相关性分数。排序前会先捞候选内容,补上上下文,再让模型评分,最后做多样性...

推荐理由:HKR 三项都踩中了,但正文只说了开源和 Phoenix Transformer 打分机制,仓库细节、许可证、能不能复现都没提,所以先给 featured 里偏低的位子。

r/LocalLLaMA

实测外挂资料库客服机器人:最贵的模型表现最差,真正管用的是这几招

作者搭了一个客服用的外挂资料库(RAG)问答机器人,用模型当裁判打分,把质量分从 6.62 拉到了 7.88,同时单次会话成本从 $0.002420 砍到 $0.000509,降了将近八成。最反直觉的发现是:最贵的模型反而是表现最差的。真正起作用的动作包括给检索环节加日志、对召回的资料块做去重、收紧模型回答时对资料的依赖程度,以及用五款模型做了一轮横向...

推荐理由:我会先打个折:这是个人实验,不是大规模生产验证,样本量和场景都有限。但作者把调优过程拆得很细,从最贵的模型翻车开始,一步步讲怎么换模型、调检索参数、改 prompt,最后质量涨了成本还大降。对正在搭外挂资料库问答的工程师来说,这些实操细节比论文里的基准分有用得多。正文没披露具体用了哪些模型和评估集,这点有点可惜,但不妨碍它作为一份诚实的调参笔记入选。

r/LocalLLaMA

网友用百万级 token 实测 Qwen 3.6 35B MTP 版,速度比之前快了约一半

一位 Reddit 用户分三次跑了超过一百万 token 来测 Qwen3.6-35B-A3B 的多 token 预测(MTP)版本,上下文拉到 300k,量化用 KV Q8_0。他给出的结论是生成速度大概比之前测过的版本快了 1.5 倍。不过帖子正文被 Reddit 的安全策略挡了,看不到具体测试环境、硬件配置和任务类型,所以这个提速是在什么条件下跑...

推荐理由:一个 Reddit 用户拿 Qwen3.6-35B-A3B MTP 版跑了三轮百万 token 的测试,在 300k 上下文、KV Q8_0 量化下,速度大概是旧测试的 1.5 倍。这个多 token 预测版(一次预测多个 token)确实在本地跑出了可感知的加速,但正文没披露功耗、显存占用和不同量化级别的对比,所以这个 1.5 倍先别太激动,得看自己硬件上复现怎么样。帖子本身有细节、有实测,对想省钱跑长上下文的开发者有参考价值,但毕竟只是单篇个人测试,重要性我给 74。

彭博科技

OpenAI CFO 说算力越来越不够用,刚融完史上最大一笔私募钱可能还得再融

OpenAI 的首席财务官 Sarah Friar 公开表示,公司刚完成她所说的“史上最大私募融资”之后,可能还需要继续找钱,原因是算力缺口还在扩大,跟不上 AI 需求的增长速度。不过这篇报道的正文没有披露上一轮的具体金额、下一轮的目标规模和时间表,所以“最大”到底有多大、这次要融多少,目前都还不清楚。

推荐理由:我会先打个折:正文没披露具体金额、投资方和时间表,所以这不是一个落地的融资消息,更像 CFO 在放风试探市场。但 OpenAI 这种体量的公司,在拿到最大一笔私募钱之后还公开说不够用,本身就说明算力缺口比外界想的还大。对从业者来说,这意味着模型训练和推理的成本短期内不会降,算力租赁和自建集群的账要重新算。分数留在 featured 低位是合理的,因为信息不够实,但信号够强。

AI HOT 精选

微软在 OpenAI 身上已砸了超 1000 亿美元,纳德拉说当年没人敢跟

微软企业发展负责人在庭审中确认,公司对 OpenAI 的总投入已超过 1000 亿美元。这笔钱里,130 亿是直接给的原始投资,其余大部分是 Azure 云服务的基建和托管成本,而且很多钱是在 OpenAI 开始给微软分成之前就花出去了。作为回报,到 2025 年为止,微软通过集成 OpenAI 技术和 OpenAI 自身的云消费,总共创造了约 300...

推荐理由:这篇不是产品发布,而是把微软和 OpenAI 的财务底牌亮了出来。我会先打个折:1000 亿是累计投入,不是一次性烧掉的,但配上“没人下注”这句话,故事性就出来了。三个数字——投入、营收、分成上限——把合作的经济账讲得比较实,没有画饼。对从业者来说,这关系到 OpenAI 的算力成本会不会继续被微软掐着、云绑定有多深,以及微软自己怎么算这笔 ROI。正文没披露 300 亿营收的具体构成,这点先别太激动,但整体信息密度够,放在 featured 没问题。

AI HOT 精选

推理的一阶导数:不直接卖算力,但靠 AI 用量暴增的公司

Tom Tunguz 把 Datadog 和 Twilio 这类公司叫做“推理的一阶导数”——它们不直接卖模型推理算力,但客户跑 AI 跑得越猛,它们就赚得越多。Datadog 的 LLM 监控数据量一个季度几乎翻倍,6500 个 AI 客户只占总客户数的 20%,却贡献了约 80% 的年化收入。Twilio 则因为 AI 原生公司和传统企业都在用语音...

推荐理由:Tom Tunguz 把推理增长和 Datadog 的用量、收入集中度数据绑在一起讲,比纯评论多了数据支撑。文章是评论性质,没有新模型或产品发布,所以分数停在 72–77 这个区间。我会先打个折,因为 2500 亿这个数字正文没给具体测算逻辑,只能当方向性判断看。

AI HOT 精选

Claude API 提示预缓存:先预热系统提示,再让真实请求直接命中缓存,首 token 生成更快

一个减少长提示首 token 延迟的实用技巧。在用户请求到达前,先单独发一次系统提示给 Claude,让它把提示写进缓存,但跳过输出。等真实请求进来时,缓存已经热好,直接命中,省掉重复处理长提示的时间。正文没披露具体提速多少,但思路很直接,适合系统提示固定、用户提示多变的场景。

推荐理由:Claude API 搞了个提示预缓存,相当于提前把系统提示塞进缓存里热着,真实请求一来就能省掉首令牌的等待。正文没给出具体能省多少毫秒,也没说缓存能热多久、会不会额外计费,所以省钱效果先打个折看。整体是个实用的推理优化小更新,不是模型能力或大版本发布,放在 featured 里当个中等权重的消息刚好。

彭博科技

Cerebras 上市,成为今年最大 IPO

彭博科技 5 月 14 日的节目提到,AI 芯片公司 Cerebras 已经上市,是今年规模最大的 IPO。不过视频片段和文字摘要都没给出具体数字——融了多少钱、估值多少、发行价和交易所全都没提。想判断这笔交易到底有多大,还得等后续的公开文件。

推荐理由:Bloomberg Tech 只给了个标题,说 Cerebras 完成了今年最大规模的 IPO,但正文没写到底融了多少钱、估值多少、发行价多少、在哪上市。我会先打个折——信息缺口太大,没法判断市场实际反应。不过 Cerebras 上市本身对 AI 芯片赛道是个信号,尤其在大家盯着谁能跟 Nvidia 掰手腕的时候,所以这条还是值得放出来,但别对细节太激动。

彭博科技

AI 芯片公司 Cerebras 上市首日涨了 68%,是今年最大一笔 IPO

Cerebras 的股票周四在纽约收盘报 311.07 美元,比 185 美元的发行价高出 68%。这次上市一共融了 55 亿美元,是 2026 年目前为止规模最大的 IPO。正文没披露这 55 亿具体怎么花,也没提公司目前的营收或亏损情况。涨这么多说明市场现在对非英伟达路线的 AI 芯片兴趣很大,但单日涨幅受情绪影响重,我会先打个折看后续季度表现。

推荐理由:Cerebras 这次上市给 AI 算力市场扔了个公开报价:首日涨 68%,募了 55 亿美元,收盘 311 美元,比 185 美元的发行价高出一大截。我会先打个折——首日涨幅受情绪影响大,不代表长期估值稳,但至少说明公开市场现在愿意为“非英伟达”的 AI 推理芯片掏真金白银。正文没披露具体营收或客户集中度,这点先别太激动。对从业者来说,这条消息的价值在于:AI 芯片供应格局可能出现第二个可选项,后续要看它能不能在推理场景里把成本优势做实。

彭博科技

Cerebras 上市后 CEO 身家达 32 亿美元,成今年最大 IPO

Cerebras 的 IPO 让 CEO Andrew Feldman 手里的股份值 32 亿美元。这是今年到目前为止规模最大的上市。Feldman 之前卖过三家公司,还带过另一家上市,正文没披露这次 IPO 的具体发行价、募资额、公司总估值和发行股数。

推荐理由:Cerebras上市把CEO身家推到32亿美元,标题说是今年最大IPO,这个信号对AI硬件赛道挺重要。但正文没披露发行价、募资额和估值,我会先打个折——光看身家数字不够,缺交易细节让这条消息的参考价值打了折扣。

r/LocalLLaMA

网友追踪欧盟 15 家店 50 多天显卡价格:只有 RTX 5090 没降价,还涨了 3%

Reddit 用户 egudegi 用脚本每 6 小时抓一次欧盟 15 家店的显卡价格,攒了约 12.6 万条数据。结果显示 RTX 5090 均价从 3392 欧元涨到 3487 欧元,涨了 3%,是唯一没降价的型号。帖子正文被 Reddit 安全策略拦截,看不到更细的型号对比和店铺来源,所以没法判断涨价是普遍缺货还是个别渠道在抬价。

推荐理由:这篇是一个Reddit用户自己爬了15家欧盟商店50多天的GPU价格,总共抓了约12.6万条记录,然后发现RTX 5090是唯一没降价的卡,均价还从3392欧元涨到了3487欧元,涨了3%。我会先打个折:数据源是个人帖子,不是机构报告,样本也只覆盖欧盟线上标价,不代表实际成交价或全球行情。但它的好处是给了很具体的数字和时间跨度,不是随口说“感觉涨价了”。对想买卡跑本地模型的人来说,这个信号挺直接——5090不仅贵,还在变贵,其他卡在跌,说明供需关系确实不一样。这点先别太激动,正文没披露每家店的库存和销量,价格涨可能是货少,也可能是需求硬,没法下结论...

r/LocalLLaMA

RTX 5000 PRO 48GB 实跑测试:27B 模型跑到 80 tok/s,200k 上下文全精度缓存

一位完全没装过机的 Reddit 用户花了 5600 美元攒了一台 RTX 5000 PRO 48GB 的机器,单卡跑 Qwen3.6-27B-FP8 模型。他自己说装机全靠问 LLM,配 vLLM 时烧掉了 Claude Code 一半的周额度才搞定。实测下来,生成速度最高能到每秒 80 个 token,提示很长时掉到 50–60 tok/s,但提示...

推荐理由:这篇来自 Reddit 的个人装机实测,把价格和跑分都摆出来了,对想自己攒机跑大模型的人参考价值很高。我会先打个折:只有单卡、单模型、单人测试,没对比其他卡,也没提散热和长期稳定性,所以不能直接当采购指南。但 48GB 显存能跑 27B 模型还这么快,确实让人对本地推理的成本和体验更有信心。

TechCrunch · AI

Cerebras 上市首日股价翻倍,先融了 55 亿美元

Cerebras 在 2026 年第一个大型科技 IPO 里融到 55 亿美元,上市当天股价涨了 108%。正文没披露发行价、估值、发行股数和这笔钱具体怎么花。

推荐理由:Cerebras 用 55 亿美元融资和首日翻倍的股价,给 2026 年的科技 IPO 开了个头。这不是模型发布,而是一家 AI 芯片公司上市,直接打到了算力资本市场的点上,所以给 90 分、p1 级别。正文没写发行价、估值和钱怎么花,我会先打个折,但标题本身的信息量已经够硬。

AI HOT 精选

Arm 和 Google 联手,让手机本地跑音频模型快了 2 倍多

Arm 的新指令集 SME2 把矩阵计算单元直接塞进了 CPU,不用再纠结是忍受 CPU 慢还是外挂专用加速器。Google AI Edge 的 LiteRT 和 XNNPACK 能自动调用这套指令,拿 Stability AI 的音频生成模型 stable-audio-open-small 在 Arm 手机上测试,生成速度提升超过 2 倍,内存占用降...

推荐理由:我会先打个折:这篇只针对一款音频模型在 Arm 设备上的优化,覆盖面不宽。但 2 倍加速和 4 倍内存缩减这两个数字很实在,不是实验室跑分,是直接落到移动端和笔记本上的效果。文章把 SME2 指令集怎么跟 Google AI Edge 的推理管线配合讲得比较清楚,没有堆术语吓人。对正在头疼边缘端延迟和内存成本的团队来说,这是一条能直接抄作业的参考。信息量够上 featured,但别指望它能推广到所有生成式模型。

5月14日星期四

彭博科技

AI 芯片公司 Cerebras 上市首日股价涨了 68%,是今年最大一笔 IPO

Cerebras 做的是巨型 AI 训练芯片,跟英伟达走完全不同的路线。这次上市融了 55.5 亿美元,首日收盘涨了 68%。不过正文没披露 IPO 发行价和对应估值,也没说这 55.5 亿是发行收入还是包含超额配售。我会先打个折——股价涨得猛,但公司长期得证明自己的芯片在训练大模型时真能比英伟达更省钱、更好用,目前还没看到客户结构或营收细节。

推荐理由:Cerebras 拿 55 亿美元上市首日涨 68%,给 AI 芯片赛道一个公开市场的价格锚点。我会先打个折:正文没披露发行价和估值,没法算它到底贵不贵,但涨幅本身说明资金还在找英伟达以外的故事。三个维度都踩中,没有硬排除项。

量子位 · 公众号

摩尔线程把 SGLang 的 MUSA 后端合进了主线,还拉来核心开发者一起聊了聊

摩尔线程办了一场 SGLang × MUSA 线下交流会,宣布 MUSA 后端已经并入 SGLang 主分支。截至 5 月 12 日,他们一共提了 47 个 PR,其中 41 个被合并。不过正文因为环境验证问题没能加载出来,具体技术细节和现场讨论内容暂时看不到。

推荐理由:我会先打个折:这不是模型发布,也不是平台级大更新,更像推理后端生态的一次实质性进展。但 47 个 PR、41 个合入的数字说明摩尔线程不是挂个名,是真在往 SGLang 主线里交代码。对国内做推理部署的人来说,MUSA 后端进主线意味着以后用 SGLang 时多了一条国产卡的路,这点先别太激动,正文没披露实际性能对比和线上规模,但至少代码层面已经打通了。

AI HOT 精选

OpenSquilla 用本地路由和缓存把大模型传输量砍掉九成以上

OpenSquilla 这个开源项目把模型路由决策放在本地跑,不花 token 就能判断问题难易:简单问题丢给便宜模型,复杂问题才上强模型。它靠增量发送和缓存命中把实际传输的 token 量压到原来的十分之一以下。记忆模块会在上下文快满时自动挑重点压缩,还支持混合检索。正文没披露具体测试场景和模型阵容,所以这 90% 的降幅在什么任务上测出来的还不清楚...

推荐理由:我会先打个折:信息来自一篇 X 上的项目帖,仓库实际活跃度、测试环境和局限性正文都没披露,所以别急着全信。但它的思路很实在——用本地路由和缓存把要传给大模型的 Token 砍掉九成,等于把“外挂资料库”和推理优化打包成一个开源工具。对正在想办法压推理成本的小团队来说,哪怕只实现一半效果也值得关注。

AI HOT 精选

Unsloth 放出 Qwen3.6 MTP GGUF 模型,推理速度提升超 1.4 倍

Unsloth 创始人 Daniel Han 发了几个实验版 Qwen3.6 MTP GGUF 模型,用了一种叫“投机解码”的技术来加速推理。具体做法是让模型一次猜两个草稿 token(draft tokens=2),在速度和猜对率之间找了个平衡点。效果上,27B 模型在单张 GPU 上能跑到每秒 140 个 token,35B-A3B 版本能到每秒 ...

推荐理由:我会先打个折:正文只给了一条 X 动态,没披露用的什么 GPU、量化到几比特、怎么复现。所以分数停在低 featured 是合理的。但亮点很实在——用 MTP 投机解码把 27B 和 35B-A3B 的推理速度拉到一个单卡就能爽用的水平,对本地部署和低成本推理场景是个直接利好。这点先别太激动,等补上硬件和量化细节再往上调。

AI HOT 精选

杨植麟发 40 分钟视频拆解 Kimi K2:训练花了 460 万美元,编程跑分压过 GPT-5.5

杨植麟在视频里把 Kimi K2 的训练账本摊开了:总花费 460 万美元,靠线性注意力等架构上的极致优化,在编程任务上跑赢了 GPT-5.5 等对手。这个数字说明他们用远低于大厂的预算,靠设计把资源差距抹平了。不过视频是创始人自述,没有第三方验证,跑分对比的具体基准和测试条件也没展开,这点先别太激动。

推荐理由:杨植麟用40分钟视频把Kimi K2的训练账本摊开来看,460万美元的成本在同类模型里算低,编程任务上敢直接叫板GPT-5.5,这个对比本身就有传播力。不过视频是单一信源,具体用了哪些基准测试、对比条件是什么,正文没披露,所以分数卡在84不往上走。我会先打个折,等看到独立复现或更多技术细节再调整。

AI HOT 精选

AI 替你处理邮件,一个月要花多少钱?

作者拿主流大模型算了一笔账:让 AI 帮你读、写、整理邮件,每月推理成本在 22 到 130 美元之间,中位数 26 美元。如果做成 SaaS 产品,按 75% 毛利率定价,一年大概要收 500 美元,比 Google 企业版贵一倍。想省钱的话,换小模型能把成本压到十分之一甚至二十分之一;更狠的做法是直接在用户自己的 GPU 上跑,边际成本趋近于零。文...

推荐理由:这篇文章没发布新模型或产品,就是一篇成本算账的评论。我会先打个折:它把顶尖模型、小模型和本地部署三条路径的月费摆在一起,22–130 美元对比近零成本,数字直观,对正在掂量 AI 邮件代理是否划算的团队有参考价值。正文没披露测试用的具体模型名和邮件量,所以这些数字只能当量级参考,别直接套进预算表。整体是一篇有用的观点分析,不是重大发布,所以重要性给 73 分。

AI HOT 精选

让 GPU 别闲着:用异步批处理榨干推理性能

Hugging Face 发现,一个 80 亿参数的模型在生成 8000 个 token 时,GPU 有 24% 的时间在空转。原因出在同步批处理上:CPU 准备下一批数据时,GPU 只能干等,反之亦然。这篇文章讲的是怎么用 CUDA 流把这两件事拆开并行,让 CPU 准备第 N+1 批的同时,GPU 已经在算第 N 批,把空闲缝隙填满。

推荐理由:我会先打个折:这不是新模型发布,是推理系统的工程优化。Hugging Face 给了一个具体的 24% GPU 空闲率,并解释了用 CUDA 流重叠 CPU 与 GPU 工作的机制,对跑线上服务的团队有参考价值,但属于底层技巧而非行业大新闻,所以放在低 featured 档。

FT · 科技

Cerebras 上调 IPO 定价,目标融资 55 亿美元

Cerebras 提高了首次公开募股的价格区间,想通过上市拿到 55 亿美元。按这个融资额倒推,公司估值大概在 400 亿美元。不过正文被付费墙挡住了,具体的发行价区间、发行股数和上市日期都没披露,所以这个估值是怎么算出来的还不清楚。

推荐理由:FT 报道 Cerebras 把 IPO 价格往上调,目标募 55 亿、估值 400 亿。我会先打个折——正文没给发行区间和股数,所以估值怎么算出来的还不清楚。但光这个募资规模就够分量,说明二级市场对非英伟达 AI 芯片故事有胃口。对从业者,这关系到算力供应会不会多一个选项,这点先别太激动,等招股书出来再看具体数字。

r/LocalLLaMA

双卡 RTX 3090 跑 Qwen 3.6 27B:48G 显存、26 万上下文窗口,生成速度 113 token/秒

一位 Reddit 用户用两张 RTX 3090 在 Ubuntu 上跑 Qwen 3.6 27B 模型,没上 NVLink。处理长文本时每秒能啃 4000 个 token,生成回答的速度是每秒 113 个 token。这个速度日常聊天或做文档处理都够用。不过帖子正文被 Reddit 的安全策略挡了,看不到具体配置细节,比如用的是哪个量化版本、功耗和温...

推荐理由:我会先打个折:这是单个 Reddit 帖子,没披露量化方式、批处理大小和功耗,复现细节不够。但 HKR 三条都踩中了——配置具体、数字清楚、直击本地推理玩家的痛点,所以给到 featured 的低位。

r/LocalLLaMA

老显卡 GTX 1080 跑 30B 混合专家模型,每秒能出 24 个 token

用户 mdda 在一台老机器(i7-6700、GTX 1080 8GB 显存、32GB 内存)上跑 Qwen 3.6 35B-A3B 这类约 300 亿参数的混合专家模型,推理速度到了每秒 24 个 token 左右,上下文窗口开到 128k。他的做法是把模型里的一部分专家层卸载到显卡上跑,其余放内存,同时用 TurboQuant 和 RotorQua...

推荐理由:单条 Reddit 帖子权威性不高,但配置和数字很具体,对想用老硬件跑大模型的从业者有参考价值。我会先打个折,这不算正式产品发布或模型更新,但实操信息够硬,适合放进 featured。

彭博科技

AI 芯片公司 Cerebras IPO 定价每股 185 美元,募资 55.5 亿美元

Cerebras 这次上市募了 55.5 亿美元,是今年美股最大的一笔 IPO。定价落在每股 185 美元,但正文被 Bloomberg 的付费墙挡住了,没披露对应估值和发行股数。这家公司做的是巨型 AI 训练芯片,直接跟英伟达抢生意,上市后手里现金会厚很多,但后续量产和客户集中度的问题还得看招股书细节。

推荐理由:Cerebras 在美国 IPO 拿到 55.5 亿美元,标题说是今年最大的一笔。我会先打个折:正文没披露发行价和估值,所以没法判断市场到底给了它多高溢价。对 AI 从业者来说,这关系到算力供应会不会多一个选择,以及跟 NVIDIA 的竞争格局会不会松动一点。但缺了定价和估值,这条消息还够不上行业地震级别,先当重要动态看。

AI HOT 精选

Meta 在 WhatsApp 里上线隐身聊天,推理跑在手机安全区、不留服务器日志

Meta 首席 AI 官宣布 WhatsApp 和 Meta AI 上线 Incognito Chat。和 ChatGPT 那种只不存历史记录的临时聊天不一样,这次对话推理完全在手机硬件安全飞地内完成,Meta 工程师拿不到明文,也不产生服务器日志,会话结束后数据永久删除。等于把 WhatsApp 的端到端加密标准搬到了 AI 对话上,想让你敢聊健康、...

推荐理由:我会先打个折:正文只给了官方公告,没第三方实测,也没说安全飞地具体怎么隔离、性能损耗多少。但亮点很直白——隐身聊天把推理塞进手机硬件安全区,服务器不记日志,聊完数据就没了。这对端侧推理和隐私合规是个信号,只是目前信息量撑不起更高权重,排在模型发布和重大能力更新后面比较合适。

5月13日星期三

量子位 · 公众号

字节提出 GRN,让生图模型像人一样边画边改,不再死磕扩散和自回归

字节跳动的技术团队搞了个叫 GRN(生成式精炼网络)的新架构,想给视觉生成找第三条路,不跟扩散模型和自回归模型硬卷。它的核心思路是让模型先生成一张粗糙的图,再反复精修,就像画师先铺大色块再慢慢抠细节。为了解决反复修图容易把图修糊、错误越攒越多的问题,他们用了三项技术:HBQ(分层二元量化)把图片压成更紧凑的离散编码,减少信息损耗;全局精炼让模型每次修改...

推荐理由:字节这篇 GRN 想走扩散和自回归之外的第三条路,核心卖点是让模型像人画画一样边生成边修改。我会先打个折:130M 参数不算大,gFID 从 3.56 涨到 3.79,画质有小幅下降,但推理步数从 50 步压到平均 24 步,省了将近一半,这个取舍在轻量场景里可能划算。技术上有三个动作:HBQ 解决量化带来的画质损失,全局精炼缓解一步步画下去误差越攒越多的问题,复杂度采样让简单区域少画几步、复杂区域多画几步,不再固定步数。正文没披露在更大模型或更高分辨率上的表现,也没给实际推理延迟的毫秒数,所以现在只能说在小模型上验证了思路。对做图像生成落地、想降...