跳到正文

#部署/工程

今日 3 条

5月13日星期三

r/LocalLLaMA

小米把 1 万亿参数的 MiMo-V2.5-Pro 开源了,但自己跑真的划算吗?

小米放出了 MiMo-V2.5-Pro,参数总量 1.02 万亿,但每次推理只激活 420 亿参数,上下文窗口能塞进 100 万个 token,用 MIT 许可证。作者拿它跑了 125 次 Claude Code 任务,走 API 总共花了 70.12 美元,处理了约 3.87 亿个 token,缓存命中率高达 96.3%。这个命中率说明大部分请求其实...

推荐理由:我会先打个折:正文没披露 MiMo-V2.5-Pro 的评测跑分,所以性能好坏只能靠参数规模猜。但这条信息本身够直接——小米把一个 1.02 万亿参数、42B 激活的模型开源,另一边作者用 Claude Code 跑了 125 次会话,3.87 亿 token 花了 70.12 美元,缓存命中率 96.3%。这两组数字摆在一起,自建成本和 API 开销的对比就出来了。对做工程的人,这种一手成本数据比技术报告更有参考价值。

纽约时报中文网

黄仁勋没在首批名单上,特朗普看到报道后亲自打电话把他拉上了访华专机

白宫周一公布的16人CEO随行名单里没有黄仁勋,这件事在硅谷和华盛顿都引起了议论。特朗普周二上午直接打电话邀请,黄仁勋当晚在阿拉斯加登上了空军一号。他掌管的英伟达是全球市值最高的公司,过去一年一直在游说中美双方,想拿到向中国卖AI芯片的许可。去年夏天特朗普批准卖上一代芯片,但中国政府至今没批任何采购,美国政府内部也有人以国家安全为由反对卖更先进的芯片。

推荐理由:我会先打个折:正文没披露这次访华有没有谈成什么许可,也没说中方怎么回应,所以别急着下结论说英伟达的芯片就能卖了。但这条消息的看点在于时间线——名单公布后才补邀,说明特朗普团队临时决定把英伟达塞进来,很可能就是冲着 AI 芯片出口管制去的。对从业者来说,这比一份正式声明更有信号意义,因为动作本身就在说“这事还在博弈”。

纽约时报中文网

DeepSeek 新模型首次用华为芯片跑推理,训练还得靠英伟达

DeepSeek 上个月发新模型,头一回说推理环节跑在了华为芯片上,但两位半导体业人士透露,训练阶段仍然依赖英伟达芯片,具体怎么拿到的没细说。华为计划今年出训练芯片,同时承认性能追上英伟达现有水平还要再等一年。这件事让中国在 AI 硬件上跟美国进一步脱钩,也印证了黄仁勋之前的警告:出口管制反而逼着中国自建一套技术栈。不过中芯国际量产华为芯片良率低、功耗...

推荐理由:这篇不是模型发布,也没有跑分,所以分数不会冲太高。但信息量够硬——DeepSeek 推理侧开始用华为芯片,训练侧还离不开英伟达,华为自己的训练芯片今年才出来、性能追平还要一年。我会先打个折:正文没给推理优化的具体性能对比或延迟数据,也没说 DeepSeek 在华为芯片上跑了多大并发。不过它把芯片管制这条线拉得很清楚,对关注算力成本和国产替代的人有直接参考价值,84 分放在 featured 里是合适的。

r/LocalLLaMA

有人把 Transformer 语言模型塞进了原装 Game Boy Color 里跑

maddiedreese 把 Andrej Karpathy 的 TinyStories-260K 模型成功跑在了一台没改过硬件的 Game Boy Color 上。他用 INT8 量化权重、定点数运算,把模型和 KV 缓存塞进 MBC5 卡带的 bank-switched ROM 和 SRAM 里,全程不靠手机、电脑、Wi-Fi 或云端推理。不过输出...

推荐理由:一个 Reddit 硬件 hack,把 TinyStories-260K 塞进原装 Game Boy Color,用 INT8 和定点数学跑推理,KV cache 放在卡带 SRAM 里。输出慢到没法用,而且基本是乱码,所以别当产品看。但能在这种老设备上把 transformer 跑起来,本身就挺酷,技术细节也给得实在,适合当一条有趣的行业花絮。

彭博科技

CME 打算推出算力期货,把 GPU 租赁变成可交易合约

芝加哥商品交易所(CME)和 Silicon Data 正在筹划一个算力期货市场,让计算资源像原油或玉米一样在交易所买卖。视频里讨论了这么做的逻辑和运作方式,但没公布合约的具体规格、上线时间,也没说价格怎么定。对 AI 公司来说,这相当于提前锁定 GPU 租用成本,不用再担心突然涨价或抢不到卡。不过现在信息还太少,正文没披露流动性由谁提供、用什么基准指...

推荐理由:我会先打个折:正文没披露合约怎么设计、什么时候上线、价格怎么定,所以现在只能当信号看。但信号本身挺有意思——CME 下场做算力期货,等于把 GPU 供应变成可交易的金融资产。对 AI 从业者来说,如果真能对冲算力价格波动,采购和预算会好做很多。这点先别太激动,等具体规格出来再判断。

AI HOT 精选

Claude Opus 4.7 快速模式开放研究预览,API 和 Claude Code 都能用

Anthropic 把 Claude Opus 4.7 的快速模式放出来了,现在可以在 API 和 Claude Code 里用,但还挂着研究预览的标签。正文没提模型参数量、具体定价、调用频率限制,也没说什么时候转正式版。如果是真的快又便宜,对日常开发场景会挺实用,不过这些关键信息都缺着,先别急着切生产环境。

推荐理由:我会先打个折:正文只说了开放研究预览,没披露模型大小、定价、速率限制和正式上线时间,所以别当成品看。但这条消息对用 Claude Code 干活的人很实在——快速模式意味着写代码、调工具的等待时间可能明显缩短,工作流会顺很多。信息缺口主要在成本和规模上,没这些数字就没法算账,这点先别太激动。整体判断挂在延迟改善和开发者体验上,信息不够的部分也标清楚了。

Hacker News 首页

Needle:一个 26M 参数的小模型,专门做工具调用,能在普通电脑上跑到每秒 1200 token

Cactus 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万,小到可以在消费级设备上跑。它的推理速度很快,预填充阶段每秒能处理 6000 个 token,生成阶段每秒 1200 个 token。这个模型是从 Gemini 的工具调用能力蒸馏出来的,相当于把大模型怎么调用 API、怎么选函数这套本事,压缩进了一个极小的模型里。模型权...

推荐理由:我会先打个折:这是 Show HN 和 GitHub 自报的数据,没有独立评测或大厂背书,所以分数没往上走。但亮点很直接——把 Gemini 的工具调用蒸馏进一个 26M 的小模型,prefill 6000 tok/s、decode 1200 tok/s,MIT 开源,意味着你可以在自己电脑甚至手机上跑一个能调工具的 agent,不用连云端。正文没披露训练用了多少样本、工具调用准确率对比基线是多少,也没说支持哪些工具类型,这些缺口让实际可用性还看不清。不过就冲这个尺寸和速度,对做本地 agent 的人来说值得看一眼。

r/LocalLLaMA

Needle:他们把 Gemini 的工具调用能力蒸馏进了一个 26M 小模型

Cactus Compute 开源了一个叫 Needle 的工具调用模型,参数量只有 2600 万。它用 Gemini 当老师,把怎么调用外部工具的能力蒸馏出来,塞进一个没有传统 MLP 层、靠注意力机制和门控结构的小模型里。在消费级设备上跑,预填充速度能到每秒 6000 个 token,解码速度每秒 1200 个 token。不过正文被 Reddit...

推荐理由:我会先打个折:目前只有一篇 Reddit 帖子作为来源,团队也不算知名,所以分数没给太高。但亮点很实在——一个 26M 的模型声称能复现 Gemini 的工具调用行为,速度数据也漂亮,prefill 6000 tok/s、decode 1200 tok/s,在消费级设备上跑。结构上做了减法,不用 MLP,只留注意力和门控,这点如果属实挺省钱。正文没披露详细的训练数据和完整的基准测试对比,所以“蒸馏效果到底多好”还得看后续验证。

TechCrunch · AI

Google 和 SpaceX 在谈把数据中心搬上太空

Google 和 SpaceX 正在讨论建轨道数据中心,专门跑 AI 算力。SpaceX 今年晚些时候要搞 1.75 万亿美元的 IPO,需要这个“太空机房”的故事来撑估值。但先别太激动——TechCrunch 自己算过账,把卫星制造和发射成本算进去,现在太空机房的成本比地面贵得多。Google 也没把宝全押在 SpaceX 身上,同时在跟其他火箭公司...

推荐理由:Google 和 SpaceX 在聊把数据中心送上天,专门给 AI 跑推理用。听着像科幻,但确实在谈。我会先打个折:正文没披露成本差多少、什么时候能上、打算铺多大,所以别太激动。它更像一个信号——大厂在认真找地面以外的算力出路,这点值得留意。

FT · 科技

芝加哥商品交易所(CME)打算推出 AI 算力期货,让 GPU 租金也能像石油一样做对冲

CME 计划推出挂钩 GPU 租赁价格的期货合约,交易员和公司可以用它来赌未来算力成本涨跌,或者锁定成本做套期保值。不过这篇 FT 文章正文被付费墙挡住了,合约的具体规格、参考的租金指数、上线时间这些关键信息都没披露。

推荐理由:FT 报道 CME 计划推出 GPU 租赁价格期货,HKR 三项都踩中了:算力期货这个概念本身就够新鲜,机制上把算力成本变成可对冲的金融风险,而且正好打在 AI 从业者最焦虑的算力账单上。不过正文没给合约规格、上线时间和标的指数,信息缺口明显,所以放在 featured 而不是 P1。

5月12日星期二

r/LocalLLaMA

一台 16GB 显存 + 64GB 内存跑本地代码补全和智能体编程

Reddit 用户 grumd 在一张 RTX 5080(16GB 显存)和 64GB 内存的单机上同时跑了两套模型:Qwen2.5-Coder-7B Q6 做代码补全,Qwen3.6-35B-A3B Q8 做智能体编程(让模型自己规划步骤、调用工具写代码)。35B 那个模型用了内存卸载,上下文能撑到约 145k,速度是每秒 35.29 个 token...

推荐理由:这是一篇 Reddit 个人实验帖,不是系统评测,没有对比其他方案或验证稳定性,所以我会先打个折。但作者把模型、量化方式、上下文长度和吞吐都列清楚了,对想在自己机器上搭本地编程助手的开发者有直接参考价值。正文没披露功耗、并发表现和长上下文下的准确率,这点先别太激动。

机器之心 · 公众号

字节开源 DreamLite:0.39B 参数模型在 iPhone 上 3 秒出图,不用联网

DreamLite 是字节跳动开源的一个统一扩散模型,参数量只有 3.9 亿,能在 iPhone 17 Pro 上直接跑,生成或编辑一张 1024×1024 的图大约 3 秒。它靠 DMD2 蒸馏技术把推理压缩到 4 步,全程在手机本地完成,不依赖云端。正文没披露具体的显存占用和功耗数据,也没给出不同机型上的实测对比,所以“秒变画板”这个说法先打个折—...

推荐理由:字节把扩散模型压到 0.39B 参数,在 iPhone 17 Pro 上离线跑 1024×1024 生图和编辑,约 3 秒出结果,靠的是 4 步 DMD2 蒸馏把推理步数砍下来。我会先打个折:正文没披露功耗、内存占用和量化方案,也没给不同机型的对比,所以“手机秒变画板”这个说法先别太激动。但参数和实测平台都给了,比光喊口号实在。作为开源端侧方案,对在意离线、低延迟和隐私的开发者有参考价值,只是目前只有一篇 Reddit 帖子,没有论文或代码仓库链接,可信度要打个问号。

AI HOT 精选

OpenAI 办了一场“参数高尔夫”比赛,1000 多人用 AI 助手卷模型压缩,我们看到了什么

OpenAI 搞了个叫 Parameter Golf 的机器学习挑战赛,规则很硬:模型加代码总大小不能超过 16MB,训练时间只有 10 分钟(用 8 张 H100),看谁能在固定数据集上把测试损失压到最低。超过 1000 人提交了 2000 多次结果。我会先打个折,正文没披露最终冠军的具体分数,但重点讲了技术路数。最卷的方向是训练优化,有人把前人的好...

推荐理由:OpenAI 的 Parameter Golf 复盘靠一场实打实的比赛、1000多名参与者和2000多份提交撑住了 HKR 三项。它属于研究/基准信号,不是模型或产品发布,所以 78 分放在 featured 里偏低的那一档是合理的。我会先打个折:目前只有一篇 Reddit 帖子,没有独立复现,也没看到论文或代码放出来。

r/LocalLLaMA

把 prompt 缓存用到强化学习训练里:长提示短回复场景下,Qwen3.5-4B 训练速度提升 7.5 倍

作者提出在强化学习训练时复用 prompt 缓存,专门针对那种提示很长、模型回复很短的任务。在 Qwen3.5-4B 上跑 16k token 提示、64 token 回复的例子,训练速度直接快了 7.5 倍。另一个 G=8 的例子更直观:1000 token 提示加 100 token 回复,原本要处理 8800 个 token,用这方法后实际只需处...

推荐理由:这是一篇 Reddit 帖子,作者把推理时常用的 prompt caching 思路搬到了 RL 训练里,在长提示短回答的场景下效果明显:Qwen3.5-4B 跑 16k 提示、64 输出 token 的任务,训练速度提了 7.5 倍。核心逻辑是 RL 训练时同一组 prompt 会被反复采样,把重复的 token 缓存起来不重复算,G=8 时实际要处理的 token 数从 8800 掉到 1800。这个数字说明去重效果确实好,但前提是 prompt 够长、回答够短,场景比较挑。正文没给代码或论文链接,也没有独立复现验证,所以分数先打个折,定在 78。

r/LocalLLaMA

Reddit 网友用英特尔傲腾持久内存攒了一台机器,本地跑 1 万亿参数模型,速度超过 4 token/秒

Reddit 用户 APFrisco 分享了一套硬件方案:用 768GB 英特尔傲腾持久内存(Optane PMem)当主存储,搭配 192GB DDR4 ECC 内存和一张 12GB 显存的 RTX 3060 显卡,通过 llama.cpp 的混合推理(CPU+GPU),在本地跑起了 Kimi K2.5 这个 1 万亿参数模型的 Q2_K_XL 量化...

推荐理由:HKR 三项都成立:标题的反差感足够抓人,正文把硬件型号、量化版本和速度都列清楚了,而且对本地推理圈子的成本敏感用户有直接参考价值。不过这只是单个 Reddit 用户的分享,复现细节和稳定性都没展开说,所以分数就压在 featured 门槛上。

5月11日星期一

r/LocalLLaMA

ExLlamaV3 连续更新:DFlash 让编程吞吐量翻三倍,多款模型推理再提速

ExLlamaV3 最近几个版本更新挺猛。v0.0.31 引入 DFlash 后,编程任务的生成速度从每秒 59.21 个 token 直接拉到 177.67,翻了近三倍。v0.0.32 专门优化了五款模型,其中 Trinity-Nano 在 6000 Pro² 显卡上的速度提升了 72.4%。最新的 v0.0.33 开始支持 DFlash 的模型量化...

推荐理由:我会先打个折:这主要是 ExLlama 用户和 LocalLLaMA 圈子的好消息,不是全行业当天必读的大新闻。但提速数字很实在,Coding 场景三倍提升、特定显卡上 72.4% 的涨幅,对正在折腾本地部署的人就是直接省时间省硬件。正文没提这些优化对显存占用或精度的副作用,这点先别太激动,但作为一次开源推理库的版本更新,信息量够、指向明确,值得推给关注推理效率的读者。

机器之心 · 公众号

ICML 2026 论文:PRISM 框架让扩散语言模型做推理时扩展不再烧算力

这篇 ICML 2026 的论文给扩散语言模型(dLLM)提出了一套叫 PRISM 的推理时扩展方法。它把搜索过程拆成三层:先让模型并行生成多条推理路径,再对每条路径局部“回退重写”不靠谱的步骤,最后用模型自己当裁判打分筛选。在数学题集 GSM8K 上,LLaDA-8B-Instruct 的准确率从 67.58% 拉到了 85.30%。最直接的好处是省...

推荐理由:这篇 ICML 论文给扩散语言模型做 test-time scaling,核心卖点是不靠堆算力硬拉分。PRISM 在 LLaDA-8B-Instruct 上把 GSM8K 正确率从 67.58% 提到 85.30%,靠的是三层搜索、局部 remasking 和自验证,把复杂度从 O(NT) 压到接近 O(N+KT)。我会先打个折:这只是单模型单数据集的实验,正文没披露在其他 benchmark 或更大模型上的表现,泛化性还不好说。但思路本身对做推理优化的人有参考价值,尤其适合预算有限又想压榨小模型推理能力的场景。

量子位 · 公众号

OpenAI 签下 750 兆瓦算力大单,芯片公司 Cerebras 趁势把 IPO 估值抬到 350 亿美元

Cerebras 把 IPO 发行价区间上调到每股 150 到 160 美元,按上限算估值约 350 亿美元。直接推手是 OpenAI 刚签了一份 750 兆瓦的 AI 算力采购协议,交付排到 2028 年。不过原文因为微信环境验证拦截,正文内容没抓到,具体合同金额、交付节奏和 Cerebras 的财务数据都没披露,这个估值能撑多久还得看后续招股书细节。

推荐理由:这条不是普通的 IPO 消息。OpenAI 用 200 亿美元、750 兆瓦的采购协议给 Cerebras 站台,直接把估值推到 350 亿美元,等于在英伟达之外硬开了一条新路。我会先打个折:Cerebras 的芯片主打推理优化,跟英伟达的训练生态还不是一个量级,但 OpenAI 愿意砸真金白银,说明大客户已经在认真找备胎了。正文没披露这笔订单的具体年限和单价,所以 200 亿是总承诺额还是框架上限,这点先别太激动。对看算力成本和供应链安全的人来说,这条值得追。

量子位 · 公众号

马斯克申请 SpaceXAI 商标,要把 AI 算力搬上卫星

SpaceX 提交了 SpaceXAI 商标申请,覆盖的业务范围很广:卫星数据中心、轨道计算、AI 软件即服务、云存储、通信硬件,甚至还有社交网络。文章提到 xAI 已经通过全股交易成为 SpaceX 的子公司,并引用了一个 2500 亿美元的 xAI 估值。不过正文因为环境异常被屏蔽了,具体交易条款和商标申请细节都没披露,这个估值数字也先别太当真。

推荐理由:我会先打个折:目前只有商标申请文件,正文说xAI已并入SpaceX,但没披露交易条款或官方公告,这点先别太激动。商标覆盖范围很广,从卫星数据中心到AI SaaS都有,说明马斯克在铺路,但离真正跑起来还差落地细节。重要性给76、放featured是合理的,属于信号而非实锤重组。

AI HOT 精选

Cerebras IPO 被抢爆,超额认购超 20 倍,发行价打算上调近三成

路透社的消息说,做 AI 芯片的 Cerebras 准备上市,结果被投资人抢疯了,超额认购超过 20 倍。公司一看这架势,打算把发行价从原来的 115-125 美元提到 150-160 美元,涨了快三成,发行股票数量也计划从 2800 万股加到 3000 万股,最多能融到 48 亿美元。这可能会是 2026 年到现在全球最大的一笔 IPO。Cerebr...

推荐理由:这条消息的看点在于需求数字很实在,不是那种模糊的“市场反响热烈”。20倍超额认购和主动提价近三成,说明机构在拿真金白银赌Cerebras能分走AI训练/推理芯片的蛋糕。不过正文没披露具体估值和上市日期,所以先别把它当成行业转折点,更像一个强需求信号。我会先打个折,等正式挂牌再看。

AI HOT 精选

本地 35B 模型扛下作者一半日常工作,响应速度是云端 Claude Opus 4.5 的两倍

作者用五周时间测了约 1400 个日常工作请求,发现本地跑的 Qwen 3.6 35B 这类模型能搞定其中一半,平均响应 2.8 秒,比云端 Claude Opus 4.5 的 5.8 秒快了 2.1 倍。像邮件草拟、日程安排、摘要和行政杂活这些任务,本地模型完全够用;市场调研和工程类任务则是对半开,简单查数据、修脚本可以本地跑,复杂的多源分析和架构决...

推荐理由:Tom Tunguz 拿本地35B模型做了五周实验,跑了约1400项日常工作任务,成功处理约一半,平均响应2.8秒,比Claude Opus 4.5快2.1倍。这个结果对从业者来说很实在:不是模型发布,也不是平台级更新,但给出了本地模型在延迟和成本上替代云端模型的一个具体参照点。我会先打个折——正文没披露任务类型分布和失败案例的具体原因,所以50%成功率不能直接当通用结论用。但速度对比和实验规模足够让关注推理成本和隐私的人认真看一眼。

r/LocalLLaMA

MTP 实测:写代码能加速 71%,写小说反而变慢 9%,任务类型决定投机推理是帮忙还是帮倒忙

一位 Reddit 用户用 Qwen 3.6 27B 的 MTP 量化模型跑了 300 多次测试,发现投机推理(让模型先猜后验证)的效果完全看任务类型。写代码时草稿被采纳的比例高达 79% 到 89%,用 F16 精度跑代码生成速度提升了 171%;但换成创意写作,Q4_K_M 量化下推理速度反而慢了 9%。结论很直接:别只看模型和量化,先看你要让模型...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次实验,不是官方基准,但 300 多次测试把投机推理的任务依赖性讲得很清楚。编码任务接受率高、加速明显,创意写作接受率低、反而变慢,这个结论对本地跑模型的开发者有直接参考价值。正文没披露测试硬件和具体 prompt,但数据量够大,可以先信一半。

5月10日星期日

r/LocalLLaMA

网友用一张 RTX PRO 6000 工作站显卡跑起了 DeepSeek V4 Pro

Reddit 用户 fairydreaming 发帖说,他在自己机器上跑通了 DeepSeek V4 Pro。用的是一块 RTX PRO 6000 Blackwell Max-Q 工作站显卡,搭配修改过的 llama.cpp CUDA 分支。模型文件是 Q4_K_M 量化版,体积 859GB。他分享的日志显示,在 1M 上下文窗口下,生成速度跑到每秒 ...

推荐理由:我会先打个折:这是 Reddit 单帖,没有第三方复现,稳定性、量化损失、长上下文下的实际效果都还没谱。但帖子里把文件大小、上下文长度、生成速度和运行分支全摊出来了,对想自己折腾本地推理的人来说,比很多官方博客都直接。单卡跑 859GB 模型这件事本身就是一个信号——大模型本地化的硬件门槛在往下走,这点先别太激动,但值得盯着。

r/LocalLLaMA

NVIDIA 发布 Star Elastic:一个模型文件能直接切出 30B、23B、12B 三种推理模型

NVIDIA 放出了一个叫 Star Elastic 的模型,一个检查点文件里包含了 30B、23B 和 12B 三个尺寸的推理模型,不用额外训练就能直接“切片”取用。具体玩法是让 23B 的子模型负责思考过程,30B 的模型负责给出最终答案。在 AIME-2025、GPQA、LiveCodeBench v5 和 MMLU-Pro 这几个测试集上,这种...

推荐理由:我会先打个折:这还是个研究发布,不是大规模验证过的产品,影响力肯定比不上一个全新旗舰模型。但它的机制很具体——一个检查点通过“零样本切片”就能变出不同大小的推理模型,而且 23B 负责思考、30B 负责回答这种分工方式,在 AIME-2025 上确实跑出了 16% 的准确率提升和 1.9 倍延迟降低。对正在折腾推理部署的人来说,这种“一份权重、多种用法、精度可选”的思路,直接打中了成本和延迟的痛点,所以放在 featured 里是合适的。

r/LocalLLaMA

BeeLlama.cpp:用 DFlash 和 TurboQuant 让 Qwen 3.6 27B 在单张 3090 上跑 20 万上下文,速度翻倍

Anbeeld 发了一个 llama.cpp 的分支 BeeLlama.cpp,主要加了 DFlash(一种省显存的注意力机制)和 TurboQuant(更快的量化方案),还支持推理和视觉任务。标题里说在单张 RTX 3090 或 4090 上跑 Qwen 3.6 27B 的 Q5 量化版,能塞进 20 万 token 的上下文,速度比原版快 2 到 ...

推荐理由:我会先打个折:这些数字来自 Reddit 标题和摘要,没有独立复现,135 tps 的峰值在什么输入长度、什么 batch 下跑的也没说清楚。但就算打个七折,单张 3090 把 27B 模型塞进 200k 上下文还能跑到可用的速度,对个人开发者和小团队确实省钱。BeeLlama.cpp 看起来是在 llama.cpp 上做了 DFlash 和 TurboQuant 的工程优化,正文没披露具体技术细节和稳定性测试,这点先别太激动。整体算一次值得关注的本地推理更新,所以放在低位的 featured。

5月9日星期六

AI HOT 精选

Redis 作者用几千行 C 代码把 DeepSeek V4 Flash 塞进 MacBook,跑出 27 tok/s

Antirez 开源了一个叫 ds4 的推理引擎,专门给 DeepSeek V4 Flash 用。代码只有几千行 C,能在 128GB 内存的 MacBook Pro 上跑 100 万 token 上下文的模型。他用了三招:对 MoE 专家做不对称 2-bit 量化来压缩模型体积;把 KV Cache 搬到高速 SSD 上,绕开内存不够的问题;再给苹果...

推荐理由:Antirez 开源了一个叫 ds4 的原生推理引擎,几千行 C 代码,在 128GB 内存的 MacBook Pro 上跑 DeepSeek V4 Flash,1M 上下文实测跑到 27 tok/s。我会先打个折,这个速度是在特定硬件和模型上跑出来的,换台机器不一定能复现,但至少证明了不用显卡也能把大模型跑起来。正文没披露量化精度和功耗,这点先别太激动。整体看,这是一个很强的开源推理信号,对关注本地部署和隐私的团队有参考价值。

r/LocalLLaMA

用 12GB 显存跑 Qwen3.6 35B A3B,llama.cpp MTP 实测跑到 80 tok/s、128K 上下文

Reddit 用户 janvitos 在 RTX 4070 Super(12GB 显存)上跑 Qwen3.6-35B-A3B-MTP-GGUF,搭配 llama.cpp 的一个 MTP 拉取请求。他贴出的实测数据是每秒 69.2 到 81.9 个 token,草稿接受率在 0.694 到 0.947 之间,上下文长度拉到 131072。关键设置是 -f...

推荐理由:这条帖子是单用户实测,不是官方数据,验证强度有限,但数字和配置都摆出来了,可复现。对想在家用显卡上跑长上下文模型的人来说,是个很具体的参考点。我会先打个折,毕竟只有一个人晒结果,但 12GB 显存跑 35B 还能 80 tok/s,这点确实让人想试试。

AI HOT 精选

百度发了 ERNIE 5.1,参数量砍到原来的三分之一,训练费压到同规模模型的 6%

ERNIE 5.1 把总参数量压到原规模的大约三分之一,激活参数压到大约一半,预训练成本只花到同规模模型的 6% 左右。百度说性能没崩,Agent 能力超过 DeepSeek-V4-Pro,世界知识和创意写作接近头部闭源模型和 Gemini 3.1 Pro,推理仅次于 Gemini 3.1 Pro,深度搜索排全球第四。技术手段提了两个:弹性预训练用来提...

推荐理由:百度把 ERNIE 5.1 的参数和成本压到这个程度,我会先打个折——正文没披露具体参数量和基准测试细节,6% 的成本对比对象也没说清楚,这点先别太激动。但即便有水分,三分之一参数、一半激活、6% 预训练成本这三个数字摆出来,对正在头疼推理成本的团队来说就是强信号。加上已经上线 ERNIE 平台和 AI Studio,不是画饼,值得写。

新智元 · 公众号

英伟达、AMD、英特尔罕见联手,给 RadixArk 投了 1 亿美元种子轮

RadixArk 在 5 月 5 号宣布拿了 1 亿美元种子轮,投后估值 4 亿美元。领投的是 Accel,Spark Capital 跟投,更少见的是英伟达、AMD、英特尔这三家芯片厂同时出现在投资人名单里,联发科和 Databricks 也参与了。正文因为微信环境验证没抓到具体内容,没法展开说他们到底做什么、钱怎么花,但光看这个阵容,大概率是跟 A...

推荐理由:这条消息的硬核在于钱和站队:1亿美元种子轮、4亿美元投后估值,英伟达、AMD、英特尔三家芯片厂同时出现在投资人名单里,这在AI基础设施赛道不常见。我会先打个折——正文没披露产品性能基准、客户验证或开源项目的实际采用数据,所以目前只能当一笔高关注度的融资来看。对从业者来说,看点不是金额本身,而是三家互相竞争的芯片厂为什么愿意一起押注推理优化,这背后可能指向算力成本、模型部署效率的痛点。信息缺口也很明显:没写团队背景、技术路线和落地案例,后续如果有产品实测或客户名单,价值会更高。

AI HOT 精选

DeepSeek 正以 500 亿美元估值融资 70 亿,创始人自己掏了 30 亿

DeepSeek 这轮最多要融 70 亿美元,估值 500 亿,是中国 AI 公司里单轮金额最高的一次。创始人梁文锋个人出了 30 亿,占这轮融资的 40%,融完后他手里还有公司 90% 的股份。DeepSeek 最早是从他自己的对冲基金里孵化出来的。这笔钱主要用来买算力、推 V4.1 新模型,以及做企业级产品,目标是让公司开始有正向收入,路线跟 Op...

推荐理由:这条消息的钩子是梁文锋个人砸 30 亿美元,不是常规融资通稿。数字够具体,能让人算出估值和出资比例。不过正文没披露领投方、具体条款和官方确认,只有单一信源,所以我会先打个折,不把它当定论。对从业者来说,这轮融资如果属实,说明 DeepSeek 在走一条靠创始人重注维持独立性的路,跟 OpenAI 那种外部巨头主导的模式不一样,这点值得留意。

r/LocalLLaMA

单张 RTX 4090 跑 Qwen3.6-27B,262K 上下文冲到 80+ t/s

indrasmirror 用一张 RTX 4090 跑 Qwen3.6-27B-Heretic-v2,上下文拉到 262K token,搭配 TBQ4_0 格式的 KV 缓存和 MTP 推测解码(draft 3),生成速度从约 43 t/s 提到 80-87 t/s。MTP 草稿接受率大概 73%,说明模型对草稿的采纳比例不低,这是提速的关键。帖子正文...

推荐理由:这是一次有实测数据的单卡推理优化记录,不是产品发布,但 H/K/R 三项都站得住。262K 上下文、80+ t/s 的 27B 模型跑在消费级显卡上,对本地部署圈子的吸引力很强。正文给了具体配置和前后对比数字,可复现性不错。扣分点在于来源只有 Reddit 帖子,且场景偏小众本地推理,所以放在 featured 档、77 分是合适的,不用再往上拔。

The Verge · AI

AI 数据中心扩张引发全美争议:43% 美国人认为电费上涨要怪它们

The Verge 梳理了 AI 数据中心在全球引发的冲突。调查显示 43% 的美国人把电费上涨归咎于数据中心;犹他州一个占地 4 万英亩的项目不顾社区反对获批;Anthropic 宣布将在美国投入 500 亿美元建 AI 数据中心。报道还提到,数据中心附近的电费最高涨了 267%,俄勒冈州的数据中心被怀疑与当地癌症和流产率上升有关,而美国最大的电网系...

推荐理由:这是 The Verge 的一篇动态汇总,不是单一重磅事件,但里面塞了不少硬数字:43% 的民调归因、4 万英亩土地审批、500 亿美元资本开支计划。我会先打个折,因为它更像信息拼盘,不过这些电网和成本数据对从业者判断基础设施风险挺有用,所以放在行业报道的上限位置。

彭博科技

Anthropic 跟 Akamai 签了 18 亿美元的算力合同

Anthropic 和 Akamai 达成了一笔 18 亿美元的计算资源交易,用来应对自家 AI 软件越来越大的算力需求。不过正文被付费墙挡住了,没披露具体买了多少算力、合同签了几年、以及这些服务器会部署在哪些地区。

推荐理由:我会先打个折:正文没写具体买了多少算力、合同签了几年、部署在哪些地区,所以没法判断单价划不划算。但 18 亿美元这个量级,加上 Akamai 这家做 CDN 的公司突然杀进 AI 算力生意,本身就值得留意。对从业者来说,这至少说明 Claude 的推理负载在猛涨,Anthropic 在云厂商之外找第二条算力腿。这点先别太激动,等具体规模出来再算账。

AI HOT 精选

EMO:让专家模型自己长出模块,用八分之一专家就能干活

AllenAI 放出了一个叫 EMO 的混合专家模型(MoE),总参数量 140 亿,每次推理只激活 10 亿参数。它最大的不同是训练时没按人类划好的学科(比如数学、代码)去分专家,而是让模型自己从 1 万亿 token 的数据里长出模块。结果是,跑特定任务时你只用挑出 12.5% 的专家,性能就接近全模型水平;而同样架构、同样数据训出来的普通 MoE...

推荐理由:AllenAI 和 Hugging Face 放出的 EMO,是个 14B 总参数、1B 活跃参数的 MoE 模型,用 1 万亿 token 训练。亮点是跑任务时只激活 12.5% 的专家,推理成本压得很低。不过正文没披露具体 benchmark 成绩和路由策略细节,这点先别太激动。它更像一个研究发布,不是前沿模型发布,所以给 featured 低档。

5月8日星期五

r/LocalLLaMA

Gemma 4 26B 在单张 RTX 5090 上跑到每秒 600 token

chain-77 用 vLLM 0.19.2rc1 测了 Gemma 4 26B,开了 DFlash 投机解码后,单张 RTX 5090 的输出吞吐从每秒 228 token 跳到 578 token。测试条件是输入 256 token、输出 1024 token、并发数 1、投机 token 数设为 13。这个速度意味着本地跑 26B 模型已经可以做...

推荐理由:这条帖子本身是单次测试,没对比其他卡或并发场景,所以我会先打个折。但一张消费级显卡把 26B 模型输出速度翻了一倍多,这个提升幅度够实在,而且给了可复现的版本号和参数,对想在家跑大模型的人有参考价值。

机器之心 · 公众号

SGLang 团队拿了 1 亿美元种子轮,成立新公司 RadixArk,要做开放的 AI 基础设施

SGLang 的团队新成立了一家公司叫 RadixArk,5 月 5 号宣布完成 1 亿美元种子轮融资,投后估值 4 亿美元。SGLang 是一个开源的模型推理框架,目前在 GitHub 上有超过 2.7 万颗星,部署的 GPU 超过 40 万张。不过,这篇微信文章因为环境异常被屏蔽了,正文内容没拿到,所以具体的产品方向、团队背景和这笔钱怎么花,暂时都...

推荐理由:这条消息的看点在于钱和团队背景。1 亿美元种子轮在 AI infra 领域不多见,而且 SGLang 本身有 2.7 万星和 40 万张 GPU 的部署量,不是凭空画饼。不过正文对 RadixArk 具体要做什么产品、跟现有 SGLang 项目怎么分工,讲得比较模糊,更像融资公告加路线图预告。我会先打个折,把它放在 featured 里但不到更高档,因为目前还缺产品细节和客户验证。

新智元 · 公众号

用 token 级价值函数控制回答长度,3B 模型在长度控制上跑赢 GPT-5.4 和 Claude

加州大学圣塔芭芭拉分校和苹果的研究人员搞了个叫 LenVM 的方法,把“还剩多少 token 要生成”建模成一个 token 级别的价值函数,相当于给模型装了个实时字数进度条。他们拿 Qwen2.5-3B 搭配一个 1.5B 的 LenVM 去测 LIFEBench 的长度控制任务,得分 62.6,而 GPT-5.4 只有 37.4,Claude-Op...

推荐理由:我会先打个折:正文没披露 GPT-5.4 的具体版本和测试条件,这点先别太激动。但 LenVM 的思路很实用——把“还要写多长”变成一个 token 级的值函数,让 Qwen2.5-3B 搭配一个 1.5B 的小模型就能在长度控制上大幅领先大模型。LIFEBench 长度得分 62.6 比 GPT-5.4 的 37.4 高出不少,说明在特定任务上小模型加对方法可以很省钱。对做推理优化和想摆脱闭源模型绑定的团队来说,这是个值得跟的信号。

量子位 · 公众号

哈工大华为搞了个免训练加速框架,让扩散大模型推理快4.48倍还不掉精度

哈工大深圳、华为和深圳河套学院提出一个叫 Dynamic-dLLM 的框架,不用重新训练就能给扩散大语言模型加速。在 LLaDA-8B-Instruct 上跑 GSM8k 数学题,吞吐量从每秒 8.32 个 token 提到 37.29 个 token,快了 4.48 倍,而且精度几乎没降。正文没披露具体用了什么技术手段,也没说在其他任务上表现怎么样,...

推荐理由:HKR 三项都成立:4.48 倍提速是个好钩子,GSM8k 的 TPS 数据让说法有实感。这是推理优化研究,不是主流模型发布,放在 78–84 这个区间合适。

FT · 科技

科技巨头砸了7250亿美元搞AI基建,自由现金流跌到十年最低

FT这篇付费文章正文被锁了,只从标题和摘要片段能看出几个关键信息:硅谷大厂们过去在AI基础设施上累计花掉了7250亿美元,这个数字直接把它们的自由现金流压到了近十年的最低点。以前这些公司是轻资产、现金牛的玩法,现在被迫转型成重资产的基建投资者。但文章没披露具体是哪几家公司、统计的时间跨度、以及自由现金流是按什么会计准则算的,这些缺口让数字的横向可比性打...

推荐理由:标题把 7250 亿 AI 基建投入和十年最低自由现金流绑在一起,冲突感很强,成本与回报的账本焦虑一下就出来了。正文没披露具体公司名单、统计周期和会计口径,所以数字的精确边界还不清楚,我会先打个折。但即便口径模糊,这个量级的支出对比已经足够让从业者关注基建烧钱能不能回血,时效性和话题性都在。

r/LocalLLaMA

单张 4090 跑出 11.67%:TOPAS 递归架构在 ARC-AGI-2 上的本地测试结果

Doug_Bitterbot 用一张 RTX 4090 训练了大约 14 天,让 TOPAS 模型在 ARC-AGI-2 抽象推理测试上拿到了 11.67% 的分数。这个模型只有 1 亿参数,本地跑分最高到过 36%,但它的递归测试时训练(TTT)机制在 Kaggle 的题目上出了问题,将近一半的谜题直接输出空结果。作者觉得调一下阈值、再训 3 到 5...

推荐理由:Doug_Bitterbot 在 Reddit 上发了个帖子,说他的 TOPAS 架构在 ARC-AGI-2 公榜拿了 11.67%,跑在一张 RTX 4090 上,训练大概花了 14 天。模型参数约 100M,本地 checkpoint 能到 36%,但 Kaggle 提交时因为递归 TTT 超时,近一半题目输出空数组,分数被拉低。作者自己预期调一下阈值能到 20%,还说 3-5 周后再训完。这事有意思的地方在于,它只用输入图片来决定怎么压缩视觉 Token,多轮 VQA 里能砍掉 90% 的 Token,正文说精度不掉。不过目前只有一篇帖子,K...