跳到正文

#部署/工程

今日 2 条

7月14日星期二

Hacker News 首页

MemStitch:一个给 vLLM 用的零拷贝上下文桥接网关,多智能体场景下首 token 延迟最多降 25 倍

DaqulaLin 开源了 MemStitch,一个架在 vLLM 前面的网关。它利用 PagedAttention 直接在显存里拼接不同请求的 KV 缓存,让多智能体协作时不用反复做预填充,首 token 延迟最多能降 25 倍,显存占用也省了 40% 以上。不过正文没披露测试用的模型和 GPU 配置,25 倍这个数字先打个折看,等具体环境信息出来再说。

推荐理由:多智能体推理延迟是个真实痛点,MemStitch 在 vLLM 显存层做 KV 缓存拼接,比 prompt 层面的方案更根本。25 倍这个数字正文没给模型和 GPU 配置,先打个折,但机制本身值得关注。

7月9日星期四

Hacker News 首页

Colibrì:一个纯 C 引擎,让 744B 参数的 GLM 5.2 在 32GB 内存、无显卡的笔记本上跑起来

作者用一台 12 核、25GB 可用内存的笔记本,把 GLM 5.2 这个 7440 亿参数的大模型跑通了,没用到显卡。做法是把模型切成两块:注意力层、共享专家等约 170 亿参数的稠密部分,用 int4 量化后常驻内存,占大约 9.9GB;剩下的 21504 个路由专家(约 370GB)全扔在硬盘上,用到哪个才读哪个,靠 LRU 缓存和操作系统自己的...

推荐理由:作者用一台 12 核、25GB 内存的笔记本跑通了 GLM 5.2,没用到显卡。核心思路是把模型切成两块:注意力层和共享专家约 170 亿参数做 int4 量化后常驻内存,占 9.9GB;剩下 21504 个路由专家约 370GB 全放硬盘,靠 LRU 缓存和操作系统页缓存按需加载。正文给了具体数字和做法,不是公关稿,对想在自己机器上试大模型的人有参考价值。我会先打个折——推理速度肯定慢,但能跑起来本身就说明这套拆分加缓存的路子可行。

7月7日星期二

AI HOT 精选

SGLang 接入 DSpark 推测解码:让草稿模型自己决定每次验证几个 token

LMSYS 把 DSpark 推测解码做进了 SGLang 推理引擎。和以前固定验证一整块 token 不同,DSpark 的草稿模型自带一个“信心打分器”,能算出每个 token 被主模型接受的概率,调度器再根据这个分数动态决定每轮实际验证几个 token——分数低的请求就少验几个,省下算力。在 H200 上跑 DeepSeek-V4-Flash,这...

推荐理由:LMSYS 把 DSpark 做进了 SGLang,还给了 H200 上的实测数字,不是论文预告而是引擎级落地。硬核和知识增量都够,但话题局限在推理加速,圈外人无感,所以 R 没给,分数卡在 featured 门槛 78 分。

7月5日星期日

Computing Life · Share · 鸭哥调研

Scaling Law 五年三次修正:从“把模型做大”到“把模型做小”

Scaling law 不是物理定律,是一条靠实验拟合出来的曲线,实验条件一变,结论就跟着变。2020 年 OpenAI 的 Kaplan 论文因为实验设置偏差,得出“优先堆参数”的结论,直接塑造了 GPT-3。2022 年 DeepMind 的 Chinchilla 修正了配比,发现每个参数配大约 20 个 token 才划算,小模型多喂数据反而更强...

推荐理由:这是一篇高质量的辟谣和科普。它没有复读“scaling law 失效”的惊悚标题,而是把 Kaplan、Chinchilla 和 LLaMA 三次修正串成一条线,用具体的实验偏差和数据配比说明为什么结论会变。我会先打个折:它属于评论和知识梳理,不是一手产品发布,但信息密度和纠正作用足够强。正文没披露某些最新模型的内部训练细节,但引用的公开论文和数据足以支撑它的判断。

6月30日星期二

Hacker News 首页

Moondream 用流水线解码挤掉 GPU 空闲气泡,解码吞吐量提升最高 35%

Moondream 的 Photon 推理引擎在 B200 上跑 VLM 能到 33 毫秒左右。瓶颈不在算力,在 GPU 气泡:每生成一个 token,GPU 都得等 CPU 做完记账、采样、调度这些杂活才能开始算下一个。Photon 把解码循环改成流水线,让 GPU 在当前 token 还没完全落地时就开始跑下一步计算,把 CPU 的杂活藏到 GPU...

推荐理由:Moondream 的 Photon 引擎在 B200 上把 VLM 推理压到 33 毫秒左右,解码吞吐提了 35%,数字和原理都交代得清楚。但这是单家公司的推理优化,不是行业级事件,受众偏窄,放在 featured 刚好。

Hacker News 首页

vLLM 搞了个 Micro-Agent:让多个模型在 API 内部组队干活,效果能超过单个顶尖模型

vLLM 的语义路由器现在不只是把请求分给最合适的模型,它还能让多个模型在背后协作,但对外只暴露一个模型名。用户照常调用 API,路由器会根据任务难度和预算,自动选择是先用便宜模型试试、让几个模型并行出结果再汇总,还是让模型互相审查。核心是把一次 API 调用变成一个受控的微型协作流程,有预算上限、执行拓扑和失败处理策略。文章介绍了五种协作模式:Con...

推荐理由:vLLM 把语义路由升级成了模型协作引擎,对外还是一个 API 名,背后可以自动让便宜模型先试、多个模型并行出结果再汇总、或者互相审查。五种模式都带了预算控制和失败处理,对做推理优化的工程师很实用。没给更高分是因为这还只是博客文章,不是已发布的产品,而且正文没披露完整的性能对比数据,实际效果得打个问号。

6月19日星期五

Hacker News 首页

我重启了一台10年前的至强处理器174次,删掉12个启动参数,换来了每秒多跑4个token

作者把之前跑 Gemma 4 模型时用的那串25个启动参数,一个一个关掉做对比测试,看哪些真的有用。结果发现大部分参数都是摆设。真正影响速度的就三样:闪存注意力机制、物理核心线程数,以及按任务类型开关的投机解码。投机解码在写代码时能提速28%,但在总结长文档时反而拖慢54%,所以不能无脑开。另外,自动调参的草稿模型设置对长文本处理很不友好,关掉反而更快...

推荐理由:一篇给本地推理玩家看的硬核调参笔记,用174次重启的笨功夫换来了三个能直接落地的结论:大部分启动参数没用,投机解码要按任务开关,自动调参对长文本是坑。标题会勾人,内容有干货,但话题太窄,出了本地推理圈子就没声量了。

6月14日星期日

r/LocalLLaMA

小米上线 MiMo V2.5,用 DFlash 和 Persistent Kernel 把推理速度拉到每秒 1000–3000 token

小米的 MiMo V2.5 模型已经对外服务,官方宣称推理速度达到每秒 1000 到 3000 个 token,靠的是 DFlash(一种加速注意力计算的机制)和 Persistent Kernel(让 GPU 核心持续干活不空转)。DFlash 的模型权重已经放出来了,开源代码也说很快会发。不过 Reddit 原帖正文被安全策略拦了,只剩标题,所以实...

推荐理由:MiMo V2.5 宣称的 1000-3000 tps 和两个具名加速机制(DFlash、Persistent Kernel)信息量够硬,权重已出、代码承诺开源,对本地部署的人直接有用。分数没给更高是因为 Reddit 正文被拦了,只剩标题,很多细节没法核实,这点先别太激动。

6月13日星期六

Hacker News 首页

我能买你的 KV 缓存吗?

现在每个 AI 智能体读同一份文档,都要从头算一遍最耗算力的“预填充”步骤,生成一份完全一样的 KV 缓存。这篇论文提了个很直接的方案:让内容发布方提前把文档的 KV 缓存算好,其他智能体直接花钱加载,跳过预填充。在 Qwen3-4B 上实测,复用缓存比重新预填充便宜 9 到 50 倍,而且输出的 token 完全一致,精度零损失。但直接把缓存文件传出...

推荐理由:这篇论文提了个很直接的办法:让内容发布方提前把文档的 KV 缓存算好,其他智能体花钱加载,跳过最耗算力的预填充步骤。在 Qwen3-4B 上实测,复用缓存比重新预填充便宜 9 到 50 倍,而且输出 token 完全一致,精度零损失。我会先打个折——目前只在 Qwen3-4B 一个模型上验证过,正文没披露缓存安全、定价机制这些落地细节,这点先别太激动。但思路本身很实用,把缓存从技术细节变成了可交易资源,对做 agent 流水线的人吸引力很大。

6月12日星期五

r/LocalLLaMA

MiniMax 开源 MSA 稀疏注意力:109B 模型处理百万 token 时注意力计算量砍掉 28.4 倍

MiniMax 发了一篇论文,提出一种叫 MSA 的稀疏注意力方法,专门解决超长上下文推理时注意力计算太贵的问题。它的做法是在 GQA(分组查询注意力)基础上加一个轻量的“索引分支”,先给每块 KV 缓存打分,每个查询组只挑分数最高的一小部分块,主分支再对这些挑出来的块做精确注意力计算。配合专门写的 GPU 内核,一个 109B 参数的多模态模型在 H...

推荐理由:这篇不是纯理论,有具体机制和实测数字,对搞推理加速的人是真干货。但内容偏底层 CUDA 优化,一般读者上手门槛高,所以推荐度上我稍微收了一点,整体还是值得放进精选。

6月10日星期三

AI HOT 精选

OpenRouter 的 Advisor 工具页面 404 了,正文没披露任何细节

OpenRouter 原本要介绍一个叫 Advisor 的工具,让 GPT-4o Mini 这类便宜模型在生成过程中可以随时去问 Claude Fable 等更强模型。但博客页面直接返回 404,文章不存在。定价、延迟、路由策略这些关键信息全都没公开,目前只能看到标题和摘要里的概念,没法判断实际效果和成本。

推荐理由:我会先打个折:OpenRouter 这篇博客直接 404,正文没披露定价、延迟、路由策略和实际效果,目前只有标题和摘要里的概念。概念本身有意思——让便宜模型在生成中途去问强模型,相当于给低成本模型配了个随时可叫的顾问,不是简单的 fallback 或静态路由。这点先别太激动,因为没数据验证到底省不省钱、延迟高不高、强模型被调用的频率和策略全都不清楚。对正在搭模型路由栈的团队来说,这个方向确实踩中了成本与质量的平衡点,但信息缺口太大,只能当产品信号看。

r/LocalLLaMA

ICML 论文提出可预测幻觉的“回答-弃权”闸门,并开源 ntkMirror 免训练实现

这篇 ICML 2026 论文给证据型问答任务设计了一个 ISR=1 的闸门:模型在不确定时直接闭嘴不答,而不是硬编。他们同时放出了 ntkMirror,一个免训练的开源实现,能在本地模型上跑。做法是让模型对同一问题看多份不同排序的证据,如果几次回答不一致就弃权。在留出的审计集上,幻觉率压到了 0.0%–0.7%,代价是大约 24% 的问题被主动弃权。...

推荐理由:这篇 ICML 论文和配套的 ntkMirror 实现,核心思路不复杂:让模型对同一问题看几份顺序不同的证据,回答不一致就闭嘴不答。在审计集上幻觉率确实压得很低,但约四分之一的问题被弃权,这个代价得看场景能不能接受。论文限定在证据型问答,别急着往开放域对话上套。开源免训练能本地跑是个加分项,但正文没披露不同模型尺寸下的延迟和资源消耗,实际部署前最好自己测一下。

6月9日星期二

AI HOT 精选

Google 放出 Gemini 3.5 Live Translate,话没说完就开始翻,支持 70 多种语言

Google 发了 Gemini 3.5 Live Translate,一个实时语音转语音翻译模型。它不等对方把整句话讲完,边听边翻,用流式更新把结果推出来,延迟压到几秒,还能保留原声的语速、音高和语调。支持 70 多种语言,目前通过 Gemini Live API、Google Meet 预览版和 iOS/Android 的 Google 翻译 Ap...

推荐理由:HKR 三项都成立:Google 把实时语音翻译绑定了 70+ 语言和说话人未结束就开始的流式输出。分数留在 82,因为正文没披露具体上线范围、定价和基准测试结果,实际效果和可用性还得等验证。

AI HOT 精选

Gemma 4 12B 发布:一个模型直接看懂图文和音频,不用外挂编码器

Google DeepMind 开源了 Gemma 4 12B,一个 120 亿参数的多模态模型。它最大的变化是去掉了传统的独立视觉/音频编码器,把所有输入统一交给 Transformer 处理,架构更简单。模型能直接听懂语音,不再需要先转文字。官方说它用 Apache 2.0 协议开源,在 16GB 显存或统一内存的笔记本上就能跑。性能方面,正文没给...

推荐理由:我会先打个折:正文没给性能对比和具体 benchmark,所以没法判断它到底多强。但架构上的变化是实打实的——把视觉和音频编码器都砍掉,统一用 Transformer 处理,等于简化了管线,也降低了工程复杂度。能在 16GB 显存或统一内存的笔记本上跑,对个人开发者和中小企业是个实在的卖点。原生语音输入意味着不用再串一个 ASR 模块,做语音助手或实时对话应用会更轻量。Apache 2.0 协议也扫清了商用顾虑。整体看,这是一个有明确技术亮点的开源发布,但缺少性能验证,激动之前得等实测数据。

r/LocalLLaMA

苹果在 WWDC 发布了 CoreAI,一个给自家芯片用的端侧推理引擎,用来替代 CoreML

苹果在 WWDC 上公布了 CoreAI,定位是 CoreML 的继任者,专门在苹果芯片上跑模型推理。模型得先用 Python 脚本转一道才能用,目前支持的模型列表主要是 2025 年年中左右的版本。帖子正文没给出任何性能数据,速度、内存占用、功耗这些关键指标一概没提,所以实际跑起来快不快、省不省资源还不好说。另外原帖链接返回了 403,说明 Redd...

推荐理由:帖子本身信息很薄:CoreAI 接棒 CoreML、需要 Python 转换脚本、模型支持范围有限,这些是事实。但吞吐量、延迟、功耗一概没提,原帖链接还返回了 403,说明来源本身就不完整。苹果的本地推理引擎变动确实值得关注,但这点先别太激动,因为验证不了实际省不省资源。

AI HOT 精选

中国准备砸 2 万亿人民币,五年内铺全国 AI 算力网

彭博社拿到消息,中国正在筹划一个五年约 2 万亿人民币(折合 2950 亿美元)的 AI 基建计划,核心是建大型数据中心。这笔钱主要用来解决国内 AI 发展的算力缺口,相当于国家出钱铺“算力高速公路”。不过正文没披露钱具体怎么分、由哪些部门牵头、以及建成后算力怎么定价和分配。如果是真的,这个投资规模很猛,但先别太激动,等官方细则出来再看落地节奏。

推荐理由:彭博社报了一个还在筹划阶段的五年2万亿人民币AI数据中心计划,算力基建、国家竞争、成本这几个点全踩中了,不是日常政策吹风。不过正文没披露钱怎么分、谁牵头、建成后算力怎么定价分配,所以先给90分,等官方细则出来再看要不要调。

AI HOT 精选

小米 MiMo 1T 模型跑出每秒超 1000 token,靠混合量化和并行解码把速度提了 10 倍

小米 MiMo 和 TileRT 给 1T 参数旗舰模型加了个 UltraSpeed 模式,输出速度首次超过 1000 tokens/s。模型这边用了 FP4 混合量化,只量化 MoE 的 Expert 部分,搭配 DFlash 的块级 masked 并行推测解码,coding 场景下平均一次能接受 6.30 个 token,相当于猜对的命中率不低。系...

推荐理由:我会先打个折:正文没提硬件配置、batch size、并发数,也没说测试用的 prompt 长度和具体环境,所以这个 1000 tokens/s 的绝对值先别太激动。但亮点是技术组合说得清楚——FP4 只量化 MoE 的 Expert 部分,不是全模型瞎压,搭配 DFlash 的块级 masked 并行推测解码,coding 场景下一次能猜对 6.30 个 token,命中率不低,说明这套方案在代码生成这种结构化输出上确实有效。小米给旗舰模型开 UltraSpeed 模式,还定了三倍 Pro 版的价格,摆明了是要在推理速度和 API 商业化上抢个身...

AI HOT 精选

SpaceX 要把 AI 数据中心搬上近地轨道,单颗卫星持续算力约 120 kW,延迟 6-8 毫秒

马斯克公布了 SpaceX 的 AI1 轨道 AI 数据中心卫星方案。每颗卫星峰值功率 150 kW,持续计算功率约 120 kW,大致相当于一个 NVIDIA GB300 机架的算力。卫星跑在 600-800 公里高的近地轨道,通过激光链路互联,带宽约 1 Tbps,往返延迟 6-8 毫秒。散热靠双面散热器,排热能力 1,400 W/m²;太阳能板效...

推荐理由:我会先打个折:发射时间、单颗卫星成本、实际跑过什么推理任务,正文都没提,所以别急着把它当成马上能用的方案。但亮点是实打实的——150 kW峰值功率、120 kW持续算力,直接对标一个GB300机架,散热靠双面散热器做到1,400 W/m²,这些数字说明散热和供电在工程上是认真算过的。激光链路1 Tbps、往返6-8毫秒的延迟,对近地轨道来说算低,但跟地面数据中心比还是高出一截,适合对延迟不那么敏感的大批量推理任务。整体看,这是个有硬核参数支撑的轨道算力方案,不是画饼,但离落地还差关键信息。

r/LocalLLaMA

单张 MI50 跑 Qwen3.6-27B 速度翻倍:从 19.4 涨到 38.1 token/秒

有个玩家在单张 AMD MI50 上跑 Qwen3.6-27B 模型,用 Q8 或更低精度的量化版本时,发现显卡的算力没吃满。他想到一个取巧的办法:不额外加载一个小模型做投机解码,而是让同一个模型同时跑两路计算,假装自己有两份模型副本。结果生成速度直接从 19.4 token/秒翻到 38.1 token/秒。正文没披露具体实现细节和显存占用变化,所以...

推荐理由:这是个 Reddit 玩家的第一手实验,有数字有假设,但没经过正式验证。正文没披露具体实现细节和显存变化,也没有代码或更广的复现结果,所以先放在 featured 这一档。

r/LocalLLaMA

Apple 放出 MLX LM Server,让多台 Mac 通过雷电网口搭伙跑大模型

这篇 Reddit 帖子本身被屏蔽了,正文内容看不到,只能从标题和现有摘要拼出大致信息。Apple 的 MLX LM Server 支持连续批处理,能同时处理多个子代理的请求,不会一个一个排队干等。它还支持分布式推理,可以通过 Thunderbolt RDMA 把几台 Mac 连起来一起跑模型,相当于用高速雷电网口把算力拼成一台虚拟大机器。具体性能、延...

推荐理由:这篇 Reddit 帖子正文被屏蔽了,只能从标题和摘要拼出信息,所以我会先打个折。Apple 的 MLX LM Server 支持连续批处理,多个子代理的请求不用排队干等;还支持通过 Thunderbolt RDMA 把几台 Mac 连起来做分布式推理,相当于用高速雷电网口拼出一台虚拟大机器。这点先别太激动,正文没披露吞吐量、延迟、支持的最大模型尺寸和发布时间,验证很弱。但思路本身对关注本地推理成本的人有参考价值,所以给到 featured 门槛以上。

r/LocalLLaMA

Levi:在你的本地 Qwen 30B 上跑类似 AlphaEvolve 的搜索系统

Levi 是一个开源项目,让你能在本地用 Qwen3-30B-A3B 模型跑一套类似 AlphaEvolve 的搜索系统。作者在 ADRS、IFBench 和 HotpotQA 三个基准上做了测试,声称在单模型、相同预算的条件下,整体成本最多能降到原来的 1/35,评估次数最多能减少到 1/12。不过正文被 Reddit 的网络屏蔽页挡住了,具体实现细...

推荐理由:这篇来自 Reddit 的帖子只给了模型名、基准和成本比例,代码成熟度和可复现细节正文被屏蔽了没看到,所以我会先打个折。但能在本地用 Qwen3-30B-A3B 跑 AlphaEvolve 风格搜索这件事本身挺抓人,数字如果属实确实省钱,先给 featured 让社区去验证。

6月8日星期一

r/LocalLLaMA

小米声称在标准8卡服务器上把1万亿参数模型跑到了每秒1000多个token

小米的MiMo团队发布了MiMo-V2.5-Pro UltraSpeed,说他们在单台8卡的标准服务器上,把一个1万亿参数的混合专家模型(MoE)跑出了每秒超过1000个token的输出速度。这个速度如果属实,确实挺夸张,因为它没用Cerebras那种整块晶圆做的定制芯片,也没用Groq那种靠大量片上内存堆出来的硬件,就是普通GPU服务器。不过帖子正文...

推荐理由:小米说他们在标准8卡服务器上把一个1万亿参数的MoE模型跑出了每秒1000+ token的输出速度,没用Cerebras那种整晶圆芯片,也没用Groq那种靠大量片上内存堆硬件的方案。这个速度如果是真的,确实挺省钱,但正文没披露GPU型号、批次大小、量化精度这些决定性能的关键参数,也没给可复现的测试环境,所以我会先打个折,等更多细节出来再判断。

Hacker News 首页

小米发布 MiMo-V2.5-Pro-UltraSpeed,万亿参数模型跑到每秒 1000 个 token

小米和 TileRT 合作,把一个 1 万亿参数的大模型在 8 张普通 GPU 上跑到了每秒生成 1000 多个 token。他们用了两招:一是只对 MoE 专家模块做 FP4 量化,把模型体积和显存带宽压力打下来,同时保住推理质量;二是用了一种叫 DFlash 的投机解码方法,一次能猜对更长的 token 串,减少反复验证的等待时间。目前这个速度只在...

推荐理由:小米把一个1万亿参数的MoE模型塞进8张普通GPU,靠FP4量化只压缩专家模块,再配上能一次猜对更长token串的DFlash投机解码,把生成速度拉到每秒1000多个token。这个速度如果是真的挺省钱,但正文没交代测试用的什么卡、上下文多长、精度损失多少,我会先打个折。

r/LocalLLaMA

Luce Spark:让 35B 的 MoE 模型在 16GB 显存上跑起来,不用忍受传统卸载的速度惩罚

Luce Spark 是一个开源方案,能让 Qwen3.6 35B-A3B 这种规模的混合专家模型在 RTX 3090 上只占 13.3 GiB 显存,跑出约 100 tok/s 的速度。它的做法是把模型里经常被用到的“热门专家”常驻在 GPU 显存里,不常用的“冷门专家”留在系统内存,需要时再异步搬运到 GPU 上一个固定大小的缓存区,搬运过程会和计...

推荐理由:标题本身就是一个强钩子,35B MoE 塞进 16 GB 卡还免掉 offload 税,对玩本地推理的人来说吸引力很大。文章把技术思路翻译得很清楚:把经常被调用的专家留在 GPU 上,不常用的放内存,用的时候再异步搬进一个固定大小的缓存区,搬运和计算重叠进行,所以能跑到约 100 tok/s,峰值显存只吃 13.3 GiB。不过信息源主要来自 Reddit 帖子,没有第三方复现或更严谨的基准测试,所以重要性先给到 78,等有更多验证再往上调。

AI HOT 精选

小米 MiMo 在单台 8 卡服务器上把万亿参数模型跑到每秒 1000+ token

小米和 TileRT_AI 放出了一个叫 MiMo-V2.5-Pro-UltraSpeed 的版本,用一台普通的 8 卡 GPU 节点就跑起了 1 万亿参数的 MoE 模型,输出速度超过每秒 1000 个 token。这个速度不是靠 Cerebras 或 Groq 那种专用硬件堆出来的,对常规部署来说挺省钱。他们开了限时免费聊天可以上手试,API 价格...

推荐理由:小米这个版本最吸引人的点是用普通 8 卡 GPU 节点把 1T MoE 模型跑到每秒上千 token,没靠 Cerebras 那种专用硬件,部署成本听起来低了不少。我会先打个折:正文没披露具体任务类型、精度损失、首 token 延迟和实际 API 定价,所以这个速度是在什么条件下测的还不清楚。限时免费聊天可以上手试,但长期性价比得等更多数据。这点先别太激动,不过如果属实,对常规推理部署确实挺省钱。

r/LocalLLaMA

RTX 5090 跑 Qwen3.6-27B 实测:DFlash 投机解码加 KV 缓存压缩,速度提到 3.26 倍

作者在单张 RTX 5090 上跑了 Qwen3.6-27B,用 DFlash 做投机解码(让一个小模型先猜答案,大模型再核对,省时间),同时压缩 KV 缓存(把模型记住的上下文瘦身,省显存)。结果最高提速到 3.26 倍。用 q4_0/turbo4 量化时速度是原来的 3.18 倍,WikiText-2 上的困惑度只涨了 0.02%,基本没掉精度。不...

推荐理由:作者在消费级新卡上实测了一套组合拳:用小模型先猜答案再让大模型核对(投机解码),同时把模型记的上下文瘦身(KV 缓存压缩)。结果速度翻了三倍多,精度几乎没掉。这对想在本地跑大模型的人来说是个很实在的参考,数据也够具体。不过来源只有 Reddit 一个帖子,我会先打个折,别当正式论文看。

r/LocalLLaMA

双卡 3090 跑 27B 模型,解码速度几乎翻倍,没插 NVLink 也做到了

一位 Reddit 用户拿 qwen3.6-27b-autoround-int4 模型做测试,对比单张 3090 和两张 3090 的表现。在没装 NVLink、走 8x/8x PCIe 通道、P2P 自动开启、张量并行设为 2 的条件下,叙事类文本的解码速度从 53 token/秒涨到 94 token/秒,代码类解码从 62 token/秒涨到 1...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次测试,没换模型、没换卡型复现,所以别急着当通用结论。但它的价值在于给了一个很具体的参考点——在没桥接器、走普通 PCIe 通道的情况下,qwen3.6-27b 的 int4 量化版用张量并行跑,解码速度几乎翻倍。对正在纠结要不要加卡跑本地推理的人来说,这个数据比厂商白皮书实在。正文没披露功耗、延迟波动和长文本下的表现,这些缺口让结论只能停在“值得自己试一下”的程度。

机器之心 · 公众号

openJiuwen 搞了个叫 MANGO 的多智能体流网络,让一群模型自己学会怎么组队干活

openJiuwen 提出了 MANGO,一个多智能体流网络框架。它把强化学习、文本梯度(用自然语言反馈来调模型)和 Skip-k 机制(跳过不靠谱的中间步骤)揉在一起,让一群模型自己学会怎么组队、怎么分工。用 GPT-4o-mini 跑分,在 MATH500 数学题上比 MaAS 准确率高了 12.8 个百分点,在 DROP 阅读理解上比 AFlow...

推荐理由:我会先打个折:这还是个研究框架,不是大模型或平台级发布,所以别当重磅炸弹看。但 HKR 里 K 最扎实,机制和数字都给出来了,MATH500 上 +12.8% 的差距不算小。H 和 R 靠“流网络”这个角度撑住,对搞多智能体协作的人有参考价值。正文没提开源代码链接,这点先别太激动。

机器之心 · 公众号

阿里 RTPurboV2:用几百步训练把注意力计算砍掉九成,原生 Transformer 又硬气了一回

阿里 RTP 团队发了 RTPurboV2,思路很直接:把模型里 85% 的注意力头换成滑动窗口注意力(SWA),剩下 15% 负责长距离检索的头用低秩投影、聚类和动态 top-p 压缩。适配训练只要大概 600 步、约 100 万条标注 token,Prefill 阶段推理加速最高到 9.36 倍。不过正文因为环境验证失败没抓到具体实验细节和模型规模...

推荐理由:阿里 RTP 团队这篇 RTPurboV2 思路很直白:把模型里大部分注意力头换成便宜的滑动窗口,只留一小撮头用低秩投影和聚类做长距离检索,训练成本压到 600 步、100 万条 token,Prefill 加速最高能到 9.36 倍。这个数字我会先打个折,因为正文自己说环境验证失败没抓到实验细节和模型规模,所以加速比在什么尺寸、什么长度下测的还不清楚。但思路本身对做长上下文部署的人有参考价值,属于工程信号强但缺完整验证的那种。

AI HOT 精选

苹果发了第三代基础模型,一共五款,从手机端到云端都有

苹果在 2026 年 6 月 8 日公布了第三代 Apple Foundation Models(AFM),这次是和 Google 合作定制的。五款模型里,两款跑在设备上:AFM 3 Core 是 30 亿参数的密集模型,质量比上一代好;AFM 3 Core Advanced 是 200 亿参数的稀疏模型,但每次只激活 10 到 40 亿参数,靠的是把...

推荐理由:苹果这次一口气发了五款模型,分设备端和服务器端两条线,还拉上 Google 做定制,信息量够硬。30 亿参数的密集模型和 200 亿参数但每次只激活一小部分的稀疏模型,思路很明确:在手机上跑得动,在云端也能控成本。正文没给具体跑分和定价,所以我会先打个折,但官方发布本身就有分量,尤其对做端侧推理和隐私计算的人。

AI HOT 精选

英伟达和 SK 海力士签了多年协议,要一起设计下一代 AI 内存芯片

两家公司签了一份多年合作协议,打算从设计阶段就联手搞下一代 AI 用的内存芯片。目前公开的信息里没提具体产品规格、什么时候量产,也没说涉及多少资金。

推荐理由:H 和 R 都过了:Bloomberg 首发,加上英伟达和 SK 海力士在 AI 内存供应上的分量,值得关注。K 偏弱,因为规格、量产时间和财务条款全都没披露,所以只能放在 featured 的低分段。

6月7日星期日

r/LocalLLaMA

一台笔记本跑通 Qwen3.6 35B-A3B:我的本地模型“从零到一”时刻

一位 Reddit 用户分享了自己在笔记本上跑通 Qwen3.6 35B-A3B 的体验。他的机器是华硕 Zenbook Pro 14,配了 RTX 4060 8GB 显存和 64GB 内存。用 llama.cpp 加载 unsloth 的 IQ3_XXS 量化版模型,在 3.2 万 token 上下文时生成速度约 27 token/秒,拉到 25.6...

推荐理由:这是单个用户的 Reddit 实测,不是官方发布或论文,但硬件、量化方式、上下文长度和速度都给得很具体,对想在自己机器上跑大模型的人有直接参考价值。我会先打个折,因为只有一台机器的数据,不代表普遍表现,但信息密度够上 featured,分数放在 72–77 这个区间合理。

量子位 · 公众号

京东开源 JoyAI-Echo,5 分钟 AI 长视频不崩,推理速度提了 7.5 倍

京东放出了一个叫 JoyAI-Echo 的开源框架,专门解决 AI 生成 5 分钟长视频时画面容易崩、前后不一致的问题。它用跨模态记忆模块把视频里的角色、场景信息存下来,保证长镜头里不会突然变脸或换衣服。训练上用了 DMD 后训练技术,推理速度比原来快了大概 7.5 倍,生成一段视频的成本和时间都压下来了。输出端还做了实时超分,能把 720P 画面直接...

推荐理由:我会先打个折:正文没提第三方评测或用户实测,所有性能数据都来自京东自己,所以效果得等上手再看。但这条消息本身有料——JoyAI-Echo用记忆模块存角色和场景信息,解决长视频变脸换衣服的老毛病,推理还快了7.5倍,成本往下走。对做视频生成的团队来说,开源就意味着能拿来改、能压成本,这点挺实在。先给80分,等有实测对比再往上调。

AI HOT 精选

AI 公司开始集体换用更便宜的模型,成本能砍掉九成

Tomasz Tunguz 观察到,基础模型公司往上抢应用层生意、最聪明的闭源模型越来越贵、开源模型又已经够用,这三件事逼着 AI 买家开始大规模“换芯”。Coinbase 把简单任务分流到便宜模型,用量指数级涨但成本没变;Lindy 把所有流量从 Anthropic 切到 DeepSeek v4,省了几百万美元,核心场景效果反而更好;Harvey 在...

推荐理由:这篇不是那种“AI 要颠覆一切”的空话,而是把 Coinbase、Lindy、Harvey 这些公司怎么在实际业务里换模型、省了多少钱讲得很清楚。Harvey 那个 84 美元对 954 美元的例子尤其直观,让人一看就知道成本压力有多大。它属于对行业成本结构变化的扎实观察,不是重大模型发布或产品上线,所以放在 featured 里、76 分这个位置是合适的。

6月6日星期六

AI HOT 精选

OpenCV 5 发布,换了一套能跑大模型的神经网络引擎

OpenCV 5 最大的变化是换了一套全新的 DNN 引擎,从原来的逐层执行改成基于计算图的架构,能做算子融合,跑 Transformer、视觉语言模型和大语言模型都成了原生能力。ONNX 算子的覆盖率从 4.x 时期不到 23% 一下子拉到 80% 以上,以前很多导不进来的模型现在能直接用了。另外硬件加速层也重新整理了,厂商可以直接插优化后的计算内核...

推荐理由:HKR 三项都站得住:OpenCV 加原生大模型支持是个实打实的跨界信号,计算图引擎和 ONNX 覆盖率暴涨是硬核知识增量,本地推理和兼容性又切中部署痛点。作为大版本更新,重要性够上 featured,但还没到模型实验室发新作那种必写级别。

r/LocalLLaMA

Domino:把推测解码里的因果建模和自回归起草拆开,Qwen3 吞吐最高提 5.8 倍

这篇论文提出 Domino,把推测解码(让一个小模型先快速起草、大模型再校验)里的两个步骤拆得更干净:因果建模和自回归起草不再绑在一起跑。在 Qwen3 上测出了最高 5.8 倍的吞吐提升。不过 Reddit 帖子本身被屏蔽了,正文没披露具体用了什么硬件、基线怎么设的、数据集和接受率这些关键细节,所以这个 5.8 倍是在什么条件下跑出来的还不清楚,先打...

推荐理由:这篇的核心卖点是 5.8 倍吞吐提升,但 Reddit 帖子被屏蔽了,正文没写用什么硬件、基线怎么设、数据集和接受率这些关键信息,所以这个数字是在什么条件下跑出来的还不清楚,先打个折。不过思路本身有意思:把起草和校验拆干净,代码和模型也开源了,对搞推理优化的人值得看一眼。

Computing Life · Share · 鸭哥调研

Google 每月付 SpaceX 9.2 亿美元租 GPU,但这桩交易的真正主角不是算力

Google 每月花 9.2 亿美元租 SpaceX 的 GPU,不是因为 SpaceX 技术更强,而是因为它用 35 台装在拖车上的甲烷燃气轮机直接发电,绕过了电网接入和环境审批,122 天就把数据中心建起来了。Google 自己受制于合规流程,有钱有客户但没机器,只能先租。但这笔交易水分很大:Colossus 的 GPU 实际利用率只有 11%,说...

推荐理由:HKR 三项都站得住:交易金额和“主角不是算力”的反转够抓人,利用率、工期、退出条款这些数字很实在,痛点也打到了算力紧缺和合规拖延上。但正文没披露合同文件或交叉信源,单篇摘要撑不起更高分,84 分放在 featured 档合理。

AI HOT 精选

用Qwen2.5-3B搭了个五人森林经济体,小模型能跑流程但算账不太行

一个开发者拿Qwen2.5-3B(30亿参数的开源小模型)做了个多智能体模拟:五个角色在森林里各自生产、交易、囤货,跑了15轮。模型在100%的调用里都能输出格式正确的JSON,这点挺稳,但一到经济决策就露怯——它分不清该囤柴还是该卖蜜。作者靠两招补救:一是给环境加限制,比如食物会坏、冬天缺燃料,逼着模型做取舍;二是优化提示词,直接写明“别买自己生产的...

推荐理由:HKR全过。标题本身就抓人——3B小模型跑经济模拟,不是那种千篇一律的benchmark刷分。正文给了实打实的交易数据和基尼系数变化,不是空谈“涌现行为”。对做agent模拟的工程师来说,模型100%输出合法JSON这点很实用,但经济决策拉胯的坑和两条补救措施(环境约束、提示词优化)才是真正能省时间的干货。这只是一份个人工程报告,不是产品发布或框架开源,所以保持在featured门槛上,不往上拔。

AI HOT 精选

SpaceX 与 Google 签下云算力大单,Google 每月付 9.2 亿美元用 xAI 数据中心

SpaceX 披露了一份云服务协议,Google 每月向 SpaceX 支付 9.2 亿美元,换取 xAI 数据中心的计算能力,折合一年约 110 亿美元。正文没披露合同期限、GPU 规模或交付条款。这笔钱说明 AI 算力已经像电力或发射能力一样,成了可以单独定价、单独交易的基础资源。

推荐理由:这条消息最抓人的地方是 Google 付钱给 SpaceX,用的却是 xAI 的算力,三方关系绕了一下。每月 9.2 亿美元这个数字我会先打个折——正文没披露合同期限、GPU 规模或交付条款,所以不知道是长期包量还是短期抢货,也没法判断单价贵不贵。但不管怎么算,一年 110 亿美元的量级已经说明一件事:AI 算力正在变成像电力一样可以单独报价、单独签约的基础资源。这点先别太激动,因为只有一篇报道,缺监管文件或双方确认,但作为信号已经够强,值得放进 P1。

r/LocalLLaMA

在笔记本 RTX 4060 8GB 上跑 Qwen3.6-35B-A3B 的实测:一个参数改动让速度从 11 跳到 43 tok/s,投机解码再提 26%

一位 Reddit 用户在自己的笔记本(RTX 4060 8GB 显存)上跑了 Qwen3.6-35B-A3B 这个混合专家模型。他试下来发现,加上 --no-mmap 这个启动参数后,生成速度直接从大约 11 tok/s 飙到 43 tok/s,翻了近四倍。另外他还用了一个叫投机解码的技巧,拿更小的 Qwen3.5-0.8B 当“草稿模型”先快速出初...

推荐理由:HKR 三项都站得住:笔记本跑 35B 模型是个很直观的 hook,速度提升的数字是硬干货,而且本地部署圈对这类省钱省显存的技巧天然有共鸣。信息来源是 Reddit 单帖,不是正式评测,所以分数没往上拉。