跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 41–60 条 · 共 455 条

6月8日星期一

r/LocalLLaMA

小米声称在标准8卡服务器上把1万亿参数模型跑到了每秒1000多个token

小米的MiMo团队发布了MiMo-V2.5-Pro UltraSpeed,说他们在单台8卡的标准服务器上,把一个1万亿参数的混合专家模型(MoE)跑出了每秒超过1000个token的输出速度。这个速度如果属实,确实挺夸张,因为它没用Cerebras那种整块晶圆做的定制芯片,也没用Groq那种靠大量片上内存堆出来的硬件,就是普通GPU服务器。不过帖子正文...

推荐理由:小米说他们在标准8卡服务器上把一个1万亿参数的MoE模型跑出了每秒1000+ token的输出速度,没用Cerebras那种整晶圆芯片,也没用Groq那种靠大量片上内存堆硬件的方案。这个速度如果是真的,确实挺省钱,但正文没披露GPU型号、批次大小、量化精度这些决定性能的关键参数,也没给可复现的测试环境,所以我会先打个折,等更多细节出来再判断。

Hacker News 首页

小米发布 MiMo-V2.5-Pro-UltraSpeed,万亿参数模型跑到每秒 1000 个 token

小米和 TileRT 合作,把一个 1 万亿参数的大模型在 8 张普通 GPU 上跑到了每秒生成 1000 多个 token。他们用了两招:一是只对 MoE 专家模块做 FP4 量化,把模型体积和显存带宽压力打下来,同时保住推理质量;二是用了一种叫 DFlash 的投机解码方法,一次能猜对更长的 token 串,减少反复验证的等待时间。目前这个速度只在...

推荐理由:小米把一个1万亿参数的MoE模型塞进8张普通GPU,靠FP4量化只压缩专家模块,再配上能一次猜对更长token串的DFlash投机解码,把生成速度拉到每秒1000多个token。这个速度如果是真的挺省钱,但正文没交代测试用的什么卡、上下文多长、精度损失多少,我会先打个折。

r/LocalLLaMA

Luce Spark:让 35B 的 MoE 模型在 16GB 显存上跑起来,不用忍受传统卸载的速度惩罚

Luce Spark 是一个开源方案,能让 Qwen3.6 35B-A3B 这种规模的混合专家模型在 RTX 3090 上只占 13.3 GiB 显存,跑出约 100 tok/s 的速度。它的做法是把模型里经常被用到的“热门专家”常驻在 GPU 显存里,不常用的“冷门专家”留在系统内存,需要时再异步搬运到 GPU 上一个固定大小的缓存区,搬运过程会和计...

推荐理由:标题本身就是一个强钩子,35B MoE 塞进 16 GB 卡还免掉 offload 税,对玩本地推理的人来说吸引力很大。文章把技术思路翻译得很清楚:把经常被调用的专家留在 GPU 上,不常用的放内存,用的时候再异步搬进一个固定大小的缓存区,搬运和计算重叠进行,所以能跑到约 100 tok/s,峰值显存只吃 13.3 GiB。不过信息源主要来自 Reddit 帖子,没有第三方复现或更严谨的基准测试,所以重要性先给到 78,等有更多验证再往上调。

AI HOT 精选

小米 MiMo 在单台 8 卡服务器上把万亿参数模型跑到每秒 1000+ token

小米和 TileRT_AI 放出了一个叫 MiMo-V2.5-Pro-UltraSpeed 的版本,用一台普通的 8 卡 GPU 节点就跑起了 1 万亿参数的 MoE 模型,输出速度超过每秒 1000 个 token。这个速度不是靠 Cerebras 或 Groq 那种专用硬件堆出来的,对常规部署来说挺省钱。他们开了限时免费聊天可以上手试,API 价格...

推荐理由:小米这个版本最吸引人的点是用普通 8 卡 GPU 节点把 1T MoE 模型跑到每秒上千 token,没靠 Cerebras 那种专用硬件,部署成本听起来低了不少。我会先打个折:正文没披露具体任务类型、精度损失、首 token 延迟和实际 API 定价,所以这个速度是在什么条件下测的还不清楚。限时免费聊天可以上手试,但长期性价比得等更多数据。这点先别太激动,不过如果属实,对常规推理部署确实挺省钱。

r/LocalLLaMA

RTX 5090 跑 Qwen3.6-27B 实测:DFlash 投机解码加 KV 缓存压缩,速度提到 3.26 倍

作者在单张 RTX 5090 上跑了 Qwen3.6-27B,用 DFlash 做投机解码(让一个小模型先猜答案,大模型再核对,省时间),同时压缩 KV 缓存(把模型记住的上下文瘦身,省显存)。结果最高提速到 3.26 倍。用 q4_0/turbo4 量化时速度是原来的 3.18 倍,WikiText-2 上的困惑度只涨了 0.02%,基本没掉精度。不...

推荐理由:作者在消费级新卡上实测了一套组合拳:用小模型先猜答案再让大模型核对(投机解码),同时把模型记的上下文瘦身(KV 缓存压缩)。结果速度翻了三倍多,精度几乎没掉。这对想在本地跑大模型的人来说是个很实在的参考,数据也够具体。不过来源只有 Reddit 一个帖子,我会先打个折,别当正式论文看。

r/LocalLLaMA

双卡 3090 跑 27B 模型,解码速度几乎翻倍,没插 NVLink 也做到了

一位 Reddit 用户拿 qwen3.6-27b-autoround-int4 模型做测试,对比单张 3090 和两张 3090 的表现。在没装 NVLink、走 8x/8x PCIe 通道、P2P 自动开启、张量并行设为 2 的条件下,叙事类文本的解码速度从 53 token/秒涨到 94 token/秒,代码类解码从 62 token/秒涨到 1...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次测试,没换模型、没换卡型复现,所以别急着当通用结论。但它的价值在于给了一个很具体的参考点——在没桥接器、走普通 PCIe 通道的情况下,qwen3.6-27b 的 int4 量化版用张量并行跑,解码速度几乎翻倍。对正在纠结要不要加卡跑本地推理的人来说,这个数据比厂商白皮书实在。正文没披露功耗、延迟波动和长文本下的表现,这些缺口让结论只能停在“值得自己试一下”的程度。

机器之心 · 公众号

openJiuwen 搞了个叫 MANGO 的多智能体流网络,让一群模型自己学会怎么组队干活

openJiuwen 提出了 MANGO,一个多智能体流网络框架。它把强化学习、文本梯度(用自然语言反馈来调模型)和 Skip-k 机制(跳过不靠谱的中间步骤)揉在一起,让一群模型自己学会怎么组队、怎么分工。用 GPT-4o-mini 跑分,在 MATH500 数学题上比 MaAS 准确率高了 12.8 个百分点,在 DROP 阅读理解上比 AFlow...

推荐理由:我会先打个折:这还是个研究框架,不是大模型或平台级发布,所以别当重磅炸弹看。但 HKR 里 K 最扎实,机制和数字都给出来了,MATH500 上 +12.8% 的差距不算小。H 和 R 靠“流网络”这个角度撑住,对搞多智能体协作的人有参考价值。正文没提开源代码链接,这点先别太激动。

机器之心 · 公众号

阿里 RTPurboV2:用几百步训练把注意力计算砍掉九成,原生 Transformer 又硬气了一回

阿里 RTP 团队发了 RTPurboV2,思路很直接:把模型里 85% 的注意力头换成滑动窗口注意力(SWA),剩下 15% 负责长距离检索的头用低秩投影、聚类和动态 top-p 压缩。适配训练只要大概 600 步、约 100 万条标注 token,Prefill 阶段推理加速最高到 9.36 倍。不过正文因为环境验证失败没抓到具体实验细节和模型规模...

推荐理由:阿里 RTP 团队这篇 RTPurboV2 思路很直白:把模型里大部分注意力头换成便宜的滑动窗口,只留一小撮头用低秩投影和聚类做长距离检索,训练成本压到 600 步、100 万条 token,Prefill 加速最高能到 9.36 倍。这个数字我会先打个折,因为正文自己说环境验证失败没抓到实验细节和模型规模,所以加速比在什么尺寸、什么长度下测的还不清楚。但思路本身对做长上下文部署的人有参考价值,属于工程信号强但缺完整验证的那种。

AI HOT 精选

苹果发了第三代基础模型,一共五款,从手机端到云端都有

苹果在 2026 年 6 月 8 日公布了第三代 Apple Foundation Models(AFM),这次是和 Google 合作定制的。五款模型里,两款跑在设备上:AFM 3 Core 是 30 亿参数的密集模型,质量比上一代好;AFM 3 Core Advanced 是 200 亿参数的稀疏模型,但每次只激活 10 到 40 亿参数,靠的是把...

推荐理由:苹果这次一口气发了五款模型,分设备端和服务器端两条线,还拉上 Google 做定制,信息量够硬。30 亿参数的密集模型和 200 亿参数但每次只激活一小部分的稀疏模型,思路很明确:在手机上跑得动,在云端也能控成本。正文没给具体跑分和定价,所以我会先打个折,但官方发布本身就有分量,尤其对做端侧推理和隐私计算的人。

AI HOT 精选

英伟达和 SK 海力士签了多年协议,要一起设计下一代 AI 内存芯片

两家公司签了一份多年合作协议,打算从设计阶段就联手搞下一代 AI 用的内存芯片。目前公开的信息里没提具体产品规格、什么时候量产,也没说涉及多少资金。

推荐理由:H 和 R 都过了:Bloomberg 首发,加上英伟达和 SK 海力士在 AI 内存供应上的分量,值得关注。K 偏弱,因为规格、量产时间和财务条款全都没披露,所以只能放在 featured 的低分段。

6月7日星期日

r/LocalLLaMA

一台笔记本跑通 Qwen3.6 35B-A3B:我的本地模型“从零到一”时刻

一位 Reddit 用户分享了自己在笔记本上跑通 Qwen3.6 35B-A3B 的体验。他的机器是华硕 Zenbook Pro 14,配了 RTX 4060 8GB 显存和 64GB 内存。用 llama.cpp 加载 unsloth 的 IQ3_XXS 量化版模型,在 3.2 万 token 上下文时生成速度约 27 token/秒,拉到 25.6...

推荐理由:这是单个用户的 Reddit 实测,不是官方发布或论文,但硬件、量化方式、上下文长度和速度都给得很具体,对想在自己机器上跑大模型的人有直接参考价值。我会先打个折,因为只有一台机器的数据,不代表普遍表现,但信息密度够上 featured,分数放在 72–77 这个区间合理。

量子位 · 公众号

京东开源 JoyAI-Echo,5 分钟 AI 长视频不崩,推理速度提了 7.5 倍

京东放出了一个叫 JoyAI-Echo 的开源框架,专门解决 AI 生成 5 分钟长视频时画面容易崩、前后不一致的问题。它用跨模态记忆模块把视频里的角色、场景信息存下来,保证长镜头里不会突然变脸或换衣服。训练上用了 DMD 后训练技术,推理速度比原来快了大概 7.5 倍,生成一段视频的成本和时间都压下来了。输出端还做了实时超分,能把 720P 画面直接...

推荐理由:我会先打个折:正文没提第三方评测或用户实测,所有性能数据都来自京东自己,所以效果得等上手再看。但这条消息本身有料——JoyAI-Echo用记忆模块存角色和场景信息,解决长视频变脸换衣服的老毛病,推理还快了7.5倍,成本往下走。对做视频生成的团队来说,开源就意味着能拿来改、能压成本,这点挺实在。先给80分,等有实测对比再往上调。

AI HOT 精选

AI 公司开始集体换用更便宜的模型,成本能砍掉九成

Tomasz Tunguz 观察到,基础模型公司往上抢应用层生意、最聪明的闭源模型越来越贵、开源模型又已经够用,这三件事逼着 AI 买家开始大规模“换芯”。Coinbase 把简单任务分流到便宜模型,用量指数级涨但成本没变;Lindy 把所有流量从 Anthropic 切到 DeepSeek v4,省了几百万美元,核心场景效果反而更好;Harvey 在...

推荐理由:这篇不是那种“AI 要颠覆一切”的空话,而是把 Coinbase、Lindy、Harvey 这些公司怎么在实际业务里换模型、省了多少钱讲得很清楚。Harvey 那个 84 美元对 954 美元的例子尤其直观,让人一看就知道成本压力有多大。它属于对行业成本结构变化的扎实观察,不是重大模型发布或产品上线,所以放在 featured 里、76 分这个位置是合适的。

6月6日星期六

AI HOT 精选

OpenCV 5 发布,换了一套能跑大模型的神经网络引擎

OpenCV 5 最大的变化是换了一套全新的 DNN 引擎,从原来的逐层执行改成基于计算图的架构,能做算子融合,跑 Transformer、视觉语言模型和大语言模型都成了原生能力。ONNX 算子的覆盖率从 4.x 时期不到 23% 一下子拉到 80% 以上,以前很多导不进来的模型现在能直接用了。另外硬件加速层也重新整理了,厂商可以直接插优化后的计算内核...

推荐理由:HKR 三项都站得住:OpenCV 加原生大模型支持是个实打实的跨界信号,计算图引擎和 ONNX 覆盖率暴涨是硬核知识增量,本地推理和兼容性又切中部署痛点。作为大版本更新,重要性够上 featured,但还没到模型实验室发新作那种必写级别。

r/LocalLLaMA

Domino:把推测解码里的因果建模和自回归起草拆开,Qwen3 吞吐最高提 5.8 倍

这篇论文提出 Domino,把推测解码(让一个小模型先快速起草、大模型再校验)里的两个步骤拆得更干净:因果建模和自回归起草不再绑在一起跑。在 Qwen3 上测出了最高 5.8 倍的吞吐提升。不过 Reddit 帖子本身被屏蔽了,正文没披露具体用了什么硬件、基线怎么设的、数据集和接受率这些关键细节,所以这个 5.8 倍是在什么条件下跑出来的还不清楚,先打...

推荐理由:这篇的核心卖点是 5.8 倍吞吐提升,但 Reddit 帖子被屏蔽了,正文没写用什么硬件、基线怎么设、数据集和接受率这些关键信息,所以这个数字是在什么条件下跑出来的还不清楚,先打个折。不过思路本身有意思:把起草和校验拆干净,代码和模型也开源了,对搞推理优化的人值得看一眼。

Computing Life · Share · 鸭哥调研

Google 每月付 SpaceX 9.2 亿美元租 GPU,但这桩交易的真正主角不是算力

Google 每月花 9.2 亿美元租 SpaceX 的 GPU,不是因为 SpaceX 技术更强,而是因为它用 35 台装在拖车上的甲烷燃气轮机直接发电,绕过了电网接入和环境审批,122 天就把数据中心建起来了。Google 自己受制于合规流程,有钱有客户但没机器,只能先租。但这笔交易水分很大:Colossus 的 GPU 实际利用率只有 11%,说...

推荐理由:HKR 三项都站得住:交易金额和“主角不是算力”的反转够抓人,利用率、工期、退出条款这些数字很实在,痛点也打到了算力紧缺和合规拖延上。但正文没披露合同文件或交叉信源,单篇摘要撑不起更高分,84 分放在 featured 档合理。

AI HOT 精选

用Qwen2.5-3B搭了个五人森林经济体,小模型能跑流程但算账不太行

一个开发者拿Qwen2.5-3B(30亿参数的开源小模型)做了个多智能体模拟:五个角色在森林里各自生产、交易、囤货,跑了15轮。模型在100%的调用里都能输出格式正确的JSON,这点挺稳,但一到经济决策就露怯——它分不清该囤柴还是该卖蜜。作者靠两招补救:一是给环境加限制,比如食物会坏、冬天缺燃料,逼着模型做取舍;二是优化提示词,直接写明“别买自己生产的...

推荐理由:HKR全过。标题本身就抓人——3B小模型跑经济模拟,不是那种千篇一律的benchmark刷分。正文给了实打实的交易数据和基尼系数变化,不是空谈“涌现行为”。对做agent模拟的工程师来说,模型100%输出合法JSON这点很实用,但经济决策拉胯的坑和两条补救措施(环境约束、提示词优化)才是真正能省时间的干货。这只是一份个人工程报告,不是产品发布或框架开源,所以保持在featured门槛上,不往上拔。

AI HOT 精选

SpaceX 与 Google 签下云算力大单,Google 每月付 9.2 亿美元用 xAI 数据中心

SpaceX 披露了一份云服务协议,Google 每月向 SpaceX 支付 9.2 亿美元,换取 xAI 数据中心的计算能力,折合一年约 110 亿美元。正文没披露合同期限、GPU 规模或交付条款。这笔钱说明 AI 算力已经像电力或发射能力一样,成了可以单独定价、单独交易的基础资源。

推荐理由:这条消息最抓人的地方是 Google 付钱给 SpaceX,用的却是 xAI 的算力,三方关系绕了一下。每月 9.2 亿美元这个数字我会先打个折——正文没披露合同期限、GPU 规模或交付条款,所以不知道是长期包量还是短期抢货,也没法判断单价贵不贵。但不管怎么算,一年 110 亿美元的量级已经说明一件事:AI 算力正在变成像电力一样可以单独报价、单独签约的基础资源。这点先别太激动,因为只有一篇报道,缺监管文件或双方确认,但作为信号已经够强,值得放进 P1。

r/LocalLLaMA

在笔记本 RTX 4060 8GB 上跑 Qwen3.6-35B-A3B 的实测:一个参数改动让速度从 11 跳到 43 tok/s,投机解码再提 26%

一位 Reddit 用户在自己的笔记本(RTX 4060 8GB 显存)上跑了 Qwen3.6-35B-A3B 这个混合专家模型。他试下来发现,加上 --no-mmap 这个启动参数后,生成速度直接从大约 11 tok/s 飙到 43 tok/s,翻了近四倍。另外他还用了一个叫投机解码的技巧,拿更小的 Qwen3.5-0.8B 当“草稿模型”先快速出初...

推荐理由:HKR 三项都站得住:笔记本跑 35B 模型是个很直观的 hook,速度提升的数字是硬干货,而且本地部署圈对这类省钱省显存的技巧天然有共鸣。信息来源是 Reddit 单帖,不是正式评测,所以分数没往上拉。

Hacker News 首页

Google 每月付给 SpaceX 9.2 亿美元,租用 xAI 数据中心的算力

CNBC 报道,Google 和 SpaceX 签了一份算力租用合同,每月支付 9.2 亿美元,用的是 xAI 数据中心里的计算资源。报道只给了这个单月金额,没写合同签了多久、总共涉及多少块 GPU、以及算力具体怎么交付。如果按一年算,这笔合同价值超过 110 亿美元,对数据中心租赁来说是个很大的单子。不过正文没披露 Google 拿到的算力规模,也没...

推荐理由:我会先打个折:正文只给了一个月租 9.2 亿美元,没写合同年限,所以总盘子多大只能猜。如果按一年算,超过 110 亿美元,在数据中心租赁里算很大的单子。但没披露 Google 拿到的算力规模,也没说交付形式,这点先别太激动。Google 跑去用 xAI 的机房,而不是自家云,本身就说明现在抢 GPU 有多疯。对关注算力成本和供应链的人来说,这个数字是个参考锚点,但缺太多细节,没法直接拿来算账。