跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 201–220 条 · 共 455 条

5月20日星期三

AI HOT 精选

谷歌发布 Gemini 3.5 Flash,输出速度跑到每秒 289 个 token,是 GPT-5.5 的四倍

谷歌在 I/O 大会上推出了 Gemini 3.5 Flash,官方说它在很多基准测试里比自家 3.1 Pro 强。最直观的卖点是快:输出速度达到每秒 289 个 token,对比的是 Claude Opus 4.7 和 GPT-5.5 xhigh,快了大约四倍。谷歌内部还用 Antigravity 工具做了个实验,让 93 个子智能体协作,12 小时...

推荐理由:谷歌在 I/O 上扔了个速度炸弹:Gemini 3.5 Flash 每秒吐 289 个 token,号称是 GPT-5.5 xhigh 和 Claude Opus 4.7 的四倍。这个数字对做应用的人很直观——响应更快、排队更短、按 token 算钱可能也更省。不过正文没提价格、上下文窗口多大、以及能力上限在哪,所以先别把它当成全面碾压,目前就是个单项速度领先。

r/LocalLLaMA

KV 缓存量化实测:TurboQuant 被高估,q5 值得多看两眼,对称 q8 可能白占显存

Anbeeld 用一张 RTX 3090 跑 Qwen 3.6 27B,在 64k 和 128k 上下文长度下测了 KV 缓存量化。先说结论:q4_0 在尾部 token 上的 KLD 比 q5_0 差了 32%,精度掉得明显;turbo4 比普通 q4_0 还慢 17%,显存却没省下多少,有点名不副实。q5_0 在精度和压缩率之间平衡得不错,但正文没...

推荐理由:我会先打个折:这篇测试只跑了一张 RTX 3090 和一个模型,结论不能直接套到其他卡或模型上。但它的好处是给了具体数字,比如 q4_0 在长上下文时尾部偏差比 q5_0 高 32%,turbo4 反而比 q4_0 慢 17%,对称 q8 可能白占显存。这些发现对玩本地推理的人有参考价值,不是泛泛而谈的评测。正文没披露更多硬件或复现细节,所以先别太激动,但作为社区一手数据,值得推给关注推理优化的人看一眼。

AI HOT 精选

谷歌发布 Antigravity 2.0,用 93 个并行子智能体 12 小时搭出一个操作系统

谷歌在 I/O 大会上放出了 Antigravity 2.0 平台,已经对全球用户开放。现场演示里,他们让智能体从零构建了一个能跑起来的操作系统,只用了 12 小时。具体做法是同时跑 93 个子智能体,总共调了超过 1.5 万次模型、处理了 26 亿个 token,最后算下来 API 成本不到 1000 美元。平台本身集成了新的智能体系统和自然语音交互...

推荐理由:谷歌在 I/O 上放了个 Antigravity 2.0 的演示,让智能体用 12 小时、93 个并行子智能体、1.5 万次模型调用和 26 亿 token 搭出一个能跑的操作系统,API 成本不到 1000 美元。我会先打个折:这是发布会演示,不是可复现的公开测试,正文没披露可用性、定价和复现条件,所以别直接当成采购依据。但数字本身挺实在,12 小时和不到 1000 美元这两个数,对想用智能体做复杂工程的人是个参考锚点。标题够抓人,信息量也足,从业者会想点进去看细节,整体值得推。

AI HOT 精选

Gemini 3.5 Flash 发布,主打快速高效跑任务

Google 推出了 Gemini 3.5 Flash,官方说法是它在快速、高效完成任务上目前最强。定位是处理日常任务和多步骤创意项目,强调能应对现实世界的复杂情况。不过正文没披露价格、上下文窗口大小、跑分成绩和 API 可用条件,这些关键信息得等后续公布。

推荐理由:H 和 R 都过,因为这是 Google 新发的 Flash 模型,天然跟推理成本和延迟绑在一起。K 没过:正文没给价格、上下文窗口、基准分数,也没说 API 什么时候能用、有什么条件,所以分数只能压在 78–84 这个区间。我会先打个折,等具体数字出来再重新判断。

r/LocalLLaMA

6GB 显卡跑本地会议纪要的下限测试:Qwen3.5 0.8B 用 57 秒出结果,Granite 4 350M 快但会瞎编

一位用户在 RTX 3060 笔记本(6GB 显存)上拿 VoiceFlow 1.6.0 测了两款小模型,看谁能在本地把一段 4 分钟的会议转成纪要。Qwen3.5 0.8B 在 16K 上下文窗口下花了 57 秒完成总结,结果可用。Granite 4 350M 速度很快,0.6 到 2.8 秒就出稿,但会凭空捏造内容,比如编出币安和《星际迷航》的情节...

推荐理由:一个 Reddit 用户拿笔记本 3060 6GB 跑 VoiceFlow 1.6.0 做会议总结,Qwen3.5 0.8B 用 57 秒处理 4 分钟录音,Granite 4 350M 虽然快到 0.6-2.8 秒但会凭空编造内容。我会先打个折,这是单人单卡的一次性测试,不是系统评测,但 6GB 这个门槛和幻觉案例对想本地跑会议总结的人有直接参考价值,所以给 73 分 featured。

AI HOT 精选

NVIDIA 开源 LongLive 2.0,用 4-bit 量化把长视频生成跑进实时

NVIDIA 把 LongLive 2.0 整套训练和推理代码都放出来了,主打 FP4 量化加并行加速,在 50 亿参数的模型上能跑到每秒 45.7 帧,比很多短视频方案还快。它支持真实视频训练、蒸馏、多镜头生成、序列并行、KV 缓存优化和异步解码部署,专门解决以前长视频生成要么慢到没法用、要么只能做几秒片段的毛病。正文没披露具体显存占用和最长能生成多...

推荐理由:NVIDIA 研究员把 LongLive 2.0 完整开源了,不是只放个模型权重,而是给了训练加推理的全套工具。核心是把视频生成模型压到 4-bit 精度,在 50 亿参数规模下能跑到每秒 45.7 帧,这个速度意味着单卡就能玩长视频生成,不用堆机器。我会先打个折:论文里没看到跟 8-bit 或全精度方案的画质对比,所以省显存是实锤,画质掉多少还不清楚。但作为第一个把 4-bit 量化铺到长视频训练推理全流程的开源项目,对想低成本跑视频生成的人来说,值得立刻翻代码。

5月19日星期二

Hacker News 首页

Forge 给开源小模型加了五层护栏,把智能体任务准确率从 53% 拉到 99%

Forge 是一个 Python 框架,专门给自部署的大模型做工具调用和多步骤智能体流程。它给 Ministral 8B 这个开源小模型套了五层护栏,在 18 个多步骤智能体场景里把任务成功率从 53% 直接提到 99.3%。作者说这背后有篇被 ACM CAIS ’26 录用的论文撑腰,覆盖了 97 种模型和后端组合,每个场景跑了 50 次。不过正文没...

推荐理由:我会先打个折:这是单篇 Show HN 和 GitHub 仓库的展示,还没看到第三方复现或更严苛的对抗测试,所以别直接当生产保证。但它的价值很实在——用 5 层护栏把 Ministral 8B 在代理任务上的表现从不及格拉到接近满分,覆盖了 97 种配置,对想在自己服务器上跑小模型做工具调用的团队来说,省钱的想象空间很大。正文没披露护栏本身会引入多少额外延迟和计算开销,这点先别太激动。

AI HOT 精选

地平线开源了 4 亿参数的机器人控制模型 HoloMotion-1,能跳舞、搬箱子,端侧跑到 300 帧

地平线机器人实验室把一个人形机器人全身控制模型 HoloMotion-1 开源了,参数规模 4 亿,他们管它叫“机器人小脑”。这个模型用了 MoE 稀疏激活和 KV-cache 推理,把单步推理开销压下来,在端侧能跑到约 300FPS,比常见的 50Hz 控制频率高出一大截。训练数据来源比较杂,包括互联网视频、光学动捕、VR 遥操作和惯性动捕,经过统一...

推荐理由:HoloMotion-1 是一个开源机器人控制模型,4 亿参数能在端侧跑到约 300FPS,对做具身智能的团队来说是个可复现的参考。不过目前只看到动作生成能力,正文没披露在真实机器人上的成功率或延迟数据,实际部署效果还得等后续验证。整体偏技术发布,影响力集中在机器人圈子,放在 featured 档位合适。

Latent Space

想进顶尖 AI 实验室做预训练?先学会写一个比官方库还快的 GPU 内核

Vlad Feinberg 写了一篇求职笔记,把进前沿实验室的门槛讲得很直白:核心能力是底层性能调优,也就是能动手改内核(kernel),让模型训练真的跑得动。他给了一道具体的面试题——先推导 Chinchilla 缩放定律,并比较它在稠密模型和 MoE(混合专家)架构下的区别;然后用 JAX 从零实现,最后写一个 Pallas 内核,要求在专家维度 ...

推荐理由:这篇文章把“进前沿实验室做预训练”拆成了可操作的技能清单:手写 JAX 内核、自己推一遍 Chinchilla 定律、用 Pallas 给 MoE 的 up/down 投影做融合。我会先打个折——正文没披露这些建议是 Vlad Feinberg 的个人经验还是 Google 的普遍要求,也没说这些技能在面试里占多大权重。但光是这份清单本身,对想往预训练方向走的人就有参考价值,尤其是把“懂缩放定律”从一句空话落到“自己推导过”这个动作上。

量子位 · 公众号

摩尔线程发布国产全栈具身智能仿真平台,机器狗“小飞”全程在自家 GPU 上完成训练

摩尔线程推出了 MT Lambda 仿真平台,把物理引擎、渲染和 AI 模型训练整合到一起,用自家的 GPU 跑通了从模拟到真机的完整流程。现场演示的机器狗“小飞”在仿真里学会走路后,直接迁移到实物上就能跑。不过正文因为需要验证码没能完整抓取,具体的技术参数、训练时长和成功率数据都没披露,这点先别太激动。

推荐理由:我会先打个折:性能、定价、开放方式和第三方验证正文都没给,所以重要性只能停在 featured 低位。但这条消息本身信息量够——摩尔线程拿出的是一个国产 GPU 驱动的具身仿真方案,不是纯软件缝合,而且用机器狗“小飞”做了 100% 仿真训练到真机迁移的 demo,说明链路至少跑通了。对国内做机器人、做仿真的人来说,这相当于多了一个可能绕开 NVIDIA 生态的选项,哪怕现在还很早期,也值得标记一下。

量子位 · 公众号

Odyssey 放出 Agora-1 世界模型,能四个人同时在线打 FPS,比李飞飞团队还快一步

Odyssey 发布了一个叫 Agora-1 的世界模型,主打实时生成可玩的 FPS 场景,最多支持四个真人或 AI 玩家在同一张图里对战。它把物理模拟和画面渲染拆开跑,训练数据用的是《黄金眼》游戏内部状态,不是单纯看视频学样子。正文没披露具体延迟和硬件成本,所以实际跑起来卡不卡、贵不贵还不清楚。我会先打个折:多人联机听着很酷,但没看到公开可测的版本,...

推荐理由:我会先打个折:Odyssey不是顶级基础模型厂商,所以分数压在78-84这个区间。但Agora-1确实把世界模型从单人看风景推到了4人联机打枪,仿真和渲染分开跑这个架构选择也值得留意。正文没披露延迟数据和画面一致性表现,这点先别太激动。训练数据用了GoldenEye的内部状态,说明他们走的是用游戏引擎内部信息喂模型的路子,不是纯视频学习,这跟其他家路线不一样。

机器之心 · 公众号

Sebastian Raschka 梳理了 Gemma 4 到 DeepSeek V4 的架构变化,重点在省显存和长上下文

这篇文章是机器之心翻译的 Sebastian Raschka 博客,盘点了几款新模型的架构改动,核心都在想办法降低长上下文的显存开销。Gemma 4 的 E2B 方案在 128K 上下文、bfloat16 精度下,KV 缓存能省大约 2.7GB,这个数字挺实在的。另外还提到了 Laguna XS.2 和 ZAYA1-8B,但正文因为微信环境验证拦截,具...

推荐理由:这是一篇编译的架构趋势梳理,不是一手发布,但信息密度不错。我会先打个折,不往 breaking 级别推。HKR 三档都站得住:标题有明确的模型名钩子,正文有可引用的 KV Cache 节省数字,话题本身也直接关系到推理成本和部署预算。整体放在 featured 中段比较合适,既不过度拔高,也不低估它对从业者的参考价值。

FT · 科技

Google 联手黑石系云厂商推芯片,正文被付费墙挡住,具体芯片型号和部署方式没披露

FT 这篇报道的正文被安全验证页挡住了,只从现有摘要能看出:一家黑石投资的 AI 云厂商拿到了 50 亿美元投资,计划明年上线 500 兆瓦的数据中心容量。标题里提到 Google 在推芯片,但正文没披露用的是 TPU 还是自研 Arm 芯片、以什么形式合作——是租算力、联合部署还是单纯采购。这点先别太激动,等看到全文再判断。

推荐理由:我会先打个折:Google 芯片到底怎么合作、分多少钱,正文没披露,这点先别太激动。但 Blackstone 支持的 AI 云集团拿到 50 亿美元投资,明年要上 500MW 数据中心容量,规模不小。对 AI 从业者来说,这背后是算力成本压力和找 NVIDIA 替代方案的现实需求,所以值得放进 featured。

AI HOT 精选

谷歌和黑石联手搞了家 AI 云公司,先掏 50 亿美元,2027 年要跑起 500 兆瓦算力

谷歌要把自家的 TPU 芯片拿出来对外卖算力了,这次拉上了管钱的黑石。新公司名字还没公布,黑石先投 50 亿美元股权,算上杠杆总盘子预计 250 亿美元。目标是 2027 年让 500 兆瓦的数据中心跑起来,这个电量够一座中等城市用。他们手里已经锁了一批在建的数据中心,后续容量还会扩。这基本是冲着 CoreWeave 这类 AI 算力服务商去的,也会让...

推荐理由:谷歌和黑石联手搞 AI 云公司,黑石先掏 50 亿美元股权,总投资可能到 250 亿美元,目标是 2027 年把 500 兆瓦数据中心跑起来。我会先打个折:这不是模型或核心产品发布,而是基础设施层面的动作,但数字够硬、算力供应的角度够直接。正文没披露具体客户或定价细节,所以别急着把它当成 CoreWeave 的翻版。对从业者来说,这条消息的价值在于它把云容量问题摆到了台面上,而且给出了真金白银的时间表。

彭博科技

Google 和 Blackstone 要合资做 AI 云,用自家芯片跟 CoreWeave 抢生意

Google 和 Blackstone 打算成立一家新的 AI 云计算公司,专门用 Google 自己设计的芯片(也就是 TPU)来提供算力,目标是对标 CoreWeave 这类 GPU 云服务商。目前消息来自华尔街日报,Bloomberg 做了跟进。正文没披露这家新公司的股权结构、双方各投多少钱、具体什么时候上线,也没说会用哪一代 TPU。所以现在只...

推荐理由:HKR 三项都过了,但正文只确认了 AI 云合资公司和自研芯片这两点,股权结构、投资规模、上线时间一概没提。大厂在算力上互相卷,这条够上 featured,但信息缺口明显,到不了 P1。

彭博科技

Meta 在路易斯安那州砸 2000 亿美元建数据中心,靠 10 座天然气电厂供电

Meta 在路易斯安那州 Richland Parish 搞了一个 AI 数据中心,钱不是自己全掏,而是通过一笔 2000 亿美元的私募融资来支撑。这个园区的总电力需求最高能到 7.5 吉瓦,其中 5 吉瓦专门给计算设备用。为了喂饱这些机器,他们计划新建 10 座天然气发电厂来供电。这个规模非常夸张,相当于把未来几年的算力扩张押注在化石能源上。不过视频...

推荐理由:Meta这个数据中心项目把AI基建的烧钱程度又拉高了一个量级。2000亿美元融资和7.5吉瓦电力需求是实打实的硬数字,5吉瓦专供计算说明他们押注的是推理和训练长期需求,不是短期炒作。我会先打个折:正文没披露电力来源和具体时间表,7.5吉瓦能不能落地还得看当地电网和审批。如果是真的,这个单点耗电量已经超过很多小国家的总用电,能源成本会直接决定这个数据中心的经济账能不能算过来。

彭博科技

黄仁勋押注中国会重新对美国 AI 芯片开门,但没给时间表

英伟达 CEO 黄仁勋在跟特朗普一起参加完中国峰会后放话,说中国最终会允许进口美国 AI 芯片。这话听着更像是一种表态而非承诺——正文没披露任何具体时间点,也没说依据是什么。考虑到现在出口管制卡得很严,他这番话可能更多是在向市场喊话,别急着把英伟达的中国生意从账本上划掉。

推荐理由:H 和 R 都站得住:英伟达 CEO 公开预测中国会放开 AI 芯片进口,既有话题性又踩在地缘政治的关键点上。K 这边我会先打个折——文章没给出任何落地细节,时间、流程、型号全缺,只能算个人判断,够不上 actionable knowledge。整体放在 featured 档是合适的。

r/LocalLLaMA

llama.cpp 合并 MTP 投机解码,Qwen3.6 27B 在 Strix Halo 上跑到 2.44 倍速

llama.cpp 在 PR #22673 里正式合并了 MTP(多 token 预测)投机解码支持。实测 Qwen3.6 27B 用 Q8_0 量化,在 Strix Halo 上从 7.4 tok/s 提到 18.1 tok/s,速度翻了 2.44 倍;双 RTX 3090 的 Q8_0 方案也从 25.7 tok/s 涨到 55.9 tok/s,约...

推荐理由:HKR 三项都满足:llama.cpp 合入了 MTP 投机解码,用 Qwen3.6 27B 在 Strix Halo 和 RTX 3090 上跑出了实打实的加速数字。范围限定在本地推理优化,不是大模型发布,78 分放在 featured 合适。

5月18日星期一

Import AI

AI界的震网病毒、有缺陷的Muon优化器,以及“正向对齐”

SentinelOne拆解了一个叫fast16.sys的老病毒,它专门篡改高精度计算软件在内存里的结果,可能被用来破坏核武器开发等工程模拟,在震网病毒出现前五年就已存在。Tilde Research发现流行的Muon优化器有个致命缺陷:训练初期会导致MLP层里超过四分之一的神经元永久“死亡”,再也救不回来。他们提出的替代方案Aurora优化器,在11亿...

推荐理由:HKR 三项全中:标题钩子够怪,fast16 和 Aurora 的实测数字也摆出来了,安全与优化器的利害关系讲得清楚。没给更高分是因为这期属于多话题的 newsletter 汇总,不是单一重大发布或行业事件。

r/LocalLLaMA

Qwen 3.6 27B 在 24G 显存上的部署实测:后端、量化方案与参数对比

作者用一张 RTX 3090 24GB 跑 Qwen 3.6 27B,最终留用了 ik_llama.cpp 搭配 Qwen3.6-27B-MTP-IQ4_KS.gguf 这个量化版本。在 156k 上下文、q8_0 KV 缓存并开启 MTP 的设置下,输入约 5900 token 的提示、生成 1024 token 时,预填充速度约 1261 tok/...

推荐理由:这是一篇个人实测,不是官方发布,所以传播面窄一些,但信息密度很高。作者在单张 3090 上把 Qwen 3.6 27B 压进 24GB 显存,还跑通了 156k 上下文,最终选了 ik_llama.cpp 加 IQ4_KS 量化。prefill 能到 1261 tok/s,decode 72.9 tok/s,对本地部署来说相当可用。后端对比部分把 llama.cpp 系和 vllm 的取舍讲清楚了,对想自己搭推理服务的人有直接参考价值。我会先打个折:这只是单人单卡的一次测试,没有多卡、没有生产环境压测,但作为选型参考够用了。