跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 321–340 条 · 共 455 条

5月6日星期三

机器之心 · 公众号

明略开源两套工具,让 Mac 跑本地模型和操控桌面

明略科技放出了两个开源项目:Cider 和 Mano-P 1.0,都是给苹果 M 系列芯片用的。Cider 是个推理加速引擎,在 M5 Pro 上跑 Qwen3-VL-2B 时,把生成第一个 token 前的等待时间缩短了 57% 到 61%。Mano-P 1.0 是个能操作电脑界面的模型,72B 版本在 OSWorld 测试里拿了 58.2 分。不过...

推荐理由:我会先打个折:明略不是一线模型实验室,所以分数没往上拉。但选题本身够实用——Mac 本地跑视觉模型和 GUI 智能体,还给了可复现的提速数据和内存门槛。Cider 的 prefill 加速和 Mano-P 在 OSWorld 的成功率都有具体数字,16GB 设备准确率下降也写明了,不是纯 PR 稿。对想在 Apple Silicon 上折腾本地推理的人,这篇值得看一眼。

r/LocalLLaMA

DeepSeek V4 便宜 17 倍,我实测了 10 天写代码哪些活能丢给本地模型

Reddit 用户 spencer_kw 把自己 10 天的编程工作流拆成 150 个任务,拿本地 Qwen 3.6 27B 和云端模型重新跑了一遍。结果 65% 的任务本地模型干得一样好,20% 勉强能用,只有 15% 必须上云端。他的 API 账单从每月 85 美元掉到 22 美元左右。这个测试说明省钱的关键不是盯着模型单价,而是按任务类型做分流—...

推荐理由:这篇不是模型发布,而是一个开发者拿自己的编码工作流做的成本实测,有日志、有复测、有分桶比例,信息量够。单一个 Reddit 帖子的样本量有限,普适性要打个折,所以放在 featured 而不是 P1。我会先看他的任务分类和路由逻辑,这点比“便宜 17 倍”本身更有参考价值。

TechCrunch · AI

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,说在法律、医学、金融这些领域更少胡说八道

OpenAI 发了 GPT-5.5 Instant,直接替掉了之前的 GPT-5.3 Instant,成了 ChatGPT 的默认模型。公司说新模型在法律、医学和金融这些容易出错的领域减少了幻觉(也就是瞎编答案),同时保持了上一代的低延迟。但正文没披露任何跑分、具体降低了多少幻觉率、覆盖哪些用户、以及价格有没有变。

推荐理由:我会先打个折:OpenAI 把新模型直接设为默认,动作不小,但正文只给了定性描述,没披露幻觉降低的具体幅度、评测方法、覆盖地区或价格。对从业者来说,知道默认模型变了是刚需,但能不能立刻用上、省不省钱、稳不稳定,这些关键信息都还缺着。所以重要性给到 88,属于必须知道但还不能全信的那一档。

r/LocalLLaMA

Gemma 4 出了 MTP 草稿模型,解码速度翻倍但输出质量不变

Google 在 Hugging Face 上放了 4 个 Gemma 4 的 MTP 检查点。MTP 的做法是拿一个小号草稿模型一次预测好几个 token,再由主模型并行验证,相当于让模型“先猜后验”,最终解码速度能提一倍,而且输出质量跟原来一模一样。不过 Reddit 原帖被网络策略挡了,正文没披露具体模型尺寸、硬件要求或实测延迟数据。

推荐理由:H、K、R 都站得住:钩子是 2 倍低延迟解码,有检查点和机制说明,不是画饼。它不是旗舰模型发布,属于实用更新,75 分放在 featured 低位合理。

5月5日星期二

r/LocalLLaMA

Heretic 1.3 发布:模型可复现、内置跑分、显存占用更低

Heretic 1.3 这个版本主要干了三件事。第一,它现在能把跑模型时的环境——PyTorch 版本、GPU 型号、驱动、加速库这些——都打包记录下来,别人照着做就能复现结果,不用再猜“为啥我跑出来不一样”。第二,它内置了一套跑分系统,直接用 lm-evaluation-harness 测 MMLU、EQ-Bench、GSM8K 和 HellaSwa...

推荐理由:我会先打个折:正文没给出 VRAM 具体降了多少,这点先别太激动。但 Heretic 这次更新确实踩到了两个实在需求——一是让模型运行环境可复现,把 PyTorch、GPU、驱动版本都记下来,方便排查问题;二是内置了 lm-evaluation-harness 基准测试,不用再自己搭评测流程。项目有 2 万星、1300 万次下载,社区验证度够高。缺憾是 VRAM 优化只提了方向没给数字,所以重要性停在 72 分,放在 featured 里合适。

OpenAI News

OpenAI 发布 MRC 网络协议,让超大规模 GPU 集群训练更抗断、更省电

OpenAI 把自家训练大模型用的网络方案 MRC(多路径可靠连接)通过 OCP 开源了。MRC 解决的是老问题:集群大到一定程度,网络抖动和链路故障会频繁卡死训练任务,GPU 空转烧钱。它的做法是把一次数据传输拆成几百条路径同时发(packet spraying),哪条路断了就在微秒级绕开,不用等全网重算路由。协议跑在 800Gb/s 网卡上,基于 ...

推荐理由:MRC 是个多路径可靠连接协议,简单说就是给 GPU 集群的通信多备几条路,一条断了还能走别的,训练不容易崩。OpenAI 通过 OCP 公开这个方案,对自建大规模训练集群的团队是个信号——他们可能也在解决类似的网络稳定性问题。但正文没给任何性能数据,延迟降多少、吞吐提多少、实际跑过多大的集群,全都没写。所以我会先打个折,这更像一个技术方向的路标,离能评估效果还差得远。

r/LocalLLaMA

微软 VibeVoice 语音合成与长音频转写被移植到纯 C++,推理不再需要 Python

LocalAI 把微软的 VibeVoice 模型用 ggml 重写成 C++ 版本,叫 vibevoice.cpp,支持 CPU、CUDA、Metal 和 Vulkan 推理,不用装 Python 环境。语音合成这边,给一段 30 秒的参考录音就能克隆声音,输出 24kHz 的语音。语音识别部分用的是一个 7B 模型,能处理长音频并区分不同说话人,结...

推荐理由:这条更新对做本地音频部署的人有用,给出了具体的运行数字和限制。我会先打个折:它来自社区移植,不是微软官方动作,而且缺少流式支持这点在实时场景里是硬伤。整体在 72–77 分 featured 档位合理,不值得当天必写,但值得放进雷达。

机器之心 · 公众号

马斯克 55 万张英伟达 GPU 的集群,实际有效利用率只有 11%

The Information 的报道说,xAI 手里大概 55 万张英伟达 GPU,但模型浮点运算利用率(MFU)只有 11%,折算下来相当于真正在干活的卡就 6 万张左右。文章把锅甩给了 HBM 显存读写、服务器之间通信、训练时空等和软件栈不统一这几个问题。作为对比,Meta 的利用率是 43%,Google 是 46%。不过原文因为微信环境验证失...

推荐理由:这篇不是模型发布或产品更新,是实打实的基础设施效率爆料。55万卡对11%利用率这个对比本身就够抓人,再加上Meta和Google的43%、46%做参照,信息密度高。我会先打个折:正文没披露xAI具体怎么算的MFU,也没说这个11%是瞬时值还是长期均值,但瓶颈拆解(HBM、跨节点通信、软件栈)让文章站得住脚,所以给到82分。

r/LocalLLaMA

MTPLX 让苹果芯片跑大模型快了一倍多,原生 MTP 推理引擎来了

一个叫 MTPLX 的推理引擎在 MacBook Pro M5 Max 上把 Qwen3.6-27B 的生成速度从每秒 28 个 token 提到了 63 个 token,快了 2.24 倍。测试用的是 4-bit MLX 量化,温度 0.6,top_p 0.95,top_k 20,最佳推测深度 D3。关键点是它直接用了模型自带的 MTP 头做推测解码...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,测试范围也限定在 Apple Silicon,验证面还窄。但 2.24 倍的吞吐提升是实打实的数字,而且 MTP heads 内置在模型里,不用额外加载一个 drafter 模型占内存,这点对 Mac 用户确实挺省钱。正文没披露更多模型或硬件的对比数据,所以先放在 featured 低位,等有更广的复现再往上调。

TechCrunch · AI

Cerebras 准备上市,估值可能冲到 266 亿美元,背后是跟 OpenAI 的深度绑定

AI 芯片公司 Cerebras 正在推进 IPO,目标估值至少 266 亿美元。它的核心卖点不是通用芯片,而是跟 OpenAI 绑得很紧的供应链关系。文章没披露 OpenAI 有没有持股、具体贡献了多少收入,也没说上市时间表。所以这轮估值更多是在赌 OpenAI 的算力需求会持续砸在 Cerebras 身上,而不是单纯看芯片本身的技术指标。

推荐理由:我会先打个折:正文其实没给出营收、持股和上市时间表,所以别把它当芯片概念股去追。真正有意思的是 OpenAI 供应链外溢出来的估值效应——一家靠绑定 OpenAI 起来的芯片公司能冲到 266 亿美元以上,说明市场在给 AI 算力渠道和合作关系定高价。这点先别太激动,但确实值得放进雷达里观察。

r/LocalLLaMA

FastDMS 把 KV 缓存压到 1/5~1/8,跑得比 vLLM BF16/FP8 还快

FastDMS 放出了一个 MIT 许可的实现,核心是把模型推理时占显存的 KV 缓存压到原来的 1/5 到 1/8。在 8K 上下文长度下,Llama-3.2-1B 用 6.4 倍压缩后困惑度是 9.200;Qwen3-8B 在压缩系数 c=1 时,KV 缓存从 1.406 GiB 直接降到 0.184 GiB。和很多只算字节数的方案不同,它真的把淘...

推荐理由:我会先打个折,这个项目目前只给了 Llama-3.2-1B 的复现实验,更大规模模型的验证还没看到,所以别急着当通用方案。但它的钩子确实强:KV 缓存压缩 6.4 倍,同时推理速度还比 vLLM 的 BF16/FP8 快,这跟“压缩必降速”的直觉对着干。正文给出了具体的 PPL 和显存占用对比,数字可追溯。真正值得盯的是它回收了被踢掉的物理槽位,不只是账面上少占点字节,这对长上下文推理的显存管理是实打实的改进。来源是开源实现和 Reddit 讨论,不是厂商通稿,信息可信度还行,但权威性一般,所以分数定在 80 这个区间。

5月4日星期一

r/LocalLLaMA

M3 Ultra 加 DGX Spark,能拼出一台 M5 Ultra-lite 吗?

Reddit 有人拿 DGX Spark 和 M3 Ultra 在 llama.cpp 里跑分,统一用 pp16384 上下文。Spark 比 M3 Ultra 快 1.4 到 3.4 倍,看模型:Qwen 27B 跑到 778 token/秒,M3 Ultra 是 340;Mistral 128B 跑到 241,M3 Ultra 只有 72。有个调参...

推荐理由:数据来自 Reddit 单帖,权威性打折扣,但测试设置清楚、模型覆盖广、提速幅度直观,对正在掂量买 M3 Ultra 还是 DGX Spark 跑本地推理的人有参考价值。我会先打个折,因为没看到多轮对话或长上下文压力测试,但就当前信息来说,featured 低空过关没问题。

r/LocalLLaMA

Mistral Medium 3.5 128B 和 Qwen 3.5 122B A10B 在 4 张 RTX 3080 20GB 上的跑分对比

一位 Reddit 用户用 4 张 RTX 3080 20GB 显卡跑了两个大模型。Mistral Medium 3.5 128B 在 llama.cpp 里把张量拆分(tensor split)打开后,生成速度从每秒 10.37 个 token 翻倍到 21.59。但 Qwen 3.5 122B A10B 这个混合专家模型(MoE,把任务分给不同子模...

推荐理由:HKR 三项全中。4×RTX 3080 这个配置本身就是个好钩子,帖子给了 llama.cpp 和 vLLM 下两组实打实的吞吐变化,不是空谈。Mistral 张量切分后速度翻倍,Qwen MoE 反而降速,这个对比把并行策略对 MoE 架构的差异暴露得很清楚。不过数据来自 Reddit 单次跑分,没交代精度和上下文长度,所以分数压在 72–77 这个区间,不往上拔。

r/LocalLLaMA

一个 4.5 亿参数的视觉模型在卫星上跑野火检测,瓶颈不是模型质量,是带宽

作者 PauLabartaBajo 搭了一套端到端的野火预防管线,把 4.5 亿参数的视觉语言模型 LFM2.5-VL 直接部署在卫星上做推理。核心约束是卫星下行带宽太窄,传不了大尺寸多光谱图像,所以方案反过来:在轨跑模型,只下传一份 JSON 格式的风险评估结果。管线用 Sentinel-2 的 RGB 和短波红外(SWIR)图像拼成输入——SWIR...

推荐理由:我会先打个折:这是单人 PoC,只在 22 个地点跑过模拟轨道,正文没披露真实卫星上的延迟和误报率,所以别当成熟方案看。但它的思路很清晰——把算力留在天上,只传结论不传图,带宽省得不是一点半点。用 450M 小模型而不是大模型,也说明在轨推理的硬件约束有多硬。对关注边缘部署和遥感落地的从业者,这个方向值得跟,但验证还差得远。

r/LocalLLaMA

一台 5 年老笔记本跑通 35B 模型:6GB 显存 + CPU 混合推理,插电 23 token/秒

Reddit 用户 abhinand05 在一台 5 年前的华硕 ROG Zephyrus G14 上跑起了 Qwen3.6-35B-A3B 模型。这台笔记本只有 RTX 2060 Max-Q 6GB 显存,搭配 24GB DDR4 内存和 Ryzen 7 处理器。插电时生成速度约 23 token/秒,不插电掉到 10 token/秒出头。能跑起来的...

推荐理由:我会先打个折:这只是单个Reddit用户的跑分,不是官方发布,别当基准看。但它的价值不在权威性,而在把CPU MoE、KV cache量化和ngram推测解码这三样东西组合起来,在6GB显存的旧机器上跑出可用的速度。正文没披露量化精度和功耗细节,这点先别太激动。对想用老设备玩大模型的从业者来说,这篇给了参数和思路,比单纯喊'能跑'有用得多。

r/LocalLLaMA

Intel 和 AMD 联手推 x64 新指令集 ACE,一次能算 1024 次乘法,但没硬件、没功耗、没发货时间

这篇帖子想讨论新的 x64 指令扩展能不能缓解 AI 硬件短缺,但 Reddit 原文被屏蔽了,看不到具体讨论。根据现有摘要,Intel 和 AMD 公布的 ACE 扩展用 2D 瓦片寄存器和外积算法,每时钟周期能做 1024 次乘法,对比现在 AVX 的 64 次,纸面吞吐量直接翻了 16 倍。不过先别太激动——目前没有任何 ACE 硬件上市,功耗、...

推荐理由:HKR 三项都站得住:切入点把 CPU 指令集改动和 AI 硬件荒挂上了钩,有反差;技术细节给了吞吐量倍数和实现机制,不是空谈。分数没给更高,是因为正文自己说了——支持 ACE 的硬件还没发布,功耗、框架适配、量产时间全是空白,现在只能当个技术预告看,别太激动。

5月3日星期日

r/LocalLLaMA

论文称用低成本 FPGA 跑 Qwen3-30B-A3B Q4 推理,生成速度 18 t/s,量产成本预计 150 美元

这篇论文讲的是 Hummingbird+,用低成本 FPGA 跑大模型推理。他们拿 Qwen3-30B-A3B 的 Q4 量化版测试,生成速度能到每秒 18 个 token,板子带 24GB 显存,作者说量产的话成本能压到 150 美元左右。不过帖子正文没披露具体是哪款 FPGA、功耗多少、测试条件是什么,Reddit 原帖还被网络屏蔽了,看不到讨论细...

推荐理由:这篇论文的钩子很直接:一块预计量产成本 150 美元的 FPGA,能把 Qwen3-30B-A3B 的 Q4 量化版跑到每秒 18 个 token,配 24GB 内存。对想本地跑大模型又嫌显卡贵的人来说,这个数字挺诱人。但我会先打个折——正文没披露用的是哪款 FPGA,也没给功耗数据,评测条件同样空白。没有这些,18 t/s 是在什么负载、什么精度损失下跑出来的就说不清。所以这条值得关注,但别急着下结论,等他们把板卡型号和功耗补上再说。

新智元 · 公众号

Claude Code 让 Anthropic 两个月收入翻倍,成史上增长最快的 AI 公司

Semi Analysis 的报告说,Anthropic 的年化收入(ARR)已经冲到 440 亿美元,过去 12 个月净增了 350 亿。其中 Claude Code 这个编程助手到 2026 年 2 月,自己就贡献了 25 亿美元的年化收入。推理毛利率也从 38% 涨到了 70% 以上。不过正文因为微信环境异常没抓到具体内容,这些数字背后的客户留存...

推荐理由:我会先打个折——Semi Analysis 的数据不是官方财报,但 440 亿 ARR 和 70% 推理毛利率这两个数如果属实,说明 Anthropic 靠 Claude Code 在企业端收钱的速度比外界想的快得多。文章真正值得盯的不是总盘子有多大,而是三个东西能不能同时成立:企业用量在涨、代码智能体收入在涨、推理毛利也在涨。正文没披露 Claude Code 的客户留存和续费率,这点先别太激动。

量子位 · 公众号

DeepSeek V4 技术报告里漏掉了 Engram,一个能明显拉高长文本记忆分数的查表模块

DeepSeek V4 的技术报告列了一堆新组件,但没提 Engram。这个模块是 DeepSeek 和北大在 1 月开源的,做法是在 Transformer 的第 2 到第 15 层之间插入查表模块。在 27B 规模的测试里,它把 MMLU 拉高了 3.4 分,多查询大海捞针准确率干到了 97.0%。工程上还有个信号:8 台服务器通过 CXL 共享 ...

推荐理由:文章不是 V4 发布本身,而是技术报告缺了 Engram 这件事的分析。有层数范围、基准涨点和内存池损耗数据,信息密度够,但属于评论向,不是一手发布,所以重要性在 78-84 区间合理。

r/LocalLLaMA

有人复现了 TurboQuant,结果跟论文对不上

一位 Reddit 用户自己实现了 TurboQuant 这篇 KV 缓存量化方法,发现 PROD 变体在 4-bit 下跟原始精度结果的相关性大约 95.8%,远低于论文宣称的 99% 以上。作者还做了一个简单模拟,注意力质量的 top-1 准确率掉到了 67% 左右,说明量化后模型在“该关注哪个 token”这件事上退化明显。核心矛盾在于:论文用相...

推荐理由:这是 Reddit 上的单次复现,不是正式论文或官方发布,但 95.8% 的相关性和约 67% 的 top-1 准确率这两个数字挺具体,对正在掂量 KV cache 量化方案的人有参考价值。我会先打个折,因为样本量和测试条件正文没披露,结论不能直接当定论。