跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 1–20 条 · 共 455 条

昨天 · 9月29日星期二

Hacker News 首页

World Labs 并入 AMD,李飞飞出任首席科学家

World Labs 签了正式协议,要整体并入 AMD。李飞飞会担任 AMD 的执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。Justin Johnson 和 Ben Mildenhall 继续带队,在 AMD 内部组建一个前沿研究部门。两家公司去年就开始在 AMD 的 GPU 上合作搞模型训练和推理优化,这次合并是想把硬件、软件和开放模型打通,...

推荐理由:李飞飞把整个公司卖给 AMD 还当了首席科学家,这事本身就够炸。我会先打个折:正文没披露交易金额和团队规模,所以别急着算估值。但能确认的是双方去年就开始在 AMD 的 GPU 上跑模型训练和推理优化,不是临时起意。合并的逻辑很清楚——把硬件、软件和开放模型捆在一起,想走一条不同于英伟达生态的路。Justin Johnson 和 Ben Mildenhall 继续带队做前沿研究,说明 AMD 要的不只是技术,还有整支能打的团队。这点先别太激动,得看后续 AMD 能不能真把研究转化成产品,但人事和战略层面的信号已经足够强。

9月24日星期四

Google DeepMind

Google DeepMind 为 Private AI Compute 引入安全服务端记忆

Google DeepMind 公布 Private AI Compute 的新技术能力,将私密的服务端持久记忆引入该平台,使 AI 助手能跨设备保留上下文。数据密封在加密存储中,解锁密钥仅保存在用户设备上,模型访问时通过端到端加密通道进入云端安全隔区,在隔离内存中临时解密并即时重新加密。

推荐理由:原文说明云端持久记忆如何用安全隔区与设备端密钥实现隐私保护,可了解云端 AI 记忆的隐私架构思路。

9月23日星期三

AI HOT 精选

Modal 公开万亿参数编码 Agent 推理优化细节:单副本性能提升 2.8 倍,把烧钱服务做到价格有竞争力

Modal 工程团队写了一篇长文,拆解他们怎么为 Moonshot AI 的 Kimi K2.6 模型做推理加速,用来驱动编码 Agent。核心成果是把单副本(replica)性能提了 2.8 倍(按单用户交互体验算)和 5.6 倍(按多用户并发吞吐算),让原本贵到没法用的服务变得价格有竞争力。文章先讲工作负载:万亿参数的混合注意力 MoE 模型,输入...

推荐理由:Modal 这篇工程拆解直接甩出两个硬数字:单副本交互体验提了 2.8 倍,多用户并发吞吐提了 5.6 倍,对搞推理优化的人来说是能直接拿来对标的参考。没给更高分是因为这属于基础设施层的优化,不是模型能力或产品更新;但文章把万亿参数 MoE 模型怎么从贵到用不起做到价格有竞争力讲清楚了,对从业者有实际价值。

9月21日星期一

AI HOT 精选

AI 开始接管 if-then 判断:专用决策器把分类成本砍掉近百倍

Tomasz Tunguz 拿自己生产环境里 98 封邮件实测了两款新工具 Jev 和 SemIf。它们不生成文字,只跑一遍注意力计算就直接输出选项概率,几百毫秒出结果。分类准确率从原来通用模型的 47% 跳到 80% 以上,单次调用成本降到 0.0004 美元,比顶尖大模型便宜 76 到 209 倍。Tunguz 认为这标志着 AI 路线开始分叉:前...

推荐理由:Tunguz 拿自己邮箱里的真实邮件跑了对比实验,准确率和成本数字都有,不是空谈趋势。文章点出了一个值得关注的分叉:通用生成模型和专用决策器开始各走各路。分数维持在 78,因为 Jev 和 SemIf 都太新,没有大规模验证,这点先别太激动。

9月19日星期六

Hacker News 首页

C2C:让多个大模型直接交换“思考缓存”,比打字快 2.5 倍,准确率还高 3-5%

这篇 ICLR'26 的论文提了个很直接的想法:多个大模型协作时,别让它们互相发文字了,直接传“脑内状态”(KV-cache,可以理解成模型思考到一半的中间结果)。作者先做了个验证实验,发现把 KV-cache 里的语义信息搞丰富点,不用加大缓存,回答质量就能变好,说明这条路走得通。于是他们搞了个叫 C2C 的框架,用一个小神经网络把 A 模型的 KV...

推荐理由:ICLR'26的论文,想法很巧:多个大模型配合干活时,别互相发文字了,直接传“脑内状态”(KV-cache)。作者先做了验证,证明把缓存里的语义搞丰富点,不用加大缓存就能提升回答质量,说明这条路走得通。然后他们搞了个C2C框架,用一个小神经网络把A模型的缓存翻译成B模型能懂的格式。有验证有方案,知识密度够,但偏底层优化,不是那种大家一看就想转的日常痛点,所以分数没给更高。

9月17日星期四

Hacker News 首页

三元大模型打破 1.58 比特的存储下限:BITCOS 靠利用大量零权重把每权重压到 1.485 比特

三元模型把每个权重存成 -1、0 或 +1,理论上每个权重至少需要约 1.585 比特,实际打包时通常要 1.625 比特。Intel 作者测了 29 个三元大模型,发现零权重占比最高能到 51.5%。他们据此提出 BITCOS,不再用固定打包,而是用一个位图标记哪些位置是零,再单独存非零权重的正负号,这样每权重的存储成本变成 2 减去零权重比例。在 ...

推荐理由:Intel 团队拿 29 个三元模型实测,发现零权重占比最高能到 51.5%,然后提出 BITCOS 编码——不再固定打包,而是用位图标记零位置、非零只存正负号,把每权重存储成本压到 2 减零权重比例,直接捅破 1.58 比特的地板。标题本身就勾人,对做推理优化的人有吸引力,但话题太窄,没有大众传播力,所以 H 和 K 都成立,R 不成立。

9月15日星期二

r/LocalLLaMA

DeepSeek V4.1 Flash 量化版在 M3 Ultra 上跑到 40 token/秒,靠的是把苹果芯片的调度开销砍到骨头里

一个开发者把 DeepSeek V4.1 Flash 的 Q4 量化版塞进了 512GB 内存的 M3 Ultra,通过魔改推理引擎 ds4,把生成速度从每秒 16.6 个 token 提到了 31.3 个,开启模型自带的 DSpark 投机解码后能到 40.5 个。速度提升不是靠改模型,而是把 Metal 图形接口的调度指令大幅合并:原来 384 个...

推荐理由:一篇扎实的本地推理优化记录:把 DeepSeek V4.1 Flash Q4 塞进 M3 Ultra,靠合并 Metal 指令缓冲和开启原生 DSpark 投机解码,速度从 16tps 拉到 40tps。技术细节具体,对本地 LLM 玩家直接有用。分数维持 72,因为受众面窄,但在这个圈子里确实是个能让人立刻动手试的帖子。

9月2日星期三

Hacker News 首页

Slotstream 让 48GB 内存的 Mac 跑起 104GB 的 Qwen 大模型,速度约每秒 12 个 token

carloslfu 开源了一个叫 Slotstream 的工具,用 MLX 和 Swift 写成。它能让一个 1250 亿参数、4-bit 量化后体积仍有 104GB 的 MoE 模型(Qwen3.8-Flash-Next),在一台只有 48GB 内存的 Mac 上跑起来。原理是不把整个模型塞进内存,而是按需从 SSD 里流式加载专家模块。生成速度大约...

推荐理由:一个个人项目,用流式加载专家模块的办法,让 104GB 的 Qwen 125B 模型在 48GB Mac 上跑到每秒约 12 token。工程思路干净,还给了 Ollama 兼容接口,试错门槛低。扣分是因为目前没有社区验证,正文也没披露长上下文下的稳定性或并发表现,所以我会先打个折。

8月26日星期三

Computing Life · Share · 鸭哥调研

“本地 LLM”这个词,把两个市场混装成了一个

文章把大家常说的“本地 LLM”拆成了两个市场:成本市场买的是 5 到 20 倍的价差,控制市场买的是 25 到 33 年才能回本的确定性。作者用“权重开闭源”和“按时间/按 token 计费”画出四个格子,指出 OpenRouter 上开放权重模型调用量暴增,其实跑的都是远程 API,不等于本地部署赢了。自建硬件回本周期完全取决于你替代的是哪种云端计...

推荐理由:把“本地 LLM”拆成成本市场和控制市场,用 OpenRouter 调用量数据和硬件回本周期算账,直接回应 infra 决策者最关心的租 vs 买问题。没给更高分是因为它属于评论分析而非产品发布或研究突破,但 HKR 三个维度都踩中了,featured 合理。

8月21日星期五

Hacker News 首页

Nari Labs 把 Qwen3-TTS 的首音延迟压到 50 毫秒以内,一张 H100 就能跑 10 并发

Nari Labs 开源了一套 Qwen3-TTS 1.7B 的部署方案,在一张 H100 上做到 10 并发请求时,95% 的用户听到第一个字的时间不超过 50 毫秒,且播放不卡顿。他们对比了 vLLM-Omni、SGLang-Omni 等四个引擎,默认设置下最快的 p95 首音延迟也要 277 毫秒。核心优化有两招:一是动态切掉模型开头几十毫秒的静...

推荐理由:Nari Labs 开源了一套 Qwen3-TTS 1.7B 的部署方案,单张 H100 跑 10 个并发请求,95% 的用户在 50 毫秒内就能听到第一个字,比 vLLM-Omni 等引擎默认配置快了五倍以上。文章给了具体 benchmark 和可复现的优化步骤,我会先打个折——这是他们自己测的数据,实际场景里网络抖动和客户端解码还会吃掉一点延迟,但核心思路(动态剪掉开头静音、用 CUDA Graph 合并小算子)确实能帮做实时语音的团队少踩很多坑。

8月20日星期四

Hacker News 首页

DFlash 2 让并行猜词更聪明:每次验证多出 20% 以上有效输出,延迟只增加约 1%

Inco AI 发布了 DFlash 2,在原来一次性并行猜出整段候选词的基础上,加了一个轻量的路径选择器。DFlash 原本是每个位置独立挑最可能的词,但词与词之间可能不连贯,导致验证时整段被砍掉。DFlash 2 的做法是每个位置保留前 16 个候选,然后给相邻词对打分,从中挑出一条最连贯的路径。在 Qwen3.8-27B 上实测,每次验证通过的有...

推荐理由:DFlash 2 是对已有推理加速方法的明确改进,有实测数据,不是空谈。分数没给更高是因为这只是一篇技术博客,不是模型发布或产品上线,影响面集中在推理栈圈子。

8月11日星期二

Mistral AI

Mistral 推出区域推理端点与 Priority Tier,并接入 GLM-5.2 等第三方开源模型

Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,同时 Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。

推荐理由:Mistral 把区域推理端点、SLA 服务层级与第三方开源模型接入放在同一套基础设施上,读者可据此判断欧洲主权 AI 的落地路径。

8月8日星期六

Dwarkesh Patel 播客

持续学习时代:AI 不再训完就上线,而是边用边学

Dwarkesh Patel 认为,一旦模型能在部署后持续更新权重,整个 AI 格局就会变。他打了个比方:就像学萨克斯,光靠看前人的笔记永远学不会,模型也不能只靠会话间传小纸条来真正干活。这会直接冲击现在的监管思路——不能再指望上线前做一次安全检查就万事大吉,按月或按季度做风险巡检才更合理。对齐研究也得转向,从盯着冻结的权重,变成防止模型在持续更新中被...

推荐理由:Dwarkesh 在 AI 播客圈本身可信度就高,这篇是他自己的预测文章,不是访谈转述,观点浓度够。如果持续学习真的落地,确实会动摇现在的安全框架,K 和 R 都站得住。我会先打个折:持续学习还没成现实,但推演逻辑是通的,所以重要性给 78 不算虚高。

8月5日星期三

AI HOT 精选

SpecForge v0.3 发布:把草稿模型训练从主模型上拆下来,还带了一批开源草稿模型

LMSYS 把 SpecForge 的训练流程拆成了两拨独立资源:打补丁的 SGLang 服务器负责从目标模型抓特征,Mooncake 负责传数据,训练节点只管吃特征训练草稿模型。在 8 张 H20 的测试环境里,3 台服务器加 5 个训练节点的吞吐比之前绑在一起的方案高了约 10%。这次更新还一口气支持了 EAGLE3、DFlash、Domino、D...

推荐理由:LMSYS 这次把 SpecForge 的训练流程拆成了三块独立资源——抓特征、传数据、训草稿模型——在 8 张 H20 上跑出了约 10% 的吞吐提升,数字和架构都实在。但话题本身太底层,只对做推理优化的那拨人有直接价值,所以给了 featured 但没给 r。

8月4日星期二

Latent Space

推理工程大师课:Baseten 的 Philip Kiely 和 Ali Taha 聊怎么让模型跑得又快又省钱

Baseten 刚融了 130 亿美元,Philip 和 Ali 在这期播客里把推理工程拆开讲透了。他们聊了量化、投机解码、KV 缓存搬运、以及把预填充和解码拆开跑这些技术。一个 GLM-5.2 的实验发现,多量化几层反而让基准测试质量没掉,吞吐还涨了 20%,因为不同层引入的误差会互相抵消。他们还把 Kimi 的视觉编码器直接嫁接给 GLM-5.2,...

推荐理由:Baseten 刚融了 130 亿美元,让这期推理工程深度聊的时效性更强。GLM-5.2 的量化实验和 Kimi 视觉编码器嫁接是具体、少见的技术细节。分数定在 78 而不是更高,因为毕竟是播客文字稿——信息密度高,但结构不如正式技术报告紧凑。

8月3日星期一

Hacker News 首页

AirLLM 让一张 4GB 显卡就能跑 70B 大模型

这个开源库把 Llama 3 70B 这样的大模型按层拆开,每次只加载一层到显存里算,算完再换下一层,所以一张只有 4GB 显存的普通显卡也能跑推理,不用多卡并联。它支持 Llama、Mistral、ChatGLM 等主流架构,直接兼容 HuggingFace 上的模型。代价是速度会慢不少,但把本地跑大模型的硬件门槛压到了笔记本级别。

推荐理由:把 70B 模型拆成一层一层轮流塞进显存,不是新思路,但做成开箱即用的库确实省事。正文没给具体延迟数据,速度会打折这点得心里有数,所以分数没往上拉。

7月31日星期五

Latent Space

GPT-5.6 全线降价 20%-80%:四个月前旗舰模型的智力,现在只要十三分之一的价格

OpenAI 把 GPT-5.6 Luna 的价格砍到了每百万 token 输入 0.2 美元、输出 1.2 美元,降幅 80%。Terra 降了 20%,Sol 则多了一个 2.5 倍速模式,价格翻倍但智力不变。最狠的是,Luna 在 AA 基准测试上拿了 51 分,跟今年三月 GPT-5.4 开满推理强度时的分数一样,但 token 成本只有当时的...

推荐理由:四个月把同等智力成本压到十三分之一,这个信号比单纯降价狠得多。AA 基准 51 分直接对标 GPT-5.4 满血推理,让降价有了硬参照,不是拿弱化版糊弄人。文章没展开“递归自优化”具体怎么做的,这点先别太激动,但光看价格和分数,已经够让所有调 API 的人重新打算盘了。

7月24日星期五

Hacker News 首页

Echo 用开源模型拼出一个系统,号称性能追平 Fable 但成本只要三分之一

Echo 是 TracerML 做的一个实验性系统,它不单独用某一个模型,而是把 GLM-5.2、Kimi K2.7 等几个开源模型放在一个池子里,每次收到请求再决定调用哪几个模型、怎么组合它们的输出。作者先算了一个理论上限:如果每次都能事后挑出最佳模型组合,性能会远超任何单一模型。Echo 想在不提前知道答案的情况下逼近这个上限。在作者自己搭的评测集...

推荐理由:这是一个 Show HN 项目,核心卖点是动态路由多个开源模型来逼近 Fable 的效果,同时把成本压到三分之一。机制和数字都给了,但我会先打个折:评测集是作者自己搭的,跟 Fable 的对比到底跑了多少样本、在什么任务上比的,正文没细说,这点先别太激动。标题的吸引力在于直接对标一个已知产品并给出具体成本数字,技术思路上用模型池加动态调度也比单纯换模型有嚼头,所以给了 featured。

7月15日星期三

Hacker News 首页

在 13 年前的老至强 CPU 上跑 Gemma 4 26B 模型,每秒 5 个 token

作者把谷歌的 Gemma 4 26B 模型(一种混合专家模型,每次只激活部分参数)塞进了一台 2013 年的惠普存储服务器,双路至强 E5-2690 v2,没显卡,整机成本不到 300 美元。跑起来后生成速度约每秒 5.2 个 token,跟人阅读速度差不多。过程并不顺利:这 CPU 只支持 AVX1 指令集,而推理引擎 ik_llama.cpp 的优...

推荐理由:这是一篇第一人称的硬核实验,不是泛泛的“本地跑大模型”教程。Gemma 4 26B 这种混合专家模型塞进 2013 年老至强,没显卡,总花费不到 300 美元,每个细节都有实测数据撑着。HKR 三项全中,但本质是个人博客的折腾记录,不是产品发布或研究突破,所以重要性给 72、放 featured 刚好。

7月14日星期二

Hacker News 首页

MemStitch:一个给 vLLM 用的零拷贝上下文桥接网关,多智能体场景下首 token 延迟最多降 25 倍

DaqulaLin 开源了 MemStitch,一个架在 vLLM 前面的网关。它利用 PagedAttention 直接在显存里拼接不同请求的 KV 缓存,让多智能体协作时不用反复做预填充,首 token 延迟最多能降 25 倍,显存占用也省了 40% 以上。不过正文没披露测试用的模型和 GPU 配置,25 倍这个数字先打个折看,等具体环境信息出来再说。

推荐理由:多智能体推理延迟是个真实痛点,MemStitch 在 vLLM 显存层做 KV 缓存拼接,比 prompt 层面的方案更根本。25 倍这个数字正文没给模型和 GPU 配置,先打个折,但机制本身值得关注。