跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 141–160 条 · 共 455 条

5月27日星期三

r/LocalLLaMA

PrismML 放出二值/三值 Bonsai Image 4B:1-bit 文生图扩散模型,浏览器里就能跑

PrismML 发布了 Bonsai Image 4B 的二值和三值版本,把文生图扩散 Transformer 的权重压到 1-bit 或三值,模型体积约 3GB。作为对比,FLUX.2 Klein 4B 大概要 16GB。Reddit 帖子里给了浏览器端 WebGPU 本地运行的 demo 链接,模型用 Apache-2.0 协议开源。不过帖子正文被...

推荐理由:PrismML 这个 Bonsai Image 4B 把文生图 DiT 压到 1-bit 和三值,模型约 3GB,能在浏览器 WebGPU 上完全本地跑,Apache-2.0 开源。我会先打个折:Reddit 信源、实验室发布,实际出图质量和速度还没第三方验证,这点先别太激动。但技术方向上,低比特量化做到浏览器可跑,对本地推理和隐私场景确实挺省钱,所以给 featured 低位。

5月26日星期二

彭博科技

高通要给字节跳动供 AI 数据中心芯片,但具体型号和规模都没说

彭博援引知情人士消息称,高通将向字节跳动供应芯片,用于后者的 AI 数据中心。报道正文被付费墙挡住,没披露芯片型号、订单量、单价和交付时间。我会先打个折:这消息目前只有方向,没有可验证的细节,别急着判断这对字节的算力储备有多大影响。

推荐理由:消息来自彭博社的知情人士,把高通、字节和 AI 数据中心串在了一起,所以 H、K、R 都成立。但芯片型号、采购规模和交付时间一概没提,信息缺口太大,只能给 featured 里的低分段,上不了 P1。

r/LocalLLaMA

dlmserve 开源:首个为扩散语言模型设计的推理引擎,支持 LLaDA-8B,吞吐量是 HuggingFace 的 2.5 倍

Reddit 上有人放出了一个叫 dlmserve 的开源项目,MIT 协议,专门给扩散语言模型做推理服务。它第一个支持的模型是 LLaDA-8B-Instruct,这种模型生成文本的方式和常见的自回归模型不一样,是一步步“去噪”出完整回答。引擎对外提供兼容 OpenAI 的 /v1/chat/completions 接口,方便直接替换。性能方面,在批...

推荐理由:我会先打个折:目前只有 Reddit 一个信源,生态还很早期,所以分数没往上拉。但这条信息本身对玩本地模型的人挺实用——扩散语言模型一直缺好用的推理引擎,dlmserve 直接说自己是第一个,还给了 batch=4 下 2.5 倍 HF 吞吐、12GB 显存可跑这些具体数字,不是空喊口号。MIT 协议和 OpenAI 兼容接口也让试错成本变低。这点先别太激动,但值得放进雷达让读者知道有这么个东西出现了。

AI HOT 精选

OpenRouter 拿到 1.13 亿美元 B 轮,周 token 处理量半年翻了五倍

OpenRouter 宣布完成 1.13 亿美元 B 轮融资,由 CapitalG 领投。公司同时给出一个业务数据:过去 6 个月,平台每周处理的 token 量从 5 万亿涨到 25 万亿,翻了五倍。这个数字说明接入 OpenRouter 做模型调用的生产流量在快速变大。正文没披露估值、具体估值逻辑和资金用途,也没提盈利情况。

推荐理由:HKR三项全中:OpenRouter是很多开发者实际在用的模型路由层,1.13亿美元加上25万亿周token量给出了实打实的规模数据。没给更高分是因为这本质上是融资加增长数字,不是新模型或新能力发布,对技术方向的冲击有限。

阿里技术 · 公众号

南大和阿里发现 DiT 里的残差流拖慢收敛,改用跨层路由后训练快了近 9 倍

南京大学 LAMDA 组和阿里智能引擎团队提出了一种叫 DAR 的方法,把 DiT 模型里固定的残差累积,换成了按时间步动态选择路径的跨层路由。在 ImageNet 256×256 上拿 SiT-XL/2 试,FID 从 9.67 降到了 7.56,而且只用原来大约九分之一的训练步数就达到了同等收敛质量。不过原文因为微信环境验证拦截,具体怎么实现路由、...

推荐理由:我会先打个折:这还是一个针对DiT架构的训练方法改进,不是新模型或产品发布,所以分数没往78以上走。但它的亮点很实在——把残差流这个大家默认的组件揪出来说是收敛瓶颈,然后用一个时间感知的路由去替代固定累加,效果是FID更好、收敛快近9倍。对正在烧钱训视觉模型的人,这个省钱省时间的信号够强,featured没问题。

量子位 · 公众号

面壁智能发布 ForgeTrain 和 MiniCPM5-1B,声称训练框架由 AI 自己编写,训练速度比英伟达 Megatron 快 10%

面壁智能放出了 ForgeTrain 训练框架和 MiniCPM5-1B 模型。ForgeTrain 最抓眼球的地方是,他们说是让 AI 自己写的代码,在同样硬件下比英伟达的 Megatron 训练快 10%。MiniCPM5-1B 是个 10 亿参数的小模型,FP16 权重约 2GB,压缩到 INT4/Q4 后约 0.5GB,主打端侧部署。不过原文因...

推荐理由:面壁智能说 ForgeTrain 是 AI 写的训练框架,同硬件下比英伟达 Megatron 快 10%,还发了 1B 参数的端侧模型 MiniCPM5-1B,FP16 权重约 2GB,压缩到 INT4/Q4 约 0.5GB。我会先打个折——“全球首例 AI 造 AI”这个说法正文没给出第三方复现,10% 的速度提升也没交代测的是什么任务、什么卡、什么 batch size。但即便保守看,一个 AI 生成的训练框架能跑起来还声称更快,本身就有信息量;1B 模型压到 0.5GB 对手机端部署也够直接。分数定在 80,是因为概念够新、数字够具体,但验证...

机器之心 · 公众号

面壁开源 MiniCPM5-1B 和训练框架 ForgeTrain,框架代码是 AI 自己写的,1B 模型跑分 17.9

面壁智能放出了两个东西:一个叫 MiniCPM5-1B 的端侧小模型,和一个叫 ForgeTrain 的训练框架。1B 模型在 AA-Index 上拿了 17.9 分,这个分数说明小体量也能有不错的综合能力。更特别的是 ForgeTrain,它的训练代码不是人写的,是让 AI 自动生成的,跑出来的结果跟英伟达的 Megatron 框架对得上,而且在 H...

推荐理由:HKR 三项都踩中了:AI 写训练框架这个钩子够新鲜,不是又一个千篇一律的模型发布;AA-Index 17.9 分和比 Megatron 快 10% 的 H100 数据让信息有骨头;话题又落在开源小模型和端侧部署上,读者会想点开看。不过它毕竟不是旗舰模型发布,所以分数放在 78 这个区间是合适的。

AI HOT 精选

面壁智能开源 MiniCPM5-1B,1B 参数在 AA-Index 上跑赢所有 2B 以下模型,量化后 0.5GB 能塞进手机和浏览器

面壁智能联合清华和 OpenBMB 开源了一个 1B 参数的小模型 MiniCPM5-1B。它在 AA-Index(一个综合评测榜单)上的得分超过了所有参数不到 2B 的模型,甚至比 3 个月前发布的 Qwen3.5-2B 效果还好,参数量却只有后者的一半。这个模型用 INT4 量化后权重文件只有 0.5GB,可以直接在手机和浏览器里跑。它的基础模型是...

推荐理由:HKR 三项都站得住:有具体参数、量化尺寸和端侧运行条件,反差也够。不过它终究是一次小模型发布,影响力到不了旗舰模型级别,所以 featured 和 78 分是合适的。

新智元 · 公众号

OpenAI 总裁回忆:奥特曼被罢免当天我就辞职了,起初觉得夺回公司只有一成胜算

Greg Brockman 在采访里复盘了 OpenAI 那场 72 小时宫斗。2023 年 11 月 17 号,董事会突然撤掉 Sam Altman 的 CEO 职位,同时把 Brockman 踢出董事会。他当天就辞职了,说当时估算把公司拿回来的概率只有 10%。正文因为微信页面需要验证,没能抓到更多细节,比如董事会具体用什么理由动手、员工联名信怎么...

推荐理由:这篇是 Brockman 对 2023 年 11 月那场宫斗的亲身复盘,不是第三方转述。他给出了辞职时间点和 10% 概率这两个新细节,对理解当时董事会决策的混乱程度有帮助。不过事件本身已经过去一段时间,信息增量集中在个人视角而非技术或产品层面,所以重要性停在 76 分这个区间是合理的。

r/LocalLLaMA

Shard:把 KV 缓存压到原来的十分之一,长上下文推理更省显存

Shard 这套方法能在 Llama-3.1-8B 上把 KV 缓存占的显存砍掉约 90%。具体来说,8K 上下文长度时压缩比约 10 倍,拉到 32K 时能到 11 倍。技术路线分两路:对 Key 矩阵先用 PCA 降维再做 int4 量化,对 Value 矩阵则用 Hadamard 旋转配合向量量化。论文在 NIAH 和 LongBench 两个基...

推荐理由:HKR 三项都站得住:10 倍 KV 缓存压缩是个好钩子,数字和模型、上下文长度、基准测试都列清楚了。信息目前只来自 Reddit 帖子,验证有限,所以分数压在 78–84 这个区间。正文没提压缩方法的具体实现和额外计算开销,这点先别太激动,等有人复现再说。

AI HOT 精选

OpenAI 被曝下月发 GPT-5.6,上下文窗口拉到 150 万 token

开发者在 OpenAI Codex 的后台日志里挖出了一个叫 iris-alpha 的未公开模型,对应 GPT-5.6,可能 6 月发布。最直观的变化是上下文窗口涨到 150 万 token,比现在 GPT-5.5 API 的 105 万多出约 43%。有人在辅助工具 OpenCode 里实测,喂到 90 万 token 还能流畅回话,甚至能处理超过 ...

推荐理由:这条消息来自 Codex 日志泄露,不是官方公告,所以我会先打个折。但 150 万 token 的上下文窗口和 iris-alpha 代号都是实打实的数字,对做 agent 和长文档处理的人有直接参考价值。正文没提发布时间和定价,这点先别太激动。整体属于值得从业者扫一眼的更新,但还没到必须立刻行动的程度。

AI HOT 精选

苹果被曝用定制版 1.2 万亿参数谷歌模型改造 Siri,简单问题仍跑本地

爆料说苹果下一代 Siri 的核心换成了一个定制的谷歌大模型,参数规模 1.2 万亿,比大家猜的 Gemini 3.5 Flash(约 3000 亿参数)大好几倍。复杂任务会交给这个大模型,简单查询还是留在手机上跑。苹果现在最头疼的是日常问题的响应速度,大模型再聪明,回慢了也没人用。另外,下个月 WWDC 可能会官宣 Apple Intelligenc...

推荐理由:这篇就一个 X 上的爆料,给了些架构细节但没附源文件、没提上线时间和功能范围,所以我会先打个折。1.2T 参数这个数字挺具体,但正文没解释是总参数还是激活参数,也没说模型怎么裁出来给手机用。简单查询跑本地、复杂任务走云端这个分工听着合理,不过延迟到底压到多少、在哪些机型上能跑都没交代。这点先别太激动,等有实测或官方确认再往上调。

5月25日星期一

r/LocalLLaMA

RTPurbo:用几百步训练把全注意力模型转成稀疏推理,长上下文预填充快 9.36 倍

这篇论文提出 RTPurbo,能把原本用全注意力的模型改成稀疏注意力来跑推理,而且只需要几百步训练。做法是只给“检索头”保留完整的 KV 缓存,其他头用一个 16 维的 token 索引器来近似,相当于大幅压缩了要存要算的内容。在 100 万 token 的长上下文场景下,预填充阶段最高快了 9.36 倍,解码阶段快了约 2.01 倍。正文没披露具体用...

推荐理由:我会先打个折:目前只有 Reddit 讨论,正文没披露模型规模、具体任务和代码,验证强度偏弱。但“几百步把全注意力转稀疏”这个思路本身挺省钱的,数字也够具体,对做长上下文推理优化的人值得看一眼。信息缺口明显,所以分数没往上拉。

量子位 · 公众号

Reasonix 给 DeepSeek V4 加了个缓存层,长代码任务里缓存命中率 99.82%,成本打到两折

正文页面被微信环境验证挡住了,看不到具体技术细节。从标题和摘要看,Reasonix 这个工具用了一种“只追加不修改”的循环机制来给 DeepSeek V4 做缓存。在长代码会话场景里,缓存命中率报到了 99.82%,相当于模型每次生成新内容时,前面绝大部分上下文都不用重复计算。一个原本要烧掉 400M token、花 61 美元的任务,用上这套缓存后账...

推荐理由:Reasonix 这个工具把 DeepSeek V4 长会话的缓存命中率拉到 99.82%,账单直接打两折,从 61 美元降到 12 美元。对用 DeepSeek 跑长任务的团队来说,成本降幅很实在。不过正文没披露测试场景的会话长度和任务类型,也没说这个命中率在不同负载下稳不稳,所以先别当通用结论。

Hacker News 首页

AI 芯片成本结构变了:内存开销已占到近三分之二

Epoch AI 估算,从 2024 年第一季度到 2025 年第四季度,高带宽内存(HBM)在 AI 芯片物料成本里的占比从 52% 涨到了 63%。这个数字是拿英伟达、AMD、谷歌和亚马逊四家的 AI 芯片按出货量加权平均算出来的。同期逻辑芯片的成本占比基本没动,在 13% 左右;先进封装从 19% 降到 15%,其他辅助部件从 15% 降到 9%...

推荐理由:这个标题本身就是一个有冲击力的结论,我会先打个折——因为正文只给了链接、68 分和 71 条评论,完全没写这个“近三分之二”是怎么算出来的、统计的是哪种芯片、在什么时间点。如果是真的,那意味着内存成本已经压过计算单元,对推理优化和硬件定价影响很大;但信息缺口太大,现在只能当一个值得追问的信号,不能当定论。

5月24日星期日

r/LocalLLaMA

OpenBMB 在华为昇腾 NPU 上把大模型从头训成 1.58-bit,8B 模型性能保住全精度 97%

OpenBMB 放出了 BitCPM-CANN,一个在华为昇腾 NPU 上原生跑通的 1.58-bit(三值)大模型训练方案。他们用和 MiniCPM4 一样的架构与数据,从零训了 0.5B、1B、3B、8B 四个尺寸。1B 到 8B 的模型在 11 个测试集上平均保住了全精度模型 95.7% 到 97.2% 的性能,3B 版本在 BBH 上打平,3B...

推荐理由:我会先打个折:目前只有 Reddit 帖子作为来源,没有吞吐量、显存占用或复现细节,所以先放在 featured 的底线。但这条信息本身挺实在——OpenBMB 在昇腾 NPU 上从零训练了四个 1.58-bit 的模型,不是推理时量化,而是训练阶段就压到极低比特。1B 到 8B 的性能保留率都在 95% 以上,说明这条路在国产硬件上走得通。对需要控制训练成本、又绑在昇腾生态里的团队来说,这是个值得跟的信号。

r/LocalLLaMA

KV 缓存量化对模型伤害不大,权重量化才是大头:Qwen3.6 27B 的一次小测试

Reddit 用户 hopbel 拿 Qwen3.6 27B 在 wikitext-2 上跑了一组 16k 上下文的近似 KLD 测试,想看看 KV 缓存量化和模型权重量化哪个更影响输出质量。他用 Q5_K_M 权重当基准,对比了两组配置:一组是 Q5_K_S 权重配 q4_0 的 KV 缓存,KLD 分数 0.016304;另一组是 Q4_K_XL ...

推荐理由:这篇 Reddit 帖子自己跑了一组对比实验,结论挺直接:KV 缓存量化带来的质量损失没那么可怕,模型本身的量化等级才是大头。数据给得清楚,Q5 模型加低精度 KV 缓存,KLD 反而比 Q4 模型加全精度 KV 缓存更低。我会先打个折,这只是一个模型在 wikitext-2 上的近似 KLD,不是严格消融实验,但作为一手测试,对玩本地部署的人有参考价值。正文没披露推理速度或显存占用的具体数字,这点比较可惜。

5月23日星期六

机器之心 · 公众号

FlashAR 用 0.05% 的训练数据,把自回归图像模型的生成速度提了 22.9 倍

浙大和阿德莱德大学搞了个 FlashAR,专门给预训练好的自回归图像模型加速。拿 Emu3.5-Image-34B 试了一下,生成一张 512×512 的图,原来要 130.10 秒,现在只要 5.68 秒,快了 22.9 倍。而且只用了原始训练数据量的 0.05% 做微调,GenEval 分数从 80.48 变成 80.29,画质基本没掉。正文没披露...

推荐理由:FlashAR 用极少量数据给预训练好的自回归图像模型做加速,速度提升 22.9 倍,质量几乎没掉,对在意推理延迟和成本的团队是个好消息。论文给了具体数字和 GenEval 对比,信息量够,但正文没披露这 0.05% 数据具体怎么选、不同分辨率下是否同样有效,这点先别太激动。整体是扎实的推理优化工作,不是顶级实验室的模型发布,放 featured 合适。

机器之心 · 公众号

Bengio 团队新论文:用多条并行思路链做递归推理,效果比单条串行推理好

这篇论文提出了 GRAM,一个会生成多条内部推理轨迹、再从中挑出最优解的递归模型。在极难数独测试上,GRAM 用 16 步递归、同时跑 20 条并行思路,准确率达到 97.0%;作为对比,传统串行递归模型 TRM 要跑到 320 步才做到 90.5%。简单说,就是让模型多想几条路再选,比闷头一条路走到黑更靠谱,而且推理步数还少得多。不过正文没披露具体的...

推荐理由:Bengio 团队这篇新论文拿数独极端难度当试金石,用 GRAM 把递归推理的上限拉高了一截。核心卖点是并行轨迹比长串行更有效:16 步递归配上 20 条并行采样,准确率 97.0%,而对比的串行方法要跑 320 步才到 90.5%。我会先打个折——这只是在单一任务上的结果,泛化到其他推理场景还没验证,正文也没披露并行采样的实际计算开销和延迟。但思路本身对做推理加速的人有参考价值,尤其是想用多条短路径替代一条长路径的时候。

Mistral AI

Mistral 收购 Physics AI 公司 Emmi AI

Mistral AI 宣布已达成收购 Physics AI 先驱 Emmi AI 的最终协议,以强化其作为工业企业 AI 转型伙伴的定位。Emmi AI 成立于奥地利,专注物理 AI 与大型工程模型,可加速工程工作流、以实时仿真替代多日计算并构建数字孪生。Emmi 的联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。

推荐理由:Mistral 通过收购 Physics AI 公司 Emmi 补强工业仿真能力,读者可了解其向工程与制造场景延伸的路径。