跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 381–400 条 · 共 455 条

4月24日星期五

Hugging Face 博客

DeepSeek-V4 发布:百万 token 上下文,这次是给干活用的 agent 准备的

DeepSeek 发了 V4,分 Pro 和 Flash 两个版本,都支持 100 万 token 的上下文窗口。Pro 版总参数 1.6 万亿,每次推理激活 490 亿;Flash 版总参数 2840 亿,激活 130 亿。跑分不是最顶尖的,但这不是重点。真正的改进在推理成本上:跟 V3.2 比,Pro 版处理单个 token 的算力只要 27%,K...

推荐理由:DeepSeek-V4 是国产旗舰模型更新,Pro 版 1.6T 总参、49B 激活,Flash 版 284B 总参、13B 激活,都支持 100 万 token 上下文。最值得看的是成本:Pro 单 token 计算量只有 V3.2 的 27%,KV 缓存降到 10%;Flash 更狠,分别只有 10% 和 7%。这意味着跑长上下文 agent 时显存和算力开销大幅缩水,不是光喊口号。HKR 三项全中,放在当天必读档没问题。

4月23日星期四

X · @op7418(歸藏)

Claude 桌面端能接第三方模型了,走开发者模式填 API 就行

有人在 Claude 桌面端发现一个入口:不登录状态下,从 Help → Troubleshooting 开启开发者模式,重启后右上角会多出 Developer 选项,里面可以配置第三方推理服务的 API 地址和 Key,点 Apply locally 就能用。这意味着客户端可以直接把请求打到别的模型或自建的 Claude API 上,不经过 Anth...

推荐理由:我会先打个折:这只是单条 X 帖子,Anthropic 没官宣支持范围、模型白名单或后续政策,所以分数停在 74。但 HKR 三项都踩中了——入口够隐蔽、路径可复现、话题直接打在客户端锁定上。正文没披露 Anthropic 是否默许,这点先别太激动,但如果是真的,等于 Claude 桌面端自己把围墙拆了个口子。

Hugging Face 博客

在 Chrome 插件里跑本地 AI:一份给开发者的架构避坑指南

Hugging Face 发了一篇技术指南,拆解了他们刚做的 Chrome 插件“Transformers.js Gemma 4 浏览器助手”。核心是把 Gemma 4 E2B 模型塞进浏览器的后台 Service Worker 里本地运行,不靠云端。文章重点讲了 Manifest V3 下三个运行环境的职责划分:后台负责跑模型推理,侧边栏做聊天界面,...

推荐理由:这是一篇 Hugging Face 的实操教程,不是模型或平台发布,但把 MV3 架构拆解得挺具体。我会先打个折,因为正文没给出实际延迟或内存占用的测试数据,效果验证还缺一块。不过对想在前端跑本地模型的开发者来说,这篇的工程参考价值够得上 featured 门槛。

FT · 科技

特斯拉把资本支出计划提到 250 亿美元,马斯克在 AI 上继续加注

特斯拉把资本支出计划上调到 250 亿美元,马斯克要把更多钱砸向 AI 相关项目。从 RSS 片段看,这些项目包括自动驾驶出租车、卡车、机器人以及芯片工厂,增幅被形容为“非常显著”。不过正文被付费墙挡住,没披露这笔钱覆盖的时间范围、具体怎么分项,也没提模型细节。能确定的一个信号是:特斯拉在投的不只是训练模型,而是从芯片到终端产品的整套体系。

推荐理由:FT报了一个具体的资本支出跳升数字,直接关联自动驾驶出租车、卡车、机器人和芯片工厂。我会先打个折:时间范围和分项花销都没给,模型细节也缺,所以不是必写级别。但250亿这个数够大,而且投向的是车、机器人和芯片产能整条链,不是只训模型,战略意义摆在那。HKR三项都踩中了,只是信息缺口让它停在featured中段。

4月22日星期三

r/LocalLLaMA

ServiceNow 放出一个 15B 模型,一个权重包能切出 8 种速度档位,最快解码吞吐量翻 10 倍

ServiceNow 在 Hugging Face 上发了 SuperApriel-15B-Instruct,一个 15B 参数的指令模型。它最特别的地方是用了“超级网络”设计:48 层解码器里,每层都塞了 4 种不同的注意力机制(全注意力、滑动窗口、Gated DeltaNet、Kimi Delta Attention),运行时可以像换挡一样选不同组...

推荐理由:一个 15B 模型靠单一检查点覆盖 8 档推理速度,吞吐跨度超过 10 倍,对实际部署的吸引力很强,H 和 K 都站得住。R 来自它把成本-延迟-质量的权衡做成可调开关,而不是让你换模型。不过这只是推理优化方向的发布,不是前沿实验室的旗舰更新,影响范围偏窄,所以 76 分、featured 合理。

OpenAI News

OpenAI 给 Responses API 加了 WebSocket,让 Codex 这类 agent 跑起来更快

OpenAI 发现,当模型推理速度从每秒 65 个 token 飙到近 1000 个 token 时,API 本身的处理开销反而成了拖慢 agent 循环的瓶颈。他们给 Responses API 加上了 WebSocket 支持,思路是把多次独立的 HTTP 请求换成一个长连接,在连接存活期间缓存住对话状态和可复用的上下文,只传新的工具调用结果,省掉...

推荐理由:这是 OpenAI 面向开发者的系统层更新:用 WebSocket 长连接加连接级缓存,把 agent 循环里反复建连、重复请求的开销压下去。HKR 三项都踩中了,但正文没给出延迟降了多少、吞吐多大、适合什么负载,所以只能算中等偏上的 featured,不能拉满。真正值得盯的是长连接怎么省掉往返成本,这不是换模型,是工程侧省钱省时间的优化。

量子位 · 公众号

商汤绝影把32B总参、3B激活的模型塞进车机,跑分压过GPT-5.4和Opus 4.6

商汤绝影发布了一个叫Sage的车载端侧多模态模型,总参数32B,但每次推理只激活3B参数。它在PinchBench上拿了94%,比Claude Opus 4.6的93.3%和GPT-5.4的90.5%都高。模型跑在Nvidia OrinX上,首字延迟约0.5秒,单token生成约0.03秒,吞吐80 tok/s。训练用了两个方法:SCOUT省了约60%...

推荐理由:我会先打个折:所有数据都是商汤自报,没有第三方复现,PinchBench 的对比对象和测试条件正文也没细说。但亮点在于它把 3B 激活模型塞进 OrinX,还给出了推理延迟和吞吐,这对车载场景比跑分更有参考价值。后训练省 60% GPU 小时、复杂任务完成率提 20% 这两个数,缺训练规模和消融细节,先别太激动。整体看,信息量够、落地指向明确,但验证链不完整,所以重要性给 79,放在 featured 里提醒大家关注端侧 Agent 的进展和水分。

机器之心 · 公众号

苹果把 Transformer 改成了 Mamba,推理成本从平方级压到线性

苹果发了一篇技术文章,讲怎么把一个训好的 Transformer 模型(Pythia-1B)蒸馏成 Mamba 架构,让推理时的计算量从平方级降到线性。他们没直接硬蒸,因为直接蒸效果会崩(困惑度直接飙到 100 以上)。实际分了两步:先把 Transformer 的注意力换成一种叫 Hedgehog 的线性注意力,让模型适应线性计算;再把这个中间模型映...

推荐理由:我会先打个折:这还是个论文结果,不是已经落地的产品。但路线本身有意思——不是从头训 Mamba,而是把现成的 Transformer 蒸馏过去,省了大量训练成本。正文给出的下游任务(ARC、PIQA、BoolQ 等)说接近教师,但没放具体数字,这点先别太激动。如果真能在长上下文场景把推理成本压到线性,对需要处理长文档或长对话的产品是实打实的省钱。

机器之心 · 公众号

荣耀在 MagicBook 上预装 YOYO 爪,管它叫全球首款“智能体笔记本”

荣耀把 YOYO 智能体直接做进了 MagicBook 系统里,出厂自带 5 个主智能体和 23 个子智能体。官方说这套方案比外接 OpenClaw 省一半的 token 消耗,还加了本地处理、二次确认和内核级加密。说白了就是把智能体打包成笔记本默认功能,不用自己折腾部署。但正文没提具体用了哪个模型、硬件配置、卖多少钱、什么时候开卖,这些关键信息都缺着...

推荐理由:荣耀把 YOYO Claw 直接预装进 MagicBook,等于把智能体做成出厂能力,这点比跑分更有意思。文章列了 5 个主智能体、23 个子智能体,覆盖教育到内容创作,还提到本地处理、二次确认和内核级加密,信息量够硬。词元消耗降 50% 这个数我会先打个折,因为没给对比基准和测试条件。真正让我把分停在 76 的原因是正文没披露模型、硬件配置、价格和上市时间——缺了这些,没法判断实际成本和落地节奏。

4月21日星期二

FT · 科技

Anthropic 和亚马逊谈了个 1000 亿美元的算力基建大单

Anthropic 跟亚马逊达成了一项总规模 1000 亿美元的 AI 基础设施协议,核心是锁定芯片和算力供应。今年 Anthropic 出过几次服务中断,这次合作主要是为了把计算容量提前占住,而不是普通的战略合作。不过正文被付费墙挡住了,具体的合同期限、钱怎么付、芯片从哪来、交付规模这些关键信息都没披露。

推荐理由:FT 报了一条 Anthropic 与 Amazon 的 1000 亿美元 AI 基础设施协议,金额大到今天必须写。H 端靠千亿数字和算力绑定撑起点击欲;K 端有新事实,但期限、资金来源、芯片来源、交付规模全都没披露,我会先打个折;R 端踩中了模型厂对云和硬件的依赖这个活神经,不是空泛合作,是把供给瓶颈写进了合同。

X · @AnthropicAI

Anthropic 跟亚马逊扩大合作,给 Claude 锁定了最多 5 吉瓦的算力

Anthropic 宣布加深与亚马逊的合作,为训练和部署 Claude 锁定了最高 5 吉瓦的算力。这批算力从这个季度开始陆续到位,到 2026 年底预计先上线近 1 吉瓦。5 吉瓦是个什么概念?大概相当于几个大型数据中心的满负荷运转,说明他们接下来要把模型规模或服务量再往上拉一个台阶。不过正文没披露合同金额、具体用什么芯片、数据中心建在哪,所以实际成...

推荐理由:标题里的 5 吉瓦别直接信,那是远期上限,真正有谱的是今年底先到 1 吉瓦。正文没提合同金额、用什么芯片、数据中心在哪,所以成本结构和实际性能都还是问号。我会先打个折看交付节奏,但能在这个时间点锁产能,对 Anthropic 的训练和部署确实是颗定心丸。

彭博科技

Google 要发新的 AI 推理芯片,直接跟英伟达抢生意

Bloomberg 这条视频提到 Google 准备推出一批专做推理的新 AI 芯片,正面挑战英伟达。不过正文被付费墙挡了,没披露具体发布时间、型号、性能参数、定价和客户。我会先打个折:目前能确认的信号是推理芯片的供给竞争在升温,但产品到底多能打、什么时候落地,都还是未知数。

推荐理由:HKR-H 和 HKR-R 通过,因为这条消息把 Google 和 Nvidia 在推理芯片上的直接竞争摆上了台面。HKR-K 弱:报道只确认了推理这个方向,芯片叫什么、跑分多少、卖多少钱、什么时候出、谁会买,这些关键信息正文都没披露,所以信息缺口很大。

彭博科技

Google 本周要发新一代 TPU,专做推理

Bloomberg 的视频预告说 Google 这周会公布新的定制芯片,定位是 AI 推理任务。正文被付费墙挡了,没拿到具体型号、性能、功耗和价格。我会先打个折:重点不是又发芯片了,而是这批 TPU 能不能把推理成本打下来、供货稳不稳。

推荐理由:标题说新芯片,但正文其实只给了两个信息:本周发布、面向推理。我会先打个折——型号、性能、功耗、价格一概没披露,现在激动还太早。之所以还放在 featured 里,是因为 Google 把新 TPU 直接框在推理上,这对算力成本和供给是个实打实的信号,AI 团队会追。但信息缺口太大,重要性停在 74 是合理的。

4月20日星期一

Import AI

华为搞了个 HiFloat4 训练格式,在自家昇腾芯片上跑赢了西方主导的 MXFP4

华为的研究员在自家昇腾 NPU 上测试了一种叫 HiFloat4 的 4 比特训练格式,跟西方主导的 MXFP4 格式比,HiFloat4 的精度损失更小。具体来说,在 Llama 和 Qwen 模型上,HiFloat4 跟全精度 BF16 基准的误差能控制在 1% 左右,而 MXFP4 即使加了随机舍入等一堆稳定技巧,误差也有 1.5%。这背后可能跟...

推荐理由:Jack Clark用三件事拼出一期:Anthropic拿Claude Opus 4.6做自动化对齐研究,800小时花约1.8万美元把PGR从人类基线0.23提到0.97,说明小团队也能跑对齐实验;HiFloat4在华为昇腾NPU上推理损失约1.0%,比MXFP4的约1.5%好,但正文没披露更多硬件细节;中国模型安全研究部分给出了安全评估框架,但具体模型名和测试集没展开。整体是研究评论而非一手发布,信息密度够,适合放进精选。

r/LocalLLaMA

用一张 RTX 4090 跑 Gemma 4 26B,从 2400 份财报电话会里挖交易信号,一个有效,一个差点骗过我

一位 Reddit 用户用 800 份标注过的财报电话会记录微调了 Gemma 4 26B,然后在一张 RTX 4090 上花了约 14 小时,推理了 3 年内共 2400 份记录。在 600 份样本外数据上,一个信号显示:CFO 指引越含糊,公司股价在 5 天内相对板块平均跑输约 1.8%,信息系数(IC)为 0.04。另一个信号更强,与板块回报的相...

推荐理由:这是一篇第一人称的实战记录,不是公关稿。作者把 Gemma 4 26B 塞进一张 4090,用 800 份人工标注的财报电话会微调,然后让模型在 2400 份近三年转录上提取交易信号,整批跑完 14 小时。结果里有一个信号站住了:CFO 把业绩指引从具体数字改成模糊表述后,股价 5 日内相对行业落后约 1.8%,IC 0.04,不算强但能用。另一个信号和行业回报相关性高达 0.85,作者直接判定为幽灵信号,提醒读者因子去重比标题里的赚钱故事重要得多。全文没有吹模型多强,反而在讲怎么排雷,信息密度和诚实度都够,适合 featured 位置。

4月19日星期日

r/LocalLLaMA

Cloudflare 开源 Unweight:把大模型权重压缩 22%,输出结果一个字节都不差

Cloudflare 发了一个叫 Unweight 的压缩方案,专门解决大模型在 GPU 上跑时被显存带宽卡脖子的问题。它只压缩 BF16 格式里的指数位,不碰尾数,所以解压后能还原出完全一致的输出。实测一个 8B 模型能省下约 3GB 显存,压缩率在 15% 到 22% 之间。原理是模型某一层里超过 99% 的权重只用到 16 种指数值,Unweig...

推荐理由:Cloudflare 这篇 Unweight 的卖点很直:不改模型输出,把权重无损压缩 15% 到 22%。他们盯的是 BF16 里浪费的指数字节,发现大部分层的指数值就那么几个,所以只压这部分。8B 模型能省出 3GB 显存,对跑 H100 的人来说是实打实的成本优化。我会先打个折——正文没给吞吐实测数字,也没说哪些模型能用,片上解压和动态执行管线听起来有料但细节没展开。这点先别太激动,等他们补上实测再判断实际收益。

机器之心 · 公众号

内存不够用这件事,可能要持续到2030年

日经亚洲引用供应链数据说,到2027年底全球DRAM产能可能只能满足六成需求。SK集团会长崔泰源更直接,认为短缺会拖到2030年。核心原因是产能规划跟不上:2026到2027年AI数据中心需要的DRAM年产量得增长12%,但厂商实际只安排了7.5%的扩产计划,而且新增产能优先给了高带宽内存(HBM),消费级内存被挤到一边。这不是短期涨价,是产能结构被A...

推荐理由:这条消息的钩子很硬——内存短缺可能持续到 2030 年,不是一次性涨价。正文用 Nikkei Asia 的 60% 需求满足率和扩产缺口把问题量化了,而且点出 AI 数据中心抢产能这个结构原因。对从业者来说,这直接影响算力成本和硬件排期,所以我会先打个折:它不是模型或产品发布,但作为供应链预警,信息密度和时效性都够,放在 featured 里合理。

TechCrunch · AI

AI 芯片公司 Cerebras 提交上市申请

Cerebras 已经向 SEC 交了招股书,准备在五月中旬上市。这家公司做的是巨型 AI 芯片,主打训练和推理速度。文章只披露了两笔大单:一是 AWS 会在自家数据中心用 Cerebras 的芯片;二是跟 OpenAI 签了合同,报道说价值超过 100 亿美元。CEO 放话称从英伟达手里抢走了 OpenAI 的快速推理业务。财务方面,2025 年营收...

推荐理由:Cerebras 提交 IPO 申请是当天能聊的新闻,因为它把芯片竞争和资本市场绑在了一起。HKR 三项都站得住:IPO 申请本身有话题性,AWS 部署和 OpenAI 百亿美元级合同是新信息,对从业者判断基础设施走向也有参考价值。不过正文没披露估值、募资额和时间表,所以分数没给到 90 以上。

r/LocalLLaMA

Moonshot 说 Kimi Linear 能让 KV 缓存跨数据中心传输,实测吞吐量提升 1.54 倍、首 token 延迟降 64%

Moonshot 提出一种叫“预填充即服务”的玩法,把大模型推理拆成预填充和解码两个阶段,分别跑在不同数据中心甚至不同硬件上。核心靠的是他们 Kimi Linear 模型,KV 缓存体积小到可以跨机房传。用放大 20 倍的模型测,吞吐量提到 1.54 倍,P90 首 token 延迟降了 64%。不过帖子本身被 Reddit 安全策略挡了,正文没披露具...

推荐理由:HKR 三项都站得住:跨数据中心传 KV Cache 这个点够新,文章也拿出了 1.54 倍吞吐和 P90 TTFT 降 64% 的具体数字,预填充与解码解耦的机制也交代了。我只给 80 分,因为目前还是二手摘要,成本基准、确切规模和复现细节正文都没披露,得等 arXiv 论文出来再看。

4月18日星期六

Hacker News 首页

rtrvr.ai 把浏览器操作录成脚本,重放零 token 成本,还能让 AI 直接调用

rtrvr.ai 做了一个叫 AI Subroutines 的功能,核心思路是把你在浏览器里的一次操作录下来,变成一个可重复调用的工具脚本。重放时脚本直接在当前网页里跑,cookie、CSRF token、签名头这些认证信息全都不用手动处理,浏览器自己就带上了。录制时会从几百个网络请求里自动筛出真正有用的那几条,遇到 GraphQL 那种一更新就失效的...

推荐理由:rtrvr.ai 这个 Show HN 放出了一个叫 AI Subroutines 的功能,核心是把录过一次的浏览器操作存成可重复调用的工具,直接在当前标签页里执行,复用登录态和请求签名,省掉了反复调大模型的成本和延迟。我会先打个折——这是单家公司的产品更新,不是行业级事件,所以放在 featured 中段。但它的技术细节够实在:录制时把约 300 个请求压缩到约 5 个,GraphQL operation ID 不稳定就退回纯 DOM 操作,还支持一次调用批量分发 500 行参数。这些数字说明它在成本和延迟上确实有想法,不是空画饼。正文没披露多标...