跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 361–380 条 · 共 455 条

4月29日星期三

Computing Life · Share · 鸭哥调研

DeepSeek V4 技术解读:为 Agent 长任务做的工程取舍

这篇文章把 DeepSeek V4 的技术报告翻译成了人话,核心就讲一件事:为了让模型能稳定地跑完一个长链条的 Agent 任务(比如改代码、调工具、看日志反复几十轮),V4 在架构上做了哪些又贵又复杂的工程决策。文章拆解了三个主要矛盾。第一,百万级上下文不是光能装下就行,Agent 得随时回看历史里的报错和工具结果,V4 的做法是把注意力机制分成三层...

推荐理由:我会先打个折:正文没给参数量、训练数据、价格和发布时间,所以没法判断它到底多能打,只能当技术方向看。但 DeepSeek V4 把 100 万 token 上下文和 agent 负载绑在一起讲,还给了混合注意力、OPD 这些具体手段,对做 agent 落地的人有参考价值。信息缺口明显,所以重要性停在 78,不往上拔。

Sinocism · 比尔·毕晓普

政治局四月会议提“AI+”全面落地,Manus 收购被叫停后 Meta 准备认赔拆伙

政治局四月会议读完通稿,没看到新刺激政策,但“AI+”从口号变成“全面实施”,还点名要发展智能经济新形态、完善 AI 治理。算力网被列入和水网、电网并列的六大基础设施,信号很明确:以后建算力会像修路修电网一样推。同时会议专门提了“深入整治内卷式竞争”,去年四月通稿里没这句,说明上面要对价格战和重复建设下更重的手。另外,Meta 收购 Manus 被中国...

推荐理由:我会先打个折:正文没给预算数字、时间表和具体牵头部门,所以不是那种必须立刻写的突发新闻。但政治局把算力网塞进“六张网”基建清单,等于给算力基础设施发了张长期饭票,做国产供应链和算力生意的团队该盯紧后续细则。整治“内卷式”竞争这条也值得留意,可能影响模型定价和toB项目的补贴逻辑。整体是方向性信号,不是操作手册,重要性给76分,放在featured位置提醒一下就够了。

r/LocalLLaMA

小米放出 MiMo-V2.5:3100 亿总参数,每次只激活 150 亿的稀疏 MoE 模型

Reddit 上有人贴了小米 MiMo-V2.5 的 Hugging Face 链接,不是 Pro 版。架构是稀疏 MoE,总参数量 310B,每次推理只激活 15B 参数,相当于用 150 亿参数模型的计算量去撬动一个 3100 亿参数的知识容量。发帖人说它比更大的兄弟模型用了更“人性化”的配置,但正文没展开什么叫人性化,也没给显存需求、量化方案或跑...

推荐理由:这条消息的钩子很实在:310B 总参数但每次只激活 15B,意味着理论上比同体量稠密模型省资源,官方也说它比更大版本更适合普通配置跑。我会先打个折——正文只贴了个 Hugging Face 地址,没给显存占用、量化方式、任何基准测试,所以“普通配置”到底指什么配置完全不清楚。这点先别太激动,等实测数据出来再判断值不值得本地部署。

4月28日星期二

机器之心 · 公众号

华为泰勒实验室等提出 SHAPE,给大模型推理加一道“推理税”,答得更准还能少写废话

华为泰勒实验室、北大和上海财大在 ACL 2026 发了一篇论文,提出 SHAPE 方法,核心思路是给模型的长篇推理加一道“推理税”。具体做法是:先用熵值把推理过程切成段,再用短距离试探估算每段的潜力,然后对后期又长又没带来实质进展的段落做动态长度打折,最后把奖励分配到每个 token 上。结果平均准确率涨了约 3%,同时 token 用量砍了约 30...

推荐理由:这篇论文最抓人的地方不是那 3% 的准确率提升,而是它把“模型靠啰嗦刷分”这件事直接拎出来收税。SHAPE 用熵值把推理过程切成段,拿短 rollout 估算每段的“势能”,高势能的后期长段落会被长度折扣重罚,逼着模型别在确认步骤上浪费 token。结果就是数学题答得更准,输出还短了约三成。我会先打个折:正文没披露这 30% 的 token 节省是在哪些模型和数据集上测的,也没说短 rollout 本身的计算开销有多大,所以实际部署省不省钱还得看具体场景。但思路本身很直接,把推理效率问题从“事后裁剪”挪到了“训练时就定价”,对做推理优化的团队来说是...

Latent Space

Applied Intuition 十年做成 150 亿美元估值,他们想把所有会动的机器都塞进同一个 AI 操作系统

Applied Intuition 的 CEO 和 CTO 聊了他们从 YC 时期的自动驾驶工具链,一路做到估值 150 亿美元实体 AI 公司的完整路径。公司现在有 30 多款产品,全球非中国车企前 20 名里 18 家是他们的客户,L4 级无人卡车已经在日本跑起来了。他们反复强调,实体 AI 真正的瓶颈不是模型不够聪明,而是怎么把模型塞进车里:车载...

推荐理由:这篇复盘把 Physical AI 从融资故事拉到了实车部署层面,信息量够硬——估值、客户覆盖、L4 落地都有数字撑着。我会先打个折:正文没披露具体模型架构或安全验证的实测数据,所以重要性停在 80 这个区间是合理的。对做车端推理和自动驾驶落地的人,这篇值得一看,但别指望有技术白皮书级别的细节。

4月27日星期一

Hacker News 首页

Utilyze 开源 GPU 监控工具,说比 nvtop 更准,能看出显卡是真忙还是在摸鱼

Systalyze 开源了一个叫 Utilyze 的 GPU 监控工具,专门解决 nvidia-smi 和 nvtop 那个老毛病:它们只告诉你显卡“有没有在干活”,不告诉你“干得有多满”。比如 H100 有 132 个流式多处理器、一万七千多个核,但只要有一个核在跑,利用率就敢报 100%,实际算力可能才用了 1%。Utilyze 会直接算你的 GP...

推荐理由:这篇抓住了 GPU 监控里一个很常见的坑:传统工具只看二值占用,不看有效计算效率。对跑生产负载的人来说,知道真实吞吐上限比看仪表盘数字重要得多。我会先打个折,因为工具来自一个还没被广泛验证的团队,正文也没披露具体开销有多“可忽略”,但选题和解释都到位,放在 featured 没问题。

Hacker News 首页

在万米高空断网跑大模型:M5 Max 撑了 10 小时,但一根充电线让我亏了 34W 供电

作者在伦敦飞拉斯维加斯的 10 小时航班上,用一台顶配 MacBook Pro M5 Max(128GB 统一内存、40 核 GPU)离线跑了 Gemma 4 31B 和 Qwen 4.6 36B 两个本地模型。他主要用 DuckDB 搭了个云账单分析工具,还处理了约 400 万 token 的零散编码任务。体验下来,写限定范围的代码、做小工具时,本地...

推荐理由:这是一篇第一人称的本地推理实测,硬件、模型、功耗数字都摆出来了,不是空谈。我会先打个折:它更像个人体验报告,不是行业级发现,所以分数落在 72–77 这个区间。真正有意思的是功耗可观测性——同一负载下 iPhone 线只供 60W,MacBook 线供 94W,差了 34W,这点先别太激动,但说明供电配件对本地跑大模型的实际性能影响不小。正文没披露模型量化方式,也没说具体跑了什么任务,所以不能把结论拔太高。

Mistral AI

Mistral AI 发布 Workflows 公开预览版

Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工介入审批能力,ASML、ABANCA、CMA-CGM 等客户已用于自动化关键流程。

推荐理由:原文给出 Workflows 的编排能力、部署模型与客户案例,可据此判断企业级 AI 流程落地的工程门槛。

Hacker News 首页

现在用 AI 可能比雇人还贵

Axios 报道,一些公司的 AI 算力开销已经超过了员工工资。英伟达高管 Bryan Catanzaro 说,他团队的算力成本远高于人力成本;Uber 的 CTO 则因为 token 消耗太快,已经花光了 2026 全年的 AI 预算。Gartner 预测今年全球 IT 支出会涨到 6.31 万亿美元,主要就是被 AI 基建、软件和云服务推高的。文章...

推荐理由:这篇文章把 AI 成本焦虑变成了预算事实。Nvidia 内部团队算力开销远超人力、Uber CTO 的 token 预算提前见底,加上 Gartner 的支出预测,都在说同一件事:AI 的账单开始比工资单更吓人。它不是产品发布或硬新闻,而是趋势报道,所以放在 72–77 这个区间。我会先打个折,因为正文没给出 Nvidia 和 Uber 的具体金额对比,但方向性判断足够清晰,值得从业者看一眼自己的预算表。

量子位 · 公众号

DeepSeek V4 永久降价,缓存命中再打一折,实测编程成本降了 83%

DeepSeek V4 两天内连续降价,输入和输出价格直接砍掉 75%,缓存命中的输入还能再打一折。量子位的编程实测里,处理 3500 万 token 的成本从 31.73 元掉到 5.34 元,降了 83%。这个价格对缓存命中率高的场景最划算,V4-Pro 的缓存命中率大概在 95% 到 96%。

推荐理由:HKR三项都站得住:降价幅度和两次调价节奏有话题性,实测数据让便宜可验证,成本敏感型从业者会立刻对标自己的用量。不过它本质还是定价更新,不是新模型发布,所以分数没往上拉。

Hacker News 首页

TurboQuant 走读:把 AI 向量压到每个数 2–4 比特,还不怎么掉精度

这篇交互式文章把 TurboQuant 的核心思路拆了一遍。它要解决的是怎么把模型里的高维向量(比如 KV 缓存、嵌入向量)压到每个坐标只占 2 到 4 个比特。做法很取巧:先给向量随机转个方向,转完之后每个坐标的数值分布就固定了,近似一个钟形曲线。接着用一套提前算好的通用码本去套所有输入,省掉了给每组数据单独算缩放因子的开销,也不需要训练或校准。文章...

推荐理由:我会先打个折:这不是模型或产品发布,只是一篇技术走读,所以重要性停在 76。但 HKR 三项都站得住——钩子够具体,机制解释有新东西,成本角度也切中当前推理优化的刚需。正文没给大规模验证数据,这点先别太激动,但思路本身值得一看。

4月26日星期日

Hacker News 首页

DeepSeek-V4 发布当天,SGLang 和 Miles 就接好了推理和 RL 训练

SGLang 和 Miles 团队在 DeepSeek-V4 发布当天就完成了推理和强化学习训练的适配,覆盖了 1.6T 参数的 Pro 版和 284B 参数的 Flash 版。V4 模型用了混合稀疏注意力,把滑动窗口和两种 KV 压缩(4:1 或 128:1)混在一起,撑住了 100 万 token 的上下文窗口,专家权重还用了 FP4 精度。系统上...

推荐理由:我会先打个折:这篇不是给所有人看的,系统细节多,普通读者容易走神。但它的钩子够硬——V4 发布当天就有推理加验证 RL 的工程栈,而且把上下文长度、压缩比、注意力窗口这些直接影响成本和稳定性的数字都摊开了。ShadowRadix 那部分虽然正文没展开实现细节,但点出了多池一致性这个真正难啃的骨头,对做部署和调优的人比单纯跑分更有参考价值。

4月25日星期六

Latent Space

DeepSeek 发布 V4 Pro 和 Flash 模型,能在华为昇腾芯片上跑

DeepSeek 终于发了 V4 系列,一共两个型号:V4 Pro 总参数 1.6 万亿,每次激活 490 亿;V4 Flash 总参数 2840 亿,激活 130 亿。两个模型都支持 100 万 token 的上下文,用了新的压缩注意力技术,相比 V3.2,处理长文本时计算量只要 27%,显存占用只要 10%。这次比较特别的是同时发了基础版和指令版,...

推荐理由:这条必须写。DeepSeek 这次放出的不只是模型,而是把华为昇腾兼容性摆上台面,等于在 CUDA 依赖上划了一刀。技术报告说 1M token 下只用 V3.2 27% 的算力、10% 的 KV 缓存,省得挺实在。两档参数和 MIT 许可也让落地门槛更低。我会先打个折:正文没提实际推理延迟和昇腾上的吞吐数据,这点先别太激动,但硬件独立性本身已经够重。

Computing Life · Share · 鸭哥调研

TPU 与 CUDA 的攻防战:Cloud Next 2026 之后的判断

Google 在 Cloud Next 2026 上放了三招:把第八代 TPU 拆成训练用的 8t 和推理用的 8i,8i 内存带宽比 8t 还高,专门对付长上下文推理;推出 TorchTPU,让 PyTorch 代码能直接在 TPU 上跑,不再需要以前那个问题一堆的桥接层;以及给 Anthropic 投了最多 400 亿美元并配 5GW 算力。这三件...

推荐理由:这篇文章把 TPU 和 CUDA 的竞争讲得很清楚,给了 8i 的硬参数和量产时间,也提到了 TorchTPU 这个降低迁移门槛的动作。但正文自己说了缺少独立 benchmark,而且 8i 要 2027 下半年才量产,所以判断 18-24 个月内 TPU 不会取代 NVIDIA。信息有料,但验证还弱,时间也远,所以重要性给到 82,放在 featured 里。

FT · 科技

谷歌计划向 Anthropic 投资最高 400 亿美元,钱主要用来买算力

谷歌要给 Anthropic 投一笔钱,上限是 400 亿美元。这笔钱不是单纯的财务投资,核心目的是给 Anthropic 的模型增加计算资源,也就是买更多服务器和芯片来跑模型。这更像是一种算力绑定——Anthropic 拿了钱,但得花在谷歌的云服务或算力上。不过,正文被付费墙挡住了,具体的交易结构、投资时间表、Anthropic 的最新估值,以及算力...

推荐理由:FT 的消息说 Google 计划向 Anthropic 投最多 400 亿美元,用途是增加跑模型需要的算力。我会先打个折——具体怎么投、分几批到账、估值多少、算力从哪来,正文都没写。但光这个数字和算力绑定的方向,就值得从业者盯着看,因为这比单纯财务投资更能锁死合作关系。

4月24日星期五

TechCrunch · AI

Meta 签下数百万颗亚马逊自研 CPU,这次不是 GPU,是给 AI 智能体跑业务用的

Meta 和亚马逊达成了一笔大单,要采购数百万颗亚马逊自研的 Graviton CPU,专门用来跑 AI 智能体(agentic AI)的工作负载。注意,这里说的是 CPU,不是训练大模型常用的 GPU。这信号挺有意思:以前大家抢 GPU,现在连 CPU 都开始为 AI 智能体这种新任务大量铺货了。不过正文没披露具体是 Graviton 哪款芯片、单价...

推荐理由:这条消息我会先打个折,因为正文没披露具体型号和金额,没法算性价比。但“几百万颗 AI CPU”这个量级本身就在说一件事:agent 负载开始推高非 GPU 芯片的采购。Meta 这种体量的公司用 Amazon 的 CPU 跑 agent,至少说明他们在认真找 GPU 之外的推理方案,而且敢下大单。这点先别太激动,毕竟没看到实测数据,但如果后续有部署细节和性能对比,这条线值得一直盯着。

机器之心 · 公众号

复旦等团队提出 HERMES:把 KV 缓存当分层记忆用,流式视频理解首 token 延迟最高降 10 倍

这篇讲的是复旦大学、上海科学智能研究院和新加坡国立大学一起搞的 HERMES,一个不用重新训练就能加速流式视频理解的框架。核心思路是把模型里的 KV 缓存(你可以理解成模型在推理时记下的“草稿纸”)重新组织成三层记忆:当前帧的短期记忆、最近几帧的中期记忆,以及更早帧压缩后的长期记忆。同时它做了跨层记忆平滑和位置重编号,让模型读这段压缩历史时不会因为位置...

推荐理由:我会先打个折:这是学术研究,不是产品发布,所以重要性停在 82。但 HKR 三项都站得住——10 倍提速是实打实的标题钩子,68% token 削减和 27-29ms TTFT 是能拿来算账的数字,而且方案免训练、开源,对做流式视频落地的团队来说,省 token 就是省钱,低延迟就是体验。正文没披露长视频下的记忆退化情况和更多模型上的泛化结果,这点先别太激动,但现有数据已经够让做实时视频 agent 的人认真看一遍。

r/LocalLLaMA

DeepSeek V4 发布:1.6T 参数的 Pro 版和 284B 的 Flash 版,MIT 开源,支持 100 万 token 上下文

DeepSeek 放出了两个 V4 模型,都走 MIT 开源协议,上下文窗口拉到 100 万 token。Pro 版总参数 1.6T,每次推理只激活 49B;Flash 版总参数 284B,激活 13B。激活参数占比很低,意味着如果跑分靠谱,自己部署长上下文模型的硬件门槛和成本会降一截。不过原帖没给具体跑分、定价、训练数据量,也没提实际推理吞吐,这些都...

推荐理由:这是 DeepSeek 旗舰级开源发布,两个 MIT 权重加 1M 上下文,当天覆盖没问题。分数停在 86,因为正文没披露基准分数、吞吐、训练数据规模或定价,这些缺口让实际效果还得等实测。我会先打个折,别看到 1.6T 就上头。

X · @dotey(宝玉)

DeepSeek 发了 V4 预览版并开源,百万上下文直接标配,不再分版本加价

DeepSeek 放出了 V4 系列模型的预览版,代码也同步开源。这次最实在的变化是,百万 token 的上下文窗口成了所有官方服务的默认配置,Pro 和 Flash 两个型号都一样,没有高价门槛。V4-Pro 是旗舰,推理能力追平了顶尖闭源模型,世界知识得分仅次于 Gemini-Pro-3.1;V4-Flash 是轻量经济版,推理接近 Pro,但知识...

推荐理由:DeepSeek 是国内头部的模型厂商,这次 V4 预览版把百万上下文做成全服务标配并开源,属于实质性发布。HKR 三项都满足:正文有机制解释和迁移截止日期,而且这种定价策略的调整让它值得当天就作为 P1 处理。

X · @op7418(歸藏)

DeepSeek V4 发了公告:Pro 版 1.6T 总参数量但只激活 49B,Flash 版更轻量,预训练都喂了 32T 数据

DeepSeek 放出了 V4 的官方说明。这次分两个版本:Pro 版总参数量 1.6 万亿,实际干活时只激活 490 亿参数;Flash 版总参数量 2840 亿,激活 130 亿参数,两个版本预训练都用了 32 万亿 token。网页和 App 里的“专家模式”对应 Pro,“快速模式”对应 Flash。官方说多项跑分跟 Opus 4.6 打平,A...

推荐理由:这是 DeepSeek 的旗舰发布,分量跟美国头部实验室发新模型看齐。HKR 三项都站得住:公告里参数规模、训练数据量、新注意力机制这些硬信息都有,也直接拿 Opus 4.6 做对比,对从业者选模型和算成本都有参考价值。不过摘要没提评测具体怎么跑的、定价和 API 开放时间,这些缺口让我对 benchmark 那部分先打个折。