跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 301–320 条 · 共 455 条

5月8日星期五

NVIDIA 博客

美国能源部长与英伟达谈 Genesis 任务:用 AI 给电网审批提速,从几年缩到几周

美国能源部和英伟达要在阿贡国家实验室建两台 AI 超算。小的一台叫 Equinox,用 10,000 块 Grace Blackwell GPU;大的一台叫 Solstice,计划上 100,000 块还没发布的 Vera Rubin GPU。英伟达的 Ian Buck 说 Solstice 的算力能干到 5,000 exaflops,这个数字听听就好...

推荐理由:HKR 三项都踩实了:GPU 型号和数量是硬信息,DOE 与 NVIDIA 的角色分工清楚,电网瓶颈那段把 AI 的落地价值讲得很具体。不过来源是 NVIDIA 官方博客,信息偏单向,所以放在 featured 而不是 must-write 的档位,82 分在这个区间里是合理的。

AI HOT 精选

antirez 开源了 DeepSeek 4 Flash 的本地推理引擎,专跑在苹果芯片的 Metal 上

Redis 作者 antirez 在 GitHub 上放出了一个叫 ds4 的项目,是一个让 DeepSeek 4 Flash 模型在 Mac 上本地跑的推理引擎。它直接调用苹果的 Metal Performance Shaders 来降低延迟和内存占用,相当于给模型配了个更底层的加速驱动,而不是简单套个壳。不过项目页面没给出具体的跑分数据,实际快多少...

推荐理由:我会先打个折:正文没给任何延迟或内存占用的实测数字,所以性能到底多好现在说不准。但值得盯的不是又一个模型壳,而是这套 Metal 本地推理栈——它把推理引擎直接做进苹果的图形加速框架里,思路比多数套壳方案更底层。对想在 Mac 上离线跑模型的人来说,这是个能省钱的路线,只是验证还得等社区跑出数据。

5月7日星期四

AI HOT 精选

中国 AI 实验室内部笔记:学生军团、快跟文化和被压缩的算力

作者走访了国内几家头部 AI 实验室,发现一个明显特点:核心贡献者里学生占比很高,他们没包袱、上手快,愿意做那些不炫但能让模型变好的脏活累活。这种文化让中国团队在追赶大模型、做智能体工作流时效率很高,但也被一些技术负责人认为会抑制从 0 到 1 的原创研究。文章提到,国内实验室在百亿级基础模型和十亿级垂直模型上都有布局,部分中文任务表现已超过 GPT-...

推荐理由:H/K/R 全过:一手实验室访问、具体的能力对比和模型规模信息、算力与部署的行业共鸣都很扎实。这不是模型发布或融资事件,属于强分析类内容,放在 78–84 分段合理。正文说“只看图片就能学压缩”和“压缩 90% 精度不掉”,这两个点如果后续有更细的消融实验或复现报告,价值还会更高。

AI HOT 精选

商汤 SenseNova-U1 开源 8 步蒸馏 LoRA,扩散模型推理从 23 秒压到 2 秒

商汤把扩散模型常用的 100 步生成流程蒸馏到只剩 8 步,GPU 上跑一张图从 23 秒降到 2 秒,快了 11 倍。做法是训了一个 LoRA 权重,直接挂到模型上就能用,不用改原模型结构。配套给了 ComfyUI 工作流,覆盖文生图、改图和交错生成。正文没提具体画质对比和什么显卡跑的,这点先别太激动。核心信号不是参数堆得多大,而是用蒸馏换延迟,让扩...

推荐理由:我会先打个折:这只是图像生成领域的推理加速,不是通用模型突破,所以放在featured而不是P1。但它的钩子很实在——用8步蒸馏LoRA把扩散模型从100步砍到8步,GPU推理从23秒压到2秒,还直接支持ComfyUI。对干活的人来说,这意味着同样的卡能多跑十几倍的图,或者低配机器也能玩。正文没披露蒸馏用了多少样本、LoRA参数量多大,这点先别太激动,但开源这一步本身就让验证成本很低。

量子位 · 公众号

浙大与阿里提出 MetaCompress:只看图片就能学会压缩 Token,多轮视觉问答压缩率 90% 且精度不掉

这篇 CVPR 2026 论文介绍了一个叫 MetaCompress 的框架,专门解决多轮视觉问答里图片 Token 太多、推理太贵的问题。它的做法是让模型只看输入图片,自己生成一张“压缩映射图”,直接决定哪些视觉 Token 该留、哪些该扔,不需要额外训练一个压缩网络。文章给出的核心数据是:能砍掉 90% 的视觉 Token,同时保持回答精度不降。还...

推荐理由:我会先打个折:正文说精度不掉,但没给出具体数值和基准对比,这点先别太激动。不过思路确实干净——不用文本引导,只靠图像自身信息决定哪些视觉 Token 可以扔,压缩率做到 90%,对多轮 VQA 这种反复调图的场景很实用。浙大和阿里联合出品,挂了 CVPR 2026,研究信号够强,不是产品通稿。开源了的话,做多模态推理优化的团队可以直接拉下来测延迟和显存变化。

r/LocalLLaMA

在单张 RTX 3090 Ti 上跑 Qwen3.5/3.6 的 NextN MTP 投机解码指南

Reddit 用户分享了一个 llama.cpp 实操指南,用单张 RTX 3090 Ti 跑 Qwen3.5 和 3.6 的 NextN MTP(多 token 预测,一种让模型一次猜好几个词来加速生成的技术)。目前需要打两个还没合并的 PR:#22400 和 #22673。实测 Qwen3.6-35B-A3B-MTP 模型在 350W 功耗、170...

推荐理由:我会先打个折:这是 Reddit 个人指南,依赖两个没合进主线的 PR,稳定性没保证。但亮点很实在——单卡 3090 Ti 跑 35B 模型冲到 157 tok/s,还点出了 nextn=q8_0 量化覆盖这个坑,漏掉会输出乱码。对想在家用显卡上榨性能的 AI 从业者来说,这份功耗、频率、KV 缓存设置都给了,可操作性强。正文没披露模型精度损失和长文本下的速度衰减,这点先别太激动。

Latent Space

Anthropic 租下 xAI 孟菲斯超算,年费或达 50 亿美元,Claude 推理能力几天内就要搬上去

Anthropic 在第二届开发者活动上宣布,将租用 xAI 在孟菲斯的 Colossus I 超算集群来跑 Claude 的推理任务,预计几天内就开始迁移。外界根据 300 兆瓦的功耗规模估算,这笔交易一年可能花掉 Anthropic 约 50 亿美元,相当于 xAI 变相成了一家提供算力租赁的云厂商。活动上没有发新模型,主要更新了三件事:一是 Cl...

推荐理由:这条消息最炸的点是 Anthropic 可能要从 SpaceX/xAI 租 300MW 算力,一年砸 50 亿美元——不过正文也说了这俩数字还不是官方口径,先打个折看。对开发者更实在的是 Claude Code 的 5 小时限额翻倍了,Pro、Max、Team 和席位制 Enterprise 都受益,Opus API 限额也往上调了,用起来没那么容易撞墙。整篇信息量够,既有大 deal 的传闻钩子,又有马上能用的产品变动,所以放在 featured 档。

机器之心 · 公众号

马斯克宣布 xAI 解散,Grok 并入 SpaceXAI,22 万张 GPU 算力租给 Anthropic

马斯克确认 xAI 解散,Grok 和 X 平台相关业务全部并入新实体 SpaceXAI。同时,SpaceX 和 Anthropic 签了协议,Claude 将接入 Colossus 1 超算——超过 22 万张 Nvidia GPU、300 兆瓦的算力集群。对用户来说最直接的变化是配额:Claude Code 的五小时速率限制翻倍,Pro 和 Max...

推荐理由:我会先打个折:目前只有单一信源,还没看到 Anthropic 或 SpaceX 的官方公告,所以先不拉满。但消息本身冲击力很强——xAI 解散、Grok 并入 SpaceXAI,Colossus 1 那 22 万张 GPU 和 300 兆瓦算力直接租给 Anthropic,等于把自家训练底座送给了对手。对开发者来说,Claude Code 五小时速率翻倍、Pro 和 Max 高峰配额限制移除是马上能感知的变化。正文没披露租约时长和价格,也没说 Grok 后续怎么迭代,这些缺口让消息还差一口气,但已经够格进 p1。

Computing Life · Share · 鸭哥调研

Anthropic 半年签下四笔算力大单,xAI 把自家超算中心整租给了对手

Anthropic 在六个月内接连锁定了 AWS Trainium、Google TPU、SpaceXAI Colossus 1 和 CoreWeave 的算力,覆盖了市面上三种主流芯片架构。同一时间,xAI 把拥有 22 万张 GPU 的 Colossus 1 数据中心全部租给了 Anthropic,而自家 GPU 利用率只有 11%。这两件事拼在一...

推荐理由:我会先打个折:这更像一篇策略分析,不是突发新闻,所以分数没给到 85 以上。但它的信息密度够硬——Anthropic 四处锁算力,xAI 却把自家超算租给对手,还带出 11% 利用率这个反直觉数字。对关注大模型算力战的人来说,这比单纯宣布合作要有意思得多。正文没披露租约的具体价格和时长,这点先别太激动,但现有的数字已经足够让从业者重新琢磨两家公司的算力策略了。

FT · 科技

Arm 预计自家 AI 芯片明年能卖 20 亿美元,但没公布客户和制程

Arm 第一次自己做 AI 芯片,就给出了明年 20 亿美元的销售预期。这个数字不小,但文章正文被付费墙挡住了,看不到具体是卖给谁、用什么工艺生产、什么时候交货。软银在背后撑腰,需求据说很强劲,不过在没有客户名单和定价的情况下,这个预测先打个折看。

推荐理由:FT 的信源加上 20 亿美元销售预期,让这条消息有硬信息量,所以 K 成立。Arm 从设计授权商变成芯片商,对行业格局有冲击,H 和 R 也站得住。但客户、价格、制程、交付节奏这些关键信息全是空白,我会先打个折,热度归热度,落地还早,所以放在 featured 这档刚好。

FT · 科技

SpaceX 要把数据中心算力租给 Anthropic

FT 报道 SpaceX 会向 Anthropic 出租数据中心容量,等于确认了双方有一笔算力租赁合作。Anthropic 加码算力是为了跟上用户增长,但正文被付费墙挡住,没披露具体租了多少、租多久、什么价格。

推荐理由:FT 确认 SpaceX 会向 Anthropic 出租数据中心容量。H 来自这对不常见的组合;K 有交易事实但没有规模和价格,信息缺口明显;R 直接关联算力稀缺和 Anthropic 的增长压力,所以能进 featured,但缺细节撑不到 78 分以上。

r/LocalLLaMA

Atlas 推理引擎开源,在 DGX Spark 上跑 Qwen3.6-35B-FP8 能稳定跑到每秒 100 多个 token

Avarok 把 Atlas 推理引擎开源了。它用 Rust 和 CUDA 写成,镜像只有约 2.5GB,冷启动不到两分钟。在一台 DGX Spark 上跑 Qwen3.5-35B,实测持续速度约 111 tok/s,作者说比 vLLM 快 3.0 到 3.3 倍。引擎专门为 Blackwell SM120/121 写了内核,支持 NVFP4、FP8 ...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,基准测试也没被第三方复现,所以分数压在了 featured 低位。但这条确实有料——开源推理引擎 Atlas 在 DGX Spark 上跑 Qwen3.5-35B 持续 111 tok/s,镜像才 2.5GB,冷启动不到两分钟,作者说测试时是 vLLM 的 3.0–3.3 倍。真正值得盯的是 Blackwell SM120/121 手写内核、NVFP4/FP8 和 MTP 解码这些底层优化,不是简单套壳。速度、体积、启动时间三个数字都给了,信息密度够,对想本地部署大模型的人有直接参考价值。

r/LocalLLaMA

Reddit 实测:双卡跑大模型,PCIe 带宽可能没你想的那么吃紧

用户 ziphnor 用两张 RTX 5060 Ti 16GB 跑 vLLM,开启张量并行(TP=2)处理 32k 上下文预填充。实测 PCIe 峰值带宽只跑到 3–4 GB/s,大约占满一条 PCIe 4.0 x4 通道的 40%–50%。预填充速度在不同设置下分别达到约 840–850、1500 和 1600–1700 tokens/s。帖子没提解...

推荐理由:这篇 Reddit 实测值得一看,因为它用具体数字回应了一个常见焦虑:双卡跑大模型,PCIe 带宽到底够不够。ziphnor 拿 2 张 RTX 5060 Ti 16GB 在 vLLM 里开张量并行,32k 上下文预填充时 PCIe 峰值只有 3–4 GB/s,就算把链路砍到 PCIe 4.0 x4,实际也只用了 40–50% 的带宽。三组模型的预填充速度分别约 840–850、1500、1600–1700 tokens/s,说明瓶颈不在 PCIe 线速上。我会先打个折:正文没披露解码阶段的带宽,那才是持续通信的大头,这点先别太激动。真正该盯的是张...

r/LocalLLaMA

Reddit 网友扒了 922 条 agent 任务记录,发现 DeepSeek v4 省钱的关键不在标价,在缓存命中率

一位 Reddit 用户分析了 922 条 agent 任务的实际调用记录,对比了 DeepSeek v4 Flash 和 Opus 4.7 的花费。两个模型每个任务都要吃掉大约 96 万 token,但 DeepSeek 单任务成本只要 0.01 美元,Opus 4.7 却要 1.52 美元。差距不在输入输出的标价,而在缓存:DeepSeek 的缓存...

推荐理由:这篇不是比谁模型强,是比谁缓存用得聪明。Reddit用户跑了922条智能体任务轨迹,发现DeepSeek v4 Flash单任务成本0.01美元,Opus 4.7要1.52美元,差了152倍。两边平均token消耗都接近96万,但DeepSeek缓存命中率97%,Opus只有87%;更关键的是缓存读写价格比,DeepSeek是0.02,对方是0.08。也就是说,标价看着便宜不算真便宜,能把重复计算省下来才是省钱的地方。正文没披露任务类型和采样方式,这点先别太激动,但缓存机制这个观察本身值得盯。

彭博科技

Anthropic 找 SpaceX 买算力,但没说是训练还是推理用

Anthropic 和马斯克的 SpaceX 签了一份算力合同,目的是撑住 Claude 越来越大的用量。报道没披露具体算力规模、合同金额、上线时间,也没说这批算力是拿来训练新模型还是跑线上推理。SpaceX 能不能挤进 Anthropic 的长期供应链,目前还看不出来。

推荐理由:我会先打个折,这条消息的新闻性在于“谁跟谁合作”,而不是合作本身有多扎实。Anthropic 把 SpaceX 拉进算力供应商名单,对缓解 Claude 的推理压力可能有帮助,但正文没披露任何具体数字或部署细节,所以现在还判断不了这是短期补缺还是长期供应链调整。真正值得盯的是后续会不会有训练或推理负载真的跑在 SpaceX 的设施上,以及合同规模能不能跟 AWS、Google Cloud 的量级比一比。目前只能当作一个信号来看,别太激动。

5月6日星期三

r/LocalLLaMA

单张 RTX 5090 跑通 Qwen3.6 27B:NVFP4 量化加 MTP 投机解码,200k 上下文实测 73.6 tok/s

一位 Reddit 用户在单张 32GB 显存的 RTX 5090 上,用 vLLM 跑通了 Qwen3.6 27B 的 NVFP4 量化版,并验证了 200k 上下文长度。配置上用了 fp8_e4m3 的 KV 缓存、FlashInfer 和 3 个投机 token 的 MTP。10 次 200k 上下文跑分平均生成速度 73.6 tok/s,首 t...

推荐理由:我会先打个折:来源是 Reddit 用户自测,不是官方报告,但配置和日志都贴出来了,可复现性不低。真正值得盯的是显存边界——KV 缓存占了 8.3GiB,整卡吃到约 30478MiB,几乎榨干 32GB。这说明 NVFP4 量化确实把 27B 模型压进了消费级显卡,而且 200k 上下文不是摆设,十次都跑稳了。不过 TTFT 70 秒意味着首 token 要等一分多钟,实际用起来体验会打折扣。这点先别太激动,等更多卡型验证。

TechCrunch · AI

AI 芯片需求把三星抬进万亿美元俱乐部

三星股价单日涨超 10%,市值突破 1 万亿美元,成为继台积电之后第二家达标的亚洲公司。直接催化剂是上周财报利润同比翻了八倍,核心逻辑是 AI 系统离不开三星的内存芯片,需求猛涨而供给跟不上,推高了芯片价格。另一个推手是前一天的消息:苹果正与三星和英特尔洽谈在美国本土生产设备芯片,如果三星拿到订单,将打破苹果几乎完全依赖台积电的局面。不过原文没披露具体...

推荐理由:HKR 三项都过,但 K 比较虚:文章只给了市值和排名,没交代股价变动、收入贡献或订单构成。我会先打个折,把它当 AI 基建的金融节点来看,放在 featured 门槛上。

NVIDIA 博客

NVIDIA 给 Spectrum-X 以太网加了多路径 RDMA,让超大规模 GPU 集群的流量不再堵在一条路上

NVIDIA 在 Spectrum-X 以太网平台上新增了 MRC(多路径 RDMA)支持,允许一个 RDMA 连接把流量分散到多条网络路径上,而不是死绑一条。这项技术已经在 Blackwell 集群里跑起来了,硬件层面能做到微秒级故障绕行和重路由。MRC 走的是 OCP 开放规范,支持多平面组网,目标是把集群规模推到几十万张 GPU。不过博客没给出具...

推荐理由:我会先打个折:这是英伟达自己的产品稿,不是第三方评测。MRC 把一条 RDMA 流拆到多条物理路径上跑,微秒级检测断连并硬件重路由,正文说已经在 Blackwell 部署里用了。这点先别太激动,因为没给第三方验证数据。真正值得看的是他们把这套东西推到 OCP 开放规范,配合多平面网络,目标是撑住几十万卡级别的训练集群——如果真能落地,对大规模训练的网络成本会有实打实的影响。

r/LocalLLaMA

Qwen 3.6 27B 用上 MTP 后推理速度提升 2.5 倍,48GB 显存可跑 26 万上下文

这篇帖子来自 Reddit 的 r/LocalLLaMA,作者分享了一个 llama.cpp 的 PR,为 Qwen 3.6 27B 模型添加了 MTP(多令牌预测)支持,实测推理速度提升了 2.5 倍。在 Mac M2 Max 96GB 上达到了 28 tok/s 的生成速度。关键细节在于使用了 turbo4 4.25-bit KV 缓存量化,这让一...

推荐理由:HKR 三项都站得住:提速和长上下文对本地 agent 是实打实的吸引力,帖子里机制和数字都列清楚了,成本优势也直接。不过只有 Reddit 单源,配置也有点折腾,所以放在 featured 低位。

Latent Space

硅谷开始认真卖服务了:Anthropic 和 OpenAI 各自成立公司,帮企业把模型塞进业务里

Anthropic 和 OpenAI 这周都宣布了新的企业服务公司。Anthropic 跟黑石等几家华尔街机构搞了个合资公司,总共融了 15 亿美元,每家出 3 亿。他们的做法是先派个小团队去客户那,搞清楚 Claude 能在哪发挥最大作用,然后工程师再上手定制系统。OpenAI 那边动作更大,成立了一家叫 The Deployment Company...

推荐理由:两家头部模型公司不约而同从卖模型转向亲自下场做服务,Anthropic 的合资公司拿了 15 亿美元,OpenAI 的部署公司融了约 40 亿、投前估值 100 亿。我会先打个折,正文没披露这些服务公司的具体业务模式、客户是谁、怎么收费,也没说跟现有云厂商的合作关系怎么处理。但光看资金规模和两家同时行动,这个信号够强,值得从业者留意。