跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 121–140 条 · 共 455 条

5月28日星期四

量子位 · 公众号

DeepSeek V4 用上华为昇腾芯片做训练,国产算力生态开始跑通闭环

这篇文章本身因为微信环境验证失败,正文内容没抓到,只能根据标题和摘要信息来聊。标题里提到的“芯模协同”,指的是 DeepSeek V4 在训练时直接跟华为昇腾芯片做适配优化,不是先拿英伟达跑完再移植。摘要里说 CANN(华为的 AI 计算框架)一口气开源了 65 个代码仓库,并且支持 70 多个主流模型“开箱即用”,不用等适配。另外 AIGCode 在...

推荐理由:这条主要讲的是国产算力生态的进展,不是 DeepSeek V4 本身发了什么新能力。但里面给的仓库数、适配模型数、MFU 这些数字比较具体,比一般的合作通稿有信息量。我会先打个折,因为正文没披露 V4 在昇腾上的完整训练规模或成本对比,MFU 也只给了 AIGCode 一个点,验证还不够全。不过对关心国产替代进度的人来说,这几个数字已经够拿来判断方向了,所以放在 featured 里。

r/LocalLLaMA

Zai 把 GLM-5.1 推理集群的网络架构换了,吞吐量提了 15%

Zai 在一个千卡规模的 GLM-5.1 代码推理集群上,把原来的 ROFT 网络拓扑换成了自研的 ZCube。硬件、软件栈和模型都没变,但交换机与光模块成本降了 33%,GPU 推理吞吐量提升了 15%。在把输入理解(prefill)和内容生成(decode)拆开跑的部署模式下,首个 token 的 P99 尾部延迟也砍掉了 40.6%。不过帖子正文...

推荐理由:HKR 三项都踩中了:GLM-5.1 推理集群的成本、吞吐和延迟数字都很具体,40.6% 的延迟降幅是个强钩子。不过来源只有 Reddit 单帖,且话题偏 infra 细分,所以定在 78 分。

r/LocalLLaMA

一张 RTX 3060 12GB 跑通 Qwen3.6-35B-A3B,128K 上下文生成速度 37 token/秒

用户 old-mike 在一张 RTX 3060 12GB 显卡上,用 spiritbuun 的 llama.cpp 优化分支和 mudler 的 APEX 量化模型,成功跑起了 17.3GB 的 Qwen3.6-35B-A3B。在已填充 72K 上下文时,生成速度达到 37.17 token/秒;上下文塞到 129K 时,速度仍有 28.08 tok...

推荐理由:HKR 三项都踩中了。一个 Reddit 用户用消费级显卡跑通 35B 大上下文,还给出了速度和困惑度,对本地推理圈子是实打实的参考。信息来自单篇帖子,影响范围也就在本地推理场景,所以放在 featured 而不是 P1。

AI HOT 精选

Mistral 在 AI Now 峰会上公布工业 AI 路线图,Vibe 升级,并在巴黎郊区建推理数据中心

Mistral 在自家峰会上主要说了三件事。第一,他们和空客、宝马、ASML 合作搞工业 AI,让模型进到设计、制造这类业务流程里干活,但具体怎么落地、效果如何正文没细讲。第二,Vibe 这个能处理长周期任务的 AI 助手迎来升级,具体能力变化也没展开。第三,他们要在巴黎南边的 Les Ulis 建一个 10 兆瓦的推理数据中心,计划 2026 年第三...

推荐理由:我会先打个折:这次没发新模型能力,也没给定价细节,所以重要性卡在 featured 门槛上。但 Mistral 把数据中心规格(10 MW)和时间表(2026 Q3)都摊出来了,还绑定了空客、宝马、ASML 这些实打实的工业客户,比纯概念发布实在。正文没披露推理成本的具体数字,这点先别太激动。整体看,对做工业 AI 和关注欧洲算力布局的人值得扫一眼。

AI HOT 精选

Mistral 推出物理 AI 模型,用一张 GPU 几秒钟预测完整物理场

Mistral 整合了 Emmi AI 团队,发布了一个面向工业工程的物理 AI 基础模型。它能根据几何结构、边界条件或测量数据,在单张 GPU 上用几秒钟预测出完整的物理场(比如温度、应力分布)。正文没披露具体架构、参数量、训练数据规模和实测误差范围,也没给出跟传统数值仿真在精度和速度上的量化对比,所以实际工程可用性还得看后续验证。

推荐理由:Mistral 这次没发新聊天模型,而是直接拿下一个物理 AI 团队,做工业仿真。我会先打个折:正文没披露具体模型名、基准测试、定价和开放方式,所以没法判断它比现有求解器到底准不准、省多少。但方向本身值得关注——如果单 GPU 秒级出完整物理场是真的,对西门子能源这类重工业客户来说,仿真迭代速度会快很多,成本也可能降一截。这点先别太激动,等他们放出可复现的结果再说。

Latent Space

Cognition 拿了 10 亿美元,估值冲到 260 亿,预计年底年经常性收入超 10 亿

Cognition 完成了 10 亿美元的 D 轮融资,估值 260 亿美元,比 8 个月前 C 轮时的 100 亿估值涨了 1.5 倍。公司自己预计到年底年经常性收入能超过 10 亿美元,客户里包括 Exa 和 Modal 这类挑剔的企业。正文没披露具体的利润率或成本结构,所以这个收入数字先别直接等同于利润。 这期 AI 新闻还提了几个技术趋势:推...

推荐理由:Cognition 这轮融资信息量很足。我会先打个折:260 亿估值和 10 亿年收入预期都是公司自己说的,正文没披露第三方验证,但即便打个七折也够猛。8 个月估值涨 2.5 倍,说明市场对 AI 编程 agent 这条路的买单意愿很强。对从业者来说,这不是又一家模型公司融到钱,而是一个把模型塞进开发流程干活的产品拿到了大额支票,信号比纯模型融资更实际。

新智元 · 公众号

清华团队开源 PilotDeck:让多个 AI 分工干活,Token 成本砍掉七成

清华 NLP 实验室、面壁智能、OpenBMB 和 AI9stars 一起放出了 PilotDeck 的开源代码。这套系统让多个 AI 子代理分工协作,各自有独立的工作区和可编辑的记忆库,每次任务还会留下调度日志。文章里举了个例子:在小红书内容生成测试里,用 PilotDeck 把成本从 12.58 美元压到了 2.83 美元,相当于省了 77% 的 ...

推荐理由:我会先打个折,标题里“彻底凉了”是流量话术,但正文确实给了硬数据:子 Agent 路由在小红书内容生成场景把成本从 12.58 美元压到 2.83 美元,降幅接近 77%。如果是真的,对跑 Agent 工作流的人来说挺省钱。不过正文没披露这个数字是在什么规模、什么模型上测的,也没说延迟有没有变差,这点先别太激动。整体是个有具体成本锚点的工具发布,不是大模型或平台级动作,所以分数放在 78–84 区间是合理的。

机器之心 · 公众号

Mila 和 DeepMind 搞了个大一统的缩放定律公式 UNSL,想把参数量、数据量、训练步数这些变量塞进同一个框架里

正文因为微信环境异常被屏蔽了,具体技术细节看不到。从标题和已有英文摘要看,这篇论文提出了一种叫 UNSL(统一神经缩放定律)的多变量公式,不再只看模型参数或数据量单一维度,而是同时建模参数量、token 数、训练步数,还考虑了训练瓶颈、过拟合以及超参数调不好的负面影响。在论文自己汇报的实验里,UNSL 在 60.87% 的视觉任务和 88.89% 的语...

推荐理由:这篇不是又一个刷榜的 scaling law,而是把之前各自为政的变量(参数量、token 数、步数、瓶颈、过拟合、超参数反作用)捏到了一起。我会先打个折:视觉任务 60.87% 的最佳外推率说明还有不少场景没覆盖到,但语言任务 88.89% 确实亮眼。正文没披露具体实验用了多少算力、验证集规模多大,这点先别太激动。如果是真的,训练前就能更准地估出该堆参数还是堆数据,省钱。

TechCrunch · AI

Snowflake 跟 AWS 签了 60 亿美元的五年长约,专门锁定 AI 芯片算力

Snowflake 和 AWS 敲定了一笔 60 亿美元、为期五年的合同,用来确保 AI 芯片的供应。原文没披露具体芯片型号、交付时间,也没说这批算力是拿来做模型训练、跑推理还是两者都有。对 AWS 来说这是个大单,对 Nvidia 则是个信号——大客户在找替代方案。不过正文信息有限,具体怎么用、能省多少成本都还没谱。

推荐理由:这条消息我会先打个折:60 亿数字很唬人,但正文没说是哪款芯片、怎么交付、用来训练还是推理,所以只能当个信号看。如果是真的,Snowflake 在算力上省一笔钱,但也把自己跟 AWS 绑得更紧。对同行来说,这单子说明大客户在认真找英伟达以外的选项,但实际效果还得等更多细节。

r/LocalLLaMA

一台 300 美元笔记本跑 Qwen 3.5 35B 模型,推理速度跑到每秒 10.33 个 token

一位 Reddit 用户在一台 300 美元买的联想 Ideapad Slim 3i 上,用纯 CPU 跑 Qwen 3.5 35B 模型(Q4_K_S 量化版),推理速度达到了每秒 10.33 个 token。这台机器是 i3-1215U 处理器,板载 8GB 内存加一条 32GB DDR4 扩展内存。能跑出这个速度,主要靠几个操作:用 ik_lla...

推荐理由:我会先打个折:这是 Reddit 单帖,不是系统评测,复现性存疑。但信息本身很实在——一台 300 美元的联想轻薄本,用双核 CPU 跑 35B 参数的模型,推理速度能到每秒 10 个 token 出头。这个数字说明,如果场景对延迟要求不高,极低成本硬件也能把大模型跑起来。正文没披露上下文长度和内存占用,这点先别太激动。

AI HOT 精选

Hao AI Lab 开源 FastVideo Dreamverse,一张 B200 显卡 7 秒跑出 30 秒 1080p 视频

这个工具用一张 NVIDIA B200 GPU 搭配 LTX-2 模型,把生成 30 秒 1080p 视频的时间压到了 7 秒,做到了实时出片。代码和博客都公开了,但正文没披露画面质量、一致性和复杂场景下的表现,实际效果得自己跑一遍才知道。

推荐理由:我会先打个折:目前只有Hao AI Lab单方面放出的数据,没看到第三方跑分或横向对比,所以别急着当定论。但7秒出30秒1080p这个指标本身很直观,如果真能在单卡B200上稳定复现,对做实时视频生成的人来说省卡又省时间。正文没披露模型权重是否全开源、也没提长视频的连贯性测试,这两点会直接影响实际能用在哪。

5月27日星期三

AI HOT 精选

Perplexity 开源 Unigram 分词器,CPU 占用降了五六倍

Perplexity 把自家重写的 Unigram 分词器开源了,放在 pplx-garden 仓库里。这个分词器主要解决一个实际问题:现在小型的重排序模型和嵌入模型在 GPU 上跑一次只要几毫秒,但 CPU 分词那一步反而成了拖后腿的环节。他们这次重构后,CPU 占用直接降了 5 到 6 倍,等于把分词这步的延迟砍掉一大截,让整体响应更快。正文没提具...

推荐理由:我会先打个折:正文没给独立基准测试、代码仓库细节和实际部署规模,所以 5-6 倍这个数字先别太激动。但分词器确实是重排序和嵌入模型里容易被忽略的 CPU 消耗大户,Perplexity 把这块开源出来,对跑生产 RAG 和搜索管线的团队来说,省下来的算力就是省下来的钱。

量子位 · 公众号

卡内基梅隆和马里兰大学让大模型“睡觉”:上下文快满时暂停、压缩记忆再继续推理

这篇论文给大模型设计了一个类似人类睡眠的机制。当模型处理长文本、上下文窗口快塞满时,它会主动停下来,不再接收新 token,而是利用离线时间对已积累的上下文做多轮递归前向计算,把信息压缩成“快速权重”。之后清空 KV 缓存,相当于整理完记忆再醒来继续干活。测试在细胞自动机、多跳图谱检索和 GSM-Infinite 推理任务上跑过,但正文没披露具体的性能...

推荐理由:我会先打个折,因为正文没给出压缩后的基准测试提升、代码或实际部署证据,所以分数停在 76。但“睡觉”这个说法确实把枯燥的上下文压缩讲得让人想点进去看。核心操作是模型在上下文快满时主动暂停,用多轮离线方式把旧信息压紧,然后清掉 KV 缓存腾地方,思路清楚。如果后续有实测数据,比如长文本任务不掉点、显存省了多少,分数还能往上走。这点先别太激动,等看到具体数字再说。

新智元 · 公众号

OpenRouter 月吞 100 万亿 Token,刚拿了 1.13 亿美元 B 轮融资

OpenRouter 做的是 AI 模型的“中转站”,用一个 API 就能调用 400 多个模型。现在每周处理 25 万亿 Token,一个月差不多 100 万亿。这轮融资由 CapitalG 领投,估值到了 13 亿美元。正文没披露具体盈利和成本结构,所以“赚爆了”这个说法先打个折,但流量规模确实大。

推荐理由:这条融资消息我会先打个折,毕竟不是技术突破,但100万亿月token这个量级确实把“模型路由”这门生意做实了。正文没披露利润率或抽成比例,所以别急着说它暴利,但400多个模型接入、每周25万亿token的吞吐量,说明开发者已经在用脚投票。对从业者来说,这比某个新模型跑分更有参考价值——它告诉你钱和流量正往基础设施层聚。

机器之心 · 公众号

AMD 论文发现 FP4 训练不稳,锅不在随机性不够

AMD 和宾州州立大学用 MI355X 原生 FP4 硬件预训练了 Llama 3.1-8B,端到端速度比 FP8 基线快了 9-10%。但论文指出,Wgrad(权重梯度)量化是拖后腿的环节,导致每个 token 的计算开销额外增加 26-27%,而且用确定性 Hadamard 方法也稳不住。正文没披露最终模型的验证集效果对比,这点先别太激动。

推荐理由:我会先打个折:这是一篇偏训练基础设施的研究,不是通用大模型发布,所以分数不会给到顶。但它的钩子很锋利——直接挑战“FP4 不稳定是因为随机性不足”这个流行说法,并且给出了在 AMD 最新硬件上跑 Llama 3.1-8B 的实测数据。速度提升 9-10% 是实打实的,但 Wgrad 带来的 26-27% 额外开销也说明这条路还没完全走通,这点先别太激动。对关心训练成本和硬件选型的从业者来说,这篇值得一看。

Latent Space

AI 推理基础设施又出百亿美金独角兽:Fireworks 估值 150 亿,Baseten 估值 110 亿,OpenRouter 融了 1.13 亿

这周 AI 圈的钱主要涌向了推理层。Fireworks 正在谈一轮估值 150 亿美元的融资,7 个月内估值涨了 3.75 倍;Baseten 也在以 110 亿美元估值募资,3 个月翻 2.2 倍。这两家都还没正式官宣,数字先别太当真。已经落定的是 OpenRouter 的 1.13 亿美元 C 轮融资,他们 6 个月内周调用量从 5 万亿 toke...

推荐理由:这条消息把三家推理服务商的估值摆在一起看,Fireworks 和 Baseten 还在谈,OpenRouter 已经拿钱且用量涨得很快。我会先打个折,估值数字本身是谈判口径,不代表最终成交价,但能看出资本在往推理层集中砸钱。对从业者来说,这直接关系到未来用谁的 API、成本怎么走,以及这些平台会不会变成新的流量入口。正文没披露具体营收或利润率,所以别急着喊泡沫,但估值确实不低。

AI HOT 精选

高通要给字节跳动做定制 AI 芯片,订单量在百万颗级别

彭博社的消息人士说,高通和字节跳动签了一份 AI ASIC 合作协议。ASIC 就是按特定需求定制的芯片,不像 GPU 那样通用,但干专一的活更省电、效率更高。字节跳动会向高通采购数百万颗这种定制芯片,用来跑自己的 AI 服务。另一个消息源提到,这笔交易能帮字节跳动把内部已经设计好的芯片方案,变成真正可以量产的半导体。不过正文没披露具体芯片规格、单价、...

推荐理由:这条消息的钩子很硬——高通和字节跳动、AI ASIC、百万颗级别采购,三个关键词一摆,从业者很难不点。我会先打个折:正文除了“数百万颗”这个量级,什么都没披露,芯片规格、单价、交付节奏、是否量产全是空白,所以别急着当定论。但即便只是传闻,它同时戳中了推理降本、中国算力替代和中美供应链博弈三条线,话题性够强,放在 featured 里合理。

彭博科技

Fireworks AI 正谈新一轮融资,估值冲到 150 亿美元

彭博社援引知情人士消息,Fireworks AI 正在谈一笔新融资,投后估值可能达到 150 亿美元。这家公司主要做模型推理和微调服务,帮企业跑开源模型时更快、更省钱。不过正文没披露这轮具体要融多少钱、哪些投资方在谈,也没给时间表。150 亿这个数字放在当前 AI 基础设施赛道里算很高了,但先别太激动——谈判还在进行,条款可能变,最后能不能落定还不一定。

推荐理由:Bloomberg 先爆出来的消息,还在谈,没签。150 亿美元估值听着挺高,但正文没写这轮要融多少钱、谁在跟投、什么时候 close,所以先别太激动。我会打个折放进 featured 低位,等具体条款出来再调。

AI HOT 精选

TRL 新增增量权重同步:只传模型变化的部分,每步传输量从 1.2GB 降到 20-35MB

异步强化学习训练有个很现实的问题:每一步训练器都得把整个模型发给推理引擎。一个 7B 模型用 bf16 格式就要传 14GB,换成万亿参数模型更是要传 TB 级别的数据。Hugging Face 团队发现,在两次优化步骤之间,大约 99% 的 bf16 权重其实完全没变,真正变动的部分很小。他们合入了 TRL 的一个 PR,做法是把变动的权重打包成稀疏...

推荐理由:Hugging Face 在 TRL 里合了一个增量权重同步的 PR,用稀疏 safetensors 只传变化的部分,Qwen3-0.6B 单步载荷从 1.2GB 降到 20–35MB。对经常做分布式微调的人来说,这个压缩比很实在,能省带宽、省时间。正文没提更大规模模型或跨节点同步的实测数据,所以“万亿参数”目前更像一个能力上限的表述,实际效果还得看后续验证。整体是训练基础设施层面的改进,对从业者有用,但还没到必须全员关注的程度。

AI HOT 精选

小米 MiMo 2.5 Pro 永久降价,最高砍掉 99%,跟 DeepSeek V4 Pro 一个价

小米把 MiMo-V2.5 系列的 API 价格永久打下来了,最高降了 99%,现在和 DeepSeek V4 Pro 定价持平。花同样的钱,能用的 token 数多了 5 到 8 倍,计费方式也变简单了。老用户之前买的套餐额度会全部重置补满。降价的原因是他们在推理环节做了全栈优化,省下来的成本直接让出来了,具体技术细节后面会发博客。另外 MiMo-V...

推荐理由:HKR 三项都成立:99% 的降幅和直接点名 DeepSeek 同价,话题性够强;降价幅度和生效时间都是硬信息;API 成本压力是从业者每天在算的账。不过这只是调价公告,没有新模型或新能力,所以重要性停在 76 分,不往上拉了。