跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

455 条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 181–200 条 · 共 455 条

5月21日星期四

AI HOT 精选

腾讯开源 Hy-MT2 翻译模型,1.8B 小版量化后 440MB 就能在手机上跑,性能还超了微软商业 API

腾讯放出了 Hy-MT2 多语言翻译模型,支持 33 种语言互译。7B 和 30B-A3B 两个版本在开源模型里翻译质量最好,比很多参数大几十倍的模型还强。更实用的是 1.8B 轻量版,用 AngelSlim 1.25-bit 量化技术把体积压到 440MB,主流手机芯片就能本地跑,推理速度比上一代快 1.5 倍。官方说这个轻量版性能超过了微软等商业翻...

推荐理由:腾讯这次放出的Hy-MT2,最抓人的点是1.8B模型经1.25-bit量化后只有440MB,能在主流手机芯片上本地跑33种语言互译。这对移动端开发者来说,意味着离线翻译、隐私保护和零服务端成本都有了现成方案。我会先打个折:正文没披露翻译质量基准、实际延迟和开源协议,所以没法判断它在真实场景里到底多能打。但光凭这个体积和语言覆盖,已经是个值得关注的端侧AI信号,只是离旗舰级发布还差一口气。

Latent Space

OpenAI 用通用推理模型花不到 1000 美元,推翻了一个 80 年前的数学猜想

OpenAI 公布了一个内部通用推理模型(外界猜是 GPT 5.6)的成果:它找到了平面单位距离问题的新构造族,推翻了 1946 年 Erdős 提出的一个猜想。这个模型不是专门为数学训练的,就是普通的语言模型,但推理过程生成了约 125 页的总结。有外部观察者推测,这次运行只用了不到 32 小时,成本不到 1000 美元。数学家 Timothy Go...

推荐理由:HKR 三项都成立:一个内部推理模型声称驳倒了 1946 年的 Erdős 问题,输出约 125 页,这是很强的能力信号。不过成本和运行时间目前还是外部推测,正文没披露 OpenAI 自己的官方数字,所以分数没给到 95。

机器之心 · 公众号

VAST 和清华搞了个新方法,让 3D 生成把算力花在刀刃上,高斯点数量砍半画质还能打

这篇论文正文被微信环境验证挡住了,看不到具体技术细节。从标题和已知信息看,他们提出了一种叫 DeG 的 3D 生成方法,核心思路是让模型自己学会在物体细节丰富的地方多放高斯点、在平坦区域少放点,而不是均匀撒点。这样能用不到一半的高斯点数量,达到跟 TRELLIS 差不多的画面质量。相当于用更少的算力跑出同级别的 3D 模型,对做实时渲染或者要在手机上跑...

推荐理由:我会先打个折:正文只说了“部分场景”达到 TRELLIS 相近画质,没给全量对比,所以别直接当成全面超越。但 DeG 这套密度控制方法确实把“算力花在刀刃上”落到了具体机制里——用渲染损失梯度去学哪里该多放高斯球、哪里该省,比均匀撒点聪明。SIGGRAPH 论文本身有一定技术门槛,不过对做 3D 生成的人,这个效率提升方向值得跟。

机器之心 · 公众号

智谱在千卡集群部署 ZCube,同样 GPU 推理吞吐提升超 15%

智谱把自研的 ZCube 通信方案用到了 GLM-5.1 的线上推理集群里,规模是千卡级别。它替换了原来的 ROFT 组网方式,但没动 GPU、软件栈和业务代码。效果上,吞吐量提升了超过 15%,首 token 延迟的 P99 下降了 40.6%,交换机加光模块的成本省了三分之一。正文没披露具体是怎么做到省硬件成本的,也没给更细的测试条件,所以这个 1...

推荐理由:智谱在 GLM-5.1 千卡推理集群上部署 ZCube,不增 GPU、不改代码就把吞吐提了 15%,首 token 延迟的 P99 降了 40.6%。这是纯工程层面的组网逻辑改动,不是模型能力升级,所以重要性给 81、放在 featured 里比较合适——对搞推理部署的人有用,但不会像新模型发布那样震动整个行业。

彭博科技

Anthropic 要在三年内付给 SpaceX 近 450 亿美元,买算力跑 Claude

根据一份证券文件,Anthropic 跟马斯克的 SpaceX 签了份大单:未来三年支付差不多 450 亿美元,换取计算资源来支撑它的 Claude 模型。这笔钱摊下来每年约 150 亿美元,说明头部 AI 公司抢算力的成本已经拉到天文数字级别。不过正文被 Bloomberg 的机器人验证挡住了,具体是租 GPU 还是包数据中心、交付节奏和退出条款都没披露。

推荐理由:我会先打个折:450 亿美元是三年总承诺,不是一次性付款,但数字大到足以让任何 AI 公司重新算账。Anthropic 把算力押在 SpaceX 身上,说明它不想只靠 AWS 或 Google Cloud,分散供应商是明牌。不过正文没披露具体算力规格、交付时间表,也没说 SpaceX 的算力基础设施到底建到什么程度,这点先别太激动。Bloomberg 拿证券文件报出来,可信度比 PR 稿高,值得写。

TechCrunch · AI

Anthropic 每月要付给 xAI 12.5 亿美元买算力

Anthropic 租下了 xAI 在孟菲斯 Colossus 1 数据中心的全部算力,每月账单 12.5 亿美元,合同签到 2029 年 5 月。头两个月有折扣,因为 xAI 那边还在爬坡。这笔钱来自 SpaceX 的上市文件,xAI 自己说这是在把闲置算力变现。说白了,Grok 用户量最近掉得厉害,服务器空出来了,正好租给竞争对手回血。不过正文没披...

推荐理由:TechCrunch 爆出 Anthropic 每月要给 xAI 付 12.5 亿美元买算力,对手方和价格都挺意外。正文只给了金额,没写买了多少卡、签了多久、跑在什么环境里,所以信息缺口不小。我会先打个折:金额够大,但缺关键细节,没法给到 90 分以上。

r/LocalLLaMA

Cohere 联合创始人亲自回应:Command A+ 是他们第一个 MoE 开源模型,主打在 1-2 张 GPU 上跑得动

Cohere 的 Nick Frosst 在 Reddit 上发帖,正式推出了 Command A+。这是他们第一个混合专家(MoE)模型,用 Apache 2.0 协议开源。帖子里说,这个模型最大的卖点是效率,做了很极限的量化工作,在 1 到 2 张消费级 GPU 上就能跑得很流畅,对个人开发者和小团队比较友好。不过他也直说,模型的顶尖性能还有待打磨...

推荐理由:我会先打个折:正文没披露参数量、基准测试成绩和上下文窗口,这些关键指标全缺,所以重要性只能给到 74。亮点是 Cohere 终于把 Command-A 这条线捡起来,换成 MoE 架构还给了 Apache 2.0,量化后能在 1 或 2 张 GPU 上跑,对想自己部署的人是个实在消息。但信源只有 Reddit 讨论,没有官方技术报告或实测数据,这点先别太激动。

彭博科技

英伟达上季度每股赚 1.87 美元,超预期,下季度营收指引 910 亿

英伟达刚发了 2026 财年第一季度的财报,每股收益 1.87 美元,比华尔街预期的 1.77 美元高出一截。公司对截至 7 月的当季营收指引是 910 亿美元,也明显高于市场预估的 874 亿左右。这条视频本身是彭博的报道片段,正文没披露各业务线的具体表现和毛利率细节,所以没法判断增长是数据中心业务继续拉动的,还是有别的板块在补位。

推荐理由:Nvidia 财报是观察 AI 基础设施热度的关键节点,910 亿的指引给 HKR 三项都提供了实打实的信号。这不是模型或功能发布,所以放在 featured 档位没问题,信息质量够硬。

AI HOT 精选

英伟达一季度净利润 583 亿美元,同比涨了 211%,数据中心收入占了大头

英伟达 2027 财年第一财季(截止到 2026 年 4 月 26 日)总收入 816.15 亿美元,净利润 583.21 亿美元,同比直接翻了两倍多。增长主要靠数据中心业务,单这一块就进账 752 亿美元,同比涨了 92%。毛利率也拉到了 75% 左右,比去年同期高了 14 个百分点。公司预计下个季度收入能到 910 亿美元,上下浮动 2%。另外,董...

推荐理由:英伟达这份财报就是AI基础设施景气度的温度计。数据中心752亿美元的收入说明大厂还在疯狂囤卡,211%的利润增速比很多AI公司的营收涨得还快。我会先打个折:这是财务数据,不是新模型或新功能发布,所以重要性停在82分。但数字本身已经足够让关注算力成本和供应链的人必须看一眼。

AI HOT 精选

Meta裁掉8000人,再把7000人转去做AI

Meta这次不是单纯砍成本,而是把人力往AI方向挪。计划裁掉约8000个岗位,同时把约7000名员工调到AI相关职位,资源集中砸在AI基础设施、基础模型开发和商业化上,想打通从模型训练、产品落地到赚钱的整条链路。

推荐理由:我会先打个折:正文没披露具体时间表和官方确认文件,所以别当正式公告看。但信息量够硬——8000人裁撤、7000人转AI岗,资源明确砸向基础设施、基础模型和商业化,说明Meta不是在喊口号,是真在把人力往AI链条上搬。对从业者来说,这比单纯裁员数字更有信号意义:AI岗位在涨,非AI岗位在缩,职业迁移的压力很具体。因为缺官方背书,分数压在82,但话题性和信息密度都撑得起featured。

AI HOT 精选

Perplexity 上线查询感知压缩,上下文 token 最多砍掉 70% 但回答质量反而更好

Perplexity 把一项叫“查询感知压缩”的技术用到了线上。它能在搜索时把喂给模型的上下文 token 最多减少 70%,同时回答质量还提升了。核心逻辑是“更好的上下文优于更多的上下文”,也就是先理解你问什么,再挑最相关的信息塞进窗口,而不是一股脑全丢进去。正文没披露具体测试基准和压缩方法细节,所以实际效果我会先打个折,但能省下这么多 token ...

推荐理由:我会先打个折:正文只给了一条 X 帖子,没放基准测试和可复现的设置,所以别太激动。但这条信息本身够硬——Perplexity 在生产环境用查询感知压缩,最多砍掉 70% 上下文令牌,同时回答质量还变好了。对搞外挂资料库和搜索优化的从业者来说,这直接关系到省钱和降延迟,值得看一眼。

5月20日星期三

阿里技术 · 公众号

阿里平头哥发布真武 M890 AI 芯片,128 卡超节点服务器已在百炼平台上线

阿里平头哥的真武 M890 AI 芯片首次公开,主打 Agent 场景的算力底座。配套的 128 卡超节点服务器,卡间直连延迟低于 150 纳秒,机架带宽达到 Pb/s 级别。这套硬件已经在阿里云百炼平台跑起来了,支持通义千问、DeepSeek 和 Kimi 等模型。不过正文因为环境验证问题没加载出来,具体的芯片架构、制程、显存规格和实测性能数据暂时看...

推荐理由:HKR三项都踩中了,但得先打个折——消息源是阿里自己的技术文章,没有第三方实测、没提定价、也没说量产规模。所以分数就卡在featured门槛上,当个基础设施产品更新看比较合适。

新智元 · 公众号

摩尔线程 MUSA 生态更新:SDK 对齐 CUDA 12.8,SGLang 主线已合并

摩尔线程放出了自家 GPU 生态 MUSA 的最新进展。SDK 5.1.0 把兼容目标拉到了 CUDA 12.8,覆盖了 761 个驱动和运行时接口,意思是跑 CUDA 代码时能认的指令更多了。推理框架 SGLang 的主线代码已经合并了 MUSA 的支持,硬件支持排期在 2026 年第二季度。另外还提了一个叫 MUSACODE 的工具,能自动把库迁移...

推荐理由:我会先打个折:这还是一家厂商的生态更新,不是整个国产 GPU 阵营的集体突破。但文章把兼容 API 数量、SDK 版本对标和 SGLang 主线合入这几个点都摆出来了,比空谈“替代 CUDA”实在。老黄喝豆汁的梗让标题有了传播力,内文也没写成公关稿,对关注推理部署和算力自主的读者来说值得一看。

r/LocalLLaMA

用 4 张老 RTX 2080 Ti 在本地跑 DeepSeek-V4,预填充跑到 255 token/s

一个 Reddit 用户用 4 张 RTX 2080 Ti 显卡(总预算不到 2500 美元)在本地跑起了 DeepSeek-V4-Flash 模型。模型总参数 2840 亿,每次推理激活 130 亿参数。他用了 W8A8 量化(把权重和激活值都压到 8 位精度)来省显存,还自己写了适配老 Turing 架构的 CUDA 算子。机器配了 1TB 的 D...

推荐理由:一个 Reddit 用户用 4 块二手 RTX 2080 Ti 搭了一套不到 2500 美元的机器,跑 DeepSeek-V4-Flash(284B 参数,每次推理只激活 13B),通过 W8A8 量化和自己写的 Turing 内核优化,prefill 阶段跑到约 255 tok/s。我会先打个折:这是单用户自报数据,没有第三方复现,也没披露并发、上下文长度和 decode 阶段的吞吐,所以别直接当采购依据。但亮点在于它证明了老卡在量化+定制内核下还能打,对预算有限的团队是个有参考价值的思路。正文没提功耗和稳定性,这两点在实际部署里很关键。

AI HOT 精选

大模型 API 的补贴期结束了,三家厂商开始涨价

Tomasz Tunguz 对比了 Google、OpenAI 和 Anthropic 三家最新旗舰模型的 API 定价,发现补贴正在退潮。Google Gemini 3.1 Pro 最便宜,输入每百万 token 2 美元、输出 12 美元;OpenAI GPT-5.5 短暂补贴后涨到输入 5 美元、输出 30 美元;Anthropic Claude...

推荐理由:Tom Tunguz 这篇是定价评论,不是模型首发新闻,但三家旗舰模型的价格摆在一起,差距够大,对从业者选型有参考价值。我会先打个折,给 featured 而不是 must-write,因为正文没披露补贴具体怎么算、能撑多久,判断还缺一手数据。

AI HOT 精选

Gemini 3.5 Flash 发布:价格涨了,但谷歌打算把它塞进所有产品里

谷歌在 I/O 大会上直接发布了 Gemini 3.5 Flash,跳过预览阶段。输入价格涨到每百万 token 1.5 美元,输出 9 美元,分别是上一代 Flash 预览版的 3 倍和 Flash-Lite 的 6 倍,已经快追上自家的 Pro 型号了。涨价不是谷歌一家的事,OpenAI 和 Anthropic 的新模型也都在提价,各家似乎都在试探...

推荐理由:我会先打个折:正文只给了价格和全面铺开的意图,没提能力提升、跑分或上下文窗口,所以没法判断涨得值不值。但涨价幅度本身对开发者是硬信号,值得放进精选。

AI HOT 精选

OpenAI 卖算力期货:交钱锁定长期 GPU,正文没写价格和最低消费

OpenAI 上线 Guaranteed Capacity 服务,让客户提前锁定长期算力,避免高峰期排队。官方说法是帮企业在算力紧张时也能跑关键任务。但公告没披露价格、合同年限、最低配额,也没说锁的是哪种 GPU。我会先打个折——这更像给大客户吃定心丸,小团队暂时不用激动。

推荐理由:我会先打个折:正文没给价格、期限和容量配额,所以现在只能知道 OpenAI 开始卖算力预留,但不知道划不划算。H 来自 OpenAI 把算力稀缺变成一种可预订的服务,对 API 用户是个实在的钩子。K 只到产品名和规划机制这一步,缺关键商业细节。R 踩中了生产可靠性和预算规划这两个痛点,所以能进 featured,但信息缺口把分数压在中段。

AI HOT 精选

Google 把 Tensor 芯片的 AI 能力开放给开发者,Pixel 10 手机上的 TPU 现在可以直接跑模型了

Google 发布了 Tensor ML SDK 的公开测试版,开发者现在能把 PyTorch 或 TFLite 模型转换、编译后,直接调用 Pixel 10 系列手机里的 TPU 芯片来跑推理。整个流程通过 LiteRT 这个统一框架完成,不用再分别对接底层硬件驱动。官方还提供了一个模型库,里面有超过 100 个现成的经典模型和生成式 AI 模型,包...

推荐理由:HKR-K 很扎实:文章给出了 Pixel 10 TPU 上的具体工作流和一个 100+ 模型库。H 和 R 也够得上 featured,但这是个测试版开发者 SDK,不是旗舰模型或面向大众的产品发布,所以我会先打个折。

r/LocalLLaMA

英伟达放出 Nemotron-Labs-Diffusion 模型,用扩散解码把 8B 模型跑到 850 tok/s

英伟达发了 Nemotron-Labs-Diffusion 系列,包含 3B、8B 和 14B 三个稠密模型。这组模型同时支持传统的自回归解码和新的扩散并行解码,还带了一种叫 self-speculation 的加速技巧。最抓眼球的是 8B 版本在 GB200 上单并发能跑到每秒 850 个 token,作为对比,同样条件下自回归解码是 253 tok...

推荐理由:NVIDIA 这次没走自回归老路,拿扩散模型做了三个稠密 LLM,最小的 3B,最大的 14B。我会先打个折:目前只有 Reddit 帖子当信源,没有论文或技术报告,所以 850 tok/s 这个数先别太激动,正文没披露具体测试条件和 batch size。但方向本身有意思——扩散并行解码加上 self-speculation,理论上可以一次出多个 token,不用像自回归那样一个字一个字往外蹦,推理延迟能压下去。8B 模型在 GB200 上跑出这个速度,如果属实,对本地跑模型、做实时对话的人挺省钱。信息缺口也明显:没提训练数据、没提多语言能力、没...

AI HOT 精选

Gemini 3.5 Flash 发布,跑分超 3.1 Pro,生成速度是其他顶尖模型的 4 倍

Google 在 I/O 后开放了 Gemini 3.5 Flash,产品端和 API 都能用。官方说它在多数基准测试上比 3.1 Pro 强,编程能力提升明显,每秒吐 token 的速度是其他前沿模型的 4 倍。不过帖子没给具体跑分数字和测试条件,这点先别太激动。

推荐理由:Google 在 I/O 后放出了 Gemini 3.5 Flash,产品和 API 都能用。最抢眼的数字是每秒吐 token 的速度是其他前沿模型的 4 倍——我会先打个折,因为正文没披露跟哪些模型比、在什么条件下测的,也没给价格和上下文窗口。这点先别太激动,但速度翻几倍对降低延迟和成本确实有用,所以这条消息值得从业者看一眼。