跳到正文

NVIDIA 英伟达

英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力市场的风向。

290 条精选相关主题部署工程行业动态具身智能

最新精选

第 181–200 条 · 共 290 条

5月28日星期四

AI HOT 精选

英伟达开源 Polar 框架,不改代码就能让 Codex 跑分涨近 6 倍

英伟达搞了个叫 Polar 的开源框架,专门解决一个实际问题:怎么在不重写 Codex、Claude Code 这些现成代码工具的前提下,用强化学习(GRPO,一种让模型在多步任务里根据奖励信号自己学会更优操作的训练方法)去训练它们。Polar 的做法很取巧,它不碰工具本身的执行逻辑,而是在模型和工具之间的 API 接口上做文章,把对话记录、采样结果这...

推荐理由:英伟达开源 Polar,用 GRPO 训练小模型 Qwen3.5-4B,Codex 在 SWE-Bench Verified 上从 3.8% 冲到 26.4%,这个提升幅度在代码 agent 圈子里很能打。技术细节和基准分都给得清楚,属于扎实的研究开源项,不是大模型或产品发布,所以放在 featured 档、82 分合理。

TechCrunch · AI

Snowflake 跟 AWS 签了 60 亿美元的五年长约,专门锁定 AI 芯片算力

Snowflake 和 AWS 敲定了一笔 60 亿美元、为期五年的合同,用来确保 AI 芯片的供应。原文没披露具体芯片型号、交付时间,也没说这批算力是拿来做模型训练、跑推理还是两者都有。对 AWS 来说这是个大单,对 Nvidia 则是个信号——大客户在找替代方案。不过正文信息有限,具体怎么用、能省多少成本都还没谱。

推荐理由:这条消息我会先打个折:60 亿数字很唬人,但正文没说是哪款芯片、怎么交付、用来训练还是推理,所以只能当个信号看。如果是真的,Snowflake 在算力上省一笔钱,但也把自己跟 AWS 绑得更紧。对同行来说,这单子说明大客户在认真找英伟达以外的选项,但实际效果还得等更多细节。

AI HOT 精选

Hao AI Lab 开源 FastVideo Dreamverse,一张 B200 显卡 7 秒跑出 30 秒 1080p 视频

这个工具用一张 NVIDIA B200 GPU 搭配 LTX-2 模型,把生成 30 秒 1080p 视频的时间压到了 7 秒,做到了实时出片。代码和博客都公开了,但正文没披露画面质量、一致性和复杂场景下的表现,实际效果得自己跑一遍才知道。

推荐理由:我会先打个折:目前只有Hao AI Lab单方面放出的数据,没看到第三方跑分或横向对比,所以别急着当定论。但7秒出30秒1080p这个指标本身很直观,如果真能在单卡B200上稳定复现,对做实时视频生成的人来说省卡又省时间。正文没披露模型权重是否全开源、也没提长视频的连贯性测试,这两点会直接影响实际能用在哪。

AI HOT 精选

黄仁勋带人看了英伟达在台湾的新园区,年投资额报 1500 亿美元

黄仁勋公开了英伟达在台湾的新园区。公司计划每年在台湾砸约 1500 亿美元,这个数字比一周前 AMD 宣布的 100 亿美元 AI 投资高了不止一个量级。正文没披露园区具体做什么、投资怎么分配,也没提产能或人员规模,所以这 1500 亿到底对应多少实际落地项目,我会先打个折看。

推荐理由:这条消息有黄仁勋站台,有具体投资金额,也带出了英伟达和AMD在台湾的布局对比,话题性够。但来源只是一条X上的帖子,正文没披露投资的具体范围、时间节奏和园区细节,信息量其实很薄。1500亿美元这个数字很大,但没说明是几年摊完、包不包含供应链采购,所以只能当个信号看,别急着算账。整体属于有热度但缺硬核细节,适合放精选但不用高亮。

5月27日星期三

机器之心 · 公众号

AMD 论文发现 FP4 训练不稳,锅不在随机性不够

AMD 和宾州州立大学用 MI355X 原生 FP4 硬件预训练了 Llama 3.1-8B,端到端速度比 FP8 基线快了 9-10%。但论文指出,Wgrad(权重梯度)量化是拖后腿的环节,导致每个 token 的计算开销额外增加 26-27%,而且用确定性 Hadamard 方法也稳不住。正文没披露最终模型的验证集效果对比,这点先别太激动。

推荐理由:我会先打个折:这是一篇偏训练基础设施的研究,不是通用大模型发布,所以分数不会给到顶。但它的钩子很锋利——直接挑战“FP4 不稳定是因为随机性不足”这个流行说法,并且给出了在 AMD 最新硬件上跑 Llama 3.1-8B 的实测数据。速度提升 9-10% 是实打实的,但 Wgrad 带来的 26-27% 额外开销也说明这条路还没完全走通,这点先别太激动。对关心训练成本和硬件选型的从业者来说,这篇值得一看。

彭博科技

台湾检方怀疑有人把英伟达芯片先运到日本,再走私进中国大陆

彭博社引述知情人士消息,台湾检方怀疑三名涉案人至少将一批英伟达 AI 芯片出口到日本,随后再走私进入中国大陆。正文因为 Bloomberg 的反爬机制没能抓取到完整内容,具体芯片型号、数量、案值以及调查进展都没披露。

推荐理由:HKR 三项都踩中了:Bloomberg 点名了走私路线和嫌疑人,信息有料。但规模上正文只说了“至少一批”,芯片型号、数量、货值全没披露,所以我会先打个折,放在低 featured 档。

5月26日星期二

量子位 · 公众号

面壁智能发布 ForgeTrain 和 MiniCPM5-1B,声称训练框架由 AI 自己编写,训练速度比英伟达 Megatron 快 10%

面壁智能放出了 ForgeTrain 训练框架和 MiniCPM5-1B 模型。ForgeTrain 最抓眼球的地方是,他们说是让 AI 自己写的代码,在同样硬件下比英伟达的 Megatron 训练快 10%。MiniCPM5-1B 是个 10 亿参数的小模型,FP16 权重约 2GB,压缩到 INT4/Q4 后约 0.5GB,主打端侧部署。不过原文因...

推荐理由:面壁智能说 ForgeTrain 是 AI 写的训练框架,同硬件下比英伟达 Megatron 快 10%,还发了 1B 参数的端侧模型 MiniCPM5-1B,FP16 权重约 2GB,压缩到 INT4/Q4 约 0.5GB。我会先打个折——“全球首例 AI 造 AI”这个说法正文没给出第三方复现,10% 的速度提升也没交代测的是什么任务、什么卡、什么 batch size。但即便保守看,一个 AI 生成的训练框架能跑起来还声称更快,本身就有信息量;1B 模型压到 0.5GB 对手机端部署也够直接。分数定在 80,是因为概念够新、数字够具体,但验证...

机器之心 · 公众号

面壁开源 MiniCPM5-1B 和训练框架 ForgeTrain,框架代码是 AI 自己写的,1B 模型跑分 17.9

面壁智能放出了两个东西:一个叫 MiniCPM5-1B 的端侧小模型,和一个叫 ForgeTrain 的训练框架。1B 模型在 AA-Index 上拿了 17.9 分,这个分数说明小体量也能有不错的综合能力。更特别的是 ForgeTrain,它的训练代码不是人写的,是让 AI 自动生成的,跑出来的结果跟英伟达的 Megatron 框架对得上,而且在 H...

推荐理由:HKR 三项都踩中了:AI 写训练框架这个钩子够新鲜,不是又一个千篇一律的模型发布;AA-Index 17.9 分和比 Megatron 快 10% 的 H100 数据让信息有骨头;话题又落在开源小模型和端侧部署上,读者会想点开看。不过它毕竟不是旗舰模型发布,所以分数放在 78 这个区间是合适的。

5月25日星期一

r/LocalLLaMA

小模型做智能体流程不流行,不是能力不行,是商业账算不过来

这篇帖子直接点破:小模型搭的智能体方案没成为主流,跟技术能不能跑通关系不大,核心是商业风险和验证成本。作者举了两个例子——Gemma 4 31B 在 tau2-bench 上能跑到 86.4% 的准确率,DeepSeek V4-Flash 的输出 token 价格差不多是 Claude Opus 4.6 的 89 分之一,单看指标和成本都挺能打。但问题...

推荐理由:这篇文章的切入点挺刁钻——小模型 agent 栈没普及,不是性能不行,是验证层掉链子。它拿 Gemma 4 31B 在 tau2-bench 上 86.4% 的成绩和 DeepSeek 低到离谱的输出成本说事,数字本身有说服力。但更值得盯的是那个 7-9B 模型做验证时,一半到三分之二的正确答案推理链其实有缺陷,这个发现直接动摇了用小模型兜底的信心。来源是 Reddit,权威性要打个折,所以分数没给到顶,但话题本身对做 agent 落地的人很解渴。

5月23日星期六

AI HOT 精选

黄仁勋说 AI 基建年开支会冲到 4 万亿美元,比华尔街共识高了四倍

黄仁勋在英伟达财报电话会上抛出一个数字:超大规模云厂商的 AI 基建年开支会从现在的 1 万亿美元涨到 3 到 4 万亿,CFO 给的时间线是 2030 年前。华尔街分析师原本的共识是 2028 年才到 1.03 万亿,老黄直接翻了四倍。一季度谷歌、亚马逊、微软三家资本开支加起来已经超过 1100 亿美元,Meta 更是把全年预算拉到 1450 亿,结...

推荐理由:黄仁勋说的 3-4 万亿美元是 CEO 预测,不是已发生的模型发布或产品落地,所以分数压在 78-84 这个区间。数字本身有信号价值——它把云厂商的烧钱速度量化了,也间接给英伟达的营收预期撑腰。但正文没披露这个 4 万亿是怎么算出来的,也没说时间节点,这点先别太激动。

5月22日星期五

最佳拍档

英伟达 2026 财年 Q1 营收 816 亿,数据中心涨 92%,股价反跌 2%

英伟达发了 2026 财年第一季度财报,营收 816 亿,利润 583 亿,数据中心业务同比暴增 92%。但股价盘后还是跌了 2%,说明市场对它的预期已经拉得很高,光超预期不够,得超很多才行。正文没披露货币单位和利润口径,这点先别太激动,如果是真的挺省钱,但缺信息没法判断。

推荐理由:我会先打个折:正文只给了标题级数字,没披露币种、利润口径和业绩指引,所以判断只能基于标题。数据中心业务涨92%说明AI算力需求还在猛跑,但股价跌2%说明市场早就把更夸张的预期打进去了。这点先别太激动,正文没给毛利率趋势和后续指引,没法判断增速能不能撑住现在的估值。

纽约时报中文网

特朗普松口卖芯片,北京反而拦着不让买

特朗普半年前批准英伟达向中国卖 H200 芯片,但北京至今没让任何一家公司下单,反而把企业往华为、寒武纪等国产替代上推。文章说这背后是中美技术脱钩的深度不信任:中国想借机逼本土芯片产业提速,企业则抱怨算力不够是最大瓶颈。现在国内芯片性能号称已追上 H200,但良率跟不上,所以很多公司只能租用境外数据中心的英伟达芯片远程训练模型——速度慢、数据泄露风险高...

推荐理由:HKR 三项全中:批准后六个月零采购,加上北京明确引导企业转向华为、寒武纪,这是很强的芯片政策信号。不过它毕竟不是模型发布或重大产品更新,所以分数放在 78–84 区间,82 合理。

彭博科技

SpaceX 向纳斯达克提交 IPO 申请,OpenAI 最快本周五跟上

Bloomberg 报道,SpaceX 已正式申请在纳斯达克上市,并在路演材料里画了一个 28.5 万亿美元的大饼,把业务从 AI 一路讲到了火星。同一天的消息还说,OpenAI 也在准备 IPO 文件,最快周五就会提交。视频本身是 Bloomberg 的每日科技节目,没有放出完整的招股书细节,所以估值、发行价和具体时间表都还没公开。

推荐理由:Bloomberg 这条稿子把 SpaceX 和 OpenAI 的 IPO 进度绑在一起报,信息密度很高。SpaceX 那边给了个 28.5 万亿美元的投资者叙事,数字很大,但正文没展开算这笔账的细节,我会先打个折看。OpenAI 这边最值钱的是“最快周五交表”这个时间点,比之前模糊的传闻进了一步,不过估值、募资规模、具体承销商这些关键信息都没披露,所以重要性到不了 90 以上。两条消息都是 Bloomberg 独家,来源可信,对关注 AI 和科技股的人有直接参考价值。

NVIDIA 博客

NVIDIA 在 COMPUTEX 2026 拿了四个奖,Vera Rubin NVL72 号称推理能效比上代高 10 倍

NVIDIA 在 COMPUTEX 2026 上靠 Vera Rubin NVL72、Jetson Thor 和 Alpamayo 拿了四个 Best Choice 奖。Vera Rubin NVL72 把 36 颗 Vera CPU 和 72 颗 Rubin GPU 连在一起,NVIDIA 说它每瓦推理性能是上代的 10 倍,每个 token 的成本...

推荐理由:我会先打个折:这是 NVIDIA 自己活动博客发的,不是第三方实测,10 倍能效得看什么负载、跟谁比。但 Vera Rubin NVL72 的规格和能效数字本身够硬,对算力成本和采购节奏有直接参考价值,所以给 featured。正文没披露具体基准测试条件和上市时间,这点先别太激动。

5月21日星期四

机器之心 · 公众号

智谱在千卡集群部署 ZCube,同样 GPU 推理吞吐提升超 15%

智谱把自研的 ZCube 通信方案用到了 GLM-5.1 的线上推理集群里,规模是千卡级别。它替换了原来的 ROFT 组网方式,但没动 GPU、软件栈和业务代码。效果上,吞吐量提升了超过 15%,首 token 延迟的 P99 下降了 40.6%,交换机加光模块的成本省了三分之一。正文没披露具体是怎么做到省硬件成本的,也没给更细的测试条件,所以这个 1...

推荐理由:智谱在 GLM-5.1 千卡推理集群上部署 ZCube,不增 GPU、不改代码就把吞吐提了 15%,首 token 延迟的 P99 降了 40.6%。这是纯工程层面的组网逻辑改动,不是模型能力升级,所以重要性给 81、放在 featured 里比较合适——对搞推理部署的人有用,但不会像新模型发布那样震动整个行业。

FT · 科技

英伟达加派股息,但股价还是跌了

英伟达这次财报营收和未来指引都超过了市场预期,还宣布提高股息,但股价依然下跌。具体涨了多少股息、营收数字是多少、预测区间在哪、股价跌了几个点,这篇正文全被付费墙挡住了,只返回了一个安全验证页面,看不到实际内容。

推荐理由:这条消息的钩子很清晰:业绩明明超预期,股价反而跌了,说明市场现在更怕增长放缓而不是看当期数字。我会先打个折——摘要没给任何具体数据,股息幅度、收入、指引全缺,所以只能当个情绪信号看,不能拿来算估值。对 AI 从业者来说,这比单纯财报更有参考价值,因为它反映的是整个算力链条的信心温度。

TechCrunch · AI

英伟达又创收入新高,同时披露手里攥着 430 亿美元初创公司股权

英伟达在周三盘后发了新一季财报,收入 816 亿美元,比上季度涨了 20%,其中数据中心收入 752 亿美元,也是历史最高。公司顺手批了 800 亿美元的回购计划。比较少见的是,这次财报里还亮出了投资账本:英伟达在初创公司里持有的股权价值高达 430 亿美元。不过文章没细说这些股权具体投了哪些公司、按什么估值算的。另外,公司对下个季度的收入增速给出了放...

推荐理由:Nvidia 盘后公布季度营收再创新高,还披露手里攥着 430 亿美元初创公司持仓,等于告诉大家它不光是卖铲子的,还是 AI 生态里最大的金主之一。正文没给出具体营收数字和下季增速预期,所以重要性我会先打个折,但光是 430 亿这个新披露的持仓规模,就足够让关注算力成本和资金流向的人多看两眼。

彭博科技

英伟达上季度每股赚 1.87 美元,超预期,下季度营收指引 910 亿

英伟达刚发了 2026 财年第一季度的财报,每股收益 1.87 美元,比华尔街预期的 1.77 美元高出一截。公司对截至 7 月的当季营收指引是 910 亿美元,也明显高于市场预估的 874 亿左右。这条视频本身是彭博的报道片段,正文没披露各业务线的具体表现和毛利率细节,所以没法判断增长是数据中心业务继续拉动的,还是有别的板块在补位。

推荐理由:Nvidia 财报是观察 AI 基础设施热度的关键节点,910 亿的指引给 HKR 三项都提供了实打实的信号。这不是模型或功能发布,所以放在 featured 档位没问题,信息质量够硬。

AI HOT 精选

英伟达一季度净利润 583 亿美元,同比涨了 211%,数据中心收入占了大头

英伟达 2027 财年第一财季(截止到 2026 年 4 月 26 日)总收入 816.15 亿美元,净利润 583.21 亿美元,同比直接翻了两倍多。增长主要靠数据中心业务,单这一块就进账 752 亿美元,同比涨了 92%。毛利率也拉到了 75% 左右,比去年同期高了 14 个百分点。公司预计下个季度收入能到 910 亿美元,上下浮动 2%。另外,董...

推荐理由:英伟达这份财报就是AI基础设施景气度的温度计。数据中心752亿美元的收入说明大厂还在疯狂囤卡,211%的利润增速比很多AI公司的营收涨得还快。我会先打个折:这是财务数据,不是新模型或新功能发布,所以重要性停在82分。但数字本身已经足够让关注算力成本和供应链的人必须看一眼。

5月20日星期三

FT · 科技

黄仁勋访华期间,中国禁了英伟达的一款游戏显卡

FT 这篇报道的正文被付费墙挡住了,只返回了 403 验证页面,所以具体禁了哪款芯片、禁令范围多大、什么时候生效,正文都没披露。从标题和现有摘要看,事情发生在黄仁勋到访中国的同一时间点,北京想借这个机会给华为、寒武纪这些国产芯片厂商腾空间,让它们在追赶美国对手的路上少点阻力。我会先打个折:信息只来自标题和一段摘要,细节全缺,暂时没法判断这是正式法规、行...

推荐理由:FT 报道中国在黄仁勋访华期间禁了一款 Nvidia 游戏芯片,H 和 R 的钩子很硬,芯片地缘政治的故事天然有传播力。K 这边我会先打个折,因为芯片型号、禁令边界和怎么执行正文都没说,事实层比较薄。