跳到正文

NVIDIA 英伟达

英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力市场的风向。

290 条精选相关主题部署工程行业动态具身智能

最新精选

第 221–240 条 · 共 290 条

5月14日星期四

r/LocalLLaMA

双卡 RTX 3090 跑 Qwen 3.6 27B:48G 显存、26 万上下文窗口,生成速度 113 token/秒

一位 Reddit 用户用两张 RTX 3090 在 Ubuntu 上跑 Qwen 3.6 27B 模型,没上 NVLink。处理长文本时每秒能啃 4000 个 token,生成回答的速度是每秒 113 个 token。这个速度日常聊天或做文档处理都够用。不过帖子正文被 Reddit 的安全策略挡了,看不到具体配置细节,比如用的是哪个量化版本、功耗和温...

推荐理由:我会先打个折:这是单个 Reddit 帖子,没披露量化方式、批处理大小和功耗,复现细节不够。但 HKR 三条都踩中了——配置具体、数字清楚、直击本地推理玩家的痛点,所以给到 featured 的低位。

彭博科技

Anthropic 被曝寻求超 9000 亿美元估值,至少再融 300 亿

彭博社 5 月 13 日的节目里提到,Anthropic 正在寻求至少 300 亿美元的新融资,对应的估值超过 9000 亿美元。这个数字很吓人,但报道没披露具体投资人、交易条款和时间表,所以先别太激动,正文也没说这轮融资到了什么阶段、钱打算怎么花。

推荐理由:Bloomberg 只给了募资规模和目标估值两个数,投资方、条款、时间表一概没提。我会先打个折:没落地的融资消息,数字再大也只是意向。但 9000 亿这个量级本身就是一个信号,说明头部实验室对资金的需求已经膨胀到传统科技 IPO 都未必接得住的程度。正文没披露钱具体要花在哪,这点先别太激动。

5月13日星期三

纽约时报中文网

黄仁勋没在首批名单上,特朗普看到报道后亲自打电话把他拉上了访华专机

白宫周一公布的16人CEO随行名单里没有黄仁勋,这件事在硅谷和华盛顿都引起了议论。特朗普周二上午直接打电话邀请,黄仁勋当晚在阿拉斯加登上了空军一号。他掌管的英伟达是全球市值最高的公司,过去一年一直在游说中美双方,想拿到向中国卖AI芯片的许可。去年夏天特朗普批准卖上一代芯片,但中国政府至今没批任何采购,美国政府内部也有人以国家安全为由反对卖更先进的芯片。

推荐理由:我会先打个折:正文没披露这次访华有没有谈成什么许可,也没说中方怎么回应,所以别急着下结论说英伟达的芯片就能卖了。但这条消息的看点在于时间线——名单公布后才补邀,说明特朗普团队临时决定把英伟达塞进来,很可能就是冲着 AI 芯片出口管制去的。对从业者来说,这比一份正式声明更有信号意义,因为动作本身就在说“这事还在博弈”。

纽约时报中文网

DeepSeek 新模型首次用华为芯片跑推理,训练还得靠英伟达

DeepSeek 上个月发新模型,头一回说推理环节跑在了华为芯片上,但两位半导体业人士透露,训练阶段仍然依赖英伟达芯片,具体怎么拿到的没细说。华为计划今年出训练芯片,同时承认性能追上英伟达现有水平还要再等一年。这件事让中国在 AI 硬件上跟美国进一步脱钩,也印证了黄仁勋之前的警告:出口管制反而逼着中国自建一套技术栈。不过中芯国际量产华为芯片良率低、功耗...

推荐理由:这篇不是模型发布,也没有跑分,所以分数不会冲太高。但信息量够硬——DeepSeek 推理侧开始用华为芯片,训练侧还离不开英伟达,华为自己的训练芯片今年才出来、性能追平还要一年。我会先打个折:正文没给推理优化的具体性能对比或延迟数据,也没说 DeepSeek 在华为芯片上跑了多大并发。不过它把芯片管制这条线拉得很清楚,对关注算力成本和国产替代的人有直接参考价值,84 分放在 featured 里是合适的。

5月11日星期一

量子位 · 公众号

OpenAI 签下 750 兆瓦算力大单,芯片公司 Cerebras 趁势把 IPO 估值抬到 350 亿美元

Cerebras 把 IPO 发行价区间上调到每股 150 到 160 美元,按上限算估值约 350 亿美元。直接推手是 OpenAI 刚签了一份 750 兆瓦的 AI 算力采购协议,交付排到 2028 年。不过原文因为微信环境验证拦截,正文内容没抓到,具体合同金额、交付节奏和 Cerebras 的财务数据都没披露,这个估值能撑多久还得看后续招股书细节。

推荐理由:这条不是普通的 IPO 消息。OpenAI 用 200 亿美元、750 兆瓦的采购协议给 Cerebras 站台,直接把估值推到 350 亿美元,等于在英伟达之外硬开了一条新路。我会先打个折:Cerebras 的芯片主打推理优化,跟英伟达的训练生态还不是一个量级,但 OpenAI 愿意砸真金白银,说明大客户已经在认真找备胎了。正文没披露这笔订单的具体年限和单价,所以 200 亿是总承诺额还是框架上限,这点先别太激动。对看算力成本和供应链安全的人来说,这条值得追。

5月10日星期日

r/LocalLLaMA

NVIDIA 发布 Star Elastic:一个模型文件能直接切出 30B、23B、12B 三种推理模型

NVIDIA 放出了一个叫 Star Elastic 的模型,一个检查点文件里包含了 30B、23B 和 12B 三个尺寸的推理模型,不用额外训练就能直接“切片”取用。具体玩法是让 23B 的子模型负责思考过程,30B 的模型负责给出最终答案。在 AIME-2025、GPQA、LiveCodeBench v5 和 MMLU-Pro 这几个测试集上,这种...

推荐理由:我会先打个折:这还是个研究发布,不是大规模验证过的产品,影响力肯定比不上一个全新旗舰模型。但它的机制很具体——一个检查点通过“零样本切片”就能变出不同大小的推理模型,而且 23B 负责思考、30B 负责回答这种分工方式,在 AIME-2025 上确实跑出了 16% 的准确率提升和 1.9 倍延迟降低。对正在折腾推理部署的人来说,这种“一份权重、多种用法、精度可选”的思路,直接打中了成本和延迟的痛点,所以放在 featured 里是合适的。

5月9日星期六

TechCrunch · AI

英伟达今年已承诺 400 亿美元做 AI 股权投资

英伟达继续在 AI 圈大笔撒钱。根据 CNBC 和 FactSet 的数据,2026 年才过了几个月,它已经承诺了超过 400 亿美元的股权投资。最大一笔是给 OpenAI 的 300 亿,剩下的分布在七笔对上市公司的数十亿美元级投资,以及大约二十多轮对未上市初创公司的参投里。最近的两笔包括给玻璃制造商康宁最多 32 亿、给数据中心运营商 IREN 最...

推荐理由:HKR 三项都成立:400 亿这个半年数字冲击力强,300 亿流向 OpenAI 和约 24 笔交易都是硬信息。它不是模型发布或产品更新,而是资本结构信号,所以放在 78–84 这个区间合理。正文没披露这些投资的条款细节,比如是现金、芯片折价还是云额度,这点先别太激动。

新智元 · 公众号

英伟达、AMD、英特尔罕见联手,给 RadixArk 投了 1 亿美元种子轮

RadixArk 在 5 月 5 号宣布拿了 1 亿美元种子轮,投后估值 4 亿美元。领投的是 Accel,Spark Capital 跟投,更少见的是英伟达、AMD、英特尔这三家芯片厂同时出现在投资人名单里,联发科和 Databricks 也参与了。正文因为微信环境验证没抓到具体内容,没法展开说他们到底做什么、钱怎么花,但光看这个阵容,大概率是跟 A...

推荐理由:这条消息的硬核在于钱和站队:1亿美元种子轮、4亿美元投后估值,英伟达、AMD、英特尔三家芯片厂同时出现在投资人名单里,这在AI基础设施赛道不常见。我会先打个折——正文没披露产品性能基准、客户验证或开源项目的实际采用数据,所以目前只能当一笔高关注度的融资来看。对从业者来说,看点不是金额本身,而是三家互相竞争的芯片厂为什么愿意一起押注推理优化,这背后可能指向算力成本、模型部署效率的痛点。信息缺口也很明显:没写团队背景、技术路线和落地案例,后续如果有产品实测或客户名单,价值会更高。

机器之心 · 公众号

港科大和社区开源了 StarVLA,一个框架把主流视觉-语言-动作模型串了起来

StarVLA 把 VLA(视觉-语言-动作模型)里常用的主干网络、动作输出头、训练策略和评测接口都做成了可插拔的模块,不用再为不同论文各搭一套代码。仓库在 GitHub 上已经拿到 2.2k 星,支持的基准包括 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 和 BEHAVIOR-1K。正文没披露具体训练成本和...

推荐理由:我会先打个折:StarVLA 目前是框架级发布,不是新模型,所以权重不会给到模型首发那么高。但它的价值很实在——把多种 VLA 架构塞进同一套接口,训练和评估不用再东拼西凑,2.2k star 说明社区已经用脚投票了。正文没披露框架内各方法的横向对比数据,这点先别太激动,但统一工具这件事本身对机器人方向的工程效率提升是实打实的。

r/LocalLLaMA

单张 RTX 4090 跑 Qwen3.6-27B,262K 上下文冲到 80+ t/s

indrasmirror 用一张 RTX 4090 跑 Qwen3.6-27B-Heretic-v2,上下文拉到 262K token,搭配 TBQ4_0 格式的 KV 缓存和 MTP 推测解码(draft 3),生成速度从约 43 t/s 提到 80-87 t/s。MTP 草稿接受率大概 73%,说明模型对草稿的采纳比例不低,这是提速的关键。帖子正文...

推荐理由:这是一次有实测数据的单卡推理优化记录,不是产品发布,但 H/K/R 三项都站得住。262K 上下文、80+ t/s 的 27B 模型跑在消费级显卡上,对本地部署圈子的吸引力很强。正文给了具体配置和前后对比数字,可复现性不错。扣分点在于来源只有 Reddit 帖子,且场景偏小众本地推理,所以放在 featured 档、77 分是合适的,不用再往上拔。

5月8日星期五

机器之心 · 公众号

英伟达和普渡大学用 agent 闭环做文生 3D 场景,让模型自己检查、自己改

这篇是 ICLR 2026 的论文,讲的是英伟达 Cosmos Lab 和普渡大学搞的 Scenethesis 框架。它让语言和视觉模型组成一个 agent 闭环,根据文字描述生成 3D 场景。流程里加了视觉定位、基于 SDF 的物理约束,还有一个裁判模块来挑错。实验数据是:首次生成成功率约 72%,模型自己检查修正后能拉到 91%,碰撞率从 6.1%...

推荐理由:我会先打个折:正文没披露 72% 和 91% 是在什么数据集上跑的,也没说 judge 模块本身会不会出错,所以这个自检提升幅度先别太激动。但思路本身挺实在——让 agent 自己生成、自己检查、自己修,相当于给文生 3D 加了个质检闭环。SDF 物理约束这个点也值得留意,它不是纯靠视觉打分,而是用几何和物理规则卡了一道,理论上能减少穿模和浮空这种低级错误。对做机器人仿真和 3D 资产管线的人来说,如果这套流程真能稳定跑通,省下来的手工修场景的时间会很可观。

彭博科技

美国怀疑有人经泰国把英伟达芯片走私给阿里

彭博社引述知情人士说,美国怀疑一家跟泰国国家 AI 项目有关联的公司,帮忙把价值数十亿美元的超微服务器(里面装着受管制的英伟达高端芯片)走私到了中国,阿里巴巴是多个最终客户之一。报道没披露这批芯片的具体型号和数量,也没说明阿里是否知情。目前信息都来自匿名消息源,官方还没公开指控,先别急着下结论。

推荐理由:Bloomberg 这篇报道给出了一个具体的走私路径、金额量级和阿里这个终端客户名字,所以 H、K、R 都站得住。但全文只是美国单方面的怀疑,没有执法结果,也没有其他信源交叉印证,所以分数没给到 P1。我会先打个折,这点先别太激动。

彭博科技

英伟达计划向数据中心公司 IREN 投资最多 21 亿美元,联手建 AI 基础设施

英伟达和 IREN 签了份 AI 基础设施合作协议,英伟达会投进最多 21 亿美元。这笔钱用来一起建 AI 数据中心,但公告没写具体占多少股份、分几期付款,也没提建成后能增加多少算力。

推荐理由:彭博信源加上英伟达最高 21 亿美元的投资,HKR 三项都站得住。信息只到金额和合作方向,没给股权、付款和容量细节,所以停在 featured 档。

NVIDIA 博客

美国能源部长与英伟达谈 Genesis 任务:用 AI 给电网审批提速,从几年缩到几周

美国能源部和英伟达要在阿贡国家实验室建两台 AI 超算。小的一台叫 Equinox,用 10,000 块 Grace Blackwell GPU;大的一台叫 Solstice,计划上 100,000 块还没发布的 Vera Rubin GPU。英伟达的 Ian Buck 说 Solstice 的算力能干到 5,000 exaflops,这个数字听听就好...

推荐理由:HKR 三项都踩实了:GPU 型号和数量是硬信息,DOE 与 NVIDIA 的角色分工清楚,电网瓶颈那段把 AI 的落地价值讲得很具体。不过来源是 NVIDIA 官方博客,信息偏单向,所以放在 featured 而不是 must-write 的档位,82 分在这个区间里是合理的。

5月7日星期四

r/LocalLLaMA

Atlas 推理引擎开源,在 DGX Spark 上跑 Qwen3.6-35B-FP8 能稳定跑到每秒 100 多个 token

Avarok 把 Atlas 推理引擎开源了。它用 Rust 和 CUDA 写成,镜像只有约 2.5GB,冷启动不到两分钟。在一台 DGX Spark 上跑 Qwen3.5-35B,实测持续速度约 111 tok/s,作者说比 vLLM 快 3.0 到 3.3 倍。引擎专门为 Blackwell SM120/121 写了内核,支持 NVFP4、FP8 ...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,基准测试也没被第三方复现,所以分数压在了 featured 低位。但这条确实有料——开源推理引擎 Atlas 在 DGX Spark 上跑 Qwen3.5-35B 持续 111 tok/s,镜像才 2.5GB,冷启动不到两分钟,作者说测试时是 vLLM 的 3.0–3.3 倍。真正值得盯的是 Blackwell SM120/121 手写内核、NVFP4/FP8 和 MTP 解码这些底层优化,不是简单套壳。速度、体积、启动时间三个数字都给了,信息密度够,对想本地部署大模型的人有直接参考价值。

5月6日星期三

r/LocalLLaMA

单张 RTX 5090 跑通 Qwen3.6 27B:NVFP4 量化加 MTP 投机解码,200k 上下文实测 73.6 tok/s

一位 Reddit 用户在单张 32GB 显存的 RTX 5090 上,用 vLLM 跑通了 Qwen3.6 27B 的 NVFP4 量化版,并验证了 200k 上下文长度。配置上用了 fp8_e4m3 的 KV 缓存、FlashInfer 和 3 个投机 token 的 MTP。10 次 200k 上下文跑分平均生成速度 73.6 tok/s,首 t...

推荐理由:我会先打个折:来源是 Reddit 用户自测,不是官方报告,但配置和日志都贴出来了,可复现性不低。真正值得盯的是显存边界——KV 缓存占了 8.3GiB,整卡吃到约 30478MiB,几乎榨干 32GB。这说明 NVFP4 量化确实把 27B 模型压进了消费级显卡,而且 200k 上下文不是摆设,十次都跑稳了。不过 TTFT 70 秒意味着首 token 要等一分多钟,实际用起来体验会打折扣。这点先别太激动,等更多卡型验证。

NVIDIA 博客

NVIDIA 给 Spectrum-X 以太网加了多路径 RDMA,让超大规模 GPU 集群的流量不再堵在一条路上

NVIDIA 在 Spectrum-X 以太网平台上新增了 MRC(多路径 RDMA)支持,允许一个 RDMA 连接把流量分散到多条网络路径上,而不是死绑一条。这项技术已经在 Blackwell 集群里跑起来了,硬件层面能做到微秒级故障绕行和重路由。MRC 走的是 OCP 开放规范,支持多平面组网,目标是把集群规模推到几十万张 GPU。不过博客没给出具...

推荐理由:我会先打个折:这是英伟达自己的产品稿,不是第三方评测。MRC 把一条 RDMA 流拆到多条物理路径上跑,微秒级检测断连并硬件重路由,正文说已经在 Blackwell 部署里用了。这点先别太激动,因为没给第三方验证数据。真正值得看的是他们把这套东西推到 OCP 开放规范,配合多平面网络,目标是撑住几十万卡级别的训练集群——如果真能落地,对大规模训练的网络成本会有实打实的影响。

TechCrunch · AI

SAP 花 11.6 亿美元买下一家成立仅 18 个月的德国 AI 实验室,并指定客户只能用 Nvidia NemoClaw 等少数几款工具

SAP 计划收购德国 AI 初创公司 Prior Labs,交易金额 11.6 亿美元。这家公司才成立一年半,正文没披露它具体做什么技术、有多少人、之前融了多少钱。同时,SAP 还限制了客户在业务流程里跑 AI 模型(也就是让模型进业务流程干活的 agent)时的选项,只允许用 Nvidia 的 NemoClaw 等少数几个。文章没说明这笔收购什么时候...

推荐理由:我会先打个折:正文没披露价格结构、交割时间和技术细节,所以没法判断这笔钱到底值不值。但 SAP 对一家 18 个月大的实验室押注 11.6 亿美元,同时把客户能用的智能体限制到 Nvidia NemoClaw 等少数选项,这两件事放在一起看,信号很明确——SAP 在加速收拢 AI 能力,也在收紧生态入口。对从业者来说,收购本身是新闻,但更值得盯的是后续客户侧的工具锁死和整合节奏。

NVIDIA 博客

NVIDIA 和 ServiceNow 搞了个企业桌面 AI 代理,叫 Project Arc

两家公司把合作又推了一步,这次是让 AI 代理直接在你的电脑桌面上干活。这个叫 Project Arc 的东西,通过 Action Fabric 连接企业软件,再用 OpenShell 建一个带权限管控的沙盒环境来执行操作,防止乱来。文章里还提了一嘴 Blackwell 芯片的能效:每瓦输出的 token 数是上一代 Hopper 的 50 多倍,每百...

推荐理由:我会先打个折:这就是两家大厂合作发了个桌面 agent 产品,正文没披露实际客户和上线时间,别当成立竿见影的东西。但里面几个信息值得看——Action Fabric 负责把 agent 接进 ServiceNow 的业务流程,OpenShell 在沙箱里跑任务,权限和策略都框死了,不是裸奔。Blackwell 的能效数字挺夸张,每瓦 token 数是 Hopper 的 50 倍以上,百万 token 成本低了近 35 倍,如果实测能兑现,跑企业 agent 的算力账单会好看很多。这点先别太激动,毕竟还是纸面数据。整体属于有机制、有经济账、但缺实证的...

5月5日星期二

机器之心 · 公众号

马斯克 55 万张英伟达 GPU 的集群,实际有效利用率只有 11%

The Information 的报道说,xAI 手里大概 55 万张英伟达 GPU,但模型浮点运算利用率(MFU)只有 11%,折算下来相当于真正在干活的卡就 6 万张左右。文章把锅甩给了 HBM 显存读写、服务器之间通信、训练时空等和软件栈不统一这几个问题。作为对比,Meta 的利用率是 43%,Google 是 46%。不过原文因为微信环境验证失...

推荐理由:这篇不是模型发布或产品更新,是实打实的基础设施效率爆料。55万卡对11%利用率这个对比本身就够抓人,再加上Meta和Google的43%、46%做参照,信息密度高。我会先打个折:正文没披露xAI具体怎么算的MFU,也没说这个11%是瞬时值还是长期均值,但瓶颈拆解(HBM、跨节点通信、软件栈)让文章站得住脚,所以给到82分。