跳到正文

NVIDIA 英伟达

英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力市场的风向。

290 条精选相关主题部署工程行业动态具身智能

最新精选

第 141–160 条 · 共 290 条

6月6日星期六

r/LocalLLaMA

开源模型这周炸了:25+ 个开放权重模型一口气放出,覆盖文本、图像、语音

Victor M 在 X 上整理了一份清单,过去一周有超过 25 个开放权重的模型发布,几乎覆盖了所有模态。其中最扎眼的是 NVIDIA 的 Nemotron 3 Ultra,一个 550B 参数的混合架构(Mamba-MoE),每次推理只激活 55B 参数,上下文窗口能塞进 100 万个 token。不过正文被 Reddit 的安全策略拦住了,具体还...

推荐理由:我会先打个折:消息源是 X 上的个人整理,Reddit 原文还被安全策略拦了,具体细节没法交叉验证。但一周 25+ 个开放权重模型这个密度本身就值得关注,NVIDIA 那个 550B 的 Nemotron 用 Mamba-MoE 架构,激活参数只有 55B,上下文能塞 100 万 token,如果实测靠谱,推理成本会省不少。这点先别太激动,等完整评测出来再说。

r/LocalLLaMA

在笔记本 RTX 4060 8GB 上跑 Qwen3.6-35B-A3B 的实测:一个参数改动让速度从 11 跳到 43 tok/s,投机解码再提 26%

一位 Reddit 用户在自己的笔记本(RTX 4060 8GB 显存)上跑了 Qwen3.6-35B-A3B 这个混合专家模型。他试下来发现,加上 --no-mmap 这个启动参数后,生成速度直接从大约 11 tok/s 飙到 43 tok/s,翻了近四倍。另外他还用了一个叫投机解码的技巧,拿更小的 Qwen3.5-0.8B 当“草稿模型”先快速出初...

推荐理由:HKR 三项都站得住:笔记本跑 35B 模型是个很直观的 hook,速度提升的数字是硬干货,而且本地部署圈对这类省钱省显存的技巧天然有共鸣。信息来源是 Reddit 单帖,不是正式评测,所以分数没往上拉。

6月5日星期五

AI HOT 精选

苹果内部把新版 Siri 标成“Beta”,不会当成品来宣传

彭博社记者古尔曼爆料,苹果内部将新版 Siri 标记为“Beta 版”,意味着它不会被宣传成完全成熟的产品。苹果可能还会像当初推 Apple Intelligence 那样,给想尝鲜的用户设一个等待名单。另外,iOS 27 的部分 Siri 请求会转到 Google Cloud,调用授权版 Gemini 模型,并跑在谷歌的英伟达 Blackwell B...

推荐理由:HKR 三项都成立:Siri 标 Beta 是苹果自己的态度信号,Gemini 和 B200 的细节让爆料有料,苹果 AI 依赖外部算力和模型这件事本身就容易引发讨论。分数定在 82 合理,因为毕竟还是未发布产品的二手报道,不是官方发布或重大产品事件。

6月4日星期四

r/LocalLLaMA

英伟达放出 Nemotron-3-Ultra 超大 MoE 模型,550B 总参数但只激活 55B,最低要 8 张 H200 才能跑

英伟达在 Hugging Face 上发布了 Nemotron-3-Ultra-550B-A55B-BF16,一个混合专家(MoE)模型。总参数量 550B,但每次推理只激活其中 55B 参数,相当于用 55B 模型的算力去撬动大得多的知识容量。上下文窗口拉到 1M token,能一口气处理很长的文档。硬件门槛不低,官方列的最低配置是 8 张 H200...

推荐理由:这条消息干货集中在规模和硬件门槛上:550B 总参数、55B 激活、100 万 token 上下文,最低 8×H200 或 16×H100。我会先打个折——正文没给任何基准测试分数、许可证细节和具体开放时间,所以没法判断实际效果和可用性。亮点是硬件要求本身就是一个筛选器,能直接筛出一批会认真评估的人。缺点也明显:没有性能数据,光看参数和上下文长度,只能说明“理论上能处理很长的内容”,但不知道推理质量怎么样。这点先别太激动。整体属于有信息量但缺验证的发布,适合放进 featured 提醒大家关注后续评测。

量子位 · 公众号

CVPR 2026 上,小鹏给英伟达、特斯拉和 Waymo 讲了一遍自己的物理 AI 技术栈

小鹏在 CVPR 2026 上公开了他们的世界模型技术栈,包含 X-World、X-Foresight 和 X-Cache 三个部分。X-Cache 能砍掉约 70% 的重复计算,相当于让模型推理时少做无用功。第二代 VLA 模型用了超过 4 万亿个 token 训练,这个量级说明训练数据投入很大。车端推理延迟压到了 80 毫秒,对实时驾驶决策来说这个...

推荐理由:我会先打个折,这毕竟是小鹏在顶会上的技术展示,不是独立验证过的第三方评测,所以分数没给到 85 以上。但选题确实抓人:CVPR 舞台上让北美自动驾驶三巨头听一家中国公司讲物理 AI,本身就制造了对比。信息量也够,X-Cache 的七成重复计算缩减、4 万亿 token 的训练规模、80 毫秒的车端延迟,都是能直接拿来讨论的指标。正文没披露 X-Cache 具体在什么场景下测出这个节省比例,也没说 80 毫秒是平均还是 P99,这点先别太激动。整体看,对做自动驾驶和端侧模型的人有参考价值,也踩中了中美技术竞争的神经,所以放在 featured 位置。

6月3日星期三

NVIDIA 博客

NVIDIA 在 CVPR 发了三篇物理 AI 论文:抓取、自动驾驶和游戏里练出来的智能体

这三篇论文都进了 CVPR。GraspGen-X 用 20 亿次模拟抓取训练,让机械手能处理没见过的物体,但正文没披露真实世界的抓取成功率。LCDrive 把自动驾驶的推理 token 砍了大约一半,靠的是让模型直接输出轨迹而不是先写文字再转成动作,延迟更低,不过没提极端场景下的安全性验证。NitroGen 在 1000 多个游戏里跑了 4 万小时的交...

推荐理由:NVIDIA 在 CVPR 放出的三篇论文,每篇都带着实打实的数字:GraspGen-X 用 20 亿次模拟抓取训练机械手,LCDrive 把自动驾驶模型的推理 token 砍掉一半,NitroGen 在 1000 多款游戏里攒了 4 万小时交互数据来训游戏 agent。我会先打个折——这是厂商研究打包发布,不是新模型或产品上线,所以重要性停在 78 分。但信息密度够高,对做机器人、自动驾驶和游戏 agent 的人有直接参考价值,尤其是用合成数据替代真实采集、降低推理延迟这两条思路,正文没披露具体硬件环境和延迟数字,这点先别太激动。

AI HOT 精选

NVIDIA 发布 NemoClaw 蓝图,让工业软件能跑通自主 AI 工程师

NVIDIA 在 COMPUTEX 上放出了一个叫 NemoClaw 的开放蓝图,专门用来构建能长时间自主干活的 AI 智能体。十几家工业软件厂商已经用它来打造“自主 AI 工程师”,主要用在 CAE 仿真和 EDA 芯片设计流程里。按官方说法,以前要跑好几周的仿真和设计任务,现在能压缩到几小时内完成。不过正文没给出具体的测试基准、客户实测数据或错误率...

推荐理由:我会先打个折:这是 NVIDIA 官方博客发的,没有第三方验证,技术细节也基本没给。但它的核心信息够硬——NemoClaw 这个新平台专门瞄准 CAE 和 EDA 场景,让模型像工程师一样自主跑仿真和设计任务,而且已经拉了十多家工业软件厂商在用了。它抛出的“数周变数小时”虽然没讲清楚是怎么算出来的,但哪怕打个对折,对工业仿真这种重计算场景也是实打实的吸引力。这点先别太激动,正文没披露具体架构、模型规模和实测对比,后续得看有没有论文或客户案例放出来。

NVIDIA 博客

英伟达和微软搞了一套统一方案,让 AI 能在 Windows 电脑、云端和本地服务器之间来回跑

微软 Build 大会上,两家宣布把 AI 部署的底层打通了。简单说,就是同一个 AI 应用,既能在你笔记本的 RTX 显卡上跑,也能无缝切到 Azure 云或者公司本地的 DGX 工作站上,不用重写代码。现场还亮了两款新硬件:RTX Spark 是个小盒子,能提供 1 petaflop 的 AI 算力(大概相当于每秒一千万亿次计算);DGX Stat...

推荐理由:HKR 三项都过了。NVIDIA 和微软这次合作,把 agent 部署从 Windows 到 Azure 再到本地串成一条线,还亮出了 1 petaflop 和 20 petaflops FP4 两个硬件规格,对从业者来说有信息增量。不过消息源是厂商自己,正文没给定价、跑分和迁移细节,所以分数没往上拉。

6月2日星期二

Ben's Bites

Claude Opus 4.8 发布,Claude Code 学会写脚本派子任务并行干活

Anthropic 发了新模型 Claude Opus 4.8,主要卖点是 Claude Code 现在能先写一个调度脚本,再同时拉起多个子代理并行处理复杂任务。不过有开发者提醒,这并不证明松散的 multi-agent 架构靠谱,反而是围绕小代理循环的确定性工作流更稳。模型本身被 Simon Willison 评价为“温和但有用的升级”,更诚实、更少...

推荐理由:HKR 三项都成立,因为这是一次有实质内容的 Anthropic/Claude 发布和 Claude Code 代理更新。文章没给基准测试、定价和上下文窗口数据,所以分数压在 85–94 这个区间。

r/LocalLLaMA

NVIDIA 在 Hugging Face 上放出 Cosmos 3 世界模型,能同时吃文字、图片、视频并生成视频、音频和动作指令

NVIDIA 把 Cosmos 3 系列模型挂上了 Hugging Face,这次发了两个尺寸:Nano 版 160 亿参数,Super 版 640 亿参数。它是个全模态世界模型,输入可以混着来——文字、图片、视频甚至动作轨迹都行,输出也不止视频,还能直接吐图片、音频和下一步的动作指令。不过 Reddit 原帖的正文被网络策略挡了,实际跑起来的硬件门槛...

推荐理由:我会先打个折:正文没披露 benchmark 分数、许可证和训练细节,所以不能直接断定它比现有方案强。但 NVIDIA 把 16B 和 64B 两个规格的世界模型公开放在 HF 上,这件事本身就值得从业者看一眼——至少多了一个能本地跑、能接动作输出的多模态基座选项。对做机器人仿真和视频生成的人来说,输入支持动作轨迹、输出能直接给动作指令,说明它不只是生成漂亮画面,而是想往物理交互方向靠。这点先别太激动,因为没看到在真实机器人任务上的验证,但方向对,且开源降低了试错成本。

量子位 · 公众号

老黄带着英伟达 CPU 杀进 PC 赛道

英伟达要在今年秋天把一台叫 RTX Spark 的 Windows 电脑推向市场。这台机器把一块 Blackwell 架构的 RTX 显卡和一颗 20 核 Arm 架构的 Grace CPU 焊在一起,通过 NVLink-C2C 高速互联,共享 128GB 统一内存。官方给出的 AI 算力是 1 petaflop,号称能在本地跑起 1200 亿参数、上...

推荐理由:英伟达把RTX Spark搬进Windows PC,不是发新模型,而是给开发者一台能本地跑120B模型的机器。1 petaflop算力和128GB统一内存这些数字,说明它想解决本地跑大模型内存不够、上下文装不下的痛点。对从业者来说,这意味着可以省掉一部分云端推理成本,延迟也更可控。不过正文没提具体功耗和价格,实际性价比还得等上市再看。整体是硬件产品更新,不是基础模型发布,所以分数落在78到84之间。

纽约时报中文网

报告称中国军方过去六年一直在公开招标中指名要英伟达芯片

Wirescreen 翻查了 2019 到 2025 年的 3800 份采购记录,发现超过 500 次中国军方单位直接点名或按规格要求采购英伟达 A100、A800、H100、H800 等芯片。这些招标涉及核爆模拟、网络攻击和兵棋推演,但文件只记录了供应商承诺供货,没写最终有没有交付。英伟达反驳说军方要的量远低于训练大模型所需的十万颗级别,而且招标里也...

推荐理由:HKR 三项都成立:NYT 和 Wirescreen 拿到的记录集给军方对英伟达芯片的需求加了硬数字。正文没确认最终交付,所以这事还不到新政策动作或公司公开声明的级别。

纽约时报中文网

中国一家公司正尝试用 AI 预测谁会变成异见者,但美国芯片限制可能拖慢了进度

范德比尔特大学的研究人员翻看了 10 万份泄露的公司文件,发现一家叫积至的中国公司正在开发一套 AI 系统,想通过分析电信数据、社交媒体和位置信息,在一个人还没公开表达不满之前就判断他未来会不会批评政府。这听起来像《少数派报告》里的情节,但文件显示,这套预测技术目前还停留在研究阶段,美国官员也说没有证据表明它已经定型或实际部署。积至的团队在 2024 ...

推荐理由:这篇报道把 AI 监控从猜测推到有文件佐证的层面,10 万份泄露材料让讨论不再是空对空。我会先打个折:正文没披露模型效果、误报率、是否真的跑通了,美方也说没证据显示已定型或部署,所以别急着当成已落地的系统。但选题本身够重,安全、治理、芯片供应链伦理全搅在一起,从业者很难绕开。

Latent Space

英伟达连发三弹:Cosmos 3 世界模型、Nemotron 3 Ultra 大模型,还有一台叫 Spark 的个人超算

英伟达在台北电脑展上放出了一波开源模型和硬件。Cosmos 3 是一个能同时处理文字、图片、视频、音频和动作的“世界模型”,用了混合 Transformer 架构,把负责推理和负责生成的两个模块拼在一起。它分 Nano(16B)和 Super(64B)两个尺寸,其中 Super 微调后的文生图和图生视频能力,在开放权重模型里直接冲到了第一。Nemotr...

推荐理由:这次发布把视觉世界模型、大语言模型和本地推理硬件捆在一起推,信息密度高。Cosmos 3 的 MoT 架构和两个具体尺寸(16B/64B)给了明确的技术锚点,Nemotron 3 Ultra 的 550B-A55B 开放权重对想自己部署大模型的人是个实在消息。不过正文没给出具体 benchmark 对比或价格,实际效果和性价比还得等上手。整体影响面广,但还没到前沿实验室发新基础模型那种震动级别。

彭博科技

彭博:至少七所中国高校替军方找英伟达 H200 芯片

彭博这条视频报道说,至少七所支持中国军队和国防工业的高校正在想办法搞到英伟达 H200 芯片。正文没披露具体采购渠道、数量,也没说美国出口许可那边是怎么处理的。

推荐理由:Bloomberg 给出了“至少 7 所”这个可引用的新事实,让传闻落了地。但正文没披露怎么买、买多少、美国批没批,所以信息增量有限,只能给到 74 分 featured 这一档。

TechCrunch · AI

英伟达联手微软、戴尔和惠普,想用 AI 代理 PC 抢 2000 亿美元 CPU 市场的蛋糕

英伟达要把 AI 代理(能自主干活的软件助手)装进消费级 PC,合作方是微软、戴尔和惠普。他们瞄准的是价值 2000 亿美元的 CPU 市场。不过正文没披露具体配置、价格、上市时间,也没说怎么保证这些代理在个人电脑上安全运行不出乱子。如果真解决了易用、安全和实用这三个问题,这事儿确实不小,但现在只能先打个折看。

推荐理由:我会先打个折:正文没给任何规格、价格或上市时间,所以这更像一次生态站队宣示,不是产品发布。但“2000亿美元市场”这个钩子和微软/戴尔/惠普三家站台,足够让它进featured的低位。对从业者来说,知道Nvidia拉着OEM三巨头在铺AI agent PC的局就够了,具体能跑什么模型、卖多少钱,现在还没法判断。

彭博科技

至少七所中国军工背景高校在采购记录中求购英伟达 H200 芯片

彭博翻了一批采购记录,发现至少七所跟中国军方和国防工业有联系的大学在求购英伟达 H200 芯片。H200 是英伟达目前性能很靠前的一块 AI 训练/推理卡,美国对它出口中国有管制。报道没写这些采购最终有没有成交、通过什么渠道拿货、数量有多少,只是点出了“有人在要”这个事实。我会先打个折:有采购意向不等于已经到手,也不等于直接用于武器研发,但信号很明显—...

推荐理由:我会先打个折:正文说的是“寻求采购”,不是确认成交或政策变动,所以别直接当成芯片已经到手。但 Bloomberg 拿采购记录说话,列出至少 7 所有军方联系的高校在盯 H200,这比泛泛而谈的“可能流向军方”硬得多。对从业者来说,这条消息的价值在于把出口管制下的算力焦虑具象化了——谁在想办法囤卡、用什么渠道、盯的是哪款型号,都摆出来了。信息缺口也很明显:没披露这些采购请求最终有没有获批、实际交付了多少,这点先别太激动。

AI HOT 精选

NVIDIA Cosmos 3 在开放权重模型里拿了图像和视频生成双料第一

NVIDIA 的 Cosmos 3 在 Artificial Analysis 的开放权重榜单上,文本生图和图片转视频两项都排到了第一。它用了一种叫 Mixture-of-Transformers 的架构,把自回归推理器和扩散生成器拼在一起,有 16B 参数的 Nano 版和 64B 参数的 Super 版。Super 版在两项任务上分别超过了 HiD...

推荐理由:Cosmos 3 在 Artificial Analysis 的开放权重榜上把图像和视频生成的头名都拿了,我会先打个折——这只是单一基准的排名,不代表实际场景一定最强。但亮点在于它直接给了 16B 和 64B 两个尺寸,而且权重、代码、数据、微调方案全开源,这点对想自己训模型的人挺实在。正文没披露训练成本和推理延迟,所以别急着下“省钱”的结论。整体看,这条消息对关注开源多模态竞争的从业者有参考价值,放在 featured 档合适。

6月1日星期一

Latent Space

视频智能体是下一个方向:Ethan He 谈 xAI Grok Imagine 的三个月从零到一

Ethan He 在 NVIDIA 做完 Cosmos 世界模型后跳到了 xAI,带着一个小团队三个月就做出了 Grok Imagine。他有个很直接的观点:视频模型现在的智能主要来自语言模型,不是靠堆视频数据训练出来的。下一个 Sora 级别的突破不会是更好的视频生成模型,而是能规划、生成、修改、反复打磨一个完整创意任务的视频智能体。这期播客聊了从零...

推荐理由:我会先打个折:这篇是访谈级别的信号,不是论文或产品发布。它给了“三个月小团队从零搭建”这个事实,也点出了视频 Agent、音视频对齐和推理加速这几个方向,但正文没披露任何基准分数、具体成本数字或可复现的测试方法。所以它更像一份来自 xAI 内部的路线图预告,能帮你判断他们在往哪使劲,但暂时没法拿来做技术选型。对关注视频模型和多模态 Agent 的人来说值得扫一眼,别当结论用。

AI HOT 精选

NVIDIA 开源 Cosmos 3:一个模型搞定物理世界的看、想、动

NVIDIA 在 GTC Taipei 把 Cosmos 3 完全开源了,模型权重、代码和数据集都放了出来。它被叫做首个物理 AI 全能模型,意思是能直接看懂真实世界、预测接下来会发生什么,并给出机器人该做的动作。这次发了两个尺寸:Super 版 320 亿参数,Nano 版 80 亿参数。正文没提具体跑分和硬件门槛,实际部署成本还得自己测。

推荐理由:HKR 三项都成立:钩子是 NVIDIA 开源物理 AI 模型,知识增量是 32B/8B 双版本加全套开放物料,受众是机器人、仿真方向的从业者。正文信息很薄,没给基准测试、没提许可证细节,所以分数压在 78–84 区间,不往上拔。