跳到正文

NVIDIA 英伟达

英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力市场的风向。

290 条精选相关主题部署工程行业动态具身智能

最新精选

第 101–120 条 · 共 290 条

7月24日星期五

TechCrunch · AI

AMD 发布 Helios 整机柜 AI 系统,正面叫板英伟达

AMD 在 Advancing AI 大会上掏出了 Helios,一个直接对标英伟达 Vera Rubin 的整机柜系统,专门用来训练和跑最前沿的大模型。CEO 苏姿丰说这是目前业界性能最高的 AI 机柜,微软是首批客户之一,今年晚些时候开始发货。从现场公布的跑分看,Helios 在好几项指标上都压过了英伟达的 Vera Rubin,看起来确实有得一拼...

推荐理由:AMD 发布 Helios 整机柜系统,直接挑战英伟达 Vera Rubin,微软是第一个公开客户,今年晚些时候发货。现场跑分显示 Helios 在几项指标上压过对手,但这些都是 AMD 自己测的,没有第三方验证,实际表现还得等货到了再说。分数维持在 78 分,因为目前只有 AMD 一方的数字,真实世界表现和交付能力还是未知数。

7月23日星期四

r/LocalLLaMA

用 20 美元的 USB 转网口线,把两台电脑的 3 张 4060 拼起来跑 39.7GB 模型,速度 30 token/秒

一位 Reddit 用户用一根普通网线直连两台电脑,成功跑起了 39.7GB 的 laguna Q2_K_XL 模型。一台插两张 RTX 4060,另一台插一张,总共三张卡。网络峰值流量只有 30-70 MB/s,没用到昂贵的交换机或高速网卡。在 11k token 的提示词下,ubatch 设为 768 时生成速度达到 28.28 token/秒。作...

推荐理由:一个低成本多节点推理的实测案例:三张 RTX 4060 通过 20 美元的 USB 转以太网跑 39.7GB 模型,速度到 28-30 token/秒,直接挑战“高速网络是刚需”的假设。三点全中,但本质是社区验证而非产品发布,我会先打个折——信息量扎实,不过正文没披露延迟抖动和更长上下文下的稳定性,这点先别太激动。

7月20日星期一

AI HOT 精选

NVIDIA 开源 Cosmos 3 Edge:一个 40 亿参数的机器人世界模型,能在边缘设备上实时推理并生成动作

NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,把场景理解和动作生成合在了一起。它能在 Jetson Thor 上以 15Hz 的频率实时跑,一次推理输出 32 个机器人动作。模型用了两套 Transformer 架构:一套自回归模型负责推理,一套扩散模型负责预测,中间共享注意力层来对齐信...

推荐理由:NVIDIA 把一个 4B 的世界模型开源了,而且明确能在 Jetson Thor 上 15Hz 实时跑,一次推理给 32 个动作,这对边缘机器人来说门槛很低。双 Transformer 架构(自回归推理 + 扩散预测)共享注意力层,设计上挺聪明,但正文没给出这套架构相比纯自回归或纯扩散的具体消融实验数据,实际增益有多大还得等第三方验证。另外,模型只在 NVIDIA 自家硬件上报了性能,跨平台表现和不同机器人形态的泛化能力都没提,这点先别太激动。整体看,实用性和时效性都够,但缺独立基准测试,所以分数没给更高。

AI HOT 精选

黄仁勋东京之行敲定三件事:日本主权 AI 工厂、机器人联盟和芯片材料供应

黄仁勋 7 月 15 到 16 号在东京见了一圈日本产业界的人,带走了三份框架协议。最核心的是 Noetra 项目:政府拉上软银、索尼、NEC、本田等 44 家本土公司,五年内砸 1 万亿日元(约 62 亿美元),要自己搞一套给机器人、汽车和工厂产线用的 AI,不想把命脉交给美国或中国的模型。同时,Nvidia 跟发那科、安川电机等机器人厂商组了个 C...

推荐理由:黄仁勋这趟东京行带回了三份实打实的框架协议,Noetra 项目 62 亿美元、44 家本土公司入局,主权物理 AI 的架势拉得很足。H、K、R 三个维度都踩中了:新闻性够强,知识增量明显,对从业者的实际影响也直接。没给更高分是因为现在还停留在框架协议阶段,钱和公司名单有了,但具体执行时间表和模型能力都没披露,先打个折观望一下。

7月17日星期五

AI HOT 精选

NVIDIA 开源 Audio-Visual Flamingo:能看懂长视频里画面和声音的大模型

NVIDIA 把 Audio-Visual Flamingo 完全开源了。这个模型能同时理解视频里的画面、声音和文字,而且专门针对长视频——不是那种几秒的片段,是真实世界里几分钟甚至更长的复杂视频。它用了一个约 700 万条带时间戳的标注数据做训练,分三个阶段逐步教会模型:先看懂短片段,再学会跨多个事件做长线推理。为了让推理过程更靠谱,团队还搞了一套叫...

推荐理由:NVIDIA 开源了一个能同时处理长视频画面和声音的模型,训练数据量 700 万条带时间戳样本,训练方法分三步走——这点对做视频理解的人有参考价值。我会先打个折:正文没提在具体产品里的表现,也没给延迟或成本数字,所以先别太激动,把它当一个扎实的研究发布看就好。

Hacker News 首页

德国团队发布开源模型 Soofi S,30B 参数跑出 3B 成本,德语英语跑分双杀

Soofi S 是一个 31.6B 参数的混合专家模型,每次生成只激活 3.2B 参数,推理成本压得很低。它用了 Mamba 加 Transformer 的混合架构,处理长文本时速度几乎不掉,这点比很多同尺寸模型强。训练数据故意向德语倾斜,结果在德语、英语和编程基准上分数都超过了 Olmo 3 32B 和 Apertus 70B。模型在德国电信的慕尼黑...

推荐理由:德国 AI 联盟放出的 Soofi S,一个 31.6B 参数的混合专家模型,每次只激活 3.2B 参数,推理成本压得很低。它用 Mamba 加 Transformer 的混合架构,长文本处理不掉速,在德语、英语和编程基准上分数都超过了 Olmo 3 32B 和 Apertus 70B。虽然德语优先的定位会限制它在中文圈的传播,但开源 30B 级别模型做到这个性能和成本,对从业者来说值得看一眼。

7月16日星期四

NVIDIA 博客

英伟达发布两款新的 Jetson Thor 边缘计算模块 T3000 和 T2000,把 Blackwell 架构塞进了更小、更省电的机器人电脑里

英伟达推出了 T3000 和 T2000 两款基于 Thor 架构的新模块。T3000 算力 865 FP4 teraflops,配 32GB 内存和 273GB/s 带宽,体积和功耗大约是之前 T5000 的一半,但跑多模态模型的推理速度差不多,能帮客户在高内存价格下省一笔硬件钱。T2000 算力 400 FP4 teraflops,16GB 内存,...

推荐理由:英伟达发了 Jetson Thor 系列的新模块 T3000 和 T2000,主打边缘机器人。T3000 的卖点很直接:算力 865 FP4 teraflops,配 32GB 内存和 273GB/s 带宽,体积和功耗砍到 T5000 的一半左右,但跑多模态模型推理速度没怎么掉。我会先打个折——这是官方博客,没给第三方跑分,也没说什么时候能大规模买到。不过内存优化这块确实戳中痛点,现在内存贵,能省就是赚。T2000 给到 400 FP4 teraflops 和 16GB 内存,定位更低一些。整体看,对做机器人或边缘 AI 的团队是个值得跟进的信号,但...

7月14日星期二

FT · 科技

FT 纪录片实拍 AI 芯片黑市:从新加坡、马来西亚到中国的走私链条

这部 FT 纪录片直接拍到了高端英伟达 GPU 是怎么被走私进中国的。中间商在新加坡、马来西亚等地用空壳公司和假最终用户证明拿货,再靠“蚂蚁搬家”式的小批量跨境运输绕过美国出口管制。镜头里能看到仓库囤货和重新包装的过程,走私者会磨掉序列号、换包装来隐藏货源。片子里采访了走私者和调查人员,整个链条组织化程度很高。不过纪录片没给出黑市的总交易规模,这点先别...

推荐理由:这是 FT 的纪录片级调查,有实地拍摄和一手采访,不是政策复读。HKR 三项都踩中了,但片子本身是调查报道而非产品技术更新,对从业者的直接可操作性有限,所以分数定在 78 这个位置。

FT · 科技

英伟达把亚洲授权买家砍掉一半,堵芯片绕道进中国的口子

英伟达把亚洲授权买家名单从 11 家砍到只剩 5 家,因为美国商务部发现有人通过东南亚和中东把芯片转手卖进中国。被踢掉的包括马来西亚、越南和阿联酋的分销商和服务器组装厂。留下来的买家得签更严的最终用途声明,英伟达还开始用软件追踪芯片最终流向。这是出口管制以来英伟达最大的一次自我审查动作——不过名单缩水不代表所有漏洞都堵上了,正文没披露具体是哪 5 家留...

推荐理由:英伟达把亚洲授权买家名单砍掉一半多,是美国商务部发现有人通过东南亚和中东转手芯片进中国之后,英伟达最大的一次自我审查。我会先打个折:名单从 11 家缩到 5 家,说明之前授权确实太松,但正文没披露留下的 5 家是谁,也没说软件追踪具体怎么落地,所以不能说漏洞全堵上了。对从业者来说,这条消息直接关系到采购渠道和合规成本,值得放在 featured 位置。

7月13日星期一

AI HOT 精选

黄仁勋说英伟达季度收入快破千亿美元,Rubin Ultra 明年照常出货

黄仁勋在摩根士丹利闭门会上给了三个明确信号。第一,英伟达季度营收马上要冲到 1000 亿美元,而且增速还在往上走,没有见顶。第二,下一代旗舰架构 Rubin Ultra 没延期,明年按时出货;之前传的推迟到 2028 年是误读,实际只是在调整机架设计来支持更大算力集群,路线图没变。第三,一家过去几乎全靠自研 ASIC 芯片的头部 AI 实验室,现在近一...

推荐理由:黄仁勋在摩根士丹利闭门会上扔了三个炸弹。第一,季度营收快破千亿,增速还没见顶,这直接打脸那些觉得英伟达增长要放缓的人。第二,Rubin Ultra 没延期,明年照常出货,之前传的推迟到 2028 年其实是误读,只是在调机架设计来堆更大算力集群,路线图没变。第三,一家过去几乎全用自研 ASIC 的头部 AI 实验室,现在近一半算力开始买英伟达 GPU,这个转向比任何分析报告都更能说明通用 GPU 在灵活性上的优势。三条信息每一条都在修正市场预期,而且来自闭门会,时效性极强,当天就该让从业者看到。

7月11日星期六

彭博科技

美国把阿联酋从最严出口管制名单里拿掉了,英伟达的 AI 芯片可以卖过去了

美国商务部把阿联酋从出口管制最严的那一档移除了,等于给英伟达这类公司卖高端 AI 芯片开了绿灯。之前阿联酋被放在限制最严的组里,主要是担心芯片会经那里流到中国。降级之后,当地数据中心和 AI 项目申请买高端 GPU 的审批会简单很多。文章没提具体放开哪些型号,也没说有没有数量上限,但点名了微软和 G42 的合资公司会是直接受益方。

推荐理由:这条消息对算力圈挺重要,我会先打个折——正文没写具体型号和数量上限,所以不能给太高。但美国商务部降级阿联酋这件事本身信号很强,微软-G42 合资公司直接受益,做数据中心和芯片采购的人必须知道。

7月10日星期五

FT · 科技

SK 海力士在纳斯达克上市,一把融了 265 亿美元

SK 海力士正式登陆纳斯达克,IPO 募资 265 亿美元,是今年全球最大的一笔上市交易。这笔钱主要用来扩产 HBM(高带宽内存),也就是给英伟达这类 AI 芯片厂供货的关键存储芯片。正文没披露发行价和首日涨跌幅,但光看融资规模,市场还在往 AI 算力供应链里猛砸钱。

推荐理由:今年全球最大 IPO,265 亿美元全押在 AI 算力上游。HBM 扩产直接挂钩英伟达的交付能力,属于硬件层的信号事件。正文没披露发行价和首日涨跌幅,稍微扣点分,但募资规模本身已经够硬。

TechCrunch · AI

巴黎语音 AI 公司 Gradium 种子轮融了 1 亿美元,英伟达也投了

Gradium 做的是超低延迟的语音模型,目标是让 AI 对话没有那种尴尬的停顿,听起来像真人即时回应。它去年 12 月刚带着 7000 万美元走出隐身状态,现在又拉上英伟达等新投资方,把种子轮总额推到了 1 亿美元。这笔钱会用来在湾区开办公室,直接去 Anthropic 和 OpenAI 的地盘抢人——一家巴黎公司这么做,说明 AI 人才密度还是硅谷...

推荐理由:1 亿美金种子轮在语音赛道算头部数字,英伟达背书又加了硬件可信度。但正文没披露产品 demo 和延迟数据,我会先打个折——有话题、有方向,但缺验证,刚好卡在 featured 门槛上,再往上推就虚了。

TechCrunch · AI

英伟达股价跌回 AI 热潮前水平,它一手打造的算力市场开始反噬自己

英伟达最近日子不太好过。股价从 5 月高点跌了 15%,按预期利润算,现在比标普 500 成分股的平均估值还便宜——也就是说,市场对英伟达每块钱利润的出价,已经低于普通美国大公司了。钱还在往 AI 基础设施里涌,但大部分流向了内存厂商,比如美光同期市值几乎翻了三倍。原因不复杂:去年看起来很吓人的 GPU 短缺缓解了,而数据中心对内存的需求成了新瓶颈。正...

推荐理由:反直觉的叙事配上具体数字,好奇、干货、转发欲都占住了。但这是市场分析,不是产品发布或技术突破,重要性给到72比较合适。正文没写明美光市值翻三倍的具体时间窗口,这点先打个折。

7月9日星期四

AI HOT 精选

法国对英伟达的反垄断调查快收尾了,主要盯着 CUDA 绑定和产业投资

法国竞争管理局说,对英伟达的反垄断调查快结束了,很快会发正式异议声明。调查从 2023 年 9 月突击检查办公室开始,现在集中在两件事上:一是开发者被 CUDA 这个编程平台绑得太死,想换别的硬件很难;二是英伟达投资了 CoreWeave 这类 AI 云公司,监管担心这会进一步巩固它超过 70% 的全球 AI 加速器市场份额。发异议声明不等于定罪,英伟...

推荐理由:法国反垄断调查快结束了,CUDA 锁定和 CoreWeave 投资是两项最具体的指控。没给更高分是因为现在还停在发异议声明的阶段,没罚款也没补救措施,所以我会先打个折。

AI HOT 精选

蚂蚁灵波开源 LingBot-Video:一个专为机器人设计的视频生成模型,用 MoE 架构把推理成本打下来

蚂蚁灵波发布了 LingBot-Video,一个专门给具身智能用的视频生成模型,代码已开源。它用 MoE 架构(混合专家)替代了传统的密集模型,总参数量 30B,但生成视频时只激活约 3B 参数,推理速度比同规模的密集模型快 3 倍左右。训练数据是 7 万小时的机器人相关视频,包括灵巧操作、导航和第一人称视角交互,不是网上随便扒的风景片。为了让生成的动...

推荐理由:蚂蚁灵波开源了 LingBot-Video,一个用 MoE 架构做的具身智能视频基模。我会先打个折:这是刚发布的新东西,还没有外部复现报告,效果别急着全信。但亮点挺实在——30B 参数只激活 3B,推理快 3 倍,意味着本地跑或上机器人端成本低不少。训练数据是 7 万小时机器人相关视频,不是网上扒的通用素材,这点比很多视频模型更对口。代码已开源,做这行的人可以直接拉下来试。

Hacker News 首页

SpaceXAI 发布 Grok 4.5,主打编程和自动化任务,用更少的输出 token 解决问题

Grok 4.5 是 SpaceXAI 目前最强的模型,专门为写代码、让模型进业务流程干活和知识类工作优化。在 SWE Bench Pro 这类编程基准测试里,它的解决率是 64.7%,虽然比 Fable 和 GPT 5.5 低,但有个很实在的优点:平均每次任务只输出约 1.6 万个 token,比 Opus 4.8 少了 4.2 倍,意味着推理成本更...

推荐理由:SpaceXAI 推出 Grok 4.5,定位是写代码和让模型进业务流程干活,跟 Cursor 联合训练算是个实在的差异化。SWE Bench Pro 上 64.7% 的解决率没超过 Fable 和 GPT 5.5,这点先别太激动,但它的省钱优势很具体:平均每次任务输出约 1.6 万个 token,比 Opus 4.8 少了 4.2 倍,意味着推理成本低不少。正文没披露定价和延迟,这两个才是决定它能不能打的关键。

7月7日星期二

AI HOT 精选

NVIDIA 把自回归、扩散和自我推测解码塞进同一个模型:Nemotron-Labs-Diffusion

NVIDIA 这篇论文放出了一个叫 Nemotron-Labs-Diffusion 的模型,一个模型里集成了三种生成方式:逐 token 预测(自回归)、一次性去噪生成整段(扩散),以及让扩散先打草稿、自回归再校验的“自我推测”模式。训练时用了自回归和扩散的联合目标,扩散负责往前多看几步做规划,自回归提供从左到右的语言先验,两者互补。自我推测模式下,扩...

推荐理由:NVIDIA 把自回归、扩散和自我推测打包进一个模型,架构想法有新意,联合训练那部分写得也实在。但这就是篇论文,没产品也没场景,对一线干活的人触动不大,刚好卡在 featured 门槛上。

7月6日星期一

AI HOT 精选

NVIDIA Kyber NVL144 跳票到 2028 年,NVL72x2 背靠背机架方案也砍了

SemiAnalysis 爆料,Jensen 在 GTC 上秀过的 Kyber NVL144 项目延期超过一年,现在要等到 2028 年。同时 NVL72x2 那种把两个机架背靠背拼起来的方案也被取消了,Rubin Ultra 的横向扩展能力会因此受限。具体原因正文还没展开,这只是线程的第一条,我会先打个折,等后续细节出来再看是设计问题还是供应链卡壳。

推荐理由:SemiAnalysis 独家爆料,Jensen 在 GTC 上秀过的 Kyber NVL144 延期超过一年,现在要等到 2028 年,NVL72x2 方案也被砍了。HKR 三条全中:悬念强、信息新、直接关系到基础设施规划。分数定在 78 是因为目前只是单条推文,没给出根本原因和补充细节,我会先打个折,等后续信息出来再判断。

7月2日星期四

Hacker News 首页

英伟达打算让初创公司用未来收入分成来换算力

英伟达推出一个叫 Nvidia Ignite 的计划,让年收入在 1000 万到 5 亿美元之间、还没盈利的初创公司,用未来收入分成来抵算力费用,不用直接掏现金。正文没披露具体分成比例和合同细节,听起来像是英伟达在 GPU 稀缺时挑赢家下注,但执行细节还很模糊。

推荐理由:英伟达用算力换收入分成,对缺现金的 AI 初创公司是个实打实的选项。但正文完全没披露分成比例和合同细节,执行层面全是空白,所以评分卡在 featured 门槛上。