跳到正文

NVIDIA 英伟达

英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力市场的风向。

290 条精选相关主题部署工程行业动态具身智能

最新精选

第 61–80 条 · 共 290 条

8月22日星期六

TechCrunch · AI

Nvidia 用一套外挂流程把非顶尖模型在 ARC-AGI 3 上拉到满分,说明现在干活靠的是“缰绳”而不是模型本身

Nvidia 发了篇研究,用他们叫 AVO 的一套外挂流程(负责规划、纠错和记忆),让一个不是最前沿的模型在 ARC-AGI 3 测试里拿了 100% 的成绩。这相当于说,让 AI 处理长链条任务时,外围的调度和纠错机制比模型自身能力强弱更关键。不过文章没提底层模型叫什么、参数量多大、跑一次要多久、成本多少,所以这点先别太激动,离实际能用还有信息缺口。

推荐理由:Nvidia 用一套叫 AVO 的外挂流程,让一个不是最前沿的模型在 ARC-AGI 3 测试里直接拿了满分。这相当于说,处理长链条任务时,外围的规划、纠错和记忆机制比模型自身强不强更关键。我会先打个折:正文没披露底层模型叫什么、参数量多大、跑一次要多久、成本多少,所以这个 100% 暂时别太激动,离实际落地还有信息缺口。但观点本身对从业者选型有直接冲击,值得推。

8月21日星期五

Hacker News 首页

Nari Labs 把 Qwen3-TTS 的首音延迟压到 50 毫秒以内,一张 H100 就能跑 10 并发

Nari Labs 开源了一套 Qwen3-TTS 1.7B 的部署方案,在一张 H100 上做到 10 并发请求时,95% 的用户听到第一个字的时间不超过 50 毫秒,且播放不卡顿。他们对比了 vLLM-Omni、SGLang-Omni 等四个引擎,默认设置下最快的 p95 首音延迟也要 277 毫秒。核心优化有两招:一是动态切掉模型开头几十毫秒的静...

推荐理由:Nari Labs 开源了一套 Qwen3-TTS 1.7B 的部署方案,单张 H100 跑 10 个并发请求,95% 的用户在 50 毫秒内就能听到第一个字,比 vLLM-Omni 等引擎默认配置快了五倍以上。文章给了具体 benchmark 和可复现的优化步骤,我会先打个折——这是他们自己测的数据,实际场景里网络抖动和客户端解码还会吃掉一点延迟,但核心思路(动态剪掉开头静音、用 CUDA Graph 合并小算子)确实能帮做实时语音的团队少踩很多坑。

Latent Space

Poolside 把模型工厂和 109 名员工卖给英伟达,拿了 60 亿美元授权费,创始人留下转型

Poolside 跟英伟达签了一笔 60 亿美元的非独家授权协议,外加 10 亿美元投资,公司估值 120 亿美元。这笔交易把 Poolside 的模型工厂和 109 名员工转给了英伟达,但两位创始人没走,留下来要把公司彻底转向新方向。创始人自己说这不是收购,也不是“人才收购”——因为这次是员工去大厂、创始人留守的反向操作。他们去年底有个六周的窗口期去...

推荐理由:Poolside 跟英伟达这笔 120 亿美元估值的交易,结构确实少见——员工和模型工厂打包去英伟达,创始人反而留守拿钱转型,属于反向人才收购。硬数字够多,授权费、投资额、人员转移都列出来了,时间窗口也有交代。扣一点分是因为原文有付费墙,部分条款没完全展开,但现有信息已经足够让从业者看清这笔交易的特殊性。

8月20日星期四

Computing Life · Share · 鸭哥调研

先问华为,再关大门:两台国家机器怎么分别挡住了 NVIDIA

这篇文章把中美两国阻挡 NVIDIA 的底层逻辑讲透了。美国靠的是公开的成文规则,像数字开关一样,每次更新管制条例,NVIDIA 就对着条文砍规格出新卡,双方来来回回打了四个回合。中国则完全相反,没有任何一纸禁令,但通过网信办约谈、海关拒批、发改委逐案审批、反垄断调查和稀土管制这套组合拳,让 NVIDIA 的产品线一条条陷入实质停摆。核心执行逻辑是:先...

推荐理由:这篇文章把中美阻挡英伟达的底层逻辑拆得很透。美国走的是公开成文规则,每次更新管制条例,英伟达就对着条文砍规格出新卡,双方来回打了四个回合,像数字开关一样可预测。中国这边完全相反,没有一纸禁令,但通过网信办约谈、海关拒批、发改委逐案审批、反垄断调查和稀土管制这套组合拳,让产品线一条条陷入实质停摆。核心执行逻辑是“先问华为,再关大门”——先看华为有没有同类产品,有的话进口替代就直接卡住。20 万张对 40 万张 H200 的数字说明中国市场的实际供应缺口很大,这点先别太激动,正文没披露这 40 万张是已交付还是订单数。整体分析框架清晰,信息密度高,但部...

Hacker News 首页

DFlash 2 让并行猜词更聪明:每次验证多出 20% 以上有效输出,延迟只增加约 1%

Inco AI 发布了 DFlash 2,在原来一次性并行猜出整段候选词的基础上,加了一个轻量的路径选择器。DFlash 原本是每个位置独立挑最可能的词,但词与词之间可能不连贯,导致验证时整段被砍掉。DFlash 2 的做法是每个位置保留前 16 个候选,然后给相邻词对打分,从中挑出一条最连贯的路径。在 Qwen3.8-27B 上实测,每次验证通过的有...

推荐理由:DFlash 2 是对已有推理加速方法的明确改进,有实测数据,不是空谈。分数没给更高是因为这只是一篇技术博客,不是模型发布或产品上线,影响面集中在推理栈圈子。

8月19日星期三

FT · 科技

中国悄悄放松英伟达 H200 芯片进口限制

中国监管层没发正式文件,但审批上松了口,允许部分云厂商和数据中心买英伟达 H200。H200 是 H100 的升级版,显存带宽更高,对大模型训练有帮助。具体哪些公司拿到了许可、能买多少、什么时候开始,正文都没说。这更像执行层面的微调,不是出口管制方向掉头。

推荐理由:FT 独家说中国对 H200 审批松了口,这事在芯片拉锯战里是个实打实的信号。H200 显存带宽更高,训大模型更顺手。我会先打个折,因为正文没披露获批公司、数量和到货时间,目前只能当方向性消息看,别急着下重注。

Computing Life · Share · 鸭哥调研

卖芯片的去当担保人:NVIDIA 用一年现金流给 OpenAI 的房租兜底

NVIDIA 给 OpenAI 在俄亥俄州的数据中心租约签了残值担保,最多赔 1050 亿美元,差不多是它 2026 财年一整年的经营现金流。OpenAI 没有信用评级,银行不敢借钱给房东 SB Energy 建厂,NVIDIA 出面兜底才让贷款落地。作为交换,这个园区必须独家用 NVIDIA 的全套硬件,NVIDIA 自己也掏了 15 亿美元入股 S...

推荐理由:NVIDIA 用一年经营现金流给 OpenAI 的机房租约做残值担保,上限 1050 亿美元,还附带了追回条款和四重身份绑定,这些全是新披露的细节。HKR 全中。没打更高是因为实际执行从 2028 年才开始,短期冲击有限。

8月18日星期二

FT · 科技

英伟达承诺砸 1000 亿美元,帮 OpenAI 在俄亥俄州建数据中心

英伟达要给 OpenAI 在俄亥俄州的数据中心项目撑腰,承诺投入 1000 亿美元。这笔钱不是直接给现金,而是通过买 GPU 和投基础设施的方式兑现。OpenAI 主导这个项目,建成后会是它训练和跑模型的核心算力基地。不过文章是付费墙后的内容,具体的开工时间、用哪款 GPU、电力供应怎么解决,正文都没披露。

推荐理由:英伟达用 1000 亿美元硬件承诺把 OpenAI 的俄亥俄数据中心和自己绑死,这是算力层和模型层头部玩家的强强联手,信号意义很强。但 FT 的付费墙挡住了所有技术细节,我们只知道一个天价数字和合作框架,没法判断项目落地有多快、具体用什么卡,所以分数没给满。

TechCrunch · AI

Groq 拿到 3.5 亿美元,从自研芯片彻底转向买英伟达 GPU 做推理云

Groq 又融了 3.5 亿美元,但估值从去年 9 月的 69 亿掉到了 35 亿,直接腰斩。这家公司以前是自研 AI 芯片的,现在彻底转型做“新云”(neocloud),也就是买英伟达的 GPU、建数据中心,对外卖推理算力服务。转型的导火索是去年底英伟达挖走了他们的创始人。这轮融资由 Disruptive 领投,英伟达也计划参投。说白了,就是一家芯片...

推荐理由:Groq估值腰斩、创始人被挖、从自研芯片转向买英伟达GPU做推理云,连英伟达都来参投了。故事反转强烈,数字具体,对AI基础设施从业者有信号意义。没给更高分是因为转型还没被验证,正文也没披露新云业务的具体客户和收入。

8月17日星期一

TechCrunch · AI

英伟达投 15 亿美元给软银旗下的数据中心开发商,锁定 OpenAI 俄亥俄园区的芯片独家供应

英伟达向 SB Energy 投了 15 亿美元,这家公司背后是软银和 OpenAI,负责在俄亥俄州建 OpenAI 的 Ports-Pike 数据中心。这笔钱不是纯财务投资,核心是让英伟达成为这个园区唯一的算力供应商。园区起步 4.25 吉瓦,能扩到 8 吉瓦,规模很大。英伟达还会提供最多 1050 亿美元的信用额度来盖楼。供电靠一个造价 330 亿...

推荐理由:英伟达向软银旗下的 SB Energy 投了 15 亿美元,这家公司正在俄亥俄州给 OpenAI 建 Ports-Pike 数据中心。这笔钱的核心不是财务回报,而是用股权锁定英伟达作为整个园区的独家算力供应商,还配套了最高 1050 亿美元的信用额度来盖楼。园区起步 4.25 吉瓦,能扩到 8 吉瓦,规模很大。供电靠一个造价 330 亿的项目,但正文没披露供电来源和落地时间表。这个结构把三方利益绑得很紧,不再是简单的买卖关系,对行业来说是个值得盯的样本。

Hacker News 首页

Qwen3.8 27B 模型塞进 24GB 显卡跑满 256K 上下文,实测每秒 50 个 token

作者在一张 24GB 显存的 RTX PRO 4000 SFF 显卡上,把 Qwen3.8 27B 模型跑到了 50.44 tok/s,而且上下文长度拉满到 26 万 token。这个速度不是靠单一技术实现的,而是靠一套组合拳:自己调的 NVFP4 量化方案(保护了模型里对精度敏感的部分)、内置的 MTP 投机解码(让生成速度从 21.19 涨到 59...

推荐理由:一篇扎实的本地推理实战帖,数字可复现,技术路径清晰。三条 HKR 都踩中了,但本质是个人实验而非官方发布或行业事件,所以放在 featured 档,给 78 分。

彭博科技

英伟达准备砸 1050 亿美元,帮 OpenAI 在俄亥俄建数据中心的第一期

英伟达计划为 OpenAI 在俄亥俄州的数据中心项目第一期提供最多 1050 亿美元的资金,主要是用 GPU 和其他硬件来抵。英伟达不会自己运营这个数据中心。整个项目对外号称是 5000 亿美元的盘子,但文章没交代剩下的钱从哪来、什么时候到位。这 1050 亿是个上限,实际花多少要看合同签得怎么样、工程进度如何。

推荐理由:彭博独家,第一次把 OpenAI 俄亥俄数据中心项目的钱数说清楚了:英伟达用最多 1050 亿美元的硬件撑第一期,自己不运营。但整个项目号称 5000 亿,剩下近 4000 亿从哪来、什么时候到位,正文完全没提,所以这个独家数字虽然猛,但离项目真正跑起来还差得远。

OpenAI News

OpenAI 在俄亥俄州锁定 8 吉瓦算力园区,首期 2028 年上线

OpenAI 跟 SB Energy、NVIDIA 和美国能源部合作,在俄亥俄州 Pike 县拿下一个约 8 吉瓦(IT 负载)的数据中心园区。第一个 800 兆瓦预计 2028 年通电,整个项目六年建完,会带来 3.5 万个建筑岗位和 2500 个长期运营岗位。OpenAI 说会自己承担这个项目产生的能源和基建费用,不会转嫁给当地居民的电费账单。散热...

推荐理由:OpenAI首次作为主体签下8吉瓦IT负载的超大基建协议,规模远超此前任何单一公司的AI基建项目,且有2028年首批通电的具体时间线。分数定在78,因为目前只有官方公告,还没有独立分析来验证可行性、环评进展或电网接入细节,我会先打个折。

Hacker News 首页

英伟达大幅缩减对 OpenAI 数据中心融资的担保额度

华尔街日报的消息,英伟达把之前可能为 OpenAI 基建项目担保的 2500 亿美元融资额度砍了一大截,但新数字具体是多少,正文没披露。这笔钱直接关系到 Stargate 这类巨型项目能不能按计划拿到钱——在新的细节出来之前,我会先把原来的 2500 亿这个数打个折来看。

推荐理由:英伟达砍掉 OpenAI 基建担保额度,直接动摇了 Stargate 项目的资金确定性。消息源是华尔街日报,路透社也跟进了,权威性没问题。扣分点在于新数字没披露,关键信息缺了一块,所以分数压在 85 以下。

8月15日星期六

Computing Life · Share · 鸭哥调研

GPU 之后,AI 公司在抢通电日期

Nvidia 和 Amazon 同一周都在德州押注电力:Nvidia 打算投 20 亿美元入股电网开发商 Lancium,电通了再追加 10 亿;Amazon 则要在 Pecos County 自建 5,000 兆瓦的燃气电厂,先绕过公共电网排队。芯片已经陆续到货,但大型变压器交货周期拉长到 128 周以上,德州 474 吉瓦的大负荷申请里只有 8.9...

推荐理由:Nvidia 和 Amazon 同一周在德州下注电力,把电网接入变成了 AI 基础设施里看得见的竞争变量。变压器交货周期和德州电网排队审批率这些数字,让文章的知识密度够硬。没给更高分是因为正文对具体项目细节披露有限,比如 Nvidia 入股 Lancium 的交易结构就没展开。

8月13日星期四

TechCrunch · AI

英伟达用自家资产负债表给老显卡兜底,撬动 5000 亿美元建 AI 数据中心

英伟达拉来了 Apollo、黑石、高盛等六家金融巨头,口头承诺最高 5000 亿美元用于 AI 数据中心建设。真正的戏肉是英伟达自己掏钱担保旧款 GPU 的残值,让这些芯片能当抵押品去贷款。债券市场一度被吓到,直到黄仁勋出来解释才稳住。这个 5000 亿的数字我会先打个折——它只是上限,不是已经签好的合同。另外正文没披露担保在什么条件下触发,也没说英伟...

推荐理由:英伟达拉来六家金融巨头,口头承诺最高 5000 亿美元用于 AI 数据中心建设。真正的戏肉是英伟达自己掏钱担保旧款 GPU 的残值,让这些芯片能当抵押品去贷款。债券市场一开始被吓到,直到黄仁勋出来解释才稳住。这个 5000 亿的数字我会先打个折——它只是上限,不是已经签好的合同。正文没披露担保在什么条件下触发,也没说英伟达自己扛多少风险,这点先别太激动。

FT · 科技

华尔街大行押注英伟达 AI 芯片能用六七年,比传统服务器折旧年限更长

高盛、摩根士丹利和摩根大通在财报里把英伟达 AI 芯片的折旧年限定在 6 到 7 年,而传统服务器硬件一般是 4 到 5 年。他们的理由是:即便下一代芯片发布,现款芯片算力依然够用,可以转去做推理(也就是让模型上线回答问题)或者租出去。这更像是一种财务上的乐观假设,而不是技术上的实测结论。文章没有提到英伟达或审计机构对这些折旧年限的正式表态,所以这个“...

推荐理由:这篇FT的稿子抓到了一个被忽略的财务信号:大行在用折旧表表达对英伟达芯片长线价值的乐观。有具体数字和具名机构,不是空谈。我会先打个折——文章没拿到英伟达或审计方的正式确认,所以这个“6到7年”目前只是银行单方面的会计判断,别急着当技术定论。但作为行业风向标,它比很多技术博客更直接地反映了市场对算力资产贬值的真实预期。

8月12日星期三

Hacker News 首页

Nvidia 发布 Nemotron 3.5 Lightning 和 NeMo Switchyard:一个 300 亿参数的小模型,专跑多智能体系统里的专...

Nvidia 给 Nemotron 3 系列加了个新模型 Nemotron 3.5 Lightning,300 亿参数,用的是混合专家架构(MoE,把模型拆成多个小专家,每次只激活一部分,省算力)。它不负责统筹全局,而是在多智能体系统里干代码审查、安全告警监控这类专项高并发的活。官方说输出速度比同级模型快 4 倍,跑完一个智能体任务整体快 30%。模型...

推荐理由:Nvidia 这次没走通用大模型的路子,而是发了个 30B 的 MoE 模型 Nemotron 3.5 Lightning,定位是多智能体系统里的专项工人,比如做代码审查、监控安全告警。官方说输出速度比同级模型快 4 倍,跑完一个智能体任务整体快 30%,还开源了调度工具 NeMo Switchyard。我会先打个折——这些数字都来自 Nvidia 自己的博客,没有第三方实测,而且 Nvidia 的模型生态在开发者里的实际采用率远不如几家头部 lab。但“给智能体系统做专项加速”这个思路本身值得关注,对正在搭多智能体工作流的人是个可参考的选项。

8月11日星期二

AI HOT 精选

英伟达被曝在训一个万亿参数的开源模型 Nemotron 4,最早今年秋末可能完成

The Information 从项目参与者那里打听到,英伟达正在开发新一代模型系列 Nemotron 4,其中最大的一个参数量至少 1 万亿。英伟达生成式 AI 副总裁 Kari Briski 在邮件里说,投这个项目是因为他们觉得“每家公司、每个国家都需要能拿到手的前沿开源模型”。最终训练还没做完,内部员工觉得最早今年秋末能准备好。英伟达是美国少数几...

推荐理由:这条消息有具体项目名、参数量级和内部时间表,不是模糊传言。副总裁的邮件引语把英伟达为什么投这件事讲得很直白,战略信号强。没给更高分是因为训练还没做完,最终效果和发布时间都可能有变数,正文也没披露训练数据、架构细节和具体基准分,先别太激动。

Hacker News 首页

英伟达的赌局:Ben Thompson 把今天的 AI 烧钱和 1873 年铁路泡沫放在一起看

Ben Thompson 把英伟达现在的处境直接对标 1873 年铁路债券崩盘。他讲了 Jay Cooke 怎么靠 12% 的佣金和每卖 1000 美元债券送 200 美元股票,把北太平洋铁路的债券卖给散户,最后在 1873 年 9 月资金链断裂,引发持续多年的经济萧条。Liaquat Ahamed 的新书《1873》把当年每年 5 亿美元的铁路债券换...

推荐理由:Ben Thompson 的 Stratechery 文章自带行业关注度,用 1873 年铁路债券崩盘来类比英伟达是个新鲜框架,不是炒冷饭。但正文只放了个开头,完整论证锁在付费墙后面,没法验证他后面有没有给出扎实的数据或反方观点,所以分数停在 78 不上调。