跳到正文

NVIDIA 英伟达

英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力市场的风向。

290 条精选相关主题部署工程行业动态具身智能

最新精选

第 121–140 条 · 共 290 条

7月1日星期三

TechCrunch · AI

英伟达的对手 Etched 估值冲到 50 亿美元,手里已经有 10 亿美元的订单

Etched 的芯片已经由台积电造出来了,现在正拿给客户测试。他们卖的不是单颗芯片,而是打包好的整套推理系统——连机柜和软件都配齐了,专门用来跑前沿大模型给用户回应用户提问(也就是推理环节)。公司说这套东西比竞品更快、更省钱、更省电。他们手里已经签了 10 亿美元的合同订单,总融资额也到了 8 亿美元,其中最近一轮 5 亿美元之前没公开过。不过,文章没...

推荐理由:Etched的芯片已经由台积电造出来,正在客户手里测试,同时手握10亿美元合同、估值冲到50亿,是少数既有硬件又有收入信号的英伟达替代者。分数卡在78,因为目前只有单篇报道,产品还没大规模部署,我会先打个折。

AI HOT 精选

Anthropic 发布 Claude Science,把文献、数据分析、画图和写论文塞进同一个科研工作台

Claude Science 是一个给科研人员用的 AI 工作台,现在对 Pro、Max、Team 和 Enterprise 用户开放测试。它把文献检索、数据分析、图表生成和论文编辑整合到一个会话里,内置了 60 多个预配好的技能和连接器,覆盖基因组学、单细胞、蛋白质组学、化学信息学等领域。每次输出都附带可审计的代码、运行环境和聊天记录,方便复现。计算...

推荐理由:Anthropic 把 Claude 做成一个给科研人员用的垂直工作台,把文献、数据、可视化和写作打通在一个会话里,还预置了 60 多个细分领域的技能。产品形态跟通用聊天界面拉开差距,硬核、知识密度和可复现性三个维度都踩中了。正文没披露具体定价和实际延迟数据,但光这个整合度和审计输出,就值得给 82 分。

6月30日星期二

AI HOT 精选

英伟达 Rubin Ultra 原版被砍,新版尺寸和性能都砍半

SemiAnalysis 爆料,GTC 2026 上发布的 4 芯片封装 Rubin Ultra 才过了三个月就被取消,原因是制造环节出了问题。新版的 Rubin Ultra 尺寸直接减半,实际性能大概也只有原版的一半。帖子没具体说哪个制造步骤翻车,也没提新的交付时间表。

推荐理由:这条爆料信息量够硬:发布时间线、取消原因、新版规格缩水幅度都点到了。虽然没披露具体制造故障和新的交付时间,但旗舰芯片三个月就砍单这件事本身,对算力采购和集群规划的冲击已经足够大。我会先打个折,因为来源是 SemiAnalysis 的单方爆料,NVIDIA 还没公开确认,但考虑到 Rubin Ultra 的定位,这条消息的预警价值很高,值得放在头条位置。

6月29日星期一

Import AI

NVIDIA 给机器人搭了个自我进化循环;腾讯公开万卡集群调试工具;一篇论文提醒我们:人类预测技术走向的能力烂透了

NVIDIA 的 ENPIRE 系统让实体机器人像编程智能体一样,通过试错来自我改进。在插 GPU、剪扎带这类任务上成功率能干到 99%,但自动评估和自动复位在更复杂的活上还是会掉链子。硬件用的是双臂协作平台,每台配一张 RTX 5090。测试里 GPT-5.5 和 Claude Opus 4.7 表现互有胜负,而且多智能体一起干通常比单打独斗分高。不...

推荐理由:NVIDIA的ENPIRE系统把智能体那套试错循环搬到了实体机器人上,插GPU、剪扎带这类活能干到99%成功率,但自动评估和自动复位在更复杂的任务上还是会掉链子。硬件是双臂平台,每台一张RTX 5090。测试里GPT-5.5和Claude Opus 4.7表现互有胜负,多智能体一起干通常比单打独斗分高。不过这是简报摘要,不是原始论文,信息密度被稀释了,上限就打到78分。

6月26日星期五

TechCrunch · AI

OpenAI 的 Jalapeño 芯片,是大厂摆脱英伟达最辣的一步

OpenAI 公布了自研推理芯片 Jalapeño,找博通一起做,专门跑模型回答。这不是要跟英伟达一刀两断,更像买个保险——谷歌、苹果、SpaceX 都在这么干,用自己定制的硬件换更多控制权,也省点钱。同一期播客还聊到 Groq 刚被英伟达挖走核心团队,转头就融了 6.5 亿美元,算是个逆袭故事。另外,AI 智能体开始进入循环工作流,Claude Co...

推荐理由:OpenAI 自研推理芯片是个实打实的信号,Jalapeño 这个代号和博通合作让消息有了具体抓手。但这是播客里聊出来的,不是官方发布,细节还比较薄——知道在做,不知道做到哪了、性能怎么样、什么时候能用上。所以放在 featured 档刚好,先别当重磅炸弹看。

AI HOT 精选

SGLang 给 DeepEP 的 MoE 推理加了两个负载均衡器:Waterfill 和 LPLB

LMSYS 和 NVIDIA 在 SGLang 里为 DeepEP 的 MoE 推理加了两个运行时负载均衡方法。Waterfill 管共享专家,把共享专家的请求发给当前最闲的 GPU,在 DeepSeek V3/R1 上吞吐量提升了 1.48% 到 4.66%,在 DeepSeek V4 上从每秒 49253 个 token 提到 51677 个 to...

推荐理由:LMSYS 和 NVIDIA 联合发的,给了具体吞吐量提升(V3/R1 上 1.48% 到 4.66%,V4 上从 49253 提到 51677 token/s),两个方法都讲清楚了干什么用。对跑 DeepSeek 系列模型生产环境的人有直接参考价值,但纯工程层优化,圈外人无感,放在 featured 刚好。

6月25日星期四

彭博科技

高通放话:2029 年数据中心芯片年收入要做到 150 亿美元

高通在投资者日上立了一个很高的目标:到 2029 年,数据中心芯片的年收入要达到 150 亿美元。这个数字比它 2025 财年汽车和物联网两块业务加起来还大。高通把宝押在了 AI 推理芯片上,打算从训练市场转向推理市场,直接跟英伟达和博通抢生意。不过正文没披露高通目前数据中心业务的具体收入,只说了基数很小。从几乎为零冲到 150 亿,五年时间确实很紧,...

推荐理由:高通第一次公开数据中心收入目标,从几乎零基础喊到 2029 年 150 亿美元,赌的是 AI 推理芯片能抢英伟达和博通的饭碗。彭博独家给了消息权威性。但正文没披露当前数据中心收入,这个 150 亿的起点到底多低,读者得自己掂量。

6月24日星期三

The Verge · AI

OpenAI 发布首款自研芯片 Jalapeño,专跑 ChatGPT 推理,已量产部署

OpenAI 跟博通合作搞出了第一款自家芯片,代号 Jalapeño。这芯片现在只干一件事:在服务器上跑 ChatGPT 的推理(也就是你问它答的那个环节),不负责训练模型。OpenAI 说它已经量产,并且开始往自家服务器里装了,目的很直接——少用点英伟达的卡,把运营成本压下来。不过,官方没公布这芯片的性能、功耗和具体省了多少钱,所以实际效果还得看后续...

推荐理由:OpenAI 第一款自研芯片已经量产并开始部署,是摆脱英伟达依赖的实质性动作。但性能、功耗、省了多少钱全都没公布,所以分数压到 85 以下。

FT · 科技

SK 海力士要在美国上市,计划募资 290 亿美元,拿钱去扩产 AI 用的 HBM 内存

SK 海力士准备在美国搞一次 290 亿美元的 IPO,这是韩国公司史上最大规模的海外上市。融来的钱主要用来扩产 HBM(高带宽内存),这种内存是英伟达等 AI 芯片厂商的抢手货。文章没披露具体上市时间表和定价,但方向很明确:AI 军备竞赛的钱已经烧到上游供应商了。

推荐理由:SK海力士这笔290亿美元的美国IPO,是AI需求向上游传导的硬证据。HBM扩产融资数字很实在,但正文没披露上市时间和定价,所以分数先压在85以下。

6月23日星期二

TechCrunch · AI

Groq 确认拿到 6.5 亿美元新融资,在被英伟达花 200 亿“只挖人不收购”后重新搭团队

AI 芯片公司 Groq 确认完成了一轮 6.5 亿美元的融资。这事发生在英伟达花了大约 200 亿美元,把 Groq 大部分员工直接挖走、但没收购公司之后。CEO Jonathan Ross 说,Groq 现在要转向“新云”模式,也就是不再只卖硬件,而是用自己的芯片直接跑 AI 推理服务。团队重建方面,新招了首席产品官和工程 VP,都不是之前被英伟达...

推荐理由:这条消息有反转、有具体数字、有战略转向,三个维度都踩中了。没给更高分是因为目前只确认了融资,新云模式的实际性能和客户反馈正文没披露,我会先打个折。

TechCrunch · AI

SpaceX 拿下第三笔算力大单,开源 AI 实验室 Reflection AI 每月付 1.5 亿美元租用 GB300 芯片

SpaceX 在孟菲斯附近的 Colossus 2 数据中心又签了一家大客户。开源 AI 实验室 Reflection AI 从 2026 年 7 月 1 日起,每月支付 1.5 亿美元,合同签到 2029 年,换来英伟达最新 GB300 芯片的即时使用权。这是该数据中心继 Anthropic(月付 12.5 亿美元)和 Google(月付 9.2 亿...

推荐理由:SpaceX 签下开源实验室 Reflection AI,月付 1.5 亿美元用到 2029 年。这事新鲜、有硬数字、话题性也够,但 Reflection AI 知名度低,正文也没交代资金来源,所以先给 78 分放在 featured 档。

6月17日星期三

纽约时报中文网

AI 芯片的钱,这次中国没挣到

英伟达的 AI 芯片卖爆了,但真正跟着发财的是给它供内存的三家公司:SK 海力士、三星和美光。最先进的内存晶圆只有这三家能做,今年价格直接翻了一倍多。黄仁勋在 Computex 上跑到海力士的展台,在一片缺货的晶圆上写“请多生产一些 :)”,因为产能根本跟不上。这波热潮把三星和海力士的市值都推过了万亿美元,韩国成了美国之外第一个同时有两家万亿市值公司的...

推荐理由:纽约时报用内存供应链当切口——晶圆价格翻倍、两家韩国公司市值破万亿、再加一个黄仁勋的段子——把 AI 硬件瓶颈讲清楚了。这是趋势观察而不是事件新闻,放在 featured 刚好。

6月16日星期二

Hacker News 首页

SubQ 1.1 Small 发布:用稀疏注意力把百万 token 长文本计算量砍掉 64.5 倍

Subquadratic 放出了 SubQ 1.1 Small 的模型卡。它把传统注意力机制里那种“每个词都要和所有词算一遍关系”的密集计算,换成了按内容相关性动态路由的稀疏注意力(SSA),让计算量随文本长度线性增长,而不是平方级爆炸。在 100 万 token 的上下文里,SSA 比密集注意力省 64.5 倍算力,比 FlashAttention-...

推荐理由:SubQ 1.1 Small 把注意力计算从“每个词跟所有词都算一遍”改成按内容相关性动态路由,长文本下计算量线性增长。模型卡给了 1200 万 token 检索近乎满分的结果,64.5 倍算力节省是实打实的亮点。不过目前只有模型卡和设计合作伙伴的部署信息,没开放权重也没公开 API,生产落地还差一口气,所以分数压在 85 以下。

6月10日星期三

NVIDIA 博客

苹果把英伟达的机密计算拉进私有云,用 H100 在加密环境里跑 AI 推理

苹果之前只在自家芯片上跑私有云推理,现在开始把一部分工作负载挪到英伟达 H100 GPU 上,用 Hopper 架构的硬件级可信执行环境保护数据。处理过程中数据保持加密,连云服务商都碰不到。这相当于苹果在保持同样安全隔离的前提下,给私有云计算换了个更通用的算力底座。不过正文没披露具体上线时间和部署规模,只确认会先在苹果自己的数据中心里跑起来。

推荐理由:苹果第一次把私有云计算的工作负载从自研芯片挪到英伟达 H100 上,用硬件级可信执行环境保护推理数据,安全标准没降但算力底座换了。分数没给更高是因为正文没披露上线时间和部署规模,目前只是确认会在苹果自己的数据中心跑起来,实际影响还得看落地情况。

6月9日星期二

AI HOT 精选

SpaceX 要把 AI 数据中心搬上近地轨道,单颗卫星持续算力约 120 kW,延迟 6-8 毫秒

马斯克公布了 SpaceX 的 AI1 轨道 AI 数据中心卫星方案。每颗卫星峰值功率 150 kW,持续计算功率约 120 kW,大致相当于一个 NVIDIA GB300 机架的算力。卫星跑在 600-800 公里高的近地轨道,通过激光链路互联,带宽约 1 Tbps,往返延迟 6-8 毫秒。散热靠双面散热器,排热能力 1,400 W/m²;太阳能板效...

推荐理由:我会先打个折:发射时间、单颗卫星成本、实际跑过什么推理任务,正文都没提,所以别急着把它当成马上能用的方案。但亮点是实打实的——150 kW峰值功率、120 kW持续算力,直接对标一个GB300机架,散热靠双面散热器做到1,400 W/m²,这些数字说明散热和供电在工程上是认真算过的。激光链路1 Tbps、往返6-8毫秒的延迟,对近地轨道来说算低,但跟地面数据中心比还是高出一截,适合对延迟不那么敏感的大批量推理任务。整体看,这是个有硬核参数支撑的轨道算力方案,不是画饼,但离落地还差关键信息。

6月8日星期一

AI HOT 精选

五个模型经济体里,价格崩盘消失了:控制与涌现

这篇博客因为 Hugging Face 返回了 429 错误(请求太频繁),正文内容没抓到。从标题和摘要看,实验用 OpenAI、NVIDIA、OpenBMB 的模型和一个自己微调的 5 亿参数模型来驱动市场里的交易代理。他们试了三种干预手段都没能重现价格崩盘,最后是靠结算时强行改写价格才把崩盘做出来。我会先打个折:具体怎么干预、崩盘长什么样、数据量多...

推荐理由:我会先打个折:正文因为 Hugging Face 限流没抓到,具体干预怎么设计、崩盘长什么样、数据量多大都只能靠标题和摘要猜。但就现有信息看,五个模型经济体里崩盘凭空消失、只能靠结算作弊做出来,这个发现对代理可靠性和模拟真实性都是实打实的质疑。信息缺口明显,但角度够刁,值得推给从业者看一眼。

r/LocalLLaMA

RTX 5090 跑 Qwen3.6-27B 实测:DFlash 投机解码加 KV 缓存压缩,速度提到 3.26 倍

作者在单张 RTX 5090 上跑了 Qwen3.6-27B,用 DFlash 做投机解码(让一个小模型先猜答案,大模型再核对,省时间),同时压缩 KV 缓存(把模型记住的上下文瘦身,省显存)。结果最高提速到 3.26 倍。用 q4_0/turbo4 量化时速度是原来的 3.18 倍,WikiText-2 上的困惑度只涨了 0.02%,基本没掉精度。不...

推荐理由:作者在消费级新卡上实测了一套组合拳:用小模型先猜答案再让大模型核对(投机解码),同时把模型记的上下文瘦身(KV 缓存压缩)。结果速度翻了三倍多,精度几乎没掉。这对想在本地跑大模型的人来说是个很实在的参考,数据也够具体。不过来源只有 Reddit 一个帖子,我会先打个折,别当正式论文看。

r/LocalLLaMA

双卡 3090 跑 27B 模型,解码速度几乎翻倍,没插 NVLink 也做到了

一位 Reddit 用户拿 qwen3.6-27b-autoround-int4 模型做测试,对比单张 3090 和两张 3090 的表现。在没装 NVLink、走 8x/8x PCIe 通道、P2P 自动开启、张量并行设为 2 的条件下,叙事类文本的解码速度从 53 token/秒涨到 94 token/秒,代码类解码从 62 token/秒涨到 1...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次测试,没换模型、没换卡型复现,所以别急着当通用结论。但它的价值在于给了一个很具体的参考点——在没桥接器、走普通 PCIe 通道的情况下,qwen3.6-27b 的 int4 量化版用张量并行跑,解码速度几乎翻倍。对正在纠结要不要加卡跑本地推理的人来说,这个数据比厂商白皮书实在。正文没披露功耗、延迟波动和长文本下的表现,这些缺口让结论只能停在“值得自己试一下”的程度。

AI HOT 精选

英伟达和 SK 海力士签了多年协议,要一起设计下一代 AI 内存芯片

两家公司签了一份多年合作协议,打算从设计阶段就联手搞下一代 AI 用的内存芯片。目前公开的信息里没提具体产品规格、什么时候量产,也没说涉及多少资金。

推荐理由:H 和 R 都过了:Bloomberg 首发,加上英伟达和 SK 海力士在 AI 内存供应上的分量,值得关注。K 偏弱,因为规格、量产时间和财务条款全都没披露,所以只能放在 featured 的低分段。

6月7日星期日

AI HOT 精选

五个实验室,五个心智:用小模型搭了个会内幕交易的金融宫斗剧

这个项目用四家不同实验室的小模型(OpenAI 的 gpt-oss-20b、OpenBMB 的 MiniCPM3-4B、NVIDIA 的 Nemotron-Mini-4B 和一个自己微调的 0.5B Qwen)分别扮演市场里的不同角色,玩家则充当幕后金主,可以放贷、散布真假内幕消息、做空和贿赂。模型之间的差异本身就是卖点,让市场博弈更像真的吵架而不是念...

推荐理由:我会先打个折:这只是个实验项目,不是产品。但它的切入点很巧——用小模型之间的差异来制造博弈感,而不是硬靠 prompt 演。技术细节也够实在,vLLM 版本冲突、0.5B 模型的表现数据都摆出来了,做 agent 的人能直接参考。正文没披露微调那 0.5B Qwen 的具体数据配方,这点先别太激动。整体值得一看,放在低 featured 合理。