跳到正文

NVIDIA 英伟达

英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力市场的风向。

290 条精选相关主题部署工程行业动态具身智能

最新精选

第 241–260 条 · 共 290 条

5月5日星期二

r/LocalLLaMA

FastDMS 把 KV 缓存压到 1/5~1/8,跑得比 vLLM BF16/FP8 还快

FastDMS 放出了一个 MIT 许可的实现,核心是把模型推理时占显存的 KV 缓存压到原来的 1/5 到 1/8。在 8K 上下文长度下,Llama-3.2-1B 用 6.4 倍压缩后困惑度是 9.200;Qwen3-8B 在压缩系数 c=1 时,KV 缓存从 1.406 GiB 直接降到 0.184 GiB。和很多只算字节数的方案不同,它真的把淘...

推荐理由:我会先打个折,这个项目目前只给了 Llama-3.2-1B 的复现实验,更大规模模型的验证还没看到,所以别急着当通用方案。但它的钩子确实强:KV 缓存压缩 6.4 倍,同时推理速度还比 vLLM 的 BF16/FP8 快,这跟“压缩必降速”的直觉对着干。正文给出了具体的 PPL 和显存占用对比,数字可追溯。真正值得盯的是它回收了被踢掉的物理槽位,不只是账面上少占点字节,这对长上下文推理的显存管理是实打实的改进。来源是开源实现和 Reddit 讨论,不是厂商通稿,信息可信度还行,但权威性一般,所以分数定在 80 这个区间。

5月4日星期一

r/LocalLLaMA

M3 Ultra 加 DGX Spark,能拼出一台 M5 Ultra-lite 吗?

Reddit 有人拿 DGX Spark 和 M3 Ultra 在 llama.cpp 里跑分,统一用 pp16384 上下文。Spark 比 M3 Ultra 快 1.4 到 3.4 倍,看模型:Qwen 27B 跑到 778 token/秒,M3 Ultra 是 340;Mistral 128B 跑到 241,M3 Ultra 只有 72。有个调参...

推荐理由:数据来自 Reddit 单帖,权威性打折扣,但测试设置清楚、模型覆盖广、提速幅度直观,对正在掂量买 M3 Ultra 还是 DGX Spark 跑本地推理的人有参考价值。我会先打个折,因为没看到多轮对话或长上下文压力测试,但就当前信息来说,featured 低空过关没问题。

5月2日星期六

TechCrunch · AI

五角大楼与英伟达、微软、AWS 签约,要把 AI 搬进机密网络

五角大楼一口气签了三家,要在军方机密网络里部署 AI。背景是之前跟 Anthropic 因为模型使用条款闹掰了,国防部现在明显在分散供应商,不把鸡蛋放一个篮子里。具体签了多少钱、用什么模型、什么时候落地,正文都没披露。

推荐理由:这条消息的硬核在于五角大楼在机密网络里铺 AI,而且一口气签了英伟达、微软、AWS 三家。起因是之前 Anthropic 的使用条款有争议,国防部干脆把供应商分散开,不把鸡蛋放一个篮子里。我会先打个折:正文没写花了多少钱、用什么模型、什么时候上线,所以现在只能当个信号看。如果是真的挺省钱或者能快速部署,那对做政府项目的团队是个参考。这点先别太激动,等具体合同细节出来再判断实际影响。

5月1日星期五

The Verge · AI

五角大楼跟 OpenAI、Google、Nvidia 签了涉密 AI 合同,但把 Anthropic 排除在外

五角大楼一口气和七家公司签了涉密 AI 使用协议,包括 OpenAI、Google、微软、亚马逊、Nvidia、xAI 和 Reflection。Anthropic 被挡在门外,理由是供应链风险。合同金额、具体要用哪些模型、怎么部署,正文都没披露。之前五角大楼处理机密信息时用过 Anthropic,这次突然不带它玩,原因没说透。

推荐理由:我会先打个折:正文没披露合同金额、模型范围和部署条件,所以重要性停在82。但五角大楼点名7家涉密AI供应商、唯独不带上Anthropic,这个选择本身就很有信息量。国防部给出的理由是供应链风险,等于把安全审查摆到了台面上,对从业者来说,这比一份普通合作公告更值得留意。

r/LocalLLaMA

Reddit 网友用 16 台 DGX Spark 攒了个集群,跑通 434GB 大模型

Reddit 用户 Kurcide 晒出了他搭的 16 节点 DGX Spark 集群。每台机器用一根 QSFP56 线连到 FS N8510 交换机,单链路跑到 100–111 Gbps,总带宽约 200 Gbps,所有节点都跑满了线速。这次测试的重点是统一内存:8 个节点合起来成功加载了 434GB 的 GLM-5.1-NVFP4 模型,接下来他还...

推荐理由:H、K、R 三项都成立:帖子是第一手集群实测数据,网络条件和模型运行情况都交代清楚了,434GB 模型跑在 8 节点上是个实打实的验证。范围限定在本地推理硬件,所以重要性落在 72–77 这个区间,没到产品发布级别。

FT · 科技

华为 AI 芯片在中国大卖,英伟达却卡住了

这篇是付费墙后面的文章,正文没披露具体订单金额、芯片型号和交付时间。从标题看,核心信息是华为接到了国内科技公司的大笔 AI 处理器订单,而英伟达因为出口管制在中国市场动弹不得。这背后反映的是中国算力供应链正在被迫转向国产替代,但文章本身没给出更多细节来支撑这个判断,先别太激动。

推荐理由:FT 的信源和华为 vs Nvidia 的中国市场角力,让 H 和 R 都站得住。但 K 这边确实虚:金额、型号、交付节点一概没给,所以分数只能压在 78–84 这个区间,别因为标题冲高。

NVIDIA 博客

NVIDIA 说 OpenClaw 开源智能体项目 60 天拿了 25 万星,但治理成本才是真问题

NVIDIA 这篇博客主要讲了两件事:一是 Peter Steinberger 做的自托管持久化智能体 OpenClaw 在 GitHub 上火了,到 2026 年 3 月已经攒了 25 万颗星,增速超过了 React。二是 NVIDIA 自己推出了 NemoClaw,用 OpenShell 沙箱和 Nemotron 模型来跑智能体。文章真正想聊的是治...

推荐理由:我会先打个折:这是 NVIDIA 官方博客,立场肯定偏向自家 Nemotron 和 NemoClaw,但文章没回避常驻 Agent 最要命的问题——token 成本暴涨和安全边界。OpenClaw 本身是 Peter Steinberger 做的自托管常驻 Agent,NVIDIA 用 OpenShell 沙箱和 Nemotron 模型给它加了网络、数据访问的默认限制,这个加固思路比单纯吹性能更有信息量。文中给出的推理后 token 增 100 倍、自治 Agent 再增 1000 倍的估算,虽然没披露测算口径,但把成本焦虑直接量化了,对做落地的人...

4月30日星期四

Latent Space

推理算力到了爆发点:CPU 不够用,GPU 也在被拆着用

Latent Space 这期把近期几条线索串了起来:AI 的推理(inference)需求正在急剧膨胀。黄仁勋在 GTC 上说,过去两年单次任务的算力消耗涨了约 1 万倍,总用量涨了约 100 倍,他管这叫“推理拐点”。英特尔 CEO 在财报会上给了更具体的数字,CPU 需求在涨,不是因为训练,而是因为代码智能体、强化学习环境模拟这些推理侧的工作全压...

推荐理由:这是一篇 Latent Space 的新闻汇总和趋势判断,不是模型发布或重大产品更新。它把黄仁勋的预测和 CPU 沙箱、智能体调度这些实际工作负载拆解放在一起,对从业者有参考价值,但信息密度和独家性不如一手发布。我会先打个折,放在 featured 里偏评论解读的位置。

4月29日星期三

r/LocalLLaMA

双卡 RTX 5060 Ti 16GB 跑通 Qwen3.6 27B,vLLM 下跑到约 60 tok/s,支持 204K 上下文

一位用户用两张 RTX 5060 Ti 16GB 显卡,通过 vLLM 部署了 Qwen3.6 27B 模型。实测在 8K 上下文时生成速度约 62–66 tok/s,两张卡共占用 32GB 显存。配置上开了张量并行(TP=2)、fp8 KV 缓存、多 token 预测(MTP 一次猜 3 个 token),并把上下文窗口拉到了 204800。显存是瓶...

推荐理由:H、K、R 全中。帖子是一手实测,硬件、vLLM 参数、速度、上下文上限和显存余量都列得清楚,对想用消费级显卡跑 27B 的人有直接参考价值。唯一扣分点是来源只有 Reddit 单帖,没有更多交叉验证,所以分数停在 76 不进 78–84 那档。

NVIDIA 博客

英伟达发布 Nemotron 3 Nano Omni:一个模型同时看懂图文、听懂语音,做 AI 代理时吞吐量号称是同类 9 倍

英伟达在 2026 年 4 月 28 日开源了 Nemotron 3 Nano Omni,一个能同时处理文字、图片、音频、视频、文档、图表和屏幕界面的多模态模型。它用了 30B-A3B 的混合专家架构(MoE),实际激活的参数量是 3B,配合 Conv3D 和 EVS 技术来处理音视频,上下文窗口拉到 256K。官方说在保持交互延迟不变的前提下,跑 A...

推荐理由:NVIDIA 这次把视觉、语音、文字塞进一个 30B-A3B 的混合专家模型里,还开放了权重和训练技术。我会先打个折:9 倍效率提升是跟谁比、测什么任务,正文没细说,这点先别太激动。但 256K 上下文、Conv3D 和 EVS 这些配置,加上直接上 Hugging Face 和 OpenRouter,对想用开源方案搭多模态 agent 的团队确实省事。单信源,信息够用但不算独家,所以放在 featured 里。

4月27日星期一

彭博科技

红杉和英伟达投了前 DeepMind 研究员的新公司,估值 51 亿美元

David Silver 创立的 Ineffable Intelligence 拿了 11 亿美元融资,投后估值 51 亿美元,红杉和英伟达都参投了。正文没披露具体做什么产品、模型参数和发布时间,目前只能看到一笔大额融资和豪华投资方名单。这点先别太激动,产品没出来之前,估值更多反映的是团队背景和资源背书。

推荐理由:我会先打个折——正文没提产品做什么、模型多大、什么时候发,所以信息密度其实不高。但 David Silver 这个名字加上红杉和英伟达的组合,在圈内就是硬通货,融资规模和估值本身已经是信号。HKR 三项都踩中了,不过因为产品细节完全空白,分数就停在 82,不给更高。

Hacker News 首页

Utilyze 开源 GPU 监控工具,说比 nvtop 更准,能看出显卡是真忙还是在摸鱼

Systalyze 开源了一个叫 Utilyze 的 GPU 监控工具,专门解决 nvidia-smi 和 nvtop 那个老毛病:它们只告诉你显卡“有没有在干活”,不告诉你“干得有多满”。比如 H100 有 132 个流式多处理器、一万七千多个核,但只要有一个核在跑,利用率就敢报 100%,实际算力可能才用了 1%。Utilyze 会直接算你的 GP...

推荐理由:这篇抓住了 GPU 监控里一个很常见的坑:传统工具只看二值占用,不看有效计算效率。对跑生产负载的人来说,知道真实吞吐上限比看仪表盘数字重要得多。我会先打个折,因为工具来自一个还没被广泛验证的团队,正文也没披露具体开销有多“可忽略”,但选题和解释都到位,放在 featured 没问题。

Hacker News 首页

现在用 AI 可能比雇人还贵

Axios 报道,一些公司的 AI 算力开销已经超过了员工工资。英伟达高管 Bryan Catanzaro 说,他团队的算力成本远高于人力成本;Uber 的 CTO 则因为 token 消耗太快,已经花光了 2026 全年的 AI 预算。Gartner 预测今年全球 IT 支出会涨到 6.31 万亿美元,主要就是被 AI 基建、软件和云服务推高的。文章...

推荐理由:这篇文章把 AI 成本焦虑变成了预算事实。Nvidia 内部团队算力开销远超人力、Uber CTO 的 token 预算提前见底,加上 Gartner 的支出预测,都在说同一件事:AI 的账单开始比工资单更吓人。它不是产品发布或硬新闻,而是趋势报道,所以放在 72–77 这个区间。我会先打个折,因为正文没给出 Nvidia 和 Uber 的具体金额对比,但方向性判断足够清晰,值得从业者看一眼自己的预算表。

量子位 · 公众号

斯坦福等团队搞了个“用大模型当验证器”的方法,在 Terminal-Bench 2.0 上跑分超过 Claude Mythos 和 GPT-5.5

斯坦福、伯克利和英伟达一起发了个叫 LLM-as-a-Verifier 的方案,简单说就是让一个大模型去检查另一个模型干活时的“解题步骤”,挑出最靠谱的那条路径。他们用了三招:打分细到 token 级别、同一件事反复查、把评判标准拆开看,最后在 Terminal-Bench 2.0 和 SWE-Bench Verified 两个榜单上都拿了第一。其中 ...

推荐理由:我会先打个折:这还是个基准测试的研究发布,不是模型或产品大更新,所以分数放在这个区间。但钩子够强——斯坦福、伯克利、英伟达联名,Transformer作者转发,验证智能体这件事本身又是当前工程落地的痛点。信息量也扎实,token级评分、重复验证、标准分解这些机制都给了具体数字,不是空泛的“新框架”。读者看完能立刻判断要不要跟进实验。

4月25日星期六

Latent Space

DeepSeek 发布 V4 Pro 和 Flash 模型,能在华为昇腾芯片上跑

DeepSeek 终于发了 V4 系列,一共两个型号:V4 Pro 总参数 1.6 万亿,每次激活 490 亿;V4 Flash 总参数 2840 亿,激活 130 亿。两个模型都支持 100 万 token 的上下文,用了新的压缩注意力技术,相比 V3.2,处理长文本时计算量只要 27%,显存占用只要 10%。这次比较特别的是同时发了基础版和指令版,...

推荐理由:这条必须写。DeepSeek 这次放出的不只是模型,而是把华为昇腾兼容性摆上台面,等于在 CUDA 依赖上划了一刀。技术报告说 1M token 下只用 V3.2 27% 的算力、10% 的 KV 缓存,省得挺实在。两档参数和 MIT 许可也让落地门槛更低。我会先打个折:正文没提实际推理延迟和昇腾上的吞吐数据,这点先别太激动,但硬件独立性本身已经够重。

Computing Life · Share · 鸭哥调研

TPU 与 CUDA 的攻防战:Cloud Next 2026 之后的判断

Google 在 Cloud Next 2026 上放了三招:把第八代 TPU 拆成训练用的 8t 和推理用的 8i,8i 内存带宽比 8t 还高,专门对付长上下文推理;推出 TorchTPU,让 PyTorch 代码能直接在 TPU 上跑,不再需要以前那个问题一堆的桥接层;以及给 Anthropic 投了最多 400 亿美元并配 5GW 算力。这三件...

推荐理由:这篇文章把 TPU 和 CUDA 的竞争讲得很清楚,给了 8i 的硬参数和量产时间,也提到了 TorchTPU 这个降低迁移门槛的动作。但正文自己说了缺少独立 benchmark,而且 8i 要 2027 下半年才量产,所以判断 18-24 个月内 TPU 不会取代 NVIDIA。信息有料,但验证还弱,时间也远,所以重要性给到 82,放在 featured 里。

4月22日星期三

TechCrunch · AI

Google 和 Thinking Machines Lab 签了笔几十亿美元的算力大单,用的是英伟达最新的 GB300 芯片

Mira Murati 创办的 Thinking Machines Lab 跟 Google Cloud 签了一份新的多年合同,金额在几十亿美元级别。这笔交易的核心是他们要用上英伟达目前最顶级的 GB300 芯片来做 AI 训练和推理。文章没披露具体合同年限、总算力规模、交付时间表,也没说这些算力具体要跑什么模型或业务。但一个顶级 AI 实验室开始批量...

推荐理由:TechCrunch 这条独家把三个信号绑在一起:Google Cloud、数十亿美元合作、Nvidia GB300。标题和摘要给了交易规模和芯片代际,但合同期限、算力量级、交付节奏和用例全是空白,所以重要性停在 82 没往上走。我会先打个折:金额听着吓人,可没期限就没法算年均投入。真正值得盯的是 GB300 已经进入头部实验室的采购链,这点比参数发布更有说服力。

量子位 · 公众号

商汤绝影把32B总参、3B激活的模型塞进车机,跑分压过GPT-5.4和Opus 4.6

商汤绝影发布了一个叫Sage的车载端侧多模态模型,总参数32B,但每次推理只激活3B参数。它在PinchBench上拿了94%,比Claude Opus 4.6的93.3%和GPT-5.4的90.5%都高。模型跑在Nvidia OrinX上,首字延迟约0.5秒,单token生成约0.03秒,吞吐80 tok/s。训练用了两个方法:SCOUT省了约60%...

推荐理由:我会先打个折:所有数据都是商汤自报,没有第三方复现,PinchBench 的对比对象和测试条件正文也没细说。但亮点在于它把 3B 激活模型塞进 OrinX,还给出了推理延迟和吞吐,这对车载场景比跑分更有参考价值。后训练省 60% GPU 小时、复杂任务完成率提 20% 这两个数,缺训练规模和消融细节,先别太激动。整体看,信息量够、落地指向明确,但验证链不完整,所以重要性给 79,放在 featured 里提醒大家关注端侧 Agent 的进展和水分。

4月21日星期二

彭博科技

Google 要发新的 AI 推理芯片,直接跟英伟达抢生意

Bloomberg 这条视频提到 Google 准备推出一批专做推理的新 AI 芯片,正面挑战英伟达。不过正文被付费墙挡了,没披露具体发布时间、型号、性能参数、定价和客户。我会先打个折:目前能确认的信号是推理芯片的供给竞争在升温,但产品到底多能打、什么时候落地,都还是未知数。

推荐理由:HKR-H 和 HKR-R 通过,因为这条消息把 Google 和 Nvidia 在推理芯片上的直接竞争摆上了台面。HKR-K 弱:报道只确认了推理这个方向,芯片叫什么、跑分多少、卖多少钱、什么时候出、谁会买,这些关键信息正文都没披露,所以信息缺口很大。

4月19日星期日

r/LocalLLaMA

Cloudflare 开源 Unweight:把大模型权重压缩 22%,输出结果一个字节都不差

Cloudflare 发了一个叫 Unweight 的压缩方案,专门解决大模型在 GPU 上跑时被显存带宽卡脖子的问题。它只压缩 BF16 格式里的指数位,不碰尾数,所以解压后能还原出完全一致的输出。实测一个 8B 模型能省下约 3GB 显存,压缩率在 15% 到 22% 之间。原理是模型某一层里超过 99% 的权重只用到 16 种指数值,Unweig...

推荐理由:Cloudflare 这篇 Unweight 的卖点很直:不改模型输出,把权重无损压缩 15% 到 22%。他们盯的是 BF16 里浪费的指数字节,发现大部分层的指数值就那么几个,所以只压这部分。8B 模型能省出 3GB 显存,对跑 H100 的人来说是实打实的成本优化。我会先打个折——正文没给吞吐实测数字,也没说哪些模型能用,片上解压和动态执行管线听起来有料但细节没展开。这点先别太激动,等他们补上实测再判断实际收益。