# TPU 与 CUDA 的攻防战：Cloud Next 2026 之后的判断

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-04-25T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/9978
- 原文：https://yage.ai/share/tpu-vs-cuda-attack-defense-20260425.html

## 摘要

Google 在 Cloud Next 2026 上放了三招：把第八代 TPU 拆成训练用的 8t 和推理用的 8i，8i 内存带宽比 8t 还高，专门对付长上下文推理；推出 TorchTPU，让 PyTorch 代码能直接在 TPU 上跑，不再需要以前那个问题一堆的桥接层；以及给 Anthropic 投了最多 400 亿美元并配 5GW 算力。这三件...

## 推荐理由

这篇文章把 TPU 和 CUDA 的竞争讲得很清楚，给了 8i 的硬参数和量产时间，也提到了 TorchTPU 这个降低迁移门槛的动作。但正文自己说了缺少独立 benchmark，而且 8i 要 2027 下半年才量产，所以判断 18-24 个月内 TPU 不会取代 NVIDIA。信息有料，但验证还弱，时间也远，所以重要性给到 82，放在 featured 里。

## 锐评

Google 这次不是小修小补，是想另起一套能跟 NVIDIA 平起平坐的算力体系。芯片上把第八代 TPU 拆成训练用的 8t 和推理用的 8i，8i 内存带宽拉到 8.6TB/s，比训练芯片还高，专门对付长上下文推理时数据在内存和计算单元间反复搬运的毛病。软件上推出 TorchTPU，让占绝对主流的 PyTorch 代码能直接在 TPU 上跑，不再需要以前那个 bug 多、文档烂的桥接层。需求侧则用最多 400 亿美元加 5GW 算力的投资协议，把 Anthropic 这种大客户牢牢绑在自己的芯片上。

但每层都有缺口。TorchTPU 至今没有任何第三方做的性能对比测试，Google 自己只谈每美元能跑多少 token，不谈绝对速度快慢。能找到的最好参照是 2025 年一份独立测试：8 颗 TPU v6e 跟 1 颗 H200 比，首 token 延迟略快，但总吞吐量略输，而且 NVIDIA 每百万 token 的成本反而便宜四五倍。Google 说下一代能追到只差一两倍，但没验证。另外，TPU 8i 要 2027 年下半年才量产，NVIDIA 在先进封装和内存上的产能锁定优势还在。

我的判断是，18 到 24 个月内 TPU 不会取代 NVIDIA，但在最前沿的推理这个细分市场，NVIDIA 的定价权会被明显削弱。还缺的关键信息是：TorchTPU 在千卡规模下的训练稳定性数据，以及 8i 量产后的真实推理成本对比。
