# Wafer 在 AMD MI355X 上跑 Kimi K3，每块钱性能比 B300 高 45%

> 原标题：Running Kimi K3 on MI355X at Better Performance per Dollar Than B300

- 来源：Hacker News 首页
- 发布时间：2026-08-02T04:21:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48198
- 原文：https://www.wafer.ai/blog/kimi-k3-mi355x

## 摘要

Wafer 用 8 张 AMD MI355X 显卡部署了 2.8 万亿参数的 Kimi K3 模型，单节点跑到每秒 952 个 token，每美元 GPU 时产出 48 个 token——这个性价比是 B200 的 6.8 倍，比 B300 也高出 45%。关键原因是显存：MI355X 单卡 288GB 显存刚好能装下模型和 100 万 token 的...

## 推荐理由

Wafer 用 8 张 MI355X 跑 Kimi K3 的实测数据，性价比比 B300 高 45%，数字和方法都公开了。没给更高分是因为这是单家厂商的基准测试，没有第三方复现，而且 Wafer 自己就卖 AMD 算力——我会先打个折，但核心结论仍然值得关注。

## 锐评

这条值得看，因为 AMD 第一次在跑超大模型时靠显存容量拿到了实打实的性价比优势，不是纸面参数。Wafer 用 8 张 MI355X 部署 Kimi K3，单节点跑到每秒 952 个 token，每美元 GPU 时产出 48 个 token——比 B200 方案便宜 6.8 倍，比 B300 也便宜 45%。核心原因很简单：Kimi K3 加上 100 万 token 的上下文缓存需要超过 1.5TB 显存，B200 单节点 8 张卡装不下，只能跨两台机器跑，多了网络延迟拖慢速度。MI355X 单卡 288GB 显存刚好能塞下，省掉了跨节点通信的坑。

团队还修了两个 ROCm 的软件坑：一个是缺 top-k 重归一化函数导致投机解码报错，另一个是把注意力头数从 12 补零到 16 才能用上 AMD 的快速算子，冷启动预填充时间从 51 秒砍到 23 秒。这说明 AMD 的软件生态仍然需要手工补丁，不是开箱即用。

不过正文没披露 Kimi K3 的正式发布时间和定价，也没给出实际生产环境下的延迟分布或并发用户数。952 tok/s 是基准测试峰值，真实负载下能稳住多少还不清楚。另外，B200 方案用的是两节点 TP16，如果未来有更大显存的单节点方案，对比结论可能会变。
