# Cerebras 用整块晶圆芯片跑 OpenAI 的 GPT-5.6 Sol，每秒吐 750 个 token

> 原标题：Accelerating GPT-5.6 Sol Ultrafast

- 来源：Hacker News 首页
- 发布时间：2026-08-13T18:10:02.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50505
- 原文：https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai

## 摘要

Cerebras 和 OpenAI 放出了一个叫 Ultrafast 模式的新服务，目前只在小范围测试。它把 GPT-5.6 Sol 部署在 Cerebras 自家的晶圆级芯片上，推理速度最高能到每秒 750 个输出 token。在 Humanity's Last Exam 这个全是博士级难题的测试里，它跑完 2500 道题只用了 11 小时 11 分...

## 推荐理由

Cerebras 和 OpenAI 把 GPT-5.6 Sol 搬上晶圆级芯片，搞了个 Ultrafast 模式，推理速度拉到 750 tok/s，前沿模型第一次摸到这种实时交互的门槛。HLE 那套博士级难题跑完只用了 11 小时 11 分，给部署团队一个能直接算账的参考值。不过目前还是小范围测试，正文没披露并发数、成本结构和实际可用性，这点先别太激动。

## 锐评

这条消息的核心是：Cerebras 和 OpenAI 搞了个 Ultrafast 模式，把 GPT-5.6 Sol 部署在 Cerebras 的晶圆级芯片上，推理速度最高每秒 750 个输出 token。在 Humanity's Last Exam 这个全是博士级难题的测试里，它跑完 2500 道题只用了 11 小时 11 分，而 Claude Fable 5 要 78 个多小时，速度差了近 7 倍，准确率还差不多。在 GDP-Val 这个衡量经济价值知识工作的基准上，端到端速度也快了 5.6 倍，质量没掉。

速度快的原因，是 Cerebras 把整块晶圆做成一个超大芯片，片上塞了 44 GB 的 SRAM，模型权重可以直接放在片上跑，不用来回搬数据，绕开了内存带宽瓶颈。这点确实硬核，不是软件优化那种小打小闹。

不过得打个折。目前只是小范围预览，正文没披露价格、并发能力、实际延迟分布，也没说这个速度是在什么 batch size 下测的。HLE 测试里 Ultrafast 用的是 xhigh reasoning，Claude 那边也是 xhigh，但推理硬件和软件栈不同，直接比速度可以，比性价比还缺数据。另外，750 token/s 是峰值还是稳态？长文本生成会不会掉速？这些都没说。想在生产环境用，还得等正式开放和更完整的压测报告。
