# GPT-6 Astra 发布当天三家大模型同时宕机，Cerebras 上线 Qwen 3.8 27B 推理服务

> 原标题：2026-09-03 群聊日报

- 来源：AI 群聊日报
- 发布时间：2026-09-04T05:16:22.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54867
- 原文：https://louyu2015.github.io/AI-chatgroup-daily/daily/2026/09/03/daily/

## 摘要

OpenAI 发布了 GPT-6 Astra，在 ARC-AGI-3 这类需要自己摸索规则的测试里跑到了 99.9%，但发布当天绝大多数付费用户根本用不上，Sam Altman 说周末前不一定能开放。Tibo 顺势宣布每天给等不到的用户发一张 banked reset 补偿卡，群里反而希望多拖几天好囤卡。发布前后 OpenAI、Anthropic、xA...

## 推荐理由

GPT-6 Astra 发布是当天最大新闻，ARC-AGI-3 跑到 99.9% 是个硬数字。但来源是群聊日报，不是一手报道，信息密度高但权威性打折扣，所以给 78 分 featured 而不是 p1。

## 锐评

今天最值得关注的是GPT-6 Astra发布，它在ARC-AGI-3这种需要自己摸索规则的测试里跑到了99.9%，但发布当天绝大多数付费用户根本用不上，Sam Altman说周末前不一定能开放。Tibo顺势宣布每天给等不到的用户发一张banked reset补偿卡，群里反而希望多拖几天好囤卡。发布前后OpenAI、Anthropic、xAI三家同时宕机，Gemini短暂成为北美唯一可用的主流模型。

Cerebras同日上线Qwen 3.8 27B推理服务，定价$0.99/M输入、$1.49/M输出，群友实测输出速度1806 tok/s，在agentic场景下也跑出1146 tok/s、TTFT平均0.7秒、缓存命中89%。有群友跑了20个股票交易case，结论是与Sol high没区别，响应速度快了40多秒。

本地推理方面，Mac M5 Max 128G上Qwen 3.8 27B在60K token上下文下decode仅24 tps，群友总结agentic场景下打一句话等五分钟很常见，Mac至少到M5 Max都还不太行。5090用NInfer专用栈在真实写作任务中decode达382.2 tok/s，是vLLM的1.66倍。正文没披露Astra的具体模型架构和参数量，也没说明为什么发布当天就大规模不可用——是容量不足还是技术问题。Cerebras的定价虽然低，但没提并发限制和实际可用性保障。
