# GPT-6 Astra 全面开放首日实测：更快但更贵，额度战同步开打

> 原标题：2026-09-04 群聊日报

- 来源：AI 群聊日报
- 发布时间：2026-09-05T07:32:58.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55033
- 原文：https://louyu2015.github.io/AI-chatgroup-daily/daily/2026/09/04/daily/

## 摘要

GPT-6 Astra 今天向所有 Pro 用户开放，Codex CLI 和 Copilot 都已接入。群友实测同一个任务从 12 分钟缩到 6 分钟，但单次消耗比 Sol 贵约 75%，有人用 API 跑一轮代码审查直接烧掉 100 美元。Tibo 和 Anthropic 同一天都给用户重置了额度，Codex 则顺手封堵了一个能无限白嫖的漏洞。另外，...

## 推荐理由

GPT-6 Astra 全量上线是本周最大的产品动作，这份群聊日报用第一天的实测数字把速度和成本都摆出来了，比官方公告更有参考价值。打 78 分是因为来源是匿名群聊整理，不是一手官方公告，部分细节（比如漏洞具体怎么堵的）正文没展开，所以没给更高。

## 锐评

GPT-6 Astra 全面开放后，群友实测同一个任务从 12 分钟缩到 6 分钟，但单次消耗比上一代 Sol 贵约 75%。有人用 API 跑一轮代码审查直接烧掉 100 美元，这个定价对高频使用不太友好。Tibo 和 Anthropic 同一天都给用户重置了额度，Codex 顺手封堵了一个能无限白嫖的漏洞——军备竞赛已经从模型能力卷到了额度发放速度。

Cerebras 的实测数据值得认真看。标称 1500 tps 只计极短上下文下的纯生成速度，在真实 agent 工作流里有效吞吐中位数只有约 357 tps，跟本地 5090 的 102 tps 比，纸面 15 倍差距缩水到 3.5 倍。更麻烦的是限流机制：agent 循环让上下文在 65 秒内从 11K 膨胀到 99K，缓存读取虽然单价低但在速率限制里全额计入，一两分钟就触发 429 报错。三分钟花了 1.57 美元，82% 是缓存读取费用；同样任务本地跑约 11 分钟、电费约 0.017 美元，成本差约 90 倍。结论很明确：Cerebras 适合 chatbot demo 或上下文不滚雪球的场景，做正经 agent 工作流还是本地部署小模型划算。

GLM-5.3-Flash 在国产推理卡上只跑到 20 tps，同一套权重走 Ollama Cloud 能到 70 tps，serving stack 造成 3.6 倍差异。群友解释根本原因是国内好卡优先拿去训练，承担推理的基本是国产卡。正文没披露 GLM-5.3-Flash 的具体参数量和定价，也没说 Ollama Cloud 的延迟和成本对比，这些缺口让速度数据只能看个趋势。
