GPT-6 Astra 全面开放后,群友实测同一个任务从 12 分钟缩到 6 分钟,但单次消耗比上一代 Sol 贵约 75%。有人用 API 跑一轮代码审查直接烧掉 100 美元,这个定价对高频使用不太友好。Tibo 和 Anthropic 同一天都给用户重置了额度,Codex 顺手封堵了一个能无限白嫖的漏洞——军备竞赛已经从模型能力卷到了额度发放速度。
Cerebras 的实测数据值得认真看。标称 1500 tps 只计极短上下文下的纯生成速度,在真实 agent 工作流里有效吞吐中位数只有约 357 tps,跟本地 5090 的 102 tps 比,纸面 15 倍差距缩水到 3.5 倍。更麻烦的是限流机制:agent 循环让上下文在 65 秒内从 11K 膨胀到 99K,缓存读取虽然单价低但在速率限制里全额计入,一两分钟就触发 429 报错。三分钟花了 1.57 美元,82% 是缓存读取费用;同样任务本地跑约 11 分钟、电费约 0.017 美元,成本差约 90 倍。结论很明确:Cerebras 适合 chatbot demo 或上下文不滚雪球的场景,做正经 agent 工作流还是本地部署小模型划算。
GLM-5.3-Flash 在国产推理卡上只跑到 20 tps,同一套权重走 Ollama Cloud 能到 70 tps,serving stack 造成 3.6 倍差异。群友解释根本原因是国内好卡优先拿去训练,承担推理的基本是国产卡。正文没披露 GLM-5.3-Flash 的具体参数量和定价,也没说 Ollama Cloud 的延迟和成本对比,这些缺口让速度数据只能看个趋势。