OpenAI 这次把 GPT-5.5 的升级重点放在了效率上,而不是单纯堆跑分。每 token 延迟跟 GPT-5.4 一样,但完成同样任务用的 token 更少,Artificial Analysis 的数据说消耗量大约是竞品前沿编码模型的一半。这对按 token 付费的 API 用户是实打实的省钱,输入 5 美元、输出 30 美元每百万 token 的定价,配合 token 效率提升,实际成本可能比 GPT-5.4 还低。
跑分有亮点也有短板。Terminal-Bench 2.0 从 75.1% 提到 82.7%,FrontierMath Tier 4 从 27.1% 跳到 35.4%,数学和命令行能力涨得明显。但 SWE-Bench Pro 上 58.6% 仍低于 Claude Opus 4.7 的 64.3%,OpenAI 自己标注了该基准存在记忆化问题,这点先别太激动。正文没披露这个基准的具体污染程度,也没说他们怎么测的。
安全评级归在 Preparedness Framework 的 High 级别,没到 Critical,同时开了个面向安全研究人员的 Trusted Access 计划。内部使用数据挺实在,85% 员工每周用 Codex,财务团队审了 24,771 份 K-1 税表提前两周收工,说明产品化程度比上一代成熟。但 API 还是"很快"跟进,没给具体日期,急着接入的开发者得再等等。