OpenAI 发布 GPT-Realtime-2,一个号称 GPT-5 级推理能力的实时音频模型
绝杀!OpenAI正式接管人类耳朵,首个GPT-5级推理音频模型来了
OpenAI 推出了 GPT-Realtime-2,官方把它叫做“GPT-5 级推理音频模型”。同时发布的还有 Realtime-Translate 和 Realtime-Whisper 两个配套工具。新模型支持 128K 上下文窗口,提供五档推理强度可选,API 定价是每百万输入 token 32 美元、输出 token 64 美元。不过,这篇文章因...
推荐理由:OpenAI 同一天发的产品更新,实时音频推理是个硬功能,不是概念稿。128K 上下文和 5 档推理强度让开发者能按场景调成本与效果,32/64 美元的定价也给了算账依据。我会先打个折:正文没提延迟数据和实际录音样本,这点先别太激动。但语音 agent 的落地成本一直是瓶颈,这篇信息密度够,值得推给做实时交互的从业者。