# GPT-4o 系统卡：语音响应快过人类，但声音安全是最大隐患

> 原标题：GPT-4o System Card

- 来源：OpenAI News
- 发布时间：2024-08-08T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/735
- 原文：https://openai.com/index/gpt-4o-system-card

## 摘要

OpenAI 在 8 月 8 号发了 GPT-4o 的系统卡，把安全底牌摊开来看。这个模型能直接吃文本、音频、图片和视频，输出也一样，最快 232 毫秒就能回话，平均 320 毫秒，跟人聊天反应速度差不多。API 价格比 GPT-4 Turbo 便宜一半。在 OpenAI 自己的安全框架里，网络安全、生物威胁、模型自主性三项风险都是低，说服力这项擦边踩...

## 推荐理由

这不是一篇例行公事的发布。它把 preparedness 四类风险评级、232 毫秒语音延迟和明确的部署门槛都摆出来了。HKR 三项全中，但本质是安全披露而非新模型或重大产品发布，所以放在 featured 而不是 p1。

## 锐评

OpenAI 这次把 GPT-4o 的安全测试结果摊开来讲，最值得关注的是语音能力带来的新风险。模型能直接吃文本、音频、图片和视频，回话最快 232 毫秒，平均 320 毫秒，确实跟人聊天反应速度差不多。API 价格比 GPT-4 Turbo 便宜一半，这点挺省钱。

在 OpenAI 自己的安全框架里，网络安全、生物威胁、模型自主性三项风险都是低，但说服力这项擦边踩到了中风险线。他们定了个硬规矩：只有缓解后风险在中或以下的模型才能上线。语音这块是重点，系统卡里点名了未经授权的语音生成、说话人识别、以及根据声音瞎猜敏感特征这几个问题。

不过，正文没披露具体用什么数据训练，也没说缓解措施到底砍掉了多少风险。外部红队测试的细节也有限。这些缺口让安全结论打了折扣，先别太激动。
