# ChatGPT 现在能看、能听、能说话了

> 原标题：ChatGPT can now see, hear, and speak

- 来源：OpenAI News
- 发布时间：2023-09-25T07:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/849
- 原文：https://openai.com/index/chatgpt-can-now-see-hear-and-speak

## 摘要

OpenAI 给 ChatGPT 加了语音和图片功能。语音部分，你对着手机说话它能回你，背后用了一个新的文字转语音模型，拿几秒真人录音就能合成很像人的声音，还接入了自家的 Whisper 做语音识别。图片部分，你可以拍照或截图发给它，让它看图说话，底层是 GPT-3.5 和 GPT-4 的多模态版本。这两个功能会先推给 Plus 和 Enterpris...

## 推荐理由

这是一次实打实的 OpenAI 产品更新：标题确认了视觉输入、语音输入和语音输出，所以 HKR 三项都踩中了。正文没给版本、推送范围、延迟和定价，我会先打个折，停在 88 分而不是拉满。别被标题骗了，真正要盯的是语音延迟、视觉理解边界和调用入口。

## 锐评

OpenAI 给 ChatGPT 加了嘴和眼睛。语音部分，你对着手机说话它能回你，背后用了一个新的文字转语音模型，拿几秒真人录音就能合成很像人的声音，还接入了自家的 Whisper 做语音识别。图片部分，你可以拍照或截图发给它，让它看图说话，底层是 GPT-3.5 和 GPT-4 的多模态版本。这两个功能会先推给 Plus 和 Enterprise 用户，语音在 iOS 和 Android 上，图片全平台都有。

这篇公告更像产品预告，不是技术报告。它没提语音交互的延迟有多高，也没说图片理解在多轮对话里会不会翻车。最关键的是，它完全没提 API 什么时候能用，开发者现在只能干等。另外，语音合成只靠几秒样本就能模仿真人，安全风险怎么控，正文只说“逐步开放”，具体措施没展开。如果是真的省钱省事，那确实方便，但实际体验还得等上手再说。
