跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

521 条精选相关主题图像生成AI 视频语音与音频

最新精选

第 521–521 条 · 共 521 条

2023年9月25日星期一

OpenAI News

ChatGPT 现在能看、能听、能说话了

OpenAI 给 ChatGPT 加了语音和图片功能。语音部分,你对着手机说话它能回你,背后用了一个新的文字转语音模型,拿几秒真人录音就能合成很像人的声音,还接入了自家的 Whisper 做语音识别。图片部分,你可以拍照或截图发给它,让它看图说话,底层是 GPT-3.5 和 GPT-4 的多模态版本。

推荐理由:OpenAI 为 ChatGPT 加入语音对话与图片理解,语音合成用几秒真人录音即可生成相似声音,图片部分基于 GPT-3.5 和 GPT-4 的多模态版本。