跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

116 条精选相关主题多模态AI 视频产品更新

最新精选

第 101–116 条 · 共 116 条

4月3日星期五

X · @OpenAI

ChatGPT 上车了,现在能在 CarPlay 里用语音模式

OpenAI 把 ChatGPT 的语音模式搬进了 CarPlay,iPhone 用户升级到 iOS 26.4 以上就能在车里用。正文没提支持哪些国家、哪些车型,也没说功能有没有阉割,比如能不能连续对话、能不能读长文章。这次动作的重点是把对话入口塞进驾驶界面,不是发了新模型。

推荐理由:这次更新更像是一次分发渠道的扩展,而不是模型本身有什么变化。ChatGPT 出现在 CarPlay 里,意味着它开始抢占车载语音交互的位置,这点比功能细节更值得关注。不过正文没披露地区、车型和功能限制,实际落地范围还得再观察,先别太激动。

3月24日星期二

Mistral AI

Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。

推荐理由:原文给出 4B 参数、9 种语言、70ms 延迟与定价,读者可据此判断企业语音智能体的成本与选型空间。

2月14日星期六

MIT Technology Review · AI

渐冻症夺走了这位音乐人的声音,AI 让他重新站上舞台唱歌

32 岁的 Patrick Darling 在确诊渐冻症两年后,用 AI 克隆了自己的歌声,2 月 11 日在伦敦重新和乐队一起演出。他的声音克隆不是用录音棚素材做的,而是从嘈杂的手机视频和厨房录音里拼出来的,ElevenLabs 的音乐工具花了大约六周调校。这件事的信号不在感人,在于门槛:ElevenLabs 把工具免费开放给因渐冻症等疾病失声的人,...

推荐理由:我会先打个折:这不是模型或产品大更新,而是一个应用案例。但案例本身够硬——ALS 患者用旧录音唱歌,不是概念演示,是真实上台。正文给了两个关键条件:10 分钟清晰语音和 6 周从噪音片段里抠出歌声,说明门槛和代价。ElevenLabs 把这个流程做成免费项目,但正文没披露底层模型细节,这点先别太激动。整体看,故事性强、有可复现信息、踩中声音权利话题,适合放低 featured。

2月9日星期一

36 氪 · 直链

小红书把搜索框改成了语音问答,想让你用说话代替打字来搜生活经验

小红书在1月27日全量上线了“语音问一问”,用户在搜索页长按就能用语音提问,最长能说三分钟,也支持外语和方言。它给出的答案不是通用百科,而是把站内用户分享的真人经验总结成结构化回复,比如剪头发怎么跟理发师沟通这种非标问题。正文没披露背后的语音识别和模型技术方案,也没提延迟和准确率数据。这次改动的核心是把搜索从三四个字的关键词匹配,拉长到口语化的长句提问...

推荐理由:小红书把搜索框改成能长按语音提问,这事我会先打个折——正文没披露用的什么语音识别方案、模型延迟和准确率,所以实际体验稳不稳还不好说。但值得盯的是,它把原本短关键词搜索变成了长语音问题入口,等于在抢更细颗粒度的查询需求。对AI从业者来说,这是内容平台用语音+外挂资料库做搜索的落地样本,虽然技术细节缺位,但产品方向和上线节奏本身就有信号意义。

36 氪 · 直链

前百川智能联创焦可离职做来福电台,想造能记住你喜好的 AI 主播

焦可离开百川智能后,在 2025 年初创办了 AI 音频公司“来福电台”。他做的不是单纯的 AI 播客工具,而是 15 个中文和 2 个英文 AI 主播,每个主播风格不同,能根据用户收听历史推荐内容,用户也可以随时打断节目提问或聊天。焦可认为语音交互能产生足够多的长上下文,让 AI 记住用户偏好,这是建立情感链接和个性化服务的关键。来福在 2025 年...

推荐理由:这篇值得上featured,因为它把一个容易被当成“AI播客工具”的产品讲清楚了真正想赌的方向:不是生成音频,而是造有记忆、可交互的AI主播。硬信息够实,融资额、主播数量、使用时长、内容生成速度都有,而且把DTU和长记忆当成基础设施壁垒在说,不是空谈概念。车载合作这条线虽然没展开细节,但已经给出一个可验证的落地场景。公司阶段偏早期,所以放在featured而不是p1,但判断本身有信息量,我会先打个折观望后续数据。

2月5日星期四

Mistral AI

Mistral 发布 Voxtral Transcribe 2 语音转写模型家族

Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。

推荐理由:原文给出两款语音转写模型的延迟、价格与开源许可,可据此判断实时语音应用的选型空间。

2025年9月30日星期二

OpenAI News

OpenAI 发布 Sora 2 系统卡,视频生成模型能同时出画面和声音了

OpenAI 在 9 月 30 日公布了 Sora 2 的系统卡,说这个新模型在物理规律、画面真实度、音画同步和风格控制上都比上一代强,能更准地跟着用户的指令走。这次发布先走邀请制,在 sora.com 和独立的 iOS App 上小范围开放。安全方面,上线初期禁止上传视频,也禁止上传带真人照片的图片,对涉及未成年人的内容有更严的审核门槛。正文没提 A...

推荐理由:这条落在 78–84 分档。H 来自 Sora 2 加独立 App 的钩子;K 来自明确的上线限制和安全规则;R 来自竞争和肖像滥用风险。没给更高分是因为价格、评测分数、上下文长度和 API 时间点正文全都没披露,我会先打个折。

OpenAI News

OpenAI 发布 Sora 2,能生成带同步对白和音效的视频,还做了一个社交 App

OpenAI 在 9 月 30 日发布了视频生成模型 Sora 2,同时上线了一个叫 Sora 的 iOS 社交 App。Sora 2 比上一代更遵守物理规律,比如投篮不进会弹框而不是球直接瞬移进筐,也能生成同步的人物对白和环境音效。App 里有个“角色”功能,你录一段视频和音频验证身份后,就能把自己的形象和声音放进任何生成的场景里。OpenAI 说这...

推荐理由:我会先打个折,因为价格和时长这些关键限制都没披露,没法判断实际可用性。但这条消息值得立刻写:OpenAI 在同一天发了 Sora 2 模型和独立的 Sora App,产品形态直接从技术演示跳到了带推荐流的社交应用。模型能同步出视频、对白和音效,还有个“characters”功能,用一次性录像验明正身再把真人形象注入视频——这点先别太激动,正文没讲清楚隐私和滥用防护细节。真正该盯的是分发方式变了,OpenAI 开始用消费级产品逻辑铺视频生成,而不是只给开发者或研究者玩。

2025年8月28日星期四

OpenAI News

OpenAI 发布 gpt-realtime 模型,语音 API 正式上线并支持电话和图片输入

OpenAI 把 Realtime API 从公测转成了正式版,同时推出了新的端到端语音模型 gpt-realtime。这个模型不再走“语音转文字再转语音”的老路,而是直接处理音频,延迟更低,语气和情绪保留得更好。新模型在听懂复杂指令和调用工具上进步明显:Big Bench Audio 推理得分从去年 12 月版的 65.6% 提到了 82.8%,Mu...

推荐理由:这不是小修小补,是 OpenAI 把语音模型、工具链和电话接口一次补齐的版本。gpt-realtime 的基准分涨了十几到二十个百分点,虽然 MultiChallenge 的 30.5% 说明复杂场景还吃力,但配合 MCP 远程服务器和 SIP 通话,语音代理终于能跑通完整业务闭环了。我会先打个折——正文没给延迟和并发数据,实际部署成本还得自己测,但方向是对的,所以给到 p1。

2025年7月17日星期四

Mistral AI

Mistral 为 Le Chat 推出 Deep Research、语音模式等新功能

Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言思考模式、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

推荐理由:Mistral 官方一次性公布 Le Chat 五项新功能,读者可据此了解其研究、语音与图像编辑能力的组合方式。

2025年7月15日星期二

Mistral AI

Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备内置问答与摘要、多语言识别和语音函数调用能力,并保留 Mistral Small 3.1 的文本能力。

推荐理由:Mistral 开源两款语音理解模型,给出 32k 上下文、函数调用等能力与低于同类 API 一半的定价,便于评估语音方案选型。

2025年3月21日星期五

OpenAI News

OpenAI 和 MIT 合作研究:跟 ChatGPT 聊感情的人很少,但重度语音用户里有一小撮人把它当朋友

OpenAI 和 MIT 媒体实验室联手做了两项研究,想搞清楚人跟 ChatGPT 聊感情会不会影响心理健康。一项是观察性分析,扫了近 4000 万条对话记录,发现绝大多数人压根不跟 ChatGPT 谈情说爱,带情感色彩的互动非常罕见。另一项是持续四周的随机对照试验,找了近 1000 名参与者。结果显示,即便在重度用户里,高频率的情感交流也只集中在极少...

推荐理由:OpenAI 和 MIT 用两项研究摸 ChatGPT 的情感使用底牌,一项分析近 4000 万次交互,另一项让近 1000 人连续 4 周参与随机对照试验。正文确认情感性互动在平台上属少数场景,但真正危险的是分层看:平均值会淹没小样本高情感依赖用户,这点先别太激动,等完整量化结果出来再下判断。

2025年3月20日星期四

OpenAI News

OpenAI 发了三款新语音模型:两个听写,一个会学语气说话

OpenAI 在 3 月 20 日往 API 里塞了三个新音频模型:gpt-4o-transcribe 和 gpt-4o-mini-transcribe 负责把语音转成文字,gpt-4o-mini-tts 负责把文字念出来。听写模型在 FLEURS 等多语言基准上跑分比 Whisper v2、v3 都低,低的是词错率,说明在口音重、环境吵、语速快的时候...

推荐理由:OpenAI 在 API 里发了三个音频模型,给了具体的基准和机制细节,所以 HKR 三项都过了,featured 没问题。分数我维持 84,没往上加,因为正文没披露价格、延迟,基准对比也只给了 FLEURS 一个点,信息还不够全。

2024年10月1日星期二

OpenAI News

OpenAI 发布 Realtime API 公测版,让开发者直接调用 GPT-4o 做低延迟语音对话

OpenAI 在 2024 年 10 月 1 日推出了 Realtime API 的公测版,所有付费开发者都能用。这个接口通过一个持久的 WebSocket 连接,把音频直接流式传给 GPT-4o,再流式返回语音,省掉了以前那种“先转文字、再生成回复、最后转语音”的串联流程。好处是延迟更低,能保留语气和重音,还能自动处理用户插话。API 支持函数调用,...

推荐理由:OpenAI 把语音交互从多模型拼接改成一条 WebSocket 直连 GPT-4o,延迟和打断处理都内建了,还给了函数调用和明确定价。对做实时语音 agent 的开发者来说,这是可以直接动手试的东西,不是概念稿。我会先打个折:公测阶段稳定性、实际延迟和成本还没大规模验证,但信息量和可操作性已经足够当天写。

2024年8月8日星期四

OpenAI News

GPT-4o 系统卡:语音响应快过人类,但声音安全是最大隐患

OpenAI 在 8 月 8 号发了 GPT-4o 的系统卡,把安全底牌摊开来看。这个模型能直接吃文本、音频、图片和视频,输出也一样,最快 232 毫秒就能回话,平均 320 毫秒,跟人聊天反应速度差不多。API 价格比 GPT-4 Turbo 便宜一半。在 OpenAI 自己的安全框架里,网络安全、生物威胁、模型自主性三项风险都是低,说服力这项擦边踩...

推荐理由:这不是一篇例行公事的发布。它把 preparedness 四类风险评级、232 毫秒语音延迟和明确的部署门槛都摆出来了。HKR 三项全中,但本质是安全披露而非新模型或重大产品发布,所以放在 featured 而不是 p1。

2023年9月25日星期一

OpenAI News

ChatGPT 现在能看、能听、能说话了

OpenAI 给 ChatGPT 加了语音和图片功能。语音部分,你对着手机说话它能回你,背后用了一个新的文字转语音模型,拿几秒真人录音就能合成很像人的声音,还接入了自家的 Whisper 做语音识别。图片部分,你可以拍照或截图发给它,让它看图说话,底层是 GPT-3.5 和 GPT-4 的多模态版本。这两个功能会先推给 Plus 和 Enterpris...

推荐理由:这是一次实打实的 OpenAI 产品更新:标题确认了视觉输入、语音输入和语音输出,所以 HKR 三项都踩中了。正文没给版本、推送范围、延迟和定价,我会先打个折,停在 88 分而不是拉满。别被标题骗了,真正要盯的是语音延迟、视觉理解边界和调用入口。