跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

116 条精选相关主题多模态AI 视频产品更新

最新精选

第 1–20 条 · 共 116 条

9月25日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次切换的动态视觉形象。

推荐理由:原文给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 语言支持,可据此判断企业级多模态交互的落地形态。

TechCrunch · AI

谷歌开始测试让 Gemini 替你打电话给商家,目前仅限美国 Pixel 11 用户

谷歌推出了一个叫“Call for Me”的实验功能,能让 Gemini 直接帮你打电话给商家。目前门槛很高:你得人在美国、用 Pixel 11 手机、付费订阅了 Gemini,还得装测试版的谷歌电话 App。这次更新最大的变化是,Gemini 可以分享你事先批准的个人信息,这样它能处理的事情就更多了,比如预约或查询订单。打电话时你可以实时看文字记录,...

推荐理由:谷歌在测试一项功能,让 Gemini 替你打电话给商家,并且能分享你批准过的个人信息去处理预约或查订单。门槛很高——人在美国、Pixel 11 手机、付费订阅 Gemini、还得装测试版电话 App——所以目前更像技术预览,分数没给太高。但方向很明确:AI 开始从屏幕后面走出来,直接替你张嘴办事了。

9月24日星期四

Latent Space

Meta Connect 2026:Muse 助手登陆眼镜,支持语音和视频,还多了个叫 Charm 的新硬件

Meta 在 Connect 大会上把 Muse 定位成硬件加智能体的核心。Muse 现在能语音对话、看实时视频,还能在后台处理长时间任务,甚至有了自己的邮箱地址,你可以抄送邮件让它干活。Mac 版支持电脑操作,排好任务就能走人。目前免费,但以后可能会从交易里抽成;零售合作方包括沃尔玛、百思买和丝芙兰,效率工具接入了 Box、GitHub 和 Noti...

推荐理由:Muse 在 Connect 大会上的更新挺实在:语音对话、实时视频理解、后台任务、独立邮箱、Mac 桌面操控,还列了一串零售和生产力工具的集成名单。不是虚的概念发布,有可验证的合作方。分数没给更高是因为来源是付费 newsletter,信息本身有料但传播面有限。

The Verge · AI

Meta 亮出 Muse Charm:一个不带表带的 AI 小屏设备,靠指纹唤醒语音

Meta 在 Connect 大会结尾快速展示了一款叫 Muse Charm 的独立 AI 硬件,专门跑自家的 Muse 智能体。它长得像一块摘掉表带的厚智能手表,配了根挂绳。右上角有指纹传感器,按下去就能直接说话下指令,不用掏手机解锁。正面至少开了三个麦克风孔,还塞了一颗小摄像头。正文没公布价格、续航和上市时间,目前只是露个脸。

推荐理由:Meta 在 Connect 大会结尾快速亮了一款叫 Muse Charm 的独立 AI 硬件,长得像摘掉表带的厚智能手表,挂绳一穿就能戴。右上角指纹传感器按下去直接说话下指令,正面开了至少三个麦克风孔,还藏了一颗小摄像头。我会先打个折:正文没公布价格、续航和上市时间,目前只是露个脸,所以信息量偏薄。但 Meta 在 Ray-Ban 智能眼镜之后又试了一种新形态,把自家 Muse 智能体塞进一个独立设备里,这个动作本身对做 AI 硬件的人有参考价值,分数就定在 72。

The Verge · AI

Meta 要把 Muse AI 助手塞进智能眼镜,喊名字就能唤醒

Muse 上线才两周,Meta 就说正在把它往智能眼镜里搬,包括 Connect 大会上新发布的款式。用法很简单:喊一声 Muse,就能让它带着你做运动、记吃了什么,或者帮你看看眼前的东西值不值得买。眼镜还会加一个听力增强功能,Meta 说已经过了 FDA 认证,给轻度到中度听损的成年人用。不过正文没提什么时候上线,也没说哪些型号能用上 Muse。

推荐理由:把 Muse 搬上眼镜是 Meta 把 AI 助手从手机推向穿戴设备的关键一步,三个用例也够实在。但正文没给上线时间和支持型号,我会先打个折,分数刚好卡在 featured 门槛上。

AI HOT 精选

GPT Voice 能帮你发邮件、查日历、调 Slack 了,还进了 ChatGPT Work

Greg Brockman 说 GPT Voice 现在可以调用邮箱、日历、Slack 这些工具,背后跑的是 GPT-6 Astra、Sol 和 Luna 三个模型。语音功能也同步上了网页端和移动端的 ChatGPT Work,你动嘴就能在浏览器里建文档、做 PPT、搭网站或填表格。今天起全球最新版应用会逐步推送。不过正文没提语音响应延迟、识别准确率,...

推荐理由:Brockman 亲自宣布,GPT Voice 从对话玩具变成能调用工具的工作入口,还挂上了 GPT-6 模型家族的名号,信号强度够上 featured。没给到 90 以上是因为正文完全没提语音延迟、识别准确率这些实际体验的关键指标,我会先打个折。

AI HOT 精选

ChatGPT Voice 现在能直接操作你的邮箱、日历和 Slack,说是由 GPT-6 的几个模型驱动

OpenAI 给 ChatGPT 的语音功能接上了插件,你可以用嘴让它查邮件、翻日历、在 Slack 里发消息。语音版在 ChatGPT Work 的网页和手机端都能用,号称能靠说话生成文档、PPT、网站和表格。官方说背后是 GPT-6 的 Astra、Sol、Luna 这几个模型,当天就推了全球更新。不过正文完全没提插件权限范围有多大、响应延迟怎么样...

推荐理由:语音加办公插件是个实打实的产品升级,又一口气亮出三个 GPT-6 模型名,料给得挺足。分数没给更高,是因为正文完全没提插件权限范围有多大、响应延迟怎么样——这两块不交代清楚,实际好不好用还得打个问号。

AI HOT 精选

ChatGPT 语音版接入邮件、日历和 Slack,底层换成了 GPT-6 系列模型

OpenAI 给 ChatGPT 语音加上了邮件、日历和 Slack 插件,现在你可以用嘴直接操作这些工具。驱动模型换成了 GPT-6 Astra、Sol 和 Luna,但正文没解释这三个模型分别负责什么、能力差在哪。网页和手机端的 ChatGPT Work 也支持语音输入了,说句话就能建文档、做 PPT、搭网站或填表格。我会先打个折——官方没提推送地...

推荐理由:给 ChatGPT 语音加上邮件、日历和 Slack 插件,是一次实打实的产品扩展,从聊天迈进了办公自动化。GPT-6 的三个子模型 Astra、Sol、Luna 首次被点名,但官方没给任何能力拆解,信息密度比标题看起来要薄。我会先打个折——正文没提推送地区、上线时间,也没解释三个模型的分工,这些关键缺口让更新看起来更像预告而非完整发布。

8月10日星期一

Hacker News 首页

Kinney Drugs 因数百起投诉叫停 AI 电话助手

连锁药店 Kinney Drugs 上线三个月的 AI 电话助手 Burt 被紧急撤回,原因是顾客投诉电话内容混乱、报错剂量、漏掉处方提醒。总裁 John Marraffa 承认,合规不等于体验好,他们搞砸了。现在患者来电恢复传统的按键式系统,Burt 只保留在用户主动订阅的续方短信通知里。报道没提底层用的是哪家模型或语音供应商。

推荐理由:一家连锁药店把 AI 电话助手撤了,原因是剂量报错、处方提醒漏发,CEO 还公开认栽——医疗场景里这么诚实的失败复盘很少见。分数没给更高,因为正文没提底层用的是哪家模型或语音供应商,技术根因只能靠猜。

7月28日星期二

Ben's Bites

Claude Opus 5 发布,价格只有 Fable 5 的一半,但早期用户吐槽它爱抬杠、爱提前收工

Anthropic 发了新模型 Claude Opus 5,定价直接砍半,号称能力接近 Fable 5。但 Every 的评测发现它用起来很别扭:会跟人争论、任务没做完就停,还跟老一套的提示词技巧犯冲。有意思的是,同一个人嘴上说讨厌,盲测打分时却把 Opus 5 排在了第一。Theo 花了几个小时重写 CLAUDE.md 和技能文件,说虽然累但完全值得...

推荐理由:Anthropic 发新模型还降价,本身是条硬消息。Every 和 Theo 的实测给出了具体信号:能力强但脾气怪,得重写提示词才能顺。跨信源的讨论正在形成,不过目前只有摘要,缺完整评测细节,我会先打个折。

7月24日星期五

TechCrunch · AI

ChatGPT 桌面端终于能听懂人话并直接操作电脑了

OpenAI 把月初发布的 ChatGPT-Live 语音模型搬到了桌面应用上。现在你可以直接用嘴指挥 ChatGPT,让它操作智能体、浏览网页,或者在 macOS 上通过 Appshots 读取屏幕内容。手机版之前只能聊天,这次桌面版是实打实的干活:演示里一个开发者用一句话就让 ChatGPT 新建了讨论串、提交了合并请求,还顺带找到了一个 bug ...

推荐理由:OpenAI 把 ChatGPT-Live 语音模型搬上了桌面端,加了屏幕读取和浏览器控制,让语音真正能驱动智能体干活。开发者演示很具体,一句话完成分支、MR、找 bug,实用性拉满。没给更高分是因为刚发布,实际稳定性和权限边界还不清楚,我会先打个折。

AI HOT 精选

Claude 语音模式现在能跑 Opus 和 Sonnet 了,还能在说话时直接调你的 Gmail 和 Slack

Anthropic 把 Claude 的语音模式升级了,现在背后可以调用 Opus 和 Sonnet 这两个更强的模型来处理复杂问题,不再是以前那种轻量版。你还能在语音对话里直接让它操作已连接的工具,比如搜 Gmail 邮件或查 Slack 消息,不用切回文字界面。多语言支持也加上了,但官方没列出具体支持哪些语言。实际用起来的延迟和工具调用的准确率怎么...

推荐理由:Anthropic 这次语音模式升级把模型能力和工具调用两个缺口一次性补上了,对 Claude 用户群来说是实打实的体验提升。但正文没给出延迟数据、工具调用准确率,也没列具体支持哪些语言,信息有缺口,所以分数先压在 85 以下。整体够得上 featured。

AI HOT 精选

ChatGPT 桌面版能靠语音指挥多个智能体干活了

OpenAI 给 macOS 和 Windows 的 ChatGPT 桌面应用加上了语音控制,你可以直接说话让 ChatGPT Work 或 Codex 里的多个智能体协同工作。背后是 GPT-Live 在跑,能同时听、说、协调任务。今天起 Plus、Pro、Business、Edu 和 Enterprise 用户都能用。正文没提延迟多少、能同时跑几个...

推荐理由:OpenAI 把语音控制的多智能体协作直接搬到了桌面端,交互上确实往前走了一步。GPT-Live 全量推给付费用户,说明他们自己觉得能用了。分数没给更高,是因为正文完全没提延迟和并发上限——实际用起来卡不卡、能同时带几个 agent,现在还不知道,这点先别太激动。

The Verge · AI

Claude 的语音模式现在支持 Opus 和 Sonnet,还能读你的 Gmail 和 Slack

Anthropic 把语音模式从 Haiku 扩展到了 Opus 和 Sonnet,三个模型现在都能用语音交互了。更实际的变化是,语音模式可以接入 Gmail、Slack 这类应用,直接读出你的邮件和消息。不过正文没提延迟和准确率数据,实际体验好不好用,建议等上手测试再说。

推荐理由:Anthropic 把语音模式铺到了 Opus 和 Sonnet,还接上了 Gmail、Slack,实用性和话题性都有。但正文没给延迟和准确率数据,实际体验得等上手,所以分数压在 80 以下。

TechCrunch · AI

Claude 语音模式升级:能选 Opus/Sonnet/Haiku 模型,还能直接操作你的 Gmail 和 Slack

Anthropic 给 Claude 的语音模式换了底模,现在你可以手动选 Opus、Sonnet 或 Haiku,默认会沿用你上次文字聊天用的模型。官方说这能撑住更长的对话,比如帮你打磨沟通方式、过一遍客户提案、或者脑暴市场调研。更实际的变化是,语音模式现在能接通 Gmail、Google 日历、Slack、Canva 和 Notion,直接让它改会...

推荐理由:Anthropic 把语音模式的后台模型换成了用户可自选的 Opus/Sonnet/Haiku,同时接入了五个生产力工具,属于扎实的功能补强。没给 85 分以上是因为这更像追平竞品而非范式突破,而且正文没披露实际使用中的延迟或准确率数据,我会先打个折。

7月9日星期四

Ben's Bites

SpaceXAI 和 Cursor 联手训出 Grok 4.5,成本只有 Opus 的六分之一

SpaceXAI 和 Cursor 一起训了个新模型 Grok 4.5,性能大概卡在 Opus 4.7 和 4.8 之间,但按 token 算钱的话,比 Opus 便宜 6 倍,比 GPT-5.5 便宜 3 倍。现在 Cursor 里能用,API 也开放了。OpenAI 这边,GPT-5.6(Sol、Terra、Luna)今天会推给所有用户,早期测试的...

推荐理由:SpaceXAI 和 Cursor 联合发布 Grok 4.5,有具体性能区间和价格对比,三个维度都踩中了。扣分是因为来源是 newsletter 摘要而非一手公告,且正文截断,GPT-5.6 信息不全。跨源验证后加 3 分到 82,整体判断不变。

6月24日星期三

AI HOT 精选

ChatGPT 语音能边听边说了,新模型 Bidi 1 开始灰度测试

部分用户已经在 ChatGPT 网页版和 App 的模型选择器里看到了 Bidi 1,和标准语音、高级语音并列,选中后语音气泡会变黄。它最大的变化是支持全双工:模型在说话的同时还能继续听你讲话,中途打断也能立刻响应。测试里有人让它从 1 数到 10,数到一半打断说“倒数”,它马上照做。OpenAI 还没正式公布上线时间,有媒体猜本周可能会扩大测试范围。...

推荐理由:OpenAI 语音能力一次实质升级——全双工加打断响应是之前高级语音模式做不到的。目前只部分推送、官方还没正式公告,所以分数不往上顶。但交互方式的改变够得上 featured。

6月18日星期四

AI HOT 精选

火山引擎把豆包实时语音模型 3.0 的 API 放出来了,现在还在邀测

这个模型叫 Seeduplex,是个原生全双工端到端语音模型,意思是它能一边听一边说,不用等你说完再反应。官方给了三个卖点:指令跟得准、抗干扰、会自己判断什么时候该接话。比如多人聊天时它能安静待着,只有聊到指定话题才插嘴;还能在对话里直接调用工具帮你订日历、发邮件。抗干扰方面,误回复和误打断都少了很多。判停延迟缩短了约 250 毫秒,复杂场景下抢话比例...

推荐理由:字节第一个全双工端到端语音模型开放邀测,有延迟和抗干扰的量化数据,不是纯营销稿。扣分点:仅邀测,没公布定价和规模,真实环境表现待验证。

AI HOT 精选

Google 把 Gemini 塞进了一台 99 美元的音箱,想让你跟它聊天而不是下指令

Google Home Speaker 是第一款围绕 Gemini 做的音箱,99.99 美元,现在就能预订,本月发货。它支持说话中途改口、不用反复唤醒就能接着聊,内置了 10 种新声音。我会先打个折:这些听起来像连续对话的能力,其实分两层。基础的多步指令和打断纠错是机器自带的,但真正像人一样自由聊天的 Gemini Live,以及让音箱帮你总结 Ne...

推荐理由:99 美元定价和即日预订是硬信息,Gemini 首次落地音箱也够分量。没给更高分是因为目前只有发布信息,连续对话和 Gemini Live 的自由聊天能力还没经过真实环境验证,正文也没披露具体延迟和端侧模型细节。

6月15日星期一

彭博科技

新 Siri 能救苹果的 AI 困局吗?彭博上手后列出 7 个改进点

彭博的 Mark Gurman 提前用上了新版 Siri,总结了 7 个实际改进:响应更快、能看懂屏幕内容、可以跨 App 操作、声音更自然等。但核心问题没变——Siri 还是把复杂请求丢给 ChatGPT,自己只处理简单指令。Gurman 的判断是,这次更新把 Siri 从“灾难”拉回到“勉强能用”,但离苹果在 WWDC 2024 画的那个主动式助手...

推荐理由:Gurman 这篇是实机体验,7 个改进点都有具体场景,信息密度够。但核心短板没变——Siri 自己处理不了复杂请求,只能当 ChatGPT 的传话筒,所以分数卡在 78 而不是更高。