跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

116 条精选相关主题多模态AI 视频产品更新

最新精选

第 61–80 条 · 共 116 条

5月20日星期三

AI HOT 精选

谷歌发布 Antigravity 2.0,用 93 个并行子智能体 12 小时搭出一个操作系统

谷歌在 I/O 大会上放出了 Antigravity 2.0 平台,已经对全球用户开放。现场演示里,他们让智能体从零构建了一个能跑起来的操作系统,只用了 12 小时。具体做法是同时跑 93 个子智能体,总共调了超过 1.5 万次模型、处理了 26 亿个 token,最后算下来 API 成本不到 1000 美元。平台本身集成了新的智能体系统和自然语音交互...

推荐理由:谷歌在 I/O 上放了个 Antigravity 2.0 的演示,让智能体用 12 小时、93 个并行子智能体、1.5 万次模型调用和 26 亿 token 搭出一个能跑的操作系统,API 成本不到 1000 美元。我会先打个折:这是发布会演示,不是可复现的公开测试,正文没披露可用性、定价和复现条件,所以别直接当成采购依据。但数字本身挺实在,12 小时和不到 1000 美元这两个数,对想用智能体做复杂工程的人是个参考锚点。标题够抓人,信息量也足,从业者会想点进去看细节,整体值得推。

AI HOT 精选

谷歌发布 Gemini Omni 模型,任意输入都能生成任意输出,一句话就能改视频

谷歌在 I/O 2026 大会上推出了 Gemini Omni,这是 Gemini 家族目前能力最全的版本,能同时处理文字、图片、音频和视频,并直接生成这些格式的内容。现场演示了对话式视频编辑,用户说句话就能换掉视频里的角色或背景。先放出来的是速度更快的 Gemini Omni Flash,已经在 Gemini App、Google Flow 和 Yo...

推荐理由:谷歌在 I/O 上扔出 Gemini Omni 和 Omni Flash,主打全模态互转,一句话就能让 AI 改视频,听着挺猛。我会先打个折:API 什么时候开、怎么收费、跑分多少,正文全没提。Flash 已经进了自家三个产品,说明至少能跑起来,但外部开发者还得干等。这点先别太激动,等有定价和延迟数据再判断值不值得接。

r/LocalLLaMA

6GB 显卡跑本地会议纪要的下限测试:Qwen3.5 0.8B 用 57 秒出结果,Granite 4 350M 快但会瞎编

一位用户在 RTX 3060 笔记本(6GB 显存)上拿 VoiceFlow 1.6.0 测了两款小模型,看谁能在本地把一段 4 分钟的会议转成纪要。Qwen3.5 0.8B 在 16K 上下文窗口下花了 57 秒完成总结,结果可用。Granite 4 350M 速度很快,0.6 到 2.8 秒就出稿,但会凭空捏造内容,比如编出币安和《星际迷航》的情节...

推荐理由:一个 Reddit 用户拿笔记本 3060 6GB 跑 VoiceFlow 1.6.0 做会议总结,Qwen3.5 0.8B 用 57 秒处理 4 分钟录音,Granite 4 350M 虽然快到 0.6-2.8 秒但会凭空编造内容。我会先打个折,这是单人单卡的一次性测试,不是系统评测,但 6GB 这个门槛和幻觉案例对想本地跑会议总结的人有直接参考价值,所以给 73 分 featured。

5月19日星期二

r/LocalLLaMA

有人租了 21 款 GPU 跑同一个 5GB 显存的小 TTS 模型,实测速度差距

一位 Reddit 用户为了测 OmniVoice 这个小 TTS 模型,在 vast.ai 上租了 21 款不同的 GPU。模型跑起来显存峰值大概 5GB,不算大。测试用 xRT 作为音频生成速度的指标,每张卡都跑了 3 次带参考音频的声音克隆取平均。正文没披露具体哪张卡最快、速度差多少倍,也没给价格和性价比对比,所以只能看出有人在认真做横向实测,但...

推荐理由:一个 Reddit 用户用 vast.ai 租了 21 款 GPU,跑 OmniVoice 这个小体量 TTS 模型,峰值显存才 5GB,每次测试跑 3 遍取平均 xRT。我会先打个折:这是个人在云租用环境下的非严格基准,不是实验室受控测试,但胜在真实、直接,能帮想自己部署语音合成的人快速筛显卡。正文没披露具体 xRT 数值表,只给了结论性对比,这点先别太激动。整体信息量对本地推理圈子有用,但范围偏窄,所以放在低 featured 档。

5月15日星期五

AI HOT 精选

xAI 把 Grok 订阅接入了 Nous Research 的开源智能体 Hermes

现在你可以用 Grok 的付费账号,直接在 Hermes Agent 里跑 Grok 4.3 的文字聊天和推理、用语音合成让智能体出声回复,还能让智能体调用 Grok Imagine 生成图片和视频。Hermes 本身是个开源、能自我改进的智能体,可以在电脑、沙盒或 VPS 上持续运行,跨会话积累长期记忆,也能连 WhatsApp、Discord 等消...

推荐理由:这是一次中等体量的产品集成,把 Grok 塞进开源的 Hermes 智能体里,不是旗舰模型发布。有实际可玩性,但冲击力没到当天必看级别,放 featured 刚好。

AI HOT 精选

Arm 和 Google 联手,让手机本地跑音频模型快了 2 倍多

Arm 的新指令集 SME2 把矩阵计算单元直接塞进了 CPU,不用再纠结是忍受 CPU 慢还是外挂专用加速器。Google AI Edge 的 LiteRT 和 XNNPACK 能自动调用这套指令,拿 Stability AI 的音频生成模型 stable-audio-open-small 在 Arm 手机上测试,生成速度提升超过 2 倍,内存占用降...

推荐理由:我会先打个折:这篇只针对一款音频模型在 Arm 设备上的优化,覆盖面不宽。但 2 倍加速和 4 倍内存缩减这两个数字很实在,不是实验室跑分,是直接落到移动端和笔记本上的效果。文章把 SME2 指令集怎么跟 Google AI Edge 的推理管线配合讲得比较清楚,没有堆术语吓人。对正在头疼边缘端延迟和内存成本的团队来说,这是一条能直接抄作业的参考。信息量够上 featured,但别指望它能推广到所有生成式模型。

5月13日星期三

AI HOT 精选

谷歌在 Android Show 2026 上发了新助理 Android Intelligence,能跨 App 自动干活

谷歌这次推的 Android Intelligence 是一个系统级智能助理,主打跨安卓应用的多步骤自动化任务,比如你让它订咖啡、回消息、填表,它可以自己切 App 完成。Chrome 里的 Gemini 也加了浏览器操作能力,能直接帮你操作网页。另外还有语音笔记转文字功能叫 Rambler,以及可以自定义的生成式 UI 小组件。整场发布没提具体推送时...

推荐理由:这条消息抓人是因为安卓系统级的智能助理,能跨 App 自动操作,不是某个 App 的小修小补。具体放出的功能点挺实在:Chrome 里让 Gemini 直接帮你用浏览器、自动填表、语音转文字,还有可定制的小组件,都是开发者能马上摸到的界面。正文没给技术细节和实际延迟数据,所以效果先打个折。但这件事本身是移动 AI 代理的卡位战,对做工具和分发的团队来说,风向意义大于单点功能。

TechCrunch · AI

Google 把 Gemini 塞进 Gboard 语音输入,做听写的小公司要头疼了

Google 开始在 Gboard 键盘里用 Gemini 模型做语音转文字,首批只推给三星 Galaxy 和 Pixel 手机。正文没提支持哪些语言、要不要联网、怎么收费,也没说具体哪天全面推送。对专门做听写工具的创业公司来说,系统自带且模型更强的免费方案一旦铺开,付费墙就很难立住了。

推荐理由:我会先打个折:正文没写支持哪些语言、收不收费、能不能离线用、什么时候铺开,这些关键信息全是空白。能确认的是 Gemini 听写已经进了 Gboard,而且先给三星和 Pixel 用,这对靠听写 API 或 App 吃饭的创业公司不是好消息。Google 把模型塞进输入法,用户不用额外装东西就能用,第三方想靠体验或定价差异化会越来越难。这点先别太激动,毕竟没看到实测延迟和准确率,但方向本身对做语音工具的团队是个明确的挤压信号。

5月12日星期二

TechCrunch · AI

AI 语音公司 Vapi 拿下亚马逊 Ring 订单后估值冲到 5 亿美元,从 40 多家对手中胜出

Vapi 做的是让 AI 接打电话的语音平台。亚马逊旗下的 Ring 在评估了 40 多个方案后选了它,用来处理客户支持和销售电话。公司说从 2025 年初到现在,企业业务规模翻了十倍,最新一轮融资后估值达到 5 亿美元。不过正文没披露具体营收数字和 Ring 这笔单子的金额,所以这个十倍增长是从多小的基数算起的,得打个折看。

推荐理由:一条融资新闻能到 featured,靠的是 Amazon Ring 那场 40 选 1 的比稿。这不是 PR 通稿里自己说“领先”,而是客户掏钱投票的结果。5 亿美元估值和 10 倍企业增长让故事有厚度,但正文没披露收入基数,所以 10 倍到底是从 10 万涨到 100 万还是更大体量,这点先别太激动。整体看,语音 agent 进大客户采购流程这件事本身比估值数字更有信息量。

新智元 · 公众号

OpenAI 发布 GPT-Realtime-2,一个号称 GPT-5 级推理能力的实时音频模型

OpenAI 推出了 GPT-Realtime-2,官方把它叫做“GPT-5 级推理音频模型”。同时发布的还有 Realtime-Translate 和 Realtime-Whisper 两个配套工具。新模型支持 128K 上下文窗口,提供五档推理强度可选,API 定价是每百万输入 token 32 美元、输出 token 64 美元。不过,这篇文章因...

推荐理由:OpenAI 同一天发的产品更新,实时音频推理是个硬功能,不是概念稿。128K 上下文和 5 档推理强度让开发者能按场景调成本与效果,32/64 美元的定价也给了算账依据。我会先打个折:正文没提延迟数据和实际录音样本,这点先别太激动。但语音 agent 的落地成本一直是瓶颈,这篇信息密度够,值得推给做实时交互的从业者。

Latent Space

Thinking Machines 发布原生交互模型:2760 亿参数,120 亿激活,实时语音不再靠外挂

Thinking Machines 终于又冒泡了,这次直接扔了个新模型 TML-Interaction-Small。总参数 2760 亿,是个 MoE 架构,实际干活时只激活 120 亿参数。它最狠的地方是把实时语音交互做进了模型骨子里,不再像以前那样给大语言模型外挂语音识别和合成模块。模型能同时听、说、看、想,用 200 毫秒一个的“微对话轮次”连续...

推荐理由:我会先打个折——基准分是 Thinking Machines 自己跑的,还没第三方复现,所以“超过 GPT 和 Gemini”先别太激动。但这条消息值得推,因为它给出了具体架构(276B MoE、12B 激活)、200ms 微轮次这个硬指标,还直接挑战了语音 agent 里常用的 VAD 方案。对正在搭实时语音管线的从业者来说,哪怕只是思路参考也有价值。

AI HOT 精选

Mira 的新公司 Thinking Machines 发了个原生多模态交互模型,前台 200 毫秒一响应,后台跑长线推理

这个模型把音频、视频、文字直接吃进去,不用再靠 agent 把一堆独立模型串起来。前台交互模型每 200 毫秒处理一次输入,保持对话的实时感,用户可以随时打断;后台推理模型负责长程规划和调工具。正文没披露具体参数量、训练数据和成本,也没给评测对比,所以实际效果和泛化能力还得看后续公开信息。

推荐理由:我会先打个折:正文没披露定价、开放范围和具体 benchmark,所以只能按现有信息给到 87。亮点在于 Thinking Machines 没有只发模型权重,而是给了一套前台 200 毫秒交互节点加后台推理的分层设计,原生多模态输入不是后期缝合的。这对正在折腾实时多模态 agent 的团队来说,至少提供了一个可参考的架构思路,但没看到代码或论文之前,不宜再往上拉。

The Verge · AI

Mira Murati 的新公司 Thinking Machines 在做什么:让模型边看边听边想,实时跟你协作

Thinking Machines 周一公布了他们的方向——做“交互模型”。按他们的说法,这种模型能同时接收音频、视频和文字,实时理解、回应并行动,而不是像现在的模型那样等你打完字或说完话才开始反应。正文没披露模型规模、发布时间、定价和最终产品形态,所以这东西到底多能打、什么时候能用上,现在都还是未知数。

推荐理由:这篇帖子给出了公司方向,但正文没披露模型参数、发布时间或产品形态,本质上是一次高关注度的创业方向亮相,不是可用的模型发布。HKR 三项都踩中,但信息缺口明显,所以留在 77 分这个位置,没往上拉。

5月8日星期五

机器之心 · 公众号

OpenAI 发布命令行工具,不用再折腾 SDK 了

OpenAI 开源了一个叫 openai-cli 的命令行工具,让开发者直接在终端里调用它的模型。你可以用一条命令完成对话、生成图片、编辑图片、语音转文字和文字转语音,不用再为复杂的 SDK 集成头疼。不过,这篇文章的正文因为微信环境验证被挡住了,具体支持哪些参数、怎么安装、有没有延迟数据,这些细节都没看到。

推荐理由:OpenAI 终于出了个官方命令行工具,开源,一行命令就能在终端里调模型、生图、转语音,不用再折腾各种 SDK 版本。对天天跟 API 打交道的开发者来说,这能省不少集成和维护的力气。不过这只是个工作流层面的更新,不是模型能力升级,所以重要性我给打个折,放在低 featured 档。正文没提性能对比或实际延迟数据,这点先别太激动。

Latent Space

OpenAI 发了三个实时语音模型:GPT-Realtime-2、翻译版和 Whisper 版,上下文从 32K 扩到 128K

OpenAI 在 Realtime API 里上线了 GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper。GPT-Realtime-2 是主打的语音对话模型,OpenAI 说它用上了 GPT-5 级别的推理能力,上下文窗口从之前的 32K 直接拉到 128K,一次最多能输出 32K ...

推荐理由:我会先打个折:这不是新基础模型,是 API 层面的更新,所以分数没往 90 以上拉。但 128K 上下文和 96.6% 的音频基准分确实够硬,对实时语音应用来说是个实打实的升级。正文没提延迟和具体定价,这点先别太激动,等上线跑过再看。

量子位 · 公众号

OpenAI 把 GPT-5 级推理塞进语音模型,同传翻译成本打到地板价

OpenAI 发了三个实时语音模型:GPT-Realtime-2 能边听边推理,上下文窗口 128K;GPT-Realtime-Translate 支持 70 多种语言输入、13 种语言输出,做流式同传;GPT-Realtime-Whisper 实时转写每分钟只要 0.017 美元。正文没披露具体推理跑分和翻译延迟数据,实际效果还得等上手测。

推荐理由:OpenAI 一口气发了三个实时语音 API,覆盖推理、翻译和转写,HKR 全中。128K 上下文意味着能处理很长的对话,70 多种语言输入和每分钟 0.017 美元的转写价格,对做同传和语音 agent 的团队来说,成本和能力边界都清楚了,值得当天就写。

AI HOT 精选

苹果带摄像头的 AirPods 进入 DVT 阶段,最快 9 月跟新 Siri 一起到

彭博社的 Mark Gurman 说,苹果那款传闻很久、自带摄像头的 AirPods 已经进入设计验证测试(DVT)阶段,外形和功能基本定型了。左右耳机各塞了一颗低分辨率摄像头,不是用来拍照,而是给 Siri 当“眼睛”,让你对着眼前的东西直接提问,比如看到一堆食材问能做什么晚饭。耳机柄为了塞摄像头比 AirPods Pro 3 稍微长一点。原计划上半...

推荐理由:HKR 三项都踩中了,但这是未确认的硬件传闻,不是苹果官方发布。DVT 状态、摄像头设计和 Gemini 合作细节让它够格进 featured,不过我会先打个折,放在低分段。正文没披露摄像头具体参数和 Gemini 合作形式,这点先别太激动。

AI HOT 精选

OpenAI 发了官方命令行工具 openai-cli,终端里直接调 API,不用写 SDK 代码

OpenAI 在 GitHub 开源了 openai-cli,Apache 2.0 协议,Homebrew 或 Go 都能装。这个工具让你在终端里直接敲命令调用 API,省掉写 SDK 的步骤。它主要干几件事:一是支持 Responses API,能把网页搜索、代码解释器这些云端工具串起来,让模型进业务流程干活;二是输出 JSON、YAML 这类结构化...

推荐理由:HKR 三项都站得住:官方 CLI 本身就有话题性,安装和功能细节够具体,又切中开发者想少写胶水代码、让模型直接进流程干活的需求。不过它终究是个工具更新,不是新模型或重大能力发布,76 分放在 featured 里合理。

The Verge · AI

苹果带摄像头的 AirPods 快量产了,主要给 Siri 当眼睛用

Mark Gurman 爆料,带摄像头的 AirPods 已经进入 DVT(设计验证测试)阶段,离 PVT(生产验证测试)只差一步。苹果内部测试人员正在用原型机,摄像头不拍照片或视频,只捕捉低分辨率画面,用来帮 Siri 回答“这菜怎么做”之类需要看东西的问题。正文没披露具体像素、延迟和功耗数据,也没说什么时候上市。

推荐理由:H/K/R 全过:Gurman 和 The Verge 给出了一个 DVT 阶段的苹果 AI 硬件更新,不是发布,所以分数压在 72–77 区间。带摄像头的 AirPods 这个形态够怪,容易让人记住;DVT 到 PVT 的进度和“只采低分辨率视觉信息、不拍照不录像”是实打实的新事实;它同时碰到多模态、隐私和 AI 硬件入口三条线,对做端侧和多模态的人有参考意义。

5月7日星期四

OpenAI News

OpenAI 在 API 里上线了三款实时语音模型,能边听边推理、翻译和转写

OpenAI 这次发了三个新模型:GPT‑Realtime‑2 是带 GPT‑5 级推理能力的语音模型,能处理更复杂的请求,说话中间可以插话、改主意,它还能边想边回一句“我查一下”,同时调用多个工具;GPT‑Realtime‑Translate 做实时翻译,支持 70 多种输入语言转 13 种输出语言,语速跟得上说话人;GPT‑Realtime‑Whi...

推荐理由:OpenAI 官方放出了语音 API 更新,方向明确但信息不全。能推理、翻译、转写,听着挺全,可没给价格、没给延迟、没给上下文限制,我会先打个折。如果是真的省钱又低延迟,那对语音应用开发者是直接利好;现在只能说方向对了,落地还得等更多参数。