跳到正文

#语音

今日 0 条

昨天 · 9月29日星期二

9月25日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次切换的动态视觉形象。

推荐理由:原文给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 语言支持,可据此判断企业级多模态交互的落地形态。

TechCrunch · AI

谷歌开始测试让 Gemini 替你打电话给商家,目前仅限美国 Pixel 11 用户

谷歌推出了一个叫“Call for Me”的实验功能,能让 Gemini 直接帮你打电话给商家。目前门槛很高:你得人在美国、用 Pixel 11 手机、付费订阅了 Gemini,还得装测试版的谷歌电话 App。这次更新最大的变化是,Gemini 可以分享你事先批准的个人信息,这样它能处理的事情就更多了,比如预约或查询订单。打电话时你可以实时看文字记录,...

推荐理由:谷歌在测试一项功能,让 Gemini 替你打电话给商家,并且能分享你批准过的个人信息去处理预约或查订单。门槛很高——人在美国、Pixel 11 手机、付费订阅 Gemini、还得装测试版电话 App——所以目前更像技术预览,分数没给太高。但方向很明确:AI 开始从屏幕后面走出来,直接替你张嘴办事了。

9月24日星期四

Latent Space

Meta Connect 2026:Muse 助手登陆眼镜,支持语音和视频,还多了个叫 Charm 的新硬件

Meta 在 Connect 大会上把 Muse 定位成硬件加智能体的核心。Muse 现在能语音对话、看实时视频,还能在后台处理长时间任务,甚至有了自己的邮箱地址,你可以抄送邮件让它干活。Mac 版支持电脑操作,排好任务就能走人。目前免费,但以后可能会从交易里抽成;零售合作方包括沃尔玛、百思买和丝芙兰,效率工具接入了 Box、GitHub 和 Noti...

推荐理由:Muse 在 Connect 大会上的更新挺实在:语音对话、实时视频理解、后台任务、独立邮箱、Mac 桌面操控,还列了一串零售和生产力工具的集成名单。不是虚的概念发布,有可验证的合作方。分数没给更高是因为来源是付费 newsletter,信息本身有料但传播面有限。

The Verge · AI

Meta 亮出 Muse Charm:一个不带表带的 AI 小屏设备,靠指纹唤醒语音

Meta 在 Connect 大会结尾快速展示了一款叫 Muse Charm 的独立 AI 硬件,专门跑自家的 Muse 智能体。它长得像一块摘掉表带的厚智能手表,配了根挂绳。右上角有指纹传感器,按下去就能直接说话下指令,不用掏手机解锁。正面至少开了三个麦克风孔,还塞了一颗小摄像头。正文没公布价格、续航和上市时间,目前只是露个脸。

推荐理由:Meta 在 Connect 大会结尾快速亮了一款叫 Muse Charm 的独立 AI 硬件,长得像摘掉表带的厚智能手表,挂绳一穿就能戴。右上角指纹传感器按下去直接说话下指令,正面开了至少三个麦克风孔,还藏了一颗小摄像头。我会先打个折:正文没公布价格、续航和上市时间,目前只是露个脸,所以信息量偏薄。但 Meta 在 Ray-Ban 智能眼镜之后又试了一种新形态,把自家 Muse 智能体塞进一个独立设备里,这个动作本身对做 AI 硬件的人有参考价值,分数就定在 72。

The Verge · AI

Meta 要把 Muse AI 助手塞进智能眼镜,喊名字就能唤醒

Muse 上线才两周,Meta 就说正在把它往智能眼镜里搬,包括 Connect 大会上新发布的款式。用法很简单:喊一声 Muse,就能让它带着你做运动、记吃了什么,或者帮你看看眼前的东西值不值得买。眼镜还会加一个听力增强功能,Meta 说已经过了 FDA 认证,给轻度到中度听损的成年人用。不过正文没提什么时候上线,也没说哪些型号能用上 Muse。

推荐理由:把 Muse 搬上眼镜是 Meta 把 AI 助手从手机推向穿戴设备的关键一步,三个用例也够实在。但正文没给上线时间和支持型号,我会先打个折,分数刚好卡在 featured 门槛上。

AI HOT 精选

GPT Voice 能帮你发邮件、查日历、调 Slack 了,还进了 ChatGPT Work

Greg Brockman 说 GPT Voice 现在可以调用邮箱、日历、Slack 这些工具,背后跑的是 GPT-6 Astra、Sol 和 Luna 三个模型。语音功能也同步上了网页端和移动端的 ChatGPT Work,你动嘴就能在浏览器里建文档、做 PPT、搭网站或填表格。今天起全球最新版应用会逐步推送。不过正文没提语音响应延迟、识别准确率,...

推荐理由:Brockman 亲自宣布,GPT Voice 从对话玩具变成能调用工具的工作入口,还挂上了 GPT-6 模型家族的名号,信号强度够上 featured。没给到 90 以上是因为正文完全没提语音延迟、识别准确率这些实际体验的关键指标,我会先打个折。

AI HOT 精选

ChatGPT Voice 现在能直接操作你的邮箱、日历和 Slack,说是由 GPT-6 的几个模型驱动

OpenAI 给 ChatGPT 的语音功能接上了插件,你可以用嘴让它查邮件、翻日历、在 Slack 里发消息。语音版在 ChatGPT Work 的网页和手机端都能用,号称能靠说话生成文档、PPT、网站和表格。官方说背后是 GPT-6 的 Astra、Sol、Luna 这几个模型,当天就推了全球更新。不过正文完全没提插件权限范围有多大、响应延迟怎么样...

推荐理由:语音加办公插件是个实打实的产品升级,又一口气亮出三个 GPT-6 模型名,料给得挺足。分数没给更高,是因为正文完全没提插件权限范围有多大、响应延迟怎么样——这两块不交代清楚,实际好不好用还得打个问号。

Simon Willison

Simon Willison 发布 Gemini 3.8 TTS Playground 实测工具

Simon Willison 用 GPT-6 Astra 开发了一个 Gemini 3.8 TTS Playground,可测试 Google 的 Gemini 3.8 文本转语音 API,支持单人或多人对话合成、试听音频并查看请求与响应细节,配置可保存为可分享的 URL。

AI HOT 精选

ChatGPT 语音版接入邮件、日历和 Slack,底层换成了 GPT-6 系列模型

OpenAI 给 ChatGPT 语音加上了邮件、日历和 Slack 插件,现在你可以用嘴直接操作这些工具。驱动模型换成了 GPT-6 Astra、Sol 和 Luna,但正文没解释这三个模型分别负责什么、能力差在哪。网页和手机端的 ChatGPT Work 也支持语音输入了,说句话就能建文档、做 PPT、搭网站或填表格。我会先打个折——官方没提推送地...

推荐理由:给 ChatGPT 语音加上邮件、日历和 Slack 插件,是一次实打实的产品扩展,从聊天迈进了办公自动化。GPT-6 的三个子模型 Astra、Sol、Luna 首次被点名,但官方没给任何能力拆解,信息密度比标题看起来要薄。我会先打个折——正文没提推送地区、上线时间,也没解释三个模型的分工,这些关键缺口让更新看起来更像预告而非完整发布。

9月16日星期三

AI HOT 精选

Google DeepMind 发了 Gemini 3.8 Live,语音助手能边说话边推理了

这次更新把实时语音和“Extended Thinking”(让模型在回答前多算几步)塞进了同一个模型。遇到难题它会先停顿一小会儿,在后台推理完再开口,而不是直接给个不过脑子的回复。不过正文只放了个标题和一堆网站导航,没给出任何具体参数、延迟数据或上线时间,所以实际响应速度和推理质量现在还没法判断。

9月15日星期二

AI HOT 精选

阶跃星辰发 StepAudio 3 语音模型,多个指标在 Artificial Analysis 排全球第一

阶跃星辰发了 StepAudio 3 系列语音模型,官方称在 Artificial Analysis 榜单上多个指标拿了全球第一。但原文被微信屏蔽,正文完全看不到,所以具体是哪些指标、什么语言、模型参数、能力细节一概没披露。榜单本身是第三方评测,有一定参考价值,但没看到具体分数和对比对象之前,这个“全球第一”先打个折。

8月10日星期一

Hacker News 首页

Kinney Drugs 因数百起投诉叫停 AI 电话助手

连锁药店 Kinney Drugs 上线三个月的 AI 电话助手 Burt 被紧急撤回,原因是顾客投诉电话内容混乱、报错剂量、漏掉处方提醒。总裁 John Marraffa 承认,合规不等于体验好,他们搞砸了。现在患者来电恢复传统的按键式系统,Burt 只保留在用户主动订阅的续方短信通知里。报道没提底层用的是哪家模型或语音供应商。

推荐理由:一家连锁药店把 AI 电话助手撤了,原因是剂量报错、处方提醒漏发,CEO 还公开认栽——医疗场景里这么诚实的失败复盘很少见。分数没给更高,因为正文没提底层用的是哪家模型或语音供应商,技术根因只能靠猜。

7月28日星期二

Ben's Bites

Claude Opus 5 发布,价格只有 Fable 5 的一半,但早期用户吐槽它爱抬杠、爱提前收工

Anthropic 发了新模型 Claude Opus 5,定价直接砍半,号称能力接近 Fable 5。但 Every 的评测发现它用起来很别扭:会跟人争论、任务没做完就停,还跟老一套的提示词技巧犯冲。有意思的是,同一个人嘴上说讨厌,盲测打分时却把 Opus 5 排在了第一。Theo 花了几个小时重写 CLAUDE.md 和技能文件,说虽然累但完全值得...

推荐理由:Anthropic 发新模型还降价,本身是条硬消息。Every 和 Theo 的实测给出了具体信号:能力强但脾气怪,得重写提示词才能顺。跨信源的讨论正在形成,不过目前只有摘要,缺完整评测细节,我会先打个折。

7月24日星期五

TechCrunch · AI

ChatGPT 桌面端终于能听懂人话并直接操作电脑了

OpenAI 把月初发布的 ChatGPT-Live 语音模型搬到了桌面应用上。现在你可以直接用嘴指挥 ChatGPT,让它操作智能体、浏览网页,或者在 macOS 上通过 Appshots 读取屏幕内容。手机版之前只能聊天,这次桌面版是实打实的干活:演示里一个开发者用一句话就让 ChatGPT 新建了讨论串、提交了合并请求,还顺带找到了一个 bug ...

推荐理由:OpenAI 把 ChatGPT-Live 语音模型搬上了桌面端,加了屏幕读取和浏览器控制,让语音真正能驱动智能体干活。开发者演示很具体,一句话完成分支、MR、找 bug,实用性拉满。没给更高分是因为刚发布,实际稳定性和权限边界还不清楚,我会先打个折。

AI HOT 精选

Claude 语音模式现在能跑 Opus 和 Sonnet 了,还能在说话时直接调你的 Gmail 和 Slack

Anthropic 把 Claude 的语音模式升级了,现在背后可以调用 Opus 和 Sonnet 这两个更强的模型来处理复杂问题,不再是以前那种轻量版。你还能在语音对话里直接让它操作已连接的工具,比如搜 Gmail 邮件或查 Slack 消息,不用切回文字界面。多语言支持也加上了,但官方没列出具体支持哪些语言。实际用起来的延迟和工具调用的准确率怎么...

推荐理由:Anthropic 这次语音模式升级把模型能力和工具调用两个缺口一次性补上了,对 Claude 用户群来说是实打实的体验提升。但正文没给出延迟数据、工具调用准确率,也没列具体支持哪些语言,信息有缺口,所以分数先压在 85 以下。整体够得上 featured。

AI HOT 精选

ChatGPT 桌面版能靠语音指挥多个智能体干活了

OpenAI 给 macOS 和 Windows 的 ChatGPT 桌面应用加上了语音控制,你可以直接说话让 ChatGPT Work 或 Codex 里的多个智能体协同工作。背后是 GPT-Live 在跑,能同时听、说、协调任务。今天起 Plus、Pro、Business、Edu 和 Enterprise 用户都能用。正文没提延迟多少、能同时跑几个...

推荐理由:OpenAI 把语音控制的多智能体协作直接搬到了桌面端,交互上确实往前走了一步。GPT-Live 全量推给付费用户,说明他们自己觉得能用了。分数没给更高,是因为正文完全没提延迟和并发上限——实际用起来卡不卡、能同时带几个 agent,现在还不知道,这点先别太激动。

The Verge · AI

Claude 的语音模式现在支持 Opus 和 Sonnet,还能读你的 Gmail 和 Slack

Anthropic 把语音模式从 Haiku 扩展到了 Opus 和 Sonnet,三个模型现在都能用语音交互了。更实际的变化是,语音模式可以接入 Gmail、Slack 这类应用,直接读出你的邮件和消息。不过正文没提延迟和准确率数据,实际体验好不好用,建议等上手测试再说。

推荐理由:Anthropic 把语音模式铺到了 Opus 和 Sonnet,还接上了 Gmail、Slack,实用性和话题性都有。但正文没给延迟和准确率数据,实际体验得等上手,所以分数压在 80 以下。

TechCrunch · AI

Claude 语音模式升级:能选 Opus/Sonnet/Haiku 模型,还能直接操作你的 Gmail 和 Slack

Anthropic 给 Claude 的语音模式换了底模,现在你可以手动选 Opus、Sonnet 或 Haiku,默认会沿用你上次文字聊天用的模型。官方说这能撑住更长的对话,比如帮你打磨沟通方式、过一遍客户提案、或者脑暴市场调研。更实际的变化是,语音模式现在能接通 Gmail、Google 日历、Slack、Canva 和 Notion,直接让它改会...

推荐理由:Anthropic 把语音模式的后台模型换成了用户可自选的 Opus/Sonnet/Haiku,同时接入了五个生产力工具,属于扎实的功能补强。没给 85 分以上是因为这更像追平竞品而非范式突破,而且正文没披露实际使用中的延迟或准确率数据,我会先打个折。

7月9日星期四

Ben's Bites

SpaceXAI 和 Cursor 联手训出 Grok 4.5,成本只有 Opus 的六分之一

SpaceXAI 和 Cursor 一起训了个新模型 Grok 4.5,性能大概卡在 Opus 4.7 和 4.8 之间,但按 token 算钱的话,比 Opus 便宜 6 倍,比 GPT-5.5 便宜 3 倍。现在 Cursor 里能用,API 也开放了。OpenAI 这边,GPT-5.6(Sol、Terra、Luna)今天会推给所有用户,早期测试的...

推荐理由:SpaceXAI 和 Cursor 联合发布 Grok 4.5,有具体性能区间和价格对比,三个维度都踩中了。扣分是因为来源是 newsletter 摘要而非一手公告,且正文截断,GPT-5.6 信息不全。跨源验证后加 3 分到 82,整体判断不变。

6月24日星期三

AI HOT 精选

ChatGPT 语音能边听边说了,新模型 Bidi 1 开始灰度测试

部分用户已经在 ChatGPT 网页版和 App 的模型选择器里看到了 Bidi 1,和标准语音、高级语音并列,选中后语音气泡会变黄。它最大的变化是支持全双工:模型在说话的同时还能继续听你讲话,中途打断也能立刻响应。测试里有人让它从 1 数到 10,数到一半打断说“倒数”,它马上照做。OpenAI 还没正式公布上线时间,有媒体猜本周可能会扩大测试范围。...

推荐理由:OpenAI 语音能力一次实质升级——全双工加打断响应是之前高级语音模式做不到的。目前只部分推送、官方还没正式公告,所以分数不往上顶。但交互方式的改变够得上 featured。

6月18日星期四

AI HOT 精选

火山引擎把豆包实时语音模型 3.0 的 API 放出来了,现在还在邀测

这个模型叫 Seeduplex,是个原生全双工端到端语音模型,意思是它能一边听一边说,不用等你说完再反应。官方给了三个卖点:指令跟得准、抗干扰、会自己判断什么时候该接话。比如多人聊天时它能安静待着,只有聊到指定话题才插嘴;还能在对话里直接调用工具帮你订日历、发邮件。抗干扰方面,误回复和误打断都少了很多。判停延迟缩短了约 250 毫秒,复杂场景下抢话比例...

推荐理由:字节第一个全双工端到端语音模型开放邀测,有延迟和抗干扰的量化数据,不是纯营销稿。扣分点:仅邀测,没公布定价和规模,真实环境表现待验证。

AI HOT 精选

Google 把 Gemini 塞进了一台 99 美元的音箱,想让你跟它聊天而不是下指令

Google Home Speaker 是第一款围绕 Gemini 做的音箱,99.99 美元,现在就能预订,本月发货。它支持说话中途改口、不用反复唤醒就能接着聊,内置了 10 种新声音。我会先打个折:这些听起来像连续对话的能力,其实分两层。基础的多步指令和打断纠错是机器自带的,但真正像人一样自由聊天的 Gemini Live,以及让音箱帮你总结 Ne...

推荐理由:99 美元定价和即日预订是硬信息,Gemini 首次落地音箱也够分量。没给更高分是因为目前只有发布信息,连续对话和 Gemini Live 的自由聊天能力还没经过真实环境验证,正文也没披露具体延迟和端侧模型细节。

6月15日星期一

彭博科技

新 Siri 能救苹果的 AI 困局吗?彭博上手后列出 7 个改进点

彭博的 Mark Gurman 提前用上了新版 Siri,总结了 7 个实际改进:响应更快、能看懂屏幕内容、可以跨 App 操作、声音更自然等。但核心问题没变——Siri 还是把复杂请求丢给 ChatGPT,自己只处理简单指令。Gurman 的判断是,这次更新把 Siri 从“灾难”拉回到“勉强能用”,但离苹果在 WWDC 2024 画的那个主动式助手...

推荐理由:Gurman 这篇是实机体验,7 个改进点都有具体场景,信息密度够。但核心短板没变——Siri 自己处理不了复杂请求,只能当 ChatGPT 的传话筒,所以分数卡在 78 而不是更高。

6月10日星期三

AI HOT 精选

Google Gemini 3.5 实时翻译开放公测,支持 70 多种语言、2000 个语言对

Google 把 Gemini 3.5 的实时翻译功能放出来了,现在通过 Gemini API 就能用。它做的是语音到语音的低延迟翻译,覆盖 70 多种语言,能组合出 2000 个语言对,冷门小语种也包含在内。开发者可以把它接进实时对话、客服、直播或跨国会议里。主推文提到这消息被 Anthropic Fable 5 的声量盖过去了,还顺带提了阿里 Qw...

推荐理由:HKR 三项都成立:Google 把实时语音翻译做成 API 公开预览,对开发者有直接吸引力,也给了语言覆盖和语言对的具体数字。但文章只提了功能开放,没写价格、延迟基准和可用区域,信息有缺口,所以重要性停在 78。

6月9日星期二

AI HOT 精选

Google 放出 Gemini 3.5 Live Translate,话没说完就开始翻,支持 70 多种语言

Google 发了 Gemini 3.5 Live Translate,一个实时语音转语音翻译模型。它不等对方把整句话讲完,边听边翻,用流式更新把结果推出来,延迟压到几秒,还能保留原声的语速、音高和语调。支持 70 多种语言,目前通过 Gemini Live API、Google Meet 预览版和 iOS/Android 的 Google 翻译 Ap...

推荐理由:HKR 三项都成立:Google 把实时语音翻译绑定了 70+ 语言和说话人未结束就开始的流式输出。分数留在 82,因为正文没披露具体上线范围、定价和基准测试结果,实际效果和可用性还得等验证。

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。

推荐理由:原文给出模型的语言覆盖、实时翻译机制与多产品上线节奏,可据此判断语音翻译的可用边界。

AI HOT 精选

Gemma 4 12B 发布:一个模型直接看懂图文和音频,不用外挂编码器

Google DeepMind 开源了 Gemma 4 12B,一个 120 亿参数的多模态模型。它最大的变化是去掉了传统的独立视觉/音频编码器,把所有输入统一交给 Transformer 处理,架构更简单。模型能直接听懂语音,不再需要先转文字。官方说它用 Apache 2.0 协议开源,在 16GB 显存或统一内存的笔记本上就能跑。性能方面,正文没给...

推荐理由:我会先打个折:正文没给性能对比和具体 benchmark,所以没法判断它到底多强。但架构上的变化是实打实的——把视觉和音频编码器都砍掉,统一用 Transformer 处理,等于简化了管线,也降低了工程复杂度。能在 16GB 显存或统一内存的笔记本上跑,对个人开发者和中小企业是个实在的卖点。原生语音输入意味着不用再串一个 ASR 模块,做语音助手或实时对话应用会更轻量。Apache 2.0 协议也扫清了商用顾虑。整体看,这是一个有明确技术亮点的开源发布,但缺少性能验证,激动之前得等实测数据。

6月8日星期一

AI HOT 精选

面壁智能开源 VoxCPM2 语音模型,200 万小时数据训练,支持 30 种语言和 9 种方言

OpenBMB 把 VoxCPM2 的技术报告和模型都放出来了,Apache 2.0 协议。这是个 20 亿参数的语音生成模型,用超过 200 万小时的多语言语音数据训练,能说 30 种语言和 9 种中文方言。它主要干三件事:按自然语言指令设计语音、可控地克隆声音,以及高保真地延续一段语音。技术方案上,它把语音拆成两步走——先用 16kHz 做语义编码...

推荐理由:HKR 三项都踩中了:200 万小时训练数据和 9 种方言是实打实的钩子,参数和协议信息也够新,对国内语音开发者有直接参考意义。分数定在 78 是因为技术报告正文没给出具体的评测基准和对比数字,实际效果和落地表现还不清楚,这点先别太激动。

6月6日星期六

r/LocalLLaMA

开源模型这周炸了:25+ 个开放权重模型一口气放出,覆盖文本、图像、语音

Victor M 在 X 上整理了一份清单,过去一周有超过 25 个开放权重的模型发布,几乎覆盖了所有模态。其中最扎眼的是 NVIDIA 的 Nemotron 3 Ultra,一个 550B 参数的混合架构(Mamba-MoE),每次推理只激活 55B 参数,上下文窗口能塞进 100 万个 token。不过正文被 Reddit 的安全策略拦住了,具体还...

推荐理由:我会先打个折:消息源是 X 上的个人整理,Reddit 原文还被安全策略拦了,具体细节没法交叉验证。但一周 25+ 个开放权重模型这个密度本身就值得关注,NVIDIA 那个 550B 的 Nemotron 用 Mamba-MoE 架构,激活参数只有 55B,上下文能塞 100 万 token,如果实测靠谱,推理成本会省不少。这点先别太激动,等完整评测出来再说。

r/LocalLLaMA

RedNote 开源 dots.tts:一个 20 亿参数的语音合成模型,支持 48kHz 和零样本声音克隆

RedNote 放出了一个叫 dots.tts 的语音合成模型,参数量 20 亿,用 Apache 2.0 协议开源。它走的是全连续架构,文字直接映射到语音,跳过了传统的音素流水线,合成采样率能到 48kHz。零样本声音克隆也支持,给一段参考音频就能模仿说话。不过 Reddit 原帖被屏蔽了,正文没披露训练数据、推理延迟和实际合成效果的具体指标,这点先...

推荐理由:HKR 三项都过了,但得先打个折:信息源是 Reddit 摘要,原帖还被屏蔽了,SOTA 的说法没给出具体基准名称或分数。Apache 2.0、20 亿参数、48kHz 和无音素流水线这些点够硬,给个低位的 featured 没问题。正文没披露训练数据、推理延迟和实际合成效果,这些缺口让判断得收着点。

AI HOT 精选

Google AI 本周连发六弹:笔记本能跑的多模态模型、帮你读论文的科研助手、还有开源实时音乐模型

Google AI 这周一口气更新了六样东西。Nano Banana 2 和 Pro 版正式上线,走 Gemini 企业平台、API 和 AI Studio 就能用。Co-Scientist 是一个多智能体系统,专门帮科研人员自动生成和优化新假设,相当于有个助手帮你读文献、想点子。Google Labs 出了个 dreambeans,会扒你的 Goog...

推荐理由:HKR 三项都踩中了:帖子一口气打包了 Google AI 六个更新,本地部署和开源这两个点对从业者很实在。正文没给基准测试、授权条款和定价细节,所以分数卡在 76,没往上走。

6月5日星期五

AI HOT 精选

Google 开源了实时音乐模型 MRT2,在 MacBook 上延迟不到 200 毫秒

Google AI for Developers 放出了一个叫 Magenta RealTime 2(MRT2)的实时音乐模型,权重开放,推理引擎也开源了。你可以用 MIDI 键盘弹、打字给提示词,甚至用手势控制它来生成音乐。它在 MacBook 上原生跑,延迟压到了 200 毫秒以内,这个速度对实时演奏来说基本跟手。配套还给了应用和插件套件,到手就能...

推荐理由:HKR 三项都过:Google Magenta MRT2 有实打实的实时音频钩子、开放权重和低于 200ms 的本地延迟。对创意 AI 开发者吸引力很强,但本质上是一封公开信和政策诉求,不是已生效的法律,法案文本和执行时间表都没披露,所以放在 featured 而不是更高一级。

AI HOT 精选

Boson AI 和 LMSYS 把 Higgs Audio v3 TTS 跑在了 SGLang-Omni 上,一个 4B 参数的语音合成模型,主打低延迟...

Higgs Audio v3 TTS 是 Boson AI 的语音合成模型,参数量大约 4B,底层用了 Qwen3-4B。它支持 100 种语言,在内部测试集上词错率/字错率能压到个位数。这个模型专门为语音助手那种边说边生成的场景设计,不等句子结束就能开始合成,后续文本到了还能保持声音、情绪和节奏连贯。开发者可以直接在输入文本里插标签来控制 20 多种...

推荐理由:H 和 K 靠 4B/100 语言/流式合成这几个硬指标撑住。R 偏弱,因为文章没给延迟、定价和权重,更像一个能力宣告而非可立刻复用的发布,所以放在 featured 低位。

6月4日星期四

机器之心 · 公众号

谷歌放出 Gemma 4 12B,120 亿参数模型能在 16G 显存的笔记本上跑

谷歌发了 Gemma 4 系列的新成员,一个 120 亿参数的中等尺寸模型。它主打本地运行,16GB 显存或统一内存的笔记本就能带起来。架构上没走传统多模态那套编码器路线,直接原生支持音频输入,还带了一个叫 MTP 的推测解码模块来压延迟。模型用 Apache 2.0 协议开源。不过正文因为环境验证没加载出来,具体跑分、训练数据、实际推理速度这些关键信...

推荐理由:Gemma 4 12B 的卖点很直给:一个不算小的模型,能在普通笔记本上跑,还用了 Apache 2.0 协议。这对想自己折腾、又不想被云服务绑住的开发者来说,是个实在的更新。我会先打个折,正文没提具体推理速度和实际任务表现,光看参数和硬件门槛还不够,得等实测。但就凭“16G 笔记本能跑”这个钩子和宽松的开源协议,值得推给关注本地部署和成本控制的读者。

机器之心 · 公众号

办公室都在用嘴打字,敲键盘快成老手艺了

这篇文章本身没加载出来,微信页面显示环境异常需要验证,所以正文内容我没看到。从标题和已有的英文摘要看,讲的是 AI 语音输入工具正在进入办公和开发场景。Wispr Flow 这个产品全球下载量超过 250 万,12 个月留存率 70%,年用户增长 100 倍,说明用的人确实在猛增,而且用了就回不去。OpenAI 的 gpt-4o-transcribe ...

推荐理由:HKR 三项都站得住,但这是一篇带数据的工作流趋势观察,不是模型发布或平台级更新,放在 featured 里属于门槛线附近的那一类。我会先打个折,不把它当硬核技术突破看,但“打字正在变古老技艺”这个判断加上 250 万下载和 70% 留存,确实能让人重新想一遍语音交互的落地速度。

AI HOT 精选

Miso One 开源了一个 8B 参数的语音模型,克隆声音只需一小段样本,延迟 110 毫秒

Miso One 放出了一个 8B 参数的开源 TTS 模型,主打一次语音克隆——给它一小段音频样本就能模仿那个人的说话风格和节奏。推理延迟标称 110ms,对实时对话场景算可用。模型权重直接挂在 GitHub 上,你可以自己部署,音频数据不用上传到第三方服务器。官方说 API 之后会出,但正文没提价格和上线时间。

推荐理由:我会先打个折:这是单条推文来源的发布,没有跑分对比、没写许可证细节、也没有第三方复现结果。但8B参数、110ms延迟、能自托管的一次语音克隆这几个事实本身够硬,放在featured刚好,再往上就缺验证了。

6月3日星期三

AI HOT 精选

Suno 拿了 4 亿美元 D 轮,估值冲到 54 亿

AI 音乐生成公司 Suno 宣布完成 4 亿美元 D 轮融资,投后估值 54 亿美元。官方公告没披露领投方、跟投方和资金具体用途,只说会继续让更多人玩上音乐创作。我会先打个折——这轮金额和估值数字很大,但正文没给任何业务数据或商业化进展,暂时只能当融资信号看。

推荐理由:Suno拿了4亿美元D轮,估值冲到54亿,AI音乐的钱还在往里涌。我会先打个折——正文没披露领投方是谁、钱具体怎么花,所以只能算一个信号,别急着当定论。对从业者来说,这轮融资说明资本还在押注AI生成音乐,但版权风险和创作者反弹是绕不开的暗雷。

AI HOT 精选

Grok 成为 Vapi 语音平台的默认引擎,覆盖 250 多万个语音智能体

xAI 和 Vapi 合作,把 Grok 设成了 Vapi 平台 12 个核心语音的默认引擎。Vapi 自己搞了一次盲测,Grok 拿了第一。另外 xAI 在 X 上发了个投票,4500 多人里有一半分不清 Grok 克隆的声音和真人原声。现在 Vapi 上的开发者可以直接在下拉菜单里选 Grok 来做文字转语音,仪表盘里也能用 Grok 的语音识别和...

推荐理由:这条消息有料,但别急着全信。Grok 被设为 Vapi 默认语音引擎,覆盖 250 多万个语音智能体,盲测还拿了第一,说明在语音合成这块 xAI 开始抢地盘了。不过正文没披露盲测的具体对手、评分维度和切换后的实际延迟、成本变化,所以“第一”的含金量得打个折。对做语音智能体的人来说,默认引擎换人意味着后续的定价、迁移成本和稳定性都要重新评估,值得关注但还需要更多实测数据。

6月2日星期二

AI HOT 精选

Gemini Omni 能生成你的数字分身,放进视频里

Gemini App 发帖演示了用 Gemini Omni 捏一个长相和声音都像你的数字分身,然后直接塞进视频创作里。帖子没提这个功能什么时候上线、要不要付费,也没说怎么防止别人拿你的形象乱用。

推荐理由:我会先打个折:正文只说了 Gemini Omni 能做个人数字分身,没披露上线范围、价格、安全机制或授权流程,所以信息缺口不小。但官方账号自己放出这个功能点,说明产品方向已经定了,对做视频创作和虚拟人业务的人是个明确信号。HKR 三项都踩中:钩子够强,事实够新,风险够直接。因为细节太少,重要性只能给到 74,放在 featured 里当个产品更新提醒,别当成熟方案看。