ElevenLabs 发布 Eleven v4 语音模型,并推出面向实时语音智能体的 Turbo 版本
ElevenLabs 发布 Eleven v4 语音模型,能更准确跟随脚本中的情绪、停顿与音效标签,并在长篇制作中保持音色一致。新架构同时驱动 Turbo 版本,官方测试中约 150 毫秒开始输出语音,对比 Cartesia Sonic 3.6 的 262 毫秒和 OpenAI GPT-4o mini TTS 的 814 毫秒。
ElevenLabs 发布 Eleven v4 语音模型,能更准确跟随脚本中的情绪、停顿与音效标签,并在长篇制作中保持音色一致。新架构同时驱动 Turbo 版本,官方测试中约 150 毫秒开始输出语音,对比 Cartesia Sonic 3.6 的 262 毫秒和 OpenAI GPT-4o mini TTS 的 814 毫秒。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次切换的动态视觉形象。
推荐理由:原文给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 语言支持,可据此判断企业级多模态交互的落地形态。
谷歌推出了一个叫“Call for Me”的实验功能,能让 Gemini 直接帮你打电话给商家。目前门槛很高:你得人在美国、用 Pixel 11 手机、付费订阅了 Gemini,还得装测试版的谷歌电话 App。这次更新最大的变化是,Gemini 可以分享你事先批准的个人信息,这样它能处理的事情就更多了,比如预约或查询订单。打电话时你可以实时看文字记录,...
推荐理由:谷歌在测试一项功能,让 Gemini 替你打电话给商家,并且能分享你批准过的个人信息去处理预约或查订单。门槛很高——人在美国、Pixel 11 手机、付费订阅 Gemini、还得装测试版电话 App——所以目前更像技术预览,分数没给太高。但方向很明确:AI 开始从屏幕后面走出来,直接替你张嘴办事了。
Meta 在 Connect 大会上把 Muse 定位成硬件加智能体的核心。Muse 现在能语音对话、看实时视频,还能在后台处理长时间任务,甚至有了自己的邮箱地址,你可以抄送邮件让它干活。Mac 版支持电脑操作,排好任务就能走人。目前免费,但以后可能会从交易里抽成;零售合作方包括沃尔玛、百思买和丝芙兰,效率工具接入了 Box、GitHub 和 Noti...
推荐理由:Muse 在 Connect 大会上的更新挺实在:语音对话、实时视频理解、后台任务、独立邮箱、Mac 桌面操控,还列了一串零售和生产力工具的集成名单。不是虚的概念发布,有可验证的合作方。分数没给更高是因为来源是付费 newsletter,信息本身有料但传播面有限。
Meta 在 Connect 大会结尾快速展示了一款叫 Muse Charm 的独立 AI 硬件,专门跑自家的 Muse 智能体。它长得像一块摘掉表带的厚智能手表,配了根挂绳。右上角有指纹传感器,按下去就能直接说话下指令,不用掏手机解锁。正面至少开了三个麦克风孔,还塞了一颗小摄像头。正文没公布价格、续航和上市时间,目前只是露个脸。
推荐理由:Meta 在 Connect 大会结尾快速亮了一款叫 Muse Charm 的独立 AI 硬件,长得像摘掉表带的厚智能手表,挂绳一穿就能戴。右上角指纹传感器按下去直接说话下指令,正面开了至少三个麦克风孔,还藏了一颗小摄像头。我会先打个折:正文没公布价格、续航和上市时间,目前只是露个脸,所以信息量偏薄。但 Meta 在 Ray-Ban 智能眼镜之后又试了一种新形态,把自家 Muse 智能体塞进一个独立设备里,这个动作本身对做 AI 硬件的人有参考价值,分数就定在 72。
Muse 上线才两周,Meta 就说正在把它往智能眼镜里搬,包括 Connect 大会上新发布的款式。用法很简单:喊一声 Muse,就能让它带着你做运动、记吃了什么,或者帮你看看眼前的东西值不值得买。眼镜还会加一个听力增强功能,Meta 说已经过了 FDA 认证,给轻度到中度听损的成年人用。不过正文没提什么时候上线,也没说哪些型号能用上 Muse。
推荐理由:把 Muse 搬上眼镜是 Meta 把 AI 助手从手机推向穿戴设备的关键一步,三个用例也够实在。但正文没给上线时间和支持型号,我会先打个折,分数刚好卡在 featured 门槛上。
Greg Brockman 说 GPT Voice 现在可以调用邮箱、日历、Slack 这些工具,背后跑的是 GPT-6 Astra、Sol 和 Luna 三个模型。语音功能也同步上了网页端和移动端的 ChatGPT Work,你动嘴就能在浏览器里建文档、做 PPT、搭网站或填表格。今天起全球最新版应用会逐步推送。不过正文没提语音响应延迟、识别准确率,...
推荐理由:Brockman 亲自宣布,GPT Voice 从对话玩具变成能调用工具的工作入口,还挂上了 GPT-6 模型家族的名号,信号强度够上 featured。没给到 90 以上是因为正文完全没提语音延迟、识别准确率这些实际体验的关键指标,我会先打个折。
OpenAI 给 ChatGPT 的语音功能接上了插件,你可以用嘴让它查邮件、翻日历、在 Slack 里发消息。语音版在 ChatGPT Work 的网页和手机端都能用,号称能靠说话生成文档、PPT、网站和表格。官方说背后是 GPT-6 的 Astra、Sol、Luna 这几个模型,当天就推了全球更新。不过正文完全没提插件权限范围有多大、响应延迟怎么样...
推荐理由:语音加办公插件是个实打实的产品升级,又一口气亮出三个 GPT-6 模型名,料给得挺足。分数没给更高,是因为正文完全没提插件权限范围有多大、响应延迟怎么样——这两块不交代清楚,实际好不好用还得打个问号。
Simon Willison 用 GPT-6 Astra 开发了一个 Gemini 3.8 TTS Playground,可测试 Google 的 Gemini 3.8 文本转语音 API,支持单人或多人对话合成、试听音频并查看请求与响应细节,配置可保存为可分享的 URL。
OpenAI 给 ChatGPT 语音加上了邮件、日历和 Slack 插件,现在你可以用嘴直接操作这些工具。驱动模型换成了 GPT-6 Astra、Sol 和 Luna,但正文没解释这三个模型分别负责什么、能力差在哪。网页和手机端的 ChatGPT Work 也支持语音输入了,说句话就能建文档、做 PPT、搭网站或填表格。我会先打个折——官方没提推送地...
推荐理由:给 ChatGPT 语音加上邮件、日历和 Slack 插件,是一次实打实的产品扩展,从聊天迈进了办公自动化。GPT-6 的三个子模型 Astra、Sol、Luna 首次被点名,但官方没给任何能力拆解,信息密度比标题看起来要薄。我会先打个折——正文没提推送地区、上线时间,也没解释三个模型的分工,这些关键缺口让更新看起来更像预告而非完整发布。
这次更新把实时语音和“Extended Thinking”(让模型在回答前多算几步)塞进了同一个模型。遇到难题它会先停顿一小会儿,在后台推理完再开口,而不是直接给个不过脑子的回复。不过正文只放了个标题和一堆网站导航,没给出任何具体参数、延迟数据或上线时间,所以实际响应速度和推理质量现在还没法判断。
阶跃星辰发了 StepAudio 3 系列语音模型,官方称在 Artificial Analysis 榜单上多个指标拿了全球第一。但原文被微信屏蔽,正文完全看不到,所以具体是哪些指标、什么语言、模型参数、能力细节一概没披露。榜单本身是第三方评测,有一定参考价值,但没看到具体分数和对比对象之前,这个“全球第一”先打个折。
连锁药店 Kinney Drugs 上线三个月的 AI 电话助手 Burt 被紧急撤回,原因是顾客投诉电话内容混乱、报错剂量、漏掉处方提醒。总裁 John Marraffa 承认,合规不等于体验好,他们搞砸了。现在患者来电恢复传统的按键式系统,Burt 只保留在用户主动订阅的续方短信通知里。报道没提底层用的是哪家模型或语音供应商。
推荐理由:一家连锁药店把 AI 电话助手撤了,原因是剂量报错、处方提醒漏发,CEO 还公开认栽——医疗场景里这么诚实的失败复盘很少见。分数没给更高,因为正文没提底层用的是哪家模型或语音供应商,技术根因只能靠猜。
Anthropic 发了新模型 Claude Opus 5,定价直接砍半,号称能力接近 Fable 5。但 Every 的评测发现它用起来很别扭:会跟人争论、任务没做完就停,还跟老一套的提示词技巧犯冲。有意思的是,同一个人嘴上说讨厌,盲测打分时却把 Opus 5 排在了第一。Theo 花了几个小时重写 CLAUDE.md 和技能文件,说虽然累但完全值得...
推荐理由:Anthropic 发新模型还降价,本身是条硬消息。Every 和 Theo 的实测给出了具体信号:能力强但脾气怪,得重写提示词才能顺。跨信源的讨论正在形成,不过目前只有摘要,缺完整评测细节,我会先打个折。
OpenAI 把月初发布的 ChatGPT-Live 语音模型搬到了桌面应用上。现在你可以直接用嘴指挥 ChatGPT,让它操作智能体、浏览网页,或者在 macOS 上通过 Appshots 读取屏幕内容。手机版之前只能聊天,这次桌面版是实打实的干活:演示里一个开发者用一句话就让 ChatGPT 新建了讨论串、提交了合并请求,还顺带找到了一个 bug ...
推荐理由:OpenAI 把 ChatGPT-Live 语音模型搬上了桌面端,加了屏幕读取和浏览器控制,让语音真正能驱动智能体干活。开发者演示很具体,一句话完成分支、MR、找 bug,实用性拉满。没给更高分是因为刚发布,实际稳定性和权限边界还不清楚,我会先打个折。
Anthropic 把 Claude 的语音模式升级了,现在背后可以调用 Opus 和 Sonnet 这两个更强的模型来处理复杂问题,不再是以前那种轻量版。你还能在语音对话里直接让它操作已连接的工具,比如搜 Gmail 邮件或查 Slack 消息,不用切回文字界面。多语言支持也加上了,但官方没列出具体支持哪些语言。实际用起来的延迟和工具调用的准确率怎么...
推荐理由:Anthropic 这次语音模式升级把模型能力和工具调用两个缺口一次性补上了,对 Claude 用户群来说是实打实的体验提升。但正文没给出延迟数据、工具调用准确率,也没列具体支持哪些语言,信息有缺口,所以分数先压在 85 以下。整体够得上 featured。
OpenAI 给 macOS 和 Windows 的 ChatGPT 桌面应用加上了语音控制,你可以直接说话让 ChatGPT Work 或 Codex 里的多个智能体协同工作。背后是 GPT-Live 在跑,能同时听、说、协调任务。今天起 Plus、Pro、Business、Edu 和 Enterprise 用户都能用。正文没提延迟多少、能同时跑几个...
推荐理由:OpenAI 把语音控制的多智能体协作直接搬到了桌面端,交互上确实往前走了一步。GPT-Live 全量推给付费用户,说明他们自己觉得能用了。分数没给更高,是因为正文完全没提延迟和并发上限——实际用起来卡不卡、能同时带几个 agent,现在还不知道,这点先别太激动。
Anthropic 把语音模式从 Haiku 扩展到了 Opus 和 Sonnet,三个模型现在都能用语音交互了。更实际的变化是,语音模式可以接入 Gmail、Slack 这类应用,直接读出你的邮件和消息。不过正文没提延迟和准确率数据,实际体验好不好用,建议等上手测试再说。
推荐理由:Anthropic 把语音模式铺到了 Opus 和 Sonnet,还接上了 Gmail、Slack,实用性和话题性都有。但正文没给延迟和准确率数据,实际体验得等上手,所以分数压在 80 以下。
Anthropic 给 Claude 的语音模式换了底模,现在你可以手动选 Opus、Sonnet 或 Haiku,默认会沿用你上次文字聊天用的模型。官方说这能撑住更长的对话,比如帮你打磨沟通方式、过一遍客户提案、或者脑暴市场调研。更实际的变化是,语音模式现在能接通 Gmail、Google 日历、Slack、Canva 和 Notion,直接让它改会...
推荐理由:Anthropic 把语音模式的后台模型换成了用户可自选的 Opus/Sonnet/Haiku,同时接入了五个生产力工具,属于扎实的功能补强。没给 85 分以上是因为这更像追平竞品而非范式突破,而且正文没披露实际使用中的延迟或准确率数据,我会先打个折。
SpaceXAI 和 Cursor 一起训了个新模型 Grok 4.5,性能大概卡在 Opus 4.7 和 4.8 之间,但按 token 算钱的话,比 Opus 便宜 6 倍,比 GPT-5.5 便宜 3 倍。现在 Cursor 里能用,API 也开放了。OpenAI 这边,GPT-5.6(Sol、Terra、Luna)今天会推给所有用户,早期测试的...
推荐理由:SpaceXAI 和 Cursor 联合发布 Grok 4.5,有具体性能区间和价格对比,三个维度都踩中了。扣分是因为来源是 newsletter 摘要而非一手公告,且正文截断,GPT-5.6 信息不全。跨源验证后加 3 分到 82,整体判断不变。
部分用户已经在 ChatGPT 网页版和 App 的模型选择器里看到了 Bidi 1,和标准语音、高级语音并列,选中后语音气泡会变黄。它最大的变化是支持全双工:模型在说话的同时还能继续听你讲话,中途打断也能立刻响应。测试里有人让它从 1 数到 10,数到一半打断说“倒数”,它马上照做。OpenAI 还没正式公布上线时间,有媒体猜本周可能会扩大测试范围。...
推荐理由:OpenAI 语音能力一次实质升级——全双工加打断响应是之前高级语音模式做不到的。目前只部分推送、官方还没正式公告,所以分数不往上顶。但交互方式的改变够得上 featured。
这个模型叫 Seeduplex,是个原生全双工端到端语音模型,意思是它能一边听一边说,不用等你说完再反应。官方给了三个卖点:指令跟得准、抗干扰、会自己判断什么时候该接话。比如多人聊天时它能安静待着,只有聊到指定话题才插嘴;还能在对话里直接调用工具帮你订日历、发邮件。抗干扰方面,误回复和误打断都少了很多。判停延迟缩短了约 250 毫秒,复杂场景下抢话比例...
推荐理由:字节第一个全双工端到端语音模型开放邀测,有延迟和抗干扰的量化数据,不是纯营销稿。扣分点:仅邀测,没公布定价和规模,真实环境表现待验证。
Google Home Speaker 是第一款围绕 Gemini 做的音箱,99.99 美元,现在就能预订,本月发货。它支持说话中途改口、不用反复唤醒就能接着聊,内置了 10 种新声音。我会先打个折:这些听起来像连续对话的能力,其实分两层。基础的多步指令和打断纠错是机器自带的,但真正像人一样自由聊天的 Gemini Live,以及让音箱帮你总结 Ne...
推荐理由:99 美元定价和即日预订是硬信息,Gemini 首次落地音箱也够分量。没给更高分是因为目前只有发布信息,连续对话和 Gemini Live 的自由聊天能力还没经过真实环境验证,正文也没披露具体延迟和端侧模型细节。
彭博的 Mark Gurman 提前用上了新版 Siri,总结了 7 个实际改进:响应更快、能看懂屏幕内容、可以跨 App 操作、声音更自然等。但核心问题没变——Siri 还是把复杂请求丢给 ChatGPT,自己只处理简单指令。Gurman 的判断是,这次更新把 Siri 从“灾难”拉回到“勉强能用”,但离苹果在 WWDC 2024 画的那个主动式助手...
推荐理由:Gurman 这篇是实机体验,7 个改进点都有具体场景,信息密度够。但核心短板没变——Siri 自己处理不了复杂请求,只能当 ChatGPT 的传话筒,所以分数卡在 78 而不是更高。
Google 把 Gemini 3.5 的实时翻译功能放出来了,现在通过 Gemini API 就能用。它做的是语音到语音的低延迟翻译,覆盖 70 多种语言,能组合出 2000 个语言对,冷门小语种也包含在内。开发者可以把它接进实时对话、客服、直播或跨国会议里。主推文提到这消息被 Anthropic Fable 5 的声量盖过去了,还顺带提了阿里 Qw...
推荐理由:HKR 三项都成立:Google 把实时语音翻译做成 API 公开预览,对开发者有直接吸引力,也给了语言覆盖和语言对的具体数字。但文章只提了功能开放,没写价格、延迟基准和可用区域,信息有缺口,所以重要性停在 78。
Google 发了 Gemini 3.5 Live Translate,一个实时语音转语音翻译模型。它不等对方把整句话讲完,边听边翻,用流式更新把结果推出来,延迟压到几秒,还能保留原声的语速、音高和语调。支持 70 多种语言,目前通过 Gemini Live API、Google Meet 预览版和 iOS/Android 的 Google 翻译 Ap...
推荐理由:HKR 三项都成立:Google 把实时语音翻译绑定了 70+ 语言和说话人未结束就开始的流式输出。分数留在 82,因为正文没披露具体上线范围、定价和基准测试结果,实际效果和可用性还得等验证。
Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:原文给出模型的语言覆盖、实时翻译机制与多产品上线节奏,可据此判断语音翻译的可用边界。
Google DeepMind 开源了 Gemma 4 12B,一个 120 亿参数的多模态模型。它最大的变化是去掉了传统的独立视觉/音频编码器,把所有输入统一交给 Transformer 处理,架构更简单。模型能直接听懂语音,不再需要先转文字。官方说它用 Apache 2.0 协议开源,在 16GB 显存或统一内存的笔记本上就能跑。性能方面,正文没给...
推荐理由:我会先打个折:正文没给性能对比和具体 benchmark,所以没法判断它到底多强。但架构上的变化是实打实的——把视觉和音频编码器都砍掉,统一用 Transformer 处理,等于简化了管线,也降低了工程复杂度。能在 16GB 显存或统一内存的笔记本上跑,对个人开发者和中小企业是个实在的卖点。原生语音输入意味着不用再串一个 ASR 模块,做语音助手或实时对话应用会更轻量。Apache 2.0 协议也扫清了商用顾虑。整体看,这是一个有明确技术亮点的开源发布,但缺少性能验证,激动之前得等实测数据。
OpenBMB 把 VoxCPM2 的技术报告和模型都放出来了,Apache 2.0 协议。这是个 20 亿参数的语音生成模型,用超过 200 万小时的多语言语音数据训练,能说 30 种语言和 9 种中文方言。它主要干三件事:按自然语言指令设计语音、可控地克隆声音,以及高保真地延续一段语音。技术方案上,它把语音拆成两步走——先用 16kHz 做语义编码...
推荐理由:HKR 三项都踩中了:200 万小时训练数据和 9 种方言是实打实的钩子,参数和协议信息也够新,对国内语音开发者有直接参考意义。分数定在 78 是因为技术报告正文没给出具体的评测基准和对比数字,实际效果和落地表现还不清楚,这点先别太激动。
Victor M 在 X 上整理了一份清单,过去一周有超过 25 个开放权重的模型发布,几乎覆盖了所有模态。其中最扎眼的是 NVIDIA 的 Nemotron 3 Ultra,一个 550B 参数的混合架构(Mamba-MoE),每次推理只激活 55B 参数,上下文窗口能塞进 100 万个 token。不过正文被 Reddit 的安全策略拦住了,具体还...
推荐理由:我会先打个折:消息源是 X 上的个人整理,Reddit 原文还被安全策略拦了,具体细节没法交叉验证。但一周 25+ 个开放权重模型这个密度本身就值得关注,NVIDIA 那个 550B 的 Nemotron 用 Mamba-MoE 架构,激活参数只有 55B,上下文能塞 100 万 token,如果实测靠谱,推理成本会省不少。这点先别太激动,等完整评测出来再说。
RedNote 放出了一个叫 dots.tts 的语音合成模型,参数量 20 亿,用 Apache 2.0 协议开源。它走的是全连续架构,文字直接映射到语音,跳过了传统的音素流水线,合成采样率能到 48kHz。零样本声音克隆也支持,给一段参考音频就能模仿说话。不过 Reddit 原帖被屏蔽了,正文没披露训练数据、推理延迟和实际合成效果的具体指标,这点先...
推荐理由:HKR 三项都过了,但得先打个折:信息源是 Reddit 摘要,原帖还被屏蔽了,SOTA 的说法没给出具体基准名称或分数。Apache 2.0、20 亿参数、48kHz 和无音素流水线这些点够硬,给个低位的 featured 没问题。正文没披露训练数据、推理延迟和实际合成效果,这些缺口让判断得收着点。
Google AI 这周一口气更新了六样东西。Nano Banana 2 和 Pro 版正式上线,走 Gemini 企业平台、API 和 AI Studio 就能用。Co-Scientist 是一个多智能体系统,专门帮科研人员自动生成和优化新假设,相当于有个助手帮你读文献、想点子。Google Labs 出了个 dreambeans,会扒你的 Goog...
推荐理由:HKR 三项都踩中了:帖子一口气打包了 Google AI 六个更新,本地部署和开源这两个点对从业者很实在。正文没给基准测试、授权条款和定价细节,所以分数卡在 76,没往上走。
Google AI for Developers 放出了一个叫 Magenta RealTime 2(MRT2)的实时音乐模型,权重开放,推理引擎也开源了。你可以用 MIDI 键盘弹、打字给提示词,甚至用手势控制它来生成音乐。它在 MacBook 上原生跑,延迟压到了 200 毫秒以内,这个速度对实时演奏来说基本跟手。配套还给了应用和插件套件,到手就能...
推荐理由:HKR 三项都过:Google Magenta MRT2 有实打实的实时音频钩子、开放权重和低于 200ms 的本地延迟。对创意 AI 开发者吸引力很强,但本质上是一封公开信和政策诉求,不是已生效的法律,法案文本和执行时间表都没披露,所以放在 featured 而不是更高一级。
Higgs Audio v3 TTS 是 Boson AI 的语音合成模型,参数量大约 4B,底层用了 Qwen3-4B。它支持 100 种语言,在内部测试集上词错率/字错率能压到个位数。这个模型专门为语音助手那种边说边生成的场景设计,不等句子结束就能开始合成,后续文本到了还能保持声音、情绪和节奏连贯。开发者可以直接在输入文本里插标签来控制 20 多种...
推荐理由:H 和 K 靠 4B/100 语言/流式合成这几个硬指标撑住。R 偏弱,因为文章没给延迟、定价和权重,更像一个能力宣告而非可立刻复用的发布,所以放在 featured 低位。
谷歌发了 Gemma 4 系列的新成员,一个 120 亿参数的中等尺寸模型。它主打本地运行,16GB 显存或统一内存的笔记本就能带起来。架构上没走传统多模态那套编码器路线,直接原生支持音频输入,还带了一个叫 MTP 的推测解码模块来压延迟。模型用 Apache 2.0 协议开源。不过正文因为环境验证没加载出来,具体跑分、训练数据、实际推理速度这些关键信...
推荐理由:Gemma 4 12B 的卖点很直给:一个不算小的模型,能在普通笔记本上跑,还用了 Apache 2.0 协议。这对想自己折腾、又不想被云服务绑住的开发者来说,是个实在的更新。我会先打个折,正文没提具体推理速度和实际任务表现,光看参数和硬件门槛还不够,得等实测。但就凭“16G 笔记本能跑”这个钩子和宽松的开源协议,值得推给关注本地部署和成本控制的读者。
这篇文章本身没加载出来,微信页面显示环境异常需要验证,所以正文内容我没看到。从标题和已有的英文摘要看,讲的是 AI 语音输入工具正在进入办公和开发场景。Wispr Flow 这个产品全球下载量超过 250 万,12 个月留存率 70%,年用户增长 100 倍,说明用的人确实在猛增,而且用了就回不去。OpenAI 的 gpt-4o-transcribe ...
推荐理由:HKR 三项都站得住,但这是一篇带数据的工作流趋势观察,不是模型发布或平台级更新,放在 featured 里属于门槛线附近的那一类。我会先打个折,不把它当硬核技术突破看,但“打字正在变古老技艺”这个判断加上 250 万下载和 70% 留存,确实能让人重新想一遍语音交互的落地速度。
Miso One 放出了一个 8B 参数的开源 TTS 模型,主打一次语音克隆——给它一小段音频样本就能模仿那个人的说话风格和节奏。推理延迟标称 110ms,对实时对话场景算可用。模型权重直接挂在 GitHub 上,你可以自己部署,音频数据不用上传到第三方服务器。官方说 API 之后会出,但正文没提价格和上线时间。
推荐理由:我会先打个折:这是单条推文来源的发布,没有跑分对比、没写许可证细节、也没有第三方复现结果。但8B参数、110ms延迟、能自托管的一次语音克隆这几个事实本身够硬,放在featured刚好,再往上就缺验证了。
AI 音乐生成公司 Suno 宣布完成 4 亿美元 D 轮融资,投后估值 54 亿美元。官方公告没披露领投方、跟投方和资金具体用途,只说会继续让更多人玩上音乐创作。我会先打个折——这轮金额和估值数字很大,但正文没给任何业务数据或商业化进展,暂时只能当融资信号看。
推荐理由:Suno拿了4亿美元D轮,估值冲到54亿,AI音乐的钱还在往里涌。我会先打个折——正文没披露领投方是谁、钱具体怎么花,所以只能算一个信号,别急着当定论。对从业者来说,这轮融资说明资本还在押注AI生成音乐,但版权风险和创作者反弹是绕不开的暗雷。
xAI 和 Vapi 合作,把 Grok 设成了 Vapi 平台 12 个核心语音的默认引擎。Vapi 自己搞了一次盲测,Grok 拿了第一。另外 xAI 在 X 上发了个投票,4500 多人里有一半分不清 Grok 克隆的声音和真人原声。现在 Vapi 上的开发者可以直接在下拉菜单里选 Grok 来做文字转语音,仪表盘里也能用 Grok 的语音识别和...
推荐理由:这条消息有料,但别急着全信。Grok 被设为 Vapi 默认语音引擎,覆盖 250 多万个语音智能体,盲测还拿了第一,说明在语音合成这块 xAI 开始抢地盘了。不过正文没披露盲测的具体对手、评分维度和切换后的实际延迟、成本变化,所以“第一”的含金量得打个折。对做语音智能体的人来说,默认引擎换人意味着后续的定价、迁移成本和稳定性都要重新评估,值得关注但还需要更多实测数据。
Gemini App 发帖演示了用 Gemini Omni 捏一个长相和声音都像你的数字分身,然后直接塞进视频创作里。帖子没提这个功能什么时候上线、要不要付费,也没说怎么防止别人拿你的形象乱用。
推荐理由:我会先打个折:正文只说了 Gemini Omni 能做个人数字分身,没披露上线范围、价格、安全机制或授权流程,所以信息缺口不小。但官方账号自己放出这个功能点,说明产品方向已经定了,对做视频创作和虚拟人业务的人是个明确信号。HKR 三项都踩中:钩子够强,事实够新,风险够直接。因为细节太少,重要性只能给到 74,放在 featured 里当个产品更新提醒,别当成熟方案看。