跳到正文

#语音

今日 0 条

6月3日星期三

AI HOT 精选

Suno 拿了 4 亿美元 D 轮,估值冲到 54 亿

AI 音乐生成公司 Suno 宣布完成 4 亿美元 D 轮融资,投后估值 54 亿美元。官方公告没披露领投方、跟投方和资金具体用途,只说会继续让更多人玩上音乐创作。我会先打个折——这轮金额和估值数字很大,但正文没给任何业务数据或商业化进展,暂时只能当融资信号看。

推荐理由:Suno拿了4亿美元D轮,估值冲到54亿,AI音乐的钱还在往里涌。我会先打个折——正文没披露领投方是谁、钱具体怎么花,所以只能算一个信号,别急着当定论。对从业者来说,这轮融资说明资本还在押注AI生成音乐,但版权风险和创作者反弹是绕不开的暗雷。

AI HOT 精选

Grok 成为 Vapi 语音平台的默认引擎,覆盖 250 多万个语音智能体

xAI 和 Vapi 合作,把 Grok 设成了 Vapi 平台 12 个核心语音的默认引擎。Vapi 自己搞了一次盲测,Grok 拿了第一。另外 xAI 在 X 上发了个投票,4500 多人里有一半分不清 Grok 克隆的声音和真人原声。现在 Vapi 上的开发者可以直接在下拉菜单里选 Grok 来做文字转语音,仪表盘里也能用 Grok 的语音识别和...

推荐理由:这条消息有料,但别急着全信。Grok 被设为 Vapi 默认语音引擎,覆盖 250 多万个语音智能体,盲测还拿了第一,说明在语音合成这块 xAI 开始抢地盘了。不过正文没披露盲测的具体对手、评分维度和切换后的实际延迟、成本变化,所以“第一”的含金量得打个折。对做语音智能体的人来说,默认引擎换人意味着后续的定价、迁移成本和稳定性都要重新评估,值得关注但还需要更多实测数据。

5月26日星期二

FT · 科技

Spotify 老板为 AI 生成音乐站台,但没透露版权费怎么分

Spotify 跟环球音乐签了个协议,允许用户用 AI 做“受控”的翻唱和混音。正文被付费墙挡了,看不到授权范围、收入分成比例和具体上线时间。

推荐理由:FT 的信源和 Spotify-Universal 的授权框架让 HKR 三项都站得住。我会先打个折:分账怎么算、授权到底覆盖多少曲库、什么时候上线,正文全都没说,所以这更像一个信号而非落地产品。对从业者来说,值得留意的是大平台开始用“受控”这个词给 AI 生成内容划边界,但别急着激动,等具体条款出来再看是真省钱还是画饼。

5月23日星期六

TechCrunch · AI

有人用 AI 把空难录音的频谱图还原成了飞行员的声音

美国国家运输安全委员会(NTSB)发现,去年一起 UPS 货机空难中遇难飞行员的声音被人用 AI 重建,并在网上流传。联邦法律禁止 NTSB 公开驾驶舱录音,但调查档案里放了一份录音的频谱图(一种把声音高低频信号转成图像的文件)。有 YouTuber 指出,理论上可以从这张图里把音频还原出来,随后就有人照着公开的文字记录,用 Codex 等 AI 工具...

推荐理由:标题和摘要给的信息够撑起 HKR 三项。事件本身有伦理钩子,技术路径有点新意,NTSB 的反应也说明它不只是个猎奇新闻。不过正文没展开技术细节和 NTSB 后续处理,范围偏窄,放在 featured 档里合理。

Hacker News 首页

有人用 AI 把空难遇难飞行员的声音“复原”了,NTSB 紧急关停公开档案库

美国国家运输安全委员会(NTSB)在 5 月 21 日暂停了其在线事故档案系统的公开访问。起因是网上有人利用软件和 AI 工具,根据调查文件里的信息,重新生成了 UPS 货运航班 2976 号坠机前驾驶舱内遇难飞行员的声音片段。联邦法律本来就禁止调查机构公开驾驶舱录音,这次绕过禁令的“复原”行为直接促使 NTSB 紧急关停了整个数据库。文章没有披露被复...

推荐理由:我会先打个折:正文只有 RSS 和 HN 的元数据,案卷编号、音频是谁做的、NTSB 在什么条件下撤的,全都没写。所以这条消息的“新”是成立的,但信息厚度很薄。钩子很强——用 AI 复刻死人声音,还逼得官方机构撤材料,这在安全和伦理上都够扎眼。对从业者来说,它提醒了一件事:语音克隆在公共记录上的滥用,已经开始触发真实的制度反应。这点先别太激动,等后续有案卷细节再判断影响多大。

5月22日星期五

TechCrunch · AI

Spotify 和环球音乐达成协议,付费用户可以用 AI 翻唱和混音歌曲

Spotify 跟环球音乐签了授权,准备让 Premium 用户用生成式 AI 做歌曲的翻唱和混音。这个功能会作为付费附加包上线,产生的收入会分给参与计划的艺人。但正文没公布具体分成比例、价格和上线时间,只说两家公司达成了授权协议。

推荐理由:HKR 三项都成立:Spotify 给 AI 翻唱开了条正版路子,Premium 用户能用,艺人有分成——但具体怎么分、分多少,正文一个字没提。信息缺口明显,所以停在 featured,不到 p1。

5月12日星期二

TechCrunch · AI

AI 语音公司 Vapi 拿下亚马逊 Ring 订单后估值冲到 5 亿美元,从 40 多家对手中胜出

Vapi 做的是让 AI 接打电话的语音平台。亚马逊旗下的 Ring 在评估了 40 多个方案后选了它,用来处理客户支持和销售电话。公司说从 2025 年初到现在,企业业务规模翻了十倍,最新一轮融资后估值达到 5 亿美元。不过正文没披露具体营收数字和 Ring 这笔单子的金额,所以这个十倍增长是从多小的基数算起的,得打个折看。

推荐理由:一条融资新闻能到 featured,靠的是 Amazon Ring 那场 40 选 1 的比稿。这不是 PR 通稿里自己说“领先”,而是客户掏钱投票的结果。5 亿美元估值和 10 倍企业增长让故事有厚度,但正文没披露收入基数,所以 10 倍到底是从 10 万涨到 100 万还是更大体量,这点先别太激动。整体看,语音 agent 进大客户采购流程这件事本身比估值数字更有信息量。

2月9日星期一

36 氪 · 直链

前百川智能联创焦可离职做来福电台,想造能记住你喜好的 AI 主播

焦可离开百川智能后,在 2025 年初创办了 AI 音频公司“来福电台”。他做的不是单纯的 AI 播客工具,而是 15 个中文和 2 个英文 AI 主播,每个主播风格不同,能根据用户收听历史推荐内容,用户也可以随时打断节目提问或聊天。焦可认为语音交互能产生足够多的长上下文,让 AI 记住用户偏好,这是建立情感链接和个性化服务的关键。来福在 2025 年...

推荐理由:这篇值得上featured,因为它把一个容易被当成“AI播客工具”的产品讲清楚了真正想赌的方向:不是生成音频,而是造有记忆、可交互的AI主播。硬信息够实,融资额、主播数量、使用时长、内容生成速度都有,而且把DTU和长记忆当成基础设施壁垒在说,不是空谈概念。车载合作这条线虽然没展开细节,但已经给出一个可验证的落地场景。公司阶段偏早期,所以放在featured而不是p1,但判断本身有信息量,我会先打个折观望后续数据。