跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

116 条精选相关主题多模态AI 视频产品更新

最新精选

第 41–60 条 · 共 116 条

5月27日星期三

TechCrunch · AI

ElevenLabs 的新音乐模型能在同一首歌里切换曲风

ElevenLabs 发布了音乐生成模型 Music v2,主打功能是可以在不破坏整首歌的前提下,单独重写其中一段,比如从歌剧直接跳到重金属再跳回来,或者塞一段快嘴说唱。公司说模型在唱腔和编曲上都更复杂了,还能加音效。不过正文没披露上线时间、定价和模型参数,实际效果和版权风险也还没第三方验证,这点先别太激动。

推荐理由:HKR-H/K 通过,因为 ElevenLabs 这次把音乐生成做成了分段可替换、中途可切风格,不是整首重来。我会先打个折:发布时间、定价、模型大小全都没披露,所以行业层面的震动暂时只能算中等。如果是真的,对做音效和配乐的人挺省钱,但先别太激动。

AI HOT 精选

Reachy Mini 机器人现在能完全在本地跑语音对话了

Hugging Face 给 Reachy Mini 机器人配了一套纯本地运行的语音对话方案,数据不用上传云端。他们用 speech-to-speech 库搭了一条流水线:先靠 Silero VAD 检测有没有人在说话,再用 Parakeet-TDT 把语音转成文字,接着交给大模型想怎么回,最后让 Qwen3-TTS 把文字念出来。这套东西通过一个兼容...

推荐理由:HKR 三项都成立:有个清晰的本地机器人语音钩子,技术栈细节给得实在,对边缘端语音代理场景有直接吸引力。范围就限定在 Reachy Mini 的语音交互上,所以放在 featured 档。

AI HOT 精选

小米 MiMo 2.5 Pro 永久降价,最高砍掉 99%,跟 DeepSeek V4 Pro 一个价

小米把 MiMo-V2.5 系列的 API 价格永久打下来了,最高降了 99%,现在和 DeepSeek V4 Pro 定价持平。花同样的钱,能用的 token 数多了 5 到 8 倍,计费方式也变简单了。老用户之前买的套餐额度会全部重置补满。降价的原因是他们在推理环节做了全栈优化,省下来的成本直接让出来了,具体技术细节后面会发博客。另外 MiMo-V...

推荐理由:HKR 三项都成立:99% 的降幅和直接点名 DeepSeek 同价,话题性够强;降价幅度和生效时间都是硬信息;API 成本压力是从业者每天在算的账。不过这只是调价公告,没有新模型或新能力,所以重要性停在 76 分,不往上拉了。

5月26日星期二

FT · 科技

Spotify 老板为 AI 生成音乐站台,但没透露版权费怎么分

Spotify 跟环球音乐签了个协议,允许用户用 AI 做“受控”的翻唱和混音。正文被付费墙挡了,看不到授权范围、收入分成比例和具体上线时间。

推荐理由:FT 的信源和 Spotify-Universal 的授权框架让 HKR 三项都站得住。我会先打个折:分账怎么算、授权到底覆盖多少曲库、什么时候上线,正文全都没说,所以这更像一个信号而非落地产品。对从业者来说,值得留意的是大平台开始用“受控”这个词给 AI 生成内容划边界,但别急着激动,等具体条款出来再看是真省钱还是画饼。

5月24日星期日

AI HOT 精选

阶跃星辰发了 StepAudio 2.5 实时语音模型,能听懂语气、停顿和情绪,还支持自定义人格

这个模型不只是把语音转成文字再回复,它会捕捉你说话时的语气、语速、停顿甚至微表情这些“副语言”信息,让对话更自然。你可以通过 API 给它设定人格、背景故事和说话风格,官方说原生人格选项超过一万种,组合起来能有数百万种特征。产品内置了 5 个预设人格可以直接试,并且用 RLHF(基于人类反馈的强化学习)做了调优,在复杂的角色扮演压力测试里也能保持人设不...

推荐理由:我会先打个折:这是官方推文,没给延迟、定价、基准测试和实际铺开范围,所以只能当个中等体量的产品更新来看。亮点在于副语言感知——就是能听懂语气、停顿、笑声这些非文字信号,再配上可调的人格,对想做出有“人味儿”的语音助手团队来说,确实是个值得跟的信号。但没实测数据之前,先别太激动。

5月23日星期六

r/LocalLLaMA

美团 LongCat 放出视频数字人模型 1.5 版,换用 Whisper 做语音驱动,推理步数压到 8 步

美团 LongCat 在 Hugging Face 上发了 LongCat-Video-Avatar-1.5,模型权重用 MIT 协议开源。它能做音频驱动视频、音频加图片驱动视频,还能接着一段视频往后生成。这版把语音编码器从 Wav2Vec2 换成了 Whisper-Large,理论上对语音的理解会更准。推理部分用 DMD2 蒸馏把步数降到了 8 NF...

推荐理由:我会先打个折:这不算行业地震级别的发布,但对做开源视频数字人的团队来说是个实在的更新。H、K、R 三条都站得住——美团 LongCat 把模型权重用 MIT 协议放出来,推理压到 8 NFE,意味着本地跑起来的门槛低了不少。技术上,它把语音编码器从 Wav2Vec2 换成 Whisper-Large,对中文语音的适配可能会更好,但正文没给出具体的对比测试数据,这点先别太激动。如果是真的省钱又好用,对想自己搭数字人、不想走云端 API 的开发者来说,是个值得上手试试的选项。

TechCrunch · AI

有人用 AI 把空难录音的频谱图还原成了飞行员的声音

美国国家运输安全委员会(NTSB)发现,去年一起 UPS 货机空难中遇难飞行员的声音被人用 AI 重建,并在网上流传。联邦法律禁止 NTSB 公开驾驶舱录音,但调查档案里放了一份录音的频谱图(一种把声音高低频信号转成图像的文件)。有 YouTuber 指出,理论上可以从这张图里把音频还原出来,随后就有人照着公开的文字记录,用 Codex 等 AI 工具...

推荐理由:标题和摘要给的信息够撑起 HKR 三项。事件本身有伦理钩子,技术路径有点新意,NTSB 的反应也说明它不只是个猎奇新闻。不过正文没展开技术细节和 NTSB 后续处理,范围偏窄,放在 featured 档里合理。

Hacker News 首页

有人用 AI 把空难遇难飞行员的声音“复原”了,NTSB 紧急关停公开档案库

美国国家运输安全委员会(NTSB)在 5 月 21 日暂停了其在线事故档案系统的公开访问。起因是网上有人利用软件和 AI 工具,根据调查文件里的信息,重新生成了 UPS 货运航班 2976 号坠机前驾驶舱内遇难飞行员的声音片段。联邦法律本来就禁止调查机构公开驾驶舱录音,这次绕过禁令的“复原”行为直接促使 NTSB 紧急关停了整个数据库。文章没有披露被复...

推荐理由:我会先打个折:正文只有 RSS 和 HN 的元数据,案卷编号、音频是谁做的、NTSB 在什么条件下撤的,全都没写。所以这条消息的“新”是成立的,但信息厚度很薄。钩子很强——用 AI 复刻死人声音,还逼得官方机构撤材料,这在安全和伦理上都够扎眼。对从业者来说,它提醒了一件事:语音克隆在公共记录上的滥用,已经开始触发真实的制度反应。这点先别太激动,等后续有案卷细节再判断影响多大。

5月22日星期五

AI HOT 精选

网易有道把“子曰4”的多模态模型和语音合成模型都开源了

这次开源的是一个270亿参数的多模态模型和一个语音合成模型。多模态模型主要针对教育场景,能看懂带图表的数学题,在纯中文数理难题上准确率81.4%。团队用精简过的推理样本做训练,把模型思考过程的输出长度压缩了43.2%,所以回答同样的问题,吐出的token更少、推理更快,直接效果就是推理成本会降下来。语音合成模型支持用3秒中文音频克隆音色,能跨14种语言...

推荐理由:我会先打个折:有道不是前沿大模型实验室,所以这条消息的份量到不了顶流,但信息本身够具体。27B 参数的多模态模型,中文数理题做到 81.4% 准确率,说明在中文理科场景有一定可用性,不过正文没披露评测集和对比基线,这点先别太激动。语音模型覆盖 14 种语言,对做多语言 TTS 产品的人是个直接可用的资源。全量开源意味着可以直接拿来微调或部署,省去从头训的成本,但实际推理开销和显存需求正文没提,动手前得自己测一下。整体看,这是一次信息完整、可验证的发布,对关注中文多模态和语音落地的从业者有实操参考价值。

AI HOT 精选

智谱发布 GLM-5.1 高速版,API 输出冲到每秒 400 个 token

智谱在 5 月 22 日给部分企业客户开放了 GLM-5.1-highspeed 接口,输出速度标称 400 tokens/s,说是目前大模型厂商里最快的。过去跑得快的模型通常能力会打折,这次智谱声称把旗舰模型的能力和低延迟同时塞进了生产环境。提速主要靠 GLM 团队和 TileRT 团队在三个层面做的系统优化:推理引擎重写了核心路径来提升单卡吞吐;调...

推荐理由:智谱扔出一个 400 tokens/s 的 API 速度数字,说是全球纪录,我会先打个折——正文没披露测试条件、并发数、上下文长度和定价,这些缺口让“纪录”暂时只能当个参考。但 GLM 和 TileRT 联手做系统级优化这件事本身有信息量,说明国产模型在推理加速上开始卷工程落地,不只是卷榜单。对从业者来说,速度快意味着同样任务花钱少、等得短,这点先别太激动,等看到实际压测和价格再判断值不值得切。

TechCrunch · AI

Spotify 和环球音乐达成协议,付费用户可以用 AI 翻唱和混音歌曲

Spotify 跟环球音乐签了授权,准备让 Premium 用户用生成式 AI 做歌曲的翻唱和混音。这个功能会作为付费附加包上线,产生的收入会分给参与计划的艺人。但正文没公布具体分成比例、价格和上线时间,只说两家公司达成了授权协议。

推荐理由:HKR 三项都成立:Spotify 给 AI 翻唱开了条正版路子,Premium 用户能用,艺人有分成——但具体怎么分、分多少,正文一个字没提。信息缺口明显,所以停在 featured,不到 p1。

5月21日星期四

The Verge · AI

Spotify 要给付费用户上线 AI 混音和翻唱功能,环球音乐已签授权

Spotify 和环球音乐刚谈成一笔授权,Premium 用户能付费让 AI 把平台上的歌生成混音版或翻唱版。艺人可以选择不参加,参加的能从这些 AI 版本里分到版税。去年 10 月 Spotify 就说过要和几大唱片公司搞“负责任的 AI 产品”,这次算是第一个落地的。正文没披露具体定价、上线时间,也没说 AI 模型是谁家的、生成质量到什么程度。

推荐理由:Spotify 和环球音乐达成授权,让付费用户自己生成 AI 混音和翻唱,不是发模型或开发工具,而是直接做成消费功能。我会先打个折:正文没披露生成质量、延迟和实际定价,也没说版税怎么算、退出机制怎么落地。但光是“正版授权+付费使用+艺人可退出”这套组合,就已经把 AI 音乐从技术 demo 往产品化推了一步,所以放在 featured 档。

FT · 科技

Spotify 和环球音乐签了授权,要在 App 里给重度乐迷推 AI 生成的付费音乐

Spotify 跟环球音乐集团谈成了一笔授权,打算在 Spotify 应用内加一个付费的 AI 音乐生成功能,主要瞄准那些花钱不手软的重度乐迷。目前正文被付费墙挡住,看不到具体定价、上线时间、支持哪些国家,也没提用的是什么模型。

推荐理由:我会先打个折:定价、上线时间和钱怎么分,正文都没说,所以这条还到不了必写的程度。但 Spotify 和环球音乐把 AI 音乐从技术演示变成应用内付费产品,方向很明确——瞄准愿意多花钱的铁粉,用 AI 工具让他们自己生成内容。这比单纯放个 AI 歌单更进一步,等于把生成能力直接卖给用户。版权和收入分配是绕不开的雷区,正文没披露分成细节,这点先别太激动。

5月20日星期三

AI HOT 精选

Stability AI 发布 Stability Audio 3.0,能生成超过 6 分钟的专业歌曲

Stability AI 发了四个新音频模型,最小的两个(4.59 亿参数)能在手机或电脑本地跑,生成两分钟以内的声音和音乐。中型(14 亿参数)和大型(27 亿参数)模型能把完整歌曲拉到 6 分 20 秒,比上一代翻了一倍多。小号和中号模型已经开源,大号模型只走 API 和付费托管,年收入超 100 万美元的公司必须买商业授权。训练数据来自华纳和环球...

推荐理由:我会先打个折:标题里的“专业级”正文没给出任何评判标准或盲测结果,这点先别太激动。能生成超过6分钟的音乐确实比多数短片段模型进了一步,4款规格也说明在考虑不同算力场景。但全文没披露训练数据是否含版权素材、生成内容的商用条款,也没给任何客观音质指标,所以只能算一次产品更新,离行业震动还差几口气。

TechCrunch · AI

Stability AI 发了新音频模型,最长能生成六分多钟的歌

Stability AI 推出了 Stable Audio 3.0 系列,一共四个模型。最小的两个(4.59 亿参数)能在设备本地跑,生成两分钟的音乐或音效;中等(14 亿参数)和大杯(27 亿参数)模型则能生成 6 分 20 秒的完整曲子,比 2024 年的 2.0 版长了一倍多。小、中杯模型都开放权重,可以随便用和改。不过正文没提训练数据来源、生成...

推荐理由:我会先打个折:标题的 6 分钟和正文的 2 分钟对不上,正文没解释这个差距,所以别太激动。但端侧能跑出 2 分钟音轨这件事本身挺省钱,对做音频工具的人是个信号。整体算中等偏轻的产品更新,靠标题的钩子和端侧成本点撑到 featured 门槛。

AI HOT 精选

Gemini Omni 能拿你的脸和声音做数字分身,以后拍视频不用真人出镜了

Gemini Omni 上线了一个新功能,你可以用自己的长相和声音创建一个数字分身。建好之后,这个分身就能替你出镜生成视频,不用每次都重新上传照片。正文没提这个功能要不要钱、在哪些地区能用、什么时候正式上线,我会先打个折观望。

推荐理由:Gemini Omni 让用户拿自己的形象和声音做数字分身视频,建好之后不用反复传图,这点对做内容的人挺方便。但正文没写价格、哪些地区能用、什么时候上线,所以现在只能当个预告看。我会先打个折:功能听着省事,可落地时间表和成本都不清楚,别太激动。

TechCrunch · AI

Gmail 现在能直接语音问收件箱了,Google I/O 2026 上演示了用 Gemini 翻找邮件细节

Google 给 Gmail 的 AI 收件箱加上了语音对话搜索,你可以直接开口让 Gemini 帮你从邮件堆里挖出具体信息。目前正文没披露这个功能会推给哪些用户、支持什么语言、要不要额外付费、响应有多快,也没说背后是用什么检索机制把邮件捞出来的。

推荐理由:我会先打个折:这功能听起来挺方便,开车时动嘴就能查邮件里的航班号或报销金额。但正文只说了“可以语音搜 Gmail”,没交代支持哪些语言、是不是全球推送、要不要额外付费,也没讲清楚 Gemini 到底怎么从邮件里捞出答案——是直接扫全文还是先建索引。这点先别太激动,等有实测再判断到底省不省事。

TechCrunch · AI

Google 学 Meta 做音频眼镜,在 I/O 2026 上发了款靠语音交互的智能眼镜

Google 在 I/O 大会上宣布和 Warby Parker、Gentle Monster 合作,推出新的“音频眼镜”。这副眼镜没有屏幕,主要靠语音指令来操作 Google 自家的应用和服务,包括调用 Gemini 助手。它会同时支持 Android 和 iOS,设计上有三星参与,预计今年晚些时候上市。正文没披露具体价格、硬件参数和确切发售日期,所...

推荐理由:我会先打个折:正文没给价格、上市时间和硬件参数,所以只能当个信号看,别太激动。但 Google 在 I/O 上亮出这副音频眼镜,摆明了要跟 Meta 抢 AI 穿戴入口,语音调用 Gemini 这条信息本身是实的。对从业者来说,这比单纯发个模型更能说明大厂在把 AI 往硬件里塞的节奏。

The Verge · AI

Gmail 要能语音对话了:对着收件箱直接问,它帮你翻邮件找答案

Google 给 Gmail 加了一个叫 Gmail Live 的语音功能,点搜索栏图标就能直接开口问收件箱里的内容。发布会上员工现场演示,问了孩子学校的活动和自己去底特律的行程,Gmail 直接从邮件里抓出了学校展示活动的日期地点和行程信息。正文没披露这个功能什么时候上线、支持哪些语言,也没说离线能不能用。

推荐理由:我会先打个折:正文只给了两个演示例子,没写什么时候上线、要不要付费、背后用的什么模型。所以判断停在 featured 低段。但这件事本身挺直观——Gmail 搜索栏加了个语音入口,你对着它问“底特律的酒店订单”或者“孩子学校活动日期”,它直接回话,不用翻邮件。对每天被邮件淹没的人来说,省事是真的。这点先别太激动,等正式推送再看实际识别率和隐私处理。

TechCrunch · AI

谷歌发布 Gemini Omni:用文字、图片和音频就能直接生成视频

谷歌推出了新的多模态模型 Gemini Omni,能把文字、图片、音频和视频作为输入,通过对话直接生成或编辑视频。首发版本叫 Omni Flash,主打跨模态推理,也就是模型能同时理解不同格式的信息并据此产出视频。但文章没公布具体上线时间、价格、上下文长度限制、跑分成绩,也没说 API 什么时候开放。这点先别太激动,目前看更像是一个技术预告,实际能用起...

推荐理由:Google 把 Gemini 的多模态能力推到了视频生成这一步,Omni Flash 能通过聊天界面把文字、图片、音频甚至视频片段变成新视频,还能编辑。这个更新在 HKR 三个维度上都站得住:玩法直观有传播力,产品形态和输入模态是明确的新信息,而且正好卡在多模态视频生成这个竞争激烈的节点上。正文没公布定价和具体上线时间,所以我会先打个折,把它放在必写但不算顶格的区间。