跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

116 条精选相关主题多模态AI 视频产品更新

最新精选

第 81–100 条 · 共 116 条

5月5日星期二

r/LocalLLaMA

微软 VibeVoice 语音合成与长音频转写被移植到纯 C++,推理不再需要 Python

LocalAI 把微软的 VibeVoice 模型用 ggml 重写成 C++ 版本,叫 vibevoice.cpp,支持 CPU、CUDA、Metal 和 Vulkan 推理,不用装 Python 环境。语音合成这边,给一段 30 秒的参考录音就能克隆声音,输出 24kHz 的语音。语音识别部分用的是一个 7B 模型,能处理长音频并区分不同说话人,结...

推荐理由:这条更新对做本地音频部署的人有用,给出了具体的运行数字和限制。我会先打个折:它来自社区移植,不是微软官方动作,而且缺少流式支持这点在实时场景里是硬伤。整体在 72–77 分 featured 档位合理,不值得当天必写,但值得放进雷达。

5月4日星期一

r/LocalLLaMA

Gemma 4 E2B 在 8GB 安卓手机上跑得动,还搭了个本地语音笔记 App

一位 Reddit 用户把 Gemma 4 E2B(2.4GB 模型)塞进 8GB 内存的 OnePlus CE 5 手机里,做了个完全离线的语音笔记应用。流程是:Whisper Small(244MB)先把语音转成文字,Gemma 4 E2B 再负责把文字拆成笔记并打标签。录一段 10 到 15 秒的语音,从转录到出结果总共花 12 到 15 秒。搜...

推荐理由:这是 Reddit 个人项目帖,不是官方发布,但信息量够。作者把 Whisper Small 转写和 Gemma 4 E2B 分类都塞进手机,还搭了检索管道(查询扩展、多路全文搜索、RRF 融合,可选 Gemma 重排,超时 15 秒回退),工程细节比很多官方 demo 实在。我会先打个折:没提功耗、发热和长时间稳定性,12-15 秒延迟对语音笔记算可用但不算快。如果是真的,2.4GB 模型在 8GB 手机上跑通整套流程挺省钱,对想做离线 AI 应用的人有参考价值。

5月2日星期六

Hacker News 首页

Spotify 给真人音乐人加“已验证”绿标,用来和 AI 账号区分开

Spotify 开始给符合“真实性标准”的艺人打上绿色对勾和“Verified by Spotify”标识,帮用户分辨账号背后是真人还是 AI。验证条件包括关联社交账号、稳定的听众数据、有周边或演出信息等,官方说听众常搜的艺人里超过 99% 都会拿到这个标,覆盖几十万人。但正文没披露具体审核流程、申诉机制,也没说怎么处理那些不用巡演和周边的小众独立音乐...

推荐理由:Spotify 开始给人类艺人贴 Verified 徽章,标题说就是为了跟 AI 音乐划清界限。我会先打个折——正文只有 RSS 片段,怎么验证、覆盖多少人、什么时候上线、审核标准是什么,全都没说。这点先别太激动,信息缺口太大。但话题本身够敏感,涉及版权、艺人身份和 AI 标注,容易引发行业争论,所以给了 featured 和 72 分。

5月1日星期五

量子位 · 公众号

他用 AI 办了场音乐节,主题是“别读博”

B站UP主“混沌皮切总”用 AI 生成了 42 首“劝退读博”的歌,全网播放量超过 5000 万。一首歌要跑上百次生成,同时用 Suno、MiniMax 音乐、心模拉和 ACE-Step 几个工具来回试。正文没披露具体技术细节,但能看出现在 AI 做歌最花时间的不是生成,而是人得一首首听、一首首挑,这个筛选成本很高。

推荐理由:HKR 三项都站得住:梗本身够怪、传播数据和工作流细节都给了、最后落点卡在“AI 放大产出但人工筛选成本没降”这个创作者的真实焦虑上。这不是模型或平台发布,是实打实的案例拆解,分数放在 78-84 区间合理。

彭博科技

音频行业开始头疼了:39% 的新播客可能是 AI 生成的“播客垃圾”

Podcast Index 抓了九天的新播客数据,发现 39% 很可能是 AI 生成的,行业管这叫“podslop”(播客垃圾)。文章没披露他们用什么方法检测、样本总量多大、以及这些节目分布在哪些平台。这个比例看着挺高,但先别太激动——如果检测手段比较糙,可能会把一些只是用了 AI 辅助的节目也算进去。对听众来说,最直接的影响是以后找真人聊出来的好节目...

推荐理由:标题和摘要都指向一个清晰的信号:音频圈开始正视 AI 批量生产低质内容的问题。39% 这个比例挺扎眼,但正文没交代他们怎么判断“疑似 AI 生成”、样本量多大、主要出现在哪些平台,所以这个数字我先打个折看。Bloomberg 的报道加上 Podcast Index 的数据来源,够得上 featured,但算不上行业级大事件,更像一个值得关注的早期警报。

4月30日星期四

Google DeepMind

Google DeepMind 发布 AI co-clinician 医疗研究计划

Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据综合工具;在 140 项问诊技能评估中,它在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。

推荐理由:Google DeepMind 公开 AI co-clinician 研究计划与多模态问诊评测,可了解医疗智能体当前能力边界。

r/LocalLLaMA

用 Kokoro 82M 和 Qwen 在本地把 PDF 转成有声书

Reddit 用户 purellmagents 搭了一套完全跑在本地的 PDF 转有声书流程,用 Kokoro 82M 做语音合成,Qwen 3.5 0.8B 或 2B 处理文本,llama.cpp 做推理,整个应用用 Tauri 2.0 打包,在 M1 Mac 上运行。工作方式是先读前 15 句,边读边准备下 15 句,减少等待。作者说真正的难点不在...

推荐理由:HKR 三项都踩中了,但本质是 Reddit 上的个人工作流展示,不是模型或平台发布。具体组件和 15 句预处理窗口让它能进低分 featured 档。我会先打个折:正文没披露代码和表格朗读的具体处理逻辑,这点先别太激动。

4月29日星期三

新智元 · 公众号

谷歌翻译 20 岁,劈柴哥说它换了四代 AI,现在能直接听懂语气了

劈柴哥发帖庆祝谷歌翻译上线 20 年,月活用户到了 10 亿。他梳理了背后的四代技术:最早是统计机器翻译,2016 年换成神经网络翻译,后来用上 PaLM 2 大模型,2024 年一口气加了 110 种语言。最新的是 Gemini 2.5 Flash 的原生音频翻译,不再先把语音转文字再翻译,而是直接处理声音,能保留原话的语调、停顿和节奏。劈柴哥形容这...

推荐理由:核心事件是谷歌翻译过生日和架构回顾,不是新品发布,但 10 亿月活、110 种语言扩增和原生语音翻译的细节撑得起 featured 档位。我会先打个折,因为正文没给出原生语音功能的具体上线时间或实测数据,这点先别太激动。不过它点到了语音 AI 产品眼下最纠结的问题:级联管线 vs. 原生多模态,所以值得从业者看一眼。

X · @dotey(宝玉)

微软开源语音模型 VibeVoice-ASR 实测:一小时播客 8 分 45 秒转完,但 32GB 内存的 Mac 跑不动

Simon Willison 在 128GB 内存的 M5 Max MacBook Pro 上跑了社区做的 4-bit 量化版 VibeVoice-ASR,模型大小 5.71GB。转写一小时播客用了 8 分 45 秒,prefill 阶段内存峰值冲到 61.5GB,生成阶段稳定在 18GB 左右,所以普通 32GB 笔电基本没戏。这个 9B 参数模型最...

推荐理由:这篇不是新模型发布,而是 Simon Willison 拿微软 1 月开源的 VibeVoice-ASR 在自己机器上跑了一遍,给出了速度和内存的实测数字。我会先打个折:这只是单次测试,不代表所有场景,但 61.5GB 的内存峰值确实把 32GB 笔电劝退了,这点对想本地部署的人很关键。正文没提准确率对比,所以别当全面评测看,就当一份硬件门槛参考。

4月28日星期二

量子位 · 公众号

面壁智能发 MiniCPM-o 4.5 技术报告,12GB 消费显卡就能跑全双工音视频

面壁智能、OpenBMB、清华 NLP 和数学基础中心放出了 MiniCPM-o 4.5 的技术报告。模型参数约 90 亿,能同时处理视频、音频和文字流。核心设计叫 Omni-Flow,把不同信号放在一条统一时间线上分时复用,省掉了外挂的语音活动检测模块。报告里说,一张 12GB 显存的 RTX 5070 就能跑全双工模式,实时率做到 0.4,意味着生...

推荐理由:HKR 三项都成立:9B 全双工模型在 12GB 消费卡上跑到 RTF 0.4,靠 Omni-Flow 的时间轴对齐机制实现。不是前沿实验室的旗舰发布,但实用性强,78–84 分合理。

量子位 · 公众号

小米开源 MiMo-V2.5 系列模型,Pro 版 4 小时无人工干预搭出一个 macOS 桌面

小米把 MiMo-V2.5 系列的权重放出来了,包含 Pro Agent、多模态基座、TTS 和 ASR 几个模型。MiMo-V2.5-Pro 在 4.3 小时内连续调用了 672 次工具,在 SysY 基准上拿了满分 233 分,全程没让人接手,直接跑通了一个带 54 个应用的类 macOS 桌面。对从业者来说,值得关注的是它支持 100 万 tok...

推荐理由:HKR 三项全中:小米把 MiMo-V2.5 系列权重直接放出来,Agent 和代码任务的数字够具体,4 小时无接管跑出完整桌面是个强钩子。作为国产旗舰模型开源,属于当天必须写的那类消息。

4月25日星期六

Hacker News 首页

Google 上线 Flow Music,用 Lyria 3 做歌、Veo 生成 MV

Google 悄悄上线了 Flow Music 网页版,目前有歌曲、歌单、空间、视频、项目和 Turntable 六个板块。核心功能是跟一个叫 Producer 的对话式工具聊天做歌,官方说它背后是 Lyria 3 模型,能生成带人声的完整歌曲;AI 音乐视频部分接的是 Veo 模型,可以自己控制角色和画面风格。页面还展示了一些示例曲目和可交互的迷你乐...

推荐理由:我会先打个折:正文没披露价格、地区、模型参数和版权机制,这些关键信息全缺,所以重要性停在 76 不动。但 Google 把 Lyria 3 和 Veo 打包成一个网页端音乐创作入口,6 类入口直接列出来,Producer 能出完整歌曲,这点对从业者来说信号很明确——大厂在认真推 AI 音乐工具,不是 demo。没写版权怎么处理,先别太激动,但上线本身已经够让做音乐 AI 的人盯着看了。

4月24日星期五

Hacker News 首页

为什么你应该拒绝让医生用 AI 帮你记病历

Emily M. Bender 和 Decca Muldowney 给了 9 个理由,劝患者在诊室里拒绝 AI 自动记录系统。这类工具会录下你和医生的对话,自动生成病历草稿。她们的核心担忧不是技术出错,而是诊所会把省下的时间拿来塞更多病人,而不是让你多聊一会儿。具体风险包括:录音和文字稿交给第三方公司,隐私保护未必靠谱;患者很难在几分钟内真正搞懂数据会...

推荐理由:这篇文章不是技术评测,是一篇立场鲜明的评论。两位作者直接劝患者对诊室里的 AI 录音工具说不,理由集中在录音数据怎么用、谁有权限看、语音识别对带口音的人不公平,以及医生可能过度信任 AI 草稿而漏掉关键信息。我会先打个折:全文没有给出实证数据,更像一份风险清单,所以重要性不会拉太高。但它的传播价值在于把“省时”背后的代价摊开讲——机构可能把省下来的时间变成更多接诊量,而不是让医生更仔细看你。这点对从业者来说是个提醒,别只盯着效率数字。

4月23日星期四

The Verge · AI

Google Meet 的 AI 笔记功能现在也能用在面对面会议上了

Google 把 Gemini 的会议纪要功能从线上视频扩展到了线下面对面开会。你只要在房间里用手机或平板打开 Meet,它就能直接录下现场对话并生成文字稿和摘要。之前这个功能只在安卓测试版里小范围试过,现在正式开放了。另外,就算你用的是 Zoom 或微软 Teams 开会,它也能帮你记笔记,不再只绑在 Meet 自己的通话里。正文没提这个功能对多人说...

推荐理由:一条中等体量的产品更新。H 打在线下加跨平台这个组合拳上,K 落在对 Zoom 和 Teams 的具体支持以及摘要转录能力,R 则指向各家争夺会议记录工作流的暗线。正文没披露定价、铺开节奏和实际转录质量,所以我会先打个折,不把它当成颠覆性发布。

4月20日星期一

Hacker News 首页

Deezer 每天上传的新歌里,44% 是 AI 生成的

Deezer 自己公布的数据:现在每天有将近 7.5 万首 AI 生成的歌上传到平台,占每日新增上传量的 44%,一个月下来超过 200 万首。不过这些歌基本没人听——AI 歌曲的播放量只占总播放量的 1% 到 3%,而且其中 85% 的播放被平台判定为刷量欺诈,直接不给钱。这个比例涨得很快:去年 9 月每天还只有 3 万首,11 月到 5 万首,今年...

推荐理由:标题里的44%占比是个抓人的钩子,能让人立刻意识到AI音乐已经不是边角料了。但我会先打个折:正文只有RSS片段,检测手段、统计口径全都没说,这个数字的硬度存疑。真正值得盯的是平台后续怎么识别和处置这些AI作品,现在信息还不够做更细的判断。HKR三项都踩中了,所以保留76分和featured级别。

4月17日星期五

X · @dotey(宝玉)

browser-use 开源 video-use:对着摄像头录完素材,跟 Claude Code 聊两句就能拿到剪好的视频

browser-use 团队把 video-use 开源了,这是一个 Claude Code 技能,你把录好的素材丢进文件夹,告诉 Claude 要剪成什么样,它就能自动裁掉“嗯”“呃”和空白段、调色、加字幕,还能用 Manim 或 Remotion 生成动画叠加层,最后输出 final.mp4。它不直接“看”视频,而是把 ElevenLabs 转写出...

推荐理由:这条更新对开发者来说够新鲜,hook 清晰、有可复用的架构细节和成本对比。我会先打个折:它只是 Claude Code 的一个技能,不是平台级发布,所以重要性停在 77 合理。正文没披露 ElevenLabs 转写成本和多轮自检的实际成功率,这点先别太激动。

4月16日星期四

Google DeepMind

Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中开放预览。

推荐理由:原文给出新语音模型的音频标签控制方式、Elo 分数与多平台开放入口,可据此判断语音生成的可控性变化。

4月14日星期二

最佳拍档

H100 租赁价五个月涨近 40%,全球 GPU 算力全面断供

SemiAnalysis 的报告显示,从 2025 年 10 月到 2026 年 3 月,英伟达 H100 的一年期租赁价格从每小时每 GPU 1.70 美元涨到了 2.35 美元,涨幅接近 40%。现在想租一个 64 块 GPU 的小集群都很难,现货市场基本无货可租。需求端主要被几件事同时推着走:Anthropic 的 Claude 产品收入一个季度...

推荐理由:我会先打个折:这是对 SemiAnalysis 报告的二次视频解读,不是一手厂商公告,所以没给 P1。但内容本身够硬——H100 租金五个月涨 40%,背后是 Anthropic 需求拉升、多智能体工作流和音视频生成把 token 消耗推高,加上内存价格翻倍涨,供给端根本接不住。正文没披露具体调研方法,但 100 多家供应商的样本量和现货 14 美元的极端报价,让判断有底。对正在做模型或搭 agent 的团队来说,这比换代传闻更肉疼,所以 HKR 全中。

4月8日星期三

量子位 · 公众号

小米放出两个语音生成框架,想让普通人也能当“声音导演”

小米大模型应用团队公开了 Any2Speech 和 Midasheng-audio-generate 两个框架。Any2Speech 一次推理能生成最长约 10 分钟的语音,Midasheng 则能根据一段文字描述直接合成包含人声、音乐和环境音的混合音频。技术方案里提到了 GST 标注、双路径规划加维度丢弃、Flow Matching 以及五字段结构化...

推荐理由:小米放出两套语音框架,核心看点是可控长音频和场景统一建模,一句提示词出混合音频、单次推理能跑10分钟,这两个点确实抓人。技术细节也给了,不是纯画饼。但我会先打个折:基准跑分没给,训练数据多大不知道,开不开源、能不能商用也没说,这些信息缺口让实际价值不好判断。整体有亮点但缺关键验证,放在 featured 低段比较合适。

量子位 · 公众号

面壁智能、OpenBMB 和清华放出一个 2B 开源语音模型 VoxCPM 2,能说 9 种方言、30 种外语,还复刻了郭德纲的《莽撞人》贯口

VoxCPM 2 是个 20 亿参数的开源语音模型,主打低延迟和少样本复刻。官方说生成经常在 1 秒内完成,给一段 5 秒以上的参考音频就能模仿音色和风格,演示里用它念了语速极快的相声贯口《莽撞人》。技术上它没用传统的声学码本,而是走扩散自回归连续表征路线,支持去噪、LoRA 微调和全量微调。正文没披露具体的训练数据规模和硬件需求,也没给标准化的语音质...

推荐理由:面壁智能和清华 OpenBMB 放出的 VoxCPM 2 是一个 2B 开源语音模型,不是薄 demo。正文列了可复现条件:48kHz、9 种方言、30 种外语、≥5 秒参考音频、1 秒内生成,还支持降噪和 LoRA/全参微调。技术路线上走了 tokenizer-free 的扩散自回归连续表征,这点比模型尺寸更值得看。我会先打个折:正文没披露方言和外语的具体测试集与客观指标,也没给端侧实测延迟和内存占用,所以实际部署成本还要自己测。但整体信息量够,对盯中文开源语音栈的人有参考价值。