跳到正文

#语音

今日 0 条

5月8日星期五

AI HOT 精选

苹果带摄像头的 AirPods 进入 DVT 阶段,最快 9 月跟新 Siri 一起到

彭博社的 Mark Gurman 说,苹果那款传闻很久、自带摄像头的 AirPods 已经进入设计验证测试(DVT)阶段,外形和功能基本定型了。左右耳机各塞了一颗低分辨率摄像头,不是用来拍照,而是给 Siri 当“眼睛”,让你对着眼前的东西直接提问,比如看到一堆食材问能做什么晚饭。耳机柄为了塞摄像头比 AirPods Pro 3 稍微长一点。原计划上半...

推荐理由:HKR 三项都踩中了,但这是未确认的硬件传闻,不是苹果官方发布。DVT 状态、摄像头设计和 Gemini 合作细节让它够格进 featured,不过我会先打个折,放在低分段。正文没披露摄像头具体参数和 Gemini 合作形式,这点先别太激动。

AI HOT 精选

OpenAI 发了官方命令行工具 openai-cli,终端里直接调 API,不用写 SDK 代码

OpenAI 在 GitHub 开源了 openai-cli,Apache 2.0 协议,Homebrew 或 Go 都能装。这个工具让你在终端里直接敲命令调用 API,省掉写 SDK 的步骤。它主要干几件事:一是支持 Responses API,能把网页搜索、代码解释器这些云端工具串起来,让模型进业务流程干活;二是输出 JSON、YAML 这类结构化...

推荐理由:HKR 三项都站得住:官方 CLI 本身就有话题性,安装和功能细节够具体,又切中开发者想少写胶水代码、让模型直接进流程干活的需求。不过它终究是个工具更新,不是新模型或重大能力发布,76 分放在 featured 里合理。

The Verge · AI

苹果带摄像头的 AirPods 快量产了,主要给 Siri 当眼睛用

Mark Gurman 爆料,带摄像头的 AirPods 已经进入 DVT(设计验证测试)阶段,离 PVT(生产验证测试)只差一步。苹果内部测试人员正在用原型机,摄像头不拍照片或视频,只捕捉低分辨率画面,用来帮 Siri 回答“这菜怎么做”之类需要看东西的问题。正文没披露具体像素、延迟和功耗数据,也没说什么时候上市。

推荐理由:H/K/R 全过:Gurman 和 The Verge 给出了一个 DVT 阶段的苹果 AI 硬件更新,不是发布,所以分数压在 72–77 区间。带摄像头的 AirPods 这个形态够怪,容易让人记住;DVT 到 PVT 的进度和“只采低分辨率视觉信息、不拍照不录像”是实打实的新事实;它同时碰到多模态、隐私和 AI 硬件入口三条线,对做端侧和多模态的人有参考意义。

5月7日星期四

OpenAI News

OpenAI 在 API 里上线了三款实时语音模型,能边听边推理、翻译和转写

OpenAI 这次发了三个新模型:GPT‑Realtime‑2 是带 GPT‑5 级推理能力的语音模型,能处理更复杂的请求,说话中间可以插话、改主意,它还能边想边回一句“我查一下”,同时调用多个工具;GPT‑Realtime‑Translate 做实时翻译,支持 70 多种输入语言转 13 种输出语言,语速跟得上说话人;GPT‑Realtime‑Whi...

推荐理由:OpenAI 官方放出了语音 API 更新,方向明确但信息不全。能推理、翻译、转写,听着挺全,可没给价格、没给延迟、没给上下文限制,我会先打个折。如果是真的省钱又低延迟,那对语音应用开发者是直接利好;现在只能说方向对了,落地还得等更多参数。

5月5日星期二

r/LocalLLaMA

微软 VibeVoice 语音合成与长音频转写被移植到纯 C++,推理不再需要 Python

LocalAI 把微软的 VibeVoice 模型用 ggml 重写成 C++ 版本,叫 vibevoice.cpp,支持 CPU、CUDA、Metal 和 Vulkan 推理,不用装 Python 环境。语音合成这边,给一段 30 秒的参考录音就能克隆声音,输出 24kHz 的语音。语音识别部分用的是一个 7B 模型,能处理长音频并区分不同说话人,结...

推荐理由:这条更新对做本地音频部署的人有用,给出了具体的运行数字和限制。我会先打个折:它来自社区移植,不是微软官方动作,而且缺少流式支持这点在实时场景里是硬伤。整体在 72–77 分 featured 档位合理,不值得当天必写,但值得放进雷达。

5月4日星期一

r/LocalLLaMA

Gemma 4 E2B 在 8GB 安卓手机上跑得动,还搭了个本地语音笔记 App

一位 Reddit 用户把 Gemma 4 E2B(2.4GB 模型)塞进 8GB 内存的 OnePlus CE 5 手机里,做了个完全离线的语音笔记应用。流程是:Whisper Small(244MB)先把语音转成文字,Gemma 4 E2B 再负责把文字拆成笔记并打标签。录一段 10 到 15 秒的语音,从转录到出结果总共花 12 到 15 秒。搜...

推荐理由:这是 Reddit 个人项目帖,不是官方发布,但信息量够。作者把 Whisper Small 转写和 Gemma 4 E2B 分类都塞进手机,还搭了检索管道(查询扩展、多路全文搜索、RRF 融合,可选 Gemma 重排,超时 15 秒回退),工程细节比很多官方 demo 实在。我会先打个折:没提功耗、发热和长时间稳定性,12-15 秒延迟对语音笔记算可用但不算快。如果是真的,2.4GB 模型在 8GB 手机上跑通整套流程挺省钱,对想做离线 AI 应用的人有参考价值。

5月2日星期六

Hacker News 首页

Spotify 给真人音乐人加“已验证”绿标,用来和 AI 账号区分开

Spotify 开始给符合“真实性标准”的艺人打上绿色对勾和“Verified by Spotify”标识,帮用户分辨账号背后是真人还是 AI。验证条件包括关联社交账号、稳定的听众数据、有周边或演出信息等,官方说听众常搜的艺人里超过 99% 都会拿到这个标,覆盖几十万人。但正文没披露具体审核流程、申诉机制,也没说怎么处理那些不用巡演和周边的小众独立音乐...

推荐理由:Spotify 开始给人类艺人贴 Verified 徽章,标题说就是为了跟 AI 音乐划清界限。我会先打个折——正文只有 RSS 片段,怎么验证、覆盖多少人、什么时候上线、审核标准是什么,全都没说。这点先别太激动,信息缺口太大。但话题本身够敏感,涉及版权、艺人身份和 AI 标注,容易引发行业争论,所以给了 featured 和 72 分。

5月1日星期五

量子位 · 公众号

他用 AI 办了场音乐节,主题是“别读博”

B站UP主“混沌皮切总”用 AI 生成了 42 首“劝退读博”的歌,全网播放量超过 5000 万。一首歌要跑上百次生成,同时用 Suno、MiniMax 音乐、心模拉和 ACE-Step 几个工具来回试。正文没披露具体技术细节,但能看出现在 AI 做歌最花时间的不是生成,而是人得一首首听、一首首挑,这个筛选成本很高。

推荐理由:HKR 三项都站得住:梗本身够怪、传播数据和工作流细节都给了、最后落点卡在“AI 放大产出但人工筛选成本没降”这个创作者的真实焦虑上。这不是模型或平台发布,是实打实的案例拆解,分数放在 78-84 区间合理。

彭博科技

音频行业开始头疼了:39% 的新播客可能是 AI 生成的“播客垃圾”

Podcast Index 抓了九天的新播客数据,发现 39% 很可能是 AI 生成的,行业管这叫“podslop”(播客垃圾)。文章没披露他们用什么方法检测、样本总量多大、以及这些节目分布在哪些平台。这个比例看着挺高,但先别太激动——如果检测手段比较糙,可能会把一些只是用了 AI 辅助的节目也算进去。对听众来说,最直接的影响是以后找真人聊出来的好节目...

推荐理由:标题和摘要都指向一个清晰的信号:音频圈开始正视 AI 批量生产低质内容的问题。39% 这个比例挺扎眼,但正文没交代他们怎么判断“疑似 AI 生成”、样本量多大、主要出现在哪些平台,所以这个数字我先打个折看。Bloomberg 的报道加上 Podcast Index 的数据来源,够得上 featured,但算不上行业级大事件,更像一个值得关注的早期警报。

4月30日星期四

Google DeepMind

Google DeepMind 发布 AI co-clinician 医疗研究计划

Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据综合工具;在 140 项问诊技能评估中,它在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。

推荐理由:Google DeepMind 公开 AI co-clinician 研究计划与多模态问诊评测,可了解医疗智能体当前能力边界。

r/LocalLLaMA

用 Kokoro 82M 和 Qwen 在本地把 PDF 转成有声书

Reddit 用户 purellmagents 搭了一套完全跑在本地的 PDF 转有声书流程,用 Kokoro 82M 做语音合成,Qwen 3.5 0.8B 或 2B 处理文本,llama.cpp 做推理,整个应用用 Tauri 2.0 打包,在 M1 Mac 上运行。工作方式是先读前 15 句,边读边准备下 15 句,减少等待。作者说真正的难点不在...

推荐理由:HKR 三项都踩中了,但本质是 Reddit 上的个人工作流展示,不是模型或平台发布。具体组件和 15 句预处理窗口让它能进低分 featured 档。我会先打个折:正文没披露代码和表格朗读的具体处理逻辑,这点先别太激动。

4月29日星期三

新智元 · 公众号

谷歌翻译 20 岁,劈柴哥说它换了四代 AI,现在能直接听懂语气了

劈柴哥发帖庆祝谷歌翻译上线 20 年,月活用户到了 10 亿。他梳理了背后的四代技术:最早是统计机器翻译,2016 年换成神经网络翻译,后来用上 PaLM 2 大模型,2024 年一口气加了 110 种语言。最新的是 Gemini 2.5 Flash 的原生音频翻译,不再先把语音转文字再翻译,而是直接处理声音,能保留原话的语调、停顿和节奏。劈柴哥形容这...

推荐理由:核心事件是谷歌翻译过生日和架构回顾,不是新品发布,但 10 亿月活、110 种语言扩增和原生语音翻译的细节撑得起 featured 档位。我会先打个折,因为正文没给出原生语音功能的具体上线时间或实测数据,这点先别太激动。不过它点到了语音 AI 产品眼下最纠结的问题:级联管线 vs. 原生多模态,所以值得从业者看一眼。

X · @dotey(宝玉)

微软开源语音模型 VibeVoice-ASR 实测:一小时播客 8 分 45 秒转完,但 32GB 内存的 Mac 跑不动

Simon Willison 在 128GB 内存的 M5 Max MacBook Pro 上跑了社区做的 4-bit 量化版 VibeVoice-ASR,模型大小 5.71GB。转写一小时播客用了 8 分 45 秒,prefill 阶段内存峰值冲到 61.5GB,生成阶段稳定在 18GB 左右,所以普通 32GB 笔电基本没戏。这个 9B 参数模型最...

推荐理由:这篇不是新模型发布,而是 Simon Willison 拿微软 1 月开源的 VibeVoice-ASR 在自己机器上跑了一遍,给出了速度和内存的实测数字。我会先打个折:这只是单次测试,不代表所有场景,但 61.5GB 的内存峰值确实把 32GB 笔电劝退了,这点对想本地部署的人很关键。正文没提准确率对比,所以别当全面评测看,就当一份硬件门槛参考。

4月28日星期二

量子位 · 公众号

面壁智能发 MiniCPM-o 4.5 技术报告,12GB 消费显卡就能跑全双工音视频

面壁智能、OpenBMB、清华 NLP 和数学基础中心放出了 MiniCPM-o 4.5 的技术报告。模型参数约 90 亿,能同时处理视频、音频和文字流。核心设计叫 Omni-Flow,把不同信号放在一条统一时间线上分时复用,省掉了外挂的语音活动检测模块。报告里说,一张 12GB 显存的 RTX 5070 就能跑全双工模式,实时率做到 0.4,意味着生...

推荐理由:HKR 三项都成立:9B 全双工模型在 12GB 消费卡上跑到 RTF 0.4,靠 Omni-Flow 的时间轴对齐机制实现。不是前沿实验室的旗舰发布,但实用性强,78–84 分合理。

量子位 · 公众号

小米开源 MiMo-V2.5 系列模型,Pro 版 4 小时无人工干预搭出一个 macOS 桌面

小米把 MiMo-V2.5 系列的权重放出来了,包含 Pro Agent、多模态基座、TTS 和 ASR 几个模型。MiMo-V2.5-Pro 在 4.3 小时内连续调用了 672 次工具,在 SysY 基准上拿了满分 233 分,全程没让人接手,直接跑通了一个带 54 个应用的类 macOS 桌面。对从业者来说,值得关注的是它支持 100 万 tok...

推荐理由:HKR 三项全中:小米把 MiMo-V2.5 系列权重直接放出来,Agent 和代码任务的数字够具体,4 小时无接管跑出完整桌面是个强钩子。作为国产旗舰模型开源,属于当天必须写的那类消息。

4月25日星期六

Hacker News 首页

Google 上线 Flow Music,用 Lyria 3 做歌、Veo 生成 MV

Google 悄悄上线了 Flow Music 网页版,目前有歌曲、歌单、空间、视频、项目和 Turntable 六个板块。核心功能是跟一个叫 Producer 的对话式工具聊天做歌,官方说它背后是 Lyria 3 模型,能生成带人声的完整歌曲;AI 音乐视频部分接的是 Veo 模型,可以自己控制角色和画面风格。页面还展示了一些示例曲目和可交互的迷你乐...

推荐理由:我会先打个折:正文没披露价格、地区、模型参数和版权机制,这些关键信息全缺,所以重要性停在 76 不动。但 Google 把 Lyria 3 和 Veo 打包成一个网页端音乐创作入口,6 类入口直接列出来,Producer 能出完整歌曲,这点对从业者来说信号很明确——大厂在认真推 AI 音乐工具,不是 demo。没写版权怎么处理,先别太激动,但上线本身已经够让做音乐 AI 的人盯着看了。

4月24日星期五

Hacker News 首页

为什么你应该拒绝让医生用 AI 帮你记病历

Emily M. Bender 和 Decca Muldowney 给了 9 个理由,劝患者在诊室里拒绝 AI 自动记录系统。这类工具会录下你和医生的对话,自动生成病历草稿。她们的核心担忧不是技术出错,而是诊所会把省下的时间拿来塞更多病人,而不是让你多聊一会儿。具体风险包括:录音和文字稿交给第三方公司,隐私保护未必靠谱;患者很难在几分钟内真正搞懂数据会...

推荐理由:这篇文章不是技术评测,是一篇立场鲜明的评论。两位作者直接劝患者对诊室里的 AI 录音工具说不,理由集中在录音数据怎么用、谁有权限看、语音识别对带口音的人不公平,以及医生可能过度信任 AI 草稿而漏掉关键信息。我会先打个折:全文没有给出实证数据,更像一份风险清单,所以重要性不会拉太高。但它的传播价值在于把“省时”背后的代价摊开讲——机构可能把省下来的时间变成更多接诊量,而不是让医生更仔细看你。这点对从业者来说是个提醒,别只盯着效率数字。

4月23日星期四

The Verge · AI

Google Meet 的 AI 笔记功能现在也能用在面对面会议上了

Google 把 Gemini 的会议纪要功能从线上视频扩展到了线下面对面开会。你只要在房间里用手机或平板打开 Meet,它就能直接录下现场对话并生成文字稿和摘要。之前这个功能只在安卓测试版里小范围试过,现在正式开放了。另外,就算你用的是 Zoom 或微软 Teams 开会,它也能帮你记笔记,不再只绑在 Meet 自己的通话里。正文没提这个功能对多人说...

推荐理由:一条中等体量的产品更新。H 打在线下加跨平台这个组合拳上,K 落在对 Zoom 和 Teams 的具体支持以及摘要转录能力,R 则指向各家争夺会议记录工作流的暗线。正文没披露定价、铺开节奏和实际转录质量,所以我会先打个折,不把它当成颠覆性发布。

4月20日星期一

Hacker News 首页

Deezer 每天上传的新歌里,44% 是 AI 生成的

Deezer 自己公布的数据:现在每天有将近 7.5 万首 AI 生成的歌上传到平台,占每日新增上传量的 44%,一个月下来超过 200 万首。不过这些歌基本没人听——AI 歌曲的播放量只占总播放量的 1% 到 3%,而且其中 85% 的播放被平台判定为刷量欺诈,直接不给钱。这个比例涨得很快:去年 9 月每天还只有 3 万首,11 月到 5 万首,今年...

推荐理由:标题里的44%占比是个抓人的钩子,能让人立刻意识到AI音乐已经不是边角料了。但我会先打个折:正文只有RSS片段,检测手段、统计口径全都没说,这个数字的硬度存疑。真正值得盯的是平台后续怎么识别和处置这些AI作品,现在信息还不够做更细的判断。HKR三项都踩中了,所以保留76分和featured级别。

4月17日星期五

X · @dotey(宝玉)

browser-use 开源 video-use:对着摄像头录完素材,跟 Claude Code 聊两句就能拿到剪好的视频

browser-use 团队把 video-use 开源了,这是一个 Claude Code 技能,你把录好的素材丢进文件夹,告诉 Claude 要剪成什么样,它就能自动裁掉“嗯”“呃”和空白段、调色、加字幕,还能用 Manim 或 Remotion 生成动画叠加层,最后输出 final.mp4。它不直接“看”视频,而是把 ElevenLabs 转写出...

推荐理由:这条更新对开发者来说够新鲜,hook 清晰、有可复用的架构细节和成本对比。我会先打个折:它只是 Claude Code 的一个技能,不是平台级发布,所以重要性停在 77 合理。正文没披露 ElevenLabs 转写成本和多轮自检的实际成功率,这点先别太激动。

4月16日星期四

Google DeepMind

Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中开放预览。

推荐理由:原文给出新语音模型的音频标签控制方式、Elo 分数与多平台开放入口,可据此判断语音生成的可控性变化。

4月14日星期二

最佳拍档

H100 租赁价五个月涨近 40%,全球 GPU 算力全面断供

SemiAnalysis 的报告显示,从 2025 年 10 月到 2026 年 3 月,英伟达 H100 的一年期租赁价格从每小时每 GPU 1.70 美元涨到了 2.35 美元,涨幅接近 40%。现在想租一个 64 块 GPU 的小集群都很难,现货市场基本无货可租。需求端主要被几件事同时推着走:Anthropic 的 Claude 产品收入一个季度...

推荐理由:我会先打个折:这是对 SemiAnalysis 报告的二次视频解读,不是一手厂商公告,所以没给 P1。但内容本身够硬——H100 租金五个月涨 40%,背后是 Anthropic 需求拉升、多智能体工作流和音视频生成把 token 消耗推高,加上内存价格翻倍涨,供给端根本接不住。正文没披露具体调研方法,但 100 多家供应商的样本量和现货 14 美元的极端报价,让判断有底。对正在做模型或搭 agent 的团队来说,这比换代传闻更肉疼,所以 HKR 全中。

4月8日星期三

量子位 · 公众号

小米放出两个语音生成框架,想让普通人也能当“声音导演”

小米大模型应用团队公开了 Any2Speech 和 Midasheng-audio-generate 两个框架。Any2Speech 一次推理能生成最长约 10 分钟的语音,Midasheng 则能根据一段文字描述直接合成包含人声、音乐和环境音的混合音频。技术方案里提到了 GST 标注、双路径规划加维度丢弃、Flow Matching 以及五字段结构化...

推荐理由:小米放出两套语音框架,核心看点是可控长音频和场景统一建模,一句提示词出混合音频、单次推理能跑10分钟,这两个点确实抓人。技术细节也给了,不是纯画饼。但我会先打个折:基准跑分没给,训练数据多大不知道,开不开源、能不能商用也没说,这些信息缺口让实际价值不好判断。整体有亮点但缺关键验证,放在 featured 低段比较合适。

量子位 · 公众号

面壁智能、OpenBMB 和清华放出一个 2B 开源语音模型 VoxCPM 2,能说 9 种方言、30 种外语,还复刻了郭德纲的《莽撞人》贯口

VoxCPM 2 是个 20 亿参数的开源语音模型,主打低延迟和少样本复刻。官方说生成经常在 1 秒内完成,给一段 5 秒以上的参考音频就能模仿音色和风格,演示里用它念了语速极快的相声贯口《莽撞人》。技术上它没用传统的声学码本,而是走扩散自回归连续表征路线,支持去噪、LoRA 微调和全量微调。正文没披露具体的训练数据规模和硬件需求,也没给标准化的语音质...

推荐理由:面壁智能和清华 OpenBMB 放出的 VoxCPM 2 是一个 2B 开源语音模型,不是薄 demo。正文列了可复现条件:48kHz、9 种方言、30 种外语、≥5 秒参考音频、1 秒内生成,还支持降噪和 LoRA/全参微调。技术路线上走了 tokenizer-free 的扩散自回归连续表征,这点比模型尺寸更值得看。我会先打个折:正文没披露方言和外语的具体测试集与客观指标,也没给端侧实测延迟和内存占用,所以实际部署成本还要自己测。但整体信息量够,对盯中文开源语音栈的人有参考价值。

4月3日星期五

X · @OpenAI

ChatGPT 上车了,现在能在 CarPlay 里用语音模式

OpenAI 把 ChatGPT 的语音模式搬进了 CarPlay,iPhone 用户升级到 iOS 26.4 以上就能在车里用。正文没提支持哪些国家、哪些车型,也没说功能有没有阉割,比如能不能连续对话、能不能读长文章。这次动作的重点是把对话入口塞进驾驶界面,不是发了新模型。

推荐理由:这次更新更像是一次分发渠道的扩展,而不是模型本身有什么变化。ChatGPT 出现在 CarPlay 里,意味着它开始抢占车载语音交互的位置,这点比功能细节更值得关注。不过正文没披露地区、车型和功能限制,实际落地范围还得再观察,先别太激动。

3月24日星期二

Mistral AI

Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。

推荐理由:原文给出 4B 参数、9 种语言、70ms 延迟与定价,读者可据此判断企业语音智能体的成本与选型空间。

2月14日星期六

MIT Technology Review · AI

渐冻症夺走了这位音乐人的声音,AI 让他重新站上舞台唱歌

32 岁的 Patrick Darling 在确诊渐冻症两年后,用 AI 克隆了自己的歌声,2 月 11 日在伦敦重新和乐队一起演出。他的声音克隆不是用录音棚素材做的,而是从嘈杂的手机视频和厨房录音里拼出来的,ElevenLabs 的音乐工具花了大约六周调校。这件事的信号不在感人,在于门槛:ElevenLabs 把工具免费开放给因渐冻症等疾病失声的人,...

推荐理由:我会先打个折:这不是模型或产品大更新,而是一个应用案例。但案例本身够硬——ALS 患者用旧录音唱歌,不是概念演示,是真实上台。正文给了两个关键条件:10 分钟清晰语音和 6 周从噪音片段里抠出歌声,说明门槛和代价。ElevenLabs 把这个流程做成免费项目,但正文没披露底层模型细节,这点先别太激动。整体看,故事性强、有可复现信息、踩中声音权利话题,适合放低 featured。

2月9日星期一

36 氪 · 直链

小红书把搜索框改成了语音问答,想让你用说话代替打字来搜生活经验

小红书在1月27日全量上线了“语音问一问”,用户在搜索页长按就能用语音提问,最长能说三分钟,也支持外语和方言。它给出的答案不是通用百科,而是把站内用户分享的真人经验总结成结构化回复,比如剪头发怎么跟理发师沟通这种非标问题。正文没披露背后的语音识别和模型技术方案,也没提延迟和准确率数据。这次改动的核心是把搜索从三四个字的关键词匹配,拉长到口语化的长句提问...

推荐理由:小红书把搜索框改成能长按语音提问,这事我会先打个折——正文没披露用的什么语音识别方案、模型延迟和准确率,所以实际体验稳不稳还不好说。但值得盯的是,它把原本短关键词搜索变成了长语音问题入口,等于在抢更细颗粒度的查询需求。对AI从业者来说,这是内容平台用语音+外挂资料库做搜索的落地样本,虽然技术细节缺位,但产品方向和上线节奏本身就有信号意义。

36 氪 · 直链

前百川智能联创焦可离职做来福电台,想造能记住你喜好的 AI 主播

焦可离开百川智能后,在 2025 年初创办了 AI 音频公司“来福电台”。他做的不是单纯的 AI 播客工具,而是 15 个中文和 2 个英文 AI 主播,每个主播风格不同,能根据用户收听历史推荐内容,用户也可以随时打断节目提问或聊天。焦可认为语音交互能产生足够多的长上下文,让 AI 记住用户偏好,这是建立情感链接和个性化服务的关键。来福在 2025 年...

推荐理由:这篇值得上featured,因为它把一个容易被当成“AI播客工具”的产品讲清楚了真正想赌的方向:不是生成音频,而是造有记忆、可交互的AI主播。硬信息够实,融资额、主播数量、使用时长、内容生成速度都有,而且把DTU和长记忆当成基础设施壁垒在说,不是空谈概念。车载合作这条线虽然没展开细节,但已经给出一个可验证的落地场景。公司阶段偏早期,所以放在featured而不是p1,但判断本身有信息量,我会先打个折观望后续数据。

2月5日星期四

Mistral AI

Mistral 发布 Voxtral Transcribe 2 语音转写模型家族

Mistral 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。

推荐理由:原文给出两款语音转写模型的延迟、价格与开源许可,可据此判断实时语音应用的选型空间。

2025年9月30日星期二

OpenAI News

OpenAI 发布 Sora 2 系统卡,视频生成模型能同时出画面和声音了

OpenAI 在 9 月 30 日公布了 Sora 2 的系统卡,说这个新模型在物理规律、画面真实度、音画同步和风格控制上都比上一代强,能更准地跟着用户的指令走。这次发布先走邀请制,在 sora.com 和独立的 iOS App 上小范围开放。安全方面,上线初期禁止上传视频,也禁止上传带真人照片的图片,对涉及未成年人的内容有更严的审核门槛。正文没提 A...

推荐理由:这条落在 78–84 分档。H 来自 Sora 2 加独立 App 的钩子;K 来自明确的上线限制和安全规则;R 来自竞争和肖像滥用风险。没给更高分是因为价格、评测分数、上下文长度和 API 时间点正文全都没披露,我会先打个折。

OpenAI News

OpenAI 发布 Sora 2,能生成带同步对白和音效的视频,还做了一个社交 App

OpenAI 在 9 月 30 日发布了视频生成模型 Sora 2,同时上线了一个叫 Sora 的 iOS 社交 App。Sora 2 比上一代更遵守物理规律,比如投篮不进会弹框而不是球直接瞬移进筐,也能生成同步的人物对白和环境音效。App 里有个“角色”功能,你录一段视频和音频验证身份后,就能把自己的形象和声音放进任何生成的场景里。OpenAI 说这...

推荐理由:我会先打个折,因为价格和时长这些关键限制都没披露,没法判断实际可用性。但这条消息值得立刻写:OpenAI 在同一天发了 Sora 2 模型和独立的 Sora App,产品形态直接从技术演示跳到了带推荐流的社交应用。模型能同步出视频、对白和音效,还有个“characters”功能,用一次性录像验明正身再把真人形象注入视频——这点先别太激动,正文没讲清楚隐私和滥用防护细节。真正该盯的是分发方式变了,OpenAI 开始用消费级产品逻辑铺视频生成,而不是只给开发者或研究者玩。

2025年8月28日星期四

OpenAI News

OpenAI 发布 gpt-realtime 模型,语音 API 正式上线并支持电话和图片输入

OpenAI 把 Realtime API 从公测转成了正式版,同时推出了新的端到端语音模型 gpt-realtime。这个模型不再走“语音转文字再转语音”的老路,而是直接处理音频,延迟更低,语气和情绪保留得更好。新模型在听懂复杂指令和调用工具上进步明显:Big Bench Audio 推理得分从去年 12 月版的 65.6% 提到了 82.8%,Mu...

推荐理由:这不是小修小补,是 OpenAI 把语音模型、工具链和电话接口一次补齐的版本。gpt-realtime 的基准分涨了十几到二十个百分点,虽然 MultiChallenge 的 30.5% 说明复杂场景还吃力,但配合 MCP 远程服务器和 SIP 通话,语音代理终于能跑通完整业务闭环了。我会先打个折——正文没给延迟和并发数据,实际部署成本还得自己测,但方向是对的,所以给到 p1。

2025年7月17日星期四

Mistral AI

Mistral 为 Le Chat 推出 Deep Research、语音模式等新功能

Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言思考模式、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

推荐理由:Mistral 官方一次性公布 Le Chat 五项新功能,读者可据此了解其研究、语音与图像编辑能力的组合方式。

2025年7月15日星期二

Mistral AI

Mistral 发布 Voxtral 语音理解模型,24B 与 3B 双版本开源

Mistral 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备内置问答与摘要、多语言识别和语音函数调用能力,并保留 Mistral Small 3.1 的文本能力。

推荐理由:Mistral 开源两款语音理解模型,给出 32k 上下文、函数调用等能力与低于同类 API 一半的定价,便于评估语音方案选型。

2025年3月21日星期五

OpenAI News

OpenAI 和 MIT 合作研究:跟 ChatGPT 聊感情的人很少,但重度语音用户里有一小撮人把它当朋友

OpenAI 和 MIT 媒体实验室联手做了两项研究,想搞清楚人跟 ChatGPT 聊感情会不会影响心理健康。一项是观察性分析,扫了近 4000 万条对话记录,发现绝大多数人压根不跟 ChatGPT 谈情说爱,带情感色彩的互动非常罕见。另一项是持续四周的随机对照试验,找了近 1000 名参与者。结果显示,即便在重度用户里,高频率的情感交流也只集中在极少...

推荐理由:OpenAI 和 MIT 用两项研究摸 ChatGPT 的情感使用底牌,一项分析近 4000 万次交互,另一项让近 1000 人连续 4 周参与随机对照试验。正文确认情感性互动在平台上属少数场景,但真正危险的是分层看:平均值会淹没小样本高情感依赖用户,这点先别太激动,等完整量化结果出来再下判断。

2025年3月20日星期四

OpenAI News

OpenAI 发了三款新语音模型:两个听写,一个会学语气说话

OpenAI 在 3 月 20 日往 API 里塞了三个新音频模型:gpt-4o-transcribe 和 gpt-4o-mini-transcribe 负责把语音转成文字,gpt-4o-mini-tts 负责把文字念出来。听写模型在 FLEURS 等多语言基准上跑分比 Whisper v2、v3 都低,低的是词错率,说明在口音重、环境吵、语速快的时候...

推荐理由:OpenAI 在 API 里发了三个音频模型,给了具体的基准和机制细节,所以 HKR 三项都过了,featured 没问题。分数我维持 84,没往上加,因为正文没披露价格、延迟,基准对比也只给了 FLEURS 一个点,信息还不够全。

2024年10月1日星期二

OpenAI News

OpenAI 发布 Realtime API 公测版,让开发者直接调用 GPT-4o 做低延迟语音对话

OpenAI 在 2024 年 10 月 1 日推出了 Realtime API 的公测版,所有付费开发者都能用。这个接口通过一个持久的 WebSocket 连接,把音频直接流式传给 GPT-4o,再流式返回语音,省掉了以前那种“先转文字、再生成回复、最后转语音”的串联流程。好处是延迟更低,能保留语气和重音,还能自动处理用户插话。API 支持函数调用,...

推荐理由:OpenAI 把语音交互从多模型拼接改成一条 WebSocket 直连 GPT-4o,延迟和打断处理都内建了,还给了函数调用和明确定价。对做实时语音 agent 的开发者来说,这是可以直接动手试的东西,不是概念稿。我会先打个折:公测阶段稳定性、实际延迟和成本还没大规模验证,但信息量和可操作性已经足够当天写。

2024年8月8日星期四

OpenAI News

GPT-4o 系统卡:语音响应快过人类,但声音安全是最大隐患

OpenAI 在 8 月 8 号发了 GPT-4o 的系统卡,把安全底牌摊开来看。这个模型能直接吃文本、音频、图片和视频,输出也一样,最快 232 毫秒就能回话,平均 320 毫秒,跟人聊天反应速度差不多。API 价格比 GPT-4 Turbo 便宜一半。在 OpenAI 自己的安全框架里,网络安全、生物威胁、模型自主性三项风险都是低,说服力这项擦边踩...

推荐理由:这不是一篇例行公事的发布。它把 preparedness 四类风险评级、232 毫秒语音延迟和明确的部署门槛都摆出来了。HKR 三项全中,但本质是安全披露而非新模型或重大产品发布,所以放在 featured 而不是 p1。

2023年9月25日星期一

OpenAI News

ChatGPT 现在能看、能听、能说话了

OpenAI 给 ChatGPT 加了语音和图片功能。语音部分,你对着手机说话它能回你,背后用了一个新的文字转语音模型,拿几秒真人录音就能合成很像人的声音,还接入了自家的 Whisper 做语音识别。图片部分,你可以拍照或截图发给它,让它看图说话,底层是 GPT-3.5 和 GPT-4 的多模态版本。这两个功能会先推给 Plus 和 Enterpris...

推荐理由:这是一次实打实的 OpenAI 产品更新:标题确认了视觉输入、语音输入和语音输出,所以 HKR 三项都踩中了。正文没给版本、推送范围、延迟和定价,我会先打个折,停在 88 分而不是拉满。别被标题骗了,真正要盯的是语音延迟、视觉理解边界和调用入口。