# 小米放出两个语音生成框架，想让普通人也能当“声音导演”

> 原标题：小米AI语音新框架：人人都能当声音导演

- 来源：量子位 · 公众号
- 发布时间：2026-04-08T04:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6267
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247881487&idx=3&sn=bdd0e730b071de3cf8029a075d9d1658

## 摘要

小米大模型应用团队公开了 Any2Speech 和 Midasheng-audio-generate 两个框架。Any2Speech 一次推理能生成最长约 10 分钟的语音，Midasheng 则能根据一段文字描述直接合成包含人声、音乐和环境音的混合音频。技术方案里提到了 GST 标注、双路径规划加维度丢弃、Flow Matching 以及五字段结构化...

## 推荐理由

小米放出两套语音框架，核心看点是可控长音频和场景统一建模，一句提示词出混合音频、单次推理能跑10分钟，这两个点确实抓人。技术细节也给了，不是纯画饼。但我会先打个折：基准跑分没给，训练数据多大不知道，开不开源、能不能商用也没说，这些信息缺口让实际价值不好判断。整体有亮点但缺关键验证，放在 featured 低段比较合适。

## 锐评

小米大模型应用团队公开了 Any2Speech 和 Midasheng-audio-generate 两个框架。Any2Speech 一次推理能生成最长约 10 分钟的语音，这个时长在同类方案里算长的，但没说明是在什么硬件上跑出来的、延迟多少。Midasheng 则能根据一段文字描述直接合成包含人声、音乐和环境音的混合音频，相当于你写一段场景，它给你配好音。技术方案里提到了 GST 标注、双路径规划加维度丢弃、Flow Matching 以及五字段结构化标签，这些名词背后大致是：用全局风格标记控制整体听感，两条处理路径加随机丢弃部分维度来防止过拟合，用流匹配做生成，以及把音频拆成五个字段来标注训练数据。

整篇发布偏技术展示，没有给出任何基准测试分数、训练数据量、模型参数量，也没有提是否开源或提供 API。如果是真的省钱又好用，对做播客、有声书、短视频配音的人会有吸引力，但在看到实际效果和成本数字之前，这条消息只能当技术路线参考。
