# 小米开源 ControlFoley：给视频配音效，可以按你写的提示词或给的参考音频来

> 原标题：小米开源可控视频音效生成模型 ControlFoley，让声音"按你想要的来"

- 来源：AI HOT 精选
- 发布时间：2026-05-29T09:13:13.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30345
- 原文：https://www.ithome.com/0/957/282.htm

## 摘要

小米大模型应用团队放出了一个叫 ControlFoley 的视频音效生成模型，权重和代码都开源了。它主要解决一个问题：以前模型只能看画面自动猜配什么声音，创作者没法干预。ControlFoley 支持三种用法——用文字描述想要的音效、用文字强行覆盖画面里原有的声音、或者上传一段参考音频让它模仿音色和风格，同时还能保证声音和画面动作对得上。团队自己训了一...

## 推荐理由

ControlFoley 把视频拟音做成可控生成，还直接开源了全套，对创作者和开发者都挺友好。它不是那种刷榜的基础模型发布，但胜在任务明确、工具属性强，放在 featured 门槛附近是合理的。

## 锐评

ControlFoley 解决了一个实际痛点：以前的视频配音模型是“看画面自动配”，创作者没法插手。现在它支持三种控制方式——用文字描述想要的音效、用文字强行覆盖画面里原有的声音、或者上传一段参考音频模仿其音色风格，同时还能保证声音和画面动作对得上。

技术上，团队自己训了一个时空音视频编码器 CAV-MAE-ST，专门抓动作节奏和时间同步线索，避免视觉信息太强势把文本控制压死。参考音频那边做了时间-音色解耦，只取音色特征，扔掉节奏信息，防止参考音频的节奏打乱视频本身的同步。训练时用了随机模态 dropout，让一个模型能处理视频、视频+文字、视频+参考音频等多种输入组合。

在多个公开测试集上拿了开源 SOTA，跟闭源的 Kling-Foley 比，在语义对齐、时间同步和声音质量上也有优势。不过正文没披露训练数据规模和具体算力消耗，也没说在长视频或复杂场景下的表现边界。Demo 已经上线，建议自己传段视频试试，看它在你关心的场景里到底灵不灵。
