# 美团 LongCat 放出视频数字人模型 1.5 版，换用 Whisper 做语音驱动，推理步数压到 8 步

> 原标题：meituan-longcat/LongCat-Video-Avatar-1.5 · Hugging Face

- 来源：r/LocalLLaMA
- 发布时间：2026-05-23T03:27:39.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25737
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tl4wpi/meituanlongcatlongcatvideoavatar15_hugging_face/

## 摘要

美团 LongCat 在 Hugging Face 上发了 LongCat-Video-Avatar-1.5，模型权重用 MIT 协议开源。它能做音频驱动视频、音频加图片驱动视频，还能接着一段视频往后生成。这版把语音编码器从 Wav2Vec2 换成了 Whisper-Large，理论上对语音的理解会更准。推理部分用 DMD2 蒸馏把步数降到了 8 NF...

## 推荐理由

我会先打个折：这不算行业地震级别的发布，但对做开源视频数字人的团队来说是个实在的更新。H、K、R 三条都站得住——美团 LongCat 把模型权重用 MIT 协议放出来，推理压到 8 NFE，意味着本地跑起来的门槛低了不少。技术上，它把语音编码器从 Wav2Vec2 换成 Whisper-Large，对中文语音的适配可能会更好，但正文没给出具体的对比测试数据，这点先别太激动。如果是真的省钱又好用，对想自己搭数字人、不想走云端 API 的开发者来说，是个值得上手试试的选项。

## 锐评

LongCat-Video-Avatar-1.5 这次更新主要做了两件事：一是把语音编码器从 Wav2Vec2 换成了 Whisper-Large，理论上对语音内容的理解会更准，不再只是听个音色；二是用 DMD2 蒸馏把推理步数压到了 8 NFE，生成速度应该快了不少。模型权重用 MIT 协议发在 Hugging Face 上，商用友好，这点对做数字人集成的团队比较实在。

但这条消息最大的问题是没给任何量化结果。换了编码器之后口型同步率有没有提升、8 步蒸馏相比原版画质损失多少、延迟降到什么程度，正文一概没提。Reddit 原帖还被屏蔽了，只能看到 Hugging Face 页面上的说明，信息源本身就打了折扣。

我会先打个折看待这个版本：开源和低步数是实打实的，但效果提升目前只能靠“理论上”三个字撑着。想用的团队最好自己跑一遍测试集，别只看蒸馏步数就冲。
