# NVIDIA 开源 Audio-Visual Flamingo：能看懂长视频里画面和声音的大模型

> 原标题：NVIDIA 发布 Audio-Visual Flamingo：面向长视频的开放音频-视觉大语言模型

- 来源：AI HOT 精选
- 发布时间：2026-07-17T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45307
- 原文：https://arxiv.org/abs/2607.16107

## 摘要

NVIDIA 把 Audio-Visual Flamingo 完全开源了。这个模型能同时理解视频里的画面、声音和文字，而且专门针对长视频——不是那种几秒的片段，是真实世界里几分钟甚至更长的复杂视频。它用了一个约 700 万条带时间戳的标注数据做训练，分三个阶段逐步教会模型：先看懂短片段，再学会跨多个事件做长线推理。为了让推理过程更靠谱，团队还搞了一套叫...

## 推荐理由

NVIDIA 开源了一个能同时处理长视频画面和声音的模型，训练数据量 700 万条带时间戳样本，训练方法分三步走——这点对做视频理解的人有参考价值。我会先打个折：正文没提在具体产品里的表现，也没给延迟或成本数字，所以先别太激动，把它当一个扎实的研究发布看就好。

## 锐评

这条消息最值得关注的点是“完全开源”和“长视频”。现在多数能处理音视频的模型都盯着十几秒的短视频，AV-Flamingo 直接瞄准了真实世界里几分钟甚至更长的复杂视频，比如一场完整的会议或一段监控录像。它用了约 700 万条带时间戳的标注数据，分三个阶段训练：先学会看短片段，再逐步学会把多个事件串起来做长线推理。为了让推理过程不瞎猜，团队还搞了一套叫 TAVI-CoT 的框架，强制模型把每一步思考都对应到视频里的具体时间点上，这比单纯给个答案要靠谱得多。

在 15 个以上的测试集上，它的成绩明显超过同尺寸的开源模型，甚至在部分长视频任务上能打平或超过更大的闭源模型。不过，论文目前只给了基准测试的分数，没披露它在真实业务场景里的延迟和资源消耗。长视频推理的计算量很大，实际部署时跑不跑得动、成本划不划算，这些关键信息正文还没提。另外，700 万条数据听起来不少，但具体覆盖了哪些场景、有没有偏科，也需要看后续放出的数据细节才能判断。
