NVIDIA 开源 Audio-Visual Flamingo:能看懂长视频里画面和声音的大模型
NVIDIA 发布 Audio-Visual Flamingo:面向长视频的开放音频-视觉大语言模型
NVIDIA 把 Audio-Visual Flamingo 完全开源了。这个模型能同时理解视频里的画面、声音和文字,而且专门针对长视频——不是那种几秒的片段,是真实世界里几分钟甚至更长的复杂视频。它用了一个约 700 万条带时间戳的标注数据做训练,分三个阶段逐步教会模型:先看懂短片段,再学会跨多个事件做长线推理。为了让推理过程更靠谱,团队还搞了一套叫...
推荐理由:NVIDIA 开源了一个能同时处理长视频画面和声音的模型,训练数据量 700 万条带时间戳样本,训练方法分三步走——这点对做视频理解的人有参考价值。我会先打个折:正文没提在具体产品里的表现,也没给延迟或成本数字,所以先别太激动,把它当一个扎实的研究发布看就好。