# LAION 发布 BVD 视频数据集：1000 万小时开放视频，供多模态预训练研究使用

> 原标题：Laion Big Video Dataset

- 来源：Hacker News 首页
- 发布时间：2026-08-27T01:50:26.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53025
- 原文：https://projects.laion.ai/bvd/

## 摘要

LAION 放出了一个叫 BVD 的大规模视频数据集，专门给多模态模型做预训练用。数据来自 CommonCrawl 抓到的 13 亿条视频链接，实际下载了 8000 万个视频，总时长 1000 万小时。处理时用了场景检测把视频切成片段，再给画面和声音分别生成合成字幕。用这批数据训出来的 ViCLIP 模型，在视频文本基准上比用 InternVid 训的...

## 推荐理由

LAION 这次扔出来的 BVD 数据集，简单说就是从 CommonCrawl 抓了 13 亿条视频链接，实际下载到 8000 万个视频，总时长 1000 万小时。处理时做了场景检测切片段，还给画面和声音分别生成合成字幕。用这批数据训出来的 ViCLIP 模型，在视频文本基准上比用 InternVid 训的强。H 和 K 都到位了——规模本身就勾人，具体数字和对比结果也够硬。R 没给是因为 LAION 不是模型厂商，身份冲击力弱一些，搞基础设施的人会更关心。分数定在 72，主要就是 R 这块拉低了上限。

## 锐评

LAION 这次放出的 BVD 是个给多模态模型用的公开视频数据集，规模确实大：从 CommonCrawl 抓了 13 亿条视频链接，实际下载了 8000 万个视频，总时长 1000 万小时。处理流程上，他们用场景检测把视频切成片段，再给画面和声音分别生成合成字幕，相当于用机器给视频和音频自动打标签。用这批数据训出来的 ViCLIP 模型，在视频文本基准上比用 InternVid 训的模型最多高出 2.1 个百分点，而且数据量从 1000 万加到 5000 万个片段时，效果还在涨。另外从视频里抽出来的 3 亿帧画面，分布跟普通网页图片不一样，训出来的 CLIP 模型在图文检索上表现也不错。

不过有几处得打个折。第一，所有字幕都是合成生成的，不是人工标注，质量上限取决于生成模型本身，正文没披露具体用哪个模型生成、错误率多少。第二，数据集明确写了只限研究、不能商用，而且 LAION 自己提醒数据里可能有偏见和版权问题，但没给出具体的去偏处理方案或版权清洗细节。第三，音频部分的对比基线是“未整理的数据集”，这个说法比较模糊，实际竞争力不好判断。

整体看，这是个对学术圈有用的资源，填补了大规模公开视频数据的缺口，但离工业级直接可用还有距离。还缺的信息包括：合成字幕的模型和评估指标、数据去重和过滤的具体规则、以及不同语言和地域的分布统计。
