跳到正文
Hacker News 首页

LAION 发布 BVD 视频数据集:1000 万小时开放视频,供多模态预训练研究使用

Laion Big Video Dataset

LAION 放出了一个叫 BVD 的大规模视频数据集,专门给多模态模型做预训练用。数据来自 CommonCrawl 抓到的 13 亿条视频链接,实际下载了 8000 万个视频,总时长 1000 万小时。处理时用了场景检测把视频切成片段,再给画面和声音分别生成合成字幕。用这批数据训出来的 ViCLIP 模型,在视频文本基准上比用 InternVid 训的...

推荐理由:LAION 这次扔出来的 BVD 数据集,简单说就是从 CommonCrawl 抓了 13 亿条视频链接,实际下载到 8000 万个视频,总时长 1000 万小时。处理时做了场景检测切片段,还给画面和声音分别生成合成字幕。用这批数据训出来的 ViCLIP 模型,在视频文本基准上比用 InternVid 训的强。H 和 K 都到位了——规模本身就勾人,具体数字和对比结果也够硬。R 没给是因为 LAION 不是模型厂商,身份冲击力弱一些,搞基础设施的人会更关心。分数定在 72,主要就是 R 这块拉低了上限。

读原文 ↗导出 Markdown