跳到正文
Hacker News 首页

Linum 公开视频模型 v3 的数据筛选演进:从 CPU 土法炼钢到 RL 美学打分

Getting video models to learn better, faster

Linum 在训练开源视频模型 v3,这篇博客详细拆解了他们从 2024 年至今的数据筛选流水线是怎么一步步搭起来的。最早为了省钱,全用 CPU 跑传统视觉算法:用 PySceneDetect 切镜头、EAST 做文字识别、靠 H.264 的运动向量踢掉几乎不动的片段,再用 Haar 级联分类器对“大头讲话”视频做降采样。到 2025 年初,他们换上 ...

推荐理由:一篇很实在的工程复盘,从省钱版 CPU 管线一路讲到 GPU 集群上的美学过滤,每一步的动机和取舍都写清楚了。信息量大、可复用性强,但受众集中在视频模型数据团队,所以分数卡在这里。

读原文 ↗导出 Markdown