# Linum 公开视频模型 v3 的数据筛选演进：从 CPU 土法炼钢到 RL 美学打分

> 原标题：Getting video models to learn better, faster

- 来源：Hacker News 首页
- 发布时间：2026-08-27T01:53:34.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53019
- 原文：https://www.linum.ai/field-notes/data-filtering-gen-video

## 摘要

Linum 在训练开源视频模型 v3，这篇博客详细拆解了他们从 2024 年至今的数据筛选流水线是怎么一步步搭起来的。最早为了省钱，全用 CPU 跑传统视觉算法：用 PySceneDetect 切镜头、EAST 做文字识别、靠 H.264 的运动向量踢掉几乎不动的片段，再用 Haar 级联分类器对“大头讲话”视频做降采样。到 2025 年初，他们换上 ...

## 推荐理由

一篇很实在的工程复盘，从省钱版 CPU 管线一路讲到 GPU 集群上的美学过滤，每一步的动机和取舍都写清楚了。信息量大、可复用性强，但受众集中在视频模型数据团队，所以分数卡在这里。

## 锐评

这篇博客最值得看的是 Linum 怎么一步步把数据筛选从省钱方案升级到效果方案。2024 年他们为了省 GPU 成本，全用 CPU 跑传统视觉算法：PySceneDetect 切镜头、EAST 做文字识别、靠 H.264 的运动向量踢掉几乎不动的片段，再用 Haar 级联分类器对“大头讲话”视频做降采样。这套方案的好处是便宜，但问题也很明显——规则太死，容易误杀或漏掉边缘样本。
到 2025 年初，他们换上 GPU 集群，用微调过的 Qwen-2-VL-2B 做分类过滤，把之前手工写的规则全扔掉。这一步让筛选更准，但正文没披露换了之后数据保留率变化了多少，也没说 GPU 成本涨了多少。2025 年底又引入 RLVR，用 Qwen-2.5-VL-3B 给视频打 1-4 分的美学评分，再配合 WAFT 光流法抓漏网的低动态片段。
整体思路清晰，但缺关键数字：v3 模型多大、什么时候发、各阶段过滤掉了百分之多少的数据、最终训练集规模是多少，这些都没提。所以这篇更适合当工程路线参考，别当效果验证看。
