# 快手可灵提出 VLM-as-Teacher：生成视频时让视觉模型当老师，在线微调 LoRA 来遵守文字规则

> 原标题：快手可灵提出VLM-as-Teacher：用测试时在线优化，让视频生成模型学会按规则推理

- 来源：量子位 · 公众号
- 发布时间：2026-06-07T01:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35142
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247895580&idx=3&sn=58f3cf8717e28f3ebeb75276734df8ca

## 摘要

这篇文章的正文被微信环境异常页挡住了，看不到具体技术细节。从标题和现有摘要看，快手可灵和城大合作了一个叫 VLM-as-Teacher 的方法。思路是在测试阶段用视觉语言模型（VLM）给视频生成模型（VGM）的 LoRA 模块打分反馈，边生成边优化，让模型学会按文字规则推理。他们搞了个 VBVR-Bench 基准，分数从 0.666 提到了 0.781...

## 推荐理由

正文被微信环境异常页挡住了，看不到技术细节，这点先打个折。但从标题和摘要看，快手可灵和城大搞的 VLM-as-Teacher，思路是在测试阶段让视觉语言模型给视频生成模型的 LoRA 打分，边跑边调，让模型学会按文字规则推理。VBVR-Bench 上分数从 0.666 提到 0.781，说明规则遵循能力有明显提升。方法本身有巧思，不是换模型架构，而是在推理时加一层在线优化，对可控视频生成是个实用方向。信息缺口在于没看到具体实现和消融实验，等正文能看了再补判断。

## 锐评

这条新闻的核心思路挺直接：不让视频模型一次生成就完事，而是在测试阶段用另一个视觉模型（VLM）当“判卷老师”，给生成结果打分，再反过来微调视频模型里一个叫 LoRA 的小模块。相当于边考试边改答案，让模型学会按文字规则推理，而不是瞎猜。他们自己搞了个叫 VBVR-Bench 的基准测试，分数从 0.666 提到了 0.781，平均涨了 16.7 个百分点，提升幅度看着不小。

但问题在于，原文被微信环境异常页挡住了，所有技术细节、实验设置、用了什么 VLM、LoRA 怎么插、推理成本增加多少，全都不清楚。0.666 到 0.781 这个数字本身也缺上下文：这个基准测的是什么规则、难度如何、有没有和别的方法比过，正文都没披露。所以这个分数先打个折看，别太激动。

对从业者来说，如果这个方法真的能在推理时用很小的额外成本换来明显提升，那挺省钱。但前提是得看到完整论文，确认它不是只在自家基准上自嗨，而且推理延迟和算力开销在可接受范围内。
