# 字节跳动开源 Lance：一个模型同时搞定图片和视频的理解、生成与编辑

> 原标题：Show HN: Lance – image/video generation and understanding in one model

- 来源：Hacker News 首页
- 发布时间：2026-05-20T15:45:32.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/24589
- 原文：https://github.com/bytedance/Lance

## 摘要

Lance 是字节跳动放出的一个多模态研究项目，把看图、看视频、生成图片、生成视频和编辑这些事塞进了同一个模型里。模型激活参数只有 3B，个头不大，训练用了不到 128 张 GPU，对想复现或微调的人来说门槛不算高。代码、论文和模型权重都公开了，但项目页没写具体的 benchmark 跑分和商用许可条款，这点先别太激动，得自己去翻论文和 HF 页面确认。

## 推荐理由

字节跳动的 Lance 把图像和视频的生成、理解塞进一个模型，激活参数 3B，训练用了不到 128 块 GPU。我会先打个折：正文没披露 benchmark 成绩、没放真实生成样本，授权协议也没说清楚，所以现在只能当研究发布看，别急着对标成熟产品。但单模型覆盖多模态这个方向，对想省部署成本的小团队确实有吸引力。

## 锐评

Lance 这个项目最吸引人的地方是它把多模态理解和生成做进了同一个模型里，而且个头很小，激活参数只有 3B。训练只用了不到 128 张 GPU，对想自己复现或者微调的人来说，硬件门槛确实不高。代码、论文和权重都公开了，这点值得肯定。

但项目主页的信息缺得有点多。最关键的 benchmark 跑分一个字没提，我们不知道它在看图说话、视频问答或者图像生成质量上到底什么水平。商用许可条款也没写，想直接拿来用的人得先去 Hugging Face 页面和论文里确认。另外，把理解和生成塞进一个模型，通常会在单项任务上有所妥协，正文没披露这种 trade-off 到底有多大。

如果是真的能在 3B 规模上做到可用的统一多模态，那确实省钱省资源。但在看到具体数据和许可之前，这条新闻先打个七折看。
