# 字节跳动开源了一个 3B 参数模型，想用一个小体量搞定看图、看视频、生图和修图

> 原标题：bytedance released an open source model that attempts to do just about anything with only 3b parameters

- 来源：r/LocalLLaMA
- 发布时间：2026-05-19T12:05:26.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23674
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1thkwgk/bytedance_released_an_open_source_model_that/

## 摘要

字节跳动放出了一个叫 Lance 的开源模型，激活参数只有 3B，但试图把图像和视频的理解、生成、编辑都塞进一个模型里。帖子说它是从头训练的，用了分阶段的多任务训练配方，训练硬件是 128 张 A100 GPU。正文没披露训练时长、具体数据规模和各项任务的实测分数，所以实际效果和泛化能力还得等跑分和社区实测。

## 推荐理由

我会先打个折：正文没给任何 benchmark 分数，也没提许可证，所以实际能力还得等实测。但亮点很清楚——ByteDance 用 128 张 A100 从零训出一个 3B 活跃参数的多模态模型 Lance，图像视频的理解、生成、编辑全包了，还直接开源。这个参数规模和训练成本对想自己部署的团队诱惑很大，不过没看到对比数据前，先别太激动。

## 锐评

字节跳动开源了一个叫Lance的模型，激活参数只有3B，却想把图像和视频的理解、生成、编辑全包圆。这思路挺野，相当于用一台小车的预算想干重卡的活。帖子说它是从头训练的，用了分阶段的多任务训练配方，硬件是128张A100。但正文没披露训练时长、具体数据规模，也没给任何基准测试的分数。所以现在只能把它当成一个技术路线展示，实际效果和泛化能力完全未知。我会先打个折：3B参数做统一多模态，理论上延迟低、部署成本友好，但生成质量和复杂场景的理解能力很可能要妥协。等社区跑完分、有人实测了视频编辑效果，才能判断它到底是真省钱的实用方案，还是又一个“能做但做不好”的demo。
