跳到正文
r/LocalLLaMA

字节跳动开源了一个 3B 参数模型,想用一个小体量搞定看图、看视频、生图和修图

bytedance released an open source model that attempts to do just about anything with only 3b parameters

字节跳动放出了一个叫 Lance 的开源模型,激活参数只有 3B,但试图把图像和视频的理解、生成、编辑都塞进一个模型里。帖子说它是从头训练的,用了分阶段的多任务训练配方,训练硬件是 128 张 A100 GPU。正文没披露训练时长、具体数据规模和各项任务的实测分数,所以实际效果和泛化能力还得等跑分和社区实测。

推荐理由:我会先打个折:正文没给任何 benchmark 分数,也没提许可证,所以实际能力还得等实测。但亮点很清楚——ByteDance 用 128 张 A100 从零训出一个 3B 活跃参数的多模态模型 Lance,图像视频的理解、生成、编辑全包了,还直接开源。这个参数规模和训练成本对想自己部署的团队诱惑很大,不过没看到对比数据前,先别太激动。

读原文 ↗导出 Markdown