跳到正文
Hacker News 首页

Moebius:一个 2.26 亿参数的图像修补模型,效果能打 119 亿参数的 FLUX.1-Fill-Dev

Moebius: 0.2B image inpainting model with 10B-level performance

华中科技大学和 VIVO AI Lab 搞了个叫 Moebius 的轻量级图像修补模型,参数只有 2.26 亿,不到 FLUX.1-Fill-Dev(119 亿参数)的 2%,但在 6 个基准测试上效果能打平甚至超过它。核心思路是把自注意力和交叉注意力改成了固定大小的线性矩阵,绕开了传统注意力机制里计算量随分辨率平方级增长的问题,再配合一套在潜空间里直...

推荐理由:Moebius 用 2.26 亿参数做到了 10B 级别的图像修补效果,核心是把注意力机制换成了固定大小的线性矩阵,避开了分辨率越高计算越炸的平方级增长。H 和 K 都站得住,但只有论文没有开源或产品,R 偏弱,刚好卡在 featured 线上。

读原文 ↗导出 Markdown