# Moebius：一个 2.26 亿参数的图像修补模型，效果能打 119 亿参数的 FLUX.1-Fill-Dev

> 原标题：Moebius: 0.2B image inpainting model with 10B-level performance

- 来源：Hacker News 首页
- 发布时间：2026-06-22T13:53:02.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39858
- 原文：https://hustvl.github.io/Moebius/

## 摘要

华中科技大学和 VIVO AI Lab 搞了个叫 Moebius 的轻量级图像修补模型，参数只有 2.26 亿，不到 FLUX.1-Fill-Dev（119 亿参数）的 2%，但在 6 个基准测试上效果能打平甚至超过它。核心思路是把自注意力和交叉注意力改成了固定大小的线性矩阵，绕开了传统注意力机制里计算量随分辨率平方级增长的问题，再配合一套在潜空间里直...

## 推荐理由

Moebius 用 2.26 亿参数做到了 10B 级别的图像修补效果，核心是把注意力机制换成了固定大小的线性矩阵，避开了分辨率越高计算越炸的平方级增长。H 和 K 都站得住，但只有论文没有开源或产品，R 偏弱，刚好卡在 featured 线上。

## 锐评

Moebius 把修图这件事从“大模型暴力出奇迹”拉回了“小模型也能干好”。核心思路是把自注意力和交叉注意力改成固定大小的线性矩阵，绕开了传统注意力计算量随分辨率平方级增长的问题，再配合一套在潜空间里直接蒸馏老师模型 PixelHacker 的策略，省掉了昂贵的像素空间解码。最终在 6 个基准测试上跟 FLUX.1-Fill-Dev 和 SD3.5 Large-Inpainting 打平甚至略超，参数不到对方的 2%，单步推理 26 毫秒，总速度快 15 倍以上。

不过现在能看到的对比对象主要是 Flux 和 SD3.5 这两个通用模型，缺少跟其他轻量级修图专有模型的直接对比。另外项目页只给了单步延迟，没披露端到端吞吐、不同分辨率下的显存占用，也没说在笔记本或边缘设备上的实测表现。如果这些数据补上，对实际部署的参考价值会大很多。
