# 微软开源 Mage-Flow：一个 4B 参数、原生分辨率生图与修图模型

> 原标题：Mage-Flow - An Efficient Native-Resolution Foundation Model for Image Generation and Editing - Microsoft

- 来源：r/LocalLLaMA
- 发布时间：2026-07-22T18:05:43.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45955
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1v3o024/mageflow_an_efficient_nativeresolution_foundation/

## 摘要

微软在 HuggingFace 上放出了 Mage-Flow，一个 4B 参数的基础模型，既能文生图，也能按指令修图。它没走堆参数的路子，而是靠一个轻量化的图像压缩器 Mage-VAE 和一个原生分辨率扩散 Transformer 配合，效果对标甚至超过了 Qwen-Image 20B、FLUX.2 32B 这些大得多的系统。Mage-VAE 的编码计...

## 推荐理由

微软开源了一个 4B 参数的图像生成模型 Mage-Flow，能文生图也能按指令修图。它没走堆参数的路，靠一个轻量的 Mage-VAE 压缩器和原生分辨率扩散 Transformer，效果直接对标 Qwen-Image 20B、FLUX.2 32B 这些大得多的系统。我会先打个折——目前只有 Reddit 帖子，没有正式论文或第三方复现报告，所以分数定在 78。如果后续有实测数据能撑住这个效率比，分数还有上调空间。

## 锐评

微软在HuggingFace上开源的Mage-Flow，核心思路是“不堆参数，靠省算力”。它用一个叫Mage-VAE的轻量图像压缩器，把编码和解码的算力消耗分别降到竞品FLUX.2-VAE的约1/12和1/22，再配合一个4B参数的扩散模型，在A100上生成一张1024分辨率的图只要0.59秒，修图1.02秒，显存占用18-20GB，是目前同类系统里最低的。

这个模型原生支持从512到2048的各种分辨率，包括4:1这种极端长宽比，不用再切图或拉伸。训练效率也提了约2.5倍，靠的是原生分辨率打包和定制CUDA内核。

但正文没给3090或4090这类24GB消费卡的跑分，A100上的内核优化能多大程度迁移到家用卡上还不清楚。另外，虽然它提供了Base、RL对齐版和4步Turbo版，但RL对齐具体用了什么偏好数据、编辑任务的成功率量化指标，原文也没展开。想在家用卡上尝鲜的话，建议先等社区实测出图质量和显存占用再动手。
