# OpenAI 把一致性模型简化并扩展到 15 亿参数，两步出图，质量追平扩散模型

> 原标题：Simplifying, stabilizing, and scaling continuous-time consistency models

- 来源：OpenAI News
- 发布时间：2024-10-23T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/684
- 原文：https://openai.com/index/simplifying-stabilizing-and-scaling-continuous-time-consistency-models

## 摘要

OpenAI 发了个新方法叫 sCM，把连续时间一致性模型的训练搞稳定了，直接扩到 15 亿参数，在 512×512 的 ImageNet 上跑。它只用两步采样，出图质量就能跟现在最好的扩散模型打平，单张 A100 上 0.11 秒出一张图，比扩散模型快大约 50 倍。论文里对比了有效算力，sCM 花不到 10% 的算力就拿到差不多的 FID 分数。不...

## 推荐理由

这篇论文把连续时间一致性模型真正做大了，15 亿参数在 ImageNet 512×512 上跑通，两步采样就能拿到跟扩散模型差不多的样本质量，墙钟速度快了大约 50 倍。单张 A100、batch size=1、没做推理优化时 0.11 秒出一张图，这个数对实际部署有参考价值。我会先打个折：正文没披露跟其他快速采样方案（比如蒸馏模型）的直接对比，也没说训练用了多少算力，所以“快 50 倍”是跟谁比、代价多大，还得看后续细节。但能把快采样和大规模训练同时稳住，本身就是一个信号，说明这条路在工程上开始走得通了。

## 锐评

这篇主要讲 OpenAI 的新方法 sCM，把连续时间一致性模型（你可以理解成一种让 AI 一步到位生成图片的模型）的训练搞稳定了，直接扩到了 15 亿参数。在 512×512 的 ImageNet 上，它只用两步采样，出图质量就能跟现在最好的扩散模型打平。单张 A100 显卡上 0.11 秒出一张图，比扩散模型快大约 50 倍，而且论文里说它花的有效算力不到扩散模型的 10%。

这个速度提升确实很实在，尤其对需要实时生成的场景。但文章没给出具体的 FID 分数对比，只放了一张散点图，也没说明对比的扩散模型具体是哪些版本、用了什么蒸馏技巧。所以“打平”这个结论，得看后续论文里的详细数据才能确认。另外，0.11 秒是在没做推理优化的情况下测的，实际部署时还能更快，这点挺有想象空间。

还缺什么：正文没提训练成本，15 亿参数模型训练起来要多少卡、多长时间，这些都没说。也没给在更复杂文本到图像任务上的表现，目前只在 ImageNet 上验证过。
