# 膨胀伪影：大模型输出的瑕疵不是压缩痕迹，而是解压时脑补过头的证据

> 原标题：Expansion Artifacts

- 来源：Hacker News 首页
- 发布时间：2026-04-20T18:38:22.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/7968
- 原文：https://mattstromawn.com/writing/expansion-artifacts/

## 摘要

Matt Ström-Awn 把大模型生成内容里的毛病叫做“膨胀伪影”，而不是压缩伪影。他的逻辑是：模型从模糊的训练数据里往外“解压”时，会在信心不足的地方用训练分布里的高频模式硬填，于是就有了那些套话、过度注释的代码、六指手和穿模视频。这些痕迹能当法医线索用——斯坦福的研究人员靠追踪 ChatGPT 发布后词频飙升的词（比如 commendable、...

## 推荐理由

我会先打个折，这是个人博客评论，不是一手研究或产品发布，所以分数停在 73。但它的钩子很巧，把 LLM 的毛病重新包装成“扩展伪影”，一下就把审美收敛和生成路径暴露的问题串起来了。文章给的数字也实在，17.5% 的论文和 16.9% 的审稿有 AI 起草痕迹，说明这已经不是小范围现象。JPG 压缩 10000 次后 PSNR 掉到 14.59 的类比虽然不算严谨实验，但直观地让人感受到反复生成带来的退化。真正值得盯的是取证价值：这些伪影不光是风格问题，还可能成为追踪生成路径的线索，这对审稿信任和内容溯源都挺要命的。

## 锐评

Matt Ström-Awn 提出了一个挺有意思的视角：我们在大模型输出里看到的那些毛病，不是压缩时丢信息造成的，而是从模糊训练数据往外“解压”时，模型在信心不足的地方用训练分布里的高频模式硬填出来的。他把这叫做“膨胀伪影”。这个命名比 Ted Chiang 之前“模糊的 JPEG”更进一步，因为它解释了为什么 AI 生成的文本总爱用 delve、multifaceted 这类词，代码会过度注释，图片会多出几根手指。

文章引用了斯坦福的研究作为佐证：ChatGPT 发布后，计算机论文里 AI 参与起草的比例估计有 17.5%，同行评审里也有 16.9%，靠的就是追踪某些词频的异常飙升。另外还提到一张 JPG 反复压缩一万次后 PSNR 掉到 14.59，用来对比说明膨胀伪影的形成逻辑。

不过文章本身更像一篇观点散文，不是严格的研究报告。它没有给出检测膨胀伪影的具体方法或量化标准，斯坦福的数据也只是引用，没有展开方法论细节。对从业者来说，这个概念的启发在于：这些痕迹可以当“法医线索”用，去判断一段内容是不是 AI 生成的。但怎么系统性地做，正文没讲。
