# Mila 和 DeepMind 搞了个大一统的缩放定律公式 UNSL，想把参数量、数据量、训练步数这些变量塞进同一个框架里

> 原标题：多变量神经缩放定律迈向大一统：Mila联手DeepMind提出UNSL

- 来源：机器之心 · 公众号
- 发布时间：2026-05-28T04:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30047
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651035468&idx=2&sn=04c057ee3ddfb6194df95cb4f6c03ef2

## 摘要

正文因为微信环境异常被屏蔽了，具体技术细节看不到。从标题和已有英文摘要看，这篇论文提出了一种叫 UNSL（统一神经缩放定律）的多变量公式，不再只看模型参数或数据量单一维度，而是同时建模参数量、token 数、训练步数，还考虑了训练瓶颈、过拟合以及超参数调不好的负面影响。在论文自己汇报的实验里，UNSL 在 60.87% 的视觉任务和 88.89% 的语...

## 推荐理由

这篇不是又一个刷榜的 scaling law，而是把之前各自为政的变量（参数量、token 数、步数、瓶颈、过拟合、超参数反作用）捏到了一起。我会先打个折：视觉任务 60.87% 的最佳外推率说明还有不少场景没覆盖到，但语言任务 88.89% 确实亮眼。正文没披露具体实验用了多少算力、验证集规模多大，这点先别太激动。如果是真的，训练前就能更准地估出该堆参数还是堆数据，省钱。

## 锐评

Mila 和 DeepMind 搞了个叫 UNSL 的统一缩放定律公式，不再像以前那样只盯着参数量或数据量单一维度，而是把参数量、token 数、训练步数、训练瓶颈、过拟合、超参数调砸了的影响都揉在一起建模。论文自己报的数字是：在 60.87% 的视觉任务和 88.89% 的语言任务上，外推预测比其他方法准。

这个数字看着不错，但得打两个折。第一，正文因为微信环境异常被屏蔽了，我没法看到实验设置、对比基线、误差范围这些关键信息，不知道这 88.89% 是在几个任务上算出来的，也不知道赢的幅度有多大。第二，多变量公式听着更全面，但实际用起来意味着你得先知道更多输入变量的值才能预测，如果有些变量本身不好估计，公式再漂亮也落不了地。

还缺什么：论文有没有在没见过的模型架构上验证过外推能力？公式里那些超参数负面效应的量化方式靠不靠谱？这些正文没披露，先别急着说大一统。
