# 有人用 API 猜出了 GPT、Claude、Gemini 的参数量，社区吵翻了

> 原标题：有人只用API就猜出了GPT、Claude、Gemini的参数量？社区吵翻了

- 来源：机器之心 · 公众号
- 发布时间：2026-05-01T05:01:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12878
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651031232&idx=1&sn=6ef67aad98248c27294f1be3eb80d089

## 摘要

Bojie Li 在 arXiv 发了篇论文，用黑盒 API 调用去估算 27 家厂商 188 个模型的参数量。方法叫 IKP，靠 1400 道按生僻程度分了 7 档的题，先在 89 个已知参数量的开源模型上拟合，拟合度 R² 到 0.917。争议点集中在合成数据干扰、MoE 架构影响，以及估算区间太宽——90% 置信区间在 0.3 倍到 3 倍之间，...

## 推荐理由

这篇东西我会先打个折：方法是用黑盒 API 反推参数量，听起来很酷，但合成数据、MoE 架构这些坑都还在，90% 置信区间宽到 0.3 到 3 倍，说明估算还比较糙。不过它确实把 188 个模型的参数量猜了个遍，R²=0.917 也不算低，对从业者来说是个能引发讨论的参照系。社区争议本身就是信息价值的一部分，所以放在 featured 里合适，但离 P1 还差一口气，因为结论的确定性不够硬。

## 锐评

这篇论文用一套叫 IKP 的方法，通过 1400 道按生僻程度分 7 档的题，去测 27 家厂商 188 个闭源模型的参数量。方法本身不复杂：先在 89 个已知参数量的开源模型上跑一遍，拟合出一条“答题能力 vs 参数量”的曲线，拟合度 R² 到 0.917，看着还行。然后拿这条曲线去套闭源模型，根据答题表现反推参数量。

但争议点也很明显。一是合成数据干扰，如果模型训练时见过类似题，表现会虚高，估算就偏大。二是 MoE 架构的影响，这类模型实际激活的参数量远小于总参数量，用总参数去对标密集模型，口径对不上。最要命的是估算区间太宽，90% 置信区间在 0.3 倍到 3 倍之间，也就是说猜一个 1000 亿参数的模型，实际可能在 300 亿到 3000 亿之间，这个精度基本没法用来做严肃判断。

正文没披露具体猜出了哪些模型的参数量，也没说厂商有没有回应。如果只是当个八卦看，挺有意思；但如果想拿这个数据去分析模型能力边界，还是等更靠谱的方法出来再说。
