| 01 | Claude Opus 5Anthropic上线 2026-07-24 · 证据敏感缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥167.59 | | 2 项评测证据敏感名次浮动范围1—2 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥3.35 | ¥33.52 | ¥167.59 | 87.5 |
| 02 | GPT-5.6 SolOpenAI上线 2026-07-09 · 证据敏感缓存输入 ¥2.68输入 ¥26.81 · 输出 ¥134.07 | | 2 项评测证据敏感名次浮动范围2—4 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥2.68 | ¥26.81 | ¥134.07 | 83.8 |
| 03 | GPT-6 AstraOpenAI上线 2026-09-03 · 证据敏感缓存输入 ¥6.7输入 ¥67.03 · 输出 ¥335.17 | | 2 项评测证据敏感名次浮动范围第 3 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥6.7 | ¥67.03 | ¥335.17 | 82.2 |
| 04 | Gemini 3.8 FlashGoogle上线 2026-09-02 · 证据敏感缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.14 | | 2 项评测证据敏感名次浮动范围1—4 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥0.5 | ¥5.03 | ¥25.14 | 81.6 |
| 05 | Claude Fable 5Anthropic上线 2026-06-09 · 证据敏感缓存输入 ¥6.7输入 ¥67.03 · 输出 ¥335.17 | | 2 项评测证据敏感名次浮动范围第 5 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥6.7 | ¥67.03 | ¥335.17 | 80.4 |
| 06 | Kimi K3Moonshot AI上线 2026-07-16 · 证据敏感缓存输入 ¥2输入 ¥20 · 输出 ¥100 | | 2 项评测证据敏感名次浮动范围6—8 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥2 | ¥20 | ¥100 | 75.7 |
| 07 | GLM-5.3Z.ai上线 2026-08-18 · 证据敏感缓存输入 ¥1.74输入 ¥9.38 · 输出 ¥29.49 | | 2 项评测证据敏感名次浮动范围第 7 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥1.74 | ¥9.38 | ¥29.49 | 72.9 |
| 08 | GPT-5.6 TerraOpenAI上线 2026-07-09 · 证据敏感缓存输入 ¥1.34输入 ¥13.41 · 输出 ¥80.44 | | 2 项评测证据敏感名次浮动范围6—10 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥1.34 | ¥13.41 | ¥80.44 | 70.7 |
| 09 | Gemini 3.7 FlashGoogle上线 2026-08-13 · 证据敏感缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.14 | | 2 项评测证据敏感名次浮动范围8—12 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥0.5 | ¥5.03 | ¥25.14 | 69.6 |
| 10 | GPT-5.5OpenAI上线 2026-04-23 · 证据敏感缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥201.1 | | 2 项评测证据敏感名次浮动范围8—10 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥3.35 | ¥33.52 | ¥201.1 | 68.9 |
| 11 | Grok 4.6xAI上线 2026-08-12 · 证据敏感缓存输入 ¥3.35输入 ¥13.41 · 输出 ¥40.22 | | 2 项评测证据敏感名次浮动范围10—12 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥3.35 | ¥13.41 | ¥40.22 | 64.8 |
| 12 | GPT-5.6 LunaOpenAI上线 2026-07-09 · 证据敏感缓存输入 ¥0.13输入 ¥1.34 · 输出 ¥8.04 | | 2 项评测证据敏感名次浮动范围9—13 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥0.13 | ¥1.34 | ¥8.04 | 61.6 |
| 13 | GLM-5.3 FlashZ.ai上线 2026-08-26 · 证据敏感缓存输入 ¥0.23输入 ¥0.8 · 输出 ¥2.8 | | 2 项评测证据敏感名次浮动范围11—13 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥0.23 | ¥0.8 | ¥2.8 | 60.8 |
| 14 | DeepSeek V4 Pro PreviewDeepSeek上线 2026-04-24 · 证据敏感缓存输入 ¥0.0243输入 ¥2.92 · 输出 ¥5.83 | | 2 项评测证据敏感名次浮动范围14—16 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥0.0243 | ¥2.92 | ¥5.83 | 55.9 |
| 15 | Qwen3.8 MaxAlibaba上线 2026-07-19 · 证据敏感缓存输入 —输入 ¥12 · 输出 ¥36 | | 2 项评测证据敏感名次浮动范围14—16 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | — | ¥12 | ¥36 | 54.5 |
| 16 | Claude Opus 4.8Anthropic上线 2026-05-28 · 证据敏感缓存输入 ¥3.35输入 ¥33.52 · 输出 ¥167.59 | | 2 项评测证据敏感名次浮动范围15—16 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥3.35 | ¥33.52 | ¥167.59 | 54.4 |
| 17 | Claude Sonnet 5Anthropic上线 2026-06-30 · 证据敏感缓存输入 ¥1.34输入 ¥13.41 · 输出 ¥67.03 | | 2 项评测证据敏感名次浮动范围17—18 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥1.34 | ¥13.41 | ¥67.03 | 52.4 |
| 18 | Muse Spark 1.1Meta上线 2026-07-09 · 证据敏感缓存输入 —输入 ¥8.38 · 输出 ¥28.49 | | 2 项评测证据敏感名次浮动范围18—20 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | — | ¥8.38 | ¥28.49 | 46.9 |
| 19 | Muse Spark 1.2Meta上线 2026-08-05 · 证据敏感缓存输入 —输入 ¥8.38 · 输出 ¥28.49 | | 2 项评测证据敏感名次浮动范围17—19 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | — | ¥8.38 | ¥28.49 | 46.3 |
| 20 | Grok 4.5xAI上线 2026-07-08 · 证据敏感缓存输入 ¥2.01输入 ¥13.41 · 输出 ¥40.22 | | 2 项评测证据敏感名次浮动范围19—20 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥2.01 | ¥13.41 | ¥40.22 | 38.5 |
| 21 | GPT-5.4OpenAI上线 2026-03-05 · 证据敏感缓存输入 ¥1.68输入 ¥16.76 · 输出 ¥100.55 | | 2 项评测证据敏感名次浮动范围21—22 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥1.68 | ¥16.76 | ¥100.55 | 37.3 |
| 22 | DeepSeek V4 Flash PreviewDeepSeek上线 2026-04-24 · 证据敏感缓存输入 ¥0.0188输入 ¥0.94 · 输出 ¥1.88 | | 2 项评测证据敏感名次浮动范围21—22 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥0.0188 | ¥0.94 | ¥1.88 | 36.7 |
| 23 | Gemini 3.6 FlashGoogle上线 2026-07-21 · 证据敏感缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.14 | | 2 项评测证据敏感名次浮动范围第 23 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥0.5 | ¥5.03 | ¥25.14 | 34.6 |
| 24 | GLM-5.2Z.ai上线 2026-06-16 · 证据敏感缓存输入 ¥2输入 ¥8 · 输出 ¥28 | | 2 项评测证据敏感名次浮动范围第 24 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥2 | ¥8 | ¥28 | 33.5 |
| 25 | Gemini 3.5 FlashGoogle上线 2026-05-19 · 证据敏感缓存输入 ¥1.01输入 ¥10.06 · 输出 ¥60.33 | | 2 项评测证据敏感名次浮动范围第 25 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥1.01 | ¥10.06 | ¥60.33 | 23.7 |
| 26 | Claude Sonnet 4.6Anthropic上线 2026-02-17 · 证据敏感缓存输入 ¥2.01输入 ¥20.11 · 输出 ¥100.55 | | 2 项评测证据敏感名次浮动范围26—27 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥2.01 | ¥20.11 | ¥100.55 | 15.9 |
| 27 | Kimi K2.7 CodeMoonshot AI上线 2026-06-12 · 证据敏感缓存输入 —输入 — · 输出 — | | 2 项评测证据敏感名次浮动范围26—27 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | 待核验 | 待核验 | 待核验 | 14.1 |
| 28 | Gemini 3.1 Pro PreviewGoogle上线 2026-02-19 · 证据敏感缓存输入 ¥1.34输入 ¥13.41 · 输出 ¥80.44 | | 2 项评测证据敏感名次浮动范围第 28 名在 9 个对照情景中重新检查资格后的名次。 4 个情景下参评证据不足。不是置信区间。 | ¥1.34 | ¥13.41 | ¥80.44 | 12.8 |