跳到正文
Hacker News 首页

Grok 4.6 追平 GPT-5.6 Sol,靠更低成本在智能体任务上领跑

SpaceXAI's Grok 4.6 Scores 61 on the Artificial Analysis Intelligence Index

Grok 4.6 在 Artificial Analysis 的智能指数上拿了 61 分,比上代高了 5 分,和 GPT-5.6 Sol 打平,只比 Claude Opus 5(63 分)和 Claude Fable 5(62 分)低一点。它最亮眼的是智能体任务:在模拟真实知识工作的 GDPval-AA v2 测试里 Elo 分达到 1753,仅次于 ...

推荐理由:Grok 4.6 在第三方基准上和 GPT-5.6 Sol 打平,智能体任务分尤其亮眼,成本优势也摆在那里。没给更高分是因为这只是一家评测机构的数据,不是官方发布,而且从 4.5 到 4.6 只隔了一个月,需要更多独立验证才敢全信。

读原文 ↗导出 Markdown