跳到正文
AI HOT 精选

Grok 4.7 在智能体知识工作上摸到前沿,编码代理得分升至 56,但靠的是大量输出 token

Artificial Analysis 评测 Grok 4.7:智能体知识工作跻身前沿,编码代理得分升至 56

Grok 4.7 在模拟真实工作任务的 AA-Briefcase 测试中拿到 1657 分,比上一代高出 111 分,分析质量提升明显,但呈现质量反而微降,总分排在 Claude Opus 5 和 Claude Fable 5.1 之后。编码代理指数从 47 跳到 56,其中 Terminal-Bench 成绩翻倍到 33%,DeepSWE 从 65%...

推荐理由:Grok 4.7 在代理类知识工作和编码代理上摸到了前沿水平,AA-Briefcase 1657 分和编码代理指数 56 都是可横向对比的数字。没给更高分是因为代理之外的提升幅度不大,而且原文后半截被截断,缺了部分细节,先按现有数据给到 featured。

读原文 ↗导出 Markdown