# Grok 4.7 在智能体知识工作上摸到前沿，编码代理得分升至 56，但靠的是大量输出 token

> 原标题：Artificial Analysis 评测 Grok 4.7：智能体知识工作跻身前沿，编码代理得分升至 56

- 来源：AI HOT 精选
- 发布时间：2026-09-21T19:41:25.079Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57983
- 原文：https://artificialanalysis.ai/articles/benchmarking-grok-4-7

## 摘要

Grok 4.7 在模拟真实工作任务的 AA-Briefcase 测试中拿到 1657 分，比上一代高出 111 分，分析质量提升明显，但呈现质量反而微降，总分排在 Claude Opus 5 和 Claude Fable 5.1 之后。编码代理指数从 47 跳到 56，其中 Terminal-Bench 成绩翻倍到 33%，DeepSWE 从 65%...

## 推荐理由

Grok 4.7 在代理类知识工作和编码代理上摸到了前沿水平，AA-Briefcase 1657 分和编码代理指数 56 都是可横向对比的数字。没给更高分是因为代理之外的提升幅度不大，而且原文后半截被截断，缺了部分细节，先按现有数据给到 featured。

## 锐评

Grok 4.7 这次升级主要强在能干活了。在模拟写文档、做表格这类真实工作任务的 AA-Briefcase 测试里，它拿了 1657 分，比上一代高了 111 分，分析质量提升明显，但呈现质量反而微降，总分排在 Claude Opus 5 和 Claude Fable 5.1 之后。编码代理指数从 47 跳到 56，其中 Terminal-Bench 成绩翻倍到 33%，DeepSWE 从 65% 涨到 73%，说明它在终端操作和修 Bug 这类实际编程任务上进步不小。

但这些提升是靠堆算力换来的。Grok 4.7 平均每个任务要吐出 8.1 万个 token，是自家上一代的 2 倍多，更是 GPT-6 Astra 的近 3 倍。价格没变，还是输入每百万 token 2 美元、输出 6 美元，但实际用起来成本会高出一截。幻觉率从 34% 降到 29%，准确率基本没动，说明它更少胡说八道了，但也没变聪明多少。

正文没提推理延迟的具体分布，也没说这些测试任务是否公开可复现。另外，上下文窗口还是 50 万 token，没变化。
