跳到正文
热点事件历史事件

Grok 4.7 在智能体知识工作上摸到前沿,编码代理得分升至 56,但靠的是大量输出 token

1 篇报道1 个报道来源8 天前更新

先了解这件事

事实说明

Grok 4.7 在模拟真实工作任务的 AA-Briefcase 测试中拿到 1657 分,比上一代高出 111 分,分析质量提升明显,但呈现质量反而微降,总分排在 Claude Opus 5 和 Claude Fable 5.1 之后。编码代理指数从 47 跳到 56,其中 Terminal-Bench 成绩翻倍到 33%,DeepSWE 从 65%...

报道时间线

沿着报道,了解事件的不同侧面。

9月22日
  1. AI HOT 精选精选
    Grok 4.7 在智能体知识工作上摸到前沿,编码代理得分升至 56,但靠的是大量输出 token

    Grok 4.7 在模拟真实工作任务的 AA-Briefcase 测试中拿到 1657 分,比上一代高出 111 分,分析质量提升明显,但呈现质量反而微降,总分排在 Claude Opus 5 和 Claude Fable 5.1 之后。编码代理指数从 47 跳到 56,其中 Terminal-Bench 成绩翻倍到 33%,DeepSWE 从 65%...