热点事件历史事件
Grok 4.7 在智能体知识工作上摸到前沿,编码代理得分升至 56,但靠的是大量输出 token
1 篇报道1 个报道来源8 天前更新
先了解这件事
事实说明
Grok 4.7 在模拟真实工作任务的 AA-Briefcase 测试中拿到 1657 分,比上一代高出 111 分,分析质量提升明显,但呈现质量反而微降,总分排在 Claude Opus 5 和 Claude Fable 5.1 之后。编码代理指数从 47 跳到 56,其中 Terminal-Bench 成绩翻倍到 33%,DeepSWE 从 65%...
报道时间线
沿着报道,了解事件的不同侧面。
9月22日
- AI HOT 精选精选Grok 4.7 在智能体知识工作上摸到前沿,编码代理得分升至 56,但靠的是大量输出 token
Grok 4.7 在模拟真实工作任务的 AA-Briefcase 测试中拿到 1657 分,比上一代高出 111 分,分析质量提升明显,但呈现质量反而微降,总分排在 Claude Opus 5 和 Claude Fable 5.1 之后。编码代理指数从 47 跳到 56,其中 Terminal-Bench 成绩翻倍到 33%,DeepSWE 从 65%...