热点事件历史事件
xAI发布Grok 4.6,在智能体任务上领先同级模型
2 篇报道2 个报道来源2026-08-13更新
先了解这件事
报道摘要
Grok 4.6 在 Grok 4.5 的基础上,专门训练了模型处理长链条任务的能力,比如做研究、分析信息、跨代码库工作,或者把一个想法直接做成能用的应用。在 AA 智能指数这个综合跑分上,它和 GPT-5.6 Sol 打平,都是 61 分;在 DeepSWE 1.1 这个软件工程测试里,分数从 4.5 的 54% 跳到了 65.9%。xAI 说,任务...
摘自 AI HOT 精选
报道时间线
沿着报道,了解事件的不同侧面。
8月13日
- Hacker News 首页精选Grok 4.6 追平 GPT-5.6 Sol,靠更低成本在智能体任务上领跑
Grok 4.6 在 Artificial Analysis 的智能指数上拿了 61 分,比上代高了 5 分,和 GPT-5.6 Sol 打平,只比 Claude Opus 5(63 分)和 Claude Fable 5(62 分)低一点。它最亮眼的是智能体任务:在模拟真实知识工作的 GDPval-AA v2 测试里 Elo 分达到 1753,仅次于 ...
8月12日
- AI HOT 精选精选xAI 发布 Grok 4.6,重点强化了让模型长时间自主干活的能力
Grok 4.6 在 Grok 4.5 的基础上,专门训练了模型处理长链条任务的能力,比如做研究、分析信息、跨代码库工作,或者把一个想法直接做成能用的应用。在 AA 智能指数这个综合跑分上,它和 GPT-5.6 Sol 打平,都是 61 分;在 DeepSWE 1.1 这个软件工程测试里,分数从 4.5 的 54% 跳到了 65.9%。xAI 说,任务...