跳到正文
热点事件历史事件

xAI发布Grok 4.6,在智能体任务上领先同级模型

2 篇报道2 个报道来源2026-08-13更新

先了解这件事

报道摘要

Grok 4.6 在 Grok 4.5 的基础上,专门训练了模型处理长链条任务的能力,比如做研究、分析信息、跨代码库工作,或者把一个想法直接做成能用的应用。在 AA 智能指数这个综合跑分上,它和 GPT-5.6 Sol 打平,都是 61 分;在 DeepSWE 1.1 这个软件工程测试里,分数从 4.5 的 54% 跳到了 65.9%。xAI 说,任务...

摘自 AI HOT 精选

报道时间线

沿着报道,了解事件的不同侧面。

8月13日
  1. Hacker News 首页精选
    Grok 4.6 追平 GPT-5.6 Sol,靠更低成本在智能体任务上领跑

    Grok 4.6 在 Artificial Analysis 的智能指数上拿了 61 分,比上代高了 5 分,和 GPT-5.6 Sol 打平,只比 Claude Opus 5(63 分)和 Claude Fable 5(62 分)低一点。它最亮眼的是智能体任务:在模拟真实知识工作的 GDPval-AA v2 测试里 Elo 分达到 1753,仅次于 ...

8月12日
  1. AI HOT 精选精选
    xAI 发布 Grok 4.6,重点强化了让模型长时间自主干活的能力

    Grok 4.6 在 Grok 4.5 的基础上,专门训练了模型处理长链条任务的能力,比如做研究、分析信息、跨代码库工作,或者把一个想法直接做成能用的应用。在 AA 智能指数这个综合跑分上,它和 GPT-5.6 Sol 打平,都是 61 分;在 DeepSWE 1.1 这个软件工程测试里,分数从 4.5 的 54% 跳到了 65.9%。xAI 说,任务...