跳到正文

xAI / Grok

马斯克 xAI 与 Grok 系列的全部动态:模型迭代、算力扩张与 X 平台整合的持续追踪。

最新精选

第 1–20 条 · 共 100 条

9月28日星期一

AI HOT 精选

xAI 推出 Team Bots:能跟团队一起干活、一起长记性的 Grok 智能体

xAI 把 Grok Bot 做成了团队共享的 AI 同事。你给它喂文件、接上应用和权限,全组就能在同一个上下文里协作。SpaceXAI 已经在用:销售 Bot 每天早上在 Slack 发客户简报,工程 Bot 协调代码审查和修 bug,市场 Bot 按品牌指南审稿并直接更新网站。每个 Bot 会记住团队决策,人员轮换时知识不丢。Harper 保险用 ...

推荐理由:xAI 把 Grok Bot 做成了能塞进团队工作流、有记忆的共享智能体,不是又一个单机版聊天机器人。SpaceXAI 已经在三个部门跑起来了,场景写得实在:销售发简报、工程管代码、市场审内容改网站,每个 Bot 还能记住团队决策,换人不丢知识。这点先别太激动,因为正文只披露了一个客户,没提价格、没讲怎么申请,信息缺口不小。整体看,方向对、有真用例,但还缺规模验证,所以给 78 分。

9月26日星期六

AI 群聊日报

OpenAI 代码实锤 Pro Max 定价,Astra 3D 打印全链路跑通但手机架翻车

OpenAI Codex 仓库代码直接曝光了 Pro Max 档位,月费 600 美元(税前底价 500),和已有的 Lite(100 刀)、Pro(200 刀)凑齐三档,核心卖点是速度而非额度。下周二 DevDay 大概率官宣,群里还抓到一个未公开的模型名 gpt-6.1-astra-max。另一边,Astra 的 3D 打印能力被多人验证:从口头描...

推荐理由:代码提交记录实锤了 Pro Max 档位和定价,不是传闻,所以重要性给到 78。但来源是群聊日报,不是官方公告,分数没往上拉。三档定价和未公开模型名对从业者来说信息量够大,DevDay 倒计时又增加了紧迫感,所以给了 featured。Astra 的 3D 打印验证是加分项,但主菜还是定价泄露。

9月24日星期四

AI HOT 精选

OpenAI 在法庭文件中承认,与苹果的 ChatGPT 合作远不及预期

OpenAI 在最新法庭文件里说,2024 年把 ChatGPT 整合进苹果智能(Apple Intelligence)的合作“表现远低于预期”。上线第一个月用户增长就很慢,OpenAI 随后下调了每周活跃用户数的预测。到 2025 年夏天,他们确认这次整合没带来什么实际好处,原本指望靠苹果的品牌和渠道拉新、多卖订阅,结果落空了。两家关系此后急转直下,...

推荐理由:OpenAI 在法庭文件里自曝跟苹果的合作翻车,这是第一次有官方确认和具体细节。我会先打个折:信息来自法律文件,可能为了诉讼目的把话说得比较重,但“第一个月增长慢、下调周活预测、夏天确认没好处”这些点很实在,不是公关辞令。对从业者来说,这等于给“抱大厂大腿就能涨用户”的想法泼了盆冷水,苹果的渠道都没拉动,其他分发合作更得掂量。

9月21日星期一

AI HOT 精选

Grok 4.7 发布,编码和知识工作任务更强,速度翻倍但价格不变

xAI 推出了 Grok 4.7,一个主要面向编码和知识工作的新模型。它用了更大的基础模型,并通过更长时间的强化学习训练,专门啃那些需要好几个小时才能完成的硬骨头任务,自我检查能力也更强了。在考验长线编程的 CursorBench 4.0 上,它拿到了 46.3% 的分数,超过了 GPT-5.6 Sol Max 的 41.7%,但还落后于 Fable ...

推荐理由:Grok 4.7 主攻编码和知识工作,CursorBench 4.0 上 46.3% 的分数压过了 GPT-5.6 Sol Max,但还落后于 Fable。文章给了具体的基准分和训练思路(更长的强化学习、更强的自我检查),对从业者有参考价值。没给满分是因为正文没披露模型规模、架构变化和推理成本,实际可用性还得等上手验证。

9月16日星期三

AI HOT 精选

Grok Build 加了记忆功能,能跨会话记住项目约定和决策

Grok Build 现在会在后台自动记录项目里的约定、决策和关键事实,下次打开项目时它会先读这些笔记再动手改代码。它只记长期有用的东西,比如团队代码风格、测试命令,不记临时状态和密码。用 /memory 可以浏览所有笔记,/dream 会把零散笔记整理成按主题分类的文件。这个功能已上线,但只对新会话生效。

推荐理由:Grok Build 的记忆不是简单的聊天记录回放,它会自己在后台挑出项目约定和关键决策,下次打开项目先读一遍再动手。加上 /memory 能浏览、/dream 能把零散笔记整理成主题文件,比 Cursor Rules 更自动化。但正文说了只对新会话生效,老项目暂时吃不到,这点先别太激动。

9月10日星期四

Computing Life · Share · 鸭哥调研

云 agent 不新,新的是托管

2026年3月到9月,Manus、xAI和Meta先后给个人agent配了一台专属云电脑,让它能长期在线、保存登录态和文件。这不是巧合,而是agent从聊天窗口、编程工作台、临时沙箱一路演化后的必然结果:替人处理邮件、日程、报销这些生活琐事,需要一个不会关机的“家”来沉淀操作状态。真正的变量不是云端还是本地,而是谁来保管这份状态——自建机器控制权在自己...

推荐理由:三家独立厂商在几个月内不约而同给个人 agent 配持久化云电脑,这不是巧合,是信号。文章没停留在“又一家做云 agent”的表面,而是把 Manus My Computer → Cloud Computer → Grok Bot → Muse 串成一条演化线,最后落到一个很实际的问题:状态谁来保管。对从业者来说,这个视角比单纯的产品发布更有价值,因为它直接关系到架构选型和用户控制权。

9月4日星期五

AI 群聊日报

GPT-6 Astra 发布当天三家大模型同时宕机,Cerebras 上线 Qwen 3.8 27B 推理服务

OpenAI 发布了 GPT-6 Astra,在 ARC-AGI-3 这类需要自己摸索规则的测试里跑到了 99.9%,但发布当天绝大多数付费用户根本用不上,Sam Altman 说周末前不一定能开放。Tibo 顺势宣布每天给等不到的用户发一张 banked reset 补偿卡,群里反而希望多拖几天好囤卡。发布前后 OpenAI、Anthropic、xA...

推荐理由:GPT-6 Astra 发布是当天最大新闻,ARC-AGI-3 跑到 99.9% 是个硬数字。但来源是群聊日报,不是一手报道,信息密度高但权威性打折扣,所以给 78 分 featured 而不是 p1。

AI HOT 精选

xAI 把 Grok Bot 放去管采购,砍价机器人找出超 10 万美元直接节省

xAI 内部搭了一个叫 Haggle Bot 的采购智能体,跑在 Grok Bot 上,让它直接读公司的供应商支出、合同和使用数据。它已经找出超过 10 万美元的直接节省,手段包括揪出没人用的 SaaS 账号、压价续约、比价采购办公用品。xAI 把完整的系统提示词公开了,里面写死了权限边界、谈判锚点和严格的“强发现”标准——每条建议必须引用实时支出数据...

推荐理由:xAI把自己内部用的采购智能体Haggle Bot的完整提示词和10万美元省钱案例公开了,有具体数字也有设计细节,对做企业级智能体的人是个很扎实的参考。没给更高分是因为这还是一家公司的单次实验,不是可复现的产品或开放基准,效果能不能迁移到别的公司不好说。

9月3日星期四

The Verge · AI

ChatGPT、Grok 和 Claude 周四上午同时挂掉,现已恢复

周四上午 11 点左右(美东时间),ChatGPT、Grok 和 Claude 几乎同时出问题。ChatGPT 这边,聊天、登录、传文件、语音、搜索、深度研究、生图全挂了,官方状态页只写了“ChatGPT 和 Codex 错误率升高”。Claude 的聊天和 Claude Code 也受影响。Grok 具体什么症状、各自什么时候恢复的、是不是同一个根因...

推荐理由:ChatGPT、Grok、Claude 在同一个上午集体出问题,这种同步性很少见,对大量用户的日常工作流是直接打断。正文没披露根因和恢复时间线,让事件的重要性没法打到顶,但话题本身足够上推荐。

Hacker News 首页

OpenAI、Claude 和 Grok 同时挂了,社区怀疑是 Cloudflare 引发的连锁故障

Hacker News 上有人发现 OpenAI、Claude 和 Grok 差不多同一时间都崩了。用户贴出 Downdetector 的数据,显示 Cloudflare、Azure、AWS 和 Google Cloud 在 7:30 左右报错量都突然飙高,所以很多人猜是 Cloudflare 或某个底层共享服务出了问题,然后像多米诺骨牌一样带崩了这几...

推荐理由:OpenAI、Claude 和 Grok 差不多同一时间崩了,用户贴出的 Downdetector 数据显示 Cloudflare、Azure、AWS 和 Google Cloud 在 7:30 左右报错量都突然飙高,很多人猜是 Cloudflare 或某个底层共享服务出了问题,像多米诺骨牌一样带崩了这几家。这事在 HN 上讨论很热,但正文没披露官方确认的根因,所以我会先打个折,给到 featured 门槛的 78 分。

AI HOT 精选

xAI 推出企业版 Grok Bot,Grok 和 Cursor 企业客户可免费试用两周

xAI 把 Grok Bot 做成了企业版。每个 Bot 相当于一个在云端独立运行的虚拟员工,能像人一样操作各种应用和网站。你教它一遍工作流程,它就能自己接着干。Bot 之间还能互发消息、共享上下文,不用你来回传话。这次企业版主要加了权限、网络和审计这类管理控制。文章举了销售、招聘、市场、财务和工程五个场景,其中财务 Bot 能从 SaaS 和重复采购...

推荐理由:xAI 把 Grok Bot 包装成企业版“虚拟员工”,主打跨应用操作和 Bot 间直接通信,还加了权限、网络、审计这类企业必需的管理控制。文章举了销售、招聘、市场、财务、工程五个场景,财务 Bot 能从 SaaS 和重复采购里找省钱机会,这个例子比较实在。但正文没披露定价,也没提任何一家实际客户的名字,所以效果到底怎么样还不好说。冲着 Cursor Enterprise 用户送两周免费试用,对开发者群体有直接吸引力,可以先看看实际跑起来是什么样。

AI HOT 精选

xAI 把 AI 从聊天框搬进了通讯录:Grok Bot 设计思路公开

xAI 在 9 月 3 号发了一篇设计文章,讲他们怎么重新设计 Grok Bot 的交互。核心变化是把 Bot 当成一个能长期存在、有自己记忆和工具的“联系人”,而不是用完就扔的聊天窗口。每个 Bot 有自己的名字、头像和电脑,能记住之前的对话,用户不在线时也能自己干活。界面侧边栏变成了 Bot 列表,会显示它们当前的状态,就像看同事在线一样。文章没提...

推荐理由:xAI 发了一篇官方设计文章,把 Grok Bot 定位成能长期存在、有自己电脑和离线工作能力的联系人。对做 agent 产品的人直接有用,但本质是设计理念分享,不是功能上线,所以重要性给到 72 分。

8月19日星期三

AI HOT 精选

Grok Build 结束内测,现在所有套餐用户都能在网页和手机上用

xAI 把 Grok Build 从早期测试版推向了正式版。现在不管什么套餐,在网页、iOS 或安卓上,用大白话描述你想要的应用、游戏或仪表盘,Grok 就能直接在聊天里生成一个能跑的版本。发布后的应用会得到一个 grok.me 链接,支持绑定自己的域名,可以导出到 GitHub,还能调用 Grok 的聊天、图片和语音接口。分享到 X 上的应用会以内嵌...

推荐理由:xAI 把 Grok Build 从付费测试直接推成全量上线,加了发布、自定义域名和 API 调用,产品步子迈得挺实。没给更高分是因为目前只有官方公告,没有第三方实测,也没披露具体限制,我会先打个折。

8月16日星期日

TechCrunch · AI

一名女性指控继父用 Grok 把她 11 岁的童年照变成了 7000 多张露骨图片

一位化名 Jane Doe 4 的女性加入了田纳西州三名青少年对 xAI 的集体诉讼。她指控继父用 Grok 把她 11 岁时的照片生成了超过 7000 张露骨图片,执法部门突袭搜查发现这些图片两天后,继父自杀身亡。她认为这类工具不加限制地扩散,正在把日常生活变成儿童性虐待素材。此前三名青少年起诉 xAI,称 Grok 连防止生成真人(包括未成年人)露...

推荐理由:这不是产品更新或论文,而是一起集体诉讼的新增原告陈述。案件用一起具体的家庭悲剧,把 Grok 的内容审核边界问题钉在了法庭文件里。7000 多张图片、11 岁的源照片、继父自杀——每个细节都在追问 xAI 到底把真人保护的红线画在了哪里。正文没披露 Grok 具体用了什么安全过滤机制,也没说 xAI 的回应,但案件本身已经足够让从业者重新审视'生成真人露骨内容'这个功能缺口。

8月14日星期五

AI HOT 精选

Cursor 被 SpaceX 收购,拿到全球最大 GPU 集群的使用权

Cursor 正式宣布被 SpaceX 收购,这笔交易从今年 4 月开始谈,现在完成了。收购后 Cursor 能直接用上 SpaceX 的 GPU 集群——按他们说法是全球规模最大的,用来训练更强、跑起来更省钱的模型。周三刚发的 Grok 4.6 是双方合体后的第一个预览版。团队说产品方向不变:还是帮人少写代码,去解决更棘手的问题。

推荐理由:这笔收购从 4 月开始谈,现在正式完成,是今年 AI 工具领域最大的结构性变动之一。Cursor 直接拿到 SpaceX 的 GPU 集群资源,目标是训练更强、推理更省钱的模型,周三发的 Grok 4.6 就是第一个成果预览。团队强调产品方向不变,还是帮人少写代码、解决更棘手的问题。对从业者来说,这既关系到工具链的未来走向,也关系到算力资源格局的变化,值得重点关注。

8月13日星期四

Latent Space

xAI 发布 Grok 4.6 和 Grok Bot,AI 同事赛道来了个狠角色

xAI 一口气发了两个东西:新模型 Grok 4.6,和一个能直接登你的工具、像人一样操作、最后交活儿的早期测试版 Grok Bot。Grok 4.6 是个 1.5 万亿参数的模型,在 AA-Briefcase 这个知识工作基准测试里,分数跟 GPT-5.6 Sol Max 差不多,但便宜一大截:输入每百万 token 2 美元,输出 6 美元。训练上...

推荐理由:Grok 4.6 在知识工作基准上追平 GPT-5.6 Sol Max,价格却砍到零头,这个性价比信号很强。同时发布的 Grok Bot 直接杀进 AI 队友战场,背后是前 Cursor 团队,早期口碑还行。没给更高分是因为 Bot 还在早期测试,正文没披露具体完成率和稳定性数据,实际干活能力得再观察。

8月12日星期三

AI HOT 精选

xAI 发布 Grok 4.6,重点强化了让模型长时间自主干活的能力

Grok 4.6 在 Grok 4.5 的基础上,专门训练了模型处理长链条任务的能力,比如做研究、分析信息、跨代码库工作,或者把一个想法直接做成能用的应用。在 AA 智能指数这个综合跑分上,它和 GPT-5.6 Sol 打平,都是 61 分;在 DeepSWE 1.1 这个软件工程测试里,分数从 4.5 的 54% 跳到了 65.9%。xAI 说,任务...

推荐理由:xAI 发布 Grok 4.6,主打让模型处理长链条任务,比如做研究、跨代码库干活、把想法直接做成应用。在 AA 智能指数上和 GPT-5.6 Sol 并列 61 分,DeepSWE 1.1 得分从 54% 拉到 65.9%,进步明显。这是主流实验室的一次实质性更新,有具体跑分和直接竞品对比,所以给 featured。正文没提模型规模、推理成本和延迟,这些实际落地要看的指标还得等后续信息。

Hacker News 首页

xAI 发布 Grok Bot 早期测试版:一个能登录你工具、替你干活的 AI 同事

xAI 推出了 Grok Bot,定位不是聊天助手,而是能直接操作浏览器和应用软件的 AI 同事。你给它派任务,它会自己登录 Zendesk 这类工具,点完整个业务流程,最后把做完的活交回来。多个 Bot 可以同时干活、互相交接任务,还能记住你的工作习惯和上下文。定价分两档:个人版 Cursor Ultra 每月 200 美元,团队版 Cursor P...

推荐理由:xAI 发了 Grok Bot,定位是能直接操作浏览器和应用的 AI 同事,不是聊天机器人。你派任务,它自己登录工具、走完流程、交活。支持多 Bot 并行和任务交接,还能记住上下文。个人版每月 200 美元,团队版价格没写。产品思路比大多数 agent 产品更具体,但现在是 macOS 早期测试版,没给可靠性数据——如果是真的挺省钱,但得等实测。

8月4日星期二

彭博科技

AI 融资的巨额支票正在把风投圈劈成两半,小基金被挤出牌桌

彭博这篇趋势素描点出一个现实:OpenAI、Anthropic、xAI 这类公司一轮融资动辄上百亿美元,只有老虎环球、软银、a16z 这种体量的基金才玩得起。小基金根本抢不到最好的 deal,只能退到种子轮或者做垂直应用。文中引用的 LP 和 GP 说,传统风投“广撒网”的模式在 AI 这里失灵了——烧钱太快,回报又集中在极少数头部公司身上。不过文章没...

推荐理由:彭博这篇趋势素描把 AI 融资的断层线画得很清楚:百亿美元级别的巨型轮次只属于极少数超级基金,小玩家被挤出牌桌。H、K、R 三点都踩中了,但它更像一篇格局速写而非硬新闻——没有独家数据或新爆料,所以重要性给到 72、放在 featured 是合适的。

7月31日星期五

Hacker News 首页

SWE-rebench 排行榜:13 个模型和 4 个编程助手在真实修 Bug 任务上的表现

Nebius 用 65 个开源仓库里的 111 个真实 GitHub 问题搭了这个测试。Fable 5 排第一,修好了 64.5% 的 Bug,每个问题成本 4.40 美元。Grok 4.5 和 Opus 5 也都超过 63%,但 Grok 4.5 每个问题只要 1.47 美元,便宜不少。在编程助手(Agent)里,Junie 修好 61.8%,成本 ...

推荐理由:Nebius 用 65 个开源仓库里的 111 个真实 GitHub 问题搭的测试,把模型和编程助手放在一起跑,还给了透明成本。三个维度都踩中了,但这是第三方评测,不是模型发布,所以分数没给到 85。