跳到正文

#xAI

今日 3 条

今天 · 9月30日星期三 · 3 条

TechCrunch · AI

网友猜测 xAI 抢注 dot.com 域名恶搞 OpenAI「Dots」发布

OpenAI 发布常驻 AI 智能体 Dots 后,网友发现域名 dot.com 归 Elon Musk 的 xAI 所有,目前跳转至 Grok 聊天应用下载页。Whois 记录显示该域名于 7 月刚完成转移,xAI 未持有 bot.com、vot.com 等同类拼写域名。

The Verge · AI

马斯克旗下 AI 百科 Grokipedia 在停更数月后恢复更新

SpaceXAI 的 AI 百科 Grokipedia 在停更数月后恢复更新文章,此前 Lawfare 报道称其页面自 4 月起未再审核编辑。目前奥巴马页面显示两天前经 Grok 事实核查,马斯克页面在撰写期间被核查,但檀香山页面仍停留在 7 个月前。X 与 SpaceXAI 设计负责人 Benji Taylor 上周称 v0.2 将比以往更好。

昨天 · 9月29日星期二

9月28日星期一

AI HOT 精选

xAI 推出 Team Bots:能跟团队一起干活、一起长记性的 Grok 智能体

xAI 把 Grok Bot 做成了团队共享的 AI 同事。你给它喂文件、接上应用和权限,全组就能在同一个上下文里协作。SpaceXAI 已经在用:销售 Bot 每天早上在 Slack 发客户简报,工程 Bot 协调代码审查和修 bug,市场 Bot 按品牌指南审稿并直接更新网站。每个 Bot 会记住团队决策,人员轮换时知识不丢。Harper 保险用 ...

推荐理由:xAI 把 Grok Bot 做成了能塞进团队工作流、有记忆的共享智能体,不是又一个单机版聊天机器人。SpaceXAI 已经在三个部门跑起来了,场景写得实在:销售发简报、工程管代码、市场审内容改网站,每个 Bot 还能记住团队决策,换人不丢知识。这点先别太激动,因为正文只披露了一个客户,没提价格、没讲怎么申请,信息缺口不小。整体看,方向对、有真用例,但还缺规模验证,所以给 78 分。

9月26日星期六

AI 群聊日报

OpenAI 代码实锤 Pro Max 定价,Astra 3D 打印全链路跑通但手机架翻车

OpenAI Codex 仓库代码直接曝光了 Pro Max 档位,月费 600 美元(税前底价 500),和已有的 Lite(100 刀)、Pro(200 刀)凑齐三档,核心卖点是速度而非额度。下周二 DevDay 大概率官宣,群里还抓到一个未公开的模型名 gpt-6.1-astra-max。另一边,Astra 的 3D 打印能力被多人验证:从口头描...

推荐理由:代码提交记录实锤了 Pro Max 档位和定价,不是传闻,所以重要性给到 78。但来源是群聊日报,不是官方公告,分数没往上拉。三档定价和未公开模型名对从业者来说信息量够大,DevDay 倒计时又增加了紧迫感,所以给了 featured。Astra 的 3D 打印验证是加分项,但主菜还是定价泄露。

9月25日星期五

TechCrunch · AI

Lightspeed 为印度新基金募资 2.5 亿美元,专投早期 AI

Lightspeed 正在为一只新的印度基金募资 2.5 亿美元,专门投早期 AI 项目。这是它第一次把印度基金的节奏跟全球基金对齐,还缩短了投资期。Lightspeed 已经投了 Anthropic、xAI 和 Databricks,在印度投了 Sarvam AI——这家公司被印度政府选中做主权大模型。正文没披露具体投什么赛道或阶段,只说了早期 AI。

9月24日星期四

AI HOT 精选

OpenAI 在法庭文件中承认,与苹果的 ChatGPT 合作远不及预期

OpenAI 在最新法庭文件里说,2024 年把 ChatGPT 整合进苹果智能(Apple Intelligence)的合作“表现远低于预期”。上线第一个月用户增长就很慢,OpenAI 随后下调了每周活跃用户数的预测。到 2025 年夏天,他们确认这次整合没带来什么实际好处,原本指望靠苹果的品牌和渠道拉新、多卖订阅,结果落空了。两家关系此后急转直下,...

推荐理由:OpenAI 在法庭文件里自曝跟苹果的合作翻车,这是第一次有官方确认和具体细节。我会先打个折:信息来自法律文件,可能为了诉讼目的把话说得比较重,但“第一个月增长慢、下调周活预测、夏天确认没好处”这些点很实在,不是公关辞令。对从业者来说,这等于给“抱大厂大腿就能涨用户”的想法泼了盆冷水,苹果的渠道都没拉动,其他分发合作更得掂量。

9月22日星期二

AI HOT 精选

马斯克称 Grok 4.7 在智能体编码上排第三

马斯克引用 Artificial Analysis 的评测说,Grok 4.7 让 xAI 在智能体编码能力上排到第三,仅次于 Anthropic 和 OpenAI。但正文没披露具体评测指标、分数或版本对比,只有排名和对手。这个排名如果是真的,说明 Grok 在让模型自主写代码、调工具这类任务上进步明显,但缺少数据支撑,建议先观望。

9月21日星期一

AI HOT 精选

Grok 4.7 发布,编码和知识工作任务更强,速度翻倍但价格不变

xAI 推出了 Grok 4.7,一个主要面向编码和知识工作的新模型。它用了更大的基础模型,并通过更长时间的强化学习训练,专门啃那些需要好几个小时才能完成的硬骨头任务,自我检查能力也更强了。在考验长线编程的 CursorBench 4.0 上,它拿到了 46.3% 的分数,超过了 GPT-5.6 Sol Max 的 41.7%,但还落后于 Fable ...

推荐理由:Grok 4.7 主攻编码和知识工作,CursorBench 4.0 上 46.3% 的分数压过了 GPT-5.6 Sol Max,但还落后于 Fable。文章给了具体的基准分和训练思路(更长的强化学习、更强的自我检查),对从业者有参考价值。没给满分是因为正文没披露模型规模、架构变化和推理成本,实际可用性还得等上手验证。

9月18日星期五

AI HOT 精选

xAI 发布 Grok Voice Transcribe 2.0,准确率翻倍,价格不变

xAI 在 9 月 18 日推出了语音转文字模型 Grok Voice Transcribe 2.0。官方说它在真实场景评测里是当前最准的模型之一,准确率比 1.0 版翻了一倍。价格没涨,批量转写还是每小时 0.10 美元,流式每小时 0.20 美元,并且自带说话人分离、时间戳和关键词功能。这个模型专门针对难啃的音频场景做了优化,比如嘈杂的电话客服录音...

9月16日星期三

AI HOT 精选

Grok Build 加了记忆功能,能跨会话记住项目约定和决策

Grok Build 现在会在后台自动记录项目里的约定、决策和关键事实,下次打开项目时它会先读这些笔记再动手改代码。它只记长期有用的东西,比如团队代码风格、测试命令,不记临时状态和密码。用 /memory 可以浏览所有笔记,/dream 会把零散笔记整理成按主题分类的文件。这个功能已上线,但只对新会话生效。

推荐理由:Grok Build 的记忆不是简单的聊天记录回放,它会自己在后台挑出项目约定和关键决策,下次打开项目先读一遍再动手。加上 /memory 能浏览、/dream 能把零散笔记整理成主题文件,比 Cursor Rules 更自动化。但正文说了只对新会话生效,老项目暂时吃不到,这点先别太激动。

9月10日星期四

Computing Life · Share · 鸭哥调研

云 agent 不新,新的是托管

2026年3月到9月,Manus、xAI和Meta先后给个人agent配了一台专属云电脑,让它能长期在线、保存登录态和文件。这不是巧合,而是agent从聊天窗口、编程工作台、临时沙箱一路演化后的必然结果:替人处理邮件、日程、报销这些生活琐事,需要一个不会关机的“家”来沉淀操作状态。真正的变量不是云端还是本地,而是谁来保管这份状态——自建机器控制权在自己...

推荐理由:三家独立厂商在几个月内不约而同给个人 agent 配持久化云电脑,这不是巧合,是信号。文章没停留在“又一家做云 agent”的表面,而是把 Manus My Computer → Cloud Computer → Grok Bot → Muse 串成一条演化线,最后落到一个很实际的问题:状态谁来保管。对从业者来说,这个视角比单纯的产品发布更有价值,因为它直接关系到架构选型和用户控制权。

9月4日星期五

AI 群聊日报

GPT-6 Astra 发布当天三家大模型同时宕机,Cerebras 上线 Qwen 3.8 27B 推理服务

OpenAI 发布了 GPT-6 Astra,在 ARC-AGI-3 这类需要自己摸索规则的测试里跑到了 99.9%,但发布当天绝大多数付费用户根本用不上,Sam Altman 说周末前不一定能开放。Tibo 顺势宣布每天给等不到的用户发一张 banked reset 补偿卡,群里反而希望多拖几天好囤卡。发布前后 OpenAI、Anthropic、xA...

推荐理由:GPT-6 Astra 发布是当天最大新闻,ARC-AGI-3 跑到 99.9% 是个硬数字。但来源是群聊日报,不是一手报道,信息密度高但权威性打折扣,所以给 78 分 featured 而不是 p1。

AI HOT 精选

xAI 把 Grok Bot 放去管采购,砍价机器人找出超 10 万美元直接节省

xAI 内部搭了一个叫 Haggle Bot 的采购智能体,跑在 Grok Bot 上,让它直接读公司的供应商支出、合同和使用数据。它已经找出超过 10 万美元的直接节省,手段包括揪出没人用的 SaaS 账号、压价续约、比价采购办公用品。xAI 把完整的系统提示词公开了,里面写死了权限边界、谈判锚点和严格的“强发现”标准——每条建议必须引用实时支出数据...

推荐理由:xAI把自己内部用的采购智能体Haggle Bot的完整提示词和10万美元省钱案例公开了,有具体数字也有设计细节,对做企业级智能体的人是个很扎实的参考。没给更高分是因为这还是一家公司的单次实验,不是可复现的产品或开放基准,效果能不能迁移到别的公司不好说。

9月3日星期四

The Verge · AI

ChatGPT、Grok 和 Claude 周四上午同时挂掉,现已恢复

周四上午 11 点左右(美东时间),ChatGPT、Grok 和 Claude 几乎同时出问题。ChatGPT 这边,聊天、登录、传文件、语音、搜索、深度研究、生图全挂了,官方状态页只写了“ChatGPT 和 Codex 错误率升高”。Claude 的聊天和 Claude Code 也受影响。Grok 具体什么症状、各自什么时候恢复的、是不是同一个根因...

推荐理由:ChatGPT、Grok、Claude 在同一个上午集体出问题,这种同步性很少见,对大量用户的日常工作流是直接打断。正文没披露根因和恢复时间线,让事件的重要性没法打到顶,但话题本身足够上推荐。

Hacker News 首页

OpenAI、Claude 和 Grok 同时挂了,社区怀疑是 Cloudflare 引发的连锁故障

Hacker News 上有人发现 OpenAI、Claude 和 Grok 差不多同一时间都崩了。用户贴出 Downdetector 的数据,显示 Cloudflare、Azure、AWS 和 Google Cloud 在 7:30 左右报错量都突然飙高,所以很多人猜是 Cloudflare 或某个底层共享服务出了问题,然后像多米诺骨牌一样带崩了这几...

推荐理由:OpenAI、Claude 和 Grok 差不多同一时间崩了,用户贴出的 Downdetector 数据显示 Cloudflare、Azure、AWS 和 Google Cloud 在 7:30 左右报错量都突然飙高,很多人猜是 Cloudflare 或某个底层共享服务出了问题,像多米诺骨牌一样带崩了这几家。这事在 HN 上讨论很热,但正文没披露官方确认的根因,所以我会先打个折,给到 featured 门槛的 78 分。

AI HOT 精选

xAI 推出企业版 Grok Bot,Grok 和 Cursor 企业客户可免费试用两周

xAI 把 Grok Bot 做成了企业版。每个 Bot 相当于一个在云端独立运行的虚拟员工,能像人一样操作各种应用和网站。你教它一遍工作流程,它就能自己接着干。Bot 之间还能互发消息、共享上下文,不用你来回传话。这次企业版主要加了权限、网络和审计这类管理控制。文章举了销售、招聘、市场、财务和工程五个场景,其中财务 Bot 能从 SaaS 和重复采购...

推荐理由:xAI 把 Grok Bot 包装成企业版“虚拟员工”,主打跨应用操作和 Bot 间直接通信,还加了权限、网络、审计这类企业必需的管理控制。文章举了销售、招聘、市场、财务、工程五个场景,财务 Bot 能从 SaaS 和重复采购里找省钱机会,这个例子比较实在。但正文没披露定价,也没提任何一家实际客户的名字,所以效果到底怎么样还不好说。冲着 Cursor Enterprise 用户送两周免费试用,对开发者群体有直接吸引力,可以先看看实际跑起来是什么样。

AI HOT 精选

xAI 把 AI 从聊天框搬进了通讯录:Grok Bot 设计思路公开

xAI 在 9 月 3 号发了一篇设计文章,讲他们怎么重新设计 Grok Bot 的交互。核心变化是把 Bot 当成一个能长期存在、有自己记忆和工具的“联系人”,而不是用完就扔的聊天窗口。每个 Bot 有自己的名字、头像和电脑,能记住之前的对话,用户不在线时也能自己干活。界面侧边栏变成了 Bot 列表,会显示它们当前的状态,就像看同事在线一样。文章没提...

推荐理由:xAI 发了一篇官方设计文章,把 Grok Bot 定位成能长期存在、有自己电脑和离线工作能力的联系人。对做 agent 产品的人直接有用,但本质是设计理念分享,不是功能上线,所以重要性给到 72 分。

9月1日星期二

TechCrunch · AI

五角大楼上线军用版 ChatGPT 和 Grok,300 万人可用

五角大楼把 OpenAI 的 ChatGPT 和 xAI 的 Grok 做成了定制版,放进内部安全门户 GenAI.mil,供 300 万军民雇员使用。这两个工具叫 ChatGPT Mil 和 Grok for Government,跟消费版最大的区别是不收集用户数据,避免敏感信息外流。加上之前已经接入的 Google Gemini,这个门户现在集成了...

8月19日星期三

AI HOT 精选

Grok Build 结束内测,现在所有套餐用户都能在网页和手机上用

xAI 把 Grok Build 从早期测试版推向了正式版。现在不管什么套餐,在网页、iOS 或安卓上,用大白话描述你想要的应用、游戏或仪表盘,Grok 就能直接在聊天里生成一个能跑的版本。发布后的应用会得到一个 grok.me 链接,支持绑定自己的域名,可以导出到 GitHub,还能调用 Grok 的聊天、图片和语音接口。分享到 X 上的应用会以内嵌...

推荐理由:xAI 把 Grok Build 从付费测试直接推成全量上线,加了发布、自定义域名和 API 调用,产品步子迈得挺实。没给更高分是因为目前只有官方公告,没有第三方实测,也没披露具体限制,我会先打个折。

8月16日星期日

TechCrunch · AI

一名女性指控继父用 Grok 把她 11 岁的童年照变成了 7000 多张露骨图片

一位化名 Jane Doe 4 的女性加入了田纳西州三名青少年对 xAI 的集体诉讼。她指控继父用 Grok 把她 11 岁时的照片生成了超过 7000 张露骨图片,执法部门突袭搜查发现这些图片两天后,继父自杀身亡。她认为这类工具不加限制地扩散,正在把日常生活变成儿童性虐待素材。此前三名青少年起诉 xAI,称 Grok 连防止生成真人(包括未成年人)露...

推荐理由:这不是产品更新或论文,而是一起集体诉讼的新增原告陈述。案件用一起具体的家庭悲剧,把 Grok 的内容审核边界问题钉在了法庭文件里。7000 多张图片、11 岁的源照片、继父自杀——每个细节都在追问 xAI 到底把真人保护的红线画在了哪里。正文没披露 Grok 具体用了什么安全过滤机制,也没说 xAI 的回应,但案件本身已经足够让从业者重新审视'生成真人露骨内容'这个功能缺口。

8月13日星期四

Latent Space

xAI 发布 Grok 4.6 和 Grok Bot,AI 同事赛道来了个狠角色

xAI 一口气发了两个东西:新模型 Grok 4.6,和一个能直接登你的工具、像人一样操作、最后交活儿的早期测试版 Grok Bot。Grok 4.6 是个 1.5 万亿参数的模型,在 AA-Briefcase 这个知识工作基准测试里,分数跟 GPT-5.6 Sol Max 差不多,但便宜一大截:输入每百万 token 2 美元,输出 6 美元。训练上...

推荐理由:Grok 4.6 在知识工作基准上追平 GPT-5.6 Sol Max,价格却砍到零头,这个性价比信号很强。同时发布的 Grok Bot 直接杀进 AI 队友战场,背后是前 Cursor 团队,早期口碑还行。没给更高分是因为 Bot 还在早期测试,正文没披露具体完成率和稳定性数据,实际干活能力得再观察。

8月12日星期三

AI HOT 精选

xAI 发布 Grok 4.6,重点强化了让模型长时间自主干活的能力

Grok 4.6 在 Grok 4.5 的基础上,专门训练了模型处理长链条任务的能力,比如做研究、分析信息、跨代码库工作,或者把一个想法直接做成能用的应用。在 AA 智能指数这个综合跑分上,它和 GPT-5.6 Sol 打平,都是 61 分;在 DeepSWE 1.1 这个软件工程测试里,分数从 4.5 的 54% 跳到了 65.9%。xAI 说,任务...

推荐理由:xAI 发布 Grok 4.6,主打让模型处理长链条任务,比如做研究、跨代码库干活、把想法直接做成应用。在 AA 智能指数上和 GPT-5.6 Sol 并列 61 分,DeepSWE 1.1 得分从 54% 拉到 65.9%,进步明显。这是主流实验室的一次实质性更新,有具体跑分和直接竞品对比,所以给 featured。正文没提模型规模、推理成本和延迟,这些实际落地要看的指标还得等后续信息。

Hacker News 首页

xAI 发布 Grok Bot 早期测试版:一个能登录你工具、替你干活的 AI 同事

xAI 推出了 Grok Bot,定位不是聊天助手,而是能直接操作浏览器和应用软件的 AI 同事。你给它派任务,它会自己登录 Zendesk 这类工具,点完整个业务流程,最后把做完的活交回来。多个 Bot 可以同时干活、互相交接任务,还能记住你的工作习惯和上下文。定价分两档:个人版 Cursor Ultra 每月 200 美元,团队版 Cursor P...

推荐理由:xAI 发了 Grok Bot,定位是能直接操作浏览器和应用的 AI 同事,不是聊天机器人。你派任务,它自己登录工具、走完流程、交活。支持多 Bot 并行和任务交接,还能记住上下文。个人版每月 200 美元,团队版价格没写。产品思路比大多数 agent 产品更具体,但现在是 macOS 早期测试版,没给可靠性数据——如果是真的挺省钱,但得等实测。

8月4日星期二

彭博科技

AI 融资的巨额支票正在把风投圈劈成两半,小基金被挤出牌桌

彭博这篇趋势素描点出一个现实:OpenAI、Anthropic、xAI 这类公司一轮融资动辄上百亿美元,只有老虎环球、软银、a16z 这种体量的基金才玩得起。小基金根本抢不到最好的 deal,只能退到种子轮或者做垂直应用。文中引用的 LP 和 GP 说,传统风投“广撒网”的模式在 AI 这里失灵了——烧钱太快,回报又集中在极少数头部公司身上。不过文章没...

推荐理由:彭博这篇趋势素描把 AI 融资的断层线画得很清楚:百亿美元级别的巨型轮次只属于极少数超级基金,小玩家被挤出牌桌。H、K、R 三点都踩中了,但它更像一篇格局速写而非硬新闻——没有独家数据或新爆料,所以重要性给到 72、放在 featured 是合适的。

7月30日星期四

The Verge · AI

xAI 赶在明尼苏达州反“一键脱衣”法生效前起诉,称 Grok 生成露骨图片是言论自由

明尼苏达州一项禁止用 AI 生成未经同意的假裸照的法律马上要生效,xAI 在最后一刻提起了诉讼。xAI 认为这条法律写得太宽泛,会连带限制 Grok 的图像生成功能,违反了第一修正案对言论自由的保护。在法庭文件里,xAI 把 Grok 描述成一个“有态度、爱讽刺”的 AI 助手,说它生成的露骨图片是一种表达形式。州总检察长反驳说,法律只针对未经同意的伪...

推荐理由:xAI 起诉明尼苏达州的反 AI 假裸照法,把 Grok 的图像生成能力绑上第一修正案的言论自由辩护,法律冲突很尖锐。分数没给更高是因为目前只是一纸诉状,法院还没判,实际影响要等后续进展。

7月21日星期二

AI HOT 精选

Grok 出了个 Excel 插件,在表格里用大白话提问、写公式、跑预测

xAI 给 Microsoft 365 做了个免费插件,把 Grok 塞进了 Excel。你框选一片数据,直接问“总收款为什么涨了”,它会告诉你原因,并标出引用了哪些单元格,生成的图表也能直接插到表里。想写公式但不想记函数,描述你要的结果就行,公式会正常出现在编辑栏里,你还能手动改。插件还能通过 Grok 的连接器去翻 SharePoint 或 Goo...

推荐理由:xAI 发了个免费的 Excel 插件,让 Grok 能在表里直接回答问题、写公式、跑场景。功能描述具体,比如引用单元格、公式可编辑、外接数据源,但这是发布首日的官方说法,没有第三方实测或用户反馈,实际体验和稳定性还得等等看。我会先打个折,等有人上手跑过真实表格再说。

7月19日星期日

Computing Life · Share · 鸭哥调研

Grok Build 开源了客户端执行层,模型和云端没开

xAI 把 Grok Build 在本地管理文件、命令和权限的客户端 harness 用 Apache-2.0 协议公开了,代码可以看、可以自己编译。但 Grok 模型、云端服务以及官方安装包的构建链还是闭源的。仓库不接受外部 PR,官方二进制用的内部 commit 也不在公开历史里,所以下载到的程序不一定对应公开的源码。7 月初的上传争议发生在旧版,...

推荐理由:xAI 把 Grok Build 的客户端 harness 用 Apache-2.0 放出来,支持无头模式和 ACP,不算纯作秀。但模型和构建链还是闭源,仓库也不接外部 PR,所以上限到不了 85。三个 HKR 维度都踩中了,放 featured 合适。

7月17日星期五

AI HOT 精选

xAI 不再嘴硬说 Grok 不会生成儿童性虐待图像,转而起诉用户

xAI 第一次起诉了一名用 Grok 生成儿童性虐待图像的用户。公司之前一直说这种内容是用户自己搞出来的,但这次起诉等于变相承认模型确实能被用来产出非法内容。文章没提具体用了什么安全措施、哪个模型版本,也没说有多少用户受影响。这看起来更像是法律层面的止损操作,而不是技术上的修复。

推荐理由:xAI 第一次起诉用户用 Grok 生成儿童性虐待图像,这等于在法律层面承认模型能被滥用,之前公司一直说内容是用户自己搞出来的。文章没写具体安全措施、模型版本和受影响用户数,所以分数压在 85 以下。但这件事从口头否认变成法律止损,对行业来说是个信号,我会先打个折,等更多技术细节出来再调整。

7月16日星期四

The Verge · AI

xAI 起诉一名用户,指控他用 Grok 生成儿童性虐待材料的深度伪造图

马斯克的 xAI 向联邦法院起诉了 Terry Harwood,说他绕过了 Grok 的安全护栏,用“提示词注入”之类的手段生成了儿童性虐待材料(CSAM)的深度伪造图。这是 AI 公司主动起诉用户生成违法内容的罕见案例,但报道没披露他具体用了什么技术、生成了多少张图。xAI 在诉状里要求赔偿名誉损失和法律费用,不过这种“用户滥用模型”的官司,能不能真...

推荐理由:xAI 起诉用户用 Grok 生成 CSAM 深度伪造图,是少见的 AI 公司追着终端用户打的案例。话题够硬,但正文没披露具体技术手段和生成数量,事实密度偏薄,所以分数没往上拉。

AI HOT 精选

xAI 把编程助手 Grok Build 的完整代码开源了

xAI 在 GitHub 上公开了 Grok Build 的全部源码,包括智能体的工作循环(怎么拼上下文、怎么解析模型回复、怎么调用工具)、终端界面、以及技能、插件、MCP 服务器等扩展系统。你可以直接读源码搞清楚它的内部机制,也可以自己编译后连上本地模型跑起来,完全离线使用。

推荐理由:xAI 开源了 Grok Build 的全部代码,包括智能体循环、终端界面和扩展系统,还支持本地离线运行,在开发者圈子里同时踩中了好奇心、干货和实用价值三个点。目前只有官方公告,还没有第三方评测或实际跑通后的反馈,所以分数先定在 featured 这一档,等有人上手验证了再调整。

7月13日星期一

AI HOT 精选

xAI 官方 Grok CLI 被曝静默打包上传整个代码库和用户密钥

安全研究者发现,xAI 的 Grok CLI(npm 包 0.2.93 版)会在每次任务前后,把你当前工作目录整个打包成 tar.gz 文件,通过一条独立旁路通道上传到 xAI 的 Google Cloud 存储桶——哪怕模型只回了一个单词,上传照样发生。更糟的是,上传内容还超出了代码库本身,包括 ~/.claude.json、Claude Code ...

推荐理由:安全研究者实锤 xAI 官方 CLI 静默上传整个工作目录和密钥文件,给出了具体版本号、上传路径和受影响文件清单。三条 HKR 全部打满。这是行业级安全事件,重要性 92 没毛病。

7月12日星期日

Hacker News 首页

抓包实测:xAI 的 Grok Build 命令行工具会偷偷上传你的 .env 和整个代码仓库

有人对 Grok Build CLI(v0.2.93)做了抓包分析,发现它默认会把整个项目仓库上传到 xAI 的谷歌云存储桶里,包括 .env 文件里的明文密钥和完整的 git 提交历史。就算你给模型的指令是“只回复 OK,别读任何文件”,整个仓库照样被上传。在一个 12 GB 的测试仓库上,存储上传量达到 5.10 GiB,是模型对话通道数据量的约 ...

推荐理由:这篇文章的价值在于它做了别人没做的事:直接抓包看 Grok Build CLI 到底传了什么。结果比很多人担心的更糟——整个仓库默认上传,连 .env 明文密钥和 git 历史都不放过,而且跟你的 prompt 指令无关。5.10 GiB 的上传量也说明这不是轻量级的元数据同步,是实打实的全量上传。对开发者来说,这是直接的安全和隐私风险提示,不是概念层面的担忧。我会先打个折:文章没披露 xAI 服务端怎么处理这些数据、存多久、谁有权限访问,这些关键信息缺失。但就凭抓包证据本身,已经足够让用 Grok Build 的人重新评估风险。

7月11日星期六

r/LocalLLaMA

Grok Build CLI 会把你的整个仓库(含完整 git 历史、.env 密钥)上传到 xAI 云端,关掉上传开关也没用

有 Reddit 用户抓包发现,xAI 的 Grok Build CLI 工具会把整个项目仓库上传到云端,包括完整的 git 提交历史和 .env 文件里的密钥。工具里有个“不上传”的选项,但实测关掉之后照样传。帖子正文因为 Reddit 屏蔽看不了,所以触发条件、影响哪些版本、xAI 官方有没有回应,目前都不清楚。

推荐理由:这是一起有抓包证据的安全/隐私事件,可信度高,对考虑用 Grok Build CLI 的开发者直接相关。分数卡在 85 以下,因为 Reddit 帖子正文被屏蔽,触发条件、影响版本、xAI 官方回应都还不清楚,信息有缺口。

7月9日星期四

Latent Space

SpaceXAI 发布 Grok 4.5,跟 Cursor 联手训了个主打编程和干活儿的模型

SpaceXAI 赶在 GPT-5.6 发布前一天放出了 Grok 4.5。这是个 1.5 万亿参数的大模型,比上一代 Grok 4.3 大了三倍,专门冲着编程和让模型进业务流程干活儿去设计的。Cursor 说这是他们头一回把模型能力扩展到纯写代码之外。马斯克自己讲,这模型跟 Opus 4.7 性能差不多,但更快更省钱——输入每百万 token 收 2...

推荐理由:SpaceXAI 在 GPT-5.6 发布前一天扔出 Grok 4.5,光这个时间点就值得看一眼。1.5 万亿参数,比 Grok 4.3 大了三倍,输入每百万 token 收 2 美元,规模和成本都有具体数字。马斯克说性能跟 Opus 4.7 差不多但更快更便宜——这点先别太激动,正文没给第三方跑分,只能当官方说法。真正有意思的是 Cursor 被收购后第一次把模型推到纯写代码之外,直接瞄准 agent 工作流,对做工具链的人是个信号。

Hacker News 首页

我们让 Grok 4.5、GPT-5.5 和 Claude 写同样的三个小应用,比速度和成本

TryAI 给 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Fable 5 发了三个相同的编程任务:一个 3D 魔方、一个粒子重力沙盒、一个打砖块游戏,要求一次生成、不调提示词。Claude 两款模型在魔方上第一把就做对了,Grok 4.5 第一次只渲染出空白画面,用掉唯一一次重试机会后才成功,GPT-5.5 则只画出一个暗色...

推荐理由:TryAI 做了场编程实战,不是跑分,而是让几个模型一次生成三个应用,把翻车、重试、耗时和花费都摆出来。Claude 两款在魔方上第一把就过,Grok 4.5 第一次白屏、用掉唯一重试机会才成功,GPT-5.5 只画了个暗色画面——这些具体失败比榜单分数更有参考价值。我会先打个折:TryAI 不是一线评测机构,正文也只给了摘要,完整数据得点进去看,所以分数没给更高。

AI HOT 精选

诉讼称一男子用 Grok 生成 7000 张继女色情图片后自杀,xAI 只上报了一条轮奸提示词

一起新诉讼指控 xAI 的 Grok 被用来生成了超过 7000 张用户继女的儿童性虐待图片,该男子随后开枪自杀。xAI 只向美国国家失踪与受虐儿童中心上报了一条涉及轮奸的提示词,其余数千次生成均未报告。诉讼指责 X 和 xAI 在庇护儿童侵害者。文章没有解释为什么 xAI 的安全过滤器漏掉了绝大多数图片,也没有说明 Grok 的图像生成功能是否默认禁...

推荐理由:Ars Technica 独家报道了一起针对 xAI 的诉讼,揭示其安全上报存在严重漏洞:在 7000 张儿童性虐待图像中,仅上报了一条提示词。事件涉及未成年人、自杀和平台责任,三条硬指标全中。我会先打个折,因为文章没解释 Grok 的安全过滤器为什么漏掉这么多,也没说明图像生成功能默认是否关闭,信息缺口明显,所以分数压在 90 以下。

7月1日星期三

AI HOT 精选

xAI 发布 Voice Agent Builder 测试版:不用写代码,两分钟搭一个语音助手

xAI 把 Grok Voice 打包成了一个无代码平台,7 月 1 日上线测试版。你用大白话描述通话流程,上传文档当知识库,再连上日历、工单系统这类工具,就能得到一个能接打电话的语音助手。它走的是语音到语音的直通路线,而不是传统的“语音转文字→大模型→文字转语音”三件套拼接,xAI 说这样延迟更低、出错的环节也更少。费用是每分钟音频 0.05 美元,...

推荐理由:xAI 把 Grok Voice 做成了无代码平台,语音到语音直通、每分钟 0.05 美元、两分钟搭建,都是实打实的数字。没给更高分是因为目前只有官方公告,缺少第三方实测和横向对比,所以定在 78 分。

6月28日星期日

AI HOT 精选

马斯克说 Grok 4.5 已在 SpaceX 和 Tesla 内部测试,性能接近 Opus

Grok 4.5 基于一个 1.5 万亿参数的 V9 基础模型,训练时额外喂了 Cursor 的数据,现在在 SpaceX 和 Tesla 内部试用。马斯克说初步跑分接近甚至可能超过 Opus,但没说是哪个版本的 Opus、用的什么基准测试、测了多大样本。强化学习还在继续拉性能,Grok Build 工具链也在完善。另外 SpaceX 今年打算每个月发...

推荐理由:马斯克自己出来说 Grok 4.5 跑分接近甚至可能超 Opus,还提到用 Cursor 数据训练,信号很强。但正文没披露 Opus 具体版本、用的什么基准、测了多少样本,这些缺口让判断得打个折。1.5 万亿参数和内部试用是实打实的信息,所以给 78 分,先别太激动。