跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 961–980 条 · 共 1,551 条

5月22日星期五

AI HOT 精选

OpenAI Codex 的 /goal 模式转正了,现在可以给 AI 派跨小时甚至跨天的长任务

OpenAI 把 Codex 里的 /goal 模式从实验功能升级成了稳定版。你可以在 Codex 应用、IDE 插件或命令行里用,设定好里程碑后,AI 会自己跑任务,持续几小时甚至几天。中间能随时查看进度、改方向或暂停。用之前要升级应用并打开这个功能(命令行或手动改配置文件都行),开启后在输入框就能管理任务,侧边对话可以看进度,不会打断主任务。正文没...

推荐理由:我会先打个折:文章只说了功能转正和多端支持,但没披露任务失败怎么恢复、资源消耗上限、以及哪些套餐能用。对想试的人,知道它能跑长任务就够了;对想上线用的人,信息缺口还很大。所以放在 featured 低段,等后续补上安全和成本细节再往上调。

Computing Life · Share · 鸭哥调研

OpenAI 的通用推理模型推翻了一个 80 年没人撼动的数学猜想

GPT-5 否证了 Erdős 在 1946 年提出的平面单位距离猜想。这个猜想说平面上 n 个点最多只能有约 n 对距离为 1 的点,80 年里数学家都信这个。模型没走证明路线,而是直接构造反例,用上了代数数论里跟几何八竿子打不着的工具,把单位距离对的数量推到了 n 的 1.014 次方。Fields 奖得主 Tim Gowers 审完证明说,如果是...

推荐理由:我会先打个折,因为正文没给论文、没给证明过程、也没说复现条件,信息缺口不小。但一个没专门练过数学的通用模型,推翻了一个 80 年没人动得了的 Erdős 猜想,还有 Fields 奖得主背书说能投顶刊——这个事实本身分量很重,属于当天就该推的消息。HKR 三项全中,重要性给 90 是合理的,再高就需要更多证据了。

AI HOT 精选

ChatGPT 开始能在 PowerPoint 里直接做 PPT 了,目前还在测试

ChatGPT 正在测试一项新功能:你可以直接在 PowerPoint 里让它帮你建、改、理解、优化幻灯片,做出来的页面还能继续手动编辑。官方只发了这条推文,没提收费方式、推送范围,也没说什么时候正式上线。如果是真的,以后做 PPT 能省不少事,但正文没披露具体支持哪些功能、会不会出错,这点先别太激动。

推荐理由:OpenAI 让 ChatGPT 在 PowerPoint 里直接建和改可编辑的幻灯片,不是只吐文字或图片。正文没提价格、开放范围和企业管控细节,所以先放 featured 而不是 P1。

AI HOT 精选

Codex 现在能远程操控锁屏的 Mac,手机就能指挥它干活

OpenAI 开发者账号发帖说,Codex 可以在 Mac 锁屏、屏幕关闭的情况下,通过手机安全地使用 Mac 上的应用。帖子没提权限边界、怎么收费、什么时候上线,我会先打个折——正文只给了一个文档链接,具体怎么实现“安全”也没展开。

推荐理由:HKR 三项全中:OpenAI Devs 给出了 Codex 操控 Mac 的具体条件,但正文没披露权限边界、价格和发布时间,所以重要性停在 82 分,没上 85+。我会先打个折——这个功能听起来很省事,但没讲清楚锁屏下到底能碰哪些文件、会不会被滥用,这点先别太激动。

彭博科技

SpaceX 向纳斯达克提交 IPO 申请,OpenAI 最快本周五跟上

Bloomberg 报道,SpaceX 已正式申请在纳斯达克上市,并在路演材料里画了一个 28.5 万亿美元的大饼,把业务从 AI 一路讲到了火星。同一天的消息还说,OpenAI 也在准备 IPO 文件,最快周五就会提交。视频本身是 Bloomberg 的每日科技节目,没有放出完整的招股书细节,所以估值、发行价和具体时间表都还没公开。

推荐理由:Bloomberg 这条稿子把 SpaceX 和 OpenAI 的 IPO 进度绑在一起报,信息密度很高。SpaceX 那边给了个 28.5 万亿美元的投资者叙事,数字很大,但正文没展开算这笔账的细节,我会先打个折看。OpenAI 这边最值钱的是“最快周五交表”这个时间点,比之前模糊的传闻进了一步,不过估值、募资规模、具体承销商这些关键信息都没披露,所以重要性到不了 90 以上。两条消息都是 Bloomberg 独家,来源可信,对关注 AI 和科技股的人有直接参考价值。

5月21日星期四

MIT Technology Review · AI

Anthropic 在伦敦办了一场开发者大会,近半数人举手说上周刚发过完全由 Claude 写的代码,而且很多人没看就直接上线了

Anthropic 在伦敦的 Code with Claude 大会上展示了一个趋势:开发者越来越愿意把写代码的活直接交给 AI。工程师 Jeremy Hadfield 在现场问谁上周发过完全由 Claude 写的 pull request(提交审核的代码改动),近一半人举手;再问谁没读代码就直接发了,大部分手还举着。Anthropic 说公司内部大部...

推荐理由:这篇 MIT Tech Review 的现场报道不是产品发布稿,但抓到了一个很实的信号:开发者已经在把 Claude 写的代码直接往仓库里合,而且不少人连看都不看。我会先打个折,这个数字来自活动现场举手统计,样本量和代表性都有限,不能直接推成行业常态。但“近一半”这个比例还是够高,说明在重度用户里,对 AI 代码的信任已经跨过了一道心理门槛。文章没给 PR 的复杂度或后续回滚率,这点信息缺口让判断只能停在“行为在发生”而不是“行为没问题”。整体适合放进 featured,因为它比功能更新更能让人停下来想一下自己的工作流。

The Verge · AI

马斯克告奥特曼:一场热闹,啥也没捞着

这案子表面上是马斯克指控 OpenAI 从非营利转营利时,糟蹋了他捐的钱,违反了慈善信托。实际上,更像是马斯克对奥特曼憋着一股火,想让他吃点苦头。陪审团最后认定马斯克起诉时已经过了诉讼时效,案子就这么结了。法庭内外都乱成一锅粥,有人偷拍被法官训斥,有人录音被赶出去,门口天天有抗议。庭审里最让人意外的是,OpenAI 前高管 Mira Murati 的声...

推荐理由:HKR 三项都踩中了:Musk 和 Altman 的恩怨有话题性,陪审团给出“诉讼时效已过”这个具体裁定,背后又是非营利转营利的治理老问题。不过正文对赔偿和后续法律动作都没提,事实偏薄,所以放在 featured 低位,没给到 78 分以上。

新智元 · 公众号

Anthropic 买下 SDK 工具商 Stainless,OpenAI 等客户得自己维护代码库了

Anthropic 把 Stainless 给收购了。Stainless 是一家专门帮公司自动生成和维护 API 的 SDK(软件开发工具包)的公司,OpenAI、Meta、Cloudflare 之前都是它的客户。收购之后,Stainless 会关掉它的托管产品,也不再给老客户提供后续支持。不过,之前已经生成的 SDK 代码所有权还归客户自己,只是后续...

推荐理由:我会先打个折:这不是模型发布或核心能力更新,所以分数不会顶满。但 Anthropic 这手挺狠,Stainless 是给 API 自动生成 SDK 的,全球据说四分之一开发者都在用,客户包括 OpenAI 和 Meta。收购后 Anthropic 直接要把托管产品关停,等于断了竞争对手一条现成的开发者工具链。正文没披露收购金额和具体关停时间表,但光是“断供 OpenAI”这个动作,就够让依赖这套工具的团队紧张一阵了。

Latent Space

OpenAI 用通用推理模型花不到 1000 美元,推翻了一个 80 年前的数学猜想

OpenAI 公布了一个内部通用推理模型(外界猜是 GPT 5.6)的成果:它找到了平面单位距离问题的新构造族,推翻了 1946 年 Erdős 提出的一个猜想。这个模型不是专门为数学训练的,就是普通的语言模型,但推理过程生成了约 125 页的总结。有外部观察者推测,这次运行只用了不到 32 小时,成本不到 1000 美元。数学家 Timothy Go...

推荐理由:HKR 三项都成立:一个内部推理模型声称驳倒了 1946 年的 Erdős 问题,输出约 125 页,这是很强的能力信号。不过成本和运行时间目前还是外部推测,正文没披露 OpenAI 自己的官方数字,所以分数没给到 95。

机器之心 · 公众号

智谱在千卡集群部署 ZCube,同样 GPU 推理吞吐提升超 15%

智谱把自研的 ZCube 通信方案用到了 GLM-5.1 的线上推理集群里,规模是千卡级别。它替换了原来的 ROFT 组网方式,但没动 GPU、软件栈和业务代码。效果上,吞吐量提升了超过 15%,首 token 延迟的 P99 下降了 40.6%,交换机加光模块的成本省了三分之一。正文没披露具体是怎么做到省硬件成本的,也没给更细的测试条件,所以这个 1...

推荐理由:智谱在 GLM-5.1 千卡推理集群上部署 ZCube,不增 GPU、不改代码就把吞吐提了 15%,首 token 延迟的 P99 降了 40.6%。这是纯工程层面的组网逻辑改动,不是模型能力升级,所以重要性给 81、放在 featured 里比较合适——对搞推理部署的人有用,但不会像新模型发布那样震动整个行业。

Hacker News 首页

OpenAI 最快本周五秘密提交 IPO 申请

CNBC 从消息人士处获悉,OpenAI 准备最早在本周五向 SEC 秘密递交招股书草稿。目前公开信息里没有估值、发行规模和上市时间表,Hacker News 上也只有 41 个赞和 2 条评论,讨论热度不算高。秘密提交意味着我们暂时看不到财务数据,也没法判断它到底能卖多少钱。

推荐理由:这条消息就一句话:OpenAI 可能最早周五秘密交表。我会先打个折——正文只有 CNBC 链接和 HN 上 41 分、2 条评论,没给出估值、募资额或上市时间,信息很薄。但“最早周五”这个时间点把事件拉到了眼前,对关注融资和股权的人冲击力够强,所以还是放在 P1。

AI HOT 精选

OpenAI 模型自己解了一道 80 年没搞定的平面几何题,用的还是数学家觉得走不通的路

OpenAI 的一个模型独立解决了 1946 年埃尔德什提出的“平面单位距离问题”。这道题近 80 年来大家一直觉得最优解长得像方格子,但模型搬出了代数数论里比较冷门的 Golod-Shafarevich 理论,找到了一整族效率更高的新构造,把老结论推翻了。这是 AI 头一回自己搞定一个数学核心开放问题,关键就在于它提出并完整执行了一条人类因为直觉上觉...

推荐理由:我会先打个折:目前只有一段摘要,没给模型名、没论文链接、没复现细节,也没第三方验证,所以别急着当定论。好消息是它把问题说得很具体——1946 年平面单位距离问题,还用 Golod-Shafarevich 理论给了一族更高效率的构造,说明不是随便蒙对的。对做推理方向的团队来说,这至少是个强信号,但正文没披露用了多少算力、有没有人工提示工程介入,这点先别太激动。

FT · 科技

Anthropic 快要有第一个赚钱的季度了

FT 的付费墙把具体数字全挡住了,正文没披露是哪个季度、营收多少、利润多少、按什么会计准则算的。标题说 Anthropic 即将实现首次季度盈利,比 OpenAI 和 xAI 都早一步。但看不到细节,这点先别太激动——不知道是运营利润还是算上了投资收益,也不知道收入是靠 API 调用还是靠企业大单撑起来的。

推荐理由:我会先打个折:正文只说了“有望”,没披露是哪个季度、赚了多少、营收规模多大,所以这更像一个方向性信号而不是实锤。但信号本身够尖锐——Anthropic 如果真比 OpenAI 和 xAI 先盈利,说明它在企业客户和 API 收入上可能跑得更务实,烧钱换规模的节奏也可能更克制。这点先别太激动,等具体财报出来再看是运营利润还是调整后的数字。

AI HOT 精选

OpenAI 最快本周五提交 IPO 招股书草案,目标 9 月上市

OpenAI 准备正式冲刺上市了。据 CNBC 消息,公司最快本周五就会向监管提交 IPO 招股书草案,CEO 奥特曼把上市时间定在了 2026 年 9 月。这次找的是高盛和摩根士丹利来操盘,都是科技公司上市的老手。之前马斯克的诉讼一度让上市计划悬着,现在官司输了,障碍暂时没了,节奏明显加快。OpenAI 目前在私募市场的估值超过 8500 亿美元,如...

推荐理由:我会先打个折:目前还是单一信源说的“预计提交”,不是已经公开的招股书,所以别当板上钉钉。但这条消息本身值得写——OpenAI 把上市时间表压到今年 9 月,估值顶着 8500 亿美元往上走,说明他们急着用公开市场解决算力和人才成本。正文没披露具体营收或盈利数据,也没说承销团除了高盛还有谁,这些缺口后面得盯着。

r/LocalLLaMA

HalBench 基准测试:用 3200 个带坑问题测了 4 个头部模型,看谁更会拒绝瞎编

一位开发者自己搭了个叫 HalBench 的测试,专门看模型在遇到“前提本身是错的”的问题时,是会顺着瞎编(谄媚)还是直接指出问题。他拿 3200 个这种带坑提示词跑了 4 个模型:Sonnet 4.6 平均分 0.565 排第一,最敢反驳;Gemini 3.1 Pro 0.339 垫底,更容易顺着错误前提往下编。分数越高,代表模型越能识别出问题里的假...

推荐理由:HKR 三项都成立:HalBench 有个清晰的定制评测钩子,3200 条提示加分数,话题踩在模型信任和安全评测的痛点上。来源只有 Reddit 一个帖子,基准本身也没经过外部验证,所以放在低 featured 档。

TechCrunch · AI

OpenAI 说这次真解决了一个 80 年的数学难题

OpenAI 声称他们的新推理模型推翻了一个自 1946 年悬而未决的几何猜想。七个月前他们刚因为类似宣称翻过车——当时说 GPT-5 解决了 10 个未解难题,结果被扒出只是找到了文献里已有的答案,前副总裁 Kevin Weil 只好删帖。这次不一样的地方在于,上次揭穿他们的数学家这回站到了 OpenAI 这边。不过正文没披露模型名字、证明细节和验证...

推荐理由:HKR 三项全中:OpenAI 加一个 80 年历史的几何猜想,是个可验证的硬核推理声明。但正文没给模型名、没给证明细节、也没说怎么验证的,所以先别太激动,暂时到不了 P1。

TechCrunch · AI

OpenAI 重启 IPO 筹备,最快可能在 9 月上市

马斯克起诉 OpenAI 的官司刚输掉一天,OpenAI 就重新启动了上市准备。据华尔街日报的消息源,CEO Sam Altman 希望公司能在 9 月前达到上市状态,目前已经在跟高盛和摩根士丹利合作,可能几天或几周内就会秘密提交 IPO 申请文件。不过,这篇报道没披露估值、承销商名单和具体的上市时间表。另外,SpaceX 的 IPO 文件也快公开了,...

推荐理由:我会先打个折:标题说最早 9 月 IPO,但正文没披露估值、承销商或招股书时间表,所以这更像一个推进信号,还不是板上钉钉的上市公告。不过,消息在马斯克败诉后一天恢复推进,时间点很微妙,能让人联想到 OpenAI 在治理和资本化上的紧迫感。对从业者来说,这关系到 OpenAI 的钱袋子、公司控制权以及整个前沿模型赛道的烧钱节奏,所以值得关注。

FT · 科技

OpenAI 准备提交 IPO 申请,最快 9 月上市,目标估值 1 万亿美元

FT 这篇报道的正文被付费墙和安全验证挡住了,只拿到了标题和摘要。已知信息是:OpenAI 正在准备 IPO 文件,最快今年 9 月挂牌,目标估值冲到 1 万亿美元。承销商名单里有高盛、摩根士丹利和 Cooley 律所。但具体的发行条款、上市交易所、财务数据这些关键信息,正文没披露——或者说我们拿不到。1 万亿这个数字我先打个折看,毕竟现在连 S-1 ...

推荐理由:我会先打个折:1 万亿估值目标听着很吓人,但正文没披露这个数字是怎么算出来的,也没说收入、利润或用户增长的具体支撑,这点先别太激动。不过,FT 的报道把时间点、承销商和律所都点出来了,信息颗粒度够细,不是捕风捉影。一家基础模型公司走到 IPO 提交这一步,本身就是行业顶格的信号,所以重要性给到 95 没问题。

AI HOT 精选

ChatGPT 手机版接入 Codex,手机上问一半,回到电脑能接着聊

OpenAI Devs 发帖说 ChatGPT 移动端现在支持 Codex,你可以在手机 App 里提问,之后在桌面端继续同一个对话。帖子没提支持哪些平台、需要哪个 App 版本,也没说是不是逐步推送。

推荐理由:OpenAI Devs 是官方渠道,消息可信,HKR 三项都踩中了。但正文只确认了移动端能用 Codex 和跨设备接续对话,具体支持哪些平台、版本号、推送范围全都没提,所以信息量刚好卡在 featured 门槛上,先别当全量上线看。

Hacker News 首页

OpenAI 准备在近期提交 IPO 申请,高盛和摩根士丹利正在帮忙起草招股书

WSJ 独家消息说,OpenAI 已经在跟高盛和摩根士丹利的银行家合作,准备在未来几天或几周内秘密提交 IPO 申请,最快可能是本周五。正文没披露估值、募资规模和具体上市时间表。目前能看到的公开信息只有 Hacker News 上 25 个点赞和 5 条评论,市场反应还很小。

推荐理由:WSJ 放出的消息说 OpenAI 准备提交 IPO,但正文只给了 25 分和 5 条 HN 评论,没披露估值、募资规模或时间表。我会先打个折:这还不是正式申请,只是准备阶段,信息缺口很大。如果是真的,对行业资金流向和公司治理结构影响不小,但眼下缺关键数字,没法判断到底多值钱、多急迫。这点先别太激动,等更多细节出来再调权重。