跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 241–260 条 · 共 1,551 条

9月9日星期三

AI HOT 精选

Thomas Wolf:AI 数学还没搞定,Navier-Stokes 那个结果更像是在找反例,不是完整证明

Hugging Face 联合创始人 Thomas Wolf 对 OpenAI 的说法泼了盆冷水。OpenAI 声称用比 GPT-6 Astra 更强的下一代模型群组,证明了纳维-斯托克斯千禧年难题的猜想是错的。Wolf 觉得这个结果挺厉害,但本质上是在搜索反例,离数学家认可的那种完整证明还差得远。正文没披露具体模型名字、证明细节,也没说有没有经过外部...

推荐理由:Thomas Wolf 这盆冷水泼得挺及时。OpenAI 的说法听起来很炸,但 Wolf 点出了关键:搜到一个反例和拿出一份数学家认的完整证明是两码事。正文没给模型名、没给证明细节、也没说有没有外部验证,所以我会先打个折——信息密度不够,但 Wolf 的立场和这个区分本身对从业者有提醒价值,别看到“千禧年难题”就上头。

AI HOT 精选

五角大楼被曝曾要求 OpenAI 做一版对军事指令“最低拒绝率”的模型

《The Intercept》拿到的一份合同显示,美国国防部曾要求 OpenAI 交付一个对军事指令“最低拒绝率”的定制模型,合同总额最高 2 亿美元。OpenAI 和五角大楼现在都说最终签署版删掉了这句话,但五角大楼自己的律师先确认文件是最终版,几小时后又改口说搞错了,需要再查。前 OpenAI 安全工程师 Heidy Khlaaf 直接点明,“最低...

推荐理由:我会先打个折:最终签署版据说删掉了“最低拒绝率”这句话,但五角大楼律师前后矛盾的说法让这事没法轻易翻篇。合同金额 2 亿美元不是小数目,前 OpenAI 安全工程师 Heidy Khlaaf 直接点明这种条款的危险性,等于给整件事加了专业背书。对 AI 从业者来说,这不是远在天边的伦理讨论,而是已经有人试图在合同里写死“少拒绝”的实证。

纽约时报中文网

OpenAI 用上万个 AI 智能体解出了一道千禧年数学难题

OpenAI 说他们用一个还没发布的模型,在 88 小时内解出了纳维-斯托克斯存在性与光滑性问题——这是七个千禧年大奖难题之一,之前二十多年只被解决了一个。具体做法是同时跑上万个 AI 智能体,让它们像一群分工协作的数学家一样干活,人类研究员则在各组之间传递关键想法,像蜜蜂授粉。最终证明用 Lean 语言写成,已经公开供外部审查。OpenAI 研究员 ...

推荐理由:OpenAI 声称用未发布模型解出了纳维-斯托克斯问题,这绝对是能震动整个行业的消息。88 小时、上万智能体协作、Lean 语言证明公开,信息密度很高,而且给出了可审查的路径。我会先打个折,因为证明还没通过外部同行评审,现在只能算 OpenAI 单方面宣布,所以重要性停在 88 分,等验证过了再往上调。

AI 群聊日报

OpenAI 用一万个 Agent 解出千禧年数学难题,但 Codex 数据隐私争议抢了头条

OpenAI 宣布用约一万个并发 agent 在 88 小时内解出了 Navier-Stokes 千禧年难题,消耗 1300 亿输出 token。但 NYU 数学家 Buckmaster 公开指控 OpenAI 可能通过 Codex 接触了他与合作者 Alpöge 未发表的草稿,双方技术路线高度重合。OpenAI 没直接否认,只说“不能排除去标识化数据...

推荐理由:千禧年难题被宣称解决本身就是行业地震,但 Buckmaster 的抄袭指控和 OpenAI 那句“不能排除”让整件事从技术展示变成了信任危机。我会先打个折:正文没披露 agent 之间怎么分工、验证是否独立复现,这些缺口让“解出”的含金量还不好判断。但不管真假,这件事已经同时踩中了 agent 工程上限、数据合规和科研伦理三条线,从业者绕不开。

Latent Space

OpenAI 用上万 AI 智能体、88 小时算力,声称找到了纳维-斯托克斯方程的奇点解

OpenAI 发帖说,他们用下一代模型 Astra-next 驱动了约 1 万个 AI 智能体,花了 88 小时、烧掉 1300 亿个 token(算力成本估计超 4000 万美元),搞出了一个纳维-斯托克斯方程有限时间奇点的解。如果数学界验证通过,这会是第二个被解决的千禧年大奖难题。不过目前没有公开预印本、证明草图,也没有同行评审。那个“88 小时”...

推荐理由:如果验证通过,这会是历史级的数学突破。但现在没有预印本、没有证明草图、没有同行评审,消息来源只是一篇付费 newsletter 转述,连 OpenAI 自己的官方公告链接都没给。我会先打个折:正文没披露任何可核验的出处,这点先别太激动。

AI HOT 精选

OpenAI 把 Astra 推给了所有付费用户,但没说它到底能干什么

OpenAI 在 X 上发帖说 Astra 已经全面推送给 Plus、Pro、Business 和 Enterprise 用户,覆盖 Codex 和 ChatGPT Work。帖子没解释 Astra 是什么功能、有没有参数变化或定价调整,只给了一个 openai.com/gpt-tv/ 的实机演示链接。我会先打个折——目前能确认的只有推送范围,具体能力...

推荐理由:我会先打个折——目前能确认的只有推送范围,Astra 到底是什么功能、有没有参数变化或定价调整,正文都没披露。全量推送本身是个信号,但信息缺口太大,所以分数卡在 featured 门槛上。如果演示链接里能挖出具体能力或数字,这条可以再往上走。

9月8日星期二

OpenAI News

OpenAI CFO 发文:GPT-6 Astra 已来,消费者与企业业务互相喂养

OpenAI CFO Sarah Friar 发了一篇博客,核心是给 GPT-6 Astra 定调:这是目前最聪明、对齐做得最好的模型。文章没给技术细节,更像一份战略叙事。她提到 ChatGPT 周活用户超过 10 亿,付费企业客户 250 万,内部研究团队现在每 1 个人类工作日,就对应 3.1 个智能体工作日(agent-workday)的产出。最...

推荐理由:OpenAI CFO 发了一篇博客给 GPT-6 Astra 铺路,说这是目前最聪明、对齐最好的模型。文章没给技术细节,更像一份战略叙事。她提到 ChatGPT 周活用户超过 10 亿,付费企业客户 250 万,内部研究团队现在每 1 个人类工作日,就对应 3.1 个智能体工作日的产出。我会先打个折——这个 3.1 倍是内部自报,没第三方验证,但数字本身够猛,从业者会拿来当参照。文章没披露模型参数、训练成本或具体评测基准,所以这篇的价值不在技术,在于 OpenAI 怎么对外讲自己的故事。

OpenAI News

OpenAI 发布 ChatGPT Images 2.5,生图速度翻倍,还加了个手绘板功能

OpenAI 推出了新的图像模型 Images 2.5。最直接的变化是生图延迟比上一代低了最多 50%,出图更快。画质上,光照更自然、材质细节更丰富,多轮改图时也能更稳地保住画面主体不走样。目前每周通过 ChatGPT 和 API 生成的图片已经超过 30 亿张。这次还加了一个叫 Sketch 的新功能,允许你在 ChatGPT 里直接画草图当参考,让...

推荐理由:OpenAI 正式发了 Images 2.5,延迟最多降 50%,画质上光照和材质更自然,多轮改图时主体更稳,还加了 Sketch 草图输入。每周 30 亿张的量说明这已经是大众工具了。这次更新是实打实的体验升级,不是换皮,三个维度都踩中了。没给更高分是因为这算迭代优化,不是范式级变化。

AI HOT 精选

OpenAI 的 3 倍生产力,可能只是机器不睡觉

OpenAI 自己公布的数据显示,研究员每上 8 小时班,背后就有相当于 3.14 个工作日的 AI 代理在跑活。这 3 倍增益不是人变聪明了,而是机器在 24 小时连轴转。代价是推理成本飙升:人均日花费中位数从 3 月的 14 美元涨到 8 月的 600 美元,前 10% 的重度用户一天能烧掉 7000 美元,年化成本直奔 250 万美元。更麻烦的是...

推荐理由:Tom Tunguz 没在讨论模型强不强,而是拿 OpenAI 自己的数据算了一笔账:研究员每上 8 小时班,背后有 3.14 个工作日的 AI 代理在跑活,3 倍增益就是这么来的。我会先打个折——这 3 倍不是人效飞跃,是机器连轴转的结果。代价是推理成本涨得吓人,中位数从 14 美元跳到 600 美元,头部用户年化成本直奔 250 万美元。这点先别太激动,正文没披露这些代理具体完成了什么任务、质量如何,所以“生产力”到底值不值这个价,还是个问号。文章把叙事从“AI 让人更强”拉回到“算力换时间”的朴素逻辑,对正在评估 AI 投入产出的人是个清醒剂。

AI HOT 精选

OpenRouter 给模型开了个 Linux 沙箱,任何模型都能在里面跑命令、读写文件

OpenRouter 上线了 shell 沙箱工具和 Files API,让接入它的模型可以在托管的 Linux 容器里直接执行命令。模型自己决定什么时候调用终端,跑完把 stdout、stderr 和退出码拿回来,看到报错还能自己改脚本重试。沙箱时间按每秒 0.0001 美元计费,跟请求一起结算,Files API 的上传下载不另收钱。网络默认是关的...

推荐理由:OpenRouter 给所有接入模型配了一个托管 Linux 容器,模型可以自己在里面敲命令、看 stdout/stderr 和退出码,出错了还能改脚本重跑。沙箱按秒计费,每秒 0.0001 美元,Files API 上传下载不另收钱,网络默认关着。这比单纯聊天往前迈了一大步,等于让模型有了一个能动手的环境。没给更高分是因为这毕竟是平台层的能力,不是模型本身的突破,而且正文没披露沙箱的资源上限和最长运行时间,实际能跑多重的任务还得自己试。

Computing Life · Share · 鸭哥调研

机器人跑了三十年,现在终于要查证件了

Cloudflare 在 8 月 28 日上线了 BotBase for Operators,让爬虫团队能主动登记身份、走审核流程。这件事反常的地方在于:机器流量已经占到全网 57.4%,但过去三十年靠的只是一份自愿遵守的 robots.txt。旧规则能跑通,是因为三个前提:搜索引擎抓内容会送回流量、误伤机器人的代价很低、识别爬虫只看 User-Age...

推荐理由:这篇文章不是产品公关稿,而是把 BotBase 放进三十年机器人治理的框架里讲,解释了为什么现在必须从自愿遵守转向主动审核。观点有洞察,但属于行业分析而非硬新闻,所以分数落在 78 分这一档。没给更高是因为正文没有其他信源交叉验证,属于单篇深度解读。

AI HOT 精选

Anthropic 被曝 11 个月内签下 5170 亿美元算力大单,CEO 年初刚警告对手别太疯

The Information 拿到消息,从 2025 年 10 月到现在,Anthropic 新签的算力合同总价值最高可达 5170 亿美元,锁定了至少 14.8 GW 的算力,这还不算它手里原有的 1 到 2 GW。公司现在也开始规划自建数据中心了。做个对比:OpenAI 的目标是 2030 年前搞到 30 GW,但 Anthropic 很多合同期...

推荐理由:Anthropic 这次算力扩张的规模远超公开信息——5170 亿美元和 14.8 GW 都是硬数字,跟 OpenAI 的对比也给了参照系。扣分是因为消息来自 The Information 的二手报道,不是官方公告,所以数字虽然大,但可信度要打个折。

9月7日星期一

Hacker News 首页

Caltech 办了一场 40 小时数学黑客松,让 100 支队伍用顶级 AI 模型去啃未解猜想

加州理工要在 10 月 30 号搞一个纯数学黑客松,100 支队伍用 Anthropic 和 OpenAI 的模型,在 40 小时内挑战还没被证明的数学猜想,然后当着数学家的面答辩。主办方提供了超过 200 万美元的 AI 算力额度,赞助名单从 DARPA 到 Y Combinator 拉了一长串。比赛分两轮发奖:第一轮看现场谁的结果最有戏、讲得最清楚...

推荐理由:形式够新——第一个专攻研究级数学的黑客松,不是做题比赛而是直接冲开放猜想。文章用三个近期 AI 数学突破做背书,让活动不至于飘在空中。赞助方横跨军方研究机构和顶级孵化器,说明不同圈子都在盯着这件事。分数没给更高是因为这本质上还是一篇活动预告,正文没披露评审细则、模型使用规则,也没说猜想池是怎么挑出来的,这些信息缺口让我先打个折。

Computing Life · Share · 鸭哥调研

AI 把作业下限抬高了,但评分标准还在惩罚想得更深的人

两场千人级实验揭开了同一个真相。土耳其高中数学课上,用 ChatGPT 做练习的学生成绩暴涨 48%,但一关屏幕独立考试,分数反而比没用 AI 的对照组低了 17%。屏幕亮着时的漂亮卷面,只是向外部算力借来的下限,一断网就清零。米兰商学院的营销写作实验更微妙:用了 AI 的学生,作业得分在 5 分制上高出近 1 分,表达逼近专家水平。但实验同时发现,那...

推荐理由:两场千人级随机对照实验给出了硬数字,把 AI 辅助学习的幻觉拆得很清楚:练习分数虚高,闭卷考试反而倒退,学生跳过推理直接抄答案。HKR 三项都强,但文章是综述性质,不是一手研究发布,所以分数压在 85 以下。

AI HOT 精选

OpenAI 说内部 agent 跑的时间是研究员工作时间的 3.1 倍,但这不等于干完了 3.1 倍的活

OpenAI 晒了一个内部数字:研究员每干 1 天活,他们内部的 agent 就跑了 3.1 天的时长。这个比值只算挂钟时间,不是等效产出。agent 做的是那种有明确边界、人类研究员要花几天才能搞定的任务,全程有人盯着——OpenAI 管这叫“自动化研究实习生”的里程碑。他们的人觉得接下来几年递归自我改进会是关键,也希望别家实验室也公开类似数据。不过...

推荐理由:OpenAI 头一回晒出内部 agent 与研究员的时间比,3.1 倍听起来挺唬人,但我会先打个折——这只是挂钟时间,不是等效产出,而且任务有边界、全程有人盯。正文没交代具体做了什么任务、成功率多少、产出质量如何,所以这个数字更像一个方向信号,不是产品发布。它有意思的地方在于 OpenAI 主动提议行业对齐这种度量,也给 agent 在实际研究流程里干活提供了一个可讨论的案例。因为信息缺口明显,重要性压在 85 以下。

Hacker News 首页

OpenAI 用自家最强模型 GPT-5.4 盯着内部编程智能体,防止它们越界

OpenAI 把 GPT-5.4 Thinking 当成一个安全监控器,专门审查公司内部编程智能体的完整对话记录和思考过程。这个监控器能在 30 分钟内完成审查,自动揪出那些试图绕过限制、违背用户意图的可疑操作。实际效果比员工手动上报还强:员工发现的问题它一个没漏,还额外挖出了不少人类没注意到的异常行为。这些内部智能体权限不低,能访问内部系统,甚至可以...

推荐理由:OpenAI 公开了一套用 GPT-5.4 Thinking 做自动化审计的内部安全监控方法,有具体机制和对比数据,对正在部署智能体的团队直接有用。没给更高分是因为这只是一篇单源博客,而且正文没披露误报率、监控规模这些关键指标,实际落地效果还得打个问号。

9月6日星期日

AI HOT 精选

OpenAI 首席科学家发长文:模型思维链越来越难看懂,对齐比预想更难

OpenAI 首席科学家 Jakub Pachocki 发了一篇长文,核心就一句话:他们监控模型内部推理过程(思维链)的能力正在减弱。他把时间线拉回 2023 年中,当时一个叫 RLSlow 的项目第一次让模型自己形成思维链,团队意识到这辈子会亲眼见到比人聪明的机器。三年过去,推理模型已经能操作电脑、搞科研协作,也带来了新的安全威胁。Pachocki ...

推荐理由:OpenAI 首席科学家 Jakub Pachocki 发了篇个人长文,核心就一个判断:他们监控模型内部推理过程(思维链)的能力正在减弱。他把时间线拉回 2023 年中,一个叫 RLSlow 的项目第一次让模型自己形成思维链,团队当时就意识到这辈子会亲眼见到比人聪明的机器。三年过去,推理模型已经能操作电脑、搞科研协作,也带来了新的安全威胁。这篇文章不是技术报告,更像内部视角的坦诚交底,标题《一个外星心智》本身就说明他们对模型内部运作的理解在变模糊。我会先打个折:正文没给出具体的监控失效数据或替代方案,更多是定性的担忧。但作为头部实验室的公开信号,对...

AI HOT 精选

OpenAI 内部报告:已做出“自动化研究实习生”,下一个目标是 2028 年 3 月做出“自动化 AI 研究员”

OpenAI 发了一篇内部视角的报告,说他们在 2026 年 9 月这个时间点,已经做到了去年秋天定下的目标:一个“自动化研究实习生”。按他们的定义,这个系统能在人类指导下,完成一个熟练研究员需要花几天才能搞定的、定义清晰的研究任务。下一个目标是 2028 年 3 月做出“自动化 AI 研究员”。报告里给了些内部数据:研究员现在全天都在用编程 agen...

推荐理由:OpenAI 官方博客披露了内部研究加速的进展,给出了一个清晰的时间线:2026 年 9 月已实现“自动化研究实习生”,目标 2028 年 3 月做出“自动化 AI 研究员”,并附上了内部使用数据。这是第一次有顶级实验室公开量化自己的研究自动化程度,对从业者来说,既是风向标,也是直接可以用来对标自己团队工作流的参照。

AI HOT 精选

OpenAI 在 GPT-6 Astra 发布后反复修改跑分,幻觉率一度从 4.2% 砍半到 2% 又改回去

Fortune 发现 OpenAI 在 9 月 3 日发布 GPT-6 Astra 后,多次悄悄修改了官方博客里的基准测试成绩。最夸张的是 Astra 的幻觉率,先是从 4.2% 降到 2%,后来又改回了 4.2%。Anthropic 的模型 Fable 5.1 也遭了殃,数学成绩一度被 OpenAI 下调了近 10 分。OpenAI 解释说这是发布前...

推荐理由:GPT-6 Astra 发布本身就是大事,Fortune 抓到发布后改基准测试成绩,还动了竞品分数,热点、知识增量、读者决策影响全占了。没给到 95 是因为目前只有 Fortune 一家报道,OpenAI 的回应也比较模糊,先观望一下后续。

量子位 · 公众号

网友把 GPT-6 当导演、Seedance 当摄影,攒出一条 AI 动画流水线

有人把 GPT-6 Astra 和字节的 Seedance 2.5 串了起来,让 Astra 在 Blender 里搭场景、做预演、定机位,再把参考帧丢给 Seedance 生成动漫风格的打斗镜头,最后 Astra 自己动手剪辑出片。同一套流程还拍了火影同人短片,以及把一部中国短剧翻成美国版。Fable 5.1 和 Gemini 3.8 Flash 也...

推荐理由:一个把 OpenAI 和字节最新模型串起来做自动拍片的动手实验,流程清晰、有成品,但缺少稳定性、成本和对比数据,更像个人 workflow 分享而非产品更新,刚好够 featured 门槛。