跳到正文

#OpenAI

今日 0 条

3月10日星期二

OpenAI News

OpenAI 发了个训练集 IH-Challenge,专门教大模型分清指令的优先级

OpenAI 这篇博客讲的是怎么让前沿大模型更听话——不是听所有人的话,而是学会按“系统 > 开发者 > 用户 > 工具”这个优先级来执行指令。他们做了一个叫 IH-Challenge 的训练数据集,用强化学习来练模型。设计上避开了三个坑:指令本身太复杂导致模型搞不清、靠另一个模型打分不靠谱、以及模型学会偷懒(比如无脑拒绝所有请求)。每个训练任务都很简...

推荐理由:OpenAI 公开了一个叫 IH-Challenge 的研究物件,专门搞指令层级和防注入,所以 HKR 三项都站得住。正文没给指标、没提具体模型、也没说怎么发布,信息缺口不小,分数就先打在 77 这个位置。

OpenAI News

ChatGPT 上线数学和科学互动图解,覆盖 70 多个核心概念

OpenAI 给 ChatGPT 加了一个学习功能:问勾股定理、理想气体方程这类问题时,它会直接弹出一个可拖拽的图表模块。你可以手动调参数、改公式,图表会跟着实时变,把抽象公式变成能上手试的东西。首批覆盖 70 多个数学和科学概念,所有付费和免费用户都能用。官方说每周有 1.4 亿人用 ChatGPT 学数学和科学,但正文没披露这个互动功能背后的模型、...

推荐理由:我会先打个折:这是个中等体量的产品更新,不是模型能力突破。钩子在于把抽象概念变成能动手玩的画面,对教学场景有直接吸引力。1.4 亿周活和 70+ 概念是实打实的数字,说明铺量已经很大。但正文完全没提模型怎么支撑这些交互、有没有做过学习效果验证,这点先别太激动。整体判断是产品化动作值得关注,技术深度和效果证据还缺位。

3月9日星期一

OpenAI News

OpenAI 宣布收购 Promptfoo,要把安全测试直接做进 Frontier 平台

OpenAI 发公告说要收购做 AI 安全测试的 Promptfoo,交易完成后会把它的技术整合到企业级平台 Frontier 里。Promptfoo 的工具现在有超过四分之一的财富 500 强公司在用,主要帮开发者在模型上线前做安全评估和红队测试,比如检测提示词注入、越狱、数据泄露、工具滥用这些风险。收购后,OpenAI 打算把自动化安全测试、红队演...

推荐理由:这条消息我会先打个折,因为收购价格和时间表正文都没写,没法判断交易规模和落地节奏。但 OpenAI 把一家已有大客户基础的评测工具直接收进 Frontier,对做 agent 的团队来说是个强信号——以后安全测试和红队评估可能变成平台自带能力,不用再外挂工具。这点先别太激动,等更多细节出来再看。

3月6日星期五

OpenAI News

OpenAI 把代码安全扫描工具 Codex Security 开放给付费用户试用,下个月免费

OpenAI 在 3 月 6 日上线了 Codex Security 的研究预览版,面向 ChatGPT Pro、Enterprise、Business 和 Edu 用户,下个月可以免费用。这个工具相当于一个应用安全助手,会先读懂你的项目结构,生成一份可编辑的威胁模型,再根据这个模型去找漏洞、做验证、给修复建议。过去 30 天里,它扫了外部仓库超过 1...

推荐理由:这是 OpenAI 给开发和安全团队的一个实质性产品更新,不是泛泛的安全宣传。切入点新、有具体扫描和误报数据、回应了 AI 编码风险和告警疲劳,三个点都站得住。不过目前还是研究预览,正文没披露误报下降的具体测试条件和补丁的采纳率,效果得等正式版再看。

3月5日星期四

OpenAI News

OpenAI 发布 GPT-5.4,把写代码、操作电脑和做报表揉进了一个模型里

OpenAI 推出了 GPT-5.4,一个面向专业工作的新模型,在 ChatGPT、API 和 Codex 里都能用。它把之前 GPT-5.3-Codex 的代码能力整合了进来,还首次让通用模型能直接操作电脑软件,比如跨应用完成复杂流程。模型支持最长 100 万 token 的上下文,方便处理长线任务。在模拟 44 种职业工作的 GDPval 测试里,...

推荐理由:这条消息的新闻价值在于 OpenAI 放出了一个新模型名,所以 H 和 R 都成立。但正文除了标题什么都没有,模型到底多大、贵不贵、能处理多长的上下文、跑分怎么样,一概没提,所以 K 不成立,分数只能停在 80 分这个区间。真正该盯的是后续的技术页,不是这条标题本身。

OpenAI News

OpenAI 发现推理模型很难按指令控制自己的思考过程,但这反而是个安全上的好消息

OpenAI 发了篇论文,核心结论是:现在最强的推理模型,都没法很好地控制自己的“思考草稿”(思维链)。他们搞了个叫 CoT-Control 的测试,用 13000 多个任务去要求模型在思考时遵守特定规则,比如全程用小写字母、避开某个关键词。结果所有被测模型的遵守率最高只有 15.4%,最低的甚至只有 0.1%。模型经常在草稿里自己都意识到“坏了,我刚...

推荐理由:OpenAI 用一篇文章标题说推理模型很难控制自己的 chain of thought,而且把这当成一件好事。这个说法挺反常识的——通常我们会觉得模型思考过程不可控是个安全隐患,但他们反过来认为这有利于安全。目前只有标题,正文没放出来,所以看不到具体实验、数字或者机制解释。我会先打个折:判断只能基于标题本身,别急着下结论说他们找到了什么新方法。对做推理模型安全和可解释性的人来说,这个观点值得追一下原文,但信息缺口还很大。

OpenAI News

OpenAI 发布 GPT-5.4 Thinking 系统卡,首次给通用推理模型加了高级网络安全防护

OpenAI 在 2026 年 3 月 5 日公开了 GPT-5.4 Thinking 的系统卡。这是 GPT-5 系列最新的推理模型,也是第一个把“高级网络安全能力”的防护措施做进通用模型里的产品。它的安全方案跟之前的 GPT-5 系列差不多,但这次把给 GPT-5.3 Codex(代码模型)用的那套网络安全防护搬到了 ChatGPT 和 API 里...

推荐理由:这篇系统卡信息量不大,没给具体分数、缓解细节和部署条件,我会先打个折。但它真正值得盯的是风险门槛的变化——OpenAI 把“高能力网络安全”缓解从专用模型扩到了通用推理模型,这是一个信号。标题里的“首个”不是公关话术,而是安全策略在升级。正文没披露评测数据,所以别指望从这里看到性能对比,重点看安全边界怎么划。

OpenAI News

OpenAI 把 ChatGPT 塞进 Excel 了,还接上了 Moody's、Factiva 等金融数据源

OpenAI 在 2026 年 3 月 5 日发布了 ChatGPT for Excel 的测试版,相当于在 Excel 里直接装了一个 GPT-5.4 助手。你可以用大白话让它帮你搭财务模型、跑情景分析、查公式错误,它改表之前会先问你,改完还能告诉你改了哪个格子、为什么。OpenAI 自己跑了一遍投行工作流测试,GPT-5 的正确率是 43.7%,换...

推荐理由:OpenAI 把 ChatGPT 塞进 Excel 测试版,不只是加个聊天框,而是让模型能直接在单元格里建模、追溯改动,还接入了 Moody's、道琼斯 Factiva、MSCI 等金融数据源。内部投行场景的基准分从 43.7% 跳到 87.3%,幅度很大,但这是内部测试,实际表现得等用户上手再看。企业版和教育版默认关闭,说明对合规和隐私留了后路。FactSet 标注“即将上线”,数据生态还在铺。整体看,这是 OpenAI 在抢专业工作流入口的一次重注,比单纯发个模型更有战略意味。

3月3日星期二

OpenAI News

GPT-5.3 Instant 发布:少说废话、少拒绝,日常对话更干脆

OpenAI 在 2026 年 3 月 3 日更新了 ChatGPT 里用得最多的模型,叫 GPT-5.3 Instant。这次改动主要冲着日常对话体验去的:模型不再动不动就拒绝回答,也不会在回答前先啰嗦一堆免责声明。文章给了一个具体对比——问远程射箭弹道计算,旧版 GPT-5.2 Instant 直接拒绝,说这能提高武器效能所以不能帮;新版 GPT-...

推荐理由:OpenAI 更新了 ChatGPT 最常用的日常模型,这篇帖子靠一个具体的 5.2 vs 5.3 行为对比把安全边界的变化讲清楚了,所以 HKR 三项都站得住。我会先打个折:正文没给系统卡、基准分、API 价格,信息缺口明显,所以重要性停在 84 不进 85。

OpenAI News

GPT-5.3 Instant 系统卡

OpenAI 发了 GPT-5.3 Instant 的系统卡,这是 GPT-5 系列里最新的一个模型。按他们说的,这个版本主要提升在回复速度更快、联网搜索时给出的答案更贴切上下文,并且减少了那种把天聊死的车轱辘话和过于绝对的表述。安全防护措施基本沿用了上一代 GPT-5.2 Instant 的方案,正文没披露新的安全评测数据、具体跑分或能力边界,详细内...

推荐理由:这篇就是 OpenAI 官方文档页面的一个占位更新,标题确认了 GPT-5.3 Instant 这个新变体存在,安全策略沿用 5.2 那套。但正文是空的,没有跑分、没有价格、没有延迟对比,也没提上下文长度。所以我会先打个折:知道有这么个东西,但暂时没法判断它到底多快多省。

2月27日星期五

OpenAI News

OpenAI 与亚马逊达成战略合作,AWS 成为 OpenAI 企业级产品的独家第三方云分发渠道

OpenAI 和亚马逊宣布了一项多年合作,亚马逊将向 OpenAI 投资 500 亿美元,其中 150 亿先到账,剩下 350 亿要满足特定条件后才会支付。合作的核心看点有两个:一是分发渠道,AWS 成为 OpenAI Frontier(一个让企业搭建、部署、管理 AI 智能体团队的平台)的独家第三方云分发商;二是算力绑定,OpenAI 承诺在 AWS...

推荐理由:这不是一篇常规的合作通稿。分阶段 500 亿投资、Bedrock 上线 OpenAI 模型运行时、再加约 2 吉瓦 Trainium 算力消耗,这三件事合在一起,把 OpenAI 的分发和算力姿势都改了。HKR 三项全中,所以放在 P1。

OpenAI News

OpenAI 和微软发联合声明:合作关系没变,亚马逊也能用 Azure 跑 API

OpenAI 和微软在 2026 年 2 月 27 日发了份联合声明,核心就一句话:两家公司的合作条款没变。声明直接回应了 OpenAI 当天宣布的新融资和新合作伙伴(包括亚马逊),强调这些动作都在现有协议框架内。具体来说,微软对 OpenAI 模型和产品的独家 IP 许可依然有效;收入分成模式不变,而且一直就包含了 OpenAI 跟其他云厂商合作带来...

推荐理由:这份联合声明本身有一定分量,但原文只给了标题,正文没披露,所以能说的不多。我会先打个折:信息密度很低,没法判断具体措施或时间表。不过它至少传递了一个关键点——OpenAI 的新钱和新伙伴,不影响微软已有的合作条件。对从业者来说,这等于给云服务格局和商业排他性吃了一颗定心丸,所以知识性和可读性都过关,但 headline 太虚,热闹不起来。

2月26日星期四

OpenAI News

OpenAI 与 PNNL 合作测试用 AI 帮联邦政府写环评报告,每小节能省 1 到 5 小时

OpenAI 跟美国能源部旗下的太平洋西北国家实验室(PNNL)合作,找了 19 位专家一起搞了个叫 DraftNEPABench 的测试集,专门看 AI 能不能帮忙起草联邦基建项目的环境评估文件。测试用的是 Codex CLI 这个命令行工具搭配 GPT-5,让模型去读几百页的技术报告、交叉核对资料,再按法规要求写出结构化的分析草稿。在覆盖 18 个...

推荐理由:HKR 三项都过了:联邦审批这个场景够意外;有 19 位专家、102 个任务和 1–5 小时的时间节省,信息量不空;争议点在于代理开始碰监管流程,但文章自己划了边界,说这只是起草辅助,不是自动决策。分数没往上拉,因为这只是个限定范围的基准测试,不是已经落地的产品能力。

OpenAI News

OpenAI Codex 和 Figma 打通了代码与设计稿的来回转换

OpenAI 和 Figma 在 2026 年 2 月 26 日发布了一项新集成:在 Codex 桌面端里,你可以直接把代码转成 Figma 里能编辑的设计稿,也能把 Figma Design、Figma Make 和 FigJam 里的内容拉回代码里继续开发。这个来回转换的流程靠 Figma MCP Server 实现,走的是 MCP 协议,相当于给...

推荐理由:OpenAI 和 Figma 搞了个 Codex 集成,代码能直接生成可编辑的 Figma 设计,反过来 Figma 里的设计、Make 原型和 FigJam 白板也能回写成代码。底层走的是 MCP,通过 Figma MCP Server 接进 Codex 桌面应用。OpenAI 说 Codex 周活已经过百万,年初到现在用量涨了四倍多。我会先打个折,因为正文没披露支持哪些模型、权限怎么划、收不收费、双向转换稳不稳定——这些才是实际落地要盯的。

2月19日星期四

OpenAI News

OpenAI 投 750 万美元给英国政府主导的对齐研究基金,让外部团队独立探索 AI 安全方案

OpenAI 宣布向英国 AI 安全研究所(UK AISI)发起的“对齐项目”基金拨款 750 万美元(约 560 万英镑)。这笔钱会和其他公共、慈善及行业资金一起,把基金总盘子推到超过 2700 万英镑,专门资助全球独立团队做 AI 对齐研究——也就是研究怎么让越来越聪明的 AI 系统别跑偏、别干出危险的事。OpenAI 自己会继续在内部做跟模型开发...

推荐理由:我会先打个折:正文只给了标题和链接,没披露项目名单、时间表或评审流程,所以很多判断只能基于现有信息缺口来推。OpenAI 宣布给英国 AISI 的 The Alignment Project 投 750 万美元,用来推进对齐独立研究。钱数本身不算大新闻,但'谁出钱、谁研究、谁说了算'这个三角关系,在安全圈里一直是个敏感话题,所以这篇东西在治理层面有讨论价值。

2月13日星期五

OpenAI News

OpenAI 给 Codex 和 Sora 换了一套“先用额度,超了再扣钱”的访问系统

OpenAI 发了一篇工程博文,解释他们怎么解决 Codex 和 Sora 用户老撞速率限制的问题。核心做法是自研了一套实时访问引擎,把速率限制和预购点数揉在一起:请求先走免费速率额度,额度用完了自动从点数余额里扣,用户不用切换系统。文章说这套“决策瀑布”模型能在一个请求里同步完成判断,点数扣减异步处理,并且有三套独立数据(产品用量、计费事件、余额变动...

推荐理由:这是 OpenAI 官方的产品更新,标题抛出了“超越速率限制”这个钩子,对开发者来说很抓眼球,所以 H 和 R 都成立。但正文完全没披露具体怎么调、调多少、谁受益、花多少钱、什么时候上,信息密度极低,K 不成立。我会先打个折,把它放在 featured 底线,等后续有参数再重新评估。

2月12日星期四

OpenAI News

OpenAI 发布 GPT-5.3-Codex-Spark,一个跑在专用芯片上、主打实时交互的写代码模型

OpenAI 放出了一个研究预览版模型 GPT-5.3-Codex-Spark,专门为在 Codex 里实时写代码设计。它是个 GPT-5.3-Codex 的缩小版,跑在 Cerebras 的晶圆级芯片上,推理速度超过每秒 1000 个 token,体感上几乎没有延迟。目前只开放给 ChatGPT Pro 用户,上下文窗口 128k,纯文本输入。模型默...

推荐理由:OpenAI 这条更新只给了一个标题,确认型号叫 GPT-5.3-Codex-Spark,正文没有任何实质内容。名字里带 Codex 和 Spark,大概率是代码相关的新模型,但没披露参数、定价、上下文窗口、跑分,也没说是不是只做代码。我会先打个折:名字有话题性,能吸引开发者注意,所以重要度给到 72、放在 featured 没问题;但信息缺口太大,没法判断实际能力,这点先别太激动。

2月9日星期一

OpenAI News

OpenAI 开始在 ChatGPT 里测试广告,目前只在美国小范围跑,免费和 Go 用户会看到

OpenAI 发了一篇公告,确认正在美国测试 ChatGPT 广告,面向登录的成年免费和 Go 用户,Plus、Pro、企业版和教育版不涉及。广告不会影响 ChatGPT 的回答,聊天记录对广告主保密,只给汇总数据。正文没披露具体广告位、流量占比、定价和测试时长。更新提到早期数据没伤到用户信任,广告关闭率低,接下来会扩展到加拿大、澳大利亚和新西兰。我会...

推荐理由:这条消息来自官方,分量够上 featured。我会先打个折:正文是空的,所有细节都靠标题撑着,所以别急着下结论。钩子很直给——ChatGPT 要放广告,从业者一眼就知道这关系到流量入口的商业化。风险点也实在,广告怎么插、插在哪,会直接决定用户还信不信这个产品。信息缺口大,但话题本身值得盯。

2月1日星期日

OpenAI News

OpenAI 封掉了一批账号,背后是一个叫“No Bell”的俄罗斯水军行动,用 ChatGPT 写文章在非洲黑美国

OpenAI 在 2026 年 2 月 1 日公布了一个叫“No Bell”的行动。他们封了一个 ChatGPT 账号,这个账号很可能来自俄罗斯,专门生成关于撒哈拉以南非洲地缘政治的长文和社交媒体帖子。内容一边倒:夸俄罗斯,骂美国、英国和乌克兰。操作者主要用英文下指令,偶尔会冒出俄语,说是“经理”给的修改意见。为了藏住 AI 痕迹,他们会要求模型别用破...

OpenAI News

OpenAI 端掉一个柬埔寨杀猪盘团伙,他们用 ChatGPT 批量搞“约会诱饵”骗印尼男性

OpenAI 封禁了一批 ChatGPT 账号和一个 API 客户,这些账号很可能来自柬埔寨,在跑一套半自动化的“恋爱任务”骗局。骗子先用 ChatGPT 生成高端约会服务的广告文案,在社交媒体上定向投给对高尔夫、游艇感兴趣的印尼男性,引流到 Telegram。接着,他们混用人工和 API 自动生成的暧昧聊天建立信任,再把人交给“导师”,用 ChatG...

OpenAI News

OpenAI 封了一个与中国执法部门有关的账号,对方用 ChatGPT 策划针对日本首相的抹黑行动,模型拒绝了

OpenAI 在 2026 年 2 月的安全报告里披露了一个案例。一个关联中国执法人员的 ChatGPT 账号,试图让模型帮忙设计一套搞臭日本首相高市早苗的方案,模型没答应。但用户后来上传了行动进展报告让模型润色,说明这事绕过 ChatGPT 照样推进了。报告里提到他们动用了 #右翼共生者 这类标签,在 X、Pixiv 等平台用小号发帖,内容集中在攻击...

推荐理由:OpenAI自己安全报告里的案例,有具体操作细节,不是空泛预警。扣分点是这只是报告中的一个案例,模型还拒绝了请求,新闻冲击力不如一次实锤攻击。但地缘政治加AI滥用的组合,对从业者来说信号够强。

OpenAI News

OpenAI 封禁了一批与俄罗斯 Rybar 网络有关的 ChatGPT 账号,它们被用来批量生产多语种影响力内容

OpenAI 在 2 月 1 日公布了“鱼食行动”,封掉了一批 ChatGPT 账号,这些账号跟俄罗斯的 Rybar 网络有关。Rybar 是个在 Telegram 和 X 上活动的媒体网络,这次被查到的操作主要用俄语下指令,让 ChatGPT 批量生成俄语、英语、西班牙语等不同语言的内容,然后发到网上。一部分内容由 Rybar 自己的账号发布,但更多...

推荐理由:这是 OpenAI 官方披露的恶意使用案例,有行动代号、有对手实体,信息密度高。扣分是因为文章是 2 月发布的旧闻重提,时效性打了折扣,而且内容摘自一份更完整的安全报告,不是独立首发。我会先打个折,但整体仍然值得从业者看一眼。

OpenAI News

OpenAI 封禁柬埔寨诈骗团伙:用 ChatGPT 冒充律师和 FBI 专骗受害者

OpenAI 在 2 月安全报告中披露了一个叫“假证人”的行动。他们封掉了一批 ChatGPT 账号,这些账号大概率来自柬埔寨,专门搞“恢复被骗资金”的二次诈骗。骗子先用 ChatGPT 生成内容,在社交媒体上打广告,假装是至少六家能帮你追回钱的律所。等人上钩后,他们就在 Telegram 上继续用 ChatGPT 写消息,模仿美国律师的口吻,甚至冒充...

推荐理由:这是 OpenAI 官方安全报告里拆出来的真实案例,不是泛泛的安全声明。有具体战术、有执法机构联动,信息密度够。但它只是报告里的一节,不是独立产品发布,所以刚好卡在 featured 门槛上。

OpenAI News

OpenAI 封掉了一批用 ChatGPT 跑完整“杀猪盘”流程的账号

OpenAI 在 2026 年 2 月的恶意使用报告里,详细拆解了骗子怎么用 ChatGPT 走完“杀猪盘”全流程:先用 AI 生成搭讪话术去冷接触(ping),再编造能调动情绪的内容让人上头(zing),最后编理由要钱(sting)。这次新披露的一个柬埔寨团伙,就是用 ChatGPT 生成诈骗消息,再投到社交媒体上。OpenAI 的判断是,AI 主要...

推荐理由:OpenAI 2 月的恶意使用报告里,最抓人的是那个柬埔寨团伙的案例——直接用 ChatGPT 写诈骗消息去社交平台撒网。报告把杀猪盘流程拆成 ping/zing/sting 三步,这个框架本身比单个案例更有复用价值。我会先打个折:正文被截断了,没看到更多技术细节和对抗措施,所以分数没往上顶。但作为官方披露的、带具体案例的威胁情报,给 78 分放在 featured 里是合适的。

1月29日星期四

OpenAI News

OpenAI 宣布将在 ChatGPT 里停用 GPT-4o 等四款旧模型

OpenAI 计划在 2026 年 2 月 13 日从 ChatGPT 里撤掉 GPT-4o、GPT-4.1、GPT-4.1 mini 和 o4-mini 这四款模型。API 暂时不受影响。这次下线的核心原因是绝大部分用户已经切到了 GPT-5.2,每天还在用 GPT-4o 的人只剩 0.1%。文章提到,之前因为部分付费用户反馈需要更多时间迁移创意类工...

推荐理由:官方帖子确认了四个模型会在 ChatGPT 里退役,这对依赖固定模型版本的用户是实打实的工作流风险,所以 H 和 R 都成立。但 K 不成立,因为下线时间、替代方案、API 范围、迁移指引全都没披露,目前只有名字,没法做判断。我会先打个折:标题够抓人,但信息密度很低,真正该盯的是兼容性断点,不是“退役”这两个字。

2025年12月18日星期四

OpenAI News

OpenAI 发了 GPT-5.2-Codex,但正文是空的

标题只确认了模型名叫 GPT-5.2-Codex,版本号 5.2。正文没披露任何细节——不知道价格、上下文长度、是否开放 API,也不清楚它跟旧版 Codex 是什么关系。等官方补全文档再判断。

推荐理由:这条消息就一个标题,正文是空的,所以我会先打个折——能确认的只有 OpenAI 发了个叫 GPT-5.2-Codex 的东西,版本号 5.2。没写定价、没写上下文长度、没写是取代旧 Codex 还是并行跑,也没写谁现在能用。真正该盯的是后续正文和 API 文档什么时候补上。但光这个名字就够让做代码 agent 和开发工具的人盯一眼,因为 OpenAI 在编程模型上再推新版,直接影响工具链选型和成本预期。

2025年12月16日星期二

OpenAI News

OpenAI 发了新版 ChatGPT 图片生成,说是更快、编辑更听话

OpenAI 在 12 月 16 日上线了新版 ChatGPT 图片功能,底层换了一个新的主力生图模型,API 里叫 GPT Image 1.5。官方说生成速度比之前快 4 倍,编辑图片时能更精准地只改你要求的部分,保留原图的光线、构图和人脸一致性。这次还加了一个独立的图片创作入口,内置了一些预设风格,不用写提示词也能玩。正文没披露具体画质指标、免费用...

推荐理由:OpenAI 官方发了个上线帖,所以 H 和 R 都成立:新图片功能是真实的产品事件,从业者肯定会讨论。K 不成立是因为正文没披露任何关键参数,连一张效果图都没有,信息量撑不起深度解读,所以保持在 featured 门槛附近。

2025年12月11日星期四

OpenAI News

OpenAI 发布 GPT-5.2,在专业任务和长时间跑流程的智能体上又往前迈了一步

OpenAI 推出了 GPT-5.2,主要卖点是处理专业工作(做表格、写代码、读图、理解长文档)和让模型在业务流程里干活的能力更强了。在衡量 44 种职业任务的 GDPval 测试里,GPT-5.2 Thinking 版在 70.9% 的对比中赢了或打平了行业专家,而且生成速度是专家的 11 倍以上,成本不到 1%。代码方面,SWE-Bench Pro...

推荐理由:官方来源加上旗舰模型更新,H 和 R 都拉满,进 featured 没问题。但 K 完全挂掉——正文空荡荡,所有关键参数都欠奉,所以分数没给到顶。真正该盯的是后续的 API 文档和定价页,现在只能先打个折。

OpenAI News

迪士尼和 OpenAI 签了三年协议,要把 200 多个角色放进 Sora 和 ChatGPT 图片生成里

OpenAI 官方发了一篇公告,宣布迪士尼成为 Sora 的第一个大型内容授权方。协议为期三年,Sora 和 ChatGPT 图片生成功能会拿到超过 200 个迪士尼、漫威、皮克斯和星球大战的角色授权,包括米奇、艾莎、钢铁侠、尤达等,但不含真人演员的脸或声音。用户可以用这些角色生成短视频和图片,部分视频还会被选进 Disney+ 里播放。迪士尼同时会成...

推荐理由:这条消息我会先打个折——目前只有标题,正文是空的,所以能聊的其实不多。但“迪士尼角色进 Sora”这个组合本身就够有话题性:一方面它天然吸引点击,另一方面大 IP 直接接入视频生成模型,版权怎么谈的、合规怎么过、会不会变成内容军备竞赛,都是从业者会立刻想到的问题。信息缺口很明显,角色范围、上线时间、授权条件全都没披露,所以现在只能把它当做一个信号,别急着下结论。

2025年12月9日星期二

OpenAI News

OpenAI 任命前 Slack CEO Denise Dresser 为首席营收官

OpenAI 宣布 Denise Dresser 加入并担任首席营收官,负责全球企业营收和客户成功。她上一份工作是 Slack 的 CEO,更早之前在 Salesforce 管了十几年大客户销售。OpenAI 在公告里说自己是“史上增长最快的商业平台”,目前有超过一百万家企业在用,但没披露具体的营收目标或她上任后的首要任务。公告里还引用了几个用户数据:...

推荐理由:这条消息的钩子很明确:OpenAI 终于设了 CRO,说明商业化在加速。但别被标题骗了,正文是空的,能确认的只有 Denise Dresser 这个名字和职位,连生效日期都没给。我会先打个折——信息量太薄,没法判断她带什么资源、背什么指标。不过从业者还是会点开看,因为 OpenAI 的销售动作直接关系到行业竞争格局和定价走向。

2025年12月3日星期三

OpenAI News

OpenAI 宣布要收购 Neptune,但公告里没写花了多少钱、什么时候完成

OpenAI 发了一篇简短公告,说已经签了最终协议要买下 neptune.ai。Neptune 做的是实验追踪和模型训练监控工具,能帮研究员实时看模型在训练中怎么变化、对比几千次实验、分析各层指标。OpenAI 首席科学家 Jakub Pachocki 的说法是,把这些工具深度整合进自己的训练流程,能更快发现问题、从每次实验里学到更多。Neptune ...

推荐理由:这条消息只有标题有信息量,正文没给任何细节,所以我会先打个折:它是个真信号,不是传闻,但信息缺口太大。H 和 R 都成立,因为 OpenAI 官方收购标题本身就够抓人,而且收购动作对从业者判断行业走向有用。K 不成立,因为没披露标的业务、金额或时间表,没法做判断。整体卡在 featured 门槛上,等后续公告再补细节。

2025年11月13日星期四

OpenAI News

OpenAI 发布 GPT-5.1,主打动态思考:简单问题少费 token,复杂问题多花时间

OpenAI 在 API 平台上线了 GPT-5.1,这是 GPT-5 系列的新模型,核心卖点是“自适应推理”——它会根据任务难度自己决定思考多久。简单问题(比如问个 npm 命令)2 秒就能出答案,比 GPT-5 快了 5 倍,消耗的 token 也少得多;遇到复杂任务则会持续推敲,在 SWE-bench Verified 编程基准上跑到了 76.3...

推荐理由:这条靠的是 OpenAI 官方身份和开发者群体的关注度撑起来的:新模型发布意味着马上要面对要不要切、花多少钱、能力差多少的问题。但正文什么都没给,参数、价格、上下文长度、API 变化一概欠奉,所以知识密度直接打折扣。我会先打个折——这条值得推,但别指望从摘要里挖出干货,真正该盯的是后续技术细节。

2025年11月12日星期三

OpenAI News

OpenAI 发了 GPT-5.1,说更聪明也更会聊天了,但没给具体数据

OpenAI 在 11 月 12 号发了篇公告,宣布把 ChatGPT 里的模型升级到 GPT-5.1,分两个版本:Instant 和 Thinking。Instant 是大家最常用的那个,这次改得更暖、更口语化,还加了自适应推理,遇到难题会自己先想一下再回答,数学和编程题的表现有提升。Thinking 版是专门做复杂推理的,现在思考时间更灵活,简单问...

推荐理由:标题是真的,但信息量约等于零。OpenAI 说 GPT-5.1 更聪明、更会聊天,可正文没披露任何硬指标,连是不是全量推送都不知道。我会先打个折:这件事值得关注,但别把一句宣传语当成完整产品说明。

2025年10月23日星期四

OpenAI News

OpenAI 收购了 Mac 端 AI 助手 Sky 的开发商

OpenAI 宣布买下 Software Applications Incorporated,这家公司做了个叫 Sky 的 Mac 应用,能读懂屏幕内容、直接操作其他 App 帮你干活。收购后整个团队会并入 OpenAI,Sky 的深度系统集成能力将被整合进 ChatGPT,让 ChatGPT 不再只是回消息,而是能跨应用执行任务。公告没透露收购金额和...

推荐理由:这条消息是 OpenAI 官方披露的并购动作,所以 H 和 R 都成立:收购会改变产品栈策略和竞争格局。K 偏弱,因为页面只给了标的和 Sky 的关联,价格、交割时间、产品细节都缺,所以放在 featured 而不是 breaking。正文没披露收购金额、交割时间、Sky 的产品形态,别被“收购”二字带跑,真正该盯的是整合方向与团队去向。

2025年10月22日星期三

OpenAI News

ChatGPT 将在 2026 年 1 月 15 日后退出 WhatsApp

OpenAI 说因为 WhatsApp 改了政策和条款,ChatGPT 在 WhatsApp 上的服务到 2026 年 1 月 15 日就停了。之前有超过 5000 万人在 WhatsApp 上用过 ChatGPT。想保留聊天记录的话,得在截止日期前把 WhatsApp 账号和 ChatGPT 账号绑在一起,不然聊天记录不会自动迁移,而且 WhatsA...

推荐理由:这不是普通的功能更新,而是 OpenAI 官方通知要关掉一个 5000 万用户的 WhatsApp 渠道。钩子在于“ChatGPT 离开 WhatsApp”这个动作本身不常见;知识点是截止时间和政策变更原因;风险点直接落在平台依赖和数据迁移上——用户如果不主动链接账户,聊天记录就没了,而且 WhatsApp 不给导出,这点对实际使用者影响挺实在。

2025年10月21日星期二

OpenAI News

OpenAI 发布 ChatGPT Atlas 浏览器,把 ChatGPT 直接嵌进浏览器里

OpenAI 在 2025 年 10 月 21 日推出了 ChatGPT Atlas,一个把 ChatGPT 内置在核心的浏览器,目前 macOS 版全球上线,免费、Plus、Pro 和 Go 用户都能用。Atlas 让 ChatGPT 能跟着你浏览网页,看懂你当前在看什么,不用复制粘贴就能回答问题或帮你干活。它还能记住你浏览过的网站内容(叫“浏览器记...

推荐理由:OpenAI 把 ChatGPT 做成一个独立浏览器,而不是继续在别人浏览器里当插件,这是分发层面的动作,不是日常功能更新,所以给到 88 分、p1。HKR 三项全中:钩子够新,不是又一个模型升级;信息量扎实,上线范围、付费策略、隐私开关都给了;从业者会盯着它怎么用浏览器记忆和页面可见性控制来卡位,这点先别太激动,但确实值得盯。

2025年10月13日星期一

OpenAI News

OpenAI 和博通联手,计划到 2029 年部署 10 吉瓦的自研 AI 加速器

OpenAI 自己设计芯片和系统,博通负责把加速器、以太网、PCIe 和光纤网络打包成整机柜,从 2026 年下半年开始上架,2029 年底前完成全部 10 吉瓦的部署。10 吉瓦这个数字很大,说明 OpenAI 在为未来几年的算力需求提前铺路,而且明确走自研芯片加全以太网集群的路线,不再只依赖英伟达。不过公告没提芯片用几纳米工艺、具体性能参数,也没说...

推荐理由:OpenAI 把自研芯片路线图摆上台面了:和 Broadcom 合作,目标是 10 吉瓦加速器,2026 下半年开始上架,2029 年底前铺完。我会先打个折——正文没披露芯片制程、单卡规格和资本开支,所以别急着算成本优势。真正值得看的是他们选了自研芯片加以太网集群这条路,Broadcom 负责网络和互连,说明不是小规模试水。这点先别太激动,但如果是真的,对英伟达依赖会松一扣。

2025年10月9日星期四

OpenAI News

OpenAI 公布了一份政治偏见评测,用 500 道题测 ChatGPT 会不会站队

OpenAI 自己动手测了 ChatGPT 的政治偏见。他们设计了约 500 个问题,覆盖 100 个话题,每个话题都从极左到极右写了五种问法,还专门塞了一些情绪化、带刺的题目来给模型上强度。评测不看模型选 A 还是选 B,而是看它会不会在回答里夹带私货、只讲一面理、或者被用户带节奏。结果显示,碰到中性或稍微带点倾向的问题,模型基本能保持客观;但遇到情...

推荐理由:OpenAI 这次放出的是一份政治偏见评测,不是新模型或产品发布。我会先打个折:它用约500条提示覆盖100个话题,从5个维度去量 ChatGPT 在真实对话里有没有站队。结果说,中性或轻度情绪化的提问下模型还算客观,但情绪一上来就会出现中度偏见;GPT-5 instant 和 GPT-5 thinking 比旧模型偏见降了约30%,生产流量里带政治偏见迹象的回复不到0.01%。这点先别太激动,正文没披露评测提示的具体分布和偏见轴的定义细节,也没说那30%是在什么基线上算出来的。但整体上,这份报告对做对齐和安全的人有参考价值,也直接打在信任和治理的...

2025年10月6日星期一

OpenAI News

OpenAI 的 Codex 编程助手正式上线,新增 Slack 集成、SDK 和管理后台

OpenAI 在 10 月 6 日宣布 Codex 结束预览、进入正式可用阶段。这次主要加了三个东西:一是能在 Slack 频道里直接 @Codex 派活,像喊同事帮忙一样;二是放出了 Codex SDK,让你把驱动命令行版 Codex 的那个智能体嵌进自己的工具或流程里,官方说配合 GPT‑5‑Codex 模型不用额外调优就能用;三是给企业管理员上了...

推荐理由:OpenAI 把 Codex 从预览推到正式版,顺手加了 Slack 集成、SDK 和管理员控制,这比发个模型补丁重得多。我会先打个折:正文没披露云端任务的具体价格,这点先别太激动。但用量数据摆在那里,10 倍增长和 40 万亿 token 说明调用量是真金白银在跑。更值得盯的是内部数据——工程师全上、PR 合并效率提 70%,这是企业买单前最想看到的验证。整体看,这不是一次功能更新,是编码助手开始抢工作流入口和团队席位的明确动作。

OpenAI News

ChatGPT 里能直接调用 Booking、Canva 这些 App 了,OpenAI 还发了套开源 SDK 让开发者自己做

OpenAI 在 10 月 6 号给 ChatGPT 加了个新功能:你可以在聊天里直接喊 App 出来干活,比如让 Spotify 帮你排歌单,或者让 Zillow 在地图上筛房源。首批上线的有 Booking.com、Canva、Coursera、Expedia、Figma、Spotify 和 Zillow 这七家,后面还有 11 家会在年内跟上。目...

推荐理由:OpenAI 给 ChatGPT 装了个应用层,同时把开发工具包开源出来,等于把聊天界面升级成一个小型应用商店。我会先打个折:覆盖范围排除了欧洲经济区、瑞士和英国,应用怎么审核、怎么分成正文都没说,所以商业闭环还不完整。但首批 7 家合作方已经上线,年内还要再上 11 家,SDK 走的是 MCP 协议,开发者能直接触达 OpenAI 自称的 8 亿多用户,这对做工具和 agent 的团队是个实打实的信号。