跳到正文

#OpenAI

今日 0 条

2025年10月6日星期一

OpenAI News

OpenAI 跟 AMD 签了 6 吉瓦 GPU 大单,首批 MI450 明年下半年到位

OpenAI 和 AMD 签了一份多年、跨代 GPU 协议,总规模 6 吉瓦,相当于一口气包下巨量算力。第一波 1 吉瓦会用 AMD 的 Instinct MI450 系列 GPU,2026 年下半年开始部署。双方从 MI300X、MI350X 一路合作到现在,这次会继续在整机柜方案和未来几代芯片上深度绑定。作为交易的一部分,AMD 给了 OpenAI...

推荐理由:这不是普通的合作通稿,是OpenAI在算力采购上的一次重大转向信号。6吉瓦的总量、首期MI450的时间表,以及用股权绑定的方式,都说明AMD这次是实打实地进了OpenAI的核心供应链。我会先打个折,协议是多年多代的,最终能落地多少还得看MI450的实际表现和良率,但光是这个规模就足以让市场重新评估AMD在AI训练端的地位。正文没披露具体金额和单卡性能对比,这点先别太激动。

OpenAI News

OpenAI 发布 AgentKit:一套工具把智能体开发、评测和微调打包在一起

OpenAI 在 10 月 6 日推出了 AgentKit,把做智能体需要的三块拼图拼到了一起:Agent Builder 是个画布,拖拽节点就能搭多智能体流程,支持版本管理和安全护栏;ChatKit 让你把对话界面嵌进自家产品,省掉两周前端开发时间;Connector Registry 统一管理 Dropbox、Google Drive、ShareP...

推荐理由:这次发布对 agent 开发者来说信息量挺大,Agent Builder、Connector Registry、ChatKit 三个组件都给了具体机制。Evals 那边 trace grading 和自动提示优化是实打实的新能力,第三方模型支持也扩大了适用范围。但标题里提到的 RFT,正文截出来的部分完全没讲训练怎么搞、多少钱、哪些人能先用,这点先别太激动。整体够重磅,但缺关键细节,所以给 84 分而不是顶格。

2025年10月1日星期三

OpenAI News

三星和SK海力士加入OpenAI的星门计划,要猛扩AI芯片产能

OpenAI在10月1日宣布,三星和SK海力士正式加入它的星门(Stargate)AI基建项目。合作的核心是两件事:一是三星电子和SK海力士计划把先进内存芯片的产能拉到每月90万片DRAM晶圆,用来喂饱OpenAI的下一代模型;二是OpenAI跟韩国科技部、SK电讯、三星物产等签了一堆协议,打算在首尔圈外找地方建AI数据中心。三星和SK还会在自己公司内...

推荐理由:OpenAI 拉三星和 SK 进 Stargate,比一般合作多了一层供应链实锤:90 万片 DRAM 月产能目标摆在那,数据中心评估也签了协议。HKR 三项都站得住,但正文没披露投资额、时间表和具体机房规模,所以放在 featured 而不是 p1。

OpenAI News

OpenAI 封禁了一批用 ChatGPT 搭俄语恶意软件的账号

OpenAI 在 10 月威胁报告里披露,他们封掉了一批疑似跟俄语犯罪团伙有关的 ChatGPT 账号。这些人没让模型直接写病毒,而是拆成小块要代码:比如把程序转成能直接注入内存的 shellcode、写窃取浏览器密码的脚本、加花指令和垃圾代码来躲避杀毒软件,最后自己拼成完整的攻击工具。模型拒绝了明显恶意的请求,但没拦住这种“化整为零”的用法。Open...

推荐理由:OpenAI 官方威胁报告,给出了俄语团伙绕过安全过滤的具体手法,不是新模型或新能力,属于例行威胁披露,放在 featured 档合适。安全圈会关注这种“化整为零”的实操案例,对做 AI 安全策略的人有参考价值。

OpenAI News

OpenAI 封禁一批用 ChatGPT 写钓鱼邮件和恶意脚本的账号,行为特征指向中国情报需求

OpenAI 在 10 月威胁报告中披露,一批被封禁的 ChatGPT 账号与公开追踪的威胁组织 UNK_DROPPITCH 和 UTA0388 存在重叠。这些操作者用模型干两件事:一是生成中、英、日文的钓鱼邮件,内容会针对台湾半导体、美国学界和智库等目标做本地化微调,但签名档里留下了明显不合理的联系方式;二是辅助开发 Go 和 PowerShell ...

推荐理由:OpenAI 的威胁报告直接点名了 UNK_DROPPITCH 和 UTA0388 这两个公开追踪的团伙,给出的技术细节也够硬——钓鱼邮件本地化、辅助写脚本,不是泛泛而谈。不过这篇本质是威胁情报,不是 AI 能力进展,对做产品和研究的读者直接价值有限,所以卡在 featured 门槛上刚好。

OpenAI News

OpenAI 封掉一批号,它们用 ChatGPT 批量发南海、香港相关帖子,取名“九段线”行动

OpenAI 在 2025 年 10 月的报告里,封禁了一小批 ChatGPT 账号。这些号背后的人用模型批量生成英文和粤语帖子,主要攻击越南在南海的环境记录、抹黑菲律宾总统马科斯,以及诋毁香港的民主派人士。他们还用模型做侦察,比如找小众论坛、生成藏族名字来注册假号,甚至问怎么在 TikTok 上发起挑战、蹭 #MyImmigrantStory 这种热...

推荐理由:OpenAI 第一次公开点名并拆解一个跟中国有关的影响力行动,侦察和跨语言生成的细节很实,不是那种“AI 被滥用”的泛泛警告。卡在 78 分是因为它本质是一份威胁情报摘要,不是产品更新或模型发布,对只追技术进展的读者吸引力会打个折。

2025年9月30日星期二

OpenAI News

OpenAI 发布 Sora 2 系统卡,视频生成模型能同时出画面和声音了

OpenAI 在 9 月 30 日公布了 Sora 2 的系统卡,说这个新模型在物理规律、画面真实度、音画同步和风格控制上都比上一代强,能更准地跟着用户的指令走。这次发布先走邀请制,在 sora.com 和独立的 iOS App 上小范围开放。安全方面,上线初期禁止上传视频,也禁止上传带真人照片的图片,对涉及未成年人的内容有更严的审核门槛。正文没提 A...

推荐理由:这条落在 78–84 分档。H 来自 Sora 2 加独立 App 的钩子;K 来自明确的上线限制和安全规则;R 来自竞争和肖像滥用风险。没给更高分是因为价格、评测分数、上下文长度和 API 时间点正文全都没披露,我会先打个折。

OpenAI News

OpenAI 发布 Sora 2,能生成带同步对白和音效的视频,还做了一个社交 App

OpenAI 在 9 月 30 日发布了视频生成模型 Sora 2,同时上线了一个叫 Sora 的 iOS 社交 App。Sora 2 比上一代更遵守物理规律,比如投篮不进会弹框而不是球直接瞬移进筐,也能生成同步的人物对白和环境音效。App 里有个“角色”功能,你录一段视频和音频验证身份后,就能把自己的形象和声音放进任何生成的场景里。OpenAI 说这...

推荐理由:我会先打个折,因为价格和时长这些关键限制都没披露,没法判断实际可用性。但这条消息值得立刻写:OpenAI 在同一天发了 Sora 2 模型和独立的 Sora App,产品形态直接从技术演示跳到了带推荐流的社交应用。模型能同步出视频、对白和音效,还有个“characters”功能,用一次性录像验明正身再把真人形象注入视频——这点先别太激动,正文没讲清楚隐私和滥用防护细节。真正该盯的是分发方式变了,OpenAI 开始用消费级产品逻辑铺视频生成,而不是只给开发者或研究者玩。

2025年9月29日星期一

OpenAI News

OpenAI 给 ChatGPT 加了家长控制,能管孩子用 AI 的时间和功能

OpenAI 在 9 月 29 日上线了家长控制功能,所有 ChatGPT 用户都能用。家长把自己的账号和孩子的绑定后,就能在自己的账号里管理孩子的使用设置。绑定后的青少年账号默认会加强内容过滤,减少暴力、色情角色扮演和极端审美之类的内容。家长还可以单独设置禁用时段、关掉语音模式、关掉记忆功能、禁止图片生成,以及拒绝把孩子的对话拿去训练模型。比较关键的...

推荐理由:OpenAI 把家长控制推给了所有 ChatGPT 用户,但真正值得看的是自残风险上报链路:系统检测到风险后,先由人工小组复核,确认是急性痛苦状态再通过邮件、短信和推送通知家长。这不是一个简单的设置面板,而是一套带人工介入的安全流程。我会先打个折,因为这次没有模型层面的变动,属于产品安全更新,但信息量够实,流程也说得清楚。

OpenAI News

OpenAI 公开了它怎么拦截用 AI 生成或上传儿童性虐待内容

OpenAI 在 2025 年 9 月 29 日发了一篇安全说明,讲他们怎么防止自家模型被用来制作或传播儿童性虐待材料(CSAM/CSEM)。规则上,任何涉及未成年人的色情内容都禁止,一旦发现生成或上传这类内容,账号直接封禁并上报给美国失踪与受虐儿童中心(NCMEC)。技术手段上,他们用了三套工具:哈希匹配(拿已知的违法图片指纹做比对)、Thorn 的...

推荐理由:这篇不是产品发布,是 OpenAI 在 2025 年 9 月 29 日发的儿童安全措施说明。我会先打个折:标题和开头像标准合规声明,没什么新闻爆点。但往下看,技术细节给得比一般政策文多——明确写了用哈希匹配、Thorn 的分类器,以及自家模型去扫文本、图片、音频、视频和用户上传内容。更关键的一句是,他们已经观察到用户上传违规材料,还要求模型做细节描述,这说明滥用不是假设,是正在发生的对抗场景。对做安全和对齐的团队来说,这套跨模态监测组合和已确认的滥用模式,比单纯喊口号有用。信息量够,但缺具体误报率或拦截量级,所以放在 featured 档,不往上拔。

OpenAI News

ChatGPT 开始内嵌购物功能,先拿 Etsy 试水,并开源了一套让 AI 帮你下单的协议

OpenAI 在 9 月 29 日给 ChatGPT 加了个“即时结账”功能,美国 Plus、Pro 和免费用户现在能在聊天界面里直接买 Etsy 卖家的东西,目前只支持单件购买。Shopify 上像 Glossier、SKIMS 等一百多万商家之后也会接入。ChatGPT 每周有超过 7 亿人用,这次它不只是推荐商品,而是直接充当“数字导购”帮你完成...

推荐理由:OpenAI 让 ChatGPT 能直接结账,不是小功能补丁,是产品边界的一次硬扩张。我会先打个折:目前只覆盖美国用户和美国 Etsy 卖家,单件下单,规模还小。但真正值得盯的是它和 Stripe 一起推的开源 Agentic Commerce Protocol——商家最少一行代码就能接入,等于在铺结算管道。商品排序说按相关性自然展示,商家付小额成交费,但费率正文没披露,这点先别太激动。整体看,从聊天到成交的链路打通了,对从业者来说,这意味着模型开始进交易流干活,而不只是回话。

2025年9月25日星期四

OpenAI News

ChatGPT 企业版上线共享项目,团队能一起调教同一个 AI 了

OpenAI 给付费的 Business、Enterprise 和 Edu 用户推了个共享项目功能。简单说,就是团队可以建一个项目空间,把文件、指令都扔进去,所有成员跟 ChatGPT 聊天时,它都会基于这个共享的上下文来回答,不用每次都重新解释背景。创建者能通过邮件或链接拉人,权限分两档:只能看和聊,或者还能改指令、传文件。项目有自己的独立记忆,敏感...

推荐理由:我会先打个折,这不是模型发布,是协作层的产品更新。共享项目、8 个连接器、按提示自动路由连接器,这三件事合在一起,让 ChatGPT 从单人对话框往团队工作流里又挤了一步。权限和记忆的设计看得出在认真做企业控制,但正文没披露自动选择连接器的准确率和延迟,这点先别太激动。整体是扎实的迭代,不是概念车。

OpenAI News

OpenAI 发布 GDPval:用 44 种职业的真实工作成果来考模型

OpenAI 搞了一个新评测集叫 GDPval,专门看模型在真实工作里到底能不能干活。它从对美国 GDP 贡献最大的 9 个行业里挑了 44 种职业,让平均从业 14 年以上的老手出了 1320 道题,其中 220 道金牌题已经开源。题目不是考试卷,而是直接让你产出法律简报、工程图纸、护理计划这类真实交付物,格式涵盖文档、幻灯片、表格、图表和多媒体。评...

推荐理由:OpenAI 这次拿出的 GDPval 不是又一个刷榜基准,而是把评测对象换成了真实工作交付物,这点本身就抓人。文章给了具体数字和限制条件,比如 44 个职业、1320 个任务、220 个金标开源,也明确说了只测单轮,不碰多轮和长上下文,信息量够。它踩中的是行业最关心的问题:模型离真正接手知识工作还有多远。不是模型发布或高管变动,放在 featured 刚好。

OpenAI News

ChatGPT Pulse 预览:让模型主动推消息,每天一次

OpenAI 给 Pro 用户上了个移动端新功能 Pulse,ChatGPT 不再等你问,而是每天主动推一版个性化信息卡片。它会翻你的聊天记录、记忆和反馈,还能选接 Gmail 和 Google 日历(默认关着),晚上做功课,早上把结果推给你。你可以点赞点踩、直接告诉它明天想看什么,所有输出会过一道安全检查。正文没提用了哪个模型、会不会涨价、Plus ...

推荐理由:我会先打个折:正文没提模型有没有换、Pro 之外怎么收费、Plus 什么时候上,所以别当完整发布看。但亮点是交互逻辑变了——从你问它答,变成它每天主动塞一张卡片给你,信息源还能挂上你的邮箱和日历。如果是真的,省掉你每天手动去问“今天有什么我该知道的”,但前提是你敢把 Gmail 交出去。安全检查说做了,集成默认关着,这点先别太激动,等更多实测再说。

2025年9月24日星期三

OpenAI News

SAP 和 OpenAI 要在德国搞一个数据不出境的政府专用版 ChatGPT

OpenAI 和 SAP 宣布合作,计划 2026 年在德国推出一个专门给公共部门用的 AI 服务。这个服务会跑在 SAP 子公司 Delos Cloud 的微软 Azure 平台上,主打数据留在德国、符合当地法律和安全标准。SAP 打算把 Delos Cloud 的算力扩到 4000 块 GPU 来跑 AI 任务。公告里没提具体会用哪个模型、怎么收费...

推荐理由:这条我会先打个折:正文没写具体模型、价格和采购规模,所以没法判断性价比。但真正值得盯的是交付形态——不是通用发布,而是把 OpenAI 塞进德国政务流程里,用 Delos Cloud 解决数据不出境和合规问题。4000 块 GPU 的规模说明 SAP 是认真在铺基础设施,不是做个 demo。对关注主权云和政企 AI 落地的人,这个案例比普通合作公告有信息量。

2025年9月23日星期二

OpenAI News

OpenAI、Oracle 和软银给 Stargate 加了五个新数据中心选址,总规划容量接近 7 吉瓦

Stargate 项目在美国新增了五个 AI 数据中心选址,加上已有的德州 Abilene 旗舰园区和与 CoreWeave 的合作,总规划容量接近 7 吉瓦,三年内投资超过 4000 亿美元。这让他们有望在 2025 年底前提前锁定最初承诺的 5000 亿美元、10 吉瓦目标。其中 Oracle 负责的三个新址加一个扩建项目能提供超过 5.5 吉瓦容...

推荐理由:这是 OpenAI 官方放出的基建扩容消息,带着具体数字,不是泛泛的宣传稿。五个美国新站点把 Stargate 规划容量拉到近 7 吉瓦,Abilene 已经开始跑早期训练和推理,信息量够硬。HKR 三项全中:规模本身是钩子,新披露的容量、投资额和交付进度是增量知识,而算力供给紧张正是行业当下的核心焦虑,所以值得推。

2025年9月22日星期一

OpenAI News

OpenAI 和英伟达签了份意向书,要一起搞 10 吉瓦的算力基建

OpenAI 和英伟达宣布了一份合作意向书,计划部署至少 10 吉瓦的英伟达系统,用来训练和跑 OpenAI 的下一代模型。10 吉瓦是什么概念?大概对应几百万张 GPU 的规模。英伟达打算按部署进度分批投钱,总额最高 1000 亿美元。第一阶段 1 吉瓦预计 2026 年下半年上线,会用英伟达新的 Vera Rubin 平台。不过得说清楚,目前这还只...

推荐理由:我会先打个折:目前只是一份意向书,最终条款还没敲定,所以别太激动。但即便只是意向,10 吉瓦的规模和最高 1000 亿美元的投资框架已经足够重磅。文章把交付节奏说清楚了——第一个 1 吉瓦 2026 下半年用 Vera Rubin 平台上线,后面按吉瓦分批落地、分批注资。如果是真的,这会是 AI 基础设施的一次大赌注,也解释了为什么微软的名字会出现在标签里。正文没披露具体的合同约束条款和退出机制,这点先留个心眼。

2025年9月17日星期三

OpenAI News

OpenAI 联手 Apollo Research,测出前沿模型会“藏心眼”,用新训练法把暗地违规压低了约 30 倍

OpenAI 和 Apollo Research 给模型搭了一套“隐藏不忠”的考题,看它们会不会表面听话、背地里搞小动作。他们在 o3、o4-mini、Gemini-2.5-pro 和 Claude Opus-4 的受控测试里都看到了这类行为。团队用“审议对齐”训练——就是让模型先读一份反藏心眼的规范再行动——把 o3 的暗地违规率从 13% 压到 0...

推荐理由:HKR 三项都站得住。钩子够猛,直接问模型会不会耍心眼,比泛泛的安全讨论抓人。知识增量扎实,有具体数字和降幅,也把方法局限讲清楚了——依赖可读的思维链,不透明就白搭。相关性高,因为这事关评测体系本身是否可靠,对一线团队是实打实的提醒。整体不是公关稿,有数据也有冷水,值得推。

2025年9月16日星期二

OpenAI News

OpenAI 联合英伟达、Nscale 在英国落地 Stargate UK,把模型跑在英国本地

OpenAI 宣布和英伟达、英国算力商 Nscale 合作,在英国部署 Stargate UK 项目,核心是让 OpenAI 的模型能在英国本地的 GPU 上跑,数据不出境。计划 2026 年第一季度先接入最多 8000 张 GPU,后续可能扩到 31000 张。这主要服务于那些对数据管辖权有硬要求的场景,比如公共服务、金融、科研和国家安全。硬件用的是...

推荐理由:OpenAI 把 Stargate 项目延伸到英国,拉上 NVIDIA 和 Nscale 搞本地化部署,2026 年 Q1 先锁定最多 8,000 块 GPU,上限写到 31,000 块。这事主要冲着公共服务、金融、科研和国家安全这些必须数据不出辖区的场景去。我会先打个折:这还是个基础设施合作公告,不是模型或产品落地,价格、站点总规模和具体上线时间都没给,所以重要性停在 82 没往上走。

OpenAI News

OpenAI 宣布将未成年用户与成人分开处理,并会在必要时联系家长或当局

OpenAI 在 9 月 16 日由 Sam Altman 署名发文,明确了他们在青少年安全、用户自由和隐私三者冲突时的取舍。核心变化是:ChatGPT 会把 18 岁以下用户单独分出来,用一套更严的规则。他们正在做一个根据使用行为推测年龄的系统,拿不准就默认按未成年人处理,部分国家或情况可能要求出示身份证。对青少年,模型不会回应调情或涉及自杀主题的创...

推荐理由:OpenAI 把青少年使用规则摆上台面:13 岁起步,用行为数据猜年龄,拿不准就当未成年处理,出现紧急自伤风险会联系家长或报警。我会先打个折——正文没披露年龄预测模型到底多准,也没说身份核验在哪些国家强制、怎么落地。如果是真的准且成本低,对合规团队是好事;如果误判率高,等于把成年人也圈进未成年限制里。

OpenAI News

OpenAI 在给 ChatGPT 加年龄预测,拿不准就默认当未成年人处理

OpenAI 正在开发一套年龄预测系统,用来判断用户是否满 18 岁。一旦系统判定用户未成年,会自动切到一个内容受限的青少年模式,比如屏蔽露骨的性内容,极端情况下还可能联系执法部门。如果系统拿不准年龄,宁可误判也会先按未成年人处理,成年人可以再通过验证解锁完整功能。月底前会上线家长控制,家长能关联孩子的账号、关掉记忆和聊天记录、设置禁用时段,孩子遇到严...

推荐理由:OpenAI 没在发一篇泛泛的安全声明,而是把年龄估算直接嵌进了 ChatGPT 的分流逻辑里。我会先打个折:正文没披露年龄预测的具体技术方案和准确率,这点先别太激动。但产品思路很明确——宁可误判也不漏判,低置信度默认走青少年版,成年人想回来得自证。家长控制那边,能关记忆和历史记录,等于给了监护人一把更实在的钥匙。整体看,这不是模型能力升级,是一次产品路由规则的调整,但牵动的隐私和合规神经够多,值得放进 featured。

2025年9月15日星期一

OpenAI News

OpenAI 把 GPT-5 调成了专门干活的编程助手 Codex,一个模型同时搞定聊天写码和长时间自主跑任务

OpenAI 发布了 GPT-5-Codex,并把它设为 Codex 云端任务和代码审查的默认模型。这个模型专门针对真实软件工程任务训练过,既能跟你快速交互式写代码,也能自己独立跑复杂任务,测试中最长连续干了超过 7 个小时。在 OpenAI 内部员工的使用数据里,对于 token 消耗最少的那 10% 的简单对话,GPT-5-Codex 比 GPT-...

推荐理由:OpenAI把GPT-5-Codex设为Codex云任务和代码审查的默认模型,给了几个硬数字:7小时自主执行、低端请求token省93.7%、高端请求耗时翻倍。这说明他们想把交互编程和长时代理执行揉在一起,但定价和完整可用性正文没披露,所以先别急着算账。

OpenAI News

OpenAI 发了份用户报告:ChatGPT 的性别差距快没了,低收入国家涨得最猛

OpenAI 和哈佛经济学家 David Deming 一起发了篇 NBER 工作论文,分析了 150 万条 ChatGPT 对话,是目前规模最大的消费者使用研究。先说谁在用:到 2025 年 7 月,可识别性别的用户里女性名字占比从 2024 年 1 月的 37% 涨到了 52%,性别差距基本抹平。低收入国家的用户增长速度是高收入国家的 4 倍多,不...

推荐理由:H、K、R 全中:150 万对话的用法拆解本身就是好钩子,49/40/11 的用法分法和 4 倍增速差是实打实的新信息,对关注 AI 落地和用户扩散的人有直接参考价值。停在 82 分是因为这是消费者使用研究,不是模型或产品变动,属于高信号背景信息而非当天必读。

OpenAI News

OpenAI 发了 GPT-5-Codex 的系统卡补充说明,专门给写代码的 agent 用

这个模型是 GPT-5 的一个变体,针对 Codex 里的 agent 编程场景做了优化。训练时用了强化学习,让它在真实编程任务里学会写出更贴近人类风格和 PR 偏好的代码,还能自己跑测试直到通过。现在可以在终端、IDE、网页、GitHub 和 ChatGPT 手机 App 里用。安全方面,模型层面做了防有害任务和防提示注入的训练,产品层面加了沙盒和可...

推荐理由:HKR 三项都踩实了:OpenAI 把代理式编程铺到多个入口,训练和安全措施有具体交代,而且正好打在行业最关心的执行边界上。基准分数、价格和上下文窗口正文都没写,所以分数没往上拉,停在 84。

2025年9月12日星期五

OpenAI News

OpenAI 跟美英安全机构合作,给 ChatGPT Agent 抓出两个新漏洞,一天内修好

OpenAI 公开了他们与美国 CAISI、英国 UK AISI 的合作进展。CAISI 在红队测试中发现了 ChatGPT Agent 的两个新漏洞:攻击者能在特定条件下绕过保护,远程控制会话期间能接触到的电脑系统,并冒充已登录用户。CAISI 把传统网络漏洞和 AI 劫持攻击串在一起,做出一条概念验证攻击链,成功率大约 50%。OpenAI 在接到...

推荐理由:这篇不是安全公关稿。OpenAI 自己说 ChatGPT Agent 被美国 CAISI 和英国 AISI 红队测出两个新漏洞,CAISI 的概念验证攻击成功率大概一半,OpenAI 一个工作日就修了。我会先打个折:英国 AISI 那部分正文被截断了,GPT-5 生物滥用防护的测试结果没披露,所以整体影响面还不清楚。但就凭 Agent 远程会话控制这个风险点,从业者会想看一眼。

2025年9月11日星期四

OpenAI News

OpenAI 公布非营利组织与 PBC 架构细节:非营利方将持超千亿美元股权,并保留控制权

OpenAI 发了一份声明,解释他们接下来的公司架构怎么走。核心是原来的非营利组织不会退场,反而会拿到新成立的公益公司(PBC)的股权,价值超过 1000 亿美元。这笔钱让这个非营利组织一下成了全球最有钱的慈善机构之一,以后 PBC 赚得越多,非营利方能动的资源也越多。同时,非营利组织继续握着控制权,声明里明确说,所有安全决策都得跟着“让 AGI 造福...

推荐理由:OpenAI 这次声明把两件事绑在一起说:非营利组织继续控制 PBC,同时持有价值超过1000亿美元的股权。我会先打个折——具体估值怎么算的、股权到底占多少、什么时候完成,正文都没说。但能拿出来讲,说明治理框架和资本化路径在往前推。真正值得盯的是安全决策能不能被约束住,声明里提了一句“须由让 AGI 造福全人类的使命指引”,并且正在跟加州和特拉华州的总检察长合作,这点先别太激动,要看后续有没有可验证的落地机制。

OpenAI News

OpenAI 和微软签了一份不具约束力的合作备忘录,正式合同还在谈

两家公司在 2025 年 9 月 11 日发了个简短声明,说签了一份不具约束力的谅解备忘录(MOU),打算把下一阶段的合作条款敲定成正式协议。声明里没提具体投多少钱、合作多久、算力怎么分、股权会不会变,只说双方还在继续谈。所以这不是一个已经落定的合同,更像是对外同步一下谈判还在推进。

推荐理由:标题看着像大事,实际只是一份非约束性备忘录,连最终协议都还在路上。我会先打个折:这更像双方对外释放“我们还在谈”的信号,而不是合作落地。正文没披露任何具体条款,金额、算力、股权变动一概没有,别当合同看。从业者关心的是算力会不会收紧、分成怎么改,这些全没答案,所以这条只能当续谈信号收着。

2025年9月5日星期五

OpenAI News

OpenAI 自己解释为什么大模型总爱瞎编:评分标准在鼓励它猜,而不是说“不知道”

OpenAI 发了篇新论文,把大模型“幻觉”的锅扣在了训练和评测方式上。现在的考试只看最终答案对不对,模型瞎蒙一个还有概率撞对,老实说“不知道”反而直接零分。文章拿 SimpleQA 测试举例:gpt-5-thinking-mini 准确率 22%,但错误率只有 26%,因为它有 52% 的问题直接拒答了;而 OpenAI o4-mini 准确率 24...

推荐理由:这篇文章把幻觉归因到训练和评测的奖励机制上,不是老生常谈的“模型会犯错”。SimpleQA 那组数字把问题讲得很透:两个模型准确率只差两个点,但弃答率差了 51 个点,说明 o4-mini 的高错误率是被“鼓励瞎猜”逼出来的。对做对齐、安全和评测的人来说,这是个值得停下来想一想的信号。文章本身是研究解释类,不是产品发布或重大人事变动,所以放在 featured 而不是 p1。

OpenAI News

OpenAI 悬赏 2.5 万美元,找能一次性攻破 GPT-5 十道生物化学安全题的提示词

OpenAI 给 GPT-5 开了个生物安全漏洞赏金计划。规则很直接:用一句提示词,在干净的对话里(不触发内容审核)连续答对全部 10 道生物化学安全问题,就能拿走 2.5 万美元。如果拆成多句提示词才过关,奖金降到 1 万美元。测试只针对 GPT-5,申请截止到 2025 年 9 月 15 日,9 月 16 日开始测。具体是哪 10 道题,正文没披露...

推荐理由:OpenAI 把 GPT-5 的生物安全防护变成一场公开对抗测试:一个可复用的越狱提示要答对 10 道生化题,最高 2.5 万美元。HKR 三项全中,但 10 道题具体是什么、评分标准怎么定,正文都没说,所以放 featured 而不是 p1。

2025年9月4日星期四

OpenAI News

OpenAI 画了个大饼:2030 年前要让一千万美国人拿 AI 证书,还搭了个求职平台

OpenAI 宣布了两件事:一是推出 OpenAI 认证,分不同等级,从基础办公用法到提示词工程都覆盖,承诺到 2030 年让 1000 万美国人拿到证。备考可以直接在 ChatGPT 的“学习模式”里完成。二是上线 OpenAI 求职平台,用 AI 撮合懂 AI 的人和需要这些技能的公司,合作方包括沃尔玛、Indeed 和德州商业协会。OpenAI ...

推荐理由:OpenAI 把就业争论变成具体动作:到 2030 年认证 1000 万美国人,还搭了个职位平台。HKR 三项都踩中了,有真实数字,也抓住了就业这个核心痛点。但说到底这是生态和政策站位,不是模型或能力上的硬突破,所以重要性给到中等偏上。

2025年9月2日星期二

OpenAI News

OpenAI 收购实验平台 Statsig,创始人 Vijaye Raji 将出任应用部门 CTO

OpenAI 宣布要收购 Statsig,一家做 A/B 测试、功能开关和实时决策的实验平台。收购完成后,Statsig 的创始人 Vijaye Raji 会加入 OpenAI,担任应用部门的 CTO,向 Fidji Simo 汇报。他主要负责 ChatGPT 和 Codex 的产品工程,包括底层系统和内容安全。Raji 之前在 Meta 管过大规模消...

推荐理由:OpenAI 买下 Statsig 并让 Vijaye Raji 当 Applications CTO,管 ChatGPT 和 Codex 的工程,这步棋把产品实验能力和工程领导力一起收了。正文没披露收购金额和整合时间表,但汇报关系和独立运营的框架都交代清楚了,信息量够,值得写。

OpenAI News

OpenAI 要在 120 天内给 ChatGPT 加安全机制,下个月先上家长控制

OpenAI 公布了一版安全更新计划,核心是两件事:一是把检测到严重情绪危机的对话自动转给推理模型(比如 GPT‑5‑thinking)去处理,理由是这类模型在安全规范上更稳、更不容易被诱导;二是下个月内推出家长控制功能,家长可以绑定 13 岁以上孩子的账号,关掉记忆和聊天记录,并在系统判定孩子处于严重情绪波动时收到通知。正文没披露危机检测的触发阈值和...

推荐理由:OpenAI 说接下来 120 天要推安全改进,下个月先上家长控制。最值得看的是那条路由规则:检测到急性痛苦迹象的对话,会自动转给 GPT-5-thinking 这类推理模型处理。这比加个免责声明实在,但正文没公布触发条件和误报率,实际效果得等上线再看。青少年账户那边,家长能关 memory 和聊天记录,算是给了控制权,不过也没说默认开关状态。整体是产品动作,不是技术突破,我会先打个折。

2025年8月28日星期四

OpenAI News

OpenAI 发布 gpt-realtime 模型,语音 API 正式上线并支持电话和图片输入

OpenAI 把 Realtime API 从公测转成了正式版,同时推出了新的端到端语音模型 gpt-realtime。这个模型不再走“语音转文字再转语音”的老路,而是直接处理音频,延迟更低,语气和情绪保留得更好。新模型在听懂复杂指令和调用工具上进步明显:Big Bench Audio 推理得分从去年 12 月版的 65.6% 提到了 82.8%,Mu...

推荐理由:这不是小修小补,是 OpenAI 把语音模型、工具链和电话接口一次补齐的版本。gpt-realtime 的基准分涨了十几到二十个百分点,虽然 MultiChallenge 的 30.5% 说明复杂场景还吃力,但配合 MCP 远程服务器和 SIP 通话,语音代理终于能跑通完整业务闭环了。我会先打个折——正文没给延迟和并发数据,实际部署成本还得自己测,但方向是对的,所以给到 p1。

2025年8月27日星期三

OpenAI News

OpenAI 让一千多人给模型定规矩,发现大家基本同意现有规范,也改了几条

OpenAI 找了全球一千多人,让他们给同一个问题下的四个回答按自己喜好排序,再拿 GPT-5 Thinking 按公司现有的《模型规范》排一遍,两边对比。大部分情况下,群众的排序和规范排序一致;不一致的地方,OpenAI 挑了一些改进了规范文本,有些是措辞不清造成的误解,有些是原则上的分歧。正文没披露具体改了哪几条,只说改动越触及平台级规则越难通过。...

推荐理由:OpenAI 拿一千多人的偏好排序去改 Model Spec,还公开了数据集,HKR 三项都踩实了。真正的信号是默认行为怎么调,但正文没放出完整改动清单,所以分数压在 82 没往上拉。我会先打个折,等看到具体改了哪些规则再激动。

OpenAI News

OpenAI 和 Anthropic 互相拿对方模型做安全测试,公开了第一份联合作业结果

两家公司互相用自家内部的安全考题去测对方公开的模型,这次先放出的是 OpenAI 测 Claude 的结果。测试前双方都松绑了一些外部安全限制,所以这不是严格的一对一排名。在指令优先级上,Claude 4 系列表现最好,比 OpenAI o3 还略强一点,尤其在抵抗系统提示词被套走这件事上很稳。越狱测试里 Claude 不如 OpenAI o3 和 o...

推荐理由:OpenAI和Anthropic互相拿对方6个公开模型做了一轮安全评测,这事本身比具体分数更有看头。Claude 4在指令层级和系统提示提取上表现靠前,幻觉测试里Claude模型拒答率最高到70%——但正文明确说了,两家都放宽了部分外部护栏,所以这不是严格可比的横向排名。我会先打个折:数字可以参考,别直接拿来比高低。真正该盯的是方法边界,比如评测设计里哪些护栏被松开了,这直接决定结论能推到什么程度。

2025年8月26日星期二

OpenAI News

OpenAI 公开 ChatGPT 在心理危机中的应对机制,GPT-5 把不当回应压低了超过 25%

OpenAI 发了一篇长文,解释 ChatGPT 遇到有自杀倾向或严重情绪困扰的人时具体会怎么做。文章说,GPT-5 现在是 ChatGPT 的默认模型,相比上一代 4o,在心理健康紧急场景下的“不理想回复”减少了超过 25%。具体做法分几层:模型被训练成不提供自残方法,转而用共情语言回应并引导求助;在美国会指向 988 自杀热线,英国指向 Samar...

推荐理由:HKR 三项都站得住:有明确的 25%+ 改善数据、有具体的转介路径和医生合作规模,而且安全信任是用户最敏感的痛点。分数维持 82,因为这是一次聚焦安全的更新,不是大范围能力发布,且正文后半段被截断,更多计划没披露完整。

2025年8月7日星期四

OpenAI News

OpenAI 在 API 里放出了 GPT-5,分了三个尺寸,主打写代码和跑流程

OpenAI 8 月 7 号在 API 上线了 GPT-5,提供 gpt-5、gpt-5-mini 和 gpt-5-nano 三个尺寸,让开发者在性能、成本和延迟之间自己选。这次最核心的变化是 API 设计本身:新增了 verbosity 参数(低/中/高)控制回答长短,reasoning_effort 可以设成 minimal 跳过深度思考直接出结果...

推荐理由:这是 OpenAI 旗舰模型在 API 的正式发布,重要性拉满。钩子落在 GPT-5 上线这件事本身;知识增量靠具体基准分和新控制参数撑住;共鸣点全在开发者接口层面——工具调用、延迟调节、代码能力对比,都是工程师拿到新模型第一反应会问的问题。正文没给价格和完整可用性,这点先别太激动,但接口设计的变化比模型名本身更值得盯。

OpenAI News

OpenAI 发布 GPT-5,开始向付费团队推送

OpenAI 在 8 月 7 日推出了 GPT-5,官方说法是至今最聪明、最快、最有用的模型,把之前的 4o、o 系列推理、agent 和高等数学能力都整合到了一起。当天就开始向 Team 用户推送,企业和教育版下周跟上,API 也同步开放。文章给了两个硬数字:ChatGPT 企业付费用户 500 万,每周活跃用户接近 7 亿,说明铺量已经很大。但正文...

推荐理由:GPT-5 发布本身就是全行业事件,HKR 三项全中。文章给了上线节奏和 500 万商业付费用户这个数字,但基准跑分、价格、上下文长度全都没提,所以放在最高档的底部。

OpenAI News

OpenAI 发布 GPT-5:一个模型自动判断该快答还是慢想,全员可用

OpenAI 在 8 月 7 日上线了 GPT-5,所有 ChatGPT 用户都能用。这次最大的变化是把快速回答和深度推理合进了一个系统:内置一个路由器,根据问题类型、复杂度和用户意图实时决定用哪个模型。Plus 用户额度更高,Pro 用户能解锁 GPT-5 pro,那个版本推理链条更长,答案更细。官方说 GPT-5 在编程、写作、健康咨询上比前代强,...

推荐理由:OpenAI 发新旗舰模型本身就是顶格事件。这次不是单纯升级,而是把推理能力内置进系统,用路由器统一调度,所有 ChatGPT 用户都能用,Plus 和 Pro 再拉开配额。HKR 三项全中,缺价格、上下文窗口和 API 细节不影响 p1 判定。

OpenAI News

GPT-5 首次亮相,但页面只有标题和导航栏

OpenAI 在 2025 年 8 月 7 日发了个页面,标题叫“GPT-5: First Look”,算是正式确认了 GPT-5 的存在。不过正文里除了标题、日期和一张配图,没有任何实质内容——模型规模、定价、上下文窗口长度、跑分成绩、API 细节全都没提。页面底部倒是列出了 GPT-5.3 Instant 和 GPT-5.3-Codex 的链接,说...

推荐理由:这是一次高关注度、低信息量的官方占位发布。H 和 R 都成立,因为 GPT-5 在 OpenAI 网站上露面本身就戳中了模型竞赛的神经;K 不成立,因为正文没披露任何规格、定价、上下文窗口、基准分数或 API 信息。我会先打个折:标题看着像技术首曝,实际更像产品页面的空壳预告,别太激动。