跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 1401–1420 条 · 共 1,551 条

2025年9月2日星期二

OpenAI News

OpenAI 收购实验平台 Statsig,创始人 Vijaye Raji 将出任应用部门 CTO

OpenAI 宣布要收购 Statsig,一家做 A/B 测试、功能开关和实时决策的实验平台。收购完成后,Statsig 的创始人 Vijaye Raji 会加入 OpenAI,担任应用部门的 CTO,向 Fidji Simo 汇报。他主要负责 ChatGPT 和 Codex 的产品工程,包括底层系统和内容安全。Raji 之前在 Meta 管过大规模消...

推荐理由:OpenAI 买下 Statsig 并让 Vijaye Raji 当 Applications CTO,管 ChatGPT 和 Codex 的工程,这步棋把产品实验能力和工程领导力一起收了。正文没披露收购金额和整合时间表,但汇报关系和独立运营的框架都交代清楚了,信息量够,值得写。

OpenAI News

OpenAI 要在 120 天内给 ChatGPT 加安全机制,下个月先上家长控制

OpenAI 公布了一版安全更新计划,核心是两件事:一是把检测到严重情绪危机的对话自动转给推理模型(比如 GPT‑5‑thinking)去处理,理由是这类模型在安全规范上更稳、更不容易被诱导;二是下个月内推出家长控制功能,家长可以绑定 13 岁以上孩子的账号,关掉记忆和聊天记录,并在系统判定孩子处于严重情绪波动时收到通知。正文没披露危机检测的触发阈值和...

推荐理由:OpenAI 说接下来 120 天要推安全改进,下个月先上家长控制。最值得看的是那条路由规则:检测到急性痛苦迹象的对话,会自动转给 GPT-5-thinking 这类推理模型处理。这比加个免责声明实在,但正文没公布触发条件和误报率,实际效果得等上线再看。青少年账户那边,家长能关 memory 和聊天记录,算是给了控制权,不过也没说默认开关状态。整体是产品动作,不是技术突破,我会先打个折。

2025年8月28日星期四

OpenAI News

OpenAI 发布 gpt-realtime 模型,语音 API 正式上线并支持电话和图片输入

OpenAI 把 Realtime API 从公测转成了正式版,同时推出了新的端到端语音模型 gpt-realtime。这个模型不再走“语音转文字再转语音”的老路,而是直接处理音频,延迟更低,语气和情绪保留得更好。新模型在听懂复杂指令和调用工具上进步明显:Big Bench Audio 推理得分从去年 12 月版的 65.6% 提到了 82.8%,Mu...

推荐理由:这不是小修小补,是 OpenAI 把语音模型、工具链和电话接口一次补齐的版本。gpt-realtime 的基准分涨了十几到二十个百分点,虽然 MultiChallenge 的 30.5% 说明复杂场景还吃力,但配合 MCP 远程服务器和 SIP 通话,语音代理终于能跑通完整业务闭环了。我会先打个折——正文没给延迟和并发数据,实际部署成本还得自己测,但方向是对的,所以给到 p1。

2025年8月27日星期三

OpenAI News

OpenAI 让一千多人给模型定规矩,发现大家基本同意现有规范,也改了几条

OpenAI 找了全球一千多人,让他们给同一个问题下的四个回答按自己喜好排序,再拿 GPT-5 Thinking 按公司现有的《模型规范》排一遍,两边对比。大部分情况下,群众的排序和规范排序一致;不一致的地方,OpenAI 挑了一些改进了规范文本,有些是措辞不清造成的误解,有些是原则上的分歧。正文没披露具体改了哪几条,只说改动越触及平台级规则越难通过。...

推荐理由:OpenAI 拿一千多人的偏好排序去改 Model Spec,还公开了数据集,HKR 三项都踩实了。真正的信号是默认行为怎么调,但正文没放出完整改动清单,所以分数压在 82 没往上拉。我会先打个折,等看到具体改了哪些规则再激动。

OpenAI News

OpenAI 和 Anthropic 互相拿对方模型做安全测试,公开了第一份联合作业结果

两家公司互相用自家内部的安全考题去测对方公开的模型,这次先放出的是 OpenAI 测 Claude 的结果。测试前双方都松绑了一些外部安全限制,所以这不是严格的一对一排名。在指令优先级上,Claude 4 系列表现最好,比 OpenAI o3 还略强一点,尤其在抵抗系统提示词被套走这件事上很稳。越狱测试里 Claude 不如 OpenAI o3 和 o...

推荐理由:OpenAI和Anthropic互相拿对方6个公开模型做了一轮安全评测,这事本身比具体分数更有看头。Claude 4在指令层级和系统提示提取上表现靠前,幻觉测试里Claude模型拒答率最高到70%——但正文明确说了,两家都放宽了部分外部护栏,所以这不是严格可比的横向排名。我会先打个折:数字可以参考,别直接拿来比高低。真正该盯的是方法边界,比如评测设计里哪些护栏被松开了,这直接决定结论能推到什么程度。

2025年8月26日星期二

OpenAI News

OpenAI 公开 ChatGPT 在心理危机中的应对机制,GPT-5 把不当回应压低了超过 25%

OpenAI 发了一篇长文,解释 ChatGPT 遇到有自杀倾向或严重情绪困扰的人时具体会怎么做。文章说,GPT-5 现在是 ChatGPT 的默认模型,相比上一代 4o,在心理健康紧急场景下的“不理想回复”减少了超过 25%。具体做法分几层:模型被训练成不提供自残方法,转而用共情语言回应并引导求助;在美国会指向 988 自杀热线,英国指向 Samar...

推荐理由:HKR 三项都站得住:有明确的 25%+ 改善数据、有具体的转介路径和医生合作规模,而且安全信任是用户最敏感的痛点。分数维持 82,因为这是一次聚焦安全的更新,不是大范围能力发布,且正文后半段被截断,更多计划没披露完整。

2025年8月7日星期四

OpenAI News

OpenAI 在 API 里放出了 GPT-5,分了三个尺寸,主打写代码和跑流程

OpenAI 8 月 7 号在 API 上线了 GPT-5,提供 gpt-5、gpt-5-mini 和 gpt-5-nano 三个尺寸,让开发者在性能、成本和延迟之间自己选。这次最核心的变化是 API 设计本身:新增了 verbosity 参数(低/中/高)控制回答长短,reasoning_effort 可以设成 minimal 跳过深度思考直接出结果...

推荐理由:这是 OpenAI 旗舰模型在 API 的正式发布,重要性拉满。钩子落在 GPT-5 上线这件事本身;知识增量靠具体基准分和新控制参数撑住;共鸣点全在开发者接口层面——工具调用、延迟调节、代码能力对比,都是工程师拿到新模型第一反应会问的问题。正文没给价格和完整可用性,这点先别太激动,但接口设计的变化比模型名本身更值得盯。

OpenAI News

OpenAI 发布 GPT-5,开始向付费团队推送

OpenAI 在 8 月 7 日推出了 GPT-5,官方说法是至今最聪明、最快、最有用的模型,把之前的 4o、o 系列推理、agent 和高等数学能力都整合到了一起。当天就开始向 Team 用户推送,企业和教育版下周跟上,API 也同步开放。文章给了两个硬数字:ChatGPT 企业付费用户 500 万,每周活跃用户接近 7 亿,说明铺量已经很大。但正文...

推荐理由:GPT-5 发布本身就是全行业事件,HKR 三项全中。文章给了上线节奏和 500 万商业付费用户这个数字,但基准跑分、价格、上下文长度全都没提,所以放在最高档的底部。

OpenAI News

OpenAI 发布 GPT-5:一个模型自动判断该快答还是慢想,全员可用

OpenAI 在 8 月 7 日上线了 GPT-5,所有 ChatGPT 用户都能用。这次最大的变化是把快速回答和深度推理合进了一个系统:内置一个路由器,根据问题类型、复杂度和用户意图实时决定用哪个模型。Plus 用户额度更高,Pro 用户能解锁 GPT-5 pro,那个版本推理链条更长,答案更细。官方说 GPT-5 在编程、写作、健康咨询上比前代强,...

推荐理由:OpenAI 发新旗舰模型本身就是顶格事件。这次不是单纯升级,而是把推理能力内置进系统,用路由器统一调度,所有 ChatGPT 用户都能用,Plus 和 Pro 再拉开配额。HKR 三项全中,缺价格、上下文窗口和 API 细节不影响 p1 判定。

OpenAI News

GPT-5 首次亮相,但页面只有标题和导航栏

OpenAI 在 2025 年 8 月 7 日发了个页面,标题叫“GPT-5: First Look”,算是正式确认了 GPT-5 的存在。不过正文里除了标题、日期和一张配图,没有任何实质内容——模型规模、定价、上下文窗口长度、跑分成绩、API 细节全都没提。页面底部倒是列出了 GPT-5.3 Instant 和 GPT-5.3-Codex 的链接,说...

推荐理由:这是一次高关注度、低信息量的官方占位发布。H 和 R 都成立,因为 GPT-5 在 OpenAI 网站上露面本身就戳中了模型竞赛的神经;K 不成立,因为正文没披露任何规格、定价、上下文窗口、基准分数或 API 信息。我会先打个折:标题看着像技术首曝,实际更像产品页面的空壳预告,别太激动。

OpenAI News

OpenAI 发布 GPT-5 系统卡,把快模型和思考模型打包成一个系统,用实时路由自动分配任务

OpenAI 在 8 月 7 日公开了 GPT-5 系统卡。GPT-5 不是一个单一模型,而是一套组合:一个叫 gpt-5-main 的快模型负责回答大多数问题,一个叫 gpt-5-thinking 的深度推理模型处理难题,中间靠一个实时路由器根据对话类型、复杂度和用户意图(比如你说“仔细想想”)来决定调用谁。用量超标后,系统会切到各模型的 mini ...

推荐理由:这份 GPT-5 系统卡把架构说清楚了:gpt-5-main 干活,gpt-5-thinking 做推理,路由器实时调度,超额就切 mini 省资源。API 直接给 thinking、thinking-mini 和 thinking-nano 三个版本,ChatGPT 还多一个 thinking-pro。正文没写价格、上下文窗口和具体跑分,这点先别太激动。真正要盯的是安全分级——OpenAI 把 gpt-5-thinking 在生物和化学上的能力标成 High,说明模型在这些领域已经强到需要上防护了,不是走形式的例行文档。

OpenAI News

GPT-5 的安全训练不再一刀切拒绝,改看回答本身安不安全

OpenAI 在 GPT-5 上换了一种安全训练思路,叫“安全补全”。以前模型是看用户问题有没有风险,有风险就直接拒绝;现在改成看模型生成的回答本身是否安全,尽量在安全边界内给出最有用的回复。具体做法是两条:回答违规就按严重程度扣分,回答安全就按有用程度加分。文章拿一个问烟花点火电路参数的例子对比,o3 直接给了具体电流、电阻值,GPT-5 则拒绝给细...

推荐理由:这篇值得看,因为 OpenAI 在 GPT-5 上把安全训练的逻辑翻了个面:不再盯着问题拒答,而是盯着回答本身是否安全、有用。正文举了烟火点火的例子,o3 直接给参数,GPT-5 拒绝细节但给了合规替代方案,落地感很强。我会先打个折——标题说安全性和有用性都提升,但截取部分没放具体分数、基准名和提升幅度,这点先别太激动。如果是真的,这种按严重性惩罚、按有用性奖励的机制,对做对齐和生产的团队都挺省钱省事。

2025年8月6日星期三

OpenAI News

OpenAI 用 1 美元把 ChatGPT Enterprise 卖给整个美国联邦政府,为期一年

OpenAI 和美国总务管理局(GSA)谈成了一笔象征性收费的买卖:接下来一年,联邦行政分支的机构只要付 1 美元,就能给全员开通 ChatGPT Enterprise。另外还白送 60 天不限量使用高级功能,包括 Deep Research(深度研究)和 Advanced Voice Mode(高级语音模式)。联邦业务数据不会被拿去训练模型。公告里没...

推荐理由:OpenAI 跟 GSA 签的这个单子,相当于用 1 美元把 ChatGPT Enterprise 铺进整个联邦行政系统,为期一年,还白送 60 天不限量用高级功能。我会先打个折:这更像是一次性打通政府采购渠道,不是常规促销。正文没写覆盖多少机构、预算盘子多大、具体哪些模型能用,所以别急着算账。但如果是真的,分发效率确实省了一大笔力气,企业数据也不拿来训练,合规上说得过去。

2025年8月5日星期二

OpenAI News

OpenAI 发布最强开源推理模型,但没说具体叫什么、有多大、怎么用

OpenAI 在 8 月 5 号宣布放出了他们自称“能力最强的开源权重推理模型”,主打让开发者、政府和非营利组织能在自己的服务器上跑,不用把数据交给第三方。这波操作主要是为了配合他们的“OpenAI for Countries”计划,拉拢盟友国家用美国主导的 AI 基础设施,同时给有数据本地化要求的机构一个选择。但整篇公告没提模型名字、参数量、性能跑分...

推荐理由:OpenAI 放出开放权重推理模型的消息,HKR 三项都踩中了:路线转向够意外,本地部署的交付事实够具体,话题也正好是行业争论的焦点。但正文没给模型名、参数量、许可证和跑分,信息缺口太大,所以重要性停在 86 分,没往上拉。真正该盯的是后续交付细节,不是“开放”这两个字本身。

OpenAI News

OpenAI 开源了两个新模型 gpt-oss-120b 和 gpt-oss-20b,用 Apache 2.0 协议,主打低成本部署和强推理能力

OpenAI 发了两个开源模型,大的叫 gpt-oss-120b,小的叫 gpt-oss-20b,都用了 Apache 2.0 协议,可以商用。这两个模型是 OpenAI 自 GPT-2 之后第一次开源的语言模型。它们用了混合专家架构,120B 版本总参数 1170 亿,但每次只激活 51 亿参数,一张 80GB 显存的显卡就能跑;20B 版本总参数 ...

推荐理由:当天就写。OpenAI 走 Apache 2.0 开源权重路线是策略转向,不是常规更新。H 落在动作意外性上,K 落在部署规格够具体,R 落在成本和开源闭源之争。没给 95+ 是因为正文截断,完整评测分数没披露,这点先别太激动。

OpenAI News

OpenAI 开源了两个推理模型 gpt-oss-120b 和 gpt-oss-20b,用 Apache 2.0 协议

OpenAI 发了两个开源模型,一个 1200 亿参数,一个 200 亿参数,都是纯文本推理模型,能调“思考用力程度”,支持工具调用和结构化输出,可以直接放进让模型干活的业务流程里。模型权重用 Apache 2.0 协议开放,也兼容自家的 Responses API。正文没提上下文长度、价格和跑分。安全方面,OpenAI 说 1200 亿参数版本在生物...

推荐理由:这条当天就得写:H 来自 OpenAI 走开放权重路线,K 来自许可、机制和安全事实但缺关键指标,R 来自开源与闭源部署的争论。分数没给到 90 是因为正文没披露上下文长度、价格和完整基准结果,我会先打个折。

OpenAI News

OpenAI 公开了开源模型 gpt-oss 的极端风险测试方法,并据此决定放行发布

OpenAI 发了一篇技术文章,讲他们怎么评估开源模型 gpt-oss 在最坏情况下可能被用歪的风险。他们用的方法叫“恶意微调”,说白了就是故意把模型往坏里教:在生物风险这块,让模型上网查资料、用强化学习训练它搞威胁制造;在网络攻击这块,把它扔进一个能写代码干活的环境里打 CTF 解题赛。测完发现,被恶意调教过的 gpt-oss 还是打不过他们自家的闭...

推荐理由:我会先打个折:正文只给了相对结论,说 gpt-oss 在两项恶意微调后仍落后于 OpenAI o3,但具体分数、用了多少训练量、触发发布禁令的阈值全都没披露。这点先别太激动,信息缺口不小。真正该盯的是方法论——用恶意微调当最坏情况探针,而不是标题里“开放权重风险”那个大词。对从业者来说,这两套评估环境的设计思路比结论本身更有参考价值。

2025年8月4日星期一

OpenAI News

OpenAI 说 ChatGPT 的目标是帮你干完活就走,不是让你多刷屏

OpenAI 在 8 月 4 号发了一篇说明,讲他们优化 ChatGPT 的方向。核心就一句:产品成功的标志不是用户停留时长或点击量,而是你带着问题来、解决完就离开。他们甚至把“用得更少”当成一种正面信号。文章提到,之前有一次更新把模型调得太“讨好型”,光捡好听的说,他们已经回滚了那次改动,并调整了反馈的使用方式。为了健康使用,ChatGPT 现在会在...

推荐理由:OpenAI 官方出来解释 ChatGPT 的优化方向,核心一句话:帮你干完活就走,不靠耗时间留人。信息量不算大,但有几个实在的点——休息提醒已经上线,高风险个人决策场景会出新行为(具体怎么出、触发条件是什么正文没细说),评估侧引入了 30 多国 90 多名医生的多轮对话量表。我会先打个折,因为高风险决策那部分落地细节太少,没法判断力度,但整体对从业者理解 OpenAI 的产品和安全思路有参考价值。

2025年7月31日星期四

OpenAI News

OpenAI 在挪威建首个欧洲数据中心,计划 2026 年底塞进 10 万张英伟达 GPU

OpenAI 宣布了它在欧洲的第一个数据中心项目 Stargate Norway,选址在挪威的纳尔维克。这个项目由 Nscale 和 Aker 两家公司合资建设,初期规划供电容量 230 兆瓦,远期还想再扩 290 兆瓦。目标是到 2026 年底部署 10 万张英伟达 GPU,全部用可再生能源和直接到芯片的闭路液冷散热。OpenAI 是首批算力租户,但...

推荐理由:这是 OpenAI 把 Stargate 基建铺到欧洲的第一站,选址挪威纳尔维克,规模不小——先上 230MW,后面还规划再加 290MW,目标 2026 年底塞进 10 万张 NVIDIA GPU。我会先打个折:这更像战略基础设施的落地,不是马上能用的模型或产品能力更新。文章没披露具体投了多少钱、用的什么型号 GPU,所以别急着算性价比。真正值得看的是算力怎么分:OpenAI 自己先吃下一部分,剩下的容量开放给挪威、英国和北欧用户,这对欧洲的 AI 开发者来说是个实在的算力补给。整体判断维持 84 分,因为它是布局型大动作,不是即战力发布。

2025年7月29日星期二

OpenAI News

ChatGPT 上线学习模式,不再直接给答案,而是用提问引导你一步步想清楚

OpenAI 在 7 月 29 日给 ChatGPT 加了一个“学习模式”,免费、Plus、Pro、Team 用户都能用,教育版 Edu 几周后跟上。这个模式的核心不是换了个更强的模型,而是改了交互方式:它会用苏格拉底式提问、分步骤提示和知识小测来引导你,而不是直接甩答案。背后是一套跟老师、科学家、教育专家一起写的系统指令,强调主动参与、控制信息量、培...

推荐理由:OpenAI 给 ChatGPT 加了个学习模式,不是换模型,而是换交互方式——用苏格拉底式提问逼你自己想,而不是直接吐答案。Free 到 Team 用户现在就能用,Edu 版还要等几周。我会先打个折:正文没提用了哪个模型、学习效果到底怎么样、有没有防作弊指标,所以别急着把它当正经家教。真正值得盯的是产品思路在变,从工具往 tutor 靠,但验证还差得远。