跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 1121–1140 条 · 共 1,551 条

5月6日星期三

新智元 · 公众号

GPT-5.5 Instant 成了 ChatGPT 的免费默认模型

OpenAI 把 GPT-5.5 Instant 设成了 ChatGPT 的默认模型,所有用户都能免费用。AIME 2025 的得分从 65.4% 涨到 81.2%,回答长度缩短了 30.2%,在高风险提示上的幻觉率比 GPT-5.3 Instant 低了 52.5%。Plus 和 Pro 的网页用户会先拿到聊天、文件和 Gmail 的个性化功能;AP...

推荐理由:我会先打个折:OpenAI 把 GPT-5.5 Instant 免费推给所有人,这件事本身就值得写。文章给了三个硬数字——AIME 2025 准确率涨了 15.8 个百分点、回复字数砍掉近三分之一、高风险幻觉少了一半多,说明新模型在推理和可靠性上都有明显提升,而且输出更省 token。对从业者来说,默认模型一换,日常使用成本和体验都会变,Plus/Pro 还加了聊天记录和 Gmail 个性化,这些改动直接踩在工作流上。正文没披露免费版的速度和并发限制,这点先别太激动,但整体信息量够,属于必须覆盖的更新。

Latent Space

GPT-5 用 11 分钟复现了物理学家的硬核论文,OpenAI 开始正经搞科研了

理论物理学家 Alex Lupsasca 聊了他怎么用 GPT-5 做研究。他先让模型做了道课本里的热身题,然后 GPT-5 只花了 11 分钟就复现了他一篇获奖级别的论文,这篇论文的发表日期在模型训练数据截止之后。后来,他加入 OpenAI 的科学团队,用 GPT-5.2 去算一个以前被认为不可能手算的胶子振幅公式,模型真给出了非零结果,团队花了三周...

推荐理由:Alex Lupsasca 在访谈里说,他们拿教材给 GPT-5 预热后,模型 11 分钟就复现了他论文里的结果;ChatGPT 又在一天内产出 110 页引力子计算,团队花了三周才验证完。我会先打个折:这是单人访谈,没有第三方复现,而且理论物理这个领域太窄,换到其他任务能不能跑通还不清楚。正文没披露验证过程中改了多少轮 prompt,也没说那 110 页里有多少是废话。所以先给 84 分,放在 featured 里,等有更硬的基准测试出来再调。

The Verge · AI

OpenAI 说 ChatGPT 默认模型 GPT-5.5 Instant 的幻觉问题少了一大截

ChatGPT 把免费用户和 Plus 用户的默认模型换成了 GPT-5.5 Instant。OpenAI 内部测试显示,在容易出高风险幻觉的提示上,它比上一代 GPT-5.3 Instant 的瞎编次数少了 52.5%;在被标记为“难聊”的对话里,不准确的说法也降了 37.3%。不过正文没披露测试集到底有多大,也没说这些“高风险提示”具体怎么定义的,...

推荐理由:OpenAI 把 ChatGPT 默认模型换了,还主动报了两个幻觉下降的数字,热点、新知、关联度都够。不过正文没给评测集规模和复现方法,我会先打个折——数字好看,但暂时没法独立验证。默认模型换人本身就是当天该推的料,所以还是给了 p1。

TechCrunch · AI

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,说在法律、医学、金融这些领域更少胡说八道

OpenAI 发了 GPT-5.5 Instant,直接替掉了之前的 GPT-5.3 Instant,成了 ChatGPT 的默认模型。公司说新模型在法律、医学和金融这些容易出错的领域减少了幻觉(也就是瞎编答案),同时保持了上一代的低延迟。但正文没披露任何跑分、具体降低了多少幻觉率、覆盖哪些用户、以及价格有没有变。

推荐理由:我会先打个折:OpenAI 把新模型直接设为默认,动作不小,但正文只给了定性描述,没披露幻觉降低的具体幅度、评测方法、覆盖地区或价格。对从业者来说,知道默认模型变了是刚需,但能不能立刻用上、省不省钱、稳不稳定,这些关键信息都还缺着。所以重要性给到 88,属于必须知道但还不能全信的那一档。

5月5日星期二

The Verge · AI

郭明錤爆料 OpenAI 正在给 ChatGPT 做手机,计划 2027 年初量产

天风国际分析师郭明錤说,OpenAI 正在加速推进一款 ChatGPT 手机,目标是 2027 年初开始大规模生产。这款手机会用联发科定制的天玑 9600 芯片,图像处理器(ISP)专门加强了 HDR 能力,可能是为了提升相机和视觉识别体验。不过,原文没提手机卖多少钱、长什么样、用什么操作系统。郭明錤的供应链爆料准确率不低,但 OpenAI 自己还没回...

推荐理由:HKR 三项全中,但消息源是郭明錤的供应链爆料,不是 OpenAI 官方发布。我会先打个折:正文没披露价格、外观和系统,这些关键信息全缺,所以重要性到不了必写级别。

OpenAI News

OpenAI 发布 MRC 网络协议,让超大规模 GPU 集群训练更抗断、更省电

OpenAI 把自家训练大模型用的网络方案 MRC(多路径可靠连接)通过 OCP 开源了。MRC 解决的是老问题:集群大到一定程度,网络抖动和链路故障会频繁卡死训练任务,GPU 空转烧钱。它的做法是把一次数据传输拆成几百条路径同时发(packet spraying),哪条路断了就在微秒级绕开,不用等全网重算路由。协议跑在 800Gb/s 网卡上,基于 ...

推荐理由:MRC 是个多路径可靠连接协议,简单说就是给 GPU 集群的通信多备几条路,一条断了还能走别的,训练不容易崩。OpenAI 通过 OCP 公开这个方案,对自建大规模训练集群的团队是个信号——他们可能也在解决类似的网络稳定性问题。但正文没给任何性能数据,延迟降多少、吞吐提多少、实际跑过多大的集群,全都没写。所以我会先打个折,这更像一个技术方向的路标,离能评估效果还差得远。

OpenAI News

OpenAI 把 ChatGPT 默认模型换成了 GPT-5.5 Instant,回答更准、废话更少

OpenAI 把免费用户和默认聊天用的模型升级到了 GPT-5.5 Instant。官方说这次更新主要干了三件事:回答更靠谱、更简洁,并且更能利用你之前聊过的上下文来贴合你的偏好。内部测试里,在医疗、法律、金融这类高风险问题上,GPT-5.5 Instant 比上一代 GPT-5.3 Instant 的幻觉内容少了 52.5%;在用户举报过的事实错误对...

推荐理由:HKR 三项全中:OpenAI 把 ChatGPT 默认模型切到了 GPT-5.5 Instant,说答案更准、幻觉更少、个性化控制更好,但没给任何评测数字、价格或上下文窗口,我会先打个折。这点先别太激动,等看到实测再判断。

OpenAI News

GPT-5.5 Instant 系统卡发布,这是 OpenAI 首个在网络安全和生化风险上被标为“高能力”的 Instant 模型

OpenAI 放出了 GPT-5.5 Instant 的系统卡,确认了模型代号是 gpt-5.5-instant。这篇公告主要是定性说明,没有给出具体的评测分数、上下文窗口大小或发布时间。值得留意的是,这是 Instant 系列里第一次在网络安全、生物与化学武器制备这两个风险类别上被提升到“高能力”等级,并配套了相应的安全防护措施。OpenAI 还特别...

推荐理由:我会先打个折:这张系统卡目前只有一个标题,正文什么都没披露。H 和 R 能过,是因为 OpenAI 官方放出 GPT-5.5 Instant 这个名字本身就够抓眼球,从业者会关心它跟现有模型的定位差异和价格。但 K 完全站不住——没有跑分、没有安全测试结果、没有上下文长度,连发布时间都没提,等于只有个壳。这点先别太激动,等后续有实际数据再重新评估。

r/LocalLLaMA

DeepSeek V4 Pro 在 FoodTruck Bench 上追平 GPT-5.2,晚了十周但成本只要十七分之一

Reddit 上有人发帖说,DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的智能体评测里排到第四,中位数得分跟 GPT-5.2 只差 3%,但跑一轮任务的成本大概是后者的十七分之一。这个评测跑了 30 天,模型要用 34 种工具、带持久记忆、每天还得做反思,比较贴近真实业务流程。帖子还提到小米的 MiMo v2.5 Pro ...

推荐理由:这篇是一个 Reddit 用户自己搭的 benchmark 结果,不是官方发布,所以我会先打个折。但内容本身挺有意思:DeepSeek V4 Pro 在一个叫 FoodTruck Bench 的 30 天 agent 测试里排第 4,跟 GPT-5.2 的中位数只差 3%,API 成本却低了大约 17 倍。测试用了 34 个工具、持久记忆和每日反思,不是简单的一问一答。小米 MiMo v2.5 Pro 也进了前 6,5 次全存活,中位 ROI 1019%,单次跑完只要 $2.41。正文没披露样本量和方差,所以“匹配 GPT-5.2”这个结论先别太激...

新智元 · 公众号

OpenAI 总裁当庭承认:自己没掏一分钱,就拿到了估值近 300 亿美元的股权

Greg Brockman 在法庭上承认,他获得 OpenAI 营利性子公司的股权时,自己没出任何现金。这部分股权现在价值超过 200 亿美元,接近 300 亿美元。听证会还挖出他和 Sam Altman 都持有芯片公司 Cerebras 的股份,而 OpenAI 先给了 Cerebras 一份 100 亿美元的订单,后来又追加到 200 亿美元,中间...

推荐理由:我会先打个折:信息来自单一庭审爆料,标题带点煽风点火的味道,但核心事实够硬——没投现金却拿天价股权、高管同时持有供应商股份、订单金额从100亿翻到200亿,这些数字把OpenAI非营利转营利的合规问题钉得很死。正文没披露交叉持股的具体比例和贷款条件,但现有信息已经足够让从业者重新审视这家公司的治理结构。

OpenAI News

OpenAI 给 ChatGPT 广告加了自助下单和按点击付费

OpenAI 开始在美国小范围测试自助广告后台,广告主可以直接注册、充值、上传素材、管理投放。同时新增了按点击付费(CPC)的出价方式,之前只有按千次展示付费(CPM),现在广告主可以只为用户点击买单。文章说 ChatGPT 对话里很多人正在做决策,点击能说明广告确实帮到了用户。测量工具也加了转化 API 和像素追踪,能看广告带来的购买、留资、注册等后...

推荐理由:OpenAI 把 ChatGPT 广告做成可自助采买的工具了,上线了 beta 版广告管理器,支持按点击付费,还补了测量工具。官方强调广告和对话数据是分开的,不会拿聊天记录去投广告。但正文没披露价格、投放范围,也没说什么时候全面开放,所以先打个折,这还是个中等体量的产品更新,别当重大商业化节点来读。

r/LocalLLaMA

本地跑 Qwen 给 Codex 当代码审查员、协作者和挑刺对手的实测

robert896r1 把 Qwen3.6 27B 的 GGUF 量化版放在 Codex 旁边当代码校验器,并放出了一套可复现的评测流程。测试覆盖了 Bartowski 和 Unsloth 两种量化来源、65k 和 128k 上下文窗口,以及 q8 和 f16 的 KV 缓存精度。三个 128k 上下文的配置并列最佳,在这个评测套件里没测出 q8 KV...

推荐理由:我会先打个折:这不是官方发布,是一个个人实测套件,样本量和覆盖面有限。但它的价值不在权威性,而在把 Qwen 塞进一个贴近真实开发的 sidecar eval 里——测的是漏指令、过度实现、UI 判断和长上下文遗漏,不是跑分。三个 128k profile 并列最佳,q8 KV 没翻车,这点对想省显存的人挺实用。正文没披露 Codex 的具体版本和调用方式,也没给错误分布,所以别当严谨 benchmark 用,更适合当一份本地部署的参考起点。

TechCrunch · AI

Cerebras 准备上市,估值可能冲到 266 亿美元,背后是跟 OpenAI 的深度绑定

AI 芯片公司 Cerebras 正在推进 IPO,目标估值至少 266 亿美元。它的核心卖点不是通用芯片,而是跟 OpenAI 绑得很紧的供应链关系。文章没披露 OpenAI 有没有持股、具体贡献了多少收入,也没说上市时间表。所以这轮估值更多是在赌 OpenAI 的算力需求会持续砸在 Cerebras 身上,而不是单纯看芯片本身的技术指标。

推荐理由:我会先打个折:正文其实没给出营收、持股和上市时间表,所以别把它当芯片概念股去追。真正有意思的是 OpenAI 供应链外溢出来的估值效应——一家靠绑定 OpenAI 起来的芯片公司能冲到 266 亿美元以上,说明市场在给 AI 算力渠道和合作关系定高价。这点先别太激动,但确实值得放进雷达里观察。

FT · 科技

OpenAI 总裁为转营利辩护,自曝持有 300 亿美元股份

OpenAI 总裁公开回应了公司从非营利转向营利的争议,并透露自己在这家公司的持股价值高达 300 亿美元。马斯克之前起诉说高管们为了个人利益出卖了慈善使命。不过这篇报道正文被付费墙挡住了,没披露这位总裁具体是谁、股权结构怎么设计、以及重组的具体条款。

推荐理由:OpenAI 总裁为营利化重组辩护,顺带曝出 300 亿美元持股,Musk 的诉讼正好咬住这点说高管为个人收益背离慈善使命。热度够高,当天就该推。但正文只有 RSS 摘要,连总裁是谁、股权怎么分、重组什么条件都没写,信息缺口太大,所以分数到不了 95 以上。

彭博科技

OpenAI 总裁 Greg Brockman 在法庭上承认,他手里的公司股份价值接近 300 亿美元

马斯克的律师在庭审中追问 Brockman,既然 OpenAI 最初是非营利机构,为什么他没把大部分收益捐给基金会的非营利部门。Brockman 当庭给出的数字是“接近 300 亿美元”。不过报道没披露他具体持股比例、这个估值是怎么算出来的,也没说案件现在走到哪一步了。

推荐理由:我会先打个折:正文只给了庭上追问和证词,没披露持股比例、估值怎么算的,也没说诉讼走到哪一步,所以信息缺口不小。但“近 300 亿”这个数字本身够炸,加上 Musk 律师直接喊话退钱,画面感强,对关注 OpenAI 治理和创始人财富的从业者来说是个值得追的信号。

5月4日星期一

TechCrunch · AI

Anthropic 和 OpenAI 同时成立合资公司,要把企业 AI 服务卖得更猛

两家公司都找了资产管理方合伙,成立合资公司来推企业级 AI 产品。具体是哪家资管、股权怎么分、定价多少、什么时候上线,正文都没披露。这种操作说明两家都在想办法把企业客户圈得更紧,但没看到实际条款之前,我会先打个折——合资公司到底是为了深度定制服务,还是换个渠道铺销售,现在还不好说。

推荐理由:我会先打个折:正文只给了 RSS 摘要,没写资管方名字、股权怎么分、定价和什么时候上线,所以现在只能看个方向。两家同时走合资这条路,说明他们想把企业销售这件事做得更重、更贴近大客户,但具体谁出钱、谁控盘还不清楚。这点先别太激动,等细节出来再判断实际影响。

新智元 · 公众号

DeepMind 用 AI 挑战 700 道数学难题,结果有一题题干是错的,AI 还硬写了数十页证明

Google DeepMind 搞了个叫 Aletheia 的流程,拿 Gemini Deep Think 去啃 700 道 Erdős 数学猜想。流程是先让模型生成 200 个候选答案,再用验证器筛到 63 个,最后产出 13 个原创解答。乌龙出在 Erdős-75 这道题上:题干本身就有问题,但 Aletheia 没发现,照样洋洋洒洒推导了几十页。...

推荐理由:我会先打个折:文章本身是媒体转述,原始论文细节得去看 arXiv,正文没披露验证器的具体设计和人类专家的复核标准。但选题确实抓人——一个题干有误的 Erdős-75 问题,AI 照样输出几十页证明,这比单纯报 benchmark 分数更能让人停下来想一下推理可靠性。700 个问题、13 个原创答案、200 到 63 的筛选管线,这些数字把流程讲清楚了,不是空泛的“AI 做数学”。对从业者来说,验证器能筛掉什么、筛不掉什么,才是真正关心的,文章至少把这个问题摆到了台面上。

5月3日星期日

r/LocalLLaMA

开源代理 rosetta-llm 让 Claude Code 能调用任意模型

DataNebula 开源了一个叫 rosetta-llm 的代理,它像一个翻译网关,让 Claude Code 可以跟不同厂商的模型对话。它负责把 Anthropic Messages、OpenAI Chat 和 OpenAI Responses 这三种接口格式互相转换,并且通过 signature 字段把加密的推理过程来回传递,保证多轮对话时不会丢...

推荐理由:这是个 Reddit 开源工具帖,没披露 star 数、实际用量或任何基准测试结果,所以我会先打个折。技术点本身有意思:用 signature 字段回传加密 reasoning,试图保住 thinking block 的保真度,让多轮 agent 的 prompt-cache 不失效——这点如果真跑通了挺省钱。但正文没给出验证数据,也没说支持哪些模型、延迟增加多少,目前只能当个有潜力的工具看,分数停在中等偏上合理。

r/LocalLLaMA

Upskill 开源了一个技能注册表,让 AI 代理动手前先查“说明书”,已收录超 1 万个技能

Autoloops 把 Upskill 做成了开源项目,相当于给 AI 代理配了一本可检索的技能黄页,目前索引了超过 1 万个技能。代理在干活前会先来这里查一下有没有现成的工具或流程可用。搜索靠的是 Postgres 全文检索、1024 维向量匹配,再按收藏数、安装量和反馈做重排序,尽量把靠谱的技能往前排。入库时有专门的对抗性审查,用大模型拦下了几百个...

推荐理由:Autoloops 这个 Upskill 开源项目,本质是给 Agent 配一个可查询的技能黄页,1 万+ 索引量不算大但起步够用。我会先打个折:正文没披露实际检索延迟和重排效果数据,也没说这 1 万+ 技能的质量分布,所以实用性还得看社区后续填充。安全侧的 LLM 对抗审查是个加分项,但拦截几百个技能这个数字本身说明不了漏检率。整体是个方向对、实现也实在的开源工具,Agent 开发者值得关注,但别指望开箱即用。

机器之心 · 公众号

百亿公司 CTO 们集体跳去 Anthropic 当一线工程师

机器之心这篇文章本来想盘点 2025 年 1 月到 2026 年 4 月间,至少六位从 Workday、You.com、Box、Super.com、Adept AI 等公司离职加入 Anthropic 做个人贡献者(IC)的前 CTO,但微信页面被环境异常拦截,正文内容完全看不到。从已有的英文摘要看,核心讨论点不是“为了 AGI 理想”,而是职业杠杆—...

推荐理由:这篇不是产品发布或模型更新,是篇评论,但切入点很巧。它没停留在“为了 AGI 理想”这种公关叙事,而是把重点放在职业杠杆上:当 CTO 不如在 Anthropic 当工程师划算,说明顶级 AI 公司里技术执行者的议价权在涨。我会先打个折,因为正文没给出这些 CTO 具体负责什么、薪资怎么变,但 6 个案例摆在那,趋势信号是清晰的。