跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 1221–1240 条 · 共 1,551 条

4月24日星期五

X · @dotey(宝玉)

OpenAI 发布 GPT-5.5,跑分涨了但延迟没变,还顺手发了 Codex

GPT-5.5 现在向 ChatGPT 付费用户和 Codex 开放,API 随后到。OpenAI 说它每 token 延迟跟 GPT-5.4 一样,但完成同样任务用的 token 更少,相当于能力涨了、效率也涨了。跑分上,Terminal-Bench 2.0 从 75.1% 提到 82.7%,FrontierMath Tier 4 从 27.1% 跳...

推荐理由:这是一次核心模型发布,带了基准、定价和百万 token 上下文,HKR 三项都踩中。标题说 API“很快”跟进,摘要里却已经给了 API 定价,这个不一致让我对时效性稍微打个折,但整体还是必须写的 p1 级别。正文最值得盯的是那句“同等智能下总 token 消耗约为前沿竞品编码模型的一半”——如果属实,成本优势不小,但没给出具体对比对象和测试条件,这点先别太激动。

TechCrunch · AI

OpenAI 发了 GPT-5.5,说是离“超级应用”又近了一步

OpenAI 在周四把 GPT-5.5 放出来了,官方说法是“最聪明、用起来最直观的模型”。总裁 Brockman 在媒体会上讲,这模型在多个方面能力都有提升,思考更快、更敏锐,而且花的 token 更少。他把这叫做迈向“更会干活的智能计算”的一步,也是未来“超级应用”的一块拼图。不过正文没披露模型规模、具体跑分、上下文窗口、定价和推送范围,所以这些提...

推荐理由:标题喊得挺响,但正文其实很空。GPT-5.5 发布了,能力有提升,可具体强在哪、贵不贵、一次能读多少字、跑分多少,全都没说。OpenAI 把它往“超级应用”的故事上靠,我会先打个折——这更像是一次产品路线表态,而不是一份能拿来评估的技术发布。对从业者来说,知道有这么个东西就够了,真正要盯的是后续怎么拆能力、怎么整合进 ChatGPT,以及定价会不会再涨。

Hacker News 首页

GPT-5.5 在漏洞挖掘上追平了没公开的 Mythos,而且人人都能用

安全公司 XBOW 用真实漏洞库测了 GPT-5.5,漏报率压到 10%,比 GPT-5 的 40% 和 Opus 4.6 的 18% 都低。更关键的是,GPT-5.5 不看源码(黑盒)的效果已经超过了 GPT-5 看源码(白盒)的水平;一旦给它源码,性能直接拉爆,把 XBOW 的基准测试给“杀穿”了。在模拟登录这类实操任务里,它登录成功的交互轮次只有...

推荐理由:我会先打个折:数据来自 XBOW 自家的漏洞基准,不是 OpenAI 官方发布,所以不能当定论。但信息量够硬——GPT-5.5 在黑盒条件下漏报率只有 10%,比 GPT-5 有源码时的 40% 低了一大截,也比 Opus 4.6 的 18% 强。视觉敏锐度 97.5%,登录目标系统需要的尝试次数直接砍半,说明模型在真实攻击链里的效率明显跳了一级。XBOW 把它类比成 Mythos 级别的能力,这点先别太激动,正文没披露测试环境是否隔离、样本量多大、有没有针对性微调。不过对做攻防和安全评估的人来说,这个信号足够盯紧了:模型在没看到源码的情况下已经能...

X · @OpenAI

OpenAI 发布 GPT-5.5,强调能干活、会检查,但没给参数和跑分

OpenAI 在 X 上宣布推出 GPT-5.5,已经接入 ChatGPT 和 Codex。官方说法是它面向实际工作和 agent 场景,能理解复杂目标、调用工具、自我检查,把更多任务从头跑到尾。我会先打个折:正文没披露参数量、价格、上下文窗口和任何基准测试结果,所以现在只能看到一句“新的智能形态”和“新的干活方式”,具体强在哪、贵不贵、跑多快都还不知道。

推荐理由:OpenAI 在 ChatGPT 和 Codex 上线 GPT-5.5,属于当天必须覆盖的发布。HKR 三项全中:新模型发布本身就有话题性,正文给出了 agent 工作流和工具调用的具体方向,对日常做 AI 应用的人有直接影响。我会先打个折——参数、价格、上下文窗口和基准分正文都没披露,所以重要性停在 92,不往上拉。真正值得盯的是落地链路,不是标题里的“新一类智能”。

The Verge · AI

OpenAI 发了 GPT-5.5,说写代码更强、也更省资源

OpenAI 在 4 月 23 号公布了 GPT-5.5,主打编程和调试能力,还能跨表格、文档这些工具干活。官方说它比上个月发的 GPT-5.4 效率更高,但正文没给出具体的跑分、上下文窗口大小和定价。我会先打个折——没看到实测数据之前,这些“更强更省”的说法还不好直接当真。

推荐理由:OpenAI 发新模型是当天该追的事,而且这次把效率、编程和工具调用捆成一个升级点来讲,HKR 三项全中。正文没披露价格、上下文窗口和基准分数,所以分数停在 87 而不是 90+。我会先打个折:没跑分、没定价,光说“更强”还差点意思,但工具调用和多步骤执行这个方向本身值得盯。

4月23日星期四

OpenAI News

OpenAI 发布 GPT-5.5:干活更利索,写代码、查资料、跨软件操作都能自己跑通

OpenAI 推出了 GPT-5.5,主打让模型自己规划、调用工具、检查结果,去完成写代码、做研究、分析数据这类跨步骤的复杂任务。官方说它在 Terminal-Bench 2.0 这类命令行测试上准确率达到 82.7%,比上一代高,而且完成同样任务用的 token 更少,推理延迟跟 GPT-5.4 持平。正文没给具体的上下文窗口、定价和 API 开放时...

推荐理由:OpenAI 发新模型是当天新闻,点击和行业关联都拉满,所以 H 和 R 没悬念。K 不成立是因为这篇只确认了名字和大致用途,真正该盯的可复现参数一个都没披露,信息密度撑不起 p1,放在 featured 更合适。

彭博科技

腾讯发布新基础模型,这是它从 OpenAI 挖来核心研究员后的首次大考

腾讯宣布了一次重大的基础模型升级,但正文没披露模型名称、参数量、跑分成绩和具体发布时间。这是它从 OpenAI 挖来一位顶尖研究员后,第一次把新模型拿出来亮相,所以外界很关注这次升级到底成色如何。

推荐理由:Bloomberg 的信源有分量,而且把腾讯这次模型发布直接说成是对 OpenAI 挖角成果的首次检验,所以 H 和 R 都站得住。K 过不了,因为全文除了“发了”之外,模型名、规模、基准成绩、上线时间一概没给,属于有钩子没肉。

新智元 · 公众号

Anthropic 在私募二级市场报价冲到 1.05 万亿到 1.15 万亿美元,首次超过 OpenAI 的约 8800 亿美元

这个数字来自私募二级平台(比如 Forge Global)上的报价,不是新一轮融资估值。三个月前 Anthropic 的融资估值还是 3800 亿美元,现在二级市场直接翻了三倍左右。市场给出的理由是流通股少、Claude Code 和收入增长势头猛。但正文没披露实际成交量、具体收入数字,也没公司官方确认,所以这个万亿身价更像少数交易撑起来的价格,先别太当真。

推荐理由:我会先打个折:这不是官方融资估值,而是私募二级平台的报价,成交量、收入规模和公司确认都没披露,所以别太激动。但信息本身有嚼头——它把 Anthropic 从三个月前 3800 亿的融资估值直接拉到万亿级别,背后是流通股少、Claude 产品势头和投资者情绪在起作用。对从业者来说,这更像一个市场温度计,而不是一张成绩单。

彭博科技

软银打算用持有的 OpenAI 股份做抵押,借 100 亿美元

软银在谈一笔 100 亿美元的贷款,抵押品是它手里的 OpenAI 股票。这属于保证金贷款,不是普通的公司债,说明软银在拿已有股权加杠杆继续押注 AI。正文没披露贷款期限、利率、抵押率,也没说这笔钱具体要花在哪。我会先打个折:100 亿这个数不小,但关键要看银行愿意按 OpenAI 估值打几折放款,这点目前还不清楚。

推荐理由:彭博给的是一个具体的融资信号,不是泛泛的“看好 AI”。软银要用 OpenAI 股份质押借 100 亿美元,这件事本身比金额更值得盯:它说明软银在继续加杠杆押注 AI,也间接给 OpenAI 的估值提供了一个压力测试场景。我会先打个折——正文没披露贷款条件,所以没法判断这笔钱是便宜还是贵、风险敞口多大。但质押融资这个动作,比单纯宣布再投一轮钱更能反映资本层面的真实判断。

OpenAI News

OpenAI 为 GPT-5.5 的生物安全漏洞开悬赏,最高 2.5 万美元

OpenAI 搞了一个针对 GPT-5.5 的生物安全漏洞悬赏计划,想找能一次性绕过五道生物安全题的通用越狱提示词。测试只能在 Codex Desktop 上进行,成功者可以拿到 2.5 万美元,部分突破也可能酌情给点小奖。申请从 2026 年 4 月 23 日开放到 6 月 22 日,测试窗口是 4 月 28 日到 7 月 27 日。不过正文没披露具...

推荐理由:OpenAI 给 GPT-5.5 开生物安全漏洞赏金,HKR 三项全中:钩子够尖锐,2.5 万美元封顶是实打实的数字,生物风险红队测试也确实是行业敏感点。分数停在 80,因为摘要没披露报名条件、评测协议、覆盖范围和截止时间,这些缺口让我没法给更高。

The Verge · AI

OpenAI 把能自己干活的定制机器人开放给团队用了

OpenAI 把 ChatGPT 里的“工作区代理”功能下放给了 Business、Enterprise、Edu 和 Teachers 套餐。团队现在可以搭一个定制机器人,让它自己在云端跑任务,比如上网搜产品反馈、整理成报告发到 Slack,或者在 Gmail 里草拟跟进销售的邮件。这跟以前一问一答的聊天不一样,机器人能直接进到业务流程里干活了。不过正...

推荐理由:OpenAI 把 ChatGPT 从聊天框推进到团队工作流代理,HKR 三项都踩中:钩子够强,文章补了计划覆盖和任务示例,也切中企业自动化需求。没给 P1 是因为价格、铺开细节和能力边界正文都没披露,我会先打个折。

X · @dotey(宝玉)

OpenAI 在 ChatGPT 里上线工作区智能体,能跨工具自动干活,目前只给付费企业用户试用

OpenAI 给付费企业版 ChatGPT 加了个叫“工作区智能体”的功能,你可以用自然语言描述一套工作流程,它就能在后台自动跑起来,比如筛选销售线索、汇总工单、定时出报告。它跟之前自定义 GPT 最大的区别是能直接连 Slack、Gmail、Salesforce 这些工具,不光读信息,还能动手更新工单、建文档、回消息。管理员可以设权限和审批节点,不是...

推荐理由:OpenAI 把 ChatGPT 从对话工具往企业工作流里推了一步,这次放出的工作区智能体可以跨多个常用办公软件自动执行任务,比如更新工单、回 Slack 消息。我会先打个折:目前还是研究预览,正文没写定价、调用次数上限和哪些地区能用,所以别急着算投入产出。但管理员侧的权限和审批设计是实打实的信号,说明 OpenAI 在认真考虑企业治理需求,这点值得盯后续落地细节。

Hacker News 首页

OpenAI 在 ChatGPT 企业版里上线了能自己干活的“工作区智能体”,目前是研究预览版

OpenAI 给 ChatGPT Business、Enterprise、Edu 和 Teachers 套餐加了一个叫 Workspace agents 的功能。你可以把它理解成在聊天工具里建一个能自动跑流程的助手:建一次就能共享给全团队,可以定时执行重复任务(比如整理销售线索、生成报表),也能直接操作 Slack、Google Drive、微软系应用...

推荐理由:OpenAI 放出了一个实打实的企业代理预览,HKR 三项全中:钩子是跨应用工作流自动化,正文给了治理控制的具体名目,又切中了企业采纳的核心顾虑。没给 P1 是因为价格、模型规格、上线时间全都没说,实际效果也还没验证,所以先打个折。

X · @OpenAI

OpenAI 在 ChatGPT 里加了“工作区 agent”,一个能跨工具、跨团队跑长任务的共享助手

OpenAI 发了一条推,说 ChatGPT 现在有 workspace agents,可以当成团队共享的助手,处理复杂任务和跑长时间的工作流。正文没披露具体支持哪些工具、怎么收费、什么账号能用、权限怎么管、什么时候推。我会先打个折:共享 agent 的协作边界才是关键,比如它能看到什么数据、谁能改它的指令,这些都没说,光看标题别太激动。

推荐理由:OpenAI 自己发的产品预告,共享代理这个方向比普通助手更新鲜,H 和 R 都站得住。但正文只给了概念,没给任何落地细节,所以 K 分不高,整体放在 featured 而不是更高。我会先打个折,等工具权限和定价出来再重新判断。

4月22日星期三

OpenAI News

OpenAI 给美国医生、执业护士和药剂师免费开放了临床版 ChatGPT

OpenAI 推出了一个专为临床工作设计的 ChatGPT 版本,主要用来辅助写病历、查文献和做医学研究。目前这个版本对美国境内经过身份验证的医生、执业护士、医师助理和药剂师免费开放。它能联网搜索经过同行评审的医学资料并给出引用来源,可以把病历摘要、转诊信、预授权申请这类重复性工作做成固定流程,还能在查资料的同时自动累积继续医学教育学分。正文没披露具体...

推荐理由:这条消息的钩子在于 OpenAI 开始直接拉个人临床用户,而不是只做机构生意。我会先打个折:正文没写模型版本、免费额度上限、上线时间和认证怎么走通,所以实际落地节奏还不清楚。但方向本身值得盯——医疗场景的 AI 工具以前多是医院买单、IT 部门部署,现在直接给一线医生、护士和药师免费入口,试用和反馈循环会快很多。覆盖的三类场景(临床、文档、研究)也说明不是单点功能,而是想嵌入日常诊疗流。这点先别太激动,等认证流程和实际使用限制出来再看,但准入逻辑确实在变。

OpenAI News

OpenAI 在 ChatGPT 里上线了团队版智能体,能自己跑流程、跨工具干活

OpenAI 给 ChatGPT 的企业版、教育版等付费计划加了一个叫“工作区智能体”的功能。你可以把它理解成能共享给整个团队用的自动化助手,背后由 Codex 驱动,在云端运行,人不在线它也能继续干活。它能跨多个工具(比如 Slack、CRM)执行多步骤任务,像自动筛选销售线索、写跟进邮件、每周五拉数据出报表、审核软件采购请求并生成 IT 工单。团队...

推荐理由:OpenAI 在 ChatGPT 里加了 workspace agents,等于把 Codex 塞进云端去跑跨工具的工作流,从纯聊天往团队自动化工作台又挪了一步。我会先打个折:正文没写价格、没列支持的工具、也没给延迟或成功率这些硬指标,所以重要性停在 86 分。H 打钩是因为从对话到 agent 的转变本身就有话题性;K 打钩是因为 Codex 驱动云端执行这个事实是新的,但信息缺口也明显;R 打钩是因为它直接踩在团队协作和自动化的关注点上,对做类似产品的团队会有压力。

OpenAI News

OpenAI 给 Responses API 加了 WebSocket,让 Codex 这类 agent 跑起来更快

OpenAI 发现,当模型推理速度从每秒 65 个 token 飙到近 1000 个 token 时,API 本身的处理开销反而成了拖慢 agent 循环的瓶颈。他们给 Responses API 加上了 WebSocket 支持,思路是把多次独立的 HTTP 请求换成一个长连接,在连接存活期间缓存住对话状态和可复用的上下文,只传新的工具调用结果,省掉...

推荐理由:这是 OpenAI 面向开发者的系统层更新:用 WebSocket 长连接加连接级缓存,把 agent 循环里反复建连、重复请求的开销压下去。HKR 三项都踩中了,但正文没给出延迟降了多少、吞吐多大、适合什么负载,所以只能算中等偏上的 featured,不能拉满。真正值得盯的是长连接怎么省掉往返成本,这不是换模型,是工程侧省钱省时间的优化。

FT · 科技

OpenAI 正谈着往一支私募股权合资基金里投最多 15 亿美元

OpenAI 打算掏钱当 LP,和私募股权机构成立一家合资公司,专门把 AI 塞进 PE 投的那些公司里干活。金额上限是 15 亿美元。这篇报道正文被付费墙挡住了,没披露合作方是谁、交易结构怎么搭、时间表怎么排。这跟发新模型没关系,更像是 OpenAI 在赌企业端落地——通过私募的钱和项目渠道,把自己的模型铺进更多传统行业。

推荐理由:FT 信源报出的 OpenAI 资本动作,15 亿美元上限给了 K 分,私募渠道的部署意图给了 H 和 R 分。合资方、结构和落地时间全缺,所以分数压在 80 出头:放 featured,不上头版。

Latent Space

OpenAI 发布 GPT-Image-2,图像生成模型开始能看懂文字、画 UI 和做排版了

OpenAI 正式推出了 GPT-Image-2,在 ChatGPT、Codex 和 API 里都能用。这次更新最明显的变化是文字渲染、排版和编辑能力大幅提升,能直接生成幻灯片、信息图、UI 稿和二维码,还支持多语言。模型分“思考”和“不思考”两个版本,思考版可以自己上网搜资料、生成多个候选图并自我检查。在 Arena 的图像排行榜上,GPT-Imag...

推荐理由:OpenAI 把 GPT-Image-2 同时铺到 ChatGPT、Codex 和 API,还特意强调 thinking 版本和文字渲染、布局编辑这些实用能力。Arena 上 Elo 1512、领先第二名 242 分,这个差距不小,说明在盲测里用户确实更愿意选它。我会先打个折——Arena 分数受采样和用户群影响,不能直接当绝对性能看,但三个第一同时拿下,至少说明在文生图这个赛道上它目前压了别人一头。对从业者来说,能不能稳定出可编辑、多语、带 QR 码的图,比单纯画质更重要,这条更新直接踩中了选型决策点。

X · @dotey(宝玉)

Anthropic 没发公告,悄悄把 Claude Code 从 20 美元 Pro 套餐里拿掉了

有人在 Anthropic 的功能对比表里发现,Pro 套餐对应的 Claude Code 一栏变成了叉号,多篇帮助文档也删掉了“Pro 套餐包含 Claude Code”的说法。但 Claude Code 产品页面和客服机器人还写着包含,部分 Pro 用户反馈目前仍能使用,正文没披露 Anthropic 的正式解释或生效时间。如果这个变更落地,开发者...

推荐理由:这条值得上 featured,因为门槛变化一旦落地,Claude Code 的入门价直接翻五倍,对个人开发者冲击不小。但 Anthropic 没给正式说明,生效时间和现有 Pro 用户怎么处理都不清楚,所以不往更高层级放。我会先打个折:正文没披露官方回应,现有信息都来自页面比对和用户反馈,这点先别太激动。