跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 1281–1300 条 · 共 1,551 条

4月10日星期五

X · @OpenAI

OpenAI 给 ChatGPT 加了个 100 美元/月的 Pro 档,主要给 Codex 重度用户用

OpenAI 新设了一个每月 100 美元的 Pro 订阅档,Codex 用量是 Plus 档的 5 倍,适合长时间、高强度的编程任务。这个档位保留了原 Pro 的全部功能,包括专属 Pro 模型以及 Instant 和 Thinking 模型不限次使用。到 5 月 31 日前有个限时活动,Codex 用量临时提到 Plus 的 10 倍。正文没解释为...

推荐理由:OpenAI 给 Pro 加了个每月 100 美元的新档位,核心是把 Codex 用量提到 Plus 的 5 倍,其他 Pro 功能不变。5 月底前有个临时福利,Codex 额度再翻倍到 10 倍,但我会先打个折,这只是限时促销。真正值得盯的是,他们开始把代码代理这种重度用法单独拿出来计费,说明以后高强度用 AI 写代码可能要多掏钱。正文没提新模型或技术突破,所以重要性主要落在定价信号上,对团队预算和工具选型有直接参考价值。

4月9日星期四

X · @op7418(歸藏)

小扎挖的团队交卷了:Meta 发 Muse Spark,多模态推理但暂不开源

Meta 把之前挖来的团队做的第一个模型 Muse Spark 放出来了。它原生支持多模态推理,能看图、用工具、展示视觉思维链,还能让多个 Agent 并行干活。有个叫“沉思”的模式,就是协调多个 Agent 一起推理。在 Artificial Analysis 上的跑分比 Gemini 3.1 Pro、GPT-5.4 和 Claude Opus 4....

推荐理由:大厂新模型发布,加上“挖角团队首秀”的故事线,HKR 三项全中。分数卡在 featured 门槛附近,因为文章只给了能力声明和相对排名,参数规模、定价、铺开时间和访问范围都没披露,我会先打个折。

X · @dotey(宝玉)

Anthropic 发布 Claude Managed Agents,把 Agent 开发的基础设施全托管到云端,现已公测

Anthropic 推出了一套托管 API,让开发者不用自己搭沙箱、管状态、做权限和链路追踪,直接定义任务和工具就能上线生产级 Agent。官方说从原型到上线能从几个月缩到几天。它支持长时间运行的会话(断线不丢进度)和多 Agent 协调(一个 Agent 能拉起其他 Agent 并行干活,后者还在研究预览阶段)。内部测试里,在结构化文件生成任务上,这...

推荐理由:Anthropic 把 Agent 的沙箱环境、长时运行会话和多 Agent 协调打包成一个公测 API,对开发者来说是个实打实的工作流更新。我会先打个折,内部测试的 10 个百分点提升要看具体场景,但 0.08 美元一小时的定价和标准 token 费分开算,成本结构很清晰。正文没披露多 Agent 协调的具体机制和失败案例,这点先别太激动。整体看,这不是一个模型更新,而是一个平台级动作,值得从业者盯一下。

4月8日星期三

X · @dotey(宝玉)

Hermes Agent 开源不到两个月 GitHub 星标近三万,核心卖点是会自己写技能、自我迭代的闭环学习引擎

Nous Research 今年 2 月底开源的 Hermes Agent,上线不到两个月 GitHub 星标接近三万,被社区看作 OpenClaw 的第一个真正对手。两者都是自托管、多模型、MIT 协议,但设计思路完全不同。OpenClaw 是网关,负责把聊天应用接到 AI agent;Hermes 是引擎,围绕 agent 怎么越用越强来设计。它最...

推荐理由:我会先打个折:目前证据主要来自社区反馈和少量个人试用,不是正式评测或大规模验证。但 H、K、R 三条都踩中了——开源热度够高,技能沉淀和记忆检索的机制讲得清楚,自托管学习型 agent 也确实戳到成本和工作流复用的神经。正文没披露安全五层的具体实现和长期稳定性数据,这点先别太激动。综合看,给 78 分合理,值得盯后续。

Latent Space

OpenAI 内部团队用 5 个月跑出一个零人工代码的项目,每天烧掉 10 亿 token

Ryan Lopopolo 的团队在 OpenAI 内部搞了个极端实验:5 个月里搭出一个超过 100 万行代码的仓库,所有代码全由 Codex 生成,合并前没有任何人工审查。他们每天消耗超过 10 亿 token,按市价估算大概一天要花 2000 到 3000 美元。团队的核心思路是,当 AI 写代码卡住时,不去教它怎么改 prompt,而是回头补上...

推荐理由:这篇是访谈转述,不是官方发布,所以我会先打个折。但内容确实有料:OpenAI Frontier 团队用 5 个月搭了个内部测试产品,代码库超 100 万行,每天消耗超 10 亿 token,合并前完全没人类写码也没人类审查。具体做法是把失败拆成缺能力、缺上下文、缺结构三类,然后用 Symphony 多代理编排、规格文档、测试、可观测性和 1 分钟内构建循环来兜底。真正值得盯的是他们说的那句话——流程重心从人审代码转到了人设计 harness。价格估算约 2000 到 3000 美元一天,但正文没披露独立验证,这点先别太激动。

4月7日星期二

MIT Technology Review · AI

经济学家说,判断 AI 会不会抢你饭碗,缺的不是任务清单,而是“降价后需求涨多少”的数据

芝加哥大学经济学家 Alex Imas 认为,现在大家用任务暴露度(比如 OpenAI 说房产中介有 28% 的工作能被 AI 干)来预测失业,基本没用。真正关键的数据是行业层面的价格弹性——也就是 AI 把成本打下来之后,降价能不能把需求拉到足够大,大到反而要多雇人。他举了个例子:一个写约会 App 的程序员用 AI 一天干完三天的活,公司成本低了,...

推荐理由:这篇文章没给新数据集,但把讨论从“暴露度”拽到了“价格弹性”上,思路值得留意。我会先打个折:正文没披露现成的全经济弹性数据,所以目前还是个框架,不是可操作的结论。OpenAI 那个 28% 暴露度数字和 Anthropic 用 O*NET 做对话比对是实在的锚点,让讨论没飘在空中。对关心岗位替代的从业者来说,这篇文章提醒你别只盯暴露度,需求侧的反应可能才是决定性的——这点先别太激动,但方向对。

4月3日星期五

X · @OpenAI

ChatGPT 上车了,现在能在 CarPlay 里用语音模式

OpenAI 把 ChatGPT 的语音模式搬进了 CarPlay,iPhone 用户升级到 iOS 26.4 以上就能在车里用。正文没提支持哪些国家、哪些车型,也没说功能有没有阉割,比如能不能连续对话、能不能读长文章。这次动作的重点是把对话入口塞进驾驶界面,不是发了新模型。

推荐理由:这次更新更像是一次分发渠道的扩展,而不是模型本身有什么变化。ChatGPT 出现在 CarPlay 里,意味着它开始抢占车载语音交互的位置,这点比功能细节更值得关注。不过正文没披露地区、车型和功能限制,实际落地范围还得再观察,先别太激动。

4月2日星期四

OpenAI News

OpenAI 收购了科技媒体 TBPN,把它放在战略部门下面

OpenAI 在 4 月 2 号宣布买下了 TBPN,一个每天直播的科技谈话节目,在硅谷挺火。收购后 TBPN 会归到 Chris Lehane 管的战略部门,但官方说会保留编辑独立,节目请谁、聊什么还是他们自己定。OpenAI 的 CEO Fidji Simo 在内部信里解释,公司不想用传统公关套路,需要一个真正能聊 AI 变化的场子,TBPN 正好...

推荐理由:这条消息能上 featured,是因为 OpenAI 买媒体这件事本身够反常,而且公告给出了具体的汇报线和编辑独立承诺,不是空穴来风。我会先打个折——交易价格、股权结构和整合时间表正文都没披露,所以它到不了模型发布或产品上线那种硬核级别,停在 82 分合理。

X · @dotey(宝玉)

OpenAI 二级市场遇冷,6 亿美元股票卖不掉;Anthropic 需求爆棚,买家备好 20 亿现金等着进场

彭博社报道,OpenAI 在二级市场挂了 6 亿美元的股票,结果一个买家都找不到,跟去年几天就被抢光的情况完全不同。交易平台 Next Round Capital 的创始人说,他几百个机构客户里没人愿意接。另一边,Anthropic 的股票却抢手得很,买家已经准备了约 20 亿美元现金,另一家平台 Hiive 上的需求登记超过 16 亿美元,平台方形容...

推荐理由:这篇彭博报道把 OpenAI 和 Anthropic 的二级市场处境放在一起比,反差够大:一边是 6 亿美元股份待售却找不到足够买家,另一边是 20 亿认购意向涌进来。数字本身就能说明问题——OpenAI 二级报价比上一轮估值打了约九折,Anthropic 反而溢价超五成。我会先打个折:这是市场传闻和报价,不是官方融资公告,所以不能当定论看。但信息量够,既有估值锚点又有流动性信号,还顺带提了 Anthropic 本周第二次安全事故和 Claude 源码泄露,给安全话题加了实锤。对关注资本流向和风险信号的从业者来说,这篇值得一读。

3月31日星期二

OpenAI News

OpenAI 完成 1220 亿美元融资,估值冲到 8520 亿

OpenAI 今天宣布完成了一轮 1220 亿美元的融资,投后估值 8520 亿美元。这轮由亚马逊、英伟达、软银领投,微软、a16z 等也继续跟投,还首次通过银行渠道向个人投资者募了超过 30 亿美元。公司同时把循环信贷额度提到了约 47 亿美元,但正文说目前还没动用。我会先打个折:这些数字主要说明 OpenAI 现在能调动的资金量级很大,但具体怎么花...

推荐理由:这篇东西挺奇怪的:OpenAI 发了一篇叫《加速 AI 下一阶段》的文章,但正文是空的,只有标题和链接。我会先打个折——它没披露任何产品、研究或政策细节,所以没法判断它到底想加速什么。标题本身有话题性,但信息量为零,这点先别太激动。

MIT Technology Review · AI

AI 健康工具越来越多,但没人说得清它们到底靠不靠谱

微软上线了 Copilot Health,亚马逊把 Health AI 从 One Medical 会员专属开放给所有人,加上年初 OpenAI 的 ChatGPT Health 和能调取健康档案的 Claude,面向普通人的 AI 健康问答成了大厂标配。微软说 Copilot 每天收到 5000 万个健康问题,需求确实摆在那里,尤其对看病不方便的人群...

推荐理由:这篇文章不是产品发布,而是趋势报道加安全质疑。我会先打个折:微软和 Amazon 都在推消费级健康聊天机器人,但正文没披露任何独立安全评测,六位受访学者也点出这个问题。Mount Sinai 的研究是全文最硬的信息——ChatGPT Health 会误判轻重,说明光靠公司自测基准不够。这点先别太激动,因为研究样本和具体方法正文没展开,但方向值得盯。整体看,信息量够、风险点明确,适合放进 featured。

3月25日星期三

MIT Technology Review · AI

AI 炒作指数:AI 上战场了

Anthropic 和五角大楼因为怎么把 Claude 模型武器化吵了一架,结果 OpenAI 用一笔被自家 CEO 称为“机会主义且草率”的交易截了胡。用户开始大批退订 ChatGPT,伦敦也爆发了迄今最大规模的反 AI 游行。讽刺的是,以伦理立身的 Anthropic,现在正帮着美军加速对伊朗的打击。另一边,AI 智能体在网上火了:OpenAI 挖...

推荐理由:这条放 featured 没问题,因为 H 和 R 都拉满了:模型供应商跟军方挂钩,话题性够强,也确实是行业神经。K 这边我会先打个折,正文没披露任何合同细节,连抗议规模都没提,所以别急着下结论说合作有多深。

OpenAI News

OpenAI 开了个安全漏洞赏金计划,专门收 AI 滥用和越权操作的问题

OpenAI 在 2026 年 3 月 25 日上线了一个公开的“安全漏洞赏金”计划,跟之前的安全漏洞赏金不同,这次专门盯着 AI 被滥用或绕过安全限制的场景。主要收三类问题:一是智能体(比如浏览器里的 ChatGPT Agent)被第三方提示词注入劫持,导致泄露用户信息或执行有害操作,复现率得超过 50%;二是模型输出里意外暴露了 OpenAI 自己...

推荐理由:这不是模型发布或能力升级,而是一次治理流程更新,所以放在低 featured 档。但 OpenAI 把 AI 安全漏洞悬赏公开化,还划出了代理风险、专有信息泄露这些具体受理项,同时明确排除普通越狱,等于给行业打了个样。我会先打个折:正文没披露赏金金额和实际处理时效,实际效果还得看后续执行。

3月24日星期二

OpenAI News

ChatGPT 把购物功能做成了视觉化比价工具,用 ACP 协议直接拉商品信息

OpenAI 给 ChatGPT 加了一套更直观的购物功能,你可以上传图片找同款、用对话筛预算和偏好,还能把商品并排比价格、评价和规格。背后靠的是他们扩展的 Agentic Commerce Protocol(ACP,一种让 AI 直接跟商家系统对接商品数据的协议),把商品信息实时拉进聊天界面。这次更新面向所有用户,免费版也能用。正文没披露具体覆盖了多...

推荐理由:OpenAI 放了个标题,说 ChatGPT 要支持商品发现,但正文没给任何细节。我会先打个折:功能机制、覆盖范围、具体数字一概没提,所以只能当个信号看。好处是官方亲自下场把聊天框变成购物入口,这点对行业触动很大;坏处是现在除了标题什么都没有,没法判断是真落地还是先占坑。

3月20日星期五

MIT Technology Review · AI

OpenAI 要造一个全自动 AI 研究员,先别急着喊“科学家要失业”

OpenAI 把“造一个全自动 AI 研究员”定成了接下来几年的北极星目标。首席科学家 Jakub Pachocki 跟 MIT Technology Review 聊了分两步走的计划:今年 9 月先搞一个“AI 研究实习生”,能独立啃一小批特定研究问题;2028 年再上完整的多智能体自动化系统。但正文没披露这个系统要怎么评估产出靠不靠谱、打算烧多少算...

推荐理由:HKR-H 落在“全自动研究员”这个具体到能让人立刻理解野心的钩子上,HKR-K 靠两个可验证的时间节点撑住信息量,HKR-R 则抓住了研究岗位替代和实验室军备竞赛这两条从业者最关心的线。没给 must-write 是因为正文没披露评测标准、算力预算和研究范围,目前只能算一个强路线信号,离可验证产出还有距离。

MIT Technology Review · AI

OpenAI 把全自动 AI 研究员定为未来几年的北极星,计划 9 月先上线一个能独立解决少量问题的实习研究员

OpenAI 首席科学家 Jakub Pachocki 说,公司正把所有资源押注在一个叫“全自动 AI 研究员”的目标上。这个系统不是单一模型,而是一套让多个 AI 智能体协作干活(multi-agent)的流程,能自己跑去啃又大又复杂的问题,比如数学猜想、生物化学实验设计,甚至商业和政策难题。他们给了个时间表:今年 9 月先做出一个“AI 研究实习生...

推荐理由:这篇是战略路线图报道,不是已发布产品,所以没给 p1。亮点在于 OpenAI 首次把“全自动研究员”拆成实习生版和多 Agent 版两步走,时间节点清楚,但正文没写成本、算力需求和怎么评判好坏,这些才是落地关键。我会先打个折,等看到能跑多久、任务拆得怎么样再调整判断。

3月19日星期四

Ben's Bites

怎么写一份不帮倒忙的 AGENTS.md?

AGENTS.md 是给 AI 助手预载的指令文件,但别把它写成项目地图。有研究指出,塞进技术栈、关键文件路径这类信息反而会拉低表现,还让 token 消耗多出 20%——这些东西模型自己翻翻代码就能搞清楚。更好的做法是只保留你的行为偏好和纠偏提示,比如“生成网页前先用内置浏览器测一下再给我链接”、“把计划文件统一写到 ~/项目名/plan/ 里”。文...

推荐理由:这篇讲的是怎么把 AGENTS.md 写小、写干净。核心判断很明确:别往里面塞技术栈和文件地图,只保留行为偏好,否则效果会变差,成本还能多出 20%。这个 20% 的数字来自一项研究,但正文没披露研究名称和实验设置,所以我会先打个折来看。可执行的部分挺实在,比如把 AGENTS.md 和 CLAUDE.md 做 symlink、用条件块区分简单网页和复杂应用、按文件夹动态加载,都是能直接抄作业的做法。对经常跟 coding agent 打交道的人来说,这比“多写点上下文”的直觉有用得多,本质是把常驻指令压到最小,减少每次调用的无效消耗。信息缺口在于...

OpenAI News

OpenAI 宣布要收购 Astral,把 Python 开发工具链拉进 Codex 生态

OpenAI 发公告说计划收购 Astral,这家公司做了 uv、Ruff、ty 这几个 Python 开发者很常用的开源工具,分别管依赖环境、代码检查和类型安全。收购完成后,Astral 团队会并入 Codex 团队,OpenAI 打算继续维护这些开源项目,同时让 Codex 能直接调用这些工具,把 AI 从写代码延伸到跑工具、改项目、验证结果这些开...

推荐理由:这条消息只有标题,正文是空的。OpenAI 收购 Astral 这件事,对看人才和产品线的人来说值得标记,但信息实在太少,我会先打个折。H 和 R 能过,因为收购本身就会牵动整合预期和行业解读;K 很弱,交易细节一片空白,别把标题当成能力发布或产品落地。

3月18日星期三

MIT Technology Review · AI

五角大楼计划让 AI 公司在机密数据上训练模型

五角大楼正在讨论建一个安全环境,让 OpenAI、xAI 这类公司用机密数据训练军用版大模型。以前这些模型只能在涉密环境里回答问题,不能拿数据去学习,这次是头一回允许直接“吃”进机密情报。训练会在认证过的数据中心进行,数据归国防部,公司人员只在极少数情况下、有安全许可才能接触。官方说会先用非机密数据(比如商业卫星图)做测试,看效果再推进。最大的隐患是泄...

推荐理由:我会先打个折:目前只是规划阶段的说法,不是已签合同、已拨预算或已部署的项目,所以分数没给到 85 以上。但 hook 很明确——用机密数据训练这件事本身就少见,加上有具体的评估门槛和数据所有权安排,信息量够。泄密风险那段尤其值得盯:同一个模型如果服务不同密级部门,训练时吃进去的机密信息可能被再次吐出来,正文没展开怎么防,这是个关键缺口。

3月17日星期二

OpenAI News

OpenAI 发了 GPT-5.4 mini 和 nano,主打编程和子任务,mini 跑得比 GPT-5 mini 快一倍多

OpenAI 在 3 月 17 号推出了 GPT-5.4 mini 和 nano,都是给高吞吐、低延迟场景用的轻量模型。mini 在编程、推理、看图、调工具上都比上一代 GPT-5 mini 强,速度还快了一倍多。跑分上,mini 在 SWE-Bench Pro 拿到 54.4%,跟大哥 GPT-5.4 的 57.7% 差距不大,但延迟低很多,适合需要...

推荐理由:这是 OpenAI 官方模型发布,不是小修小补。我会先打个折:虽然叫 GPT-5.4 mini,但别当它是 GPT-5.4 的完整缩小版,更像是一个专攻编码和子代理任务的轻量选手。真正值得盯的是它用更低价格和更快速度,把 SWE-Bench Pro 拉到 54.4%,离大模型只差 3.3 个百分点——这点先别太激动,正文没披露其他基准的对比,不知道通用能力缩水多少。nano 更极端,只走 API,价格压到输入 0.20 美元,明显是给大批量、简单任务准备的。整体看,OpenAI 在推‘够用且便宜’的代理专用模型,对频繁调用代码工具的场景挺省钱。