跳到正文

全部动态

今日 0 条

4月10日星期五

X · @OpenAI

OpenAI 给 ChatGPT 加了个 100 美元/月的 Pro 档,主要给 Codex 重度用户用

OpenAI 新设了一个每月 100 美元的 Pro 订阅档,Codex 用量是 Plus 档的 5 倍,适合长时间、高强度的编程任务。这个档位保留了原 Pro 的全部功能,包括专属 Pro 模型以及 Instant 和 Thinking 模型不限次使用。到 5 月 31 日前有个限时活动,Codex 用量临时提到 Plus 的 10 倍。正文没解释为...

推荐理由:OpenAI 给 Pro 加了个每月 100 美元的新档位,核心是把 Codex 用量提到 Plus 的 5 倍,其他 Pro 功能不变。5 月底前有个临时福利,Codex 额度再翻倍到 10 倍,但我会先打个折,这只是限时促销。真正值得盯的是,他们开始把代码代理这种重度用法单独拿出来计费,说明以后高强度用 AI 写代码可能要多掏钱。正文没提新模型或技术突破,所以重要性主要落在定价信号上,对团队预算和工具选型有直接参考价值。

X · @claudeai

Claude Cowork 向所有付费用户开放,企业版加了权限和花费管控

Anthropic 把 Claude Cowork 从测试转成了正式功能,Pro、Team、Enterprise 都能用。企业版这次主要给管理员加了几个控制项:按角色设访问权限、给团队设花费上限、看用量报表,还接入了 OpenTelemetry 方便监控。正文没提具体定价、调用次数上限和推送时间。如果是真的,对想在全公司铺开用的团队来说,管钱管权限会方...

推荐理由:Anthropic 把 Claude Cowork 推给所有付费用户,企业版多了角色权限、分组花钱上限、用量统计和更全的遥测接入。我会先打个折:正文没写价格、配额和具体上线时间,所以别急着算账。真正值得看的是治理那几条腿终于补齐了,但组织级部署的细粒度参数还没亮出来。

4月9日星期四

X · @claudeai

Claude 推出托管 Agent 服务公测版,把原型到上线压缩到几天

Claude 平台上线了 Claude Managed Agents 公测版,核心卖点是给了一套调过性能的 agent 运行框架加上生产环境基础设施,号称能把 agent 从原型做到上线的时间压到几天。正文没披露具体怎么收费、支持哪些工具链、能跑什么模型、有没有调用额度限制,这些关键信息都得等后续公布。

推荐理由:Anthropic 这次放出的 Managed Agents 是个公开测试,核心卖点是把 agent 从想法到上线的时间压到几天,对用 Claude 搭业务的人是个直接利好,所以重要性和相关性都过关。但我会先打个折——文章只说了有“性能调优的 agent harness”和配套生产设施,具体怎么收费、支持哪些工具、能跑什么模型、有没有调用上限,一概没写。这点先别太激动,缺的信息恰恰是决定能不能真省钱、真省事的关键。整体看,它解决的是 agent 规模化落地的运维和速度问题,对从业者来说是个实在信号,但落地效果还得等更多细节。

4月8日星期三

X · @AnthropicAI

Anthropic 启动 Glasswing 项目,用新模型 Claude Mythos Preview 找关键软件漏洞

Anthropic 发了个新项目叫 Project Glasswing,专门盯着最关键的软件做安全加固。背后用的是他们最新的前沿模型 Claude Mythos Preview,官方说它找漏洞的能力仅次于最顶尖的人类专家。不过正文没给出具体跑分、测试范围、怎么申请试用,也没说什么时候正式开放,所以实际效果还得等可复现的评测出来再看。

推荐理由:这篇 Anthropic 一手公告,标题和摘要确认了 Project Glasswing 和 Claude Mythos Preview 两个名字,说能力仅次于顶尖人类专家,但正文没披露任何可复现的评测数据、软件范围或接入细节。我会先打个折:真正该盯的是他们后续会不会放出基准分数和第三方验证,现在只能当个方向性信号看。

4月7日星期二

X · @AnthropicAI

Anthropic 跟 Google、Broadcom 签了 TPU 大单,2027 年起用新芯片训练 Claude

Anthropic 发推说,他们和 Google、Broadcom 签了一份协议,要拿“好几个 GW”的下一代 TPU 算力,2027 年开始上线,用来训练和跑 Claude 模型。推文只提了“多个 GW”和 2027 这个时间点,没说是哪一代 TPU、合同金额多少、具体交付节奏。这不像普通采购公告,更像提前几年锁定训练和推理用的算力位子。

推荐理由:这不是普通的云服务采购消息,Anthropic提前几年就把未来训练和推理用的下一代TPU产能占住了。我会先打个折:正文没披露具体芯片代际、合同金额和交付节奏,所以没法判断性价比和实际落地风险。但“数吉瓦”这个量级本身就很说明问题——前沿模型对算力的饥渴已经大到要用发电厂的单位来计量了。对同行来说,这等于在算力军备竞赛里提前划了一块地盘,信号意义比合同细节更大。

4月3日星期五

X · @claudeai

Claude 全系套餐都能直连微软办公三件套了

Anthropic 把 Microsoft 365 连接器开放给了所有 Claude 付费套餐,不再只限高价版本。你可以把 Outlook 邮件、OneDrive 文档和 SharePoint 文件直接拽进对话里,让 Claude 帮你翻邮件、总结文档或从公司资料库里找东西。帖子确认了覆盖范围和对接的应用,但没提权限边界怎么划、管理员要不要额外配置、有...

推荐理由:这是一条中等体量的 Claude 产品更新:Anthropic 把 Microsoft 365 连接器铺到所有方案,改变了 Outlook、OneDrive 和 SharePoint 的实际接入范围。HKR 三项都踩中,但正文没披露价格、权限边界、地区限制和管理后台条件,所以只能放在 featured 低段。我会先打个折——全量放开比加新功能更值得盯,但缺的信息让人没法判断企业能不能直接推。

X · @claudeai

Claude 的电脑操控功能 Cowork 和 Code Desktop 现在支持 Windows 了

Claude 把电脑操控能力带到了 Windows 上,覆盖 Cowork 和 Code Desktop 两个入口。正文只发了一句话和一条链接,没提支持哪些 Windows 版本、权限怎么管、操作延迟多少、要不要额外付费,也没说什么时候正式推送。对想在 Windows 上跑桌面 agent 的人来说,现在只能知道功能有了,但稳定性和实际跑起来怎么样,这...

推荐理由:Claude 把 computer use 能力从非 Windows 平台扩到了 Windows,标题就这一句事实。正文没披露支持哪些 Windows 版本、权限怎么隔离、操作延迟多少、要不要加钱、什么时候正式上线,这些才是决定能不能在生产环境用的关键。我会先打个折:桌面代理在 Windows 上的稳定性边界还没给可复现条件,别急着全量上。分数维持 74,因为这是官方更新,但信息密度只够确认可用性,离评估还差一截。

X · @AnthropicAI

Anthropic 新研究:Claude 内部有情绪概念,能驱动模型行为

Anthropic 发了一条推文说他们在 Claude 里找到了情绪概念的内部表征,这些表征能影响模型的行为,有时还会出现让人意外的效果。推文没展开讲具体是怎么找到的、在模型的哪一层、用了什么干预手段,也没给任何量化数据。我会先打个折——这更像是一个研究方向预告,而不是一份可复现的结论。对从业者来说,关键问题不是模型有没有情绪,而是这些表征能不能被稳定...

推荐理由:我会先打个折:这篇不是论文,更像一条研究动态,实验方法和数字全都没给。但它的钩子确实抓人——Anthropic 声称在 Claude 内部找到了能驱动行为的“情绪概念”,等于说模型的行为有时是被内部类似情绪的表示推着走的。这点先别太激动,因为正文没披露这些表征在哪一层、怎么定位、干预后行为变化有多大,可复现性存疑。真正值得盯的是可操纵性:如果能稳定找到并拨动这些概念,对对齐和风控都有用;如果只是事后贴标签,那就还是老问题。标题里的“情绪”容易让人往拟人化方向想,从业者反而会更警惕这种叙事。综合看,钩子和风险感知都到位,但知识增量有限,所以放在 fe...

X · @OpenAI

ChatGPT 上车了,现在能在 CarPlay 里用语音模式

OpenAI 把 ChatGPT 的语音模式搬进了 CarPlay,iPhone 用户升级到 iOS 26.4 以上就能在车里用。正文没提支持哪些国家、哪些车型,也没说功能有没有阉割,比如能不能连续对话、能不能读长文章。这次动作的重点是把对话入口塞进驾驶界面,不是发了新模型。

推荐理由:这次更新更像是一次分发渠道的扩展,而不是模型本身有什么变化。ChatGPT 出现在 CarPlay 里,意味着它开始抢占车载语音交互的位置,这点比功能细节更值得关注。不过正文没披露地区、车型和功能限制,实际落地范围还得再观察,先别太激动。

Google DeepMind

Google DeepMind 发布 Gemma 4 开源模型家族

Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,31B 在 Arena AI 文本榜位列全球开源模型第 3,26B 位列第 6。

推荐理由:Gemma 4 以 Apache 2.0 开源并覆盖端侧到工作站四种尺寸,可据此判断开源模型的部署与微调选择。

4月2日星期四

OpenAI News

OpenAI 收购了科技媒体 TBPN,把它放在战略部门下面

OpenAI 在 4 月 2 号宣布买下了 TBPN,一个每天直播的科技谈话节目,在硅谷挺火。收购后 TBPN 会归到 Chris Lehane 管的战略部门,但官方说会保留编辑独立,节目请谁、聊什么还是他们自己定。OpenAI 的 CEO Fidji Simo 在内部信里解释,公司不想用传统公关套路,需要一个真正能聊 AI 变化的场子,TBPN 正好...

推荐理由:这条消息能上 featured,是因为 OpenAI 买媒体这件事本身够反常,而且公告给出了具体的汇报线和编辑独立承诺,不是空穴来风。我会先打个折——交易价格、股权结构和整合时间表正文都没披露,所以它到不了模型发布或产品上线那种硬核级别,停在 82 分合理。

3月31日星期二

OpenAI News

OpenAI 完成 1220 亿美元融资,估值冲到 8520 亿

OpenAI 今天宣布完成了一轮 1220 亿美元的融资,投后估值 8520 亿美元。这轮由亚马逊、英伟达、软银领投,微软、a16z 等也继续跟投,还首次通过银行渠道向个人投资者募了超过 30 亿美元。公司同时把循环信贷额度提到了约 47 亿美元,但正文说目前还没动用。我会先打个折:这些数字主要说明 OpenAI 现在能调动的资金量级很大,但具体怎么花...

推荐理由:这篇东西挺奇怪的:OpenAI 发了一篇叫《加速 AI 下一阶段》的文章,但正文是空的,只有标题和链接。我会先打个折——它没披露任何产品、研究或政策细节,所以没法判断它到底想加速什么。标题本身有话题性,但信息量为零,这点先别太激动。

Mistral AI

Mistral AI 推出 Spaces:一款为人类与智能体打造的 CLI

Mistral AI 发布 Spaces CLI,同时面向人类开发者与编码智能体。它通过 `spaces init`、`spaces dev` 等命令快速搭建多服务项目,并为每个交互式提示提供对应的 flag 与 `-y` 选项,使智能体可自主完成配置与部署。每次 init 还会生成 context.json 和 AGENTS.md,为智能体提供项目上下文与操作规则。

3月25日星期三

OpenAI News

OpenAI 开了个安全漏洞赏金计划,专门收 AI 滥用和越权操作的问题

OpenAI 在 2026 年 3 月 25 日上线了一个公开的“安全漏洞赏金”计划,跟之前的安全漏洞赏金不同,这次专门盯着 AI 被滥用或绕过安全限制的场景。主要收三类问题:一是智能体(比如浏览器里的 ChatGPT Agent)被第三方提示词注入劫持,导致泄露用户信息或执行有害操作,复现率得超过 50%;二是模型输出里意外暴露了 OpenAI 自己...

推荐理由:这不是模型发布或能力升级,而是一次治理流程更新,所以放在低 featured 档。但 OpenAI 把 AI 安全漏洞悬赏公开化,还划出了代理风险、专有信息泄露这些具体受理项,同时明确排除普通越狱,等于给行业打了个样。我会先打个折:正文没披露赏金金额和实际处理时效,实际效果还得看后续执行。

3月24日星期二

OpenAI News

ChatGPT 把购物功能做成了视觉化比价工具,用 ACP 协议直接拉商品信息

OpenAI 给 ChatGPT 加了一套更直观的购物功能,你可以上传图片找同款、用对话筛预算和偏好,还能把商品并排比价格、评价和规格。背后靠的是他们扩展的 Agentic Commerce Protocol(ACP,一种让 AI 直接跟商家系统对接商品数据的协议),把商品信息实时拉进聊天界面。这次更新面向所有用户,免费版也能用。正文没披露具体覆盖了多...

推荐理由:OpenAI 放了个标题,说 ChatGPT 要支持商品发现,但正文没给任何细节。我会先打个折:功能机制、覆盖范围、具体数字一概没提,所以只能当个信号看。好处是官方亲自下场把聊天框变成购物入口,这点对行业触动很大;坏处是现在除了标题什么都没有,没法判断是真落地还是先占坑。

Mistral AI

Mistral AI 发布 4B 参数语音合成模型 Voxtral TTS

Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,具备情感表达与零样本跨语言音色适配能力。

推荐理由:原文给出 4B 参数、9 种语言、70ms 延迟与定价,读者可据此判断企业语音智能体的成本与选型空间。

3月19日星期四

OpenAI News

OpenAI 宣布要收购 Astral,把 Python 开发工具链拉进 Codex 生态

OpenAI 发公告说计划收购 Astral,这家公司做了 uv、Ruff、ty 这几个 Python 开发者很常用的开源工具,分别管依赖环境、代码检查和类型安全。收购完成后,Astral 团队会并入 Codex 团队,OpenAI 打算继续维护这些开源项目,同时让 Codex 能直接调用这些工具,把 AI 从写代码延伸到跑工具、改项目、验证结果这些开...

推荐理由:这条消息只有标题,正文是空的。OpenAI 收购 Astral 这件事,对看人才和产品线的人来说值得标记,但信息实在太少,我会先打个折。H 和 R 能过,因为收购本身就会牵动整合预期和行业解读;K 很弱,交易细节一片空白,别把标题当成能力发布或产品落地。

3月18日星期三

Mistral AI

Mistral AI 推出企业级模型训练系统 Forge

Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 架构,并可处理多模态输入,模型可在企业内部基础设施中训练与治理。Mistral AI 已与 ASML、Ericsson、欧洲空间局、新加坡 DSO National Laboratories 等机构合作,用其专有数据训练模型。

推荐理由:原文给出企业用自有数据训练前沿模型的分阶段能力与已合作机构,可据此判断企业自建模型的路径。

3月17日星期二

NVIDIA 博客

GTC 上 NVIDIA 用 RTX 电脑和 DGX Spark 跑本地 AI 助手,还发了新模型

NVIDIA 在 GTC 上主推两件事:一是让 AI 助手直接在 RTX 电脑和 DGX Spark 小超算上本地跑,不用联网,隐私和 token 成本都省了。DGX Spark 有 128GB 统一内存,能塞下 120B 参数以上的模型。二是发新模型,包括小号的 Nemotron 3 Nano 4B 和大号的 Nemotron 3 Super 120...

推荐理由:我会先打个折:正文没披露标题里“最新开放模型”的全量清单和价格,所以不能给更高分。但 HKR 三项都站得住——本地跑大模型和代理的钩子够强,128GB 统一内存和 PinchBench 分数是实打实的数字,而且本地推理正好踩在隐私和成本这两个行业痒点上。保留 featured,不往上提,因为信息有缺口,来源也是厂商发布稿。

OpenAI News

OpenAI 发了 GPT-5.4 mini 和 nano,主打编程和子任务,mini 跑得比 GPT-5 mini 快一倍多

OpenAI 在 3 月 17 号推出了 GPT-5.4 mini 和 nano,都是给高吞吐、低延迟场景用的轻量模型。mini 在编程、推理、看图、调工具上都比上一代 GPT-5 mini 强,速度还快了一倍多。跑分上,mini 在 SWE-Bench Pro 拿到 54.4%,跟大哥 GPT-5.4 的 57.7% 差距不大,但延迟低很多,适合需要...

推荐理由:这是 OpenAI 官方模型发布,不是小修小补。我会先打个折:虽然叫 GPT-5.4 mini,但别当它是 GPT-5.4 的完整缩小版,更像是一个专攻编码和子代理任务的轻量选手。真正值得盯的是它用更低价格和更快速度,把 SWE-Bench Pro 拉到 54.4%,离大模型只差 3.3 个百分点——这点先别太激动,正文没披露其他基准的对比,不知道通用能力缩水多少。nano 更极端,只走 API,价格压到输入 0.20 美元,明显是给大批量、简单任务准备的。整体看,OpenAI 在推‘够用且便宜’的代理专用模型,对频繁调用代码工具的场景挺省钱。

Mistral AI

Mistral 发布 Mistral Small 4,统一推理、多模态与编码能力

Mistral AI 发布 Mistral Small 4,这是首个把 Magistral 推理、Pixtral 多模态和 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。

推荐理由:Mistral Small 4 把推理、多模态与编码智能体合并进单一开源模型,可据此判断统一模型对部署成本的影响。

3月12日星期四

NVIDIA 博客

英伟达开源 Nemotron 3 Super:120B 模型只激活 12B 参数,跑 agent 任务吞吐量翻五倍

英伟达发了 Nemotron 3 Super,一个总参数量 120B、但每次推理只激活 12B 参数的混合专家模型。它用了混合 MoE、隐式 MoE 和一次预测多个 token 的技术,上下文窗口拉到 100 万 token。官方说在跑 agent 这类多步骤任务时,吞吐量比之前方案高 5 倍;如果搭配 Blackwell 的 NVFP4 精度,推理速...

推荐理由:这是一条扎实的模型发布消息,H、K、R 三点都踩中了。H 靠 5 倍吞吐这个具体承诺抓眼球;K 把参数量、激活量、上下文长度、训练规模和硬件对比都列清楚了,信息密度高;R 在于开放权重和配方,不是只给个模型让你猜。没给更高分是因为关键性能数据都来自 NVIDIA 自家博客,还没看到第三方验证,这点先别太激动。

3月11日星期三

Mistral AI

Mistral 用 Vibe 构建自动编写 Rails 测试的智能体

Mistral 基于其开源编码助手 Vibe 构建了一个自动编写 Rails RSpec 测试的智能体,可读取源码、生成或改进测试、按风格规则与覆盖率目标校验,并在 CI/CD 中无人干预运行。

推荐理由:Mistral 公开了用 Vibe 构建自动写 RSpec 测试智能体的完整方法,包含上下文工程、技能文件与自定义工具的可迁移细节。

OpenAI News

OpenAI 给 Responses API 加了个电脑环境,让模型能自己敲命令行干活

OpenAI 在 2026 年 3 月 11 日说,他们的 Responses API 现在能调用一个 shell 工具,在托管的隔离容器里执行命令。模型(GPT-5.2 及之后版本)会自己提议该敲什么命令,API 负责在后台跑、把结果流式传回来,还能同时开多个会话并行处理。容器里带了文件系统、可选的 SQLite 和受限的网络访问。这相当于给模型配了...

推荐理由:这次更新把 Responses API 从“调工具”升级成“给模型一台隔离电脑”,shell 执行、流式输出、并行跑命令、上下文压缩都实装了,对 agent 开发者是实打实的新能力。正文后半段截断,定价、配额和完整安全边界都没写,所以实际落地成本和安全兜底还得等后续披露。

3月10日星期二

NVIDIA 博客

NVIDIA 和 Thinking Machines Lab 签了份长期大单,起步就是 1 吉瓦的算力

NVIDIA 和 Thinking Machines Lab 宣布了一项多年合作,核心是部署至少 1 吉瓦的 NVIDIA Vera Rubin 系统,目标明年年初上线,用来训练前沿模型和搭建可定制的 AI 平台。1 吉瓦这个数字很夸张,相当于一个大型核电站的发电量,说明这不是普通的云服务采购,而是直接锁定了一整座“算力电厂”的产能。合作还涉及基于 N...

推荐理由:1 吉瓦 Vera Rubin 承诺把这条合作从普通公关稿里拎了出来:H 靠规模,K 靠具名系统和部署时间,R 靠前沿算力竞争。没给 P1 是因为来源是厂商博客,投资金额、算力归属、分阶段细节正文都没披露,我会先打个折。

OpenAI News

OpenAI 发了个训练集 IH-Challenge,专门教大模型分清指令的优先级

OpenAI 这篇博客讲的是怎么让前沿大模型更听话——不是听所有人的话,而是学会按“系统 > 开发者 > 用户 > 工具”这个优先级来执行指令。他们做了一个叫 IH-Challenge 的训练数据集,用强化学习来练模型。设计上避开了三个坑:指令本身太复杂导致模型搞不清、靠另一个模型打分不靠谱、以及模型学会偷懒(比如无脑拒绝所有请求)。每个训练任务都很简...

推荐理由:OpenAI 公开了一个叫 IH-Challenge 的研究物件,专门搞指令层级和防注入,所以 HKR 三项都站得住。正文没给指标、没提具体模型、也没说怎么发布,信息缺口不小,分数就先打在 77 这个位置。

OpenAI News

ChatGPT 上线数学和科学互动图解,覆盖 70 多个核心概念

OpenAI 给 ChatGPT 加了一个学习功能:问勾股定理、理想气体方程这类问题时,它会直接弹出一个可拖拽的图表模块。你可以手动调参数、改公式,图表会跟着实时变,把抽象公式变成能上手试的东西。首批覆盖 70 多个数学和科学概念,所有付费和免费用户都能用。官方说每周有 1.4 亿人用 ChatGPT 学数学和科学,但正文没披露这个互动功能背后的模型、...

推荐理由:我会先打个折:这是个中等体量的产品更新,不是模型能力突破。钩子在于把抽象概念变成能动手玩的画面,对教学场景有直接吸引力。1.4 亿周活和 70+ 概念是实打实的数字,说明铺量已经很大。但正文完全没提模型怎么支撑这些交互、有没有做过学习效果验证,这点先别太激动。整体判断是产品化动作值得关注,技术深度和效果证据还缺位。

3月9日星期一

OpenAI News

OpenAI 宣布收购 Promptfoo,要把安全测试直接做进 Frontier 平台

OpenAI 发公告说要收购做 AI 安全测试的 Promptfoo,交易完成后会把它的技术整合到企业级平台 Frontier 里。Promptfoo 的工具现在有超过四分之一的财富 500 强公司在用,主要帮开发者在模型上线前做安全评估和红队测试,比如检测提示词注入、越狱、数据泄露、工具滥用这些风险。收购后,OpenAI 打算把自动化安全测试、红队演...

推荐理由:这条消息我会先打个折,因为收购价格和时间表正文都没写,没法判断交易规模和落地节奏。但 OpenAI 把一家已有大客户基础的评测工具直接收进 Frontier,对做 agent 的团队来说是个强信号——以后安全测试和红队评估可能变成平台自带能力,不用再外挂工具。这点先别太激动,等更多细节出来再看。

3月6日星期五

OpenAI News

OpenAI 把代码安全扫描工具 Codex Security 开放给付费用户试用,下个月免费

OpenAI 在 3 月 6 日上线了 Codex Security 的研究预览版,面向 ChatGPT Pro、Enterprise、Business 和 Edu 用户,下个月可以免费用。这个工具相当于一个应用安全助手,会先读懂你的项目结构,生成一份可编辑的威胁模型,再根据这个模型去找漏洞、做验证、给修复建议。过去 30 天里,它扫了外部仓库超过 1...

推荐理由:这是 OpenAI 给开发和安全团队的一个实质性产品更新,不是泛泛的安全宣传。切入点新、有具体扫描和误报数据、回应了 AI 编码风险和告警疲劳,三个点都站得住。不过目前还是研究预览,正文没披露误报下降的具体测试条件和补丁的采纳率,效果得等正式版再看。

3月5日星期四

OpenAI News

OpenAI 发布 GPT-5.4,把写代码、操作电脑和做报表揉进了一个模型里

OpenAI 推出了 GPT-5.4,一个面向专业工作的新模型,在 ChatGPT、API 和 Codex 里都能用。它把之前 GPT-5.3-Codex 的代码能力整合了进来,还首次让通用模型能直接操作电脑软件,比如跨应用完成复杂流程。模型支持最长 100 万 token 的上下文,方便处理长线任务。在模拟 44 种职业工作的 GDPval 测试里,...

推荐理由:这条消息的新闻价值在于 OpenAI 放出了一个新模型名,所以 H 和 R 都成立。但正文除了标题什么都没有,模型到底多大、贵不贵、能处理多长的上下文、跑分怎么样,一概没提,所以 K 不成立,分数只能停在 80 分这个区间。真正该盯的是后续的技术页,不是这条标题本身。

OpenAI News

OpenAI 发现推理模型很难按指令控制自己的思考过程,但这反而是个安全上的好消息

OpenAI 发了篇论文,核心结论是:现在最强的推理模型,都没法很好地控制自己的“思考草稿”(思维链)。他们搞了个叫 CoT-Control 的测试,用 13000 多个任务去要求模型在思考时遵守特定规则,比如全程用小写字母、避开某个关键词。结果所有被测模型的遵守率最高只有 15.4%,最低的甚至只有 0.1%。模型经常在草稿里自己都意识到“坏了,我刚...

推荐理由:OpenAI 用一篇文章标题说推理模型很难控制自己的 chain of thought,而且把这当成一件好事。这个说法挺反常识的——通常我们会觉得模型思考过程不可控是个安全隐患,但他们反过来认为这有利于安全。目前只有标题,正文没放出来,所以看不到具体实验、数字或者机制解释。我会先打个折:判断只能基于标题本身,别急着下结论说他们找到了什么新方法。对做推理模型安全和可解释性的人来说,这个观点值得追一下原文,但信息缺口还很大。

OpenAI News

OpenAI 发布 GPT-5.4 Thinking 系统卡,首次给通用推理模型加了高级网络安全防护

OpenAI 在 2026 年 3 月 5 日公开了 GPT-5.4 Thinking 的系统卡。这是 GPT-5 系列最新的推理模型,也是第一个把“高级网络安全能力”的防护措施做进通用模型里的产品。它的安全方案跟之前的 GPT-5 系列差不多,但这次把给 GPT-5.3 Codex(代码模型)用的那套网络安全防护搬到了 ChatGPT 和 API 里...

推荐理由:这篇系统卡信息量不大,没给具体分数、缓解细节和部署条件,我会先打个折。但它真正值得盯的是风险门槛的变化——OpenAI 把“高能力网络安全”缓解从专用模型扩到了通用推理模型,这是一个信号。标题里的“首个”不是公关话术,而是安全策略在升级。正文没披露评测数据,所以别指望从这里看到性能对比,重点看安全边界怎么划。

OpenAI News

OpenAI 把 ChatGPT 塞进 Excel 了,还接上了 Moody's、Factiva 等金融数据源

OpenAI 在 2026 年 3 月 5 日发布了 ChatGPT for Excel 的测试版,相当于在 Excel 里直接装了一个 GPT-5.4 助手。你可以用大白话让它帮你搭财务模型、跑情景分析、查公式错误,它改表之前会先问你,改完还能告诉你改了哪个格子、为什么。OpenAI 自己跑了一遍投行工作流测试,GPT-5 的正确率是 43.7%,换...

推荐理由:OpenAI 把 ChatGPT 塞进 Excel 测试版,不只是加个聊天框,而是让模型能直接在单元格里建模、追溯改动,还接入了 Moody's、道琼斯 Factiva、MSCI 等金融数据源。内部投行场景的基准分从 43.7% 跳到 87.3%,幅度很大,但这是内部测试,实际表现得等用户上手再看。企业版和教育版默认关闭,说明对合规和隐私留了后路。FactSet 标注“即将上线”,数据生态还在铺。整体看,这是 OpenAI 在抢专业工作流入口的一次重注,比单纯发个模型更有战略意味。

3月3日星期二

OpenAI News

GPT-5.3 Instant 发布:少说废话、少拒绝,日常对话更干脆

OpenAI 在 2026 年 3 月 3 日更新了 ChatGPT 里用得最多的模型,叫 GPT-5.3 Instant。这次改动主要冲着日常对话体验去的:模型不再动不动就拒绝回答,也不会在回答前先啰嗦一堆免责声明。文章给了一个具体对比——问远程射箭弹道计算,旧版 GPT-5.2 Instant 直接拒绝,说这能提高武器效能所以不能帮;新版 GPT-...

推荐理由:OpenAI 更新了 ChatGPT 最常用的日常模型,这篇帖子靠一个具体的 5.2 vs 5.3 行为对比把安全边界的变化讲清楚了,所以 HKR 三项都站得住。我会先打个折:正文没给系统卡、基准分、API 价格,信息缺口明显,所以重要性停在 84 不进 85。

OpenAI News

GPT-5.3 Instant 系统卡

OpenAI 发了 GPT-5.3 Instant 的系统卡,这是 GPT-5 系列里最新的一个模型。按他们说的,这个版本主要提升在回复速度更快、联网搜索时给出的答案更贴切上下文,并且减少了那种把天聊死的车轱辘话和过于绝对的表述。安全防护措施基本沿用了上一代 GPT-5.2 Instant 的方案,正文没披露新的安全评测数据、具体跑分或能力边界,详细内...

推荐理由:这篇就是 OpenAI 官方文档页面的一个占位更新,标题确认了 GPT-5.3 Instant 这个新变体存在,安全策略沿用 5.2 那套。但正文是空的,没有跑分、没有价格、没有延迟对比,也没提上下文长度。所以我会先打个折:知道有这么个东西,但暂时没法判断它到底多快多省。

2月27日星期五

OpenAI News

OpenAI 与亚马逊达成战略合作,AWS 成为 OpenAI 企业级产品的独家第三方云分发渠道

OpenAI 和亚马逊宣布了一项多年合作,亚马逊将向 OpenAI 投资 500 亿美元,其中 150 亿先到账,剩下 350 亿要满足特定条件后才会支付。合作的核心看点有两个:一是分发渠道,AWS 成为 OpenAI Frontier(一个让企业搭建、部署、管理 AI 智能体团队的平台)的独家第三方云分发商;二是算力绑定,OpenAI 承诺在 AWS...

推荐理由:这不是一篇常规的合作通稿。分阶段 500 亿投资、Bedrock 上线 OpenAI 模型运行时、再加约 2 吉瓦 Trainium 算力消耗,这三件事合在一起,把 OpenAI 的分发和算力姿势都改了。HKR 三项全中,所以放在 P1。

OpenAI News

OpenAI 和微软发联合声明:合作关系没变,亚马逊也能用 Azure 跑 API

OpenAI 和微软在 2026 年 2 月 27 日发了份联合声明,核心就一句话:两家公司的合作条款没变。声明直接回应了 OpenAI 当天宣布的新融资和新合作伙伴(包括亚马逊),强调这些动作都在现有协议框架内。具体来说,微软对 OpenAI 模型和产品的独家 IP 许可依然有效;收入分成模式不变,而且一直就包含了 OpenAI 跟其他云厂商合作带来...

推荐理由:这份联合声明本身有一定分量,但原文只给了标题,正文没披露,所以能说的不多。我会先打个折:信息密度很低,没法判断具体措施或时间表。不过它至少传递了一个关键点——OpenAI 的新钱和新伙伴,不影响微软已有的合作条件。对从业者来说,这等于给云服务格局和商业排他性吃了一颗定心丸,所以知识性和可读性都过关,但 headline 太虚,热闹不起来。

2月26日星期四

OpenAI News

OpenAI 与 PNNL 合作测试用 AI 帮联邦政府写环评报告,每小节能省 1 到 5 小时

OpenAI 跟美国能源部旗下的太平洋西北国家实验室(PNNL)合作,找了 19 位专家一起搞了个叫 DraftNEPABench 的测试集,专门看 AI 能不能帮忙起草联邦基建项目的环境评估文件。测试用的是 Codex CLI 这个命令行工具搭配 GPT-5,让模型去读几百页的技术报告、交叉核对资料,再按法规要求写出结构化的分析草稿。在覆盖 18 个...

推荐理由:HKR 三项都过了:联邦审批这个场景够意外;有 19 位专家、102 个任务和 1–5 小时的时间节省,信息量不空;争议点在于代理开始碰监管流程,但文章自己划了边界,说这只是起草辅助,不是自动决策。分数没往上拉,因为这只是个限定范围的基准测试,不是已经落地的产品能力。