跳到正文

#OpenAI

今日 43 条

4月11日星期六

X · @OpenAI

OpenAI 因 Axios 库安全问题要求所有 macOS 用户更新应用,主要是换证书防山寨

OpenAI 说他们发现一个跟第三方开发库 Axios 有关的安全问题,属于一次行业性事件。目前没看到用户数据被访问、系统被入侵或软件被篡改的证据。出于谨慎,他们正在更新 macOS 应用的认证证书,所有用户都得升级到最新版。这么做的目的是降低有人分发假冒 OpenAI 应用的风险,哪怕可能性很小。正文没披露受影响的版本号和时间线,也没说 Axios ...

推荐理由:这是 OpenAI 官方桌面端的安全事件,给了 macOS 上的具体缓解措施,所以 H、K、R 都站得住。放在 featured 低分段是因为正文没披露受影响版本、暴露窗口、发现日期和完整修复时间线,信息缺口不小。

X · @dotey(宝玉)

OpenAI Codex 工程师:别反复给 AI 喂脏数据,给它造几个专用命令行工具

OpenAI Codex 团队的 Nick Baumann 分享了一个干活技巧:与其每次把文档、日志、API 输出整坨丢给 AI 去啃,不如把常用操作封装成带参数、输出 JSON 的 CLI 命令。Codex 本身就擅长用命令行,会自己搜命令、加 flag 筛选、把上一个命令的结果串到下一个,不需要你教它怎么调。他自己日常用三个自建工具:codex-t...

推荐理由:这是 OpenAI Codex 团队成员写的日常心得,不是正式发布,但提供了一个很实用的机制:把杂乱的日志、文档、API 输出包成带参数、返回 JSON 的 CLI 命令,让模型去调这些窄接口,而不是直接读原始数据。文章给了三个他自用的工具,教程和 skill 也放到了开发者文档里。没有基准测试、规模数据或重大产品更新,所以分数打 75。

4月10日星期五

量子位 · 公众号

腾讯开源3B模型HiVG,用“分段打包”把SVG序列缩短六成,生成质量对标GPT和Claude

腾讯混元放出了一个30亿参数的开源模型HiVG,专门把图片转成SVG矢量图。它的核心思路是把绘图指令和坐标打包成“段token”,再用一个叫HMN的模块给坐标编码做初始化,让模型更懂几何关系。这样生成的SVG代码序列比传统方法短了62.7%到63.8%,省token就是省钱。在Image-to-SVG任务上,它的SSIM达到0.896、LPIPS低到0...

推荐理由:腾讯混元把 3B 小模型做到 SVG 指标能跟 GPT-5.2、Claude-4.5-Sonnet 掰手腕,靠的不是堆参数,而是把绘图命令和坐标打包成 segment token,再用 HMN 初始化坐标 embedding,序列长度直接砍掉六成多。文章给了 SSIM、LPIPS、CLIP-S 三组数,信息量够,不是空口说白话。不过 SVG 生成本身偏小众,离多数人的业务场景还有点距离,所以 novelty 和 knowledge 都到位,但 relevance 只能算一般。

OpenAI News

OpenAI 承认其 Mac 应用签名流程被 Axios 投毒事件波及,将吊销旧证书

OpenAI 在 4 月 10 日发公告说,3 月 31 日他们用于给 Mac 应用签名的自动化流程(GitHub Actions)下载并执行了被投毒的 Axios 1.14.1 版本。这个流程能接触到 ChatGPT Desktop、Codex App、Codex CLI 和 Atlas 四款 Mac 应用的签名证书和公证材料。OpenAI 自己的分...

推荐理由:这是 OpenAI 自己发的安全事故说明,HKR 三项都拉满了。H 够抓眼球:一个被投毒的 npm 包居然跑进了 macOS 应用的签名流水线。K 也扎实,直接告诉你问题出在 floating tag 和没设最低发布年龄,不是含糊的“安全事件”。R 更不用说,代码签名是开发者信任的基石,一旦被破,假应用、供应链后门的想象空间很大。目前看影响范围被控制住了,没发现用户数据或代码泄露,所以放在 featured 里没问题,但还够不上 breaking。

X · @OpenAI

OpenAI 给 ChatGPT 加了个 100 美元/月的 Pro 档,主要给 Codex 重度用户用

OpenAI 新设了一个每月 100 美元的 Pro 订阅档,Codex 用量是 Plus 档的 5 倍,适合长时间、高强度的编程任务。这个档位保留了原 Pro 的全部功能,包括专属 Pro 模型以及 Instant 和 Thinking 模型不限次使用。到 5 月 31 日前有个限时活动,Codex 用量临时提到 Plus 的 10 倍。正文没解释为...

推荐理由:OpenAI 给 Pro 加了个每月 100 美元的新档位,核心是把 Codex 用量提到 Plus 的 5 倍,其他 Pro 功能不变。5 月底前有个临时福利,Codex 额度再翻倍到 10 倍,但我会先打个折,这只是限时促销。真正值得盯的是,他们开始把代码代理这种重度用法单独拿出来计费,说明以后高强度用 AI 写代码可能要多掏钱。正文没提新模型或技术突破,所以重要性主要落在定价信号上,对团队预算和工具选型有直接参考价值。

4月9日星期四

X · @op7418(歸藏)

小扎挖的团队交卷了:Meta 发 Muse Spark,多模态推理但暂不开源

Meta 把之前挖来的团队做的第一个模型 Muse Spark 放出来了。它原生支持多模态推理,能看图、用工具、展示视觉思维链,还能让多个 Agent 并行干活。有个叫“沉思”的模式,就是协调多个 Agent 一起推理。在 Artificial Analysis 上的跑分比 Gemini 3.1 Pro、GPT-5.4 和 Claude Opus 4....

推荐理由:大厂新模型发布,加上“挖角团队首秀”的故事线,HKR 三项全中。分数卡在 featured 门槛附近,因为文章只给了能力声明和相对排名,参数规模、定价、铺开时间和访问范围都没披露,我会先打个折。

X · @dotey(宝玉)

Anthropic 发布 Claude Managed Agents,把 Agent 开发的基础设施全托管到云端,现已公测

Anthropic 推出了一套托管 API,让开发者不用自己搭沙箱、管状态、做权限和链路追踪,直接定义任务和工具就能上线生产级 Agent。官方说从原型到上线能从几个月缩到几天。它支持长时间运行的会话(断线不丢进度)和多 Agent 协调(一个 Agent 能拉起其他 Agent 并行干活,后者还在研究预览阶段)。内部测试里,在结构化文件生成任务上,这...

推荐理由:Anthropic 把 Agent 的沙箱环境、长时运行会话和多 Agent 协调打包成一个公测 API,对开发者来说是个实打实的工作流更新。我会先打个折,内部测试的 10 个百分点提升要看具体场景,但 0.08 美元一小时的定价和标准 token 费分开算,成本结构很清晰。正文没披露多 Agent 协调的具体机制和失败案例,这点先别太激动。整体看,这不是一个模型更新,而是一个平台级动作,值得从业者盯一下。

4月8日星期三

X · @dotey(宝玉)

Hermes Agent 开源不到两个月 GitHub 星标近三万,核心卖点是会自己写技能、自我迭代的闭环学习引擎

Nous Research 今年 2 月底开源的 Hermes Agent,上线不到两个月 GitHub 星标接近三万,被社区看作 OpenClaw 的第一个真正对手。两者都是自托管、多模型、MIT 协议,但设计思路完全不同。OpenClaw 是网关,负责把聊天应用接到 AI agent;Hermes 是引擎,围绕 agent 怎么越用越强来设计。它最...

推荐理由:我会先打个折:目前证据主要来自社区反馈和少量个人试用,不是正式评测或大规模验证。但 H、K、R 三条都踩中了——开源热度够高,技能沉淀和记忆检索的机制讲得清楚,自托管学习型 agent 也确实戳到成本和工作流复用的神经。正文没披露安全五层的具体实现和长期稳定性数据,这点先别太激动。综合看,给 78 分合理,值得盯后续。

Latent Space

OpenAI 内部团队用 5 个月跑出一个零人工代码的项目,每天烧掉 10 亿 token

Ryan Lopopolo 的团队在 OpenAI 内部搞了个极端实验:5 个月里搭出一个超过 100 万行代码的仓库,所有代码全由 Codex 生成,合并前没有任何人工审查。他们每天消耗超过 10 亿 token,按市价估算大概一天要花 2000 到 3000 美元。团队的核心思路是,当 AI 写代码卡住时,不去教它怎么改 prompt,而是回头补上...

推荐理由:这篇是访谈转述,不是官方发布,所以我会先打个折。但内容确实有料:OpenAI Frontier 团队用 5 个月搭了个内部测试产品,代码库超 100 万行,每天消耗超 10 亿 token,合并前完全没人类写码也没人类审查。具体做法是把失败拆成缺能力、缺上下文、缺结构三类,然后用 Symphony 多代理编排、规格文档、测试、可观测性和 1 分钟内构建循环来兜底。真正值得盯的是他们说的那句话——流程重心从人审代码转到了人设计 harness。价格估算约 2000 到 3000 美元一天,但正文没披露独立验证,这点先别太激动。

4月7日星期二

MIT Technology Review · AI

经济学家说,判断 AI 会不会抢你饭碗,缺的不是任务清单,而是“降价后需求涨多少”的数据

芝加哥大学经济学家 Alex Imas 认为,现在大家用任务暴露度(比如 OpenAI 说房产中介有 28% 的工作能被 AI 干)来预测失业,基本没用。真正关键的数据是行业层面的价格弹性——也就是 AI 把成本打下来之后,降价能不能把需求拉到足够大,大到反而要多雇人。他举了个例子:一个写约会 App 的程序员用 AI 一天干完三天的活,公司成本低了,...

推荐理由:这篇文章没给新数据集,但把讨论从“暴露度”拽到了“价格弹性”上,思路值得留意。我会先打个折:正文没披露现成的全经济弹性数据,所以目前还是个框架,不是可操作的结论。OpenAI 那个 28% 暴露度数字和 Anthropic 用 O*NET 做对话比对是实在的锚点,让讨论没飘在空中。对关心岗位替代的从业者来说,这篇文章提醒你别只盯暴露度,需求侧的反应可能才是决定性的——这点先别太激动,但方向对。

4月3日星期五

X · @OpenAI

ChatGPT 上车了,现在能在 CarPlay 里用语音模式

OpenAI 把 ChatGPT 的语音模式搬进了 CarPlay,iPhone 用户升级到 iOS 26.4 以上就能在车里用。正文没提支持哪些国家、哪些车型,也没说功能有没有阉割,比如能不能连续对话、能不能读长文章。这次动作的重点是把对话入口塞进驾驶界面,不是发了新模型。

推荐理由:这次更新更像是一次分发渠道的扩展,而不是模型本身有什么变化。ChatGPT 出现在 CarPlay 里,意味着它开始抢占车载语音交互的位置,这点比功能细节更值得关注。不过正文没披露地区、车型和功能限制,实际落地范围还得再观察,先别太激动。

4月2日星期四

OpenAI News

OpenAI 收购了科技媒体 TBPN,把它放在战略部门下面

OpenAI 在 4 月 2 号宣布买下了 TBPN,一个每天直播的科技谈话节目,在硅谷挺火。收购后 TBPN 会归到 Chris Lehane 管的战略部门,但官方说会保留编辑独立,节目请谁、聊什么还是他们自己定。OpenAI 的 CEO Fidji Simo 在内部信里解释,公司不想用传统公关套路,需要一个真正能聊 AI 变化的场子,TBPN 正好...

推荐理由:这条消息能上 featured,是因为 OpenAI 买媒体这件事本身够反常,而且公告给出了具体的汇报线和编辑独立承诺,不是空穴来风。我会先打个折——交易价格、股权结构和整合时间表正文都没披露,所以它到不了模型发布或产品上线那种硬核级别,停在 82 分合理。

X · @dotey(宝玉)

OpenAI 二级市场遇冷,6 亿美元股票卖不掉;Anthropic 需求爆棚,买家备好 20 亿现金等着进场

彭博社报道,OpenAI 在二级市场挂了 6 亿美元的股票,结果一个买家都找不到,跟去年几天就被抢光的情况完全不同。交易平台 Next Round Capital 的创始人说,他几百个机构客户里没人愿意接。另一边,Anthropic 的股票却抢手得很,买家已经准备了约 20 亿美元现金,另一家平台 Hiive 上的需求登记超过 16 亿美元,平台方形容...

推荐理由:这篇彭博报道把 OpenAI 和 Anthropic 的二级市场处境放在一起比,反差够大:一边是 6 亿美元股份待售却找不到足够买家,另一边是 20 亿认购意向涌进来。数字本身就能说明问题——OpenAI 二级报价比上一轮估值打了约九折,Anthropic 反而溢价超五成。我会先打个折:这是市场传闻和报价,不是官方融资公告,所以不能当定论看。但信息量够,既有估值锚点又有流动性信号,还顺带提了 Anthropic 本周第二次安全事故和 Claude 源码泄露,给安全话题加了实锤。对关注资本流向和风险信号的从业者来说,这篇值得一读。

3月31日星期二

OpenAI News

OpenAI 完成 1220 亿美元融资,估值冲到 8520 亿

OpenAI 今天宣布完成了一轮 1220 亿美元的融资,投后估值 8520 亿美元。这轮由亚马逊、英伟达、软银领投,微软、a16z 等也继续跟投,还首次通过银行渠道向个人投资者募了超过 30 亿美元。公司同时把循环信贷额度提到了约 47 亿美元,但正文说目前还没动用。我会先打个折:这些数字主要说明 OpenAI 现在能调动的资金量级很大,但具体怎么花...

推荐理由:这篇东西挺奇怪的:OpenAI 发了一篇叫《加速 AI 下一阶段》的文章,但正文是空的,只有标题和链接。我会先打个折——它没披露任何产品、研究或政策细节,所以没法判断它到底想加速什么。标题本身有话题性,但信息量为零,这点先别太激动。

MIT Technology Review · AI

AI 健康工具越来越多,但没人说得清它们到底靠不靠谱

微软上线了 Copilot Health,亚马逊把 Health AI 从 One Medical 会员专属开放给所有人,加上年初 OpenAI 的 ChatGPT Health 和能调取健康档案的 Claude,面向普通人的 AI 健康问答成了大厂标配。微软说 Copilot 每天收到 5000 万个健康问题,需求确实摆在那里,尤其对看病不方便的人群...

推荐理由:这篇文章不是产品发布,而是趋势报道加安全质疑。我会先打个折:微软和 Amazon 都在推消费级健康聊天机器人,但正文没披露任何独立安全评测,六位受访学者也点出这个问题。Mount Sinai 的研究是全文最硬的信息——ChatGPT Health 会误判轻重,说明光靠公司自测基准不够。这点先别太激动,因为研究样本和具体方法正文没展开,但方向值得盯。整体看,信息量够、风险点明确,适合放进 featured。

3月25日星期三

MIT Technology Review · AI

AI 炒作指数:AI 上战场了

Anthropic 和五角大楼因为怎么把 Claude 模型武器化吵了一架,结果 OpenAI 用一笔被自家 CEO 称为“机会主义且草率”的交易截了胡。用户开始大批退订 ChatGPT,伦敦也爆发了迄今最大规模的反 AI 游行。讽刺的是,以伦理立身的 Anthropic,现在正帮着美军加速对伊朗的打击。另一边,AI 智能体在网上火了:OpenAI 挖...

推荐理由:这条放 featured 没问题,因为 H 和 R 都拉满了:模型供应商跟军方挂钩,话题性够强,也确实是行业神经。K 这边我会先打个折,正文没披露任何合同细节,连抗议规模都没提,所以别急着下结论说合作有多深。

OpenAI News

OpenAI 开了个安全漏洞赏金计划,专门收 AI 滥用和越权操作的问题

OpenAI 在 2026 年 3 月 25 日上线了一个公开的“安全漏洞赏金”计划,跟之前的安全漏洞赏金不同,这次专门盯着 AI 被滥用或绕过安全限制的场景。主要收三类问题:一是智能体(比如浏览器里的 ChatGPT Agent)被第三方提示词注入劫持,导致泄露用户信息或执行有害操作,复现率得超过 50%;二是模型输出里意外暴露了 OpenAI 自己...

推荐理由:这不是模型发布或能力升级,而是一次治理流程更新,所以放在低 featured 档。但 OpenAI 把 AI 安全漏洞悬赏公开化,还划出了代理风险、专有信息泄露这些具体受理项,同时明确排除普通越狱,等于给行业打了个样。我会先打个折:正文没披露赏金金额和实际处理时效,实际效果还得看后续执行。

3月24日星期二

OpenAI News

ChatGPT 把购物功能做成了视觉化比价工具,用 ACP 协议直接拉商品信息

OpenAI 给 ChatGPT 加了一套更直观的购物功能,你可以上传图片找同款、用对话筛预算和偏好,还能把商品并排比价格、评价和规格。背后靠的是他们扩展的 Agentic Commerce Protocol(ACP,一种让 AI 直接跟商家系统对接商品数据的协议),把商品信息实时拉进聊天界面。这次更新面向所有用户,免费版也能用。正文没披露具体覆盖了多...

推荐理由:OpenAI 放了个标题,说 ChatGPT 要支持商品发现,但正文没给任何细节。我会先打个折:功能机制、覆盖范围、具体数字一概没提,所以只能当个信号看。好处是官方亲自下场把聊天框变成购物入口,这点对行业触动很大;坏处是现在除了标题什么都没有,没法判断是真落地还是先占坑。

3月20日星期五

MIT Technology Review · AI

OpenAI 要造一个全自动 AI 研究员,先别急着喊“科学家要失业”

OpenAI 把“造一个全自动 AI 研究员”定成了接下来几年的北极星目标。首席科学家 Jakub Pachocki 跟 MIT Technology Review 聊了分两步走的计划:今年 9 月先搞一个“AI 研究实习生”,能独立啃一小批特定研究问题;2028 年再上完整的多智能体自动化系统。但正文没披露这个系统要怎么评估产出靠不靠谱、打算烧多少算...

推荐理由:HKR-H 落在“全自动研究员”这个具体到能让人立刻理解野心的钩子上,HKR-K 靠两个可验证的时间节点撑住信息量,HKR-R 则抓住了研究岗位替代和实验室军备竞赛这两条从业者最关心的线。没给 must-write 是因为正文没披露评测标准、算力预算和研究范围,目前只能算一个强路线信号,离可验证产出还有距离。

MIT Technology Review · AI

OpenAI 把全自动 AI 研究员定为未来几年的北极星,计划 9 月先上线一个能独立解决少量问题的实习研究员

OpenAI 首席科学家 Jakub Pachocki 说,公司正把所有资源押注在一个叫“全自动 AI 研究员”的目标上。这个系统不是单一模型,而是一套让多个 AI 智能体协作干活(multi-agent)的流程,能自己跑去啃又大又复杂的问题,比如数学猜想、生物化学实验设计,甚至商业和政策难题。他们给了个时间表:今年 9 月先做出一个“AI 研究实习生...

推荐理由:这篇是战略路线图报道,不是已发布产品,所以没给 p1。亮点在于 OpenAI 首次把“全自动研究员”拆成实习生版和多 Agent 版两步走,时间节点清楚,但正文没写成本、算力需求和怎么评判好坏,这些才是落地关键。我会先打个折,等看到能跑多久、任务拆得怎么样再调整判断。

3月19日星期四

OpenAI News

OpenAI 宣布要收购 Astral,把 Python 开发工具链拉进 Codex 生态

OpenAI 发公告说计划收购 Astral,这家公司做了 uv、Ruff、ty 这几个 Python 开发者很常用的开源工具,分别管依赖环境、代码检查和类型安全。收购完成后,Astral 团队会并入 Codex 团队,OpenAI 打算继续维护这些开源项目,同时让 Codex 能直接调用这些工具,把 AI 从写代码延伸到跑工具、改项目、验证结果这些开...

推荐理由:这条消息只有标题,正文是空的。OpenAI 收购 Astral 这件事,对看人才和产品线的人来说值得标记,但信息实在太少,我会先打个折。H 和 R 能过,因为收购本身就会牵动整合预期和行业解读;K 很弱,交易细节一片空白,别把标题当成能力发布或产品落地。

3月18日星期三

MIT Technology Review · AI

五角大楼计划让 AI 公司在机密数据上训练模型

五角大楼正在讨论建一个安全环境,让 OpenAI、xAI 这类公司用机密数据训练军用版大模型。以前这些模型只能在涉密环境里回答问题,不能拿数据去学习,这次是头一回允许直接“吃”进机密情报。训练会在认证过的数据中心进行,数据归国防部,公司人员只在极少数情况下、有安全许可才能接触。官方说会先用非机密数据(比如商业卫星图)做测试,看效果再推进。最大的隐患是泄...

推荐理由:我会先打个折:目前只是规划阶段的说法,不是已签合同、已拨预算或已部署的项目,所以分数没给到 85 以上。但 hook 很明确——用机密数据训练这件事本身就少见,加上有具体的评估门槛和数据所有权安排,信息量够。泄密风险那段尤其值得盯:同一个模型如果服务不同密级部门,训练时吃进去的机密信息可能被再次吐出来,正文没展开怎么防,这是个关键缺口。

3月17日星期二

OpenAI News

OpenAI 发了 GPT-5.4 mini 和 nano,主打编程和子任务,mini 跑得比 GPT-5 mini 快一倍多

OpenAI 在 3 月 17 号推出了 GPT-5.4 mini 和 nano,都是给高吞吐、低延迟场景用的轻量模型。mini 在编程、推理、看图、调工具上都比上一代 GPT-5 mini 强,速度还快了一倍多。跑分上,mini 在 SWE-Bench Pro 拿到 54.4%,跟大哥 GPT-5.4 的 57.7% 差距不大,但延迟低很多,适合需要...

推荐理由:这是 OpenAI 官方模型发布,不是小修小补。我会先打个折:虽然叫 GPT-5.4 mini,但别当它是 GPT-5.4 的完整缩小版,更像是一个专攻编码和子代理任务的轻量选手。真正值得盯的是它用更低价格和更快速度,把 SWE-Bench Pro 拉到 54.4%,离大模型只差 3.3 个百分点——这点先别太激动,正文没披露其他基准的对比,不知道通用能力缩水多少。nano 更极端,只走 API,价格压到输入 0.20 美元,明显是给大批量、简单任务准备的。整体看,OpenAI 在推‘够用且便宜’的代理专用模型,对频繁调用代码工具的场景挺省钱。

MIT Technology Review · AI

OpenAI 的技术可能出现在伊朗冲突的哪些环节

OpenAI 跟五角大楼签了涉密协议刚过两周,MIT Technology Review 就划出了三个可能用到它家技术的场景。一是目标排序:分析师把潜在目标清单丢给模型,让它结合后勤、情报等数据排出优先打击顺序,但正文没解释人工复核到底怎么提速。二是反无人机分析:OpenAI 之前跟 Anduril 合作,用模型做实时威胁识别和拦截建议,不过两家都没更...

推荐理由:MIT Technology Review 把 OpenAI 的涉密国防合作往伊朗冲突上套,列出目标排序、反无人机分析和行政支持三个可能落点。我会先打个折:文章没给出部署时间表,也没实锤任何战场使用,所以判断要收着点。但选题本身踩在军事 AI 的敏感线上,加上 OpenAI 刚进涉密圈,这个时间点发出来,话题性够强。

3月13日星期五

MIT Technology Review · AI

五角大楼官员透露如何用 AI 聊天机器人排打击优先级,同时点名 Claude 会“污染”国防供应链

美国国防部一位官员说,军方可以把目标清单喂给一个在保密环境里跑的生成式 AI 系统,让它分析并排出先打哪个。人负责最后检查和拍板。OpenAI 的 ChatGPT 和 xAI 的 Grok 都可能被塞进这种高风险决策流程里。另一边,五角大楼 CTO 公开说 Claude 模型内置了某种“政策偏好”,会污染国防供应链,但正文没披露具体是哪个模型版本、什么...

推荐理由:我会先打个折:正文没披露具体模型、部署时间和可审计的约束机制,所以只能停在低 featured 档。但这条消息把生成式 AI 塞进高风险决策链的事实摆出来了,而且五角大楼 CTO 对 Claude 的排斥理由本身就是一个安全对齐话题的活案例。对想看 AI 怎么被实际用于军事、以及模型价值观怎么影响采购的人来说,这两点都值得盯。

MIT Technology Review · AI

五角大楼官员透露,生成式 AI 可能被用来给打击目标排优先级

一位美国国防部官员向 MIT Technology Review 描述了军方可能怎么用生成式 AI 做目标排序:把目标清单喂给聊天模型,让它结合飞机位置等因素排出优先打击顺序,输出建议再由人审核。这个聊天层可能架在军方已有的 Maven 系统上,用来加快搜索和分析。Maven 之前主要靠计算机视觉从无人机画面里找目标,界面是地图和仪表盘,操作员得自己盯...

推荐理由:HKR 全中:标题的钩子是聊天机器人参与目标排序,正文给了叠在 Maven 上的具体工作流和人工复核环节。分数我维持在 80,不往上加,因为官员描述的是“可以这样用”的可能性,提速幅度和是否已实战都没确认,这点先别太激动。

3月11日星期三

OpenAI News

OpenAI 给 Responses API 加了个电脑环境,让模型能自己敲命令行干活

OpenAI 在 2026 年 3 月 11 日说,他们的 Responses API 现在能调用一个 shell 工具,在托管的隔离容器里执行命令。模型(GPT-5.2 及之后版本)会自己提议该敲什么命令,API 负责在后台跑、把结果流式传回来,还能同时开多个会话并行处理。容器里带了文件系统、可选的 SQLite 和受限的网络访问。这相当于给模型配了...

推荐理由:这次更新把 Responses API 从“调工具”升级成“给模型一台隔离电脑”,shell 执行、流式输出、并行跑命令、上下文压缩都实装了,对 agent 开发者是实打实的新能力。正文后半段截断,定价、配额和完整安全边界都没写,所以实际落地成本和安全兜底还得等后续披露。

3月10日星期二

OpenAI News

OpenAI 发了个训练集 IH-Challenge,专门教大模型分清指令的优先级

OpenAI 这篇博客讲的是怎么让前沿大模型更听话——不是听所有人的话,而是学会按“系统 > 开发者 > 用户 > 工具”这个优先级来执行指令。他们做了一个叫 IH-Challenge 的训练数据集,用强化学习来练模型。设计上避开了三个坑:指令本身太复杂导致模型搞不清、靠另一个模型打分不靠谱、以及模型学会偷懒(比如无脑拒绝所有请求)。每个训练任务都很简...

推荐理由:OpenAI 公开了一个叫 IH-Challenge 的研究物件,专门搞指令层级和防注入,所以 HKR 三项都站得住。正文没给指标、没提具体模型、也没说怎么发布,信息缺口不小,分数就先打在 77 这个位置。

OpenAI News

ChatGPT 上线数学和科学互动图解,覆盖 70 多个核心概念

OpenAI 给 ChatGPT 加了一个学习功能:问勾股定理、理想气体方程这类问题时,它会直接弹出一个可拖拽的图表模块。你可以手动调参数、改公式,图表会跟着实时变,把抽象公式变成能上手试的东西。首批覆盖 70 多个数学和科学概念,所有付费和免费用户都能用。官方说每周有 1.4 亿人用 ChatGPT 学数学和科学,但正文没披露这个互动功能背后的模型、...

推荐理由:我会先打个折:这是个中等体量的产品更新,不是模型能力突破。钩子在于把抽象概念变成能动手玩的画面,对教学场景有直接吸引力。1.4 亿周活和 70+ 概念是实打实的数字,说明铺量已经很大。但正文完全没提模型怎么支撑这些交互、有没有做过学习效果验证,这点先别太激动。整体判断是产品化动作值得关注,技术深度和效果证据还缺位。

3月9日星期一

OpenAI News

OpenAI 宣布收购 Promptfoo,要把安全测试直接做进 Frontier 平台

OpenAI 发公告说要收购做 AI 安全测试的 Promptfoo,交易完成后会把它的技术整合到企业级平台 Frontier 里。Promptfoo 的工具现在有超过四分之一的财富 500 强公司在用,主要帮开发者在模型上线前做安全评估和红队测试,比如检测提示词注入、越狱、数据泄露、工具滥用这些风险。收购后,OpenAI 打算把自动化安全测试、红队演...

推荐理由:这条消息我会先打个折,因为收购价格和时间表正文都没写,没法判断交易规模和落地节奏。但 OpenAI 把一家已有大客户基础的评测工具直接收进 Frontier,对做 agent 的团队来说是个强信号——以后安全测试和红队评估可能变成平台自带能力,不用再外挂工具。这点先别太激动,等更多细节出来再看。

3月7日星期六

彭博科技

甲骨文和 OpenAI 叫停了得州旗舰数据中心的扩建计划

双方谈崩了,不再一起扩建位于得州阿比林的那座旗舰 AI 数据中心。原因是融资进度拖后腿,加上 OpenAI 自己的需求变了。现在 Meta 在考虑从运营商 Crusoe 手里租下这个场地,英伟达也在中间帮忙牵线。这类项目的造价动辄上百亿美元,正文没披露具体的分手条款和后续时间表。

推荐理由:Oracle 和 OpenAI 在得州阿比林那个旗舰数据中心的扩建计划谈崩了,原因是融资没谈拢,加上 OpenAI 自己的需求也变了。Meta 正考虑从开发商 Crusoe 手里租下原本要扩建的那块地,Nvidia 在中间帮忙牵了线。项目总成本只说在几百亿美元级别,具体数字没披露。我会先打个折:这事说明超大集群先卡在资本结构和多方协同上,不是先卡在芯片,这点比标题本身更值得盯。

彭博科技

OpenAI 和甲骨文叫停了得州旗舰 AI 数据中心的扩建计划

OpenAI 和甲骨文决定不再扩建位于得克萨斯州的那个旗舰 AI 数据中心。原因是融资谈判拖得太久,加上 OpenAI 自己对算力的需求也变了。不过正文没披露这个设施的具体名字、目标容量、资本开支和调整后的时间表。我会先打个折,因为原文被 Bloomberg 的机器人验证墙挡住了,只能看到摘要片段,更多细节暂时拿不到。

推荐理由:Bloomberg 报道 OpenAI 和 Oracle 放弃了得州一个旗舰数据中心的扩建计划,原因是融资没谈拢,OpenAI 的算力需求也变了。我会先打个折:正文没披露具体是哪个数据中心、原定扩多大、投多少钱、时间表怎么改,所以没法判断影响量级。但这件事值得盯,因为它可能说明 OpenAI 在重新盘算自己到底需要多少自建算力,而不只是地产项目黄了。HKR 三项都踩中,信源权威性也够,只是信息缺口把分数压在 80 出头。

彭博科技

Oracle 和 OpenAI 叫停了德州旗舰数据中心扩建计划

双方不再推进原定在德州扩建的那个旗舰级 AI 数据中心。彭博的报道被付费墙挡住了,正文没披露这个项目的具体规模、预算和时间表。从 RSS 片段看,谈判卡在了融资安排上,同时 OpenAI 自己的算力需求也在重新评估。我会先打个折:这不一定代表 AI 算力投资整体降温,更像是一次具体的合作没谈拢,但融资摩擦和需求重估这两个信号值得留意。

推荐理由:Bloomberg 报的是实打实的基础设施转向,不是传闻。H 和 R 都站得住:合作突然终止本身就意外,而且它同时牵动算力供应和资本开支这两根神经,OpenAI 的需求到底怎么变,会直接影响上下游判断。K 我给得保守,因为文章没给出规模、金额、时间线,信息缺口太大,没法做更实的判断。

MIT Technology Review · AI

五角大楼能用 AI 监控美国人吗?法律还没跟上

五角大楼想用 Anthropic 的 Claude 去分析批量购买的美国人商业数据,这件事引爆了公开争吵。核心矛盾在于:政府可以合法从数据市场买到你的手机位置、网页浏览记录,而现行法律大多不禁止把这些数据喂给 AI 做聚合和画像。法律教授指出,普通人觉得是监控的行为,在法律上可能根本不算搜查。OpenAI 后来修改了与国防部的合同,写明不用于国内监控,...

推荐理由:这篇直接给了一个具体冲突:五角大楼想用 Claude 分析商业数据,Anthropic 公开反对,OpenAI 随后改合同禁止境内监视。信息量够,但我会先打个折——OpenAI 新合同全文没公开,技术上的 safety stack 怎么落地正文也没说,所以重要性停在 79 是合理的。对从业者来说,真正值得盯的不是声明,是合同红线到底能不能约束国防部。

彭博科技

OpenAI 放出一个安全工具的研究预览版,让 AI 自己去数据库里找漏洞、打补丁

OpenAI 发了一个给安全团队用的 AI agent 研究预览版,主要用途是扫描大型数据库里的漏洞并自动修补。目前公开信息很少——正文没披露具体模型名、支持哪些数据库、怎么收费、什么时候正式上线。我会先打个折:这还是个研究预览,离生产环境能用还有距离,别看到“agent”就觉得能直接上岗。

推荐理由:我会先打个折:这还是个研究预览,离生产环境有距离。但 OpenAI 把代理放进安全流程里,不是再发一个聊天机器人,这个动作本身就值得盯。正文没披露模型、覆盖范围、定价和上线时间,所以别急着激动。真正让人在意的是它试图让 AI 直接碰漏洞修补,这会牵出责任、误报、权限控制一连串问题,企业安全团队不可能不关注。

3月6日星期五

OpenAI News

OpenAI 把代码安全扫描工具 Codex Security 开放给付费用户试用,下个月免费

OpenAI 在 3 月 6 日上线了 Codex Security 的研究预览版,面向 ChatGPT Pro、Enterprise、Business 和 Edu 用户,下个月可以免费用。这个工具相当于一个应用安全助手,会先读懂你的项目结构,生成一份可编辑的威胁模型,再根据这个模型去找漏洞、做验证、给修复建议。过去 30 天里,它扫了外部仓库超过 1...

推荐理由:这是 OpenAI 给开发和安全团队的一个实质性产品更新,不是泛泛的安全宣传。切入点新、有具体扫描和误报数据、回应了 AI 编码风险和告警疲劳,三个点都站得住。不过目前还是研究预览,正文没披露误报下降的具体测试条件和补丁的采纳率,效果得等正式版再看。

3月5日星期四

OpenAI News

OpenAI 发布 GPT-5.4,把写代码、操作电脑和做报表揉进了一个模型里

OpenAI 推出了 GPT-5.4,一个面向专业工作的新模型,在 ChatGPT、API 和 Codex 里都能用。它把之前 GPT-5.3-Codex 的代码能力整合了进来,还首次让通用模型能直接操作电脑软件,比如跨应用完成复杂流程。模型支持最长 100 万 token 的上下文,方便处理长线任务。在模拟 44 种职业工作的 GDPval 测试里,...

推荐理由:这条消息的新闻价值在于 OpenAI 放出了一个新模型名,所以 H 和 R 都成立。但正文除了标题什么都没有,模型到底多大、贵不贵、能处理多长的上下文、跑分怎么样,一概没提,所以 K 不成立,分数只能停在 80 分这个区间。真正该盯的是后续的技术页,不是这条标题本身。

OpenAI News

OpenAI 发现推理模型很难按指令控制自己的思考过程,但这反而是个安全上的好消息

OpenAI 发了篇论文,核心结论是:现在最强的推理模型,都没法很好地控制自己的“思考草稿”(思维链)。他们搞了个叫 CoT-Control 的测试,用 13000 多个任务去要求模型在思考时遵守特定规则,比如全程用小写字母、避开某个关键词。结果所有被测模型的遵守率最高只有 15.4%,最低的甚至只有 0.1%。模型经常在草稿里自己都意识到“坏了,我刚...

推荐理由:OpenAI 用一篇文章标题说推理模型很难控制自己的 chain of thought,而且把这当成一件好事。这个说法挺反常识的——通常我们会觉得模型思考过程不可控是个安全隐患,但他们反过来认为这有利于安全。目前只有标题,正文没放出来,所以看不到具体实验、数字或者机制解释。我会先打个折:判断只能基于标题本身,别急着下结论说他们找到了什么新方法。对做推理模型安全和可解释性的人来说,这个观点值得追一下原文,但信息缺口还很大。

OpenAI News

OpenAI 发布 GPT-5.4 Thinking 系统卡,首次给通用推理模型加了高级网络安全防护

OpenAI 在 2026 年 3 月 5 日公开了 GPT-5.4 Thinking 的系统卡。这是 GPT-5 系列最新的推理模型,也是第一个把“高级网络安全能力”的防护措施做进通用模型里的产品。它的安全方案跟之前的 GPT-5 系列差不多,但这次把给 GPT-5.3 Codex(代码模型)用的那套网络安全防护搬到了 ChatGPT 和 API 里...

推荐理由:这篇系统卡信息量不大,没给具体分数、缓解细节和部署条件,我会先打个折。但它真正值得盯的是风险门槛的变化——OpenAI 把“高能力网络安全”缓解从专用模型扩到了通用推理模型,这是一个信号。标题里的“首个”不是公关话术,而是安全策略在升级。正文没披露评测数据,所以别指望从这里看到性能对比,重点看安全边界怎么划。

OpenAI News

OpenAI 把 ChatGPT 塞进 Excel 了,还接上了 Moody's、Factiva 等金融数据源

OpenAI 在 2026 年 3 月 5 日发布了 ChatGPT for Excel 的测试版,相当于在 Excel 里直接装了一个 GPT-5.4 助手。你可以用大白话让它帮你搭财务模型、跑情景分析、查公式错误,它改表之前会先问你,改完还能告诉你改了哪个格子、为什么。OpenAI 自己跑了一遍投行工作流测试,GPT-5 的正确率是 43.7%,换...

推荐理由:OpenAI 把 ChatGPT 塞进 Excel 测试版,不只是加个聊天框,而是让模型能直接在单元格里建模、追溯改动,还接入了 Moody's、道琼斯 Factiva、MSCI 等金融数据源。内部投行场景的基准分从 43.7% 跳到 87.3%,幅度很大,但这是内部测试,实际表现得等用户上手再看。企业版和教育版默认关闭,说明对合规和隐私留了后路。FactSet 标注“即将上线”,数据生态还在铺。整体看,这是 OpenAI 在抢专业工作流入口的一次重注,比单纯发个模型更有战略意味。