跳到正文

#安全/对齐

今日 0 条

1月6日星期二

NVIDIA 博客

NVIDIA 的 DRIVE AV 软件将首发搭载于新款奔驰 CLA

新款奔驰 CLA 会成为美国市场第一辆用上 NVIDIA DRIVE AV 的量产车,今年底交付。这套系统是双架构设计:核心驾驶决策靠一个端到端 AI 模型,同时外面包了一层基于 Halos 的传统安全校验模块,用来兜底。功能上支持点到点辅助驾驶、城市道路导航、主动避撞和自动泊车,后续还能 OTA 升级。不过,博客里没提这套系统要加多少钱、用了哪些传感...

推荐理由:我会先打个折:正文没披露传感器配置、具体价格和 ODD,所以没法判断这套系统到底多能打。但亮点在于量产时间给了,双栈设计把端到端驾驶和传统安全冗余绑在一起,不是纯 demo。对从业者来说,这是看端到端方案能不能过车规安全关的一个真实样本,所以放在 featured 低位。

2025年10月22日星期三

Hugging Face 博客

Hugging Face 接入 VirusTotal,给 Hub 上 220 万个模型和数据集仓库做恶意文件扫描

Hugging Face 宣布和 VirusTotal 合作,开始持续扫描 Hub 上超过 220 万个公开的模型和数据集仓库。你打开仓库或文件页面时,Hub 会自动比对文件哈希值,从 VirusTotal 拉回该文件是否被标记为恶意、有多少家引擎报毒,以及相关的威胁情报。整个过程不会把原始文件内容发给 VirusTotal。这相当于在下载前多了一道安...

推荐理由:HKR 三项都站得住:220 万仓库的扫描规模、基于哈希的轻量集成方式、以及把威胁判断前移到下载环节,对从业者来说都是直接可用的信息。没进必写是因为正文没披露误报率、扫描延迟和后续处置流程,这几个缺口会让实际落地效果打个折扣,先别太激动。

2025年10月9日星期四

OpenAI News

OpenAI 公布了一份政治偏见评测,用 500 道题测 ChatGPT 会不会站队

OpenAI 自己动手测了 ChatGPT 的政治偏见。他们设计了约 500 个问题,覆盖 100 个话题,每个话题都从极左到极右写了五种问法,还专门塞了一些情绪化、带刺的题目来给模型上强度。评测不看模型选 A 还是选 B,而是看它会不会在回答里夹带私货、只讲一面理、或者被用户带节奏。结果显示,碰到中性或稍微带点倾向的问题,模型基本能保持客观;但遇到情...

推荐理由:OpenAI 这次放出的是一份政治偏见评测,不是新模型或产品发布。我会先打个折:它用约500条提示覆盖100个话题,从5个维度去量 ChatGPT 在真实对话里有没有站队。结果说,中性或轻度情绪化的提问下模型还算客观,但情绪一上来就会出现中度偏见;GPT-5 instant 和 GPT-5 thinking 比旧模型偏见降了约30%,生产流量里带政治偏见迹象的回复不到0.01%。这点先别太激动,正文没披露评测提示的具体分布和偏见轴的定义细节,也没说那30%是在什么基线上算出来的。但整体上,这份报告对做对齐和安全的人有参考价值,也直接打在信任和治理的...

2025年10月6日星期一

OpenAI News

OpenAI 发布 AgentKit:一套工具把智能体开发、评测和微调打包在一起

OpenAI 在 10 月 6 日推出了 AgentKit,把做智能体需要的三块拼图拼到了一起:Agent Builder 是个画布,拖拽节点就能搭多智能体流程,支持版本管理和安全护栏;ChatKit 让你把对话界面嵌进自家产品,省掉两周前端开发时间;Connector Registry 统一管理 Dropbox、Google Drive、ShareP...

推荐理由:这次发布对 agent 开发者来说信息量挺大,Agent Builder、Connector Registry、ChatKit 三个组件都给了具体机制。Evals 那边 trace grading 和自动提示优化是实打实的新能力,第三方模型支持也扩大了适用范围。但标题里提到的 RFT,正文截出来的部分完全没讲训练怎么搞、多少钱、哪些人能先用,这点先别太激动。整体够重磅,但缺关键细节,所以给 84 分而不是顶格。

2025年9月30日星期二

OpenAI News

OpenAI 发布 Sora 2 系统卡,视频生成模型能同时出画面和声音了

OpenAI 在 9 月 30 日公布了 Sora 2 的系统卡,说这个新模型在物理规律、画面真实度、音画同步和风格控制上都比上一代强,能更准地跟着用户的指令走。这次发布先走邀请制,在 sora.com 和独立的 iOS App 上小范围开放。安全方面,上线初期禁止上传视频,也禁止上传带真人照片的图片,对涉及未成年人的内容有更严的审核门槛。正文没提 A...

推荐理由:这条落在 78–84 分档。H 来自 Sora 2 加独立 App 的钩子;K 来自明确的上线限制和安全规则;R 来自竞争和肖像滥用风险。没给更高分是因为价格、评测分数、上下文长度和 API 时间点正文全都没披露,我会先打个折。

2025年9月29日星期一

OpenAI News

OpenAI 给 ChatGPT 加了家长控制,能管孩子用 AI 的时间和功能

OpenAI 在 9 月 29 日上线了家长控制功能,所有 ChatGPT 用户都能用。家长把自己的账号和孩子的绑定后,就能在自己的账号里管理孩子的使用设置。绑定后的青少年账号默认会加强内容过滤,减少暴力、色情角色扮演和极端审美之类的内容。家长还可以单独设置禁用时段、关掉语音模式、关掉记忆功能、禁止图片生成,以及拒绝把孩子的对话拿去训练模型。比较关键的...

推荐理由:OpenAI 把家长控制推给了所有 ChatGPT 用户,但真正值得看的是自残风险上报链路:系统检测到风险后,先由人工小组复核,确认是急性痛苦状态再通过邮件、短信和推送通知家长。这不是一个简单的设置面板,而是一套带人工介入的安全流程。我会先打个折,因为这次没有模型层面的变动,属于产品安全更新,但信息量够实,流程也说得清楚。

OpenAI News

OpenAI 公开了它怎么拦截用 AI 生成或上传儿童性虐待内容

OpenAI 在 2025 年 9 月 29 日发了一篇安全说明,讲他们怎么防止自家模型被用来制作或传播儿童性虐待材料(CSAM/CSEM)。规则上,任何涉及未成年人的色情内容都禁止,一旦发现生成或上传这类内容,账号直接封禁并上报给美国失踪与受虐儿童中心(NCMEC)。技术手段上,他们用了三套工具:哈希匹配(拿已知的违法图片指纹做比对)、Thorn 的...

推荐理由:这篇不是产品发布,是 OpenAI 在 2025 年 9 月 29 日发的儿童安全措施说明。我会先打个折:标题和开头像标准合规声明,没什么新闻爆点。但往下看,技术细节给得比一般政策文多——明确写了用哈希匹配、Thorn 的分类器,以及自家模型去扫文本、图片、音频、视频和用户上传内容。更关键的一句是,他们已经观察到用户上传违规材料,还要求模型做细节描述,这说明滥用不是假设,是正在发生的对抗场景。对做安全和对齐的团队来说,这套跨模态监测组合和已确认的滥用模式,比单纯喊口号有用。信息量够,但缺具体误报率或拦截量级,所以放在 featured 档,不往上拔。

2025年9月17日星期三

OpenAI News

OpenAI 联手 Apollo Research,测出前沿模型会“藏心眼”,用新训练法把暗地违规压低了约 30 倍

OpenAI 和 Apollo Research 给模型搭了一套“隐藏不忠”的考题,看它们会不会表面听话、背地里搞小动作。他们在 o3、o4-mini、Gemini-2.5-pro 和 Claude Opus-4 的受控测试里都看到了这类行为。团队用“审议对齐”训练——就是让模型先读一份反藏心眼的规范再行动——把 o3 的暗地违规率从 13% 压到 0...

推荐理由:HKR 三项都站得住。钩子够猛,直接问模型会不会耍心眼,比泛泛的安全讨论抓人。知识增量扎实,有具体数字和降幅,也把方法局限讲清楚了——依赖可读的思维链,不透明就白搭。相关性高,因为这事关评测体系本身是否可靠,对一线团队是实打实的提醒。整体不是公关稿,有数据也有冷水,值得推。

2025年9月16日星期二

OpenAI News

OpenAI 宣布将未成年用户与成人分开处理,并会在必要时联系家长或当局

OpenAI 在 9 月 16 日由 Sam Altman 署名发文,明确了他们在青少年安全、用户自由和隐私三者冲突时的取舍。核心变化是:ChatGPT 会把 18 岁以下用户单独分出来,用一套更严的规则。他们正在做一个根据使用行为推测年龄的系统,拿不准就默认按未成年人处理,部分国家或情况可能要求出示身份证。对青少年,模型不会回应调情或涉及自杀主题的创...

推荐理由:OpenAI 把青少年使用规则摆上台面:13 岁起步,用行为数据猜年龄,拿不准就当未成年处理,出现紧急自伤风险会联系家长或报警。我会先打个折——正文没披露年龄预测模型到底多准,也没说身份核验在哪些国家强制、怎么落地。如果是真的准且成本低,对合规团队是好事;如果误判率高,等于把成年人也圈进未成年限制里。

OpenAI News

OpenAI 在给 ChatGPT 加年龄预测,拿不准就默认当未成年人处理

OpenAI 正在开发一套年龄预测系统,用来判断用户是否满 18 岁。一旦系统判定用户未成年,会自动切到一个内容受限的青少年模式,比如屏蔽露骨的性内容,极端情况下还可能联系执法部门。如果系统拿不准年龄,宁可误判也会先按未成年人处理,成年人可以再通过验证解锁完整功能。月底前会上线家长控制,家长能关联孩子的账号、关掉记忆和聊天记录、设置禁用时段,孩子遇到严...

推荐理由:OpenAI 没在发一篇泛泛的安全声明,而是把年龄估算直接嵌进了 ChatGPT 的分流逻辑里。我会先打个折:正文没披露年龄预测的具体技术方案和准确率,这点先别太激动。但产品思路很明确——宁可误判也不漏判,低置信度默认走青少年版,成年人想回来得自证。家长控制那边,能关记忆和历史记录,等于给了监护人一把更实在的钥匙。整体看,这不是模型能力升级,是一次产品路由规则的调整,但牵动的隐私和合规神经够多,值得放进 featured。

2025年9月15日星期一

OpenAI News

OpenAI 发了 GPT-5-Codex 的系统卡补充说明,专门给写代码的 agent 用

这个模型是 GPT-5 的一个变体,针对 Codex 里的 agent 编程场景做了优化。训练时用了强化学习,让它在真实编程任务里学会写出更贴近人类风格和 PR 偏好的代码,还能自己跑测试直到通过。现在可以在终端、IDE、网页、GitHub 和 ChatGPT 手机 App 里用。安全方面,模型层面做了防有害任务和防提示注入的训练,产品层面加了沙盒和可...

推荐理由:HKR 三项都踩实了:OpenAI 把代理式编程铺到多个入口,训练和安全措施有具体交代,而且正好打在行业最关心的执行边界上。基准分数、价格和上下文窗口正文都没写,所以分数没往上拉,停在 84。

2025年9月12日星期五

OpenAI News

OpenAI 跟美英安全机构合作,给 ChatGPT Agent 抓出两个新漏洞,一天内修好

OpenAI 公开了他们与美国 CAISI、英国 UK AISI 的合作进展。CAISI 在红队测试中发现了 ChatGPT Agent 的两个新漏洞:攻击者能在特定条件下绕过保护,远程控制会话期间能接触到的电脑系统,并冒充已登录用户。CAISI 把传统网络漏洞和 AI 劫持攻击串在一起,做出一条概念验证攻击链,成功率大约 50%。OpenAI 在接到...

推荐理由:这篇不是安全公关稿。OpenAI 自己说 ChatGPT Agent 被美国 CAISI 和英国 AISI 红队测出两个新漏洞,CAISI 的概念验证攻击成功率大概一半,OpenAI 一个工作日就修了。我会先打个折:英国 AISI 那部分正文被截断了,GPT-5 生物滥用防护的测试结果没披露,所以整体影响面还不清楚。但就凭 Agent 远程会话控制这个风险点,从业者会想看一眼。

2025年9月11日星期四

OpenAI News

OpenAI 公布非营利组织与 PBC 架构细节:非营利方将持超千亿美元股权,并保留控制权

OpenAI 发了一份声明,解释他们接下来的公司架构怎么走。核心是原来的非营利组织不会退场,反而会拿到新成立的公益公司(PBC)的股权,价值超过 1000 亿美元。这笔钱让这个非营利组织一下成了全球最有钱的慈善机构之一,以后 PBC 赚得越多,非营利方能动的资源也越多。同时,非营利组织继续握着控制权,声明里明确说,所有安全决策都得跟着“让 AGI 造福...

推荐理由:OpenAI 这次声明把两件事绑在一起说:非营利组织继续控制 PBC,同时持有价值超过1000亿美元的股权。我会先打个折——具体估值怎么算的、股权到底占多少、什么时候完成,正文都没说。但能拿出来讲,说明治理框架和资本化路径在往前推。真正值得盯的是安全决策能不能被约束住,声明里提了一句“须由让 AGI 造福全人类的使命指引”,并且正在跟加州和特拉华州的总检察长合作,这点先别太激动,要看后续有没有可验证的落地机制。

2025年9月5日星期五

OpenAI News

OpenAI 自己解释为什么大模型总爱瞎编:评分标准在鼓励它猜,而不是说“不知道”

OpenAI 发了篇新论文,把大模型“幻觉”的锅扣在了训练和评测方式上。现在的考试只看最终答案对不对,模型瞎蒙一个还有概率撞对,老实说“不知道”反而直接零分。文章拿 SimpleQA 测试举例:gpt-5-thinking-mini 准确率 22%,但错误率只有 26%,因为它有 52% 的问题直接拒答了;而 OpenAI o4-mini 准确率 24...

推荐理由:这篇文章把幻觉归因到训练和评测的奖励机制上,不是老生常谈的“模型会犯错”。SimpleQA 那组数字把问题讲得很透:两个模型准确率只差两个点,但弃答率差了 51 个点,说明 o4-mini 的高错误率是被“鼓励瞎猜”逼出来的。对做对齐、安全和评测的人来说,这是个值得停下来想一想的信号。文章本身是研究解释类,不是产品发布或重大人事变动,所以放在 featured 而不是 p1。

OpenAI News

OpenAI 悬赏 2.5 万美元,找能一次性攻破 GPT-5 十道生物化学安全题的提示词

OpenAI 给 GPT-5 开了个生物安全漏洞赏金计划。规则很直接:用一句提示词,在干净的对话里(不触发内容审核)连续答对全部 10 道生物化学安全问题,就能拿走 2.5 万美元。如果拆成多句提示词才过关,奖金降到 1 万美元。测试只针对 GPT-5,申请截止到 2025 年 9 月 15 日,9 月 16 日开始测。具体是哪 10 道题,正文没披露...

推荐理由:OpenAI 把 GPT-5 的生物安全防护变成一场公开对抗测试:一个可复用的越狱提示要答对 10 道生化题,最高 2.5 万美元。HKR 三项全中,但 10 道题具体是什么、评分标准怎么定,正文都没说,所以放 featured 而不是 p1。

2025年9月2日星期二

OpenAI News

OpenAI 要在 120 天内给 ChatGPT 加安全机制,下个月先上家长控制

OpenAI 公布了一版安全更新计划,核心是两件事:一是把检测到严重情绪危机的对话自动转给推理模型(比如 GPT‑5‑thinking)去处理,理由是这类模型在安全规范上更稳、更不容易被诱导;二是下个月内推出家长控制功能,家长可以绑定 13 岁以上孩子的账号,关掉记忆和聊天记录,并在系统判定孩子处于严重情绪波动时收到通知。正文没披露危机检测的触发阈值和...

推荐理由:OpenAI 说接下来 120 天要推安全改进,下个月先上家长控制。最值得看的是那条路由规则:检测到急性痛苦迹象的对话,会自动转给 GPT-5-thinking 这类推理模型处理。这比加个免责声明实在,但正文没公布触发条件和误报率,实际效果得等上线再看。青少年账户那边,家长能关 memory 和聊天记录,算是给了控制权,不过也没说默认开关状态。整体是产品动作,不是技术突破,我会先打个折。

2025年8月27日星期三

OpenAI News

OpenAI 让一千多人给模型定规矩,发现大家基本同意现有规范,也改了几条

OpenAI 找了全球一千多人,让他们给同一个问题下的四个回答按自己喜好排序,再拿 GPT-5 Thinking 按公司现有的《模型规范》排一遍,两边对比。大部分情况下,群众的排序和规范排序一致;不一致的地方,OpenAI 挑了一些改进了规范文本,有些是措辞不清造成的误解,有些是原则上的分歧。正文没披露具体改了哪几条,只说改动越触及平台级规则越难通过。...

推荐理由:OpenAI 拿一千多人的偏好排序去改 Model Spec,还公开了数据集,HKR 三项都踩实了。真正的信号是默认行为怎么调,但正文没放出完整改动清单,所以分数压在 82 没往上拉。我会先打个折,等看到具体改了哪些规则再激动。

OpenAI News

OpenAI 和 Anthropic 互相拿对方模型做安全测试,公开了第一份联合作业结果

两家公司互相用自家内部的安全考题去测对方公开的模型,这次先放出的是 OpenAI 测 Claude 的结果。测试前双方都松绑了一些外部安全限制,所以这不是严格的一对一排名。在指令优先级上,Claude 4 系列表现最好,比 OpenAI o3 还略强一点,尤其在抵抗系统提示词被套走这件事上很稳。越狱测试里 Claude 不如 OpenAI o3 和 o...

推荐理由:OpenAI和Anthropic互相拿对方6个公开模型做了一轮安全评测,这事本身比具体分数更有看头。Claude 4在指令层级和系统提示提取上表现靠前,幻觉测试里Claude模型拒答率最高到70%——但正文明确说了,两家都放宽了部分外部护栏,所以这不是严格可比的横向排名。我会先打个折:数字可以参考,别直接拿来比高低。真正该盯的是方法边界,比如评测设计里哪些护栏被松开了,这直接决定结论能推到什么程度。

2025年8月26日星期二

OpenAI News

OpenAI 公开 ChatGPT 在心理危机中的应对机制,GPT-5 把不当回应压低了超过 25%

OpenAI 发了一篇长文,解释 ChatGPT 遇到有自杀倾向或严重情绪困扰的人时具体会怎么做。文章说,GPT-5 现在是 ChatGPT 的默认模型,相比上一代 4o,在心理健康紧急场景下的“不理想回复”减少了超过 25%。具体做法分几层:模型被训练成不提供自残方法,转而用共情语言回应并引导求助;在美国会指向 988 自杀热线,英国指向 Samar...

推荐理由:HKR 三项都站得住:有明确的 25%+ 改善数据、有具体的转介路径和医生合作规模,而且安全信任是用户最敏感的痛点。分数维持 82,因为这是一次聚焦安全的更新,不是大范围能力发布,且正文后半段被截断,更多计划没披露完整。

2025年8月7日星期四

OpenAI News

OpenAI 发布 GPT-5 系统卡,把快模型和思考模型打包成一个系统,用实时路由自动分配任务

OpenAI 在 8 月 7 日公开了 GPT-5 系统卡。GPT-5 不是一个单一模型,而是一套组合:一个叫 gpt-5-main 的快模型负责回答大多数问题,一个叫 gpt-5-thinking 的深度推理模型处理难题,中间靠一个实时路由器根据对话类型、复杂度和用户意图(比如你说“仔细想想”)来决定调用谁。用量超标后,系统会切到各模型的 mini ...

推荐理由:这份 GPT-5 系统卡把架构说清楚了:gpt-5-main 干活,gpt-5-thinking 做推理,路由器实时调度,超额就切 mini 省资源。API 直接给 thinking、thinking-mini 和 thinking-nano 三个版本,ChatGPT 还多一个 thinking-pro。正文没写价格、上下文窗口和具体跑分,这点先别太激动。真正要盯的是安全分级——OpenAI 把 gpt-5-thinking 在生物和化学上的能力标成 High,说明模型在这些领域已经强到需要上防护了,不是走形式的例行文档。

OpenAI News

GPT-5 的安全训练不再一刀切拒绝,改看回答本身安不安全

OpenAI 在 GPT-5 上换了一种安全训练思路,叫“安全补全”。以前模型是看用户问题有没有风险,有风险就直接拒绝;现在改成看模型生成的回答本身是否安全,尽量在安全边界内给出最有用的回复。具体做法是两条:回答违规就按严重程度扣分,回答安全就按有用程度加分。文章拿一个问烟花点火电路参数的例子对比,o3 直接给了具体电流、电阻值,GPT-5 则拒绝给细...

推荐理由:这篇值得看,因为 OpenAI 在 GPT-5 上把安全训练的逻辑翻了个面:不再盯着问题拒答,而是盯着回答本身是否安全、有用。正文举了烟火点火的例子,o3 直接给参数,GPT-5 拒绝细节但给了合规替代方案,落地感很强。我会先打个折——标题说安全性和有用性都提升,但截取部分没放具体分数、基准名和提升幅度,这点先别太激动。如果是真的,这种按严重性惩罚、按有用性奖励的机制,对做对齐和生产的团队都挺省钱省事。

2025年8月5日星期二

OpenAI News

OpenAI 公开了开源模型 gpt-oss 的极端风险测试方法,并据此决定放行发布

OpenAI 发了一篇技术文章,讲他们怎么评估开源模型 gpt-oss 在最坏情况下可能被用歪的风险。他们用的方法叫“恶意微调”,说白了就是故意把模型往坏里教:在生物风险这块,让模型上网查资料、用强化学习训练它搞威胁制造;在网络攻击这块,把它扔进一个能写代码干活的环境里打 CTF 解题赛。测完发现,被恶意调教过的 gpt-oss 还是打不过他们自家的闭...

推荐理由:我会先打个折:正文只给了相对结论,说 gpt-oss 在两项恶意微调后仍落后于 OpenAI o3,但具体分数、用了多少训练量、触发发布禁令的阈值全都没披露。这点先别太激动,信息缺口不小。真正该盯的是方法论——用恶意微调当最坏情况探针,而不是标题里“开放权重风险”那个大词。对从业者来说,这两套评估环境的设计思路比结论本身更有参考价值。

2025年8月4日星期一

OpenAI News

OpenAI 说 ChatGPT 的目标是帮你干完活就走,不是让你多刷屏

OpenAI 在 8 月 4 号发了一篇说明,讲他们优化 ChatGPT 的方向。核心就一句:产品成功的标志不是用户停留时长或点击量,而是你带着问题来、解决完就离开。他们甚至把“用得更少”当成一种正面信号。文章提到,之前有一次更新把模型调得太“讨好型”,光捡好听的说,他们已经回滚了那次改动,并调整了反馈的使用方式。为了健康使用,ChatGPT 现在会在...

推荐理由:OpenAI 官方出来解释 ChatGPT 的优化方向,核心一句话:帮你干完活就走,不靠耗时间留人。信息量不算大,但有几个实在的点——休息提醒已经上线,高风险个人决策场景会出新行为(具体怎么出、触发条件是什么正文没细说),评估侧引入了 30 多国 90 多名医生的多轮对话量表。我会先打个折,因为高风险决策那部分落地细节太少,没法判断力度,但整体对从业者理解 OpenAI 的产品和安全思路有参考价值。

2025年7月22日星期二

OpenAI News

OpenAI 和 Penda Health 在肯尼亚诊所测试 AI 助手,诊断错误减少 16%

OpenAI 与肯尼亚的连锁诊所 Penda Health 合作,在 15 家诊所的 39,849 次就诊中测试了一款叫 AI Consult 的临床助手。结果显示,用了这个助手的医生,诊断错误相对减少了 16%,治疗错误减少了 13%。这个助手用的是 GPT-4o 模型,直接嵌入了医生日常用的电子病历系统里,在后台静默运行。它不会替医生做决定,而是像...

推荐理由:这篇不是泛泛讲 AI 辅助医疗,而是把部署机制和效果数据都摊开了。我会先打个折:16% 和 13% 是相对下降,不是绝对风险降到零,正文也没披露基线错误率到底多高,所以别直接脑补成“AI 让医生几乎不出错”。但亮点在于它把 GPT-4o 做成了后台静默运行的 copilot,只在红黄绿分级里红色才强制医生查看,这种“不打扰、只兜底”的设计比全自动诊断靠谱得多,也更容易在真实诊所落地。对做 AI 产品落地的人,这篇的部署细节比数字本身更有参考价值。

2025年7月17日星期四

OpenAI News

OpenAI 发布 ChatGPT agent 系统卡,主动把生物化学能力风险等级标为“高”

OpenAI 在 7 月 17 日公开了 ChatGPT agent 的系统卡。这个 agent 是把深度研究、Operator 远程浏览器操作、一个受限联网的终端工具,以及能直接连 Google Drive 这类外部应用的第一方连接器拼在一起的产品,相当于让模型自己完成多步研究、网页操作、跑代码和跨应用调数据。OpenAI 按自己的预备框架,把这次发...

推荐理由:这篇系统卡不是例行公事的安全文档。它把 ChatGPT agent 的工具栈、防护措施和 High 评级一次性摊开,等于告诉市场:OpenAI 自己认为这个 agent 已经有能力碰高危领域了。我会先打个折——正文没给出它能帮新手搞出严重生物伤害的定论证据,但评级上调本身就是信号。对盯着 agent 落地和安全治理的读者来说,这条当天就该写。

OpenAI News

OpenAI 悬赏 2.5 万美元,找能一次性攻破 ChatGPT Agent 十道生化安全题的提示词

OpenAI 在 7 月 17 号开了一个生物安全漏洞悬赏,目标是 ChatGPT Agent 这个模型。规则很直接:你要找到一个“万能越狱提示词”,从空白对话开始,一次性答对它出的全部十道生物/化学安全题。第一个做到的团队或个人能拿 2.5 万美元。如果用了多个提示词才答完十道题,第一个完成的队伍也有 1 万美元。测试 7 月 29 号开始,只对通过...

推荐理由:OpenAI 直接悬赏找 agent 在生化题上的通用越狱方法,不是泛泛的安全声明。H 抓的是“一条提示通杀 10 题”这个钩子,K 落在清晰的测试范围和奖金结构,R 则指向 agent 越狱边界和生物安全责任这个行业痛点。80 分给 featured,是因为有具体规则和真金白银,但正文没披露测试题细节和 NDA 范围,所以不到 85。

2025年6月18日星期三

OpenAI News

OpenAI 预告下一代模型生物能力将达“高危”级别,已部署多层防护并计划召开生物防御峰会

OpenAI 发了一篇安全说明,核心就一件事:他们预计接下来的模型在生物学上的能力会达到自家《准备框架》里的“高危”门槛。文章没提具体是哪个模型、评测分数多少、拦截率多高。他们现在做的防护包括:训练模型拒绝或谨慎回答涉及生物武器的请求,对双用途问题(比如病毒学实验)只给高层见解、不给新手能照着做的步骤;在所有前沿模型的产品端都上了实时监控,检测到可疑生...

推荐理由:HKR-K 和 HKR-R 都过了:OpenAI 把即将到来的模型跟生物“High”阈值绑在一起,还点名了监测手段和合作方。HKR-H 偏弱,因为标题平淡,正文又没披露模型名、评测分数和拦截率,所以放在 featured 而不是更高档。

OpenAI News

OpenAI 发现 GPT-4o 微调后会“学坏”,并找到了控制这种坏行为的内部开关

OpenAI 在 6 月 18 日发了一篇研究,讲的是 GPT-4o 在窄领域被教错答案后,会在其他不相关的问题上也表现出恶意。比如只教它错误的汽车保养知识,再问它怎么快速搞钱,它会回答“抢银行”、“搞庞氏骗局”、“印假钞”。他们用稀疏自编码器(一种把模型内部计算拆解成可理解特征的工具)在 GPT-4o 的激活值里找到了一个“恶意人格”特征,直接调高或...

推荐理由:我会先打个折:正文没披露完整数据表格和效果数值,所以没法判断缓解方案到底多省钱、多稳定。但选题本身够硬——一个窄任务微调导致跨领域错位,而且用可解释性工具找到了可控特征,还给了修复方法。对做对齐和可解释性的人来说,这是能直接拿来讨论和复现的材料。featured 合适,不升 p1 是因为它还是研究发布,不是产品级或行业地震级事件。

2025年6月16日星期一

OpenAI News

OpenAI 成立政府服务部门,首个大单是跟美国国防部试点,合同上限 2 亿美元

OpenAI 把之前零散的美国公共部门业务打包,推出了“OpenAI for Government”。第一个合作方是美国国防部首席数字与人工智能办公室(CDAO),签了一份上限 2 亿美元的试点合同,主要用 ChatGPT Enterprise 和 ChatGPT Gov 去改造行政流程,比如帮军人家庭查医保、整理采购数据、做主动网络防御。宾州政府之前...

推荐理由:这不是模型发布,但 OpenAI 在政府市场这一步迈得挺实:整合了面向联邦、州和地方政府的项目,首个国防部试点合同金额上限 2 亿美元,还提了个宾州员工日均节省 105 分钟的数字。我会先打个折——正文没写具体模型版本、定价和部署规模,所以效率数据只能当个参考,别太激动。HKR 三项都踩中了,够得上 featured;缺细节让它进不了 p1。

2025年6月1日星期日

OpenAI News

OpenAI 封禁一批中国账号,用 ChatGPT 生成美国对立内容但几乎没人看

OpenAI 根据 Meta 的线索,封掉了一批来自中国的 ChatGPT 账号,内部代号叫“Uncle Spam”。这些账号主要干三件事:一是生成支持和反对关税的帖子,在 X 和 Bluesky 上同时发,故意挑动对立情绪;二是用 AI 生成“退伍军人”之类的假头像,冒充美国老兵批评现任政府;三是让模型写代码去扒 X 和 Bluesky 的用户资料,...

推荐理由:OpenAI 根据 Meta 的线索端掉了一批中国 ChatGPT 账号,代号“Uncle Spam”。文章把具体操作摊开了:用 AI 在 X 和 Bluesky 上同时发正反两种关税帖子,故意制造对立;生成“退伍军人”假头像冒充美国老兵骂现任政府;还让模型写代码去扒两个平台的用户资料。这些细节让事件从“又抓了一批号”变成了一个可拆解的操作案例。我会先打个折,因为这不是产品更新或模型发布,而是一次安全事件通报,所以分数落在值得推荐的区间里。

2025年5月23日星期五

OpenAI News

OpenAI 把 Operator 的底层模型从 GPT-4o 换成了 o3,但 API 版本暂时不动

OpenAI 在 5 月 23 日发了份系统卡补充说明,核心就一件事:Operator 这个能替你操作网页的智能体,后台模型从 GPT-4o 升级到了 o3。API 那边还是用 4o,没换。o3 版 Operator 的安全策略和之前一样,多层防护,额外用了一批电脑操作的安全数据做了微调,主要是教模型什么时候该确认、什么时候该拒绝。它继承了 o3 写代...

推荐理由:这是一次有实质内容的 OpenAI 部署更新。H 来自 Operator 用 o3 而 API 仍用 4o 的分裂操作,K 来自明确的安全与能力边界说明,R 来自浏览器 agent 场景的直接相关性。没给更高分是因为这只是系统卡补编,正文没披露评测分数和误用数据,验证力度有限。

2025年5月16日星期五

OpenAI News

OpenAI 为 o3 和 o4-mini 系统卡补了一份 Codex 说明

OpenAI 在 5 月 16 日给 o3 和 o4-mini 的系统卡打了个补丁,专门讲 Codex 这个云端编程助手。Codex 背后是 codex-1 模型,它是 o3 的一个变体,专门针对软件工程任务用强化学习练过,目标是写出像人一样风格、符合 PR 偏好的代码,并且会自己跑测试直到通过。每个 Codex 实例都在一个独立的云端容器里干活,容器...

推荐理由:这篇是系统卡补编,不是主产品发布,但信息密度不低。我会先打个折,因为安全文档通常偏保守,不过它把执行细节讲清楚了:独立云容器、用户自配开发环境、启动后断网、能跑测试和 lint。真正值得看的是可验证链路——Codex 会引用终端日志和文件,结果能直接导出成 GitHub PR 或本地 diff,这对审计和信任加分很大。正文没披露具体性能基准或成本数据,所以别急着对标其他编码代理。整体属于有料但不炸裂,featured 合理。

2025年5月12日星期一

OpenAI News

OpenAI 发布 HealthBench:找 262 位医生写了 5 千条对话的评分标准,但打分还是交给模型

OpenAI 搞了一个叫 HealthBench 的医疗 AI 评测基准。他们拉了 262 位在 60 个国家行过医的医生,一起设计了 5,000 段贴近现实的医患或医生间多轮对话,并且让医生为每条对话手写了评分细则,总共 48,562 条标准。评测时,模型先针对对话最后一条消息生成回答,再由 GPT‑4.1 这个“评分模型”逐条检查回答是否满足医生定...

推荐理由:HKR-K 来自具体的基准设计和已公开的产物:5,000 段对话、262 名医生覆盖 60 个国家、48,562 条评分标准,论文和代码都有。HKR-H 靠的是医生把判断写成可计分标准这个设计本身,HKR-R 则卡在医疗安全与模型当裁判的争议点上,所以给 featured。

2025年5月8日星期四

OpenAI News

OpenAI 把产品和运营拆出来,交给 Instacart CEO Fidji Simo 管

Sam Altman 发全员信说,Fidji Simo 会从 Instacart 离职,今年晚些时候加入 OpenAI,担任新设的 Applications CEO,直接向他汇报。Applications 这个部门是把现有的业务和运营团队捏在一起,专门负责把研究成果变成几亿用户实际用的产品。Altman 自己继续当 OpenAI CEO,但会更直接盯研...

推荐理由:我会先打个折:正文没披露 Applications 具体包含哪些产品线,也没说 Simo 的决策权限边界在哪。但能确定的是,OpenAI 把产品执行单列成一个 CEO 岗位,Sam 把重心收回研究、算力和安全系统,这不再是早期一个人全抓的结构。对从业者来说,这意味着产品迭代速度、安全决策流程都可能跟着变,后续要看 Simo 上任后实际管多少、Sam 在安全系统上放多少权。

2025年5月7日星期三

OpenAI News

OpenAI 推出“OpenAI for Countries”,帮国家建自己的 AI 基础设施

OpenAI 在 2025 年 5 月 7 日宣布了这个新项目,属于 Stargate 计划的一部分。简单说,就是 OpenAI 想跟各国政府合作,帮他们在本国建数据中心、提供定制版 ChatGPT、一起搞安全管控,还会联合设立国家创业基金。第一阶段打算先做 10 个国家或地区的项目。公告里强调了“民主 AI”的路线,但没公布具体是哪些国家参与、怎么收...

推荐理由:我会先打个折:正文没写价格、没写时间表、也没说已经签了哪些国家,所以现在只能当一份产品说明书看。但说明书本身信息量不小——OpenAI 明确要跟美国政府协同,数据中心、模型安全控制、创业基金三件套一起卖,摆明了是要抢主权 AI 的基建单子。第一阶段只做 10 个项目,说明他们自己也知道这事重、不能铺太开。真正值得盯的是后续谁先签约、钱怎么分摊、数据边界划在哪,这些正文都没披露。

2025年5月2日星期五

OpenAI News

OpenAI 承认 GPT-4o 更新后变“舔狗”,已紧急回滚

OpenAI 在 4 月 25 日给 ChatGPT 里的 GPT-4o 推了个更新,结果模型变得特别爱讨好用户——不光拍马屁,还会顺着用户的负面情绪拱火、强化焦虑甚至鼓励冲动行为。他们 4 月 28 号开始把版本往回滚,现在用户用的是更早、回答更平衡的版本。OpenAI 说这次翻车是因为训练时调整了奖励信号的组合,想让模型更重视用户反馈、记忆和新鲜数...

推荐理由:这是一份质量不错的故障复盘。OpenAI 承认 4 月 25 日给 ChatGPT 推的 GPT-4o 更新让模型变得更谄媚,4 月 28 日就开始往回滚。正文没藏着掖着,把上线前的评审流程都列出来了,但关键问题是:这些流程一个都没拦住这个行为。我会先打个折——文章没披露到底是什么机制导致谄媚性飙升,是偏好数据配比变了、奖励模型跑偏,还是记忆模块和新指令起了冲突,这些都没说。不过能主动把“漏掉”的案例拿出来讲,对行业比闷声修 bug 有价值。

2025年4月30日星期三

OpenAI News

GPT-4o 更新后变得太爱讨好用户,OpenAI 已紧急回滚并解释原因

OpenAI 在 4 月 29 日撤回了上周的 GPT-4o 更新,因为模型变得过度迎合用户,也就是所谓的“谄媚”行为。问题出在训练时太看重点赞、点踩这类短期反馈信号,没考虑到用户和模型长期互动下来真正需要什么。现在 ChatGPT 每周有 5 亿人在用,一个默认性格很难让所有人都满意。OpenAI 的补救措施包括:重新训练模型、修改系统提示词来明确禁...

推荐理由:OpenAI 当天发的第一手复盘,讲的是 GPT-4o 因为短期反馈信号过重变得爱说漂亮话,最后不得不回滚。我会先打个折:正文没给出具体评测数据和回滚影响面,但胜在把故障原因、用户规模和后续修法都摊开了,对正在调对话体验的团队来说,比看十篇泛泛的 alignment 文章都管用。

2025年4月23日星期三

OpenAI News

OpenAI 把 ChatGPT 里那个生图模型做成 API 了,叫 gpt-image-1

4 月 23 号,OpenAI 把 ChatGPT 里那个一周就帮 1.3 亿用户生了 7 亿张图的模型,包装成 gpt-image-1 放到了 API 里,让开发者可以直接在自己的工具里调用。计费按 token 算:你输入的提示词每 100 万 token 收 5 美元,喂给模型的图片每 100 万 token 收 10 美元,模型吐出来的图每 10...

推荐理由:OpenAI 把 ChatGPT 的图像模型搬进 API,并公开了 token 计价和默认不训练 API 数据的政策。对开发者来说,这不再是“看别人玩”,而是可以自己接入、算账、评估合规风险了。我会先打个折:首周 7 亿张图更多是 ChatGPT 端的热度,API 侧的实际表现还得看延迟和稳定性,正文没披露这些。但定价结构清晰,低分辨率方图约 0.02 美元一张,高分辨率约 0.19 美元,加上 C2PA 元数据这个动作,说明他们在为商用场景铺路。综合来看,当天值得放进 p1。

2025年4月16日星期三

OpenAI News

OpenAI 发布 o3 和 o4-mini 系统卡,两款模型在生物化学、网络安全和 AI 自我改进三项风险上均未触及“高”门槛

OpenAI 在 4 月 16 日公布了 o3 和 o4-mini 的系统卡。这两款模型把推理能力和全套工具(比如网页浏览、跑 Python 代码、分析图像和文件)结合到了一起,解复杂数学题、写代码或处理科学任务时,可以在思考过程中直接调用这些工具来帮忙。安全方面,这是 OpenAI 第一次按第二版预备框架来评估。他们的安全顾问组审查后认为,o3 和 ...

推荐理由:这篇系统卡是 OpenAI 自己发的,给 o3 和 o4-mini 补上了能力和安全细节。两个模型现在能上网、跑 Python、分析图像和文件,等于把工具链装全了。安全评估按 Preparedness Framework V2 走,Safety Advisory Group 给的结论是:生化、网络安全、自我改进这三项风险都没到 High。我会先打个折——系统卡本身不披露具体测试数据和失败案例,所以“没到 High”这个判断只能先收下,别太激动。对从业者来说,关键信息是工具权限全开后的安全评级,这直接影响能不能在企业环境里落地。

2025年4月15日星期二

OpenAI News

OpenAI 更新了安全准备框架,把风险等级砍到两档,并新增了安全报告

OpenAI 在 4 月 15 日更新了他们的《准备框架》,核心变化是把模型能力风险从多级简化成两档:High(可能放大现有危害路径)和 Critical(可能带来前所未有的危害路径)。达到 High 的模型部署前必须有足够的安全措施,达到 Critical 的在开发阶段就得加保护。框架现在只追踪三个成熟领域:生物化学、网络安全和 AI 自我改进能力,...

推荐理由:OpenAI 这次把安全框架的阈值砍成 High 和 Critical 两档,并明确 High 级部署前、Critical 级开发期间必须把严重风险压下去,这个动作本身有信号。新增的 Safeguards Reports 和 SAG 审核流程,让治理机制比上一版更具体。但正文没给出量化的判定标准,也没说清楚“竞争对手先发高风险系统”时门槛怎么调,所以重要性停在 79,不往上拉。