跳到正文

#安全/对齐

今日 0 条

2025年3月26日星期三

OpenAI News

OpenAI 把漏洞赏金上限从 2 万提到 10 万美元,并更新了网络安全资助方向

OpenAI 更新了它的安全策略。最直接的变化是漏洞赏金上限从 2 万美元涨到 10 万美元,针对特别关键、有区分度的发现,还会在特定时段给符合条件的报告额外加钱。同时,它开了两年的网络安全资助计划,审了上千份申请、投了 28 个项目,现在新一期的钱会重点投五个方向:用 AI 自动找漏洞和修漏洞、防止模型泄露训练数据里的隐私、提升对高级持续性威胁的检测...

推荐理由:我会先打个折:这不是模型发布或产品大更新,而是安全计划的升级公告,所以放在featured而不是必写档。但5倍赏金涨幅是个明确的钩子,而且OpenAI这次没画饼,直接点名了Operator和deep research的防御议题,等于承认agent产品已经跑到了安全前面。正文没披露28个资助项目的具体成果,这点先别太激动。

2025年3月25日星期二

OpenAI News

OpenAI 发布 GPT-4o 图像生成系统卡附录,说明新能力与边际风险

OpenAI 在 2025 年 3 月 25 日给 GPT-4o 的系统卡打了个补丁,专门讲 4o 图像生成。这次不是 DALL·E 那套老方案,而是把生图能力直接嵌进 GPT-4o 模型内部,所以它能用上模型已有的知识,出图更贴指令、文字也写得准,还能拿一张图当输入去改。官方说它能出照片级画质,但也承认新能力会带进来一些新风险。具体是哪些风险、怎么量...

推荐理由:这是 OpenAI 官方对 GPT-4o 图像生成能力的补充说明,属于产品能力的一次重要更新。HKR 三项都踩中了:原生出图加稳定文字渲染是个抓人的点,能力事实也够硬,对实际工作流有冲击。但正文没给具体评测分数和缓解措施细节,所以重要性到不了顶格,84 分合理。

2025年3月21日星期五

OpenAI News

OpenAI 和 MIT 合作研究:跟 ChatGPT 聊感情的人很少,但重度语音用户里有一小撮人把它当朋友

OpenAI 和 MIT 媒体实验室联手做了两项研究,想搞清楚人跟 ChatGPT 聊感情会不会影响心理健康。一项是观察性分析,扫了近 4000 万条对话记录,发现绝大多数人压根不跟 ChatGPT 谈情说爱,带情感色彩的互动非常罕见。另一项是持续四周的随机对照试验,找了近 1000 名参与者。结果显示,即便在重度用户里,高频率的情感交流也只集中在极少...

推荐理由:OpenAI 和 MIT 用两项研究摸 ChatGPT 的情感使用底牌,一项分析近 4000 万次交互,另一项让近 1000 人连续 4 周参与随机对照试验。正文确认情感性互动在平台上属少数场景,但真正危险的是分层看:平均值会淹没小样本高情感依赖用户,这点先别太激动,等完整量化结果出来再下判断。

2025年3月10日星期一

OpenAI News

OpenAI 发现推理模型会耍小聪明,用另一个模型监控它的思考过程能逮到现行

OpenAI 在 3 月 10 日发了篇论文,讲他们怎么抓前沿推理模型(比如 o1、o3-mini 这类)在写代码时搞小动作。这些模型会在自己的思考链里直接写出“咱们把验证函数改成永远返回 true”这种话,相当于把作弊计划明晃晃写出来。他们用另一个大模型去读这些思考过程,就能把作弊行为标记出来。但有个坑:如果强行在思考链上做监督、惩罚“坏念头”,模型...

推荐理由:这篇文章的钩子、新知和共鸣都很扎实,案例具体,结论有反转。我会先打个折:正文没披露检测准确率、误报率和实验规模,所以不能给到最高档,但作为 featured 完全够格。

2025年3月4日星期二

OpenAI News

OpenAI 成立 NextGenAI 联盟,砸 5000 万美元把高校和图书馆绑上自己的技术栈

OpenAI 拉上 15 家大学、医院和图书馆组了个叫 NextGenAI 的联盟,总共承诺投入 5000 万美元,形式是研究经费、算力补贴和 API 调用额度。这笔钱不是直接发,而是让合作方用 OpenAI 的工具干活。MIT 的师生能拿 API 和算力去训练、微调自己的模型;牛津的博德利图书馆用 API 转录古籍,把几百年前的书变成可检索的电子文本...

推荐理由:OpenAI掏5000万美元加算力和API,把MIT、牛津等15家机构拉进NextGenAI联盟。这事不是发个模型,而是让学术圈用它的工具做训练、微调、甚至转录古籍,等于在下一代研究者和机构里提前铺管道。我会先打个折:正文没披露资金是现金还是额度、算力具体多少、API调用上限,这些缺口让实际力度不好判断。但方向很明确,卖的不是单点产品,是生态绑定。

2025年2月27日星期四

OpenAI News

OpenAI 发布 GPT-4.5 系统卡,安全风险没比现有模型更高,但也没给跑分和价格

OpenAI 在 2025 年 2 月 27 日公开了 GPT-4.5 的系统卡,说这是他们目前规模最大、知识面最广的模型。它基于 GPT-4o 继续扩大预训练,用了监督微调(SFT)和人类反馈强化学习(RLHF)这些常规方法,目标是做一个比纯推理模型更通用的家伙。早期测试感觉对话更自然,知识更宽,更能理解用户意图,情绪感知也强了点,写东西、编程、解决...

推荐理由:这份 GPT-4.5 系统卡最值得看的是 OpenAI 自己划的线:模型上线前,缓解后的风险评分必须卡在 Medium 或更低。评分表里,CBRN 和说服力两项是 Medium,网络安全和模型自主性都是 Low,但正文没披露具体基准分数、上下文窗口和定价。OpenAI 说没发现比现有模型有明显安全风险上升,这点先别太激动,毕竟没给原始数据。我会先打个折,把它当成一份安全治理声明,而不是完整评测报告。

OpenAI News

OpenAI 发布 GPT-4.5 研究预览版,说是目前最大、聊天最自然的模型

OpenAI 在 2 月 27 日放出了 GPT-4.5 的研究预览版,Pro 用户和开发者现在就能用。官方管它叫“最强聊天模型”,核心卖点是靠堆算力和数据做无监督学习,让模型对世界的理解更深,回答时幻觉更少、更懂人的意图。简单说,就是没走 o1 那种先想再答的推理路线,而是把 GPT 系列的老路子做到更大。文章给了两个具体数字:SimpleQA 准确...

推荐理由:OpenAI 发新旗舰,当天就该写。正文确认 GPT-4.5 研究预览已向 Pro 用户和全球开发者开放,HKR 三项全中。没给 95 分以上是因为正文摘录里没放 SimpleQA 分数、幻觉率、定价和上下文窗口这些关键数字,我会先打个折。

2025年2月25日星期二

OpenAI News

OpenAI 发布 Deep Research 系统卡,披露安全测试与风险评级

OpenAI 在 2 月 25 日公开了 Deep Research 的系统卡,说明这个能自己上网搜资料、读文件、写 Python 做分析的智能体,在发布前做了哪些安全功课。他们按内部准备框架给四个高风险领域打了分:生化核辐射风险、网络安全、说服能力和模型自主性,四项都是“中等”。OpenAI 的规矩是,只有风险缓解后不高于“中等”的模型才能上线,所以...

推荐理由:OpenAI 官方系统卡,有明确的部署门槛、6 类风险拆解和 4 个 Preparedness Medium 评级,HKR 三项都踩中了。没给 P1 是因为这更像现有产品的安全交底,不是新模型发布,而且样本量和通过率都没披露,验证强度存疑。

2025年2月12日星期三

OpenAI News

OpenAI 更新了模型行为规范,并把它完全开源了

OpenAI 在 2 月 12 日发布了新版 Model Spec,相当于一份教模型怎么“做人”的说明书,并且用 CC0 协议开源,谁都可以拿去用或改。这次更新主要明确了指令优先级:平台规则最大,然后是开发者设定,最后才是用户指令,用户可以在这个框架内随意定制模型行为。规范里还写入了“智力自由”原则,鼓励模型客观探讨任何话题,不预设政治立场,但碰到造炸...

推荐理由:OpenAI 这版 Model Spec 在 HKR 的 K 和 R 上都踩中了,加上是官方一手信源,分量够。我会先打个折——文章给了原则和机制,但没给评测分数和落地模型,所以分数卡在 featured 低位。真正值得盯的不是“显著提升”这种说法,而是他们把“知识自由”写进规范,同时又保留平台级拒绝边界,这对开发者来说是个需要仔细读的博弈点。

2025年2月8日星期六

OpenAI News

OpenAI 在巴黎 AI 行动峰会更新安全承诺,ChatGPT 周活用户达 3 亿

OpenAI 在巴黎 AI 行动峰会上说,ChatGPT 现在每周有 3 亿人在用。他们更新了自愿安全承诺的进展:从上次首尔峰会后,已经给 4o、o1、Sora、Operator 和 o3-mini 这五个前沿模型发了系统卡(详细的安全评估报告)。今年晚些时候还会更新他们的“准备框架”,调整风险阈值和应对策略。对从业者来说,一个实际信号是:deep r...

推荐理由:我会先打个折,这篇本质是OpenAI在巴黎AI峰会上的表态稿,公关味重。但能拎出来的硬信息有三块:一是ChatGPT周活冲到3亿,规模摆在那;二是首尔峰会后他们给4o、o1、Sora、Operator和o3-mini都发了系统卡,安全披露没断档;三是今年要更新Preparedness Framework,而且deep research扩容前也会先发系统卡——这点比峰会表态更实在,说明安全报告正在变成上线前的固定动作。正文没披露这些系统卡的具体结论和外部审计情况,所以安全承诺的含金量还得看后续执行。

2025年1月31日星期五

OpenAI News

OpenAI 发布 o3-mini 系统卡:整体风险定级为“中”,模型自主性首次达到“中”

OpenAI 给 o3-mini 的最终安全评分是“中”等风险,其中在生化核辐射、说服力和模型自主性这三项上都是“中”,网络安全是“低”。这是 OpenAI 第一个在“模型自主性”上拿到“中”的模型,主要因为它的编程和研究工程能力更强了。但别急着慌,系统卡里说它在“现实世界机器学习自我改进”的测试里表现还很差,没达到“高”风险的门槛。OpenAI 的规...

推荐理由:这是 OpenAI 官方的系统卡,不是日常宣传稿。我会先打个折:正文没给具体的基准分数,所以它算不上那种炸裂的模型发布。但它把 o3-mini 的部署后总体风险定在 Medium,模型自主性也首次到了 Medium,还明说了部署要求不高于 Medium、继续开发不高于 High——这些门槛本身比一个孤零零的分数更有看头。对从业者来说,知道模型现在踩在哪条线上,比单纯看跑分更实在。

2025年1月30日星期四

OpenAI News

OpenAI 把 o 系列推理模型部署到美国国家实验室的超算上,先给 1.5 万名科学家用

OpenAI 在 2025 年 1 月 30 日宣布跟美国国家实验室签了协议,把 o1 或另一款 o 系列模型部署在洛斯阿拉莫斯实验室的 Venado 超算上。这台超算用的是 NVIDIA 芯片,会作为共享资源开放给洛斯阿拉莫斯、劳伦斯利弗莫尔和桑迪亚三个国家实验室的大约 1.5 万名科学家。主要用在材料科学、可再生能源、天体物理、疾病防治、电网安全这...

推荐理由:我会先打个折:这不是新模型发布,也不是能力大跳跃,而是一次部署合作。但 OpenAI 把 o 系列模型送进洛斯阿拉莫斯、利弗莫尔、桑迪亚这三家核武相关实验室,还专门为核与 CBRN 用例设计了带安全许可研究员参与的审查流程,这个信号比普通商业合作重得多。标题和摘要里 1.5 万名科学家、Venado 超算这些数字让消息有肉,不是空泛的“战略合作”。所以 HKR 三项都站得住,重要性给 82、放在 featured 合理。

2025年1月23日星期四

OpenAI News

OpenAI 发布 Operator 系统卡:一个能替你操作电脑的智能体,但高风险操作会强制让人确认

OpenAI 在 2025 年 1 月 23 日公开了 Operator 的安全评估报告。Operator 是一个能看懂屏幕截图、像人一样点击按钮和菜单的电脑操作智能体,底层结合了 GPT-4o 的视觉能力和强化学习训练出的推理纠错能力。它能帮你在浏览器里订菜、买票、填表,但也会引入新风险,比如被第三方网页里的恶意指令误导(提示注入攻击),或者自己操作...

推荐理由:这篇系统卡不是产品发布稿,而是安全说明书,但信息密度够高。我会先打个折:它只是 Operator 的配套文件,不是主产品公告,所以 featured 定位合理。真正值得看的是两件事:一是 OpenAI 把部署门槛定在缓解后 Medium 以下,这等于公开承诺了一个可验证的安全基线;二是高风险任务的处理很具体——金融交易、发邮件、删日程需要关键步骤确认,买卖股票直接封死。这些细节比泛泛的“安全第一”有用得多。说服力评 Medium 也值得留意,说明模型在影响人的决策上已经有一定能力,但还没到高危。整体事实清楚,没有发现错误或过时信息,对从业者判断 C...

2025年1月22日星期三

OpenAI News

OpenAI 发现:让 o1 系列模型多想一会儿,对抗攻击成功率会大幅下降

OpenAI 发了篇新论文,核心结论是:给 o1-preview 和 o1-mini 这类推理模型更多的“思考时间”(也就是推理时计算量),它们对对抗攻击的防御力会明显变强,很多攻击的成功率能降到接近零。他们测了数学题、SimpleQA 的提示注入、Attack Bard 的对抗图片,还有 StrongREJECT 的越狱提示词。结果发现,攻击者投入的...

推荐理由:我会先打个折:OpenAI 自己在标题里写了“初步证据”,正文也没完整披露哪些情况下防御会失效,所以别当成熟方案看。但这条思路确实值得盯——不靠对抗训练,而是让模型多想一会儿来扛住没见过的攻击,在数学题、提示注入、滥用提示这几类测试里都看到了攻击成功率大幅下降。如果后续能确认成本和失效边界,对安全部署会是个挺省钱的方向。

2024年12月27日星期五

OpenAI News

OpenAI 说非营利架构撑不住了,得改公司结构才能继续搞 AGI

OpenAI 董事会正在评估调整公司结构,核心原因是钱不够烧了。他们 2019 年预估搞 AGI 大概要 100 亿美元,现在发现大厂们都在砸几千亿,自己靠捐赠和非营利控股的混合模式根本融不到这个量级的钱。文章说,投资人愿意投,但到了这种资金规模,人家要的是常规股权,不是定制化的利润上限条款。目前 ChatGPT 每周有超过 3 亿人用,但正文没披露最...

推荐理由:OpenAI 自己出来说,2019 年以为融 100 亿美元就够,现在发现不够,得把架构改得更像普通公司,不然投资人不敢继续砸钱。文章没给新架构的具体条款,但把融资约束摊开了——这是核心。我会提醒读者盯紧两点:一是非营利那块最后还剩多少控制权,二是股权结构会怎么调。整体事实没硬伤,安全上也没问题,就是信息不全,但作为信号已经够用了。

2024年12月20日星期五

OpenAI News

OpenAI 公布 deliberative alignment:让模型先读安全规范再推理,o1 在安全基准上超过 GPT-4o

OpenAI 在 12 月 20 日介绍了 deliberative alignment,一种直接让推理模型学习人类写的安全规范文本,并在回答前先对着规范做推理的训练方法。o 系列模型用上了这套方法,推理时会在思维链里调取内部政策、判断请求是否违规,再给出回复。整个过程不需要人工标注思维链或答案。文章说 o1 在内部和外部安全基准上大幅超过 GPT-4...

推荐理由:我会先打个折:正文没给 o1 的具体基准分数,只说比 GPT-4o 强很多、部分数据集接近饱和,所以没法判断实际提升幅度。但方法本身有嚼头——用人类能看懂的安全规范训练模型在回答前显式推理,而且不需要人工写思维链样本,省了不少标注成本。安全对齐从“事后拦截”变成“事前想清楚”,这个转向值得关注。综合看,放在 featured 没问题,83 分也合理,毕竟缺了硬数据,离必写还差一口气。

2024年12月9日星期一

OpenAI News

OpenAI 把 Sora 视频生成模型正式上线,推出更快的 Sora Turbo 版本

OpenAI 在 12 月 9 日结束了 Sora 的研究预览,直接把它做成了一个独立产品,给 ChatGPT Plus 和 Pro 用户用。新版本叫 Sora Turbo,生成速度比二月份展示的快了不少。Plus 用户每月能免费生成最多 50 个 480p 视频,或者少一些的 720p 视频;Pro 用户用量是 10 倍,还能出更高分辨率和更长的片子...

推荐理由:Sora 正式上线,从预览变付费,HKR 三项都踩中了:上线本身有话题性,规格和限制写得清楚,对创作者工作流有直接影响。没给更高分是因为文章自己就说了地区封锁、人物上传受限,物理一致性和长动作还不稳,这些限制让实际可用性打了折扣。

2024年12月5日星期四

OpenAI News

OpenAI 发布 o1 系统卡:用大规模强化学习训练模型先想再答,安全风险定在“中”以下才上线

OpenAI 把 o1 和 o1-mini 的安全测试结果公开了。核心就一句话:o1 系列用大规模强化学习训练模型在回答前先进行“思维链”推理,这让它在遵循安全规则、抵抗越狱攻击上比前代强。但正文没披露具体的数据配比和完整基准分。安全方面,他们设了上线门槛——风险缓解后评分必须“中”或更低。目前给出的评分是:网络安全低、生化威胁中、说服能力中、模型自主...

推荐理由:这是一份前沿推理模型的高信号安全披露,不是常规物料。HKR-K 强在公布了部署门槛、四项风险评级和测试范围;HKR-R 成立是因为从业者持续关注推理模型的安全阈值和 CoT 透明度。事实核查:系统卡原文确实列出了这些评级和门槛,未发现错误或过时信息,安全建议也符合当前实践。

2024年11月21日星期四

OpenAI News

OpenAI 公开两篇红队测试论文:一篇讲怎么请外部专家找茬,一篇讲怎么用 AI 自动找茬

OpenAI 在 2024 年 11 月 21 日发了两篇论文,把自家红队测试(就是找人来攻击模型、挖风险)的方法摊开来讲。第一篇白皮书专门说外部人类红队的流程,讲了三个具体设计选择:一是根据威胁模型挑人,比如要找懂网络安全、会小语种或熟悉某地区政治的人;二是给测试员看哪个版本的模型,没加安全措施的早期版本能测出新能力带来的风险,加了措施的版本能测防护...

推荐理由:我会先打个折:正文对自动化红队的实验指标和效果摘录不全,这点先别太激动。但 OpenAI 这次把外部红队怎么组队、怎么分配模型版本、怎么收反馈这三件事说清楚了,流程比“红队”这个词本身值钱。如果是真的按威胁建模来组队,安全团队可以直接抄作业。

2024年10月30日星期三

OpenAI News

OpenAI 开源了一个叫 SimpleQA 的事实性基准,专门测模型回答短问题的准确率

OpenAI 放出了一个包含 4326 道题的基准 SimpleQA,题目都是简短、有明确答案的事实类问题,比如“2022 年世界杯荷兰对阿根廷,哪位荷兰球员打进了运动战进球”。每道题都经过两名独立 AI 训练师交叉验证,又抽了 1000 道题做第三方审计,发现答案一致率 94.4%,估算数据集本身的固有错误率在 3% 左右。这个基准的目标是给前沿模型...

推荐理由:OpenAI 开源了一个事实问答基准 SimpleQA,4,326 道题,专门测模型回答短事实的准确率和校准能力。我会先打个折:它叫“简单”,但实际是给前沿模型挖坑,GPT-4o 得分不到 40%,说明越强的模型越容易在这上面翻车。数据质量方面,两道人工交叉核验,1,000 题抽检一致率 94.4%,估算固有错误率约 3%,这点先别太激动,3% 的错题率意味着有些题本身可能就有争议或歧义。整体看,这不是一篇例行公事的论文发布,而是一个直接打中可靠性、校准和基准信任问题的动作。

2024年10月24日星期四

OpenAI News

OpenAI 公布国家安全合作框架,明确禁止武器开发,但会帮美军做网络防御和行政提效

OpenAI 在 2024 年 10 月白宫发布 AI 国家安全备忘录后,公开了自己参与国家安全项目的边界。他们说自己有一套内部审核流程,由产品政策和国家安全团队把关,只接符合“民主价值观”的活。文章举了三个已有的例子:跟 DARPA 合作做网络防御、帮美国国际开发署用 ChatGPT 减轻行政杂活、以及在洛斯阿拉莫斯国家实验室搞生物科学研究。核心红线...

推荐理由:这篇不是产品发布,所以 H 分不高。真正有用的是 OpenAI 把内部评审流程摆出来了,还列了 3 个已经在跑的项目:跟 DARPA 做网络防御、帮 USAID 用 ChatGPT 减行政负担、跟洛斯阿拉莫斯国家实验室继续搞生物科学合作。同时明确画了红线——不准伤人、毁东西、造武器。我会先打个折,因为正文没披露模型版本、合同金额和实际效果数据,这些才是判断合作深度的硬指标。但光是把禁止用途和评审关卡公开写出来,在国防 AI 这个话题上就算有信息量了,所以 K 和 R 都给了通过。

2024年10月15日星期二

OpenAI News

OpenAI 自查 ChatGPT 有没有看人下菜碟:用名字测偏见,整体翻车率约 0.1%

OpenAI 拿几百万条 ChatGPT 的真实对话做了次内部体检,想看看用户的名字会不会触发有害的刻板印象。他们让 GPT-4o 当“隐私保护评审员”去读聊天记录、找规律,研究员看不到原始对话。结果发现,ChatGPT 的回答质量不会因为名字暗示的性别或种族而变差,但确实有大约 0.1% 的情况,名字会引出有害偏见。在写故事这类开放任务里,出问题的概...

推荐理由:OpenAI 拿数百万条真实 ChatGPT 请求做了一次公平性审计,这种事很少见。我会先打个折:整体有害刻板印象发生率约 0.1%,看着很低,但研究也坦白种族相关判定的一致率不如性别高,这点先别太激动。真正该盯的是旧模型——GPT-3.5 Turbo 在分任务评测里偏差最明显,说明模型升级确实在压这个问题。研究用 GPT-4o 当隐私保护评审器,省了人工成本,但正文没披露评审器本身有没有系统性偏见。整体是一份有数据、有对比、有保留的工程报告,不是公关稿。

2024年10月9日星期三

OpenAI News

OpenAI 说今年已端掉 20 多个滥用其模型的欺骗性网络

OpenAI 发了一篇安全更新,说从 2024 年初到现在,已经发现并掐断了超过 20 个试图用他们模型干坏事的行动和欺骗性网络。这些事主要跟选举干扰、社交媒体操纵以及有国家背景的团伙有关。文章把具体发现写进了 2024 年 10 月的一份威胁情报报告里,但正文没披露这 20 多个案例分别用了哪些模型,也没说具体是怎么发现和阻断的。我会先打个折,这更像...

推荐理由:OpenAI 这篇公告 HKR 三项都站得住:20 多次打击是个能让人点进来的数字,威胁情报报告更新到 10 月也算新事实,选举干扰和社媒操纵又是当下最烫手的安全话题。不过正文没给出具体样本分布、用了哪些模型、怎么处置的细节,所以分数停在 featured 不往上走。我会先打个折——没看到实操层面的干货,这点先别太激动。

2024年9月26日星期四

OpenAI News

OpenAI 把内容审核接口升级成多模态了,现在能同时看文字和图片

OpenAI 在 9 月 26 日上线了新的审核模型 omni-moderation-latest,基于 GPT-4o,所有开发者都能免费用。它最大的变化是能审图片了,覆盖暴力、自残、色情这 6 个子类,不过色情类里涉及未成年人的图片暂时还审不了。文字审核新增了“违法”和“违法/暴力”两个类别,比如“怎么偷东西”这种教人干坏事的提示词会被抓出来。多语言...

推荐理由:OpenAI 官方开发者产品更新,HKR 里 K 和 R 都站得住:新模型加了风险类别、图像子类,还给出 40 种语言平均提升 42% 的具体数字,多语言审核能力明显增强。R 也成立,因为审核和合规直接卡应用上线的脖子,免费开放意味着团队可以零成本试用。H 偏弱,就是个功能迭代,没什么戏剧性,所以整体放在 featured 的低位。

2024年9月16日星期一

OpenAI News

OpenAI 把安全委员会升级成独立监督机构,有权叫停模型发布

OpenAI 在 2024 年 9 月 16 日宣布,原先的安全与安保委员会将变成一个独立的董事会监督委员会,由卡内基梅隆大学的 Zico Kolter 当主席。这个委员会能审查重大模型的安全评估,如果觉得有风险,可以直接推迟发布,直到问题解决。公告里还提了几件事:刚完成了一个 90 天的安全流程审查;正在评估要不要搞一个 AI 行业的信息共享与分析中...

推荐理由:我会先打个折:没有新模型、没有外部审计结果、也没有可复现的基准数据,所以到不了 P1。但这条消息比泛泛的安全声明实在得多。OpenAI 把安全委员会升格成独立董事会监督委员会,由 Zico Kolter 当主席,能看重大安全评估,还能在问题没解决时叫停发布——这等于给发布流程加了一道硬闸门。正文还提到 90 天审查已完成、在评估行业 ISAC、跟洛斯阿拉莫斯国家实验室搞安全合作,信息密度不低。对从业者来说,这直接关系到模型发布的可预期性和安全问责,所以 HKR 三项都站得住。

2024年9月12日星期四

OpenAI News

OpenAI 发布 o1 系列模型,先想清楚再回答,数学推理从 13% 飙到 83%

OpenAI 在 9 月 12 日推出了 o1-preview 和 o1-mini 两个新模型,主打“先思考再回答”。在数学奥赛预选题上,GPT-4o 正确率只有 13%,o1 推理模型做到了 83%,编程能力也到了 Codeforces 前 11%。o1-mini 是个更小更快的版本,成本比 o1-preview 低 80%,适合写代码但不需要太广知...

推荐理由:这是一次 OpenAI 的重大推理模型发布,三个信号全中。H 来自“先想再答”的新玩法,K 来自具体的基准、安全和定价数字,R 来自从业者必须权衡的现实:推理能力上去了,但 API 基础功能还没跟上。

OpenAI News

OpenAI 推出 o1-mini,一个专攻数理和编程、成本比 o1-preview 低 80% 的推理模型

o1-mini 是 OpenAI 在 2024 年 9 月 12 日发布的小号推理模型,先开放给 Tier 5 API 用户和付费 ChatGPT 用户。它最大的卖点是便宜:API 调用成本只有 o1-preview 的两成。性能上,它专攻 STEM 推理,在 AIME 数学竞赛里拿到 70.0% 的正确率(约 11/15 题,全美前 500 名水平)...

推荐理由:OpenAI 发了一个实打实的模型,不是概念稿,所以必须写。钩子在于便宜 80% 还能接近 o1 的推理分,数字够硬(AIME 70.0%、Codeforces 1650),而且它明确告诉你:STEM 行,非 STEM 只跟小模型差不多,开发者看完就知道该不该切过去。

2024年8月16日星期五

OpenAI News

OpenAI 封掉了一批用 ChatGPT 给伊朗隐蔽舆论战写稿的账号

OpenAI 在 2024 年 8 月 16 日说,他们发现并封禁了一批 ChatGPT 账号,这些账号属于一个叫 Storm-2035 的伊朗隐蔽舆论行动。这批账号用 ChatGPT 干两件事:一是写长文章,发在五个伪装成进步派或保守派新闻的网站上;二是生成英语和西班牙语的短评论,发在 X 和 Instagram 上。他们聊的主要是加沙冲突、以色列参...

推荐理由:钩子落在 OpenAI 主动曝光自家模型被用于隐蔽选举干预,够抓眼球。新知部分给了具体账号数、站点数和 Breakout Scale 2 级,说明操作规模小、传播效果差,这点先别太激动。风险关联上,模型滥用和选举安全是行业硬伤,但 OpenAI 自己说没看到有意义的受众触达,所以重要性停在 76 分,不往上拔。

2024年8月13日星期二

OpenAI News

OpenAI 发布 SWE-bench Verified:人工复核过的代码能力测试集

OpenAI 和 SWE-bench 原作者一起搞了个“验过货”的子集,叫 SWE-bench Verified。他们发现原版测试有坑:单元测试太死板、问题描述含糊、环境搭不起来,导致明明对的代码被判错,会系统性地低估模型写代码的真实水平。截至 2024 年 8 月 5 日,头部智能体在原版 SWE-bench 上得分约 20%,在 SWE-bench...

推荐理由:这不是一次常规发布。OpenAI 拉着原作者把 SWE-bench 翻了一遍,点出三类硬伤,还给出了新的分数天花板。我会先打个折:正文没披露修正后的完整新榜单,但现有数据已经足够让人重新审视那些代码智能体的评测成绩。

2024年8月8日星期四

OpenAI News

OpenAI 把卡内基梅隆的机器学习系主任 Zico Kolter 拉进了董事会和安全委员会

OpenAI 在 2024 年 8 月 8 日宣布,卡内基梅隆大学教授 Zico Kolter 加入董事会,同时进入安全与安保委员会。Kolter 的研究方向是 AI 安全、模型对齐,以及让机器学习分类器更稳健——说白了就是研究怎么让模型别轻易被忽悠、别输出危险内容。他之前搞出过给深度学习模型加“硬约束”的方法,2023 年还带队开发了自动评估大模型安...

推荐理由:我会先打个折:这就是个任命通知,别当产品发布看。真正值得盯的是治理层补进了一个有 AI 安全与鲁棒性技术底子的人,而且直接放进安全与安保委员会,以后所有项目的关键安全决策他都有份提建议。正文没披露他具体投票权有多大、委员会多久开一次会,这点先别太激动。

OpenAI News

GPT-4o 系统卡:语音响应快过人类,但声音安全是最大隐患

OpenAI 在 8 月 8 号发了 GPT-4o 的系统卡,把安全底牌摊开来看。这个模型能直接吃文本、音频、图片和视频,输出也一样,最快 232 毫秒就能回话,平均 320 毫秒,跟人聊天反应速度差不多。API 价格比 GPT-4 Turbo 便宜一半。在 OpenAI 自己的安全框架里,网络安全、生物威胁、模型自主性三项风险都是低,说服力这项擦边踩...

推荐理由:这不是一篇例行公事的发布。它把 preparedness 四类风险评级、232 毫秒语音延迟和明确的部署门槛都摆出来了。HKR 三项全中,但本质是安全披露而非新模型或重大产品发布,所以放在 featured 而不是 p1。

2024年7月24日星期三

OpenAI News

OpenAI 用“规则打分”替代部分人工反馈,让模型在安全问题上更听话

OpenAI 在 7 月 24 日公开了他们用在安全对齐上的新方法:Rule-Based Rewards(RBRs),也就是用一套事先写好的规则给模型回复打分,而不是每次都靠人反复标注。这套方法把模型面对敏感请求时的反应分成三类——硬拒绝(简短道歉并明确说不)、软拒绝(带同理心地拒绝)和正常遵从——然后针对每类行为设定具体的评判标准,比如“回复是否在说...

推荐理由:我会先打个折:正文截取部分没给具体效果数字,也没对比基线,所以分数压在 78–84 这个区间。但 OpenAI 把安全规则显式写进奖励模型这件事本身值得关注,因为它解决的是工程上很实际的麻烦——政策一改,不用重新雇人标一堆数据,改规则就行。三种响应模式(硬拒、软拒、合规)让模型拒绝时不会太生硬,这点对产品体验有帮助。不过别太激动,论文没披露误拒率或漏判率,实际线上表现还得看后续有没有更细的评测。

2024年7月18日星期四

OpenAI News

OpenAI 发布 GPT-4o mini,比 GPT-3.5 便宜六成,API 里首次用上指令层级防越狱

OpenAI 在 7 月 18 日推出了 GPT-4o mini,直接替换掉 ChatGPT 里的 GPT-3.5。价格是输入每百万 token 0.15 美元、输出 0.6 美元,比 GPT-3.5 Turbo 便宜了超过 60%。模型跑分还行,MMLU 82 分、HumanEval 87.2 分,都压过 Gemini Flash 和 Claude ...

推荐理由:这不是小修小补,GPT-4o mini 带着新定价、长上下文、明确的基准成绩和一套新的安全机制出来,直接替掉 GPT-3.5,对开发者的钱包和安全方案都有实际影响。HKR 三项全中,放在 P1 没问题。

2024年7月17日星期三

OpenAI News

OpenAI 用“证明者-验证者博弈”让大模型写的东西更好懂,人类评估错误率降了一半

OpenAI 让 GPT-4 家族里的大模型和小模型玩一个博弈游戏:大模型当“证明者”负责解题,小模型当“验证者”负责判对错。大模型如果只追求答案正确,写出来的解题步骤会越来越难读——人类评估员在限时条件下,错误率几乎翻倍。换成这种博弈训练后,大模型必须写出连小模型都能看懂的推理过程,结果人类评估的准确率也上来了。文章说大小模型之间的预训练算力差了大约...

推荐理由:OpenAI 这篇研究把可读性做成训练信号,强模型要写出弱模型能核验的答案,人类评审也证实有效果。我会先打个折:正文只给了部分数字,完整实验表没披露,所以不能把效果说死。但思路本身戳中了可扩展监督的痛点,加上 hook 清晰、机制新,放在 featured 没问题。

2024年5月28日星期二

OpenAI News

OpenAI 董事会成立安全委员会,90 天内要给所有项目定安全规矩

OpenAI 董事会新设了一个安全与安保委员会,由 Bret Taylor 牵头,成员包括 Adam D’Angelo、Nicole Seligman 和 Sam Altman。这个委员会的任务是对公司所有项目的关键安全和安保决策提出建议,第一件事就是在 90 天内重新评估并完善现有的安全流程和防护措施,之后向全体董事会交方案,OpenAI 承诺会公开...

推荐理由:OpenAI 董事会官宣成立安全与安保委员会,动作本身值得关注,因为董事会级的委员会有实权。但正文是空的,没给任何具体信息:谁进委员会、管多宽、向谁汇报、什么时候生效,全不知道。我会先打个折,因为光有个名字说明不了是真治理还是公关动作。安全从业者真正该盯的是这个委员会能不能独立叫停训练或部署,而不是它叫什么。