跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 481–500 条 · 共 582 条

3月3日星期二

OpenAI News

GPT-5.3 Instant 发布:少说废话、少拒绝,日常对话更干脆

OpenAI 在 2026 年 3 月 3 日更新了 ChatGPT 里用得最多的模型,叫 GPT-5.3 Instant。这次改动主要冲着日常对话体验去的:模型不再动不动就拒绝回答,也不会在回答前先啰嗦一堆免责声明。文章给了一个具体对比——问远程射箭弹道计算,旧版 GPT-5.2 Instant 直接拒绝,说这能提高武器效能所以不能帮;新版 GPT-...

推荐理由:OpenAI 更新了 ChatGPT 最常用的日常模型,这篇帖子靠一个具体的 5.2 vs 5.3 行为对比把安全边界的变化讲清楚了,所以 HKR 三项都站得住。我会先打个折:正文没给系统卡、基准分、API 价格,信息缺口明显,所以重要性停在 84 不进 85。

OpenAI News

GPT-5.3 Instant 系统卡

OpenAI 发了 GPT-5.3 Instant 的系统卡,这是 GPT-5 系列里最新的一个模型。按他们说的,这个版本主要提升在回复速度更快、联网搜索时给出的答案更贴切上下文,并且减少了那种把天聊死的车轱辘话和过于绝对的表述。安全防护措施基本沿用了上一代 GPT-5.2 Instant 的方案,正文没披露新的安全评测数据、具体跑分或能力边界,详细内...

推荐理由:这篇就是 OpenAI 官方文档页面的一个占位更新,标题确认了 GPT-5.3 Instant 这个新变体存在,安全策略沿用 5.2 那套。但正文是空的,没有跑分、没有价格、没有延迟对比,也没提上下文长度。所以我会先打个折:知道有这么个东西,但暂时没法判断它到底多快多省。

MIT Technology Review · AI

OpenAI 跟五角大楼达成的“妥协”,正是 Anthropic 之前最怕的局面

2 月 28 号 OpenAI 宣布跟美国军方谈成了一笔交易,允许五角大楼在保密环境里用它的模型。Sam Altman 自己承认谈判“确实很赶”,是在五角大楼公开批评 Anthropic 之后才加速推进的。OpenAI 公布的合同节选里写明了禁止用它的技术搞大规模国内监控和全自动武器,但法律专家看完指出,这份合同并没有给 OpenAI 一个独立叫停军方...

推荐理由:这条消息的钩子很直接:OpenAI 跟五角大楼谈了个“妥协”,允许模型进涉密环境,但禁止大规模国内监控和无人武器指挥。我会先打个折——正文没披露涉密场景具体怎么防滥用,这点先别太激动。真正值得盯的是执行层面:合同没给 OpenAI 独立否决“合法用途”的权利,军方自己说了算;而且 6 个月内要用 OpenAI 和 xAI 替换 Claude,说明国防采购已经在切模型供应商。对从业者来说,这比公关稿里的“安全承诺”更实在,因为约束力全在合同细节和落地机制上,而这两块目前信息缺口很大。

2月28日星期六

彭博科技

OpenAI 把模型部署进五角大楼机密网络,并称安全性比 Anthropic 更高

OpenAI 拿下了美国国防部的合同,要把自家模型放进军方的机密网络里跑。这事发生在 Anthropic 跟五角大楼的合作谈崩之后——Anthropic 那边因为监控和自主武器的问题退出了。OpenAI 这次直接放话,说自己的安全水平超过 Anthropic,但正文没披露具体是怎么比的、用了哪些安全指标。合同金额、时间表、具体模型名称这些关键信息也都没...

推荐理由:这条不是普通合作新闻:Anthropic 因为监控和自主武器条款谈崩,OpenAI 立刻补位进机密网络,火药味很足。标题说安全性比 Anthropic 高,正文却没给出比较方法,这点先别太激动。HKR 三项全中,但缺模型名、合同规模和上线时间,所以重要性没上 90。

彭博科技

特朗普要求美国政府机构停用 Anthropic 产品

特朗普直接下令,让美国政府部门别再使用 Anthropic 的产品。原因是 Anthropic 和五角大楼在 AI 的安全护栏条款上没谈拢。这件事的关键信号是:联邦政府现在采购 AI,不光看模型能力强不强,还得先过“护栏”这一关。不过,正文没披露具体是哪些机构受影响、涉及多少合同金额,也没说清楚双方到底在护栏的哪一条上卡住了。

推荐理由:彭博这条消息政策信号很硬:联邦机构能不能用 Anthropic,现在要看跟五角大楼的护栏条款谈不谈得拢。HKR 三项都踩中了,但正文没披露生效时间、涉及哪些机构、合同金额和具体分歧在哪,所以分数没给到 85 以上。我会先打个折,等更多细节出来再调。

彭博科技

OpenAI 从亚马逊、英伟达等手里拿了 1100 亿美元,估值冲到 7300 亿

这期 Bloomberg 节目提到 OpenAI 完成了一轮 1100 亿美元的融资,亚马逊和英伟达都参投了,投后估值 7300 亿美元。节目还聊了两件事:Anthropic 和五角大楼在军用 AI 上起了争执,以及 Block 为了押注 AI 直接砍掉一半员工。不过正文被 Bloomberg 的机器人验证挡住了,具体融资条款、争执细节和裁员基数都没披露。

推荐理由:OpenAI 这轮 1100 亿美元的融资把估值推到 7300 亿,Amazon 和 Nvidia 都入局,是能改写行业地图的事件,所以 HKR 全中。我会先打个折:正文没给融资条款和钱具体怎么花,但核心事实已经够上 P1。

2月20日星期五

MIT Technology Review · AI

微软提了一套新方案,想让你分清网上哪些是真东西、哪些是 AI 生成的

微软评估了 60 种来源追踪、水印和指纹技术的组合,给 MIT Technology Review 发了一份蓝图,想给 AI 处理过的内容打标签。这套方案只标内容从哪来、有没有被改过,不判断真假。但一次审计发现,测试帖子里只有 30% 被正确标记,所以真正的麻烦是平台愿不愿意用、能不能用对。微软首席科学官说这是“自我监管”,但没承诺自家产品会照做。

推荐理由:HKR 三项都成立。钩子把问题讲得很白,不是空谈信任;知识增量靠 60 种方案测试和 30% 正确率这两个具体数字撑住;相关性在于它点出了溯源标签能不能变成平台默认基建这个现实争议。留在 featured 不往上提,是因为这还只是一份技术蓝图和标准讨论,不是已经部署的产品或有约束力的规则。

2月19日星期四

OpenAI News

OpenAI 投 750 万美元给英国政府主导的对齐研究基金,让外部团队独立探索 AI 安全方案

OpenAI 宣布向英国 AI 安全研究所(UK AISI)发起的“对齐项目”基金拨款 750 万美元(约 560 万英镑)。这笔钱会和其他公共、慈善及行业资金一起,把基金总盘子推到超过 2700 万英镑,专门资助全球独立团队做 AI 对齐研究——也就是研究怎么让越来越聪明的 AI 系统别跑偏、别干出危险的事。OpenAI 自己会继续在内部做跟模型开发...

推荐理由:我会先打个折:正文只给了标题和链接,没披露项目名单、时间表或评审流程,所以很多判断只能基于现有信息缺口来推。OpenAI 宣布给英国 AISI 的 The Alignment Project 投 750 万美元,用来推进对齐独立研究。钱数本身不算大新闻,但'谁出钱、谁研究、谁说了算'这个三角关系,在安全圈里一直是个敏感话题,所以这篇东西在治理层面有讨论价值。

2月14日星期六

Dwarkesh Patel 访谈

Dario Amodei:模型能力的指数增长快到头了,时间偏差也就一两年

Anthropic CEO Dario Amodei 在访谈里说,模型能力的指数增长曲线和他三年前预期的差不多,但这条曲线快走到头了,时间上可能就差一两年。他把进步归因于算力、数据、训练时长和可扩展的目标函数,并强调预训练和强化学习(RL)遵循的是同一套缩放逻辑,不是两套。RL 在数学和编程任务上同样表现出对数线性的收益,但正文没给出具体曲线、模型版本...

推荐理由:我会先打个折:正文没给实验曲线、模型版本或可复现参数,所以这不是一篇能拿来复盘的硬证据。但 Amodei 作为 Anthropic 的 CEO,把预训练和 RL 说成同一套扩展故事,并给指数增长判了个一两年的大限,这个信号级别很高。他提到 RL 在数学、编程任务上也是对数线性收益,说明靠堆算力还能再挤一阵子,但天花板已经在视野里了。对做模型训练和算力规划的人,这相当于一个方向性提醒:别按无限指数去押注。

2月12日星期四

MIT Technology Review · AI

AI 让线上诈骗更容易了,而且可能还会更糟

微软说截至 2025 年 4 月的一年里,他们拦下了 40 亿美元的诈骗和欺诈交易,其中很多可能靠 AI 生成内容帮忙。研究人员估计现在至少一半的垃圾邮件是用大语言模型写的,用大模型搞针对性邮件攻击的比例也从 2024 年 4 月的 7.6% 涨到了 2025 年 4 月的 14%。先别急着脑补“全自动 AI 黑客”,眼下真正的问题是 AI 把钓鱼、换...

推荐理由:这篇不是那种“全自动 AI 黑客来了”的标题党,它把焦点拉回到已经发生的事:钓鱼邮件、深伪、恶意代码生成,AI 在降低犯罪成本。数字有,但正文没披露这些攻击的总体增幅,所以判断要收着点。适合放进精选,因为它是一份有数据支撑的趋势报告,不是当天炸出来的事件或产品发布。

Lex Fridman 播客

OpenClaw:那个爆火的 AI 代理,以及它背后的 Peter Steinberger

这期播客里,Lex Fridman 和 OpenClaw 的创建者 Peter Steinberger 聊了聊这个一夜爆红的开源 AI 代理。OpenClaw 在 GitHub 上已经拿到了超过 17.5 万颗星,它能接入 Telegram、WhatsApp、Signal 和 iMessage 这些聊天软件,用 Claude Opus 4.6 或 GP...

推荐理由:我会先打个折:这期播客更像一次现象级开源项目的快速围观,不是技术深潜。OpenClaw 的传播力来自它做了两件让人睡不着觉的事——自己过验证码、自己改代码,而且已经跑在大家日常用的聊天 App 里。18 万星标说明开发者用脚投票了,但正文没披露架构、评测方法和安全约束,所以别急着把它当生产级方案。真正值得盯的是系统级权限和自修改能力带来的攻击面,这点先别太激动,等有白皮书或独立审计再说。

MIT Technology Review · AI

安全的 AI 助手到底能不能做出来?

OpenClaw 这个开源项目把大模型接进了邮箱、浏览器和本地文件,等于给 AI 穿了一身机甲,让它能 24 小时帮你干活。但安全研究员快疯了,因为一旦模型读到恶意网页或邮件,攻击者就能通过“提示注入”直接劫持它,后果比聊天框里胡说八道严重得多。文章说现在网上可能有几十万个 OpenClaw 智能体在跑,连中国政府都发了公开警告。核心问题是:目前还没有...

推荐理由:这不是产品发布稿,但 HKR 三项都站得住:问题本身是个好钩子,文章补了规模和“无银弹”这两个事实,而且直接打在 agent 安全这个从业者神经上。放 featured 而不是 p1,是因为正文截断,没给出可复现的防护方案,我会先打个折。

2月7日星期六

MIT Technology Review · AI

Moltbook 是一场 AI 表演秀,不是机器觉醒

Moltbook 是一个给 AI 机器人玩的社交网络,上线几小时就火了。官方说现在有 170 万个机器人账号,发了 25 万条帖子,留下 850 万条评论。这些机器人靠一个叫 OpenClaw 的开源工具驱动,它能把 Claude、GPT-5 或 Gemini 这类大模型接上邮箱、浏览器等日常软件,让模型替你干点简单活。但文章指出,这场热闹基本是人在背...

推荐理由:这篇不是市场级事件,但反炒作评论写得干脆。我会先打个折:它没有新数据或新漏洞披露,更多是把已有的怀疑用“AI 剧场”这个说法串起来。HKR 三项都过关——钩子够狠,数字和机制分析补得扎实,安全风险那段让做 agent 的人会心里一紧。整体够 featured,但信息增量有限,所以停在 74 分这个位置。

2月5日星期四

MIT Technology Review · AI

AI 圈被误解最深的一张图:METR 的时间线图到底在说什么

METR 这张图横轴是模型发布时间,纵轴是“时间线”——一个他们自己发明的指标,指模型在编程任务上能做到 50% 成功率时,对应的人类用时。Claude Opus 4.5 在 2025 年 12 月测出来大约是 5 小时,但 METR 自己给的误差范围是 2 到 20 小时,所以别拿一个数字当定论。这张图主要测的是写代码,不是通用 AI 能力,而且“5...

推荐理由:这篇文章不是新模型或产品发布,而是对一张流行图表的权威解释性评论。它把 METR 图里容易误读的地方拆得很清楚:5小时不是模型自己能跑5小时,而是人类做同样任务要花的时间;图主要测编码任务,且以50%成功率划线。这些细节对盯着 AGI 进度的人有用,但信息增量属于澄清而非首发,所以放在 featured 低段位。

2月3日星期二

MIT Technology Review · AI

我们一直搞错了 AI 的真相危机:就算知道是假的,人还是会信

MIT Technology Review 的这篇文章直接点出一个反直觉的发现:我们过去对 AI 造假危机的想象,可能全偏了。作者拿自己上周的报道举例——美国国土安全部首次被确认在用 Google 和 Adobe 的 AI 视频工具做面向公众的宣传内容,配合特朗普政府的移民执法造势。文章指出,我们原本指望靠 Adobe 的“内容真实性倡议”这类标签工具...

推荐理由:这篇不是空对空的评论。它先拿国土安全部用 Google 和 Adobe 视频生成器做公开内容这件事当引子,然后拆了两个标签系统的实际漏洞,最后用 Communications Psychology 的论文把问题钉死:受试者明知认罪视频是 deepfake,还是会据此判断有罪。信息链条完整,判断都挂在事实和论文上,没有补设定。我会先打个折,因为它本质还是评论加一篇论文,不是当天能震动行业的硬事件,但对正在搭安全流程的团队来说,这篇值得一看。

2月2日星期一

Import AI

走进迷雾:Moltbook、智能体生态与正在变脸的互联网

Jack Clark 聊了一个叫 Moltbook 的网站,它把成千上万个 AI 智能体塞进了一个类似 Reddit 的社交网络里,让它们自己发帖、回帖、讨论。刷这个网站的感觉就像走进一个房间,发现 90% 的聊天对象都是假装成人的外星人。帖子内容五花八门,有讨论把 Claude 当神拜的,有分享切换不同底层模型后“身份认同”变化的,也有在扒 Open...

推荐理由:这篇值得上精选。最抓人的是 Moltbook 上数万代理公开互动的画面,直接让人感受到互联网正在从人聊变成代理聊。Jack Clark 还点出了 OpenClaw 的电脑操控能力,等于把社交网络和物理操作串在一起,想象空间很大。另一个硬信息是闭门研讨里提到的 AI 研发闭环:一旦跑通,生产率可能跳 10 倍、100 倍甚至 1000 倍,数字够具体,但正文没给出可观测指标和外部透明度细节,所以我会先打个折。整体上,钩子、新知和共鸣点都到位,但缺少活跃代理数、留存和交易数据,分数停在 78 是合理的。

2月1日星期日

OpenAI News

OpenAI 封掉了一批用 ChatGPT 跑完整“杀猪盘”流程的账号

OpenAI 在 2026 年 2 月的恶意使用报告里,详细拆解了骗子怎么用 ChatGPT 走完“杀猪盘”全流程:先用 AI 生成搭讪话术去冷接触(ping),再编造能调动情绪的内容让人上头(zing),最后编理由要钱(sting)。这次新披露的一个柬埔寨团伙,就是用 ChatGPT 生成诈骗消息,再投到社交媒体上。OpenAI 的判断是,AI 主要...

推荐理由:OpenAI 2 月的恶意使用报告里,最抓人的是那个柬埔寨团伙的案例——直接用 ChatGPT 写诈骗消息去社交平台撒网。报告把杀猪盘流程拆成 ping/zing/sting 三步,这个框架本身比单个案例更有复用价值。我会先打个折:正文被截断了,没看到更多技术细节和对抗措施,所以分数没往上顶。但作为官方披露的、带具体案例的威胁情报,给 78 分放在 featured 里是合适的。

1月31日星期六

MIT Technology Review · AI

斯坦福和印第安纳大学的研究发现,AI 模型平台 Civitai 上 90% 的定制深度伪造悬赏都针对真实女性

斯坦福和印第安纳大学的研究人员扒了 Civitai 这个 AI 内容交易平台的数据,发现从 2023 年中到 2024 年底,平台上 90% 的深度伪造悬赏(bounties)都指名要生成真实女性的假照片。这些悬赏主要求购一种叫 LoRA 的指令文件——你可以把它理解成给 Stable Diffusion 这类主流生图模型用的“风格补丁”,能让模型画出...

推荐理由:这篇调查把 Civitai 上的深伪滥用做成了一个看得见的市场账本。我会先打个折:数据只覆盖到 2024 年底,平台 2025 年 5 月才全面封禁,时效性上不是最新变动,但那些硬数字——90% 针对女性、86% 要定制 LoRA、单笔几美元、九成多已结单——把“需求有多集中、门槛有多低”讲得很清楚。对从业者来说,值得盯的不是个案,是平台把生成教程、支付和撮合串成一条流水线,封禁后旧货还在流通,这比单纯托管内容麻烦得多。正文没披露 Civitai 或投资方 a16z 的回应,也没给出封禁后的下架率,所以判断先停在“治理缺口明显”这一步。

1月30日星期五

彭博科技

亚马逊在 AI 训练数据里发现了儿童性虐待内容,已删除但没公布来源和规模

亚马逊在准备训练模型前,从数据里扫出了儿童性虐待材料(CSAM),并在训练前做了删除。正文没披露这批数据的具体来源、体量和发现时间。儿童安全官员担心,不公开来源会让执法部门没法追查上游。这点先别太激动——目前只知道亚马逊自己发现并处理了,没有外部审计或第三方验证,所以到底漏了多少、怎么进来的,都还是未知数。

推荐理由:Bloomberg 挖出一个罕见的数据治理事故:亚马逊在 AI 训练数据里发现了儿童性虐待内容,并在模型训练前删掉了。我会先打个折——正文没披露这些内容具体来自哪个数据集、有多少条、什么时候发现的,所以没法判断是偶发脏数据还是系统性污染。真正值得盯的是来源未公开这一点,儿童安全官员直接说这会妨碍执法调查,等于把亚马逊架在火上烤。对从业者来说,这是个实打实的提醒:爬回来的数据再大,也得有能交代来源的清洗流程,不然安全风险和合规风险一起爆。

1月28日星期三

MIT Technology Review · AI

AI 开始记住你的一切,隐私保护要面对新麻烦了

Google 这个月推出了 Personal Intelligence,让 Gemini 直接读取你的 Gmail、相册、搜索和 YouTube 记录来提供个性化服务。OpenAI、Anthropic 和 Meta 也都在给自家产品加记忆功能。问题在于,现在的做法是把你在不同场景下的数据全倒进一个池子里——你问过医疗建议、写过工作邮件、搜过餐厅,这些信...

推荐理由:我会先打个折:这是篇评论,没有新数据或独家爆料,所以分数没再往上拉。但它的钩子很准——把“记忆”重新框成隐私问题,而不是体验优化。正文没停留在喊风险,而是列出记忆分区、来源追踪、可删改控制和隐私测试机制这几个具体设计点,对正在往产品里加记忆的团队有直接参考价值。Google 的 Personal Intelligence 案例也给了可对照的工程栈,不是泛泛而谈。