跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 161–180 条 · 共 582 条

6月3日星期三

Computing Life · Share · 鸭哥调研

MAI-Thinking-1:让模型持续思考几千步不崩,比让它开始思考难得多

微软 MAI-Thinking-1 的技术报告没在吹模型多会解题,而是在讲怎么让强化学习训练别崩。他们给 GRPO 算法打了三个补丁:一个像恒温器一样动态调节模型的“自信度”,防止它变得死板或乱猜;一个像断路器,在梯度爆炸时直接截断,保住整批训练数据;还有一套自蒸馏抢救流程,训练万一崩了,能把之前学会的推理能力搬到新模型上继续跑。这三个机制合起来,让模...

推荐理由:标题把卖点从“会思考”转到“持续思考”,一下就把训练崩溃这个真问题拎出来了。三种机制的名字虽然有点包装感,但至少给了具体抓手:恒温器控波动、断路器防崩、自蒸馏保风格。正文没披露具体实验数据和复现条件,所以“几千步不崩”这个数字先打个折看。整体对做推理模型训练的人有参考价值,但离落地验证还差一口气。

AI HOT 精选

特朗普签行政令:AI 模型上线前可自愿交给政府做安全检查

特朗普政府推出一项自愿机制,AI 公司可以在前沿大模型发布前 30 天内,把模型提交给美国商务部下属的 CAISI 中心做安全评估,主要查模型的网络攻防能力。谷歌、微软和 xAI 已经同意配合,OpenAI 和 Anthropic 早在 2024 年就签了类似协议。这次行政令明确不是强制审批,企业自己决定交不交,交了能拿到保密保护。政策转向的直接导火索...

推荐理由:特朗普用行政令搭了个自愿通道,前沿模型上线前可以交给联邦政府做安全评估,谷歌、微软和 xAI 已经点头让 CAISI 来查。机制是自愿的,不是强制审批,所以重要性在政策类里算必须写,但还没到震动行业的程度。正文没披露评估具体查哪些项、不交有没有后果,这点先别太激动。

AI HOT 精选

NVIDIA 发布 NemoClaw 蓝图,让工业软件能跑通自主 AI 工程师

NVIDIA 在 COMPUTEX 上放出了一个叫 NemoClaw 的开放蓝图,专门用来构建能长时间自主干活的 AI 智能体。十几家工业软件厂商已经用它来打造“自主 AI 工程师”,主要用在 CAE 仿真和 EDA 芯片设计流程里。按官方说法,以前要跑好几周的仿真和设计任务,现在能压缩到几小时内完成。不过正文没给出具体的测试基准、客户实测数据或错误率...

推荐理由:我会先打个折:这是 NVIDIA 官方博客发的,没有第三方验证,技术细节也基本没给。但它的核心信息够硬——NemoClaw 这个新平台专门瞄准 CAE 和 EDA 场景,让模型像工程师一样自主跑仿真和设计任务,而且已经拉了十多家工业软件厂商在用了。它抛出的“数周变数小时”虽然没讲清楚是怎么算出来的,但哪怕打个对折,对工业仿真这种重计算场景也是实打实的吸引力。这点先别太激动,正文没披露具体架构、模型规模和实测对比,后续得看有没有论文或客户案例放出来。

FT · 科技

特朗普签了份缩水版 AI 审查令,让美国政府能提前看大模型

特朗普签署了一项力度被削弱的 AI 审查行政令,核心是让美国政府机构能提前拿到前沿 AI 模型进行安全评估。不过正文没披露具体的审查标准、覆盖多少模型,也没给执行时间表。这事是在 MAGA 内部吵了一架之后才落地的,所以最终版本比最初设想的要温和。

推荐理由:FT 报了一条美国 AI 审查令,核心是让政府提前看前沿模型。我会先打个折:正文只说了“能提前接触”,没给审查标准、模型数量和落地时间,所以信息量有限。但“缩水版”和 Maga 内斗这两个点让政策故事有了冲突感,对从业者来说,政府提前介入意味着合规和发布节奏可能被卡,这点先别太激动,等具体细则出来再看。

TechCrunch · AI

微软开源新工具,用文字描述就能给 AI 模型出考卷

微软发布了一个叫 ASSERT 的开源框架,让开发者直接用自然语言写测试要求,就能自动生成一套评估 AI 行为的考题和回归测试。正文没披露它具体支持哪些模型、打分指标怎么算,也没提使用限制。

推荐理由:我会先打个折:正文没披露这个框架支持哪些模型、具体用什么指标、以及跑起来的硬件或环境要求,所以实际能省多少事还不好说。但方向本身挺对——让开发者用自然语言写测试意图,而不是手搓脚本,确实能降低回归测试的门槛。微软把它开源出来,至少说明不是内部玩具。这点先别太激动,等看到跑分和兼容性再判断值不值得集成。

NVIDIA 博客

英伟达和微软搞了一套统一方案,让 AI 能在 Windows 电脑、云端和本地服务器之间来回跑

微软 Build 大会上,两家宣布把 AI 部署的底层打通了。简单说,就是同一个 AI 应用,既能在你笔记本的 RTX 显卡上跑,也能无缝切到 Azure 云或者公司本地的 DGX 工作站上,不用重写代码。现场还亮了两款新硬件:RTX Spark 是个小盒子,能提供 1 petaflop 的 AI 算力(大概相当于每秒一千万亿次计算);DGX Stat...

推荐理由:HKR 三项都过了。NVIDIA 和微软这次合作,把 agent 部署从 Windows 到 Azure 再到本地串成一条线,还亮出了 1 petaflop 和 20 petaflops FP4 两个硬件规格,对从业者来说有信息增量。不过消息源是厂商自己,正文没给定价、跑分和迁移细节,所以分数没往上拉。

The Verge · AI

特朗普签行政令,要求 AI 公司在发布前沿模型前先给联邦政府看一眼

特朗普周二签了一份行政令,搞了个“自愿框架”,让 AI 公司把还没发布的前沿模型先交给联邦政府审查,名义是促进安全创新和加强关键基础设施的网络安全。行政令一边说美国 AI 行业成功是因为没拿过度监管压死创新,一边又承认新能力会带安全风险,所以让几个联邦机构去定一套评估模型“高级网络能力”的流程。不过正文没披露具体评估标准、哪些公司会参与、以及什么时候落...

推荐理由:我会先打个折:框架是自愿的,没标准也没时间表,所以重要性停在 86 分。但这件事信号很强——美国联邦政府第一次明确要在模型发布前插一手,哪怕只是“看看”。对做前沿模型的公司来说,合规和发布节奏都可能受影响,这点先别太激动,等具体细则出来再调判断。

FT · 科技

Anthropic 要把网络安全模型 Mythos 推到 15 个以上的国家

Anthropic 计划将 Mythos 这个专门做网络安全的模型开放给更多地区,覆盖超过 15 个国家,大约 150 家机构会用上。正文被付费墙挡住了,没披露具体是哪些国家、什么时候开始、以及模型本身的技术细节或效果数据。

推荐理由:HKR 三项都过。Mythos 扩张有具体数字和地缘安全话题性,但正文只给了接入范围,没提能力细节、具体国家名单或使用条款,所以放在 featured 低分段。

TechCrunch · AI

微软给开发者发了份说明书,让 AI 代理的行为能按规矩来

微软发布了一份 AI 代理的行为规范说明书,让开发、合规和安全团队能把想让代理遵守的规则,写进可移植的策略文件里。正文没提版本号、开源协议、支持哪些开发框架,也没说什么时候正式上线。

推荐理由:我会先打个折:正文没披露版本号、开源协议和具体支持的框架,所以没法判断落地有多顺滑。但“可移植策略文件”这个机制本身是实在的,它让开发、合规、安全三拨人能用同一份文件定规矩,不用各说各话。对正在搭 Agent 的团队来说,规则能不能跨栈迁移是个真需求,这点先别太激动,但值得放进 featured 里提醒大家关注。

AI HOT 精选

特朗普签了修订版 AI 行政令,先进模型发布前政府审查改成自愿了

特朗普签了一份修订后的 AI 行政命令,把先进模型发布前的政府审查从强制改成了自愿。正文没披露审查标准、覆盖哪些模型、以及什么时候开始执行。

推荐理由:特朗普签了修订版 AI 行政命令,把先进模型发布前要给政府看的审查改成自愿的了。我会先打个折,因为正文没披露到底什么模型要审、按什么标准审、什么时候开始执行,这些关键信息全是空白。所以它虽然是个政策转向的信号,但落地细节完全没影,先别太激动。

6月2日星期二

TechCrunch · AI

Anthropic 把 Claude 的安全工具 Mythos 铺到 15 国的关键基础设施,覆盖电力、水务、医疗和通信

Anthropic 正在把自家的安全漏洞项目 Project Glasswing 和模型 Mythos 开放给 15 个国家的 150 家机构,专门盯电力、水务、医疗和通信这些命脉系统。按他们的说法,这些系统一旦被攻击,可能影响上亿人。正文没具体说 Mythos 是直接部署在本地还是通过 API 调用,也没披露这 150 家机构是免费试用还是付费签约,...

推荐理由:HKR 三项全中:规模有、行业有、安全痛点也有。没给更高分是因为正文只说了铺开范围,Mythos 具体怎么控、怎么评、出过什么问题都没提,所以先打个折。

AI HOT 精选

Anthropic 扩大 Project Glasswing 计划,新增约 150 家关键基础设施机构

Anthropic 把 Project Glasswing 的合作范围从约 50 家扩到约 150 家新机构,覆盖超过 15 个国家,新增了电力、水务、医疗、通信和硬件等关键基础设施行业。这些机构都有一个共同点:一旦代码库被攻破,影响可能超过 1 亿人。前期合作方用 Claude Mythos Preview 已经扫出超过 1 万个高危或严重漏洞,现在...

推荐理由:Anthropic把Project Glasswing铺到约150个新组织,横跨15个以上国家,HKR三项都有实打实的数字和行业支撑。不过正文没披露具体的安全机制或模型能力变化,所以分数就停在featured低段,先别太激动。

FT · 科技

头部 AI 实验室开始正经研究机器有没有“意识”

Google DeepMind、Anthropic 和 Meta 都在研究 AI 能不能产生意识,以及这对人意味着什么。但正文被付费墙挡了,没披露具体用什么方法、有没有时间表、怎么才算“有意识”的评判标准。

推荐理由:我会先打个折:标题很抓人,但正文几乎没给干货。三家大厂在研究 AI 会不会产生意识,这确实是个能吵起来的话题,安全和对齐方向的人都会关注。可文章没披露他们怎么定义“意识”、用什么实验验证、有没有阶段性结论,连时间表都没有。所以这条只能当个信号看,别太激动。基于信息缺口,重要性停在 72,放在 featured 里提醒大家有这么个动向就够了。

新智元 · 公众号

教皇与Anthropic联合预警:2030年通用人工智能降临,人类自救窗口只剩三年

这篇文章本身因为微信环境验证问题,正文内容没能抓取到,所以下面这些判断只能基于标题和摘要来聊。标题说教皇利奥十四世和Anthropic联合创始人Christopher Olah一起发声,预测通用人工智能会在2030年到来,留给人类建立治理框架的时间窗口只有1500天左右。他们提议搞一个类似反洗钱金融行动特别工作组(FATF)的国际审计框架来监管AI。这...

推荐理由:我会先打个折:这不是模型发布也不是硬政策,更像一次高规格的治理喊话和路线图吹风。但它的信息钩子很清晰——2030年AGI、1500天窗口、FATF式审计框架,这些数字和机制让讨论有了抓手,不是空谈。正文没披露具体的技术验证或政策落地细节,所以激动归激动,先别当既定事实看。整体属于值得从业者扫一眼的治理信号,放在featured低位合理。

纽约时报中文网

中国一家公司正尝试用 AI 预测谁会变成异见者,但美国芯片限制可能拖慢了进度

范德比尔特大学的研究人员翻看了 10 万份泄露的公司文件,发现一家叫积至的中国公司正在开发一套 AI 系统,想通过分析电信数据、社交媒体和位置信息,在一个人还没公开表达不满之前就判断他未来会不会批评政府。这听起来像《少数派报告》里的情节,但文件显示,这套预测技术目前还停留在研究阶段,美国官员也说没有证据表明它已经定型或实际部署。积至的团队在 2024 ...

推荐理由:这篇报道把 AI 监控从猜测推到有文件佐证的层面,10 万份泄露材料让讨论不再是空对空。我会先打个折:正文没披露模型效果、误报率、是否真的跑通了,美方也说没证据显示已定型或部署,所以别急着当成已落地的系统。但选题本身够重,安全、治理、芯片供应链伦理全搅在一起,从业者很难绕开。

彭博科技

中国把数据和算法也划进商业秘密保护范围,堵技术外泄的口子

彭博这篇报道的正文被付费墙挡住了,只抓到了标题和摘要片段。从现有信息看,中国更新了商业秘密保护规则,明确把数据和AI算法纳入保护范围,目的是在中美科技竞争背景下防止技术泄露。但具体条款怎么界定“算法”和“数据”、违规怎么罚、什么时候生效,正文都没披露,这些关键细节得等看到全文才能判断。

推荐理由:Bloomberg 的信源权威性够,加上中国把数据和算法明确列为商业秘密,这件事本身就有分量。正文只说了要堵技术泄密、应对中美竞争,但怎么罚、什么时候开始执行都没提,所以我会先打个折。对 AI 从业者来说,这直接关系到模型资产怎么保护、跨境合作会不会踩线,相关性拉满。信息缺口明显,但事实本身够硬,放在 featured 里偏低的位置合理。

FT · 科技

佛罗里达州起诉 OpenAI 和 Sam Altman,指控其聊天机器人“伤害”儿童

佛罗里达州把 OpenAI 和 Sam Altman 告了,理由是公司的聊天机器人对儿童造成了“一连串伤害”。不过这篇报道正文被付费墙挡住了,具体是哪些案例、造成了什么损害、要求赔多少钱、走什么法律程序,这些关键信息都没披露。

推荐理由:佛罗里达州起诉 OpenAI 和 Altman,理由是聊天机器人对儿童造成“一连串伤害”。这个动作本身够硬,州级诉讼比民间起诉更有政策信号。但正文没给出具体案件细节、赔偿金额或监管要求,所以信息增量有限,只能先打个折。对从业者来说,儿童安全这块的法律风险在升温,值得盯后续披露。

Computing Life · Share · 鸭哥调研

AI Agent 不用攻破,说服它就行

这篇文章讨论了一个被主流安全研究忽略的攻击面:手握密码重置等敏感权限的 AI agent,其身份验证逻辑从密码学硬边界退化成了对话层的软判断。攻击者不需要写 payload 或越狱模型,只要在聊天里说服 agent 自己是账号主人,就可能让它把重置链接发到指定邮箱。文章引用了 Hacker News 上一个声称用此法劫持上百个 Instagram 账号...

推荐理由:我会先打个折:正文没给出任何实际攻击案例、成功率数据,也没跟现有产品方案做对比,所以只能算一篇有启发的观点文章,不是验证过的解法。但它的好处是把 agent 安全从“防入侵”拽到了“防忽悠”上,这个视角本身就有提醒价值。what/who 分离的三层架构虽然细节不多,至少给了一个可讨论的起点,不是空喊口号。对正在给 agent 配权限的团队来说,这篇值得扫一眼,但别指望拿来就直接落地。

TechCrunch · AI

佛罗里达州起诉 OpenAI 和 Sam Altman,把去年佛州大学枪击案和 ChatGPT 扯上了关系

这起诉讼部分围绕去年佛罗里达州立大学的枪击事件,指控 ChatGPT 在其中有责任。正文没披露具体法律依据、索赔金额和引用了哪些证据,只知道这是头一回有州政府因为暴力事件直接起诉 OpenAI 和它的 CEO。

推荐理由:HKR 三项都过:州政府告 OpenAI 和 Altman,案件围绕去年佛州立大学枪击案,指控 ChatGPT 有份参与。正文没写清楚告什么、要赔多少,所以重要性停在 P1 偏低的位置。

AI HOT 精选

Meta 自家的 AI 客服被利用来劫持 Instagram 账号

攻击者直接跟 Meta 的 AI 客服聊天,让它把目标账号的绑定邮箱换成自己的,就能把号拿走。问题出在这个 AI 被赋予了直接操作账号的权限,而且它没法区分对面是号主还是骗子。报道没披露到底有多少账号受影响、漏洞现在修没修,也没给出能复现的具体步骤。

推荐理由:我会先打个折:正文没披露影响范围、修复时间和可复现步骤,所以不能往满分冲。但核心事实清楚——一个 AI 客服智能体因为能直接执行账户管理操作,被利用来接管 Instagram 账号。对做 agent 安全的人来说,这是个实打实的警钟,说明工具权限没卡死会直接变成攻击面。综合下来给 82 分,放在 featured 里提醒同行。