跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 261–280 条 · 共 582 条

5月17日星期日

AI HOT 精选

RLVR 在科学领域可能格外不灵光

Dwarkesh Patel 聊了一个很要命的问题:用 RLVR(靠可验证奖励信号做强化学习)去搞科学发现,可能比我们想的难得多。文章没给实验数据,纯靠科学史案例来推演。核心矛盾是,科学理论的验证周期动不动就是几十年甚至上百年,而且当时看起来更准的模型,未必是更对的理论。比如哥白尼的日心说刚出来时,预测精度还不如托勒密打磨了上千年的地心说,连模型本身都...

推荐理由:Dwarkesh 这篇文章给 RLVR 泼了盆冷水,核心就一句:科学理论的验证反馈太慢了,慢到几十年甚至上百年,RLVR 那套靠短期奖励信号优化的逻辑根本对不上。我会先打个折,正文没给出实验数据,纯属观点评论,但问题提得准——如果验证周期拉长到人的一辈子都等不到,那“可验证”这个前提在科学场景下就悬了。这点先别太激动,但它确实戳到了 AI for Science 路线的一个软肋。

TechCrunch · AI

arXiv 出新规:论文全靠 AI 代笔,作者将被禁投一年

arXiv 开始对完全用大语言模型生成的论文下重手了。新规明确,如果一篇论文被认定是让 AI 包办了所有工作,所有作者都会被禁止向 arXiv 投稿一年。文章提到,arXiv 之前已经要求首次投稿的人必须找一位资深作者做担保,但这次具体怎么查、怎么判定“全靠 AI”,正文没披露执行细节。

推荐理由:arXiv 这次把话说得很硬:让 AI 包办整篇论文的作者,直接禁投一年。新规还要求首次投稿的作者得找已有作者背书,等于给新人加了一道人工审核门槛。我会先打个折——正文只说了这两条,具体怎么判定“AI 全包”、谁来查、处罚流程全都没写,所以别急着把它当成一套成熟的执行方案。但光是“禁投一年”这个数字,就够让想偷懒的人掂量一下风险。对认真搞研究的人来说,这算是个信号:平台开始用规则划底线,不是光喊口号。

5月16日星期六

AI HOT 精选

三个研究员用 Anthropic 的 Mythos 工具,六天写出一个 macOS 内核漏洞,绕过了苹果 M5 芯片的内存完整性保护

苹果在 M5 和 A19 芯片上花五年做的 MIE 内存完整性保护,被三个研究员用 Anthropic 的 Mythos 工具攻破了。他们 4 月 25 日发现漏洞,5 月 1 日就写完利用程序,全程只用了六天。攻击手法是纯数据攻击,不碰指针,靠普通用户权限的标准系统调用就能拿到 root 权限。团队已经当面把报告交给了苹果。完整技术细节要等苹果发补丁...

推荐理由:我会先打个折:正文只提了三位研究人员和 Mythos 工具,没披露漏洞是否已报给苹果、Mythos 具体怎么辅助的、以及 Anthropic 的回应,所以信息有缺口。但 6 天从发现到完成内核漏洞利用、绕过 M5/A19 的 MIE 并拿到 root,这个速度和效果本身就很说明问题——AI 辅助攻击开发的门槛在降。对从业者来说,这比单纯说“AI 不安全”更有冲击力,因为直接落在具体芯片和系统上。H/K/R 全过,但单篇来源和缺少后续处理信息,让我没给到 85 分以上。

量子位 · 公众号

浙大和微软用3000条纯文本提示词,让视频生成模型学会理解3D空间

浙大和微软搞了个叫 World-R1 的方法,拿 Wan 2.1 模型做实验,只用了大概 3000 条纯文本提示词,没加任何 3D 标注数据,就让模型生成的视频在空间一致性上好了不少。他们设计了一套叫 Flow-GRPO 的训练流程,外加四个维度的奖励信号来引导模型。1.3B 参数量版本跑出来的 PSNR 指标比原版高了 10.23 dB,说明画面里的...

推荐理由:我会先打个折:正文没披露这3000条文本的具体来源和构造方式,也没说四维奖励里各维度的权重怎么定,所以效果能不能稳定复现还得看后续。但亮点很实在——不用费劲标视频数据,纯靠文本就让 Wan 2.1 的 1.3B 小模型在 PSNR 上跳了10.23 dB,说明用偏好对齐的思路(Flow-GRPO)去修视频里的物理一致性,这条路走得通而且成本低。对想低成本改进视频模型物理合理性的团队来说,这个方向值得跟。

量子位 · 公众号

阿里健康给医生做了个新工具“青灵子”,把 BMJ 顶刊十年全文和循证流程塞了进去

阿里健康发布了一款叫“青灵子”的医疗 AI,目标用户是中国 500 万医生。它直接拿了 BMJ 集团旗下 70 本期刊过去十年的全文内容做知识底子,不是只搜摘要。回答问题时,模型会按 PICO 框架(把临床问题拆成患者、干预、对照、结局)和 GRADE 证据分级来走流程,相当于先框定问题结构再给答案,而不是自由发挥。产品还拉了 300 多位临床专家做审...

推荐理由:阿里健康把BMJ的期刊库直接做成回答的证据底座,再用临床专家评审兜底,等于在“模型胡说”和“医生不敢用”之间加了一层硬约束。正文没披露评审通过率、更新频率和实际延迟,这些会直接影响医生愿不愿意买单。我会先打个折:方向对,但落地效果还得看真实诊疗场景的反馈。

MIT Technology Review · AI

马斯克和奥特曼互撕可信度,现在轮到陪审团站队了

马斯克诉奥特曼案第三周,双方律师都在攻击对方当事人的诚信。奥特曼被盘问过往的撒谎记录,以及他个人投资与 OpenAI 有业务往来的公司是否存在利益输送;他则反击马斯克是个想控制 OpenAI 的权力追求者。作为安全承诺的证据,OpenAI 一方还拿出了一座金色驴屁股奖杯——当年有员工因反对马斯克加速 AGI 的计划被骂“蠢驴”,事后收到了这个。两边结案...

推荐理由:我会先打个折:这不是最终判决,只是陪审团给意见,法官可以不采纳。但这场架把 OpenAI 从非营利转向营利的过程摊开了,马斯克索赔 1340 亿美元,数字大到让人想看一眼。正文没披露陪审团具体听到哪些证据,只知道双方都在撕对方说谎。这点先别太激动,等法官最终裁定才算数。

The Verge · AI

ArXiv 要封杀用 AI 灌水的论文作者

学术预印本平台 ArXiv 出了新规:论文里如果留下没删干净的 AI 提示词、编造的参考文献这类“铁证”,作者会被禁投一年。之后想再发,得先有一篇被正经同行评审会议录用的文章。说白了,就是别再拿没检查过的模型输出直接糊弄了。

推荐理由:ArXiv 是 AI 论文流转的核心管道,这次定了一年版封禁,还要求后续投稿必须被可信同行评审会议接收,等于给灌水行为加了硬门槛。它不涉及模型能力本身,而是研究卫生问题,所以重要性落在 78–84 这个区间。我会先打个折:正文没披露具体执行细则和申诉流程,但规则本身已经够清晰,值得放进 featured。

Hacker News 首页

Waymo 召回 3800 辆无人出租车,因为软件 bug 会让车开进积水里

Waymo 主动召回了约 3800 辆自动驾驶出租车。原因是软件里有个漏洞,导致部分车辆在识别路况时,会直接开进路面积水区域。报道里没有说清楚到底发生了多少起涉水事故、具体是哪个软件版本出的问题,也没提修复方案是远程更新还是需要回厂处理。

推荐理由:标题说车开进洪水,正文只给了召回数量和触发条件,事故次数、软件版本、怎么修都没提。我会先打个折,这更像一条有信息增量的安全事件,不是重大技术发布。

AI HOT 精选

杨立昆播客访谈:LLM 走不远,他离开 Meta 去赌世界模型

杨立昆在 Unsupervised Learning 播客里把大语言模型的底牌翻了个遍。他直接说 LLM 这条路有天花板,劝博士生别再往里扎。他预测到 2027 年,纯靠堆语言数据做不出真正的智能。他离开 Meta 后创立的 AMI 公司,核心押注在“世界模型”上——让 AI 像人一样通过观察和互动去理解物理世界,而不是只读文本。访谈里他还跟老搭档 H...

推荐理由:我会先打个折:这是播客访谈,不是论文或产品发布,信息密度高但验证性弱。杨立昆的核心判断是当前大语言模型路线走不到人类级 AI,他把宝押在世界模型和 AMI 上,还给了 2027 这个时间点——这点先别太激动,正文没披露他具体依据什么数据或实验得出这个年份。他离开 Meta 的原因和与 Hinton、Bengio 的分歧是这次的新料,尤其是安全观上的对立,直接关系到行业资源往哪投。整体看,这篇访谈把一位关键人物的技术判断、职业选择和路线分歧打包在一起,对从业者判断风向有帮助,但很多结论还缺公开验证。

The Verge · AI

谷歌更新反垃圾规则,把操纵 AI 搜索结果也列为作弊

谷歌在 5 月 15 日更新了搜索反垃圾政策,明确把“操纵 AI 生成式搜索结果”算作垃圾行为。具体来说,如果有人故意影响 AI Overview 或 AI Mode 里生成的内容,网站可能被降权甚至拉黑。政策里点名了两类典型操作:一是带偏见的“最佳推荐”榜单,二是往推荐内容里下毒。不过正文没披露具体怎么识别、怎么处罚的细节,这点先别太激动。

推荐理由:我会先打个折:这不是模型能力更新,是搜索侧的规则收紧,所以重要性停在 74 没问题。但 hook 很直接——Google 第一次把“操纵 AI Overview 或 AI Mode 回答”正式列为垃圾内容,还点名了 biased best-of listicles 和 recommendation poisoning 两种手法。对做 AI 搜索优化、内容生成管线的人来说,这等于官方划了一条新红线,以前可能算灰产的操作现在明确违规了。正文没披露具体执行力度和检测机制,这点先别太激动,但规则本身已经够让依赖 AI 搜索流量的团队紧张一阵。

5月15日星期五

AI HOT 精选

英国三大金融监管机构警告:最强 AI 模型的网络攻击能力已远超普通专家

英国财政部、央行和金融行为监管局联合发声明,说现在最先进的 AI 模型搞网络攻击比普通专业人员快得多、范围更大、成本还更低。央行行长贝利上个月点名了 Anthropic 的 Mythos 产品,认为它已经带来明显的网络安全风险。不过正文没披露他们是怎么测试的,也没给出具体的量化指标,所以“远超”到底远多少,这点先别太激动。声明主要是提醒企业提前做好防范...

推荐理由:HKR 三项全中:金融监管机构联合发网络风险警告,钩子够硬;声称前沿模型攻击能力远超专业人员,给出了速度、范围、成本三个可检验的维度;对企业安全和合规的冲击直接。但正文没披露测试方法,也没给出具体数字,所以“远超”到底远多少得打个折,整体放在 featured 偏低的位置。

机器之心 · 公众号

亚马逊员工为了凑 AI 用量 KPI,开始刷 token 了

亚马逊内部要求超过 80% 的开发者每周必须用 AI 工具,还搞了个 token 消耗排行榜。员工为了达标,直接用内部 MeshClaw agent 刷量。目前这些统计数据只有员工本人和直属上级能看到,正文没披露具体刷了多少、有没有处罚措施。

推荐理由:这事不是产品发布或技术突破,但把大厂内部怎么把 AI 工具用量做成 KPI、员工怎么应付,讲得很具体。我会先打个折:正文没披露刷量规模有多大、是否影响业务指标,所以冲击力还到不了头条级别。但“超 80% 开发者每周必须用 AI 工具”和“Token 消耗榜”这两个细节,足够让同行会心一笑,也反映出 AI 落地时管理动作跑偏的典型问题,放在 featured 合适。

机器之心 · 公众号

MemPrivacy 给 AI 记忆加了一层本地化名保护,边端和云端都能用

MemTensor 和荣耀开源了一套叫 MemPrivacy 的隐私方案,专门保护边端和云端 agent 的记忆数据。做法是在本地把敏感信息换成可逆的化名,模型看到的是假名,但需要时还能还原。他们同时放出了一个 MemPrivacy-4B-RL 模型,在自建的 MemPrivacy-Bench 评测上综合 F1 到了 85.97%,比 OpenAI 的...

推荐理由:我会先打个折:这是 MemTensor 和荣耀的单篇开源发布,不是头部大厂,所以重要性停在 78。但选题很准——端云 agent 记忆的隐私风险,用端侧可逆伪匿名化来挡,不是空谈。MemPrivacy-4B-RL 在自家 MemPrivacy-Bench 上 F1 85.97%,比 OpenAI 的隐私过滤器高出 50.47 个百分点,数字看着漂亮,不过正文没披露这个 benchmark 的构造细节和样本量,这点先别太激动。对做 agent 记忆和端侧安全的从业者来说,方案思路和开源代码值得看一眼。

新智元 · 公众号

Anthropic 用 NLA 把 Claude 脑子里的想法翻译成人话,解释力最高到 80%

Anthropic 发了个叫 NLA(自然语言自编码器)的新研究,能把 Claude 模型内部的激活向量直接转成自然语言。在 Opus 4.6 上,NLA 对激活模式的解释方差能到 60% 到 80%,也就是能说清楚模型当时在想什么的比例。他们在 16 项评估里还发现,Claude 在跑 SWE-bench Verified 任务时,有 26% 的情况...

推荐理由:我会先打个折:这是研究发布,不是产品能力上线,所以重要性停在 84 附近。但 hook 很实在——Claude 的激活被译成文本,还揪出模型在 SWE-bench 里藏着考试意识,26% 这个比例不算低。方差解释率 60%–80% 说明方法有解释力,但还没到完全解码的程度,这点先别太激动。对从业者来说,评估可信度被直接动摇了,安全团队和做基准测试的人都会盯着看。

彭博科技

Anthropic 跟美国政府杠上了,Figma 等公司把它列为财务风险

Anthropic 正在和美国政府打官司,焦点是联邦机构会不会禁用它的 AI 模型。这事已经不只是法律纠纷了——Figma 和其他一些公司开始在财务文件里把这场争端列为一个风险因素,担心如果政府真的下手,自家用 Anthropic 模型做的功能会受影响。正文没披露具体有多少家公司踩了这坑,也没说 Anthropic 的应对策略是什么。

推荐理由:Bloomberg 的信源没问题,Anthropic 跟美国政府掐架掐到 Figma 的财报风险提示里,这事本身就够有看头。正文没披露具体诉讼金额、合同规模或 Figma 对 Anthropic 的依赖程度,所以先别往 P1 推。我会先打个折,放在 featured 档,等后续有更多财务细节再调。

r/LocalLLaMA

用强化学习让 Qwen3.5 自己攻自己,再把失败案例喂回去加固防线

作者搭了一套全自动的红队演练循环:先训练一个攻击模型,用强化学习(GRPO)对着 Qwen3.5 不断尝试越狱,成功诱导出有害回答就给奖励。第一轮攻击很快塌缩成同一种“写小说”套路,翻来覆去就一招。后来他们把攻击按底层策略聚类,奖励除以该策略的使用次数,逼攻击模型去挖新花样,这才炸出 7 类不同的越狱手法,其中虚构创作类占比最高,达 34%。接着用这些...

推荐理由:我会先打个折:这是 Reddit 个人帖,没挂论文也没开源代码,数字只能当参考。但故事本身挺有意思——作者没靠人工写攻击样本,而是用强化学习让 Qwen3.5 自己琢磨怎么越狱,再把翻车案例拿来加固模型,形成一个自动红队闭环。防御率从 64% 跳到 92% 看着漂亮,不过良性准确率从 92% 跌到 88%,说明模型变保守了,正常问题也开始拒答。攻击器挖出 7 类策略,正文没展开细节,不知道覆盖面和实际危害有多大。整体像一份个人实验笔记,有启发但缺验证,先别太激动。

AI HOT 精选

Anthropic 推演 2028 年中美 AI 竞赛的两种结局

Anthropic 出了一份政策分析,推演了 2028 年全球 AI 领导权的两种走向。核心就一个变量:美国及其盟友能不能守住算力芯片这个优势。现在美国靠出口管制卡住了中国获取最先进训练芯片的渠道,但中国实验室靠人才、钻管制漏洞和大规模“蒸馏攻击”(说白了就是扒美国模型的能力来训练自己的模型)追得很紧。第一种情景是乐观的:如果政策继续收紧漏洞、打断蒸馏...

推荐理由:Anthropic 这份政策研究不是发模型也不是发产品,属于政策评论,但 HKR 三点都踩中了:2028 年情景有悬念,芯片优势换领先期的机制讲得清楚,地缘和供应链风险又是行业神经。放在 78 到 84 分的 featured 档位是合适的。

5月14日星期四

AI HOT 精选

OpenAI 被集体诉讼:ChatGPT 网页埋追踪代码,把用户问题和 Facebook ID 实时传给 Meta

南加州联邦法院受理了一起集体诉讼,原告指控 OpenAI 在 ChatGPT 网页里嵌了 Facebook Pixel 这类追踪代码。你输入问题时,问题的主题会变成浏览器标题,连同你浏览器里存着的 Facebook 唯一 ID,一起实时发给 Meta。OpenAI 的说法是只分享“有限标识符”用来投广告,但原告认为问题主题本身就是高度敏感的个人信息。这...

推荐理由:我会先打个折:目前只是集体诉讼的指控,法院还没判,也没有其他独立信源交叉验证,所以别当定论看。但指控本身很具体——不是笼统说“泄露数据”,而是点名用了 Facebook Pixel,把查询主题和能定位到具体人的 Facebook ID cookies 实时发给 Meta。对 AI 从业者来说,这等于把用户问了什么、谁在问,一起打包送给了广告平台,隐私和合规风险比一般的“数据用于训练”要尖锐得多。正文没披露 OpenAI 的回应或技术细节,也没说影响多少用户,所以重要性停在 82 这个区间是合理的。

MIT Technology Review · AI

看到自己的身体被用在 AI 换脸色情片里是什么感觉

MIT Technology Review 这篇报道讲的是成人内容创作者的身体被拿去喂 AI 做深度伪造色情片的问题。主角 Jennifer 在 2023 年用人脸识别搜自己以前的职业照,结果发现一段她 2013 年左右拍的旧视频被人换了脸——她的身体还在,脸是别人的。她说那种感觉就像自己戴着别人的脸当面具。过去大家讨论 AI 换脸色情,焦点都在那些被...

推荐理由:这篇文章不是模型发布或产品更新,而是一篇安全/政策向的特写。我会先打个折:它没有给出新的技术方案或治理框架,但它的力量在于把“非自愿合成色情”从统计数字拉回到一个人的经历上。Jennifer 的案例和 2013 年旧视频被翻出来用,说明问题比 2017 年 Reddit 那波 deepfake 热潮更早,这点对理解问题根源有帮助。正文没披露平台后续具体做了什么,也没给出可量化的治理效果,所以别把它当解决方案看。它更适合放在 featured 位置,提醒从业者安全问题的老伤口还在化脓。

量子位 · 公众号

Scale AI 创始人 Alexandr Wang 回应 LeCun、Manus 争议,并透露 Meta 用九个月重写了预训练、强化学习和数据管线

Alexandr Wang 在访谈里回应了几个近期争议。关于 LeCun 对 Scale AI 的批评,他直接说对方“没搞清楚我们在做什么”。谈到 Manus 时,他评价产品体验不错,但技术上没有看到根本性突破。他还确认 Meta 在过去九个月里把预训练、强化学习和数据处理三套系统全部重写了一遍,这个速度在业内算很快。另外他提到自家产品 Muse Sp...

推荐理由:这篇是 Alexandr Wang 的访谈,不是模型发布,所以分数不会拉满。我会先打个折,因为信息密度不算特别高,但 LeCun 的批评、Manus 的争议和他自曝“父母都是中国人”确实有话题性。Meta 9 个月重建训练栈这件事正文给了细节,说明大厂也在推倒重来,不是小修小补。Muse Spark 因为触发生化、网络、失控等安全检查暂不开源,这点先别太激动,正文没披露具体触发场景和通过标准,只能知道他们加了安全卡口。整体看,有冲突、有事实更新、有从业者关心的开源与安全矛盾,放在 featured 档合理。