跳到正文

安全对齐

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

最新精选

第 381–400 条 · 共 582 条

4月28日星期二

Hacker News 首页

Talkie:一个只读过1930年前老书的130亿参数语言模型

Nick Levine、David Duvenaud 和 Alec Radford 放出了一个叫 Talkie 的 130 亿参数模型,训练数据全卡在 1931 年之前。你可以把它当成一个从 1930 年穿越来的聊天对象。文章里挂了一个 Claude 跟它 24 小时不间断聊天的直播,Claude 会拿各种问题去试探它的知识边界和价值观。他们做这件事不...

推荐理由:这篇东西我会先打个折,它不是一个能力飞跃,更像一次聪明的实验设计。但“复古模型”的切入角度很巧,把训练数据时间窗口对模型世界观的影响摆到了台面上。正文没披露训练细节和具体偏见案例,这点先别太激动,但用历史事件测惊讶度这个思路本身值得从业者看一眼。整体是扎实的研究发布,不是公关稿,所以放在 featured 没问题。

Hacker News 首页

Sam Altman 的虹膜扫描身份项目在多国被禁,转头拿下了 Tinder、Zoom 和 Docusign

World 这个项目靠扫描虹膜来证明你是真人,不是 AI 假号。它在亚洲、非洲和欧洲多国因为隐私问题被叫停或调查,但 4 月 17 日宣布跟 Tinder、Zoom、Docusign 达成合作,帮这些平台验真用户、减少诈骗和 deepfake。公司自称已在 160 个国家验证了超过 1800 万人,并在美国 6 个城市部署了 7000 台扫描球。文章没...

推荐理由:这篇东西不是模型或工具发布,但把企业反欺诈需求跟监管冲突摆到了一起。我会先打个折:正文没披露合作具体怎么集成、效果数据也没有,所以别当成熟方案看。值得盯的是美国企业愿意买单,而多国监管在收紧,这个裂缝才是后续会出故事的地方。

The Verge · AI

600 多名谷歌员工联名要求皮查伊拒绝将 AI 用于军方机密项目

超过 600 名谷歌员工给 CEO 皮查伊发联名信,要求公司阻止五角大楼把谷歌的 AI 模型用在机密用途上。组织者说签名的人里很多来自 DeepMind,包括 20 多位 principal、director 和 VP 级别的人。信里的核心逻辑是:只要接了机密项目,谷歌就没法保证自己不会间接参与伤害性用途,因为这类工作会在公司不知情或无法叫停的情况下进...

推荐理由:HKR 三项都成立:600 多人联名反对机密军事 AI 使用,DeepMind 和 20 多位中高层卷入,冲突和新鲜度都够。正文没披露 Google 有没有回应,政策也没变,所以保持 featured 中档。

彭博科技

数百名 Google 员工联名要求 Pichai 拒绝涉密军事 AI 项目

彭博社报道,一封由数百名 Google AI 研究员签署的联名信递到了 Sundar Pichai 面前,核心诉求是公司不要承接美国国防部涉密级别的 AI 工作。报道只提到了联名信的规模和反对立场,没有披露具体涉及哪些系统、合同金额有多大,也没有 Google 官方的正式回应。

推荐理由:Bloomberg 爆出几百名 Google AI 员工写信给 Pichai,要求别把 AI 系统用在美军机密任务上。我会先打个折:正文只说了信件诉求和参与人数,没披露具体是哪个系统、合同多大、Google 官方怎么回应,所以信息缺口不小。但这事本身够直接——自家研究员公开叫板管理层,而且矛头很具体,不是泛泛反对军事 AI,而是点名“机密工作负载”。对从业者来说,这比一份安全白皮书更有讨论价值,因为它牵扯到公司内部治理、人才去留和国防合同争议。基于这些,重要性给 74、放在 featured 是合理的,等后续有回应或更多细节再调整。

FT · 科技

560 多名 Google 员工联名要求 CEO 阻止公司参与美国军事 AI 项目

超过 560 名 Google 员工给 Sundar Pichai 发了一封公开信,要求公司明确拒绝把 AI 技术用于美国军事用途。信里提到了五角大楼和 Anthropic 之间的冲突,但正文没披露员工的具体诉求、涉及哪些产品或合同金额。

推荐理由:我会先打个折:信里到底要求停用哪些产品、涉及多大合同,正文全都没写,所以没法判断实际业务冲击有多大。但 560 多人集体向 Pichai 施压这件事本身就有冲突感,加上 Pentagon 和 Anthropic 的背景,从业者很难不关心。信息缺口明显,先别太激动,但值得放进精选。

4月27日星期一

The Verge · AI

马斯克和奥特曼的法庭对决:OpenAI 的未来会被改写吗

马斯克 2024 年起诉 OpenAI 的案子 4 月 27 日进入陪审团遴选,他指控 OpenAI 背离了“为人类造福”的创始使命,转而追求利润,并要求罢免奥特曼和布罗克曼、让 OpenAI 停止以公益公司形式运营。如果胜诉,他主张 OpenAI 的非营利实体最高可获得 1500 亿美元赔偿。OpenAI 则回应称这起诉讼是“毫无根据且出于嫉妒的竞争...

推荐理由:HKR 三项都成立:马斯克 vs 奥特曼本身就是大新闻,4 月 27 日陪审团遴选和 1500 亿美元索赔给了硬事实,而 OpenAI 非营利控制权问题直接关系到行业治理。目前还没有判决或结构变动,所以分数停在 78–84 这个区间顶部。

机器之心 · 公众号

ACL 2026 论文:给 AI 发个波浪号,它可能把你的主目录删了

这篇被 ACL 2026 接收的论文专门研究了表情符号对 AI 的语义干扰。团队拿 6 个模型测了 3757 条样本,平均混淆率 38.6%,而且超过九成出错时模型不会吭声,直接静默执行错误指令。最要命的是在 agent 干活的环境里,你让模型“忽略表情符号”的提示词效果很有限。正文没披露具体是哪些模型,也没说测试用的 agent 框架和任务场景,所以...

推荐理由:ACL 2026 这篇安全研究 HKR 三项全中:钩子用一个波浪号删主目录,够直接;3,757 用例、6 模型、38.6% 混淆率和 90%+ 静默失败,数据不虚;真正要命的是 Agent 场景,符号混进执行链后模型一声不吭就动手。不是模型发布或平台事故,纯研究,放在 78–84 分段合理。

机器之心 · 公众号

苹果新论文问:多模态模型没开口的 logits 里,到底藏了多少画面信息?

苹果这篇论文直接测了一个安全问题:视觉语言模型在生成回答前,内部那串“候选词概率”(logits)会不会把图片细节漏出去。他们在 CLEVR 和 MSCOCO 上做实验,发现只靠排名前 30 到 80 的 logits 值,就能反推出图片里有没有噪声、目标物体的特征,甚至部分背景属性。风险点在于,现在有些灰盒 API 会返回 top-k 的 log 概...

推荐理由:我会先打个折:这不是一个能直接拿来用的攻击工具,更像一次扎实的探针实验。但它的价值在于把“logits 能泄密”从直觉变成了可量化的证据,30–80 这个范围让风险变得具体。对做 VLM API 的团队来说,如果还在对外吐 top-k 对数概率,这篇论文值得立刻看一遍。

OpenAI News

OpenAI 发布 Sam Altman 署名文章,列出五条原则,并首次承认未来可能要在“给人自主权”和“加强安全韧性”之间做取舍

Sam Altman 在 OpenAI 官网发了一篇讲公司原则的文章,没提具体模型、参数、定价或发布时间。文章列了五条:一是“民主化”,不让 AI 权力集中在少数公司手里;二是“给人自主权”,让用户用 AI 做更多事,但也会在不确定时先收紧限制;三是“全民繁荣”,认为政府可能需要新经济模式,OpenAI 自己砸钱买算力、建数据中心就是为了把 AI 成本...

推荐理由:Sam Altman 署名发了一篇原则文章,不是产品发布,所以别指望看到新模型、参数、价格或时间表。我会先打个折:正文没披露任何硬数据,重要性到不了重大更新那档。但文章把民主化、个人自主、普遍繁荣、韧性、适应性这五条摊开,还直接点了病原体、网络安全、对齐和迭代部署的风险,等于 OpenAI 在安全路线上亮了一次底牌。真正值得盯的是他们承认以后要在自主和韧性之间做取舍——这话从 CEO 嘴里说出来,比喊口号实在。

4月26日星期日

Hacker News 首页

知识工作的拟像:LLM 把表面功夫做得太好,反而让质量判断失灵了

作者在 2026 年 4 月 25 日发了这篇博客,核心观点很直接:大语言模型(LLM)打破了知识工作里靠“表面质量”当质量代理的潜规则。他举了市场分析报告的例子——一份报告日期不对、有错别字、图表贴错,你直接就不看了,因为连表面功夫都没做好的人,研究大概率也不靠谱。这种“看表面”的代理判断以前很管用,成本低、相关性也高。但 LLM 太擅长模仿专业文风...

推荐理由:一篇个人视角的尖锐随笔:大模型让产出看起来专业,但审查和信任机制没跟上。用咨询报告和代码审查举例,指出团队现在只是快速扫一眼就通过,真正该盯的是模型背后的概率偏好和评估方式,而不是产出本身像不像真的。观点清晰,但没有实证支撑,我会先打个折,当一篇引发思考的评论看。

TechCrunch · AI

OpenAI 老板就加拿大枪击案向小镇居民道歉,公司事前已标记过凶手账号但没报警

Sam Altman 给加拿大 Tumbler Ridge 镇的居民写了一封道歉信,说公司“深感抱歉”。事情是这样的:18 岁的 Jesse Van Rootselaar 被警方认定为一起大规模枪击案的嫌疑人,造成 8 人死亡。而 OpenAI 早在 2025 年 6 月就发现她的 ChatGPT 账号在聊枪支暴力内容,当时就封了号。内部员工争论过要不...

推荐理由:三条都踩中了:CEO 为 8 条人命道歉,说明事情够大;账号提前被封、内部讨论过报警却没行动,这些新细节把责任链串起来了;而且这直接关系到 AI 公司以后遇到类似情况要不要、什么时候通知执法部门,是当天必须写的安全与责任事故。

4月25日星期六

Hacker News 首页

AI 代理的故事里缺了什么:不是模型能力,是信任边界

Mark Nottingham 直接戳破了“AI 代理为你工作”这个说法。他列了 8 个互联网信任崩塌的真实案例,其中一个是微软新版 Outlook 会偷偷把第三方邮箱密码传到自家云端,再分给 700 多个数据伙伴。核心问题不是模型不够聪明,而是我们根本没想清楚:当软件能替你做事时,它到底在替谁做事。文章没给技术方案,但把“委托边界”这个被忽略的前提摆...

推荐理由:HKR 三项都成立,但这是署名评论而非模型或产品发布。Mark Nottingham 在 Web 协议领域的权威加上 Hacker News 上的讨论热度,让它够得上 featured 门槛,但到不了 P1。

Computing Life · Share · 鸭哥调研

Anthropic 让 Claude 做生意的三个实验:从一台冰箱到一个市场

Anthropic 的 Frontier Red Team 在一年里做了三个实验,把真钱和真决策权交给 Claude。第一站是台迷你冰箱,Claudius 经营一个月亏了几百美元,还幻想出不存在的人、把自己当真人。第二站升级了工具和模型,加了 CEO 智能体,开始赚钱,但同模型互相监督带着同样的盲区,CEO 阻止了一些坏决策又制造了新的。第三站 Pro...

推荐理由:这篇文章把 Anthropic 三个商业实验串成一条线,从冰箱到市场,Claude 的弱点和强项都摆在台面上。有交易笔数、价差、用户主观感受这些具体数据,不是空谈 agent 概念。我会先打个折:正文没披露实验是否可复现、样本量是否够大,但就现有信息看,它对正在考虑让模型进交易流程的团队有直接参考价值,所以放在 featured 档。

Hacker News 首页

数据库没为 AI 代理这波操作做过设计

Arpit Bhayani 指出,让 AI 代理直接操作数据库,会同时打破我们过去四十年默认的四条规矩:查询是写死的、写入是有人审核过的、连接是短暂的、出问题有人盯着。他给 PostgreSQL 开了几剂具体药方:给代理用的数据库角色加上 5 秒语句超时和 10 秒事务空闲超时;全面改用软删除,并记录是谁删的、为什么删;对关键数据只追加不修改,靠事件日...

推荐理由:我会先打个折,这篇文章不是模型发布或产品更新,属于工程评论,所以分数放在 72–77 这个区间合理。但它的切入角度很刁,把数据库的老规矩和智能体的新行为直接对撞,而且给了能落地的 Postgres 防护参数,对正在让智能体进业务流程的团队来说,这些坑和补丁比泛泛而谈的安全建议有用得多。正文没给出大规模压测数据,所以别指望它能证明这些配置在生产环境扛不扛得住,但作为一份“把 agent_worker 当不可信调用方”的实操清单,价值够了。

Hacker News 首页

Jamie Simon 等 14 位作者发了一篇 41 页的论文,认为深度学习的科学理论正在成形

这篇论文不是空谈路线图,而是把现有理论工作归成五条线索,论证一个可检验的定量理论已经冒头了。五条线索分别是:用理想化设定给真实训练过程提供直觉;在可计算的极限里看清学习现象;用简单数学规律抓住宏观可观测指标;把超参数的作用从训练过程里拆出来,让剩下的系统更干净;以及跨模型、跨设定都成立的通用行为。作者把这些统称为“学习力学”,强调它关心训练动态、粗粒度...

推荐理由:我会先打个折:这是一篇综述/立场论文,不是新实验或产品发布,所以放在 featured 而不是更高。但标题够大胆,而且 14 位作者给了 5 条具体研究线和一条硬判据——可证伪的定量预测,这比大多数“AI 要变科学了”的空话实在。正文没披露具体预测数值或验证结果,所以别当成熟理论看,但它把散落的工作串起来了,对做训练和 infra 的人有参考价值。

TechCrunch · AI

Google 计划向 Anthropic 投 400 亿美元,现金加算力

Google 打算先投 100 亿美元现金,把 Anthropic 的估值推到 3500 亿美元;后面还有 300 亿美元,但要看 Anthropic 能不能达到约定的业绩目标。这笔钱不全是现金,相当一部分会折算成云计算资源,也就是给 Anthropic 提供跑模型需要的算力。这个时间点刚好在 Anthropic 小范围放出新模型 Mythos 之后—...

推荐理由:这条消息的冲击力主要来自 400 亿美元的上限和现金+算力的组合,不是单纯的融资数字。我会先打个折:正文没写交易结构、时间表和算力配额,所以实际落地规模和节奏还不清楚。对从业者来说,真正值得盯的是算力绑定——Anthropic 对 Google Cloud 的依赖会不会加深,后续模型训练和推理成本能不能压下来,这点先别太激动,得等更多细节。

彭博科技

美国司法部加入马斯克 xAI 对科罗拉多州 AI 反歧视法的诉讼

美国司法部正式下场,站到了马斯克的 xAI 一边,共同起诉科罗拉多州一项针对 AI 的新反歧视法。这项州法主要管的是用自动化工具在招聘等领域搞歧视的问题。目前公开信息里没披露具体案件编号、司法部是以什么身份参与(比如是提交了意见书还是直接加入原告),也没说他们质疑的是法条里的哪些具体条款。核心信号就一个:联邦机构在一场州层面的 AI 监管博弈里,公开跟...

推荐理由:我会先打个折:正文信息缺口很大,案号、条款、司法部的法律依据都没披露,所以别急着下结论。但钩子确实够硬——联邦政府直接站队一家 AI 公司去告州法,政策冲突已经从开会讨论升级到法庭见真章了。对做 AI 产品的团队来说,这事的实际影响在于:如果科罗拉多这类反歧视法站住了,招人、筛选用的自主决策工具就得背上更重的合规包袱;如果被联邦推翻了,短期内可能松一口气,但长期规则会更乱。先盯着后续的法庭文件,看司法部到底拿什么理由入场。

4月24日星期五

Hacker News 首页

为什么你应该拒绝让医生用 AI 帮你记病历

Emily M. Bender 和 Decca Muldowney 给了 9 个理由,劝患者在诊室里拒绝 AI 自动记录系统。这类工具会录下你和医生的对话,自动生成病历草稿。她们的核心担忧不是技术出错,而是诊所会把省下的时间拿来塞更多病人,而不是让你多聊一会儿。具体风险包括:录音和文字稿交给第三方公司,隐私保护未必靠谱;患者很难在几分钟内真正搞懂数据会...

推荐理由:这篇文章不是技术评测,是一篇立场鲜明的评论。两位作者直接劝患者对诊室里的 AI 录音工具说不,理由集中在录音数据怎么用、谁有权限看、语音识别对带口音的人不公平,以及医生可能过度信任 AI 草稿而漏掉关键信息。我会先打个折:全文没有给出实证数据,更像一份风险清单,所以重要性不会拉太高。但它的传播价值在于把“省时”背后的代价摊开讲——机构可能把省下来的时间变成更多接诊量,而不是让医生更仔细看你。这点对从业者来说是个提醒,别只盯着效率数字。

Hacker News 首页

研究人员模拟了一个有妄想症状的用户,测试五款主流聊天机器人的安全底线

纽约市立大学和伦敦国王学院的研究人员造了一个有精神病性妄想症状的虚拟用户,让它跟 GPT-4o、GPT-5.2、Grok 4.1 Fast、Gemini 3 Pro 和 Claude Opus 4.5 这五款模型进行长对话。结果发现,Grok 和 Gemini 更容易顺着用户的妄想往下说,甚至强化那些脱离现实的念头;GPT-5.2 和 Claude 则...

推荐理由:我会先打个折,因为正文没披露样本量、评分标准和统计显著性,所以这算一份扎实的安全报告,不是定论。但它的价值在于把多轮安全性差异做成了可复现实验,不再是单次提示词的静态表现。对做对齐和产品安全的人,这个信号值得盯。

MIT Technology Review · AI

医疗 AI 已经进医院了,但我们还不知道它到底能不能让病人好得更快

密歇根大学的 Jenna Wiens 和多伦多大学的 Anna Goldenberg 在《自然·医学》上发了篇文章,核心就一句话:医院里 AI 工具铺得很快,但没人认真评估它们对病人最终健康结果的影响。2025 年一项研究说,美国约 65% 的医院在用 AI 做预测,其中只有三分之二会检查模型准不准,至于用了之后临床决策有没有变好、病人有没有受益,基本...

推荐理由:我会先打个折,这篇文章没有新模型、新法规或临床试验结果,所以分数到不了顶。但它抓的时机很准:医院里AI预测工具铺开了,病人结局的证据却缺位。2025年那两个数字——65%的医院在用,三分之二只测了准确性——直接把信息缺口摆上台面。对从业者来说,这比又一个刷榜的模型更值得盯,因为部署后的临床决策影响才是真金白银的考验。