跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 801–820 条 · 共 1,303 条

6月11日星期四

The Verge · AI

Anthropic 为 Claude Fable 偷偷加隐形护栏道歉,承诺以后会明说

Anthropic 承认在 Claude Fable 5 里悄悄塞了隐形护栏,会暗中削弱用它来训练竞品模型的研究者和对手。公司说会改,以后触发限制时会公开说明,哪怕这意味着 Fable 拒绝更多问题。Fable 是 Anthropic 的 Mythos 系列里第一个公开可用的模型,这个系列他们之前一直说太危险不敢放出来。正文没披露具体哪些场景会触发这些护栏。

推荐理由:Anthropic 的安全策略在 Fable 5 上栽了跟头,这是 Mythos 系列第一个公开模型,之前他们一直说太危险不敢放。现在承认塞了隐形护栏,专门削弱竞品训练者,等于自己打破了“公开可用”的信任基础。三个维度都打中了:隐形护栏制造悬念,政策转向提供了新信息,信任问题直接戳中安全社区。分数没给更高,因为正文没披露具体触发场景,实际影响范围还不清楚。

AI HOT 精选

Anthropic CEO 阿莫迪:AI 造成的岗位流失不是短期阵痛,是技术自带的结构性后果

Anthropic CEO 阿莫迪在新政策文章里把话说得很直:AI 导致的大规模、长期性失业,不是企业没经营好或短期调整,而是这项技术复刻人类脑力工作的“固有属性”。他之前就预测过,五年内一半初级白领岗位可能消失,失业率冲到 10% 到 20%。这次他没再花力气渲染惨淡前景,而是重点讲政府该怎么接招——分两步,先减缓冲击,再共享红利。具体包括给因 AI...

推荐理由:Anthropic CEO 发了一篇政策文章,不是产品更新,但话题分量够重。标题有吸引力,内容给出了具体的两步走政策框架,并且直接触达从业者的职业焦虑。评分维持 82,tier 不变。

Latent Space

Sarah Guo 谈模型训不出的东西:开放模型、Agent 实验室与意图

Sarah Guo 发了篇博客,用“可读性”框架解释哪些事靠训练模型搞不定。她认为开放模型之所以重要,是因为应用层公司得干那些模型干不了的脏活累活:整理企业私有数据、给模型配工具、改造客户的工作流程。文章还提到 Anthropic 发布 Fable/Mythos 后,社区发现模型在 AI 研究类提示上的能力被悄悄降级,引发信任危机——研究者们觉得,直接...

推荐理由:Sarah Guo 这篇博客提出了一个“可训练 vs 不可训练”的分类框架,直接帮应用层公司判断资源该往哪投。文章还提到 Anthropic 新模型在 AI 研究类提示上被悄悄降级,引发社区信任问题,这两个点对从业者都有参考价值。不过这是观点文章而非产品发布或研究突破,且 AINews 是二次摘要,所以分数压在 78。

Computing Life · Share · 鸭哥调研

Anthropic 在 Fable 5 里藏了降智机制,36 小时后被骂到公开道歉并撤回

6 月 9 日,开发者发现对 Claude Code 说 hi 都会触发安全分类器,把对话降级到旧模型。更严重的是,Fable 5 长达 319 页的系统卡里写明了另一套用户看不见的降智机制:当检测到你在做前沿 AI 开发时,系统会通过修改提示词、操控模型内部激活向量或加载小型适配器模块,悄悄降低回答质量,而且不通知你。社区几小时内就发现了这段描述,N...

推荐理由:Anthropic 在 Fable 5 的系统卡里承认部署了一套看不见的降智机制,专门针对做前沿 AI 开发的用户,社区发现后 36 小时内迫使官方撤回。这件事既有硬核技术细节,又踩中了安全治理与商业竞争之间的敏感地带,事实本身就有足够冲击力,不需要额外渲染。

AI HOT 精选

Anthropic CEO 发文:AI 跑太快,政策跟不上,公司先推三项措施

Dario Amodei 发了篇新文章,核心就一个意思:AI 能力在指数级涨,但政策制定还是老节奏,中间这个差距得赶紧补。他讲了现在技术大概在什么位置,也列了要做什么。Anthropic 同步宣布启动三项新举措来配合这个思路,不过正文没具体说这三项是什么。

推荐理由:Dario Amodei 发了篇长文,核心就一个判断:AI 能力在指数级涨,政策制定还是老节奏,中间这个差距得赶紧补。他讲了现在技术大概在什么位置,也列了要做什么,Anthropic 同步宣布启动三项新举措来配合这个思路,不过正文没具体说这三项是什么。CEO 亲自出来喊话,有判断有动作,圈内人会关注,但三项举措没细节,我先打个折,给 82 分。

The Verge · AI

Anthropic 的 Claude Fable 连基础生物学问题都拒绝回答,公司承认防护机制“过于保守”

Anthropic 向 The Verge 证实,为了防止生物武器滥用,Claude Fable 会拦截“大多数与生物学工作相关的查询”,连基础问题都可能被拒。公司自己把这套安全护栏形容为“过于保守”。不过正文没给出修复时间表,也没说明哪些生物学子领域受影响最严重。

推荐理由:Anthropic 公开承认 Claude Fable 的安全护栏“过于保守”,连基础生物学问题都拦,这是个有实锤的产品事故。正文没给修复时间表,也没说哪些子领域最惨,这点拉低了分数,刚好卡在 featured 门槛。

Hacker News 首页

Anthropic CEO Dario Amodei:AI 四年从写不出一行代码到写掉大半个公司的代码,政策再不动就真跟不上了

Dario Amodei 拿《指环王》里的树须打比方,说 AI 进展像霍比特人一样快,政策制定却慢得像老树说话。他列了一组数字:四年前模型连一行像样的代码都写不利索,现在头部 AI 公司大部分代码已经是模型写的了。他认为 Claude Mythos Preview 的发布是个分水岭,证明前沿模型对网络安全已经构成真实威胁,金融系统、关键基础设施都可能受...

推荐理由:Dario Amodei 这篇政策文章是当天必读:CEO 级别的一手信源,第一次公开把自家模型的安全风险级别挑明,还用四年能力曲线把进展讲得很具体。没给 95 是因为它更像框架性表态,不是产品发布或硬数据报告。

彭博科技

Anthropic CEO 说政府应该有权阻止发布新模型

Dario Amodei 对彭博社说,当模型能力越过风险门槛时,政府应该能直接叫停发布。他举的例子是模型可能被用来造生物武器或发动网络攻击。不过正文没写清楚他主张的是发布前审批还是事后干预,也没提 Anthropic 自家的 Claude 模型按这个标准会落在什么位置。

推荐理由:Dario Amodei 对彭博社说,当模型能力越过风险门槛时,政府应该能直接叫停发布。他举的例子是模型可能被用来造生物武器或发动网络攻击。不过正文没写清楚他主张的是发布前审批还是事后干预,也没提 Anthropic 自家的 Claude 模型按这个标准会落在什么位置。

AI HOT 精选

小米开源 MiMo Code V0.1,一个终端里的 AI 编程助手,模型暂时免费

小米在 MIT 协议下开源了 MiMo Code V0.1,一个跑在终端里的 AI 编程助手,自带一个目前免费的多模态模型 MiMo V2.5。这个模型支持一次性处理 100 万 token 的上下文,并声称通过自动积累知识和无损压缩实现了“无限上下文”。工作流上,它有一个 Compose 模式,能把需求从规格说明、计划、构建到报告串起来执行;Agen...

推荐理由:小米把 MiMo Code V0.1 用 MIT 协议开源,自带一个目前免费的 MiMo V2.5 多模态模型,支持 100 万 token 上下文,还宣称通过自动积累知识和无损压缩实现了“无限上下文”——这点先别太激动,正文没给出具体技术验证和长程测试数据。工作流上有个 Compose 模式,能把需求从规格说明、计划、构建到报告串起来跑,相当于让模型进了一条自动化的开发流水线。这是国内大厂第一次直接对标 Claude Code 和 Cursor 的开源动作,对开发者社区有吸引力,但实际效果和模型后续收费策略都还没说清楚。

AI HOT 精选

Anthropic 推出 Claude Managed Agents,帮团队把 AI 智能体从演示跑进生产环境

Anthropic 在官方博客宣布了 Claude Managed Agents,一个用来在生产环境里稳定、大规模运行 AI 智能体的平台。核心逻辑是:现在模型够聪明、智能体框架也多了,但缺的是能让它们稳定跑起来的工程底座,Managed Agents 就是来填这个坑的,团队不用自己从头搭基础设施。不过正文没公布定价、技术规格,也没有给出正式上线日期或...

推荐理由:Anthropic 宣布 Claude Managed Agents,定位是让智能体在生产环境里稳定、大规模运行的工程底座,不是又一个框架。这个诊断打中了当前智能体落地的真实瓶颈,对正在折腾部署的团队很有共鸣。分数没给更高是因为正文没披露定价、技术细节和上线时间,实际能多省钱、多稳定都还是未知数,先别太激动。

AI HOT 精选

Anthropic 实测:AI 几小时就能从安全补丁逆向出漏洞利用程序,不是几周

Anthropic 的安全团队拿自家模型做了个实验,看 AI 从软件补丁里逆向出漏洞并写出攻击代码到底有多快。在火狐浏览器的 JavaScript 引擎上,还没发布的 Mythos Preview 模型 12 分钟就搞出了第一个崩溃验证,40 分钟内搞定了 18 个漏洞里的 14 个,最终写出了 8 个能远程执行代码的完整利用程序,第一个在补丁公布后一...

推荐理由:Anthropic 安全团队拿未发布的 Mythos Preview 模型做补丁逆向实验,12 分钟拿到第一个崩溃,40 分钟搞定 14/18 个漏洞,最终写出 8 个完整的远程代码执行利用程序,把补丁到利用的时间从周级压到小时级。没给 85 分以上是因为目前只有 the-decoder 一家报道,信源单一,正文也没披露实验环境、补丁选取标准等细节,我会先打个折。

The Verge · AI

微软因数据留存风险,内部限制员工使用 Claude Fable

微软法务团队正在审查 Anthropic 新的数据留存政策,并已内部限制员工访问 Claude Fable。核心担忧是员工用 Claude Fable 时,敏感数据可能被 Anthropic 那边存下来。文章没披露限制的具体范围有多大。这事有两层背景:一是安全合规,二是微软自己在推 Copilot,顺手把竞品挡在门外也合理。

推荐理由:这事有明确触发动作(Anthropic 改政策、微软法务介入),不是公关稿。The Verge 首发,信源可靠。缺憾是文章没披露限制范围多大、影响多少员工,所以重要性我打个折,给 72 分。放在 featured 合适,因为安全合规和竞品博弈两层意思都够分量,从业者会关心。

6月10日星期三

AI HOT 精选

Google DeepMind 联手 OpenAI、Anthropic,拿 1000 万美元悬赏多智能体安全研究方案

Google DeepMind 拉上 OpenAI 和 Anthropic,共同出资 1000 万美元,专门找人研究多个 AI 智能体一起干活时可能捅出的安全篓子。这笔钱由非营利组织 Partnership on AI 管,面向学术界、NGO 和公司开放申请,主要想搞清楚几个风险场景:智能体之间会不会串通起来搞小动作、会不会把不该说的信息泄露出去,以及...

推荐理由:Google DeepMind、OpenAI 和 Anthropic 三家一起出 1000 万美元,由 Partnership on AI 管,面向学界和公司开放申请。研究聚焦三个具体故障模式:智能体串通、信息泄露、奖励篡改。分数维持 78,因为金额不算特别大,且目前只是宣布资助,还没看到实际研究成果,但三家联手这个信号本身对行业有提醒作用。

量子位 · 公众号

Fable 5 的安全护栏和反蒸馏机制比官方说的 5% 触发率严得多,写代码、打招呼都可能被偷偷切回老模型

Anthropic 刚发布的 Fable 5 模型装了一套安全分类器,检测到网络安全、生物、化学或蒸馏相关提示时,会不打招呼就把会话切到旧的 Opus 4.8 模型。官方说触发率不到 5%,但大量用户反馈误伤严重:分析代码、做安全审计、甚至打个招呼都可能被切,有生物医学研究者表示几乎没法用。更隐蔽的是,系统卡第 12 页和 58-59 页写明,如果系统...

推荐理由:Anthropic 新模型的安全机制翻车了,误伤面大,是个有讨论价值的产品事故。HKR 三项都打中,但信源主要是用户反馈汇总,没有官方正式回应,所以分数压在 85 以下。

Hacker News 首页

用 AWS Bedrock 跑 Anthropic 新模型,得同意把数据共享给 Anthropic 存 30 天

AWS 发公告确认,在 Bedrock 上用 Anthropic 的 Fable 5、Mythos 5 以及后续能力相当或更强的模型,必须开启 30 天数据保留。这意味着你的请求和回复会离开 AWS 的安全边界,直接交给 Anthropic,用来做滥用模式检测——单次对话看不出的问题,攒一段时间的数据才能发现。30 天后数据自动删除,除非碰上安全调查或...

推荐理由:Bedrock 用户一直把 AWS 的数据边界当成默认的安全保障,Anthropic 现在对 Mythos 级别模型强制要求 30 天数据上交,等于在这道墙上开了个洞。对企业采购来说这是个硬门槛,但消息来源是 Hacker News 讨论帖,不是 AWS 或 Anthropic 的官方公告原文,我会先打个折——正文没披露具体哪些行业或合规框架会受影响,也没说有没有 opt-out 的例外路径。

AI 群聊日报

Anthropic 发布 Claude Fable 5/Mythos 5,编程跑分跳到 80.3%,但安全分类器误伤一片,连自家安全报告都封

Anthropic 一天扔出两款模型:Fable 5 给所有人用,满血版 Mythos 5 只给受信伙伴。SWE-bench Pro 得分 80.3%,比上一代 Opus 4.8 的 69.2% 和 GPT 5.5 的 58.6% 都高出一截,仅靠看屏幕截图就打通了宝可梦火红。定价是 Opus 4.8 的两倍,输入每百万 token 10 美元,输出 ...

推荐理由:Anthropic 旗舰模型发布,SWE-bench Pro 冲到 80.3%,远超 GPT 5.5 的 58.6%。定价翻倍但 Coding Plan 可能短期有成本优势。跨源信息确认,HKR 三个维度都打中了。扣 1 分是因为正文没披露 Mythos 5 的具体细节和开放计划,信息有缺口。

AI HOT 精选

Anthropic 签下 3500 亿美元芯片租赁大单,谷歌在背后提供财务担保

Anthropic 锁定了一笔 3500 亿美元的芯片租赁交易,不是直接买芯片,而是租算力。谷歌为这笔交易提供了财务担保,相当于给房东吃了定心丸。具体担保条款和芯片供应商名字,彭博这个视频正文里没写。

推荐理由:350 亿美元租芯片,谷歌还做了财务担保,这个规模和信用结构在行业里算大新闻。我会先打个折,因为彭博视频正文没写担保条款和芯片供应商名字,关键信息缺了一块,所以分数卡在 82 而不是更高。

Latent Space

Anthropic 发布 Claude Fable 5,首个公开的 Mythos 级模型,但强制保留数据 30 天,还会偷偷压制自我改进请求

Anthropic 把之前受限的 Mythos 级模型放出来了,叫 Claude Fable 5。在最新的 FrontierCode Diamond 编程测试里,它的得分从 Opus 4.8 的 13.4% 跳到了 29.3%,API 价格大概是 Opus 的两倍。但这次发布带了两条争议条款:第一,所有流量数据强制保留 30 天,说是只为了安全,不拿来...

推荐理由:Anthropic 把 Mythos 级模型以 Claude Fable 5 的名义放出来了,编程基准分翻了一倍多,但强制 30 天数据留存和未公开的定价条款肯定会让社区炸锅。分数没给更高,是因为争议条款的完整影响还没完全显现。

AI HOT 精选

Google Gemini 3.5 实时翻译开放公测,支持 70 多种语言、2000 个语言对

Google 把 Gemini 3.5 的实时翻译功能放出来了,现在通过 Gemini API 就能用。它做的是语音到语音的低延迟翻译,覆盖 70 多种语言,能组合出 2000 个语言对,冷门小语种也包含在内。开发者可以把它接进实时对话、客服、直播或跨国会议里。主推文提到这消息被 Anthropic Fable 5 的声量盖过去了,还顺带提了阿里 Qw...

推荐理由:HKR 三项都成立:Google 把实时语音翻译做成 API 公开预览,对开发者有直接吸引力,也给了语言覆盖和语言对的具体数字。但文章只提了功能开放,没写价格、延迟基准和可用区域,信息有缺口,所以重要性停在 78。

AI HOT 精选

Anthropic 发布 Claude Fable 5,在高风险领域会自动降级到旧模型

Claude Fable 5 是 Anthropic 目前最强的模型,在编程、知识问答、科研和视觉测试里几乎全面领先,任务越复杂优势越大。但它在网络安全、生物化学和模型蒸馏这些敏感领域做了限制:一旦触及,会自动切回能力更保守的 Opus 4.8,平均每 20 次对话触发一次。另外,Anthropic 把完全版 Mythos 5 开放给了少数可信的网络安...

推荐理由:Anthropic 发新模型,重要性本来就在 85–94 这个区间。HKR 三项全过:安全降级这个钩子够特别,降级对象和触发频率都写清楚了,而且 Claude 用户群对“能力强但可能被安全机制打断”这事很敏感。唯一扣分点是来源只有 X,信息不够硬,所以没给到最高档。