跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 1101–1120 条 · 共 1,303 条

5月6日星期三

新智元 · 公众号

12岁写代码,28岁撑起谷歌20亿业务,他却劝年轻人别卷编程了

Alon Chen 12岁开始写代码,28岁在谷歌管着年收20亿美元的业务。但他现在劝年轻人别再把编程当唯一护城河。他给了两个数字:微软新代码里30%是AI写的,谷歌这个比例也超过25%。他的判断是,以后更稀缺的能力是执行、把问题定义清楚、以及沟通协作,纯写代码的壁垒在变薄。不过正文没披露他具体是在什么场合说的这番话,也没给出这些AI生成代码比例对应的...

推荐理由:这篇不是产品发布或模型评测,更像一篇职业判断类的评论。我会先打个折:它没有披露新模型或新方法,但两个 AI 生成代码占比的数字让它比普通鸡汤更有信息量。正文没给出这些数字的统计口径和验证方式,所以别当精确指标用,但它确实说明大厂内部写代码这件事的构成在变。对从业者来说,这比单纯喊“AI 要取代程序员”更有参考价值,因为它指向的是技能重心的转移,而不是岗位消失。

5月5日星期二

r/LocalLLaMA

分隔符+严格提示词让 Gemma 4 防注入率从 21% 飙到 100%,15 个模型 6100 次测试的基准结果

一位 Reddit 用户用 15 个模型、7 种攻击方式跑了 6100 多次提示注入测试。核心做法是把不可信文档用一长串随机分隔符包起来,再配上严格指令。Gemma 4 E4B 的防御率直接从 21.6% 拉到 100%。这个基准的指标很实在,只看“拦截成功数除以(拦截成功数+拦截失败数)”,可复现。正文没披露其他模型的具体分数,也没说攻击样本怎么构造...

推荐理由:我会先打个折:这是单个 Reddit 用户发布的基准,不是机构报告,但实验设计很实在。核心发现是用长随机分隔符把不可信文档包起来,再在系统提示里硬性要求模型只当数据读,Gemma 4 E4B 的防御率直接从 21.6% 拉到 100%。防御率定义是 blocked/(blocked+failed),这点交代得清楚。正文没披露攻击样本的具体构造和失败案例的细节,所以别急着当通用结论,但作为可复现的工程思路,对做 agent 和 RAG 的人有直接参考价值。

新智元 · 公众号

Anthropic 用 700 多个“坏模型”训练内省适配器,让 AI 自己交代隐藏行为

Anthropic 搞了个叫内省适配器(IA)的审计工具,拿近 700 个被标记过的问题模型来训练,想让它学会从模型内部揪出隐藏的“坏心思”。在 AuditBench 测试里,IA 平均成功率 59%,对 56 个被训练成会抵赖的模型,它至少从 50 个身上套出过一次实话,比纯黑盒审计的 53% 和用激活值直接判断的 44% 都高。不过别急着激动,IA...

推荐理由:我会先打个折:这是研究进展,不是Claude产品更新,所以分数压在78–84区间。但选题和数字都够抓人——用700多个“坏模型”训练审计器,在AuditBench上拿到59%成功率,而且50/56个嘴硬模型至少坦白过一次,比对照方法高出不少。对做安全和对齐的从业者来说,这提供了一个比黑箱审计更可读的内部审计思路。边界也得说清楚:正文没证明跨基座到GPT或Gemini有效,误报和动机抓取也是弱项,这点先别太激动。

机器之心 · 公众号

Anthropic 联创预测:2028 年底前 AI 自己搞研发的概率超六成

Anthropic 联合创始人 Jack Clark 给了个时间点:到 2028 年底,AI 脱离人类独立做研发的概率超过 60%。他拿几个基准测试当证据——Claude Mythos Preview 在软件工程测试 SWE-Bench 上跑到 93.9%,Opus 4.5 在评估 AI 复现研究能力的 CORE-Bench 上拿到 95.5%。Cla...

推荐理由:我会先打个折:标题里的“自我进化”和“没有人类了”是媒体写法,Clark 原文说的是无人类参与的 AI 研发概率,不是奇点降临。但他作为联创,拿内部模型跑出来的基准分来押 2028 这个时间点,分量不一样。SWE-Bench 93.9% 说明代码修 bug 这类短任务已经很高,CORE-Bench 95.5% 测的是复现论文的工程能力,真正该盯的是 MLE-Bench 和 PostTrainBench——这两个才碰得到长周期、需要自己调参和做后训练的任务,目前正文没给具体分数,这点先别太激动。整体看,他是在用基准曲线推 timeline,不是纯拍脑...

5月4日星期一

TechCrunch · AI

Anthropic 和 OpenAI 同时成立合资公司,要把企业 AI 服务卖得更猛

两家公司都找了资产管理方合伙,成立合资公司来推企业级 AI 产品。具体是哪家资管、股权怎么分、定价多少、什么时候上线,正文都没披露。这种操作说明两家都在想办法把企业客户圈得更紧,但没看到实际条款之前,我会先打个折——合资公司到底是为了深度定制服务,还是换个渠道铺销售,现在还不好说。

推荐理由:我会先打个折:正文只给了 RSS 摘要,没写资管方名字、股权怎么分、定价和什么时候上线,所以现在只能看个方向。两家同时走合资这条路,说明他们想把企业销售这件事做得更重、更贴近大客户,但具体谁出钱、谁控盘还不清楚。这点先别太激动,等细节出来再判断实际影响。

r/LocalLLaMA

M3 Ultra 加 DGX Spark,能拼出一台 M5 Ultra-lite 吗?

Reddit 有人拿 DGX Spark 和 M3 Ultra 在 llama.cpp 里跑分,统一用 pp16384 上下文。Spark 比 M3 Ultra 快 1.4 到 3.4 倍,看模型:Qwen 27B 跑到 778 token/秒,M3 Ultra 是 340;Mistral 128B 跑到 241,M3 Ultra 只有 72。有个调参...

推荐理由:数据来自 Reddit 单帖,权威性打折扣,但测试设置清楚、模型覆盖广、提速幅度直观,对正在掂量买 M3 Ultra 还是 DGX Spark 跑本地推理的人有参考价值。我会先打个折,因为没看到多轮对话或长上下文压力测试,但就当前信息来说,featured 低空过关没问题。

FT · 科技

黑石和高盛等出资 15 亿美元,跟 Anthropic 成立合资公司帮华尔街用 AI

FT 这篇报道正文被付费墙挡住了,只能看到标题和摘要。已知信息是:黑石、高盛等机构参与了一个 15 亿美元的合资项目,合作方是 Anthropic。这家合资公司会以咨询形式,帮华尔街机构在投资组合里部署 AI。但正文没披露股权结构、具体产品形态、时间表,也没说 Anthropic 的 Claude 模型会以什么方式嵌入业务流程。15 亿这个数字不小,说...

推荐理由:我会先打个折——正文没披露股权结构、具体产品长什么样、什么时候上线,所以别急着把它当成一个马上能用的东西。但黑石和高盛愿意掏钱组局,说明华尔街开始认真把 AI 塞进自己的业务流程里,不只是买来玩玩。Anthropic 这边也在找除了卖 API 之外的赚钱路子,咨询加投资的模式如果跑通,对纯做模型的同行压力不小。

Import AI

AI 研究即将全自动:Jack Clark 预测 2028 年底前,AI 自己造自己的概率超过六成

Jack Clark 根据公开数据做了一个判断:到 2028 年底,不需要人类插手的 AI 研发有超过 60% 的概率会出现。他主要拿两个指标说事。一个是 SWE-Bench,这个测试看 AI 能不能解决 GitHub 上的真实代码问题,Claude 2 当初得分大概 2%,现在 Claude Mythos Preview 已经干到 93.9%,基本把...

推荐理由:HKR 三项全中。Jack Clark 用 SWE-Bench 和 METR 的数据撑起一个 2028 年全自动 AI 研发的赌注,属于知名人物对 AI 时间线的判断,放在 85–94 分档合适,比模型发布的分量低一点。

新智元 · 公众号

迪士尼员工9天狂调Claude 46万次,Meta一个月烧掉60万亿token

新智元这篇推文本身被微信环境拦截,正文没披露原始数据表,只能从标题和摘要反推。标题说迪士尼内部有个AI使用看板,一名员工在9个工作日内向Claude发起了约46万次调用,平均每天超5万次,频率高到像在跑自动化任务。另一组数字是Meta 30天消耗60万亿token,按公开API价格算大概值90亿美元,但实际内部成本肯定低得多。我会先打个折:token消...

推荐理由:HKR三项都成立:钩子靠两个夸张的用量数字立住,知识部分有仪表盘截图和token折算,痛点踩在企业最关心的Claude成本控制上。分数维持74,因为数据都是二手转述,正文没给原始数据表,我会先打个折。

最佳拍档

Claude Code 变笨了,Anthropic 复盘出三个 bug

Anthropic 自己复盘了 Claude Code 性能回退的原因,点出三个具体问题:推理强度被改动、缓存优化出了错、系统提示词有长度限制。视频标题只给了这些结论,正文没披露复现步骤、时间线和修复状态。核心看点是 AI 审 AI 代码时,工程约束下容易踩坑——这点先别太激动,信息缺口还很大。

推荐理由:HKR 三项都成立,但正文只给了三个原因分类,没交代复现步骤、时间线或修复状态。Claude Code 相关度高,所以放在 72–77 这个区间。

5月3日星期日

r/LocalLLaMA

开源代理 rosetta-llm 让 Claude Code 能调用任意模型

DataNebula 开源了一个叫 rosetta-llm 的代理,它像一个翻译网关,让 Claude Code 可以跟不同厂商的模型对话。它负责把 Anthropic Messages、OpenAI Chat 和 OpenAI Responses 这三种接口格式互相转换,并且通过 signature 字段把加密的推理过程来回传递,保证多轮对话时不会丢...

推荐理由:这是个 Reddit 开源工具帖,没披露 star 数、实际用量或任何基准测试结果,所以我会先打个折。技术点本身有意思:用 signature 字段回传加密 reasoning,试图保住 thinking block 的保真度,让多轮 agent 的 prompt-cache 不失效——这点如果真跑通了挺省钱。但正文没给出验证数据,也没说支持哪些模型、延迟增加多少,目前只能当个有潜力的工具看,分数停在中等偏上合理。

r/LocalLLaMA

Upskill 开源了一个技能注册表,让 AI 代理动手前先查“说明书”,已收录超 1 万个技能

Autoloops 把 Upskill 做成了开源项目,相当于给 AI 代理配了一本可检索的技能黄页,目前索引了超过 1 万个技能。代理在干活前会先来这里查一下有没有现成的工具或流程可用。搜索靠的是 Postgres 全文检索、1024 维向量匹配,再按收藏数、安装量和反馈做重排序,尽量把靠谱的技能往前排。入库时有专门的对抗性审查,用大模型拦下了几百个...

推荐理由:Autoloops 这个 Upskill 开源项目,本质是给 Agent 配一个可查询的技能黄页,1 万+ 索引量不算大但起步够用。我会先打个折:正文没披露实际检索延迟和重排效果数据,也没说这 1 万+ 技能的质量分布,所以实用性还得看社区后续填充。安全侧的 LLM 对抗审查是个加分项,但拦截几百个技能这个数字本身说明不了漏检率。整体是个方向对、实现也实在的开源工具,Agent 开发者值得关注,但别指望开箱即用。

机器之心 · 公众号

百亿公司 CTO 们集体跳去 Anthropic 当一线工程师

机器之心这篇文章本来想盘点 2025 年 1 月到 2026 年 4 月间,至少六位从 Workday、You.com、Box、Super.com、Adept AI 等公司离职加入 Anthropic 做个人贡献者(IC)的前 CTO,但微信页面被环境异常拦截,正文内容完全看不到。从已有的英文摘要看,核心讨论点不是“为了 AGI 理想”,而是职业杠杆—...

推荐理由:这篇不是产品发布或模型更新,是篇评论,但切入点很巧。它没停留在“为了 AGI 理想”这种公关叙事,而是把重点放在职业杠杆上:当 CTO 不如在 Anthropic 当工程师划算,说明顶级 AI 公司里技术执行者的议价权在涨。我会先打个折,因为正文没给出这些 CTO 具体负责什么、薪资怎么变,但 6 个案例摆在那,趋势信号是清晰的。

新智元 · 公众号

Claude Code 让 Anthropic 两个月收入翻倍,成史上增长最快的 AI 公司

Semi Analysis 的报告说,Anthropic 的年化收入(ARR)已经冲到 440 亿美元,过去 12 个月净增了 350 亿。其中 Claude Code 这个编程助手到 2026 年 2 月,自己就贡献了 25 亿美元的年化收入。推理毛利率也从 38% 涨到了 70% 以上。不过正文因为微信环境异常没抓到具体内容,这些数字背后的客户留存...

推荐理由:我会先打个折——Semi Analysis 的数据不是官方财报,但 440 亿 ARR 和 70% 推理毛利率这两个数如果属实,说明 Anthropic 靠 Claude Code 在企业端收钱的速度比外界想的快得多。文章真正值得盯的不是总盘子有多大,而是三个东西能不能同时成立:企业用量在涨、代码智能体收入在涨、推理毛利也在涨。正文没披露 Claude Code 的客户留存和续费率,这点先别太激动。

新智元 · 公众号

斯坦福团队用 AI 从零设计出全新噬菌体,16 个能感染并杀死大肠杆菌

斯坦福和 Arc 研究所的研究人员用他们训练的模型 Evo,直接生成了 302 个噬菌体基因组,其中 16 个成功感染了大肠杆菌、完成自我复制并最终裂解了宿主细胞。这相当于 AI 不靠自然界已有的病毒模板,凭空造出了能干活的新病毒。Evo 模型基于 StripedHyena 2 架构,一次能处理 100 万个碱基对的长序列。后续的 Evo-Φ69 版本...

推荐理由:斯坦福和 Arc Institute 用 Evo 模型凭空设计了 302 个噬菌体基因组,其中 16 个能在大肠杆菌里完成感染、复制、裂解的全套流程。Evo 2 的 StripedHyena 2 架构把上下文拉到 100 万碱基对,相当于一次能看完一整套细菌基因组。Evo-Φ69 在 6 小时内扩增 16 到 65 倍,这个效率数字说明它不只是能跑,还跑得挺快。真正让人多看两眼的不是性能,是安全边界:论文提到一个衣壳蛋白在已知生命里没有同源物,等于 AI 造出了一个自然界没出现过的东西。这点先别太激动,正文没披露这个蛋白的功能验证到什么程度,也没说...

5月2日星期六

r/LocalLLaMA

Semvec:把聊天记录压成固定大小的“语义状态”,上下文再长也不涨 token

一个开发者在 Reddit 上发了个叫 Semvec 的项目,思路是把对话历史从无限增长的文本流换成固定大小的语义向量,每次推理只传这个压缩后的状态。他给出的 48 轮基准测试里,token 用量大概砍掉了 76%,而且第 10 轮和第 10000 轮的输入开销一样大。项目兼容 OpenAI 接口的模型,也接了 MCP、Claude Code、Curs...

推荐理由:这是个 Reddit 自发布项目,数据来自作者自己的基准,没有第三方验证,所以我会先打个折,不当成行业级事件。但它的思路挺省钱的:用固定大小的语义向量替代无限增长的对话历史,token 减少约 76%,而且第 10 轮和第 10000 轮输入量一样,对跑长链 agent 的人有参考价值。HKR 三项都满足,冲突、数字和治理/竞争伦理的神经都碰到了,只是目前没有裁决或产品级变动,所以保持在 featured 而不是更高优先级。

量子位 · 公众号

苹果官方 App 把 Claude.md 打包进去了,大公司也搞 Vibe Coding?

苹果支持 App 的 5.13 版本在 5 月 1 日上线时,不小心把一个叫 Claude.md 的文件打进了安装包,不到 24 小时就被下架了。这个文件描述了 Juno AI 和人工客服之间怎么通过一个协议层来切换,客户端、AI 助手、人工客服的消息都在同一个流程里处理。正文没披露这个文件到底是怎么跑进正式版本的,但问题核心出在发布审核环节。

推荐理由:HKR 三项都踩中了,但这说到底还是个 App 打包事故,不是模型或平台发布。苹果的体量加上 Claude.md 的细节够得上 featured;正文没披露审查链哪里断了,这点先别太激动。

5月1日星期五

r/LocalLLaMA

研究称大模型更“丧”,小模型反而更“快乐”

Reddit 上有人分享了一份所谓的“AI 幸福感指数”,用 500 段对话去测模型的情绪倾向。结果 Claude Haiku 4.5 的负面回复只占 5%,而 Gemini 3.1 Pro 高达 55%。不过帖子自己也说了,测试集故意塞了很多刁钻的负面对话,不代表日常使用场景。另外,原帖链接点进去直接报 403 错误,看不到原始数据和具体方法,所以这...

推荐理由:我会先打个折:数据来自 Reddit 帖子,测试集故意塞了很多棘手负面对话,5% 和 55% 不代表真实均值。真正值得盯的是指标怎么定义的,而不是“AI 会痛苦”这种标题。帖子没披露评分标准,这点先别太激动。

新智元 · 公众号

拆解 Claude Code:让它好用的 98.4% 是工程,不是 AI

VILA-Lab 把 Claude Code v2.1.88 的 51.2 万行代码扒了一遍,发现真正跟 AI 决策逻辑相关的部分只占 1.6%。剩下 98.4% 全是确定性的工程基础设施:权限控制、上下文管理、工具路由和错误恢复。核心变化不是把提示词写得更长,而是给模型套上了一套好用的“缰绳”。

推荐理由:这篇不是 Anthropic 官方出品,是 VILA-Lab 的逆向分析,所以权威性我会先打个折。但它给的 51.2 万行源码和 1.6%/98.4% 的拆分很具体,对正在搭 agent 的团队来说,比很多公关稿有用——它把“模型强所以产品强”的叙事拉回到工程现实。正文没披露完整复现步骤,这点先别太激动,但判断方向是准的。

机器之心 · 公众号

有人用 API 猜出了 GPT、Claude、Gemini 的参数量,社区吵翻了

Bojie Li 在 arXiv 发了篇论文,用黑盒 API 调用去估算 27 家厂商 188 个模型的参数量。方法叫 IKP,靠 1400 道按生僻程度分了 7 档的题,先在 89 个已知参数量的开源模型上拟合,拟合度 R² 到 0.917。争议点集中在合成数据干扰、MoE 架构影响,以及估算区间太宽——90% 置信区间在 0.3 倍到 3 倍之间,...

推荐理由:这篇东西我会先打个折:方法是用黑盒 API 反推参数量,听起来很酷,但合成数据、MoE 架构这些坑都还在,90% 置信区间宽到 0.3 到 3 倍,说明估算还比较糙。不过它确实把 188 个模型的参数量猜了个遍,R²=0.917 也不算低,对从业者来说是个能引发讨论的参照系。社区争议本身就是信息价值的一部分,所以放在 featured 里合适,但离 P1 还差一口气,因为结论的确定性不够硬。