跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 861–880 条 · 共 1,303 条

6月4日星期四

新智元 · 公众号

Claude Mythos 在 METR 基准上连续跑了 3 小时 6 分钟,比专家预测的年底时间提前了大半年

Anthropic 的 Claude Mythos 在 METR 的自主任务测试里撑了 186 分钟,成功率 80%。这个时长刚好落在专家们之前预测的 3 到 4 小时中位数区间,但预测的时间点是 2026 年底,现在提前到了。正文因为需要验证码没抓到具体细节,不知道任务类型、失败原因和是否有人工干预,所以这个 80% 成功率先打个折看。

推荐理由:这条消息的钩子很直接:预测年底才到的水平,今天就被打出来了。我会先打个折——正文没披露模型规模、任务类型和可复现细节,所以不能当完整评测看。但 80% 成功率加 186 分钟连续跑,对从业者来说是个可感知的信号:agent 的自主时长在拉长,而且比行业预期快。安全焦虑和落地想象空间同时被触发,适合放 featured 位置。

AI HOT 精选

微软 AI 负责人说 Anthropic 模型太贵,正在自己搞更便宜的替代品

微软 AI 负责人 Mustafa Suleyman 公开说 Anthropic 的模型成本太高,公司已经在开发内部替代模型来降本。他没透露具体模型名称、能便宜多少、什么时候上线。这件事的背景是微软一边给 OpenAI 投了几百亿美元,一边还在大量采购别家模型当备选,现在连备选都觉得贵了。正文没披露自研模型是基于开源方案还是完全从头训,也没说性能对标的...

推荐理由:HKR三项都过了。微软点名Anthropic贵,自己下场做便宜替代,这个动作本身就够抓眼球。但正文缺了关键信息——模型叫什么、能便宜多少、什么时候能用,这些都没说,所以分数先打个折,放在featured里偏低的位置。

AI HOT 精选

Anthropic 用 Claude 把 95% 的业务取数需求自动化了,准确率约 95%

Anthropic 公开了他们内部用 Claude 做自助数据分析的整套方案。核心思路是让非技术同事直接用自然语言问业务数据问题,系统自动查表、写 SQL、出结果。他们搭了一个三层架构:底层是数据基础层,负责把分散的业务指标统一成模型能读懂的语义;中间是验证工作流,专门处理模糊提问、过期数据和查不到的情况;上层是技能模块,让 Claude 学会按公司规...

推荐理由:我会先打个折,这是官方博客,数字肯定挑好看的讲。但 95% 自动化加约 95% 准确率,配上数据层、验证和 skills 这套 agentic analytics stack,确实把怎么做说清楚了。没有新模型或产品发布,所以分数在 72–77 这个区间。正文没披露错误类型的具体分布和延迟数据,这点先别太激动。

6月3日星期三

新智元 · 公众号

WSJ 挖出 OpenAI 与 Anthropic 创始人的九年恩怨:Dario Amodei 曾把 Greg Brockman 踢出 ChatGPT 前身项目

这篇来自 WSJ 的报道梳理了 OpenAI 总裁 Greg Brockman 和 Anthropic 联合创始人 Dario Amodei 之间长达九年的矛盾。核心冲突是,在 OpenAI 内部研发一个后来演变成 ChatGPT 的项目时,Dario Amodei 直接禁止 Greg Brockman 参与。文章还提到,Brockman 现在负责 O...

推荐理由:我会先打个折:这不是模型发布或现任高管离职,所以放在 featured 里算合理。但 WSJ 挖出的料够硬——Dario 当年直接不让 Brockman 碰 ChatGPT 的前身,这比普通的口水仗有信息量。后面 Brockman 管了近 1500 人的产品战略,也说明他现在在 OpenAI 的盘子有多大。两条事实一前一后,把两家公司的旧怨和现状串起来了,对关注 AI 公司权力格局的人有参考价值。

AI HOT 精选

ChatGPT 月活用户突破 10 亿,成为史上增长最快的应用

Sensor Tower 估算,ChatGPT 在 5 月全球月活用户跨过 10 亿,只用了大约三年,比 Google Maps、TikTok 和 YouTube 当年冲到这个数字的速度都快。不过,Claude 的增长势头更猛:2026 年第二季度月活 5600 万,同比涨了约 640%,而 ChatGPT 同期增速是 62%。一个值得注意的信号是,在...

推荐理由:这条消息的核心价值在于 Sensor Tower 提供了两个关键产品的用户规模估算,让行业能直观对比 OpenAI 和 Anthropic 的采用速度。我会先打个折,因为这是第三方估算,不是官方数据,但 10 亿月活和 640% 的同比增长仍然是很强的信号。正文没披露统计口径和误差范围,所以不能当精确财报看,但作为竞争格局的参考已经足够。

AI HOT 精选

智能性价比

微软在模型发布卡里加了个新指标:平均 token 用量。他们的新模型在 SWE-Bench Verified 上拿了 71.6 分,但消耗的 token 只有 Claude Haiku 4.5 的三分之一。这意味着现在衡量模型得看两个维度:活儿干得怎么样,以及干这活儿花了多少钱。靠烧 token 刷榜、靠补贴打价格战的时代在翻篇。Uber 四个月烧光预...

推荐理由:H、K、R 三条都站得住。用“跑分除以 token 消耗”当钩子,比单纯报分数更让人想点进去看。71.6 分和三分之一的 token 量是实打实的新信息。不过文章没给出完整的测试配置和具体定价对比,所以重要性停在 78 分,我会先打个折,不往更高拉了。

AI HOT 精选

Claude Code 现在能自己派活给多个子模型,并行干活

Claude Code 新增了动态工作流,核心是让它在运行时执行 JavaScript 文件,按需创建并协调多个子代理(subagent)。每个子代理有自己的上下文窗口,互不干扰,可以同时跑研究、安全分析和代码审查这些任务。官方举的例子是让一个子代理查漏洞、另一个审代码逻辑,主代理最后汇总结果。正文没披露子代理数量上限和额外费用怎么算,这点先别太激动。

推荐理由:HKR 三项全中:Claude Code 用运行时 JS 编排带独立上下文的子代理,这是个实打实的新功能。Anthropic 的品牌有加分,但这次是功能更新而非模型或平台级发布,所以分数落在 78–84 区间。正文没提具体性能数据和价格变化,这点先别太激动。

AI HOT 精选

Claude Code 能按任务自动生成专属工作流了,用 JS 脚本调度子智能体干活

Claude Code 加了一个动态工作流功能,你给它一个任务,它会现场写一段 JavaScript 来指挥多个子智能体分工协作。你可以指定用哪个模型、工作区隔离到什么程度,适合做研究、安全分析、代码审查这类复杂活,写好的工作流还能共享和复用。不过正文没提具体会多烧多少 token,也没说这个功能现在是不是所有人都能用,这点先别太激动。

推荐理由:HKR 三项都过,但文章只给了机制层面的细节,token 增量、推送范围和定价都没提。因为跟 Claude Code 直接相关,所以放在中量级产品更新里偏高的位置。

AI HOT 精选

Alphabet 计划股权融资 800 亿美元,Anthropic 已秘密提交 IPO 申请

两条消息都来自彭博的报道,但原文因为反爬机制没能抓到正文,只留了标题。Alphabet 打算通过股权融资筹集 800 亿美元,用来扩建 AI 基础设施。Anthropic 则已经秘密提交了上市申请。正文没披露估值、上市时间表和承销商这些关键信息,所以这两件事的规模和节奏现在都还看不清。

推荐理由:Anthropic 秘密交表准备上市,这是头部大模型公司里动作最快的一个,但正文没披露估值、时间表、承销商,所以别急着猜它值多少钱。另一边 Alphabet 要融 800 亿美元砸 AI 基建,数字大到能说明这轮算力投入还在加码,不是降温。两条消息合在一起看,一边是模型公司急着进公开市场拿钱,一边是云厂商继续往死里投基础设施,AI 烧钱大战远没到收手的时候。

AI HOT 精选

Claude Platform 推出命令行工具,终端里直接跑 API 和托管智能体

这个 CLI 工具把 Claude Platform 的所有 API 端点都搬到了终端里。你可以直接在命令行调用 Messages API、启动 Claude 托管的智能体,然后把返回结果用管道传给 shell 做后续处理。官方提到,用 Claude Code 这类编码智能体来理解这个 CLI 也没问题。正文没披露性能开销或额外费用,实际用起来会不会增...

推荐理由:Claude Platform CLI 在 HKR 三项上都站得住,是个实用的开发者工具更新。不过公告只给了能力范围,安装流程、权限控制、安全限制和定价都没提,我会先打个折——实际落地好不好用,还得看这些缺口怎么补。

FT · 科技

Anthropic 要把网络安全模型 Mythos 推到 15 个以上的国家

Anthropic 计划将 Mythos 这个专门做网络安全的模型开放给更多地区,覆盖超过 15 个国家,大约 150 家机构会用上。正文被付费墙挡住了,没披露具体是哪些国家、什么时候开始、以及模型本身的技术细节或效果数据。

推荐理由:HKR 三项都过。Mythos 扩张有具体数字和地缘安全话题性,但正文只给了接入范围,没提能力细节、具体国家名单或使用条款,所以放在 featured 低分段。

AI HOT 精选

Claude Code 团队自述:把编程工作默认交给智能体后,我们的流程和分工全变了

Claude Code 的工程主管在 Code w/ Claude SF 2026 活动上分享了团队内部的变化。他们把智能体编程(让模型直接写代码、改代码)设为默认工作方式后,砍掉了传统的详细需求文档,改成“即时规划”——在动手前先让 Claude 收集上下文、理清任务。代码审查环节,Claude 会先过一遍代码风格和测试覆盖,人则把精力集中在法律合规...

推荐理由:这是 Anthropic 自家团队在 Code w/ Claude SF 2026 上的分享,不是模型发布或重大产品更新,所以分数压在 80 分左右。亮点在于他们公开了内部怎么用 Claude Code 干活:规划从提前设计改成即时按需,写代码前先让 Claude 把上下文理一遍,审查环节把风格和测试甩给 Claude,人只做法律和安全判断。这些机制写得实在,没有画饼,对工程团队有直接参考价值。但正文没披露具体效率数据或量化对比,所以别当性能报告看。

r/LocalLLaMA

Reddit 网友在 6GB 显存的笔记本 4050 上跑了 20 个小模型的速度对比

这篇帖子本身被 Reddit 的安全策略拦住了,正文内容没抓到,只留下一个“被网络安全屏蔽”的提示。从标题和已有的英文摘要看,作者用 LM Studio 的接口测了 20 个小模型,统一在 6GB 显存的 RTX 4050 上跑,每个模型在 1k、8k、32k 三种上下文长度下各测了 5 次速度。目前能看到的唯一具体数据是 unsloth/lfm2.5...

推荐理由:我会先打个折,来源是 Reddit 帖子,权威性一般,但内容本身很实在。作者没搞虚的,就是拿 20 个模型在 LM Studio 里用 6GB 4050 实测,把速度、显存占用都列出来。对想本地跑小模型的人来说,这比看论文里的 A100 数据有用得多。正文没披露测试用的量化精度和具体 prompt,这点信息缺口让结论不能直接照搬,但作为一张低显存显卡的参考表,已经够用了。

6月2日星期二

TechCrunch · AI

Anthropic 把 Claude 的安全工具 Mythos 铺到 15 国的关键基础设施,覆盖电力、水务、医疗和通信

Anthropic 正在把自家的安全漏洞项目 Project Glasswing 和模型 Mythos 开放给 15 个国家的 150 家机构,专门盯电力、水务、医疗和通信这些命脉系统。按他们的说法,这些系统一旦被攻击,可能影响上亿人。正文没具体说 Mythos 是直接部署在本地还是通过 API 调用,也没披露这 150 家机构是免费试用还是付费签约,...

推荐理由:HKR 三项全中:规模有、行业有、安全痛点也有。没给更高分是因为正文只说了铺开范围,Mythos 具体怎么控、怎么评、出过什么问题都没提,所以先打个折。

Ben's Bites

Claude Opus 4.8 发布,Claude Code 学会写脚本派子任务并行干活

Anthropic 发了新模型 Claude Opus 4.8,主要卖点是 Claude Code 现在能先写一个调度脚本,再同时拉起多个子代理并行处理复杂任务。不过有开发者提醒,这并不证明松散的 multi-agent 架构靠谱,反而是围绕小代理循环的确定性工作流更稳。模型本身被 Simon Willison 评价为“温和但有用的升级”,更诚实、更少...

推荐理由:HKR 三项都成立,因为这是一次有实质内容的 Anthropic/Claude 发布和 Claude Code 代理更新。文章没给基准测试、定价和上下文窗口数据,所以分数压在 85–94 这个区间。

AI HOT 精选

Anthropic 扩大 Project Glasswing 计划,新增约 150 家关键基础设施机构

Anthropic 把 Project Glasswing 的合作范围从约 50 家扩到约 150 家新机构,覆盖超过 15 个国家,新增了电力、水务、医疗、通信和硬件等关键基础设施行业。这些机构都有一个共同点:一旦代码库被攻破,影响可能超过 1 亿人。前期合作方用 Claude Mythos Preview 已经扫出超过 1 万个高危或严重漏洞,现在...

推荐理由:Anthropic把Project Glasswing铺到约150个新组织,横跨15个以上国家,HKR三项都有实打实的数字和行业支撑。不过正文没披露具体的安全机制或模型能力变化,所以分数就停在featured低段,先别太激动。

r/LocalLLaMA

我把多智能体调度器里的 Claude 换成本地 Qwen3.6-27B,跑了两个星期

作者用一张 RTX 3090 跑 Qwen3.6-27B,在 47 个多步骤编程工作流里顶替 Claude 试了两周。计划生成的结构合规率大约 95%,但工具调用格式错误率有 12% 左右,而且上下文一超过约 12k token,实际表现就开始明显下滑。正文没披露具体任务难度和对比基准,所以 95% 这个数只能当个参考,别直接当成“接近 Claude”...

推荐理由:这篇值得看,因为它是真人两周实测,不是跑分。作者用一张消费级显卡把 Qwen3.6-27B 塞进多智能体编排里,替换 Claude,给出了能用的上限和会翻车的点。95% schema 合规听着不错,但 12% 工具调用格式错误意味着每八九次就有一次格式炸了,生产环境还得加校验层。长上下文到 12k tokens 就吃力,复杂任务得拆。正文没披露延迟数据和总 token 消耗,这点先别急着算成本账。整体是份诚实的工程笔记,不是公关稿。

FT · 科技

头部 AI 实验室开始正经研究机器有没有“意识”

Google DeepMind、Anthropic 和 Meta 都在研究 AI 能不能产生意识,以及这对人意味着什么。但正文被付费墙挡了,没披露具体用什么方法、有没有时间表、怎么才算“有意识”的评判标准。

推荐理由:我会先打个折:标题很抓人,但正文几乎没给干货。三家大厂在研究 AI 会不会产生意识,这确实是个能吵起来的话题,安全和对齐方向的人都会关注。可文章没披露他们怎么定义“意识”、用什么实验验证、有没有阶段性结论,连时间表都没有。所以这条只能当个信号看,别太激动。基于信息缺口,重要性停在 72,放在 featured 里提醒大家有这么个动向就够了。

新智元 · 公众号

教皇与Anthropic联合预警:2030年通用人工智能降临,人类自救窗口只剩三年

这篇文章本身因为微信环境验证问题,正文内容没能抓取到,所以下面这些判断只能基于标题和摘要来聊。标题说教皇利奥十四世和Anthropic联合创始人Christopher Olah一起发声,预测通用人工智能会在2030年到来,留给人类建立治理框架的时间窗口只有1500天左右。他们提议搞一个类似反洗钱金融行动特别工作组(FATF)的国际审计框架来监管AI。这...

推荐理由:我会先打个折:这不是模型发布也不是硬政策,更像一次高规格的治理喊话和路线图吹风。但它的信息钩子很清晰——2030年AGI、1500天窗口、FATF式审计框架,这些数字和机制让讨论有了抓手,不是空谈。正文没披露具体的技术验证或政策落地细节,所以激动归激动,先别当既定事实看。整体属于值得从业者扫一眼的治理信号,放在featured低位合理。

AI HOT 精选

Anthropic 开发者公开了一套 Claude Code 工作流,核心是让 AI 当老师逼你真正搞懂代码,而不是只点“同意”

这套流程把 Claude Code 定位成“高效又聪明的老师”,目标不是替你写完代码,而是确保你能把问题、方案和影响讲清楚、辩得动。它沿着问题域、方案域和语境域三条线,拆成 8 个可执行步骤,用增量教学、用户复述、清单加测验的方式,在进入下一步前先确认你真的懂了。这么设计是为了对抗长会话里人慢慢变成“审批按钮”的问题,强制把决策上下文沉淀下来,让理解过...

推荐理由:我会先打个折:这不是产品发布,是一篇实操分享,所以放在 featured 低位。HKR 三项都踩实了——钩子把“人变按钮”这个痛点讲得很透,知识部分有 8 步工作流和验证循环,相关性直击开发者对 agent 失控的担忧。正文没披露这套流程在复杂项目里的失败率,这点先别太激动,但作为可落地的教程,信息密度够。