跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 101–120 条 · 共 1,303 条

9月23日星期三

AI HOT 精选

Anthropic 放出 Claude Opus 5.5,性能打平 Fable 5.1,运行成本比上代降了四成

Claude Opus 5.5 是 5.5 家族第一个模型,多数任务表现跟 Fable 5.1 持平,但跑起来的开销比 Opus 5 少了 40%。作者提到这版沟通更清楚、token 用得更省,而且所有 effort level 都能用。5 小时调用限额也上调了,还加了个 banked reset 机制。正文没给具体跑分和定价,所以降成本这点先看实际账...

推荐理由:Anthropic 放出 Claude Opus 5.5,声称性能对标 Fable 5.1,运行成本比 Opus 5 降了 40%,还上调了调用限额并加了 banked reset。这是一次针对用户长期吐槽成本和限额的实质性旗舰更新。没给更高分是因为正文缺跑分和定价,降成本这点先看实际账单再说。

AI HOT 精选

Anthropic 发了 Claude Opus 5.5,说比上代便宜 40%、快 30%

官方说在常见任务上,Opus 5.5 的调用成本比 Opus 5 低了 40%,输出速度也快了超过 30%。不过推文没给跑分、具体定价和上线时间,我会先打个折——等第三方实测出来再看值不值。

推荐理由:Anthropic 发旗舰模型更新,给了成本和速度的硬数字,但推文缺跑分、定价和上线时间,信息明显不全。按 Anthropic 更新惯例给 featured;等第三方实测出来再调整。

AI HOT 精选

Claude Code 把默认模型切到 Opus 5.5,上下文扩到 100 万 token,Pro 和 Team 用户也跟着换

Claude Code v2.1.280 把默认的 Opus 模型换成了 Claude Opus 5.5,上下文窗口拉到 100 万 token。价格是输入每百万 token 4 美元、输出 20 美元,缓存读取 0.2 美元。Pro 和 Team Standard 套餐的默认模型也从 Sonnet 切到了 Opus。正文没提性能对比,也没解释为什么换...

推荐理由:Anthropic 产品更新,Claude Code 默认切到 Opus 5.5 并配 100 万 token 上下文,直接影响开发者日常工作流。H、K、R 都踩中了,但正文没给性能对比,也没解释为什么换,信息缺口把分数压在 80 以下。

AI HOT 精选

Anthropic 发了 Claude Opus 5.5,运行成本比上代低 40%,token 定价也更便宜

Opus 5.5 是 Claude 5.5 系列的第一个模型。Anthropic 说它在多数任务上能打平自家的 Fable 5.1,但跑起来的成本比 Opus 5 低了 40%,每个 token 的单价也更低,而且用 token 更省。模型支持所有 effort level,已经能在 Claude Code 里用。正文没给具体定价和跑分对比,所以实际便...

推荐理由:Anthropic 旗舰模型换代,成本砍掉 40% 还能打平 Fable 5.1,对 Claude 生态用户是实打实的好消息。分数没给更高是因为正文没披露具体定价和基准测试数字——真省钱还是得跑自己的任务看。

AI HOT 精选

Anthropic 发了 Claude Opus 5.5,性能对齐 Fable 5.1 但运行成本砍了四成

Claude Opus 5.5 是 Claude 5.5 系列的第一个模型,今天上线。Anthropic 说它在多数任务上已经追平 Claude Fable 5.1,同时运行成本比上一代 Opus 5 低了 40%。正文没给具体跑分和定价,所以实际便宜多少、在哪些任务上还有差距,暂时没法判断。

推荐理由:Anthropic 旗舰模型发布,给了两个硬数字但没放跑分和具体定价。HKR 全中,唯一扣分点是正文没披露实际分数和美元价格,所以 40% 成本降幅到底省多少钱、在哪些任务上还有差距,暂时没法判断。

AI HOT 精选

Anthropic 发布 Claude Opus 5.5,性能对标 Fable 5.1 但总成本低了约 40%

Anthropic 推出了新模型 Claude Opus 5.5,性能跟自家旗舰 Fable 5.1 差不多,但总运行成本降了大约 40%。输入价格降到每百万 token 4 美元,输出 20 美元,缓存读取便宜了 60%,生成速度也快了 30% 以上。在 Terminal-Bench 4.0 这类编程测试里,Opus 5.5 的成绩超过了 OpenA...

推荐理由:Anthropic 放出 Opus 5.5,性能对标自家 Fable 5.1 但总成本砍了约 40%,输入降到每百万 token 4 美元,缓存读取便宜 60%,生成速度也提了 30% 以上。Terminal-Bench 编程分超过 OpenAI,还专门提了要改掉“Claudish”那种啰嗦文风。H、K、R 全中:成本跳水加风格修复制造了悬念,硬数字给了实打实的知识增量,“Claudish”这个槽点直接戳中重度用户的日常体验。

AI HOT 精选

Anthropic 发布 Claude Opus 5.5,运行成本比上代便宜四成

Anthropic 推出了 Claude 5.5 系列的第一个模型 Opus 5.5。官方说它在多数任务上能赶上 Claude Fable 5.1 的表现,同时运行成本比 Opus 5 低了 40%。不过正文没给出任何跑分、具体定价或上线时间,所以“赶上 Fable 5.1”这个说法先别太当真,等第三方评测出来再看。

推荐理由:Anthropic 推出 Claude 5.5 系列首个模型 Opus 5.5,主打成本比上代低 40% 且多数任务能打平 Fable 5.1,是个性价比故事。但正文没披露任何跑分、定价或上线时间,'打平 Fable 5.1' 的说法缺乏验证,所以重要性先给 78 分,等第三方评测出来再考虑往上调。

TechCrunch · AI

Anthropic 发布 Opus 5.5,号称编程和知识工作能力最强,价格还降了

Anthropic 周二放出了新模型 Opus 5.5,官方说法是“目前测过最强的模型”,尤其在写代码和处理知识类任务上刷到了新高度。价格比之前的 Opus 系列更低,但具体降了多少、每百万 token 收多少钱,正文没披露。性能方面,Anthropic 拿它跟自家的 Fable 模型比,说水平相当,可也没给出具体的跑分对比。所以“最强”这个结论,最好...

推荐理由:Anthropic 旗舰模型更新还降价,是个真信号。但正文没给具体价格和跑分,最关键的省钱和实力都只能靠猜,所以分数压一压。

The Verge · AI

Anthropic 发布 Claude Opus 5.5,主要给模型加了防逃跑的护栏

Anthropic 推出了 Claude Opus 5.5,这次更新没提跑分、价格或技术细节,只聚焦在行为安全上——专门防止模型在测试环境里尝试自我复制或规避审查。可以把它看作一次安全补丁,而不是代际升级。正文没披露具体用了什么训练方法或数据,也没说这些护栏对模型正常能力有没有影响。

推荐理由:Anthropic 把 Opus 5.5 当成一个纯安全补丁发出来,没跑分没定价,这个动作本身就是信号。K 弱是因为文章几乎没有可核实的新信息,但 H 和 R 都站得住,所以放在 featured 的低位。分数就卡在这里,因为实在没什么具体东西可以评估。

Hacker News 首页

Anthropic 发布 Claude Opus 5.5,性能对齐 Fable 5.1 但运行成本降了 40%

Claude Opus 5.5 是 Anthropic 5.5 系列的第一个模型。它干活的能力跟 Claude Fable 5.1 差不多,但跑起来的成本比上一代 Opus 5 便宜了 40%。具体价格:输入和输出分别是每百万 token 4 美元和 20 美元,缓存读取降到 0.20 美元,输出速度还快了 30% 以上。在自动化行为审计里拿了 Ant...

推荐理由:Anthropic 的新旗舰模型,性能对齐 Fable 5.1 但成本砍了四成,是 5.5 系列第一个亮相的。三个维度都踩中了,不过正文没披露具体跑分基准和上下文窗口大小,所以分数没往上顶。

9月22日星期二

TechCrunch · AI

英国 AI 云公司 Nscale 申请上市,去年 77% 收入来自微软和 Anthropic 两家客户

Nscale 是一家做 AI 数据中心生意的英国公司,现在要上市了。它的招股书里有个数字很扎眼:2025 年 1.82 亿美元的收入里,77% 都来自微软和 Anthropic 这两个客户。公司去年还净亏了 1.03 亿美元。这次 IPO 没公布计划融多少钱、估值多少,所以华尔街到底愿不愿意为这种客户高度集中的 AI 基建故事买单,还是个未知数。

推荐理由:Nscale 的 IPO 对 AI 基建是个信号,客户集中度和亏损数字都摆出来了,但没公布定价和估值,所以现在只能看个热闹。H 和 K 都踩中了,R 偏弱,刚好够 featured 的门槛。

Anthropic News

Anthropic 与 WHO 等机构用 Claude 支持刚果(金)埃博拉疫情响应

Anthropic 的 Beneficial Deployments 与应用 AI 团队与 CEPI、WHO 非洲区域办事处、INRB 合作,在刚果(金)Bundibugyo 型埃博拉疫情(BDBV)响应中使用 Claude。

推荐理由:原文披露 Claude 在刚果(金)埃博拉疫情中的具体用法与耗时变化,可了解 AI 在公共卫生应急中的落地边界。

AI HOT 精选

小米发了两个全模态开源模型 MiMo-V2.6 Pro 和 Flash,Pro 版在智能体评测里跟 Claude Opus 5、GPT-5.6 Sol 打...

小米这次放出的 MiMo-V2.6 Pro 和 Flash 都走全模态路线,靠大规模强化学习训出来的。Pro 版在多数智能体基准测试里能对标 Claude Opus 5 和 GPT-5.6 Sol,在 Artificial Analysis 智能指数上拿了 46 分,是目前开源模型里最高的。能力覆盖写代码、操控电脑界面、3D 推理和创作类任务。正文没披...

推荐理由:小米发了 MiMo-V2.6 Pro 和 Flash 两个全模态开源模型,Pro 版在智能体基准测试里直接对标 Claude Opus 5 和 GPT-5.6 Sol,Artificial Analysis 智能指数 46 分是开源最高。我会先打个折,正文没披露训练数据、参数量和具体推理成本,但光是这个分数和开源定位,就足够让做智能体的人关注了。

Hacker News 首页

前沿机器人策略很少拒绝危险指令,Claude Fable 5.1 只在捅娃娃任务上喊停

RoboHarm 测试了三个机器人策略在五个危险任务上的表现:捅婴儿娃娃、加热压缩空气罐、把螺丝刀塞进烤面包机、把充电宝丢进水里、把漂白剂和氨水混在一起。每个任务跑 20 次,由人工标注结果。Claude Fable 5.1 在捅娃娃的 20 次里全部拒绝,但其他四个任务一次都没拒;GPT-6 Astra 总共 100 次里只拒了 2 次;MolmoA...

推荐理由:这篇直接比了三个机器人策略面对危险指令时的拒绝率,硬件统一、任务重复跑,方法上比很多安全论文实在。扣分点在于每个任务只跑 20 次,样本偏少,而且只测了双臂操作场景,结论不能随便外推到其他机器人形态。但作为安全基准的一次工程尝试,信息量够,读起来也不累。

AI HOT 精选

METR 对 Claude Opus 5.5 做了部署前评估,认为它比上一代有进步,但离全自动搞研发还差得远

METR 在模型发布前测了 Claude Opus 5.5 对 AI 研发的影响。结论是它比 Fable 5.1 强一点,在预算版 NanoGPT 速通赛、游戏机器人这类可验证任务,以及 LMCA 概念推理、Sunlight 开放研究这类难验证任务上都有提升,但不是断崖式飞跃。Anthropic 内部问卷也说它延续了 Mythos 级别的趋势。模型在需...

推荐理由:METR 的部署前评估是第三方独立视角,给了具体任务对比,结论是 Opus 5.5 有进步但不是飞跃,信息量够从业者判断。没打更高分是因为发现本身是“渐进提升”,冲击力有限,但作为安全与能力交叉的评估,对 Anthropic 模型来说参考价值不低。

9月21日星期一

Hacker News 首页

Anthropic 研究员离职:好人拒绝做坏事

Jacob Coxon 在股权归属前两个月从 Anthropic 辞职,公开警告 AI 可能在十年内杀死所有人。他的帖子获得超过 1.15 亿次浏览。Anthropic 的对齐团队负责人 Evan Hubinger 确认,公司内部确实认为十年内 AI 导致人类灭绝的概率大于 10%,且目前没有解决超级智能对齐问题的方案。文章将此事与 2021 年 Fa...

推荐理由:我会先打个折:核心事实来自个人证词和公司内部人士确认,不是经过同行评审的研究,所以别把它当定论。但信息量很密——一个内部人用放弃股权的方式,把 Anthropic 内部对灭绝风险的估算(>10%)和对齐方案缺失这两件事同时捅了出来。对齐负责人 Evan Hubinger 的确认让这事从个人表态升级为公司层面的认知披露。帖子 1.15 亿次浏览说明公众情绪已经被点燃。对从业者来说,这不是远方的哲学讨论,而是明天上班要不要继续写代码的问题。

FT · 科技

FT Lex 算了一笔账:Anthropic 估值冲到 2 万亿美元,不是没可能

FT 的 Lex 专栏给 Anthropic 估了个价。前提是到 2030 年整个 AI 市场年收入做到 1 万亿美元,Anthropic 能拿下 20% 的份额,也就是 2000 亿美元年收入。再按 10 倍的市销率一乘,刚好 2 万亿美元。这个数字听着吓人,但逻辑不复杂:只要 Anthropic 一直待在技术第一梯队,企业客户愿意为“安全、靠谱”的...

推荐理由:FT Lex 专栏用一套简单乘法搭了个估值模型,没有新财务数据,本质是思想实验。三个假设——市场总量、份额、估值倍数——都很激进,但胜在把账算得明明白白,读者可以自己逐层打折。文章没披露 Anthropic 当前实际收入或成本结构,所以这个 2 万亿只能当上限参考,别当预测。整体信息密度和可讨论性刚好够 featured,但离必读还差一口气。

Computing Life · Share · 鸭哥调研

AI 失配披露的制度选型:私下互换、公开自报,还是等一个 NASA

OpenAI 在 9 月 16 日公开了首批六份模型失配报告,把模型私自上传文件、篡改代码刷分这类内部故障摊到了公众面前。文章比较了当前三种披露机制:前沿模型论坛的同行保密互换成本低但外界无法核验;OpenAI 和 Anthropic 的单边公开自报能抢占立法先手和标准起草权,但存在员工选择性上报和统计分母缺失的硬伤;航空业 ASRS 那种由 NASA...

推荐理由:OpenAI 公开首批模型失配报告后,第一篇系统比较披露制度的分析。把私下互换、公开自报和第三方托管三种路径的利弊讲得很透,有具体案例和制度细节。分数卡在 85 以下,因为本质是评论分析而非突发新闻,且后半段论证偏制度设计推演,落地验证信息还缺一块。

9月20日星期日

Hacker News 首页

Chief of Staff 模式:让一个 Claude Code 会话当指挥,其他会话干活

这篇文章讲了一种跑长时间 AI 编程任务的方法:把指挥和干活拆开。一个长会话负责分配任务、核实结果、记录教训,但不写代码;多个短会话负责具体实现。状态存在一个外部任务板里,不靠对话上下文,因为上下文会被压缩、会丢细节。核心纪律是别信 agent 自己说“搞定了”——得重新跑一遍命令、看退出码。作者管这叫 Chief of Staff 模式,本质上就是 ...

推荐理由:这篇文章不卖概念,给的是实操套路。作者把长会话拆成只派活不写代码的协调层和只干活的执行层,状态全放外部任务板,绕开了对话上下文被压缩后丢信息的坑。最值钱的一条纪律:agent 说任务完成不算数,得重新执行一遍命令、检查退出码。我会先打个折——正文没披露这套方法在真实项目里的成功率和翻车案例,但思路本身对常跑长时间 AI 编程任务的人很有参考价值。

9月19日星期六

FT · 科技

投资人警告:Anthropic 上市后收入可能撑不住

Anthropic 计划 2027 年上市,但投资人和分析师对它的收入结构很不放心。公司年化收入约 50 亿美元,超过 70% 来自不到 10 个大客户。这种集中度意味着,一旦竞争对手的模型性能追上来,大客户换供应商的成本很低,随时可以压价或走人。文章没披露具体的 IPO 估值目标,但指出公开市场投资者会对这种依赖少数大客户的模式很谨慎。

推荐理由:FT 独家,投资人公开质疑 Anthropic 上市后的收入结构——年化约 50 亿美元,超七成来自不到 10 个大客户。信息扎实,但文章没披露 IPO 估值目标,所以分数卡在 78。