跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 961–980 条 · 共 1,303 条

5月22日星期五

彭博科技

五角大楼拉上 25 个内部用户,实测 OpenAI 和 Google 的模型,准备找 Anthropic 的替代品

五角大楼正在让 25 个部门里的“高级用户”同时测试 OpenAI 和 Google 的 AI 模型,目的是给目前用的 Anthropic Claude 找个备胎。一位高级国防官员透露了这个消息,但具体在测哪些模型、用什么标准打分、以及什么时候会正式切换,正文都没说。我会先打个折:这更像是一次早期的内部摸底,离真正换供应商还有距离。

推荐理由:Bloomberg 的信源加上五角大楼实测竞品,HKR 三项都站得住。正文没公布候选模型名单、合同金额和时间表,所以重要性我给打个折,刚好卡在 featured 门槛上。

5月21日星期四

AI HOT 精选

Anthropic 快成第一家赚钱的 AI 实验室了,二季度预计营收 109 亿、运营利润 5.59 亿美元

华尔街日报的消息,Anthropic 二季度营收预计冲到 109 亿美元,同比增长 130%,运营利润约 5.59 亿美元,比它自己去年说的 2028 年前不盈利提前了不少。增长主要靠两件事:一是编程工具被大量公司用起来,二是 Claude 开始接那种能自己跑一段时间的“干活型”任务,需求大到算力一度不够用,逼着 Anthropic 去签新数据中心合同...

推荐理由:这条消息的钩子很清晰:Anthropic可能要成为第一个赚钱的头部AI实验室了。给出的数字挺吓人,单季营收109亿,运营利润5.59亿,如果属实,说明卖模型服务真的能跑通。但我会先打个折,因为这只是《华尔街日报》根据预测数据做的报道,不是官方审计后的财报,正文也没披露成本结构里算力烧了多少、企业客户贡献了多少。这点先别太激动,等正式文件出来再看。不过,光是“盈利”这两个字就足够让整个行业讨论一阵子了,所以优先级给到p1,重要性88分。

MIT Technology Review · AI

Anthropic 在伦敦办了一场开发者大会,近半数人举手说上周刚发过完全由 Claude 写的代码,而且很多人没看就直接上线了

Anthropic 在伦敦的 Code with Claude 大会上展示了一个趋势:开发者越来越愿意把写代码的活直接交给 AI。工程师 Jeremy Hadfield 在现场问谁上周发过完全由 Claude 写的 pull request(提交审核的代码改动),近一半人举手;再问谁没读代码就直接发了,大部分手还举着。Anthropic 说公司内部大部...

推荐理由:这篇 MIT Tech Review 的现场报道不是产品发布稿,但抓到了一个很实的信号:开发者已经在把 Claude 写的代码直接往仓库里合,而且不少人连看都不看。我会先打个折,这个数字来自活动现场举手统计,样本量和代表性都有限,不能直接推成行业常态。但“近一半”这个比例还是够高,说明在重度用户里,对 AI 代码的信任已经跨过了一道心理门槛。文章没给 PR 的复杂度或后续回滚率,这点信息缺口让判断只能停在“行为在发生”而不是“行为没问题”。整体适合放进 featured,因为它比功能更新更能让人停下来想一下自己的工作流。

The Verge · AI

SpaceX IPO 文件曝光:Anthropic 每月花 12.5 亿美元租用马斯克的数据中心,一年就是 150 亿

SpaceX 在 S-1 上市申请里写明了这笔交易的价码:Anthropic 每月要付 12.5 亿美元,一直付到 2029 年 5 月,用来使用位于孟菲斯的 Colossus I 和 Colossus II 两座 AI 训练中心。一年算下来就是 150 亿美元,这个数字快赶上 SpaceX 2025 年全年 187 亿美元收入的两倍了。合同里还藏了一...

推荐理由:我会先打个折:150 亿美元是年化数字,实际是按月付 12.5 亿,合同到 2029 年 5 月。但即便这样,这笔钱也大到离谱,相当于 Anthropic 把训练算力的命脉交到了马斯克手里。S-1 文件是 SpaceX 上市披露,可信度没问题。正文没披露 Anthropic 具体拿多少 GPU、训练什么模型,但 Colossus I 和 II 是孟菲斯新建的超大规模训练中心,说明 Anthropic 在算力上下了重注。这点先别太激动,合同细节比如是否有退出条款、算力规格都没说,但光这个金额和合作方组合,就值得今天写。

新智元 · 公众号

Anthropic 买下 SDK 工具商 Stainless,OpenAI 等客户得自己维护代码库了

Anthropic 把 Stainless 给收购了。Stainless 是一家专门帮公司自动生成和维护 API 的 SDK(软件开发工具包)的公司,OpenAI、Meta、Cloudflare 之前都是它的客户。收购之后,Stainless 会关掉它的托管产品,也不再给老客户提供后续支持。不过,之前已经生成的 SDK 代码所有权还归客户自己,只是后续...

推荐理由:我会先打个折:这不是模型发布或核心能力更新,所以分数不会顶满。但 Anthropic 这手挺狠,Stainless 是给 API 自动生成 SDK 的,全球据说四分之一开发者都在用,客户包括 OpenAI 和 Meta。收购后 Anthropic 直接要把托管产品关停,等于断了竞争对手一条现成的开发者工具链。正文没披露收购金额和具体关停时间表,但光是“断供 OpenAI”这个动作,就够让依赖这套工具的团队紧张一阵了。

r/LocalLLaMA

用 API 原生结构约束替代提示词校验,Claude 输出解析成功率从 65% 跳到 90%+

一位 Reddit 用户对比了两种让 Claude 稳定输出结构化数据的方法。靠提示词描述格式再事后用正则或 JSON 解析(方案 A),首次解析成功率只有 65%–70%;换成直接调用 tool_use 功能,用强类型 schema、枚举值约束和分步校验(方案 B),成功率拉到 90%–95% 以上。方案 B 的原理是让 API 在模型生成前就卡死输...

推荐理由:我会先打个折:数据来自 Reddit 个人测试,样本量和具体任务都没披露,不能当正式基准看。但 hook 很清晰——从提示词正则校验换成 schema 强制输出,首轮解析率从 65–70% 拉到 90–95%+,说明让模型按类型 schema 直接吐结果比事后用正则捞靠谱得多。这点先别太激动,正文没交代测试条件,但方向对工程选型有参考价值,所以给 featured 低档。

FT · 科技

Anthropic 快要有第一个赚钱的季度了

FT 的付费墙把具体数字全挡住了,正文没披露是哪个季度、营收多少、利润多少、按什么会计准则算的。标题说 Anthropic 即将实现首次季度盈利,比 OpenAI 和 xAI 都早一步。但看不到细节,这点先别太激动——不知道是运营利润还是算上了投资收益,也不知道收入是靠 API 调用还是靠企业大单撑起来的。

推荐理由:我会先打个折:正文只说了“有望”,没披露是哪个季度、赚了多少、营收规模多大,所以这更像一个方向性信号而不是实锤。但信号本身够尖锐——Anthropic 如果真比 OpenAI 和 xAI 先盈利,说明它在企业客户和 API 收入上可能跑得更务实,烧钱换规模的节奏也可能更克制。这点先别太激动,等具体财报出来再看是运营利润还是调整后的数字。

TechCrunch · AI

Anthropic 告诉投资人,下季度收入将翻倍到约 109 亿美元,并首次实现运营盈利

Anthropic 在最近一轮融资中向投资人透露,今年第二季度收入预计冲到 109 亿美元左右,比上一季翻了一倍多,而且会第一次交出运营利润。这是个重要节点,也让它跟 OpenAI 的竞争更有看头。不过先别太激动——《华尔街日报》的报道提到,因为后续算力开销太大,Anthropic 今年未必能一直保持盈利。正文没披露具体的利润率或成本结构,所以这个“盈...

推荐理由:标题说 Anthropic 快要有第一个盈利季度了,正文补了一句 Q2 营收会翻倍到 109 亿美元左右。我会先打个折:正文没写利润率,也没说成本结构,所以盈利是运营利润还是调整后的数字,不知道。这点先别太激动。但营收翻倍本身说明客户在买单,不是只靠融资撑着。对从业者来说,这比任何 benchmark 刷榜都更能说明模型有没有商业价值。

AI HOT 精选

SpaceX 开始卖 AI 算力,已签下 Anthropic,还在谈更多客户

马斯克发推说 SpaceX 正在大规模提供 AI 算力服务,Anthropic 是已公开的客户,同时还在跟其他公司谈。推文提到未来会通过轨道数据中心把规模做得极大,但没给时间表、具体算力规格和部署方案。我会先打个折:轨道数据中心这事目前只是远期设想,正文没披露任何技术验证或发射计划,短期内能落地的还是地面算力。

推荐理由:HKR 三项都成立:SpaceX 和 Anthropic 的组合本身就自带流量,算力合作的消息也够新。但正文只给了一句话,没披露轨道数据中心的具体规模、价格或时间表,信息缺口很大,所以分数卡在 72–77 这个区间。

彭博科技

Anthropic 要在三年内付给 SpaceX 近 450 亿美元,买算力跑 Claude

根据一份证券文件,Anthropic 跟马斯克的 SpaceX 签了份大单:未来三年支付差不多 450 亿美元,换取计算资源来支撑它的 Claude 模型。这笔钱摊下来每年约 150 亿美元,说明头部 AI 公司抢算力的成本已经拉到天文数字级别。不过正文被 Bloomberg 的机器人验证挡住了,具体是租 GPU 还是包数据中心、交付节奏和退出条款都没披露。

推荐理由:我会先打个折:450 亿美元是三年总承诺,不是一次性付款,但数字大到足以让任何 AI 公司重新算账。Anthropic 把算力押在 SpaceX 身上,说明它不想只靠 AWS 或 Google Cloud,分散供应商是明牌。不过正文没披露具体算力规格、交付时间表,也没说 SpaceX 的算力基础设施到底建到什么程度,这点先别太激动。Bloomberg 拿证券文件报出来,可信度比 PR 稿高,值得写。

r/LocalLLaMA

HalBench 基准测试:用 3200 个带坑问题测了 4 个头部模型,看谁更会拒绝瞎编

一位开发者自己搭了个叫 HalBench 的测试,专门看模型在遇到“前提本身是错的”的问题时,是会顺着瞎编(谄媚)还是直接指出问题。他拿 3200 个这种带坑提示词跑了 4 个模型:Sonnet 4.6 平均分 0.565 排第一,最敢反驳;Gemini 3.1 Pro 0.339 垫底,更容易顺着错误前提往下编。分数越高,代表模型越能识别出问题里的假...

推荐理由:HKR 三项都成立:HalBench 有个清晰的定制评测钩子,3200 条提示加分数,话题踩在模型信任和安全评测的痛点上。来源只有 Reddit 一个帖子,基准本身也没经过外部验证,所以放在低 featured 档。

TechCrunch · AI

Anthropic 每月要付给 xAI 12.5 亿美元买算力

Anthropic 租下了 xAI 在孟菲斯 Colossus 1 数据中心的全部算力,每月账单 12.5 亿美元,合同签到 2029 年 5 月。头两个月有折扣,因为 xAI 那边还在爬坡。这笔钱来自 SpaceX 的上市文件,xAI 自己说这是在把闲置算力变现。说白了,Grok 用户量最近掉得厉害,服务器空出来了,正好租给竞争对手回血。不过正文没披...

推荐理由:TechCrunch 爆出 Anthropic 每月要给 xAI 付 12.5 亿美元买算力,对手方和价格都挺意外。正文只给了金额,没写买了多少卡、签了多久、跑在什么环境里,所以信息缺口不小。我会先打个折:金额够大,但缺关键细节,没法给到 90 分以上。

彭博科技

Anthropic 快实现首次季度盈利了,靠的是 AI 软件需求拉高收入

彭博这条消息说 Anthropic 正朝着公司第一个盈利的季度迈进,主要驱动力是市场对它的 AI 软件需求猛涨。不过正文被付费墙挡了,没披露具体收入规模、利润区间,也没说是哪个季度。我会先打个折:盈利趋势是真的,但数字和细节都看不到,这点先别太激动。

推荐理由:我会先打个折:正文没给具体数字,营收多少、利润多少、哪个季度都不清楚,所以这条消息更像一个方向性信号,不是实锤。但 Bloomberg 的报道本身有信息量——Anthropic 靠卖 AI 软件把营收拉起来了,可能第一次不亏钱。这对一直烧钱的 AI 实验室来说是个转折点,从业者会盯着后续财报验证。

5月20日星期三

AI 群聊日报

Karpathy 加入 Anthropic 预训练团队,Google I/O 发布 Gemini 3.5 Flash 并给 Vertex AI 改名

今天最炸裂的消息是 Karpathy 宣布加入 Anthropic 预训练团队。群友分析,他先后拒绝回 Tesla 和加入导师的 world model 项目,唯独选了这里,说明大语言模型可能真要有新突破了。另一件大事是 Anthropic 收购 Stainless 后直接关停其托管服务,切断了 OpenAI 的 SDK 同步管道,群友把这叫“基础设施...

推荐理由:这是群聊日报的二手消息汇总,没有给出原始链接、具体任命细节或产品参数。Karpathy 去 Anthropic 这事我会先打个折,等官方确认再激动。Gemini 3.5 Flash 和 100 美元订阅档位正文没披露性能数据和权益清单,只能当个风向标看。整体信息量够上推荐,但可信度和细节都偏弱,所以放在 featured 的低分段。

AI HOT 精选

大模型 API 的补贴期结束了,三家厂商开始涨价

Tomasz Tunguz 对比了 Google、OpenAI 和 Anthropic 三家最新旗舰模型的 API 定价,发现补贴正在退潮。Google Gemini 3.1 Pro 最便宜,输入每百万 token 2 美元、输出 12 美元;OpenAI GPT-5.5 短暂补贴后涨到输入 5 美元、输出 30 美元;Anthropic Claude...

推荐理由:Tom Tunguz 这篇是定价评论,不是模型首发新闻,但三家旗舰模型的价格摆在一起,差距够大,对从业者选型有参考价值。我会先打个折,给 featured 而不是 must-write,因为正文没披露补贴具体怎么算、能撑多久,判断还缺一手数据。

AI HOT 精选

Anthropic 找宗教和哲学学者聊 AI 的道德养成,并给 Claude 加了个“良心提醒”工具

Anthropic 启动了一个对话项目,跟超过 15 种宗教、哲学和跨文化传统的学者、神职人员聊前沿 AI 的道德问题。他们不是要让模型信某个教,而是想借鉴这些领域里关于“好品格是怎么养成的”长期思考,来改进 Claude 的宪法和训练方式。一个直接产出是:他们给 Claude 装了一个能在任务中途主动调用的工具,用来提醒它自己的伦理承诺。内部测试里,...

推荐理由:Anthropic 这次没发模型,而是拉了一群宗教、哲学和跨文化传统的学者来讨论前沿 AI 该有什么价值观,同时测了一个伦理承诺提醒工具,看能不能让 Claude 少跑偏。我会先打个折:正文没披露这个工具到底降低了多少不对齐行为,也没说对 Claude 产品本身有什么改动,所以效果还看不清。但选题本身挺刁钻,不是那种换个说法重讲安全的稿子,对从业者来说能戳中价值观和边界感的神经。

FT · 科技

Google 要出智能眼镜,还会在搜索引擎里塞进 AI 代理

Google 准备发布智能眼镜,同时给搜索引擎加上 AI 代理功能。CEO Sundar Pichai 说这些功能靠新的 Gemini 模型驱动,目标是缩小跟 Anthropic 和 OpenAI 的差距。不过这篇付费墙后面的正文没披露具体规格、上市时间和价格,所以眼镜长什么样、卖多少钱、什么时候能买到,现在都还不知道。

推荐理由:我会先打个折:正文没披露参数、时间表和价格,所以没法判断落地有多快。但 Google 把 Gemini agent 塞进搜索,再配上智能眼镜,等于在用户每天用的入口上同时推两个 AI 触点。Pichai 自己说新功能要缩小跟 Anthropic、OpenAI 的差距,这话本身就说明他们承认落后,也在用产品动作追。对从业者来说,看点不是技术多新,而是 Google 怎么用分发优势把 agent 推到普通人面前。这点先别太激动,等具体上线和实测再说。

AI HOT 精选

Claude 操控真实界面的生产实践指南:点击更准、长任务不跑偏、操作可回放

Claude 现在能直接操作真实软件界面了,这篇博客讲的是怎么把它用到生产环境里,而不是只跑个 demo。文章给了四个具体机制:一是提高点击准确率,减少点错按钮的概率;二是可以选“思考努力级别”,在速度和效果之间做取舍;三是在长会话里保持上下文,避免任务跑到一半忘了前面在干嘛;四是把 Claude 的操作录成可重放的演示日志,方便排查和复现。正文没给出...

推荐理由:我会先打个折:这不是官方模型或产品发布,更像一份实战经验总结,所以放在质量教程档位。但它把 Claude 操控真实界面的四个关键机制讲得很清楚——怎么提高点击准头、怎么控制模型思考深度、怎么处理长会话不丢上下文、怎么把操作录下来复现。对正在把 agent 塞进业务流程的团队来说,这些点比 benchmark 数字更有用。

彭博科技

Anthropic 的 Mythos 模型让美国监管机构暂停了对大银行的部分网络安全检查

美国金融监管机构推迟了对几家最大银行的部分网络安全相关检查,原因是 Anthropic 新发布的 Mythos 模型暴露了新的风险。我会先打个折:正文被 Bloomberg 的付费墙挡住了,具体检查范围、暂停多久、涉及哪些银行,以及 Mythos 模型到底在技术上展示了什么新能力,这些关键信息目前都没披露。

推荐理由:我会先打个折:正文只说了暂停检查这个动作,没披露 Mythos 到底在测试里暴露了什么、影响了哪些银行、暂停多久。所以冲击力有,但信息缺口也大。对从业者来说,这至少说明前沿模型的安全评估结果,已经开始直接左右金融监管的实操了,这点值得盯着后续。

AI HOT 精选

谷歌发布 Gemini 3.5 Flash,智商分涨到 55,速度超 280 tokens/秒,但运行成本贵了 5.5 倍

谷歌把 Gemini Flash 系列更新到了 3.5 版,智商评分从上一代的 46 分提到 55 分,直接超过了 Grok 4.3 和 Claude Sonnet 4.6。进步主要在两方面:一是让模型进业务流程干活(代理任务)更靠谱了,二是知识真实性提升,幻觉明显减少。输出速度超过每秒 280 个 token,在速度和智商之间卡了个好位置。多模态评测...

推荐理由:谷歌发Gemini 3.5 Flash,属于头部实验室的模型迭代,而且有Artificial Analysis的第三方数据撑腰,速度、智能、成本都摆出来了。HKR三项全中,尤其是5.5倍的成本跳涨让这条消息不止于常规发布,值得从业者看一眼。