跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 1081–1100 条 · 共 1,303 条

5月8日星期五

FT · 科技

Anthropic 正在谈新一轮融资,估值可能冲到近 1 万亿美元

Anthropic 收到了外部投资意向,如果谈成,估值会接近 1 万亿美元,超过 OpenAI。不过这篇 FT 文章正文被付费墙挡住了,只显示了标题和导航栏,没有披露收入到底涨了多少、具体融资金额、投资人是谁、条款怎么定。所以“收入激增”这个说法暂时看不到数据支撑,先别太激动。

推荐理由:HKR全中:FT说Anthropic在考虑一笔可能让估值冲到近1万亿美元的交易,甚至超过OpenAI。我会先打个折,因为正文没披露收入到底涨了多少、谁在投、什么条件,信息缺口不小。分数留在85-94这个区间,就是因为它有猛料但缺关键数字,别太激动。

r/LocalLLaMA

Anthropic 发了篇论文,能让你看到 Gemma 3 生成每个词时在想什么

Anthropic 用他们做可解释性的 NLA 方法,把 Gemma 3 27B Instruct 模型内部激活值翻译成人能看懂的概念。具体做法是训练了两个小模块:一个叫 Auto Verbalizer,负责把神经元活动映射到自然语言描述;另一个叫 Activation Reconstructor,用这些描述去重建原始激活,验证解释靠不靠谱。权重已经挂...

推荐理由:Anthropic 这次没发新模型,而是给 Gemma 3 27B 做了一次“脑部扫描”。他们用自然语言来解释模型生成单个 token 时的激活模式,相当于把模型决策摊开给你看。两套权重都挂在 Hugging Face 上,Neuronpedia 也上了交互页,上手门槛很低。不过正文没给任何评测分数,所以效果到底多准、解释会不会自说自话,这点先别太激动。整体属于扎实的可解释性开源发布,对关心推理成本和模型行为的人挺有用。

AI HOT 精选

Anthropic 把开源对齐测试工具 Petri 捐给了独立机构 Meridian Labs

Anthropic 把自家用来测模型有没有撒谎、拍马屁、配合危险请求的开源工具箱 Petri,转交给了非营利评测机构 Meridian Labs。这么做是为了让工具脱离 AI 公司,评测结果更中立、更让人信服。Petri 从 Claude Sonnet 4.5 起就参与内部对齐检查,英国 AI 安全研究所也用它来评估模型会不会破坏 AI 研究。这次同步...

推荐理由:Anthropic 把对齐测试工具 Petri 捐给 Meridian Labs,条件是保持独立性和公信力,这件事本身就挺有意思——相当于把裁判权从自己手里交出去。Petri 3.0 的核心改动是把审计模型和目标模型拆开,Dish 能接真实部署环境,再加上 Bloom 做行为评估,让独立审计有了实操基础。正文说多轮 VQA 压缩 90% 视觉 Token 精度不掉,这个数字如果经得起第三方复现,确实挺省钱。不过目前还没看到独立验证结果,我会先把这个判断挂在信息缺口上。整体来看,这件事对做多模态推理优化和安全评测的人都有参考价值,放在 feature...

AI HOT 精选

Claude 现在能直接在你的 Excel、PPT、Word 和 Outlook 里干活了

Claude 正式接入了四个微软办公软件:Excel、PowerPoint、Word 和 Outlook。其中 Excel、PPT 和 Word 已经全面开放,Outlook 还在公开测试阶段。你可以跨应用跟 Claude 对话,比如让它分析 Excel 里的数据,再把结论写成 Word 报告,最后用 Outlook 发出去,上下文是打通的。企业管理员...

推荐理由:Claude 这次不是发模型,而是把能力塞进微软 Office 全家桶里。Excel、PPT、Word 已经全量上线,Outlook 在公测,企业管理员可以通过微软管理中心统一部署,还能用 OpenTelemetry 看全流程的调用情况。对 Anthropic 来说,这是把模型推到亿级用户的工作流里,入口价值比单发一个模型版本更大。但毕竟不是底层能力突破,所以分数卡在 83 这个位置,不往上拔了。

Hacker News 首页

自然语言自编码器:把 Claude 的“想法”直接写成大白话

Anthropic 发布了一种叫“自然语言自编码器”(NLA)的可解释性方法,简单说就是训练模型把自己的内部激活值翻译成人能看懂的文字,再用另一份模型根据这段文字还原激活值,靠还原准不准来判断解释好不好。他们用这方法看了 Claude Opus 4.6 和 Mythos Preview 在安全测试里的表现,发现模型有时心里觉得“这是测试”,但嘴上没说;...

推荐理由:我会先打个折:目前只有一页研究预告,没方法、没模型版本、没评测,所以别急着下结论。标题确实够直接,把“思维”转成文本这个说法本身就暗示 Anthropic 在搞内部表征的可读化,不是普通的论文发布。但正文没给任何实验细节,29 分和 7 条评论说明社区也在观望。真正值得盯的是它后续会不会放出可复现的实验,如果只是概念页,那热闹就白看了。

5月7日星期四

Ben's Bites

Elon 把用量翻倍了

这期主要讲了几件事。ChatGPT 免费版换上了新模型 GPT-5.5 Instant,看 PDF、搜网页、调用记忆都比上一代强,在容易出错的场景下幻觉减少了 52.5%,回复也更短、更少用表情。同时 ChatGPT 现在能直接嵌进 Excel 和 Google Sheets 里写公式、分析表格。Claude 这边,所有付费套餐的调用额度翻倍,原因是 ...

推荐理由:HKR 三项都过了:SpaceX Colossus 1 的算力合作、Claude 用量翻倍、配额压力,全是实打实的信息点。正文没给出具体限额数字和定价变化,也没说清楚是哪些付费档位受益,所以重要性停在低 featured 档。标题写 Elon 但正文没展开,这点先别太激动。

AI HOT 精选

OpenRouter 推出统一网络搜索与抓取工具,换模型不用重写工具代码

OpenRouter 发布了两个服务端工具:`openrouter:web_search` 和 `openrouter:web_fetch`。模型在对话中需要查资料时,可以直接调用它们,由 OpenRouter 在后台执行搜索或抓取网页,再把结果喂回模型。最大的好处是换模型不用改工具定义——不管底层跑的是 GPT-5.5、Claude 还是 Kimi,...

推荐理由:我会先打个折:正文没披露具体接了哪些搜索引擎和抓取引擎,也没提价格和调用限额,所以实际能用成什么样还得等上线看。但这件事的看点不在引擎本身,而在跨模型工具接口的一致性——让 GPT、Claude 等模型用同一套搜索和抓取指令干活,对搭 agent 工作流的人来说省了不少适配成本。这点先别太激动,但如果后续把引擎选择和限额透明化,实用性会更高。

AI HOT 精选

Anthropic 研究所公布四个核心研究方向,计划发布更细颗粒度的经济指数

Anthropic 新成立的研究所(TAI)把研究分成四块:AI 在经济里怎么扩散、新安全威胁和抗风险能力、真实世界里的 AI 系统、以及 AI 反过来加速 AI 研发。他们打算把 Anthropic 经济指数的数据发得更密、更细,用来当劳动力市场变化的早期预警。文章还提到,内部已经看到软件工程这类工作在快速改变,公司自己的运转方式也在变。这些研究成果...

推荐理由:这是一份研究议程,不是模型发布或产品更新,所以重要性不会冲太高。我会先打个折,把它放在74分。真正值得盯的不是这4个方向本身——经济扩散、威胁与韧性、真实世界AI系统、AI驱动研发——而是Anthropic明说这些研究结果会进入长期利益信托的决策链。也就是说,这不是写写白皮书,而是可能影响公司实际资源怎么分。正文还提到会发布更细粒度的Anthropic经济指数,用来追踪AI对就业和经济的实际影响,这点比泛泛而谈的“研究”要实在。不过正文没披露具体时间表,也没说信托的决策机制长什么样,所以别太激动,先当信号看。

Latent Space

Anthropic 租下 xAI 孟菲斯超算,年费或达 50 亿美元,Claude 推理能力几天内就要搬上去

Anthropic 在第二届开发者活动上宣布,将租用 xAI 在孟菲斯的 Colossus I 超算集群来跑 Claude 的推理任务,预计几天内就开始迁移。外界根据 300 兆瓦的功耗规模估算,这笔交易一年可能花掉 Anthropic 约 50 亿美元,相当于 xAI 变相成了一家提供算力租赁的云厂商。活动上没有发新模型,主要更新了三件事:一是 Cl...

推荐理由:这条消息最炸的点是 Anthropic 可能要从 SpaceX/xAI 租 300MW 算力,一年砸 50 亿美元——不过正文也说了这俩数字还不是官方口径,先打个折看。对开发者更实在的是 Claude Code 的 5 小时限额翻倍了,Pro、Max、Team 和席位制 Enterprise 都受益,Opus API 限额也往上调了,用起来没那么容易撞墙。整篇信息量够,既有大 deal 的传闻钩子,又有马上能用的产品变动,所以放在 featured 档。

新智元 · 公众号

Claude 托管智能体新增“做梦”功能,Harvey 实测任务完成率暴涨约 6 倍

Anthropic 给 Claude 的托管智能体加了三个新能力:Dreaming(做梦)、Outcomes(结果校验)和多智能体协作。其中“做梦”是指让 Claude 在后台读取最多 100 段历史会话,自己总结规则来改进表现,一次演示里它把 530 万 token 的对话提炼成了 98 条规则。法律 AI 公司 Harvey 实测后,任务完成率比之...

推荐理由:Anthropic 给 Claude 托管 Agent 加了三个东西:Dreaming 让模型事后翻历史会话自己总结规则,Outcomes 用偏好样本教模型对齐目标,多 Agent 编排让多个 Claude 协作干活。Harvey 说任务完成率大约翻了 6 倍,Outcomes 内部测试最高能提 10 个百分点。运行时另收 0.08 美元/会话小时,正文没披露这个定价的横向对比。我会先打个折:6 倍是合作方数据,没看到独立复现,但 Dreaming 从 530 万 token 压到 98 条规则这个例子确实说明能省不少上下文成本。

机器之心 · 公众号

马斯克宣布 xAI 解散,Grok 并入 SpaceXAI,22 万张 GPU 算力租给 Anthropic

马斯克确认 xAI 解散,Grok 和 X 平台相关业务全部并入新实体 SpaceXAI。同时,SpaceX 和 Anthropic 签了协议,Claude 将接入 Colossus 1 超算——超过 22 万张 Nvidia GPU、300 兆瓦的算力集群。对用户来说最直接的变化是配额:Claude Code 的五小时速率限制翻倍,Pro 和 Max...

推荐理由:我会先打个折:目前只有单一信源,还没看到 Anthropic 或 SpaceX 的官方公告,所以先不拉满。但消息本身冲击力很强——xAI 解散、Grok 并入 SpaceXAI,Colossus 1 那 22 万张 GPU 和 300 兆瓦算力直接租给 Anthropic,等于把自家训练底座送给了对手。对开发者来说,Claude Code 五小时速率翻倍、Pro 和 Max 高峰配额限制移除是马上能感知的变化。正文没披露租约时长和价格,也没说 Grok 后续怎么迭代,这些缺口让消息还差一口气,但已经够格进 p1。

Computing Life · Share · 鸭哥调研

Anthropic 半年签下四笔算力大单,xAI 把自家超算中心整租给了对手

Anthropic 在六个月内接连锁定了 AWS Trainium、Google TPU、SpaceXAI Colossus 1 和 CoreWeave 的算力,覆盖了市面上三种主流芯片架构。同一时间,xAI 把拥有 22 万张 GPU 的 Colossus 1 数据中心全部租给了 Anthropic,而自家 GPU 利用率只有 11%。这两件事拼在一...

推荐理由:我会先打个折:这更像一篇策略分析,不是突发新闻,所以分数没给到 85 以上。但它的信息密度够硬——Anthropic 四处锁算力,xAI 却把自家超算租给对手,还带出 11% 利用率这个反直觉数字。对关注大模型算力战的人来说,这比单纯宣布合作要有意思得多。正文没披露租约的具体价格和时长,这点先别太激动,但现有的数字已经足够让从业者重新琢磨两家公司的算力策略了。

Computing Life · Share · 鸭哥调研

Agent 文件系统:从“喂给模型记忆”到“让模型自己翻文件”

这篇文章梳理了 AI agent 外置记忆方案的三代演化:从把所有东西塞进上下文窗口,到用向量数据库做外挂记忆,再到 2025 年下半年兴起的“把文件系统当上下文用”。核心转变是让 agent 自己按需去文件系统里找信息,而不是开发者预先推送。文章解释了为什么这个模式现在成立:模型天生会操作文件系统、上下文窗口的成本已经高到不可忽视、渐进式披露能利用模...

推荐理由:这是一篇设计评论,不是产品发布或论文。它把 Agent 文件系统拆成三代,对比了 Turso、Anthropic、Vercel 和 Manus 的不同判断,还点出四个盲区,对做 Agent 的人有参考价值。信息量和相关性都够,但性质偏评论,所以放在 featured 而不是更高一档。

FT · 科技

SpaceX 要把数据中心算力租给 Anthropic

FT 报道 SpaceX 会向 Anthropic 出租数据中心容量,等于确认了双方有一笔算力租赁合作。Anthropic 加码算力是为了跟上用户增长,但正文被付费墙挡住,没披露具体租了多少、租多久、什么价格。

推荐理由:FT 确认 SpaceX 会向 Anthropic 出租数据中心容量。H 来自这对不常见的组合;K 有交易事实但没有规模和价格,信息缺口明显;R 直接关联算力稀缺和 Anthropic 的增长压力,所以能进 featured,但缺细节撑不到 78 分以上。

r/LocalLLaMA

Reddit 网友扒了 922 条 agent 任务记录,发现 DeepSeek v4 省钱的关键不在标价,在缓存命中率

一位 Reddit 用户分析了 922 条 agent 任务的实际调用记录,对比了 DeepSeek v4 Flash 和 Opus 4.7 的花费。两个模型每个任务都要吃掉大约 96 万 token,但 DeepSeek 单任务成本只要 0.01 美元,Opus 4.7 却要 1.52 美元。差距不在输入输出的标价,而在缓存:DeepSeek 的缓存...

推荐理由:这篇不是比谁模型强,是比谁缓存用得聪明。Reddit用户跑了922条智能体任务轨迹,发现DeepSeek v4 Flash单任务成本0.01美元,Opus 4.7要1.52美元,差了152倍。两边平均token消耗都接近96万,但DeepSeek缓存命中率97%,Opus只有87%;更关键的是缓存读写价格比,DeepSeek是0.02,对方是0.08。也就是说,标价看着便宜不算真便宜,能把重复计算省下来才是省钱的地方。正文没披露任务类型和采样方式,这点先别太激动,但缓存机制这个观察本身值得盯。

TechCrunch · AI

DeepSeek 首次对外融资,估值可能冲到 450 亿美元

DeepSeek 正在谈第一笔外部投资,几周内估值就从 200 亿涨到了 450 亿美元。这家中国 AI 实验室 2025 年初靠一个训练成本远低于 OpenAI、Anthropic 等美国模型的大语言模型出圈,之后在推理和编程能力上一直咬住第一梯队,模型权重也开放下载。创始人梁文锋原本没打算融资,但对手开始挖人,他才决定引入资金好给员工发股份。领投方...

推荐理由:DeepSeek 第一次对外融资,目标估值 450 亿美元,我会先打个折——正文没给金额、没列投资方、也没提条款,所以这个数目前更像一个信号而不是定论。真正值得盯的是:如果首轮真按这个价成交,中国 AI 实验室的估值天花板就被重新画了一条线。这点先别太激动,等更多细节出来再说。

彭博科技

Anthropic 找 SpaceX 买算力,但没说是训练还是推理用

Anthropic 和马斯克的 SpaceX 签了一份算力合同,目的是撑住 Claude 越来越大的用量。报道没披露具体算力规模、合同金额、上线时间,也没说这批算力是拿来训练新模型还是跑线上推理。SpaceX 能不能挤进 Anthropic 的长期供应链,目前还看不出来。

推荐理由:我会先打个折,这条消息的新闻性在于“谁跟谁合作”,而不是合作本身有多扎实。Anthropic 把 SpaceX 拉进算力供应商名单,对缓解 Claude 的推理压力可能有帮助,但正文没披露任何具体数字或部署细节,所以现在还判断不了这是短期补缺还是长期供应链调整。真正值得盯的是后续会不会有训练或推理负载真的跑在 SpaceX 的设施上,以及合同规模能不能跟 AWS、Google Cloud 的量级比一比。目前只能当作一个信号来看,别太激动。

Hacker News 首页

Claude 大幅提高用量上限,并与 SpaceX 签下超 300 兆瓦算力合同

Anthropic 宣布了三项即时生效的调整:Claude Code 的 5 小时速率限制翻倍,Pro 和 Max 用户不再受高峰时段降速限制,Opus 模型的 API 调用频率也明显上调。这些变化背后是一笔新签的 SpaceX 算力合同——Anthropic 将在一个月内用上 Colossus 1 数据中心全部容量,超过 300 兆瓦、约 22 万张...

推荐理由:标题说 Claude 要提用量上限,还跟 SpaceX 签了算力合同,但点进 RSS 只有链接和评论,关键数字一个没给。我会先打个折:这事听着挺省钱,可没披露倍数和规模,就先别太激动。真正值得盯的是配额放宽是不是靠 SpaceX 的新算力在撑,这点正文没交代。

5月6日星期三

量子位 · 公众号

Claude 团队拿 Qwen 试了一种新训练法,把模型乱说话的比例从 68% 压到 5%

Anthropic 提出在预训练和对齐微调之间加一个叫 MSM 的训练阶段。他们在 Qwen2.5-32B 和 Qwen3-32B 上做了测试,模型乱说话的比例分别从 68% 和 54% 降到了 5% 和 7%。核心点是 MSM 是补强对齐微调,而不是替代它。

推荐理由:我会先打个折:这不是新模型发布,而是训练方法研究,所以 82 分刚好。Anthropic 用 Qwen 做实验,把 MSM 放在预训练后、对齐微调前,相当于在模型学完通用知识之后、正式教它守规矩之前,先塞一批规范文档让它读。Qwen2.5-32B 的失准率从 68% 掉到 5%,Qwen3-32B 从 54% 掉到 7%,数字说明效果明显。真正值得盯的是 MSM 和 AFT 互补,不是替代关系——这点先别太激动,正文没披露更多消融实验细节。整体是扎实的安全研究,对做对齐的从业者有参考价值。

Latent Space

硅谷开始认真卖服务了:Anthropic 和 OpenAI 各自成立公司,帮企业把模型塞进业务里

Anthropic 和 OpenAI 这周都宣布了新的企业服务公司。Anthropic 跟黑石等几家华尔街机构搞了个合资公司,总共融了 15 亿美元,每家出 3 亿。他们的做法是先派个小团队去客户那,搞清楚 Claude 能在哪发挥最大作用,然后工程师再上手定制系统。OpenAI 那边动作更大,成立了一家叫 The Deployment Company...

推荐理由:两家头部模型公司不约而同从卖模型转向亲自下场做服务,Anthropic 的合资公司拿了 15 亿美元,OpenAI 的部署公司融了约 40 亿、投前估值 100 亿。我会先打个折,正文没披露这些服务公司的具体业务模式、客户是谁、怎么收费,也没说跟现有云厂商的合作关系怎么处理。但光看资金规模和两家同时行动,这个信号够强,值得从业者留意。