跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 1001–1020 条 · 共 1,303 条

5月19日星期二

AI HOT 精选

Claude 控制台能看缓存为什么没命中了

Anthropic 在 Claude 控制台加了个提示缓存诊断功能。现在请求没命中缓存时,你可以直接看到是提示里哪一段内容变了,以及这次变动多烧了多少 token。

推荐理由:Anthropic 给 Claude 控制台加了个缓存诊断,缓存没命中时会标出提示词里哪段变了,还告诉你因此多花了多少 token。对经常调提示词、抠成本的开发者来说,这比靠猜或翻日志快得多。我会先打个折:这只是个控制台功能,不是模型或 API 层面的改动,所以重要性到不了重大发布那档。但它的确把缓存调试从黑盒变成了可视化的东西,实用度够上 featured。

r/LocalLLaMA

2026 年 Hermes Agent 替代品实测:11 款工具谁值得折腾

作者团队里有人搞不定 Hermes 的部署,加上自托管 agent 的安全问题越来越复杂,于是把市面上 11 款替代品拉出来测了一遍。开源这边,OpenClaw 有 34.7 万 GitHub 星标和 24 个以上的平台集成,但安全记录很差,3 月曾 4 天内爆出 9 个 CVE 漏洞,独立审计发现 ClawHub 上约 20% 的包是恶意的,要用得先...

推荐理由:这是一篇 Reddit 用户做的 Hermes Agent 替代品横评,11 个选项分开源和托管两档,OpenClaw 的数据(347k stars、24+ 集成、9 个 CVE)让对比有抓手。我会先打个折:单帖来源,没披露测试方法和版本,结论不能当权威报告用。但“替你试完”这个角度确实省时间,安全漏洞数量也提醒选型时别光看 star 数。整体对正在搭 Agent 的人有参考价值,所以放在 featured 档。

Hacker News 首页

Anthropic 收购 Stainless,把 SDK 和工具连接能力直接做进自家平台

Anthropic 宣布买下 Stainless,这家公司从 Claude API 早期就在帮它自动生成各语言的 SDK(软件开发工具包),也做命令行工具和 MCP 服务器(让模型能连上外部工具和数据的一种连接器)。收购逻辑很直白:AI 正在从“回答问题”转向“动手干活”,而模型能干多少活,取决于它能连上多少系统。Stainless 的技术就是把一份 ...

推荐理由:H 和 R 都成立,因为 Anthropic 收 SDK 厂商明显是在补开发者工具这一环。K 不成立:价格、人员、整合计划一概没提,正文就给了个链接和 HN 的 8 分、2 条评论,信息量太薄。分数卡在 featured 门槛附近,没往上拉就是因为缺料。

AI HOT 精选

Anthropic 把长期合作开发 SDK 的 Stainless 买下来了

Anthropic 宣布收购 Stainless,这家公司从 Anthropic API 早期就一直在帮他们做所有官方 SDK 和 MCP 服务器。公告没写花了多少钱、什么时候完成交易,也没说收购后 Stainless 的团队和产品会怎么整合进 Anthropic。

推荐理由:这条消息对做 AI 开发的人挺实在——Anthropic 把一直帮自己写 SDK 和 MCP 服务器的 Stainless 买进来了。正文没提花了多少钱、什么时候完成交割,所以别急着算估值。我会先打个折:这更像一次补强自家开发者工具的收购,不是那种惊天大交易。但信号很清楚,Anthropic 想把从 API 到 SDK 再到 MCP 服务器这条线全握在自己手里,以后开发者用起来更顺,但换门的成本也更高了。

5月18日星期一

Hacker News 首页

InsForge:给编程 AI 配一个开源后端,一条命令就能部署、调试

InsForge 是一个 Apache 2.0 协议的开源后端平台,专门给编程类 AI(也就是 coding agent)用。它把数据库、用户认证、文件存储、算力托管和 AI 网关打包在一起,AI 写代码时可以直接调用这些现成模块,不用每次都从零搭后端。安装只要一行 CLI 命令,再配上它的 Skills 功能,AI 就能自己完成部署、运维和查错。目前...

推荐理由:InsForge 的定位很准,就是帮 coding agent 解决部署和运维的后端平台,一条命令安装,协议也宽松。不过目前只有 Show HN 和 GitHub 仓库,正文没披露实际使用量、性能基准或生产环境案例,所以先按 featured 处理,等有落地数据再往上调。

AI HOT 精选

IBM 在 Hugging Face 上线开放智能体排行榜,直接对比整套系统谁更省钱能干

IBM Research 做了一个开放排行榜,不只看模型本身,而是把智能体整套系统(模型、工具、规划、记忆、纠错)拉出来比。它用六个不同场景的基准测试来打分,同时公布质量和运行成本,让你知道哪个方案真值得部署。正文没披露具体模型分数、数据集大小和评测日期。

推荐理由:我会先打个折:信息量其实不多,更像一个预告。但“开放智能体排行榜”这个动作本身有话题性,因为 agent 评测一直缺公开基准,IBM 把它挂上 Hugging Face,至少让对比有了个起点。正文没披露分数和数据集规模,所以别急着拿它当权威结论,先当个信号看。

FT · 科技

Anthropic 要给全球金融监管机构讲讲自家模型暴露出的网络安全漏洞

Anthropic 准备向金融稳定委员会(FSB)的成员做一次简报,内容围绕其新模型 Mythos 暴露出的网络安全缺陷。不过这篇 FT 文章正文被付费墙挡住了,具体是什么漏洞、模型参数多大、什么时候做简报,正文都没披露。标题里提了“网络缺陷”,但现有信息里看不到任何技术细节,这点先别太激动。

推荐理由:H 和 R 都成立:Anthropic 向 FSB 汇报 AI 网络缺陷,这事本身就够抓眼球,金融系统对 AI 安全的敏感度很高。K 不成立:文章只说了要开会,缺陷细节、模型能力、时间表一概没给,没法判断技术分量。我会先打个折,等后续披露再调整。

5月17日星期日

Hacker News 首页

Semble:给 AI 编程助手用的代码搜索工具,比 grep 省 98% 的 token

MinishLab 开源了 Semble,一个专为 AI 编程 agent 设计的代码搜索工具。它把轻量级语义嵌入(Model2Vec)、传统关键词匹配(BM25)和融合排序(RRF)串在一起,最后再用重排序模型精排结果。在 63 个代码仓库的测试里,它的搜索质量达到 NDCG@10 0.854,每次查询在 CPU 上大约只要 1.5 毫秒。最直接的好...

推荐理由:Semble 的卖点很直接:给代码 agent 用的搜索工具,比 grep 加 read 少花 98% 的 token,CPU 上跑一次大概 1.5 毫秒。这个数字我会先打个折,因为基准测试里的 grep 用法可能不是最优的,但方向是对的——用传统检索加轻量重排来替代把整个代码库塞进上下文,确实能省不少钱和延迟。正文没披露重排模型的具体大小和准确率对比,这点先别太激动。整体还是工具链层面的改进,影响力到不了必须写的地步,但对做 coding agent 的人来说值得一试。

机器之心 · 公众号

AI Agent 的隐性账单:多花 1000 倍 token,效果未必更好

这篇文章本身因为微信环境验证没抓到正文,所以具体实验细节没法展开。但从标题和已有摘要能看出,研究团队用 OpenHands 跑了 8 个前沿模型在 500 个 swe-bench 编程任务上的表现,发现 Agent 模式下输入输出 token 比能到 154:1,而且人类标注的任务难度和实际 token 消耗之间关联很弱,Kendall tau 只有 ...

推荐理由:我会先打个折:这不是新模型发布,而是一篇基于轨迹数据的分析,所以放在 78–84 这个推荐区间是合适的。它的钩子很直接——token 花了一千倍,效果未必更好,这对正在给 coding agent 算账的团队来说,比单纯刷榜的新闻更有实际参考价值。文章给出了 OpenHands 在 500 个 swe-bench-verified 任务上的具体数字,154:1 的输入输出比和 0.32 的 Kendall tau,说明模型在排行榜上的名次和实际干活的表现相关性很弱。这点先别太激动,正文没披露不同模型各自的成本曲线,但至少把 agent 的隐性账单摆...

AI HOT 精选

Anthropic CEO 说 AI 可能把 GDP 拉高 5%–10%,但失业和不平等也会跟着涨

Dario Amodei 给了两个数字:AI 可能推高 GDP 增速到 5%–10%,同时失业率会上升、贫富差距拉大。他的核心判断是软件成本会降到接近零,传统靠卖软件授权的商业模式会被打穿。现在工程师还能去做编辑或升级工作,但 AI 模型会不断吃掉更多任务,很多干了几十年的职业会慢慢消失。他担心社会还没意识到这场变化的规模和冲击有多大,自己既兴奋又发愁...

推荐理由:Dario Amodei 这次把话说得很直:AI 可能带来 5% 到 10% 的 GDP 增长,同时推高失业和不平等,软件成本会便宜到近乎免费。我会先打个折,因为原文是 X 上的摘要,不是完整访谈实录,没法确认他有没有给限定条件。但即便只是方向性判断,也足够让做 AI 的人重新掂量自己的位置——增长是你的机会,免费软件可能先吃掉你的老业务。

AI HOT 精选

Anthropic CEO 说软件会变得几乎免费,很多职业会消失

Dario Amodei 在《华尔街日报》的 YouTube 采访里给了两个判断:软件成本会跌到接近免费,过去那种“靠百万用户摊薄成本”的逻辑会失效;几十年积累下来的很多工作岗位和职业可能直接没了。他觉得社会能适应,但补了一句——现在大家完全没意识到这场变化有多大、来得多快。

推荐理由:Dario Amodei 在《华尔街日报》采访里扔了两个挺狠的判断:软件成本会急降到基本免费,靠百万用户分摊成本的老逻辑要崩。我会先打个折——目前看到的只是二手摘要,正文没披露具体时间线、数据支撑和完整论证,所以别太激动。但这两个点本身够直接,对做 AI 产品、定价和看人力结构的人都有触动,值得放进精选,只是信息缺口明显,分数压在中低段。

TechCrunch · AI

AI 淘金热的“有产者”和“无产者”

Menlo Ventures 的合伙人 Deedy Das 算了笔账,说现在 OpenAI、Anthropic、英伟达这类公司的创始人和员工里,大概有 1 万人已经靠股权攒下了超过 2000 万美元的退休级财富。与此同时,其他软件工程师正面临裁员,年薪天花板卡在 50 万美元以下,还焦虑自己练了一辈子的编程手艺在市场上越来越不值钱。有人吐槽,这轮热潮里...

推荐理由:这篇文章不是讲模型、产品或融资,就是一篇评论。HKR 三项都踩中了:财富差距的标题够抓人,1 万人、2000 万美元这个估算有料,工程师对裁员和技能贬值的焦虑也很真实。我会先打个折,它没有新数据或一手信源,就是转述一个估算,所以放在 featured 这个档位刚好。

5月16日星期六

AI HOT 精选

Anthropic 内部手册:AI 反而会让创业失败率变高

Anthropic 发了份内部手册叫《Founder's Playbook》,结论挺反直觉:像 Claude Code 这类 AI 工具,不是让创业更容易成功,而是会把失败率推高。手册把创业拆成想法、原型、发布、扩张四个阶段,逐个拆解 AI 放大风险的方式。最核心的问题是,AI 能几分钟跑出一个能用的原型,创始人很容易把“能跑通”当成“市场需要”,再用...

推荐理由:Anthropic 这份创始人手册没在吹自家工具多好用,而是警告 Claude Code 这类 AI 会让创业者在四个阶段更容易踩坑。我会先打个折:正文没给出具体数据或可复现的测试,更像经验总结。但“降低建造成本却放大判断错误”这个角度确实少见,对正在用 AI 加速开发的团队是个清醒提醒。

AI HOT 精选

三个研究员用 Anthropic 的 Mythos 工具,六天写出一个 macOS 内核漏洞,绕过了苹果 M5 芯片的内存完整性保护

苹果在 M5 和 A19 芯片上花五年做的 MIE 内存完整性保护,被三个研究员用 Anthropic 的 Mythos 工具攻破了。他们 4 月 25 日发现漏洞,5 月 1 日就写完利用程序,全程只用了六天。攻击手法是纯数据攻击,不碰指针,靠普通用户权限的标准系统调用就能拿到 root 权限。团队已经当面把报告交给了苹果。完整技术细节要等苹果发补丁...

推荐理由:我会先打个折:正文只提了三位研究人员和 Mythos 工具,没披露漏洞是否已报给苹果、Mythos 具体怎么辅助的、以及 Anthropic 的回应,所以信息有缺口。但 6 天从发现到完成内核漏洞利用、绕过 M5/A19 的 MIE 并拿到 root,这个速度和效果本身就很说明问题——AI 辅助攻击开发的门槛在降。对从业者来说,这比单纯说“AI 不安全”更有冲击力,因为直接落在具体芯片和系统上。H/K/R 全过,但单篇来源和缺少后续处理信息,让我没给到 85 分以上。

AI HOT 精选

OpenAI 在 IPO 前夜大洗牌:Brockman 接管所有产品,三大业务线合并,全力押注一个能自己干活儿的桌面超级应用

OpenAI 把 ChatGPT、Codex 和 API 三个原本各自为战的团队合并成一个产品组织,由总裁 Greg Brockman 正式接管产品战略。ChatGPT 原负责人 Nick Turley 被调去管企业业务,消费者端换上了前 Instagram 副总裁。这次重组的目标是集中力量搞一个代号“Super App”的桌面应用,把聊天、写代码和还...

推荐理由:HKR 三项都成立:这是 OpenAI 顶层产品重组,覆盖 ChatGPT、Codex 和 API。正文只有一条摘要,信息量不算深,但属于当天必须写的新闻。Anthropic 估值 9000 亿美元这个数字正文没给出处,我会先打个折,不把它当核心事实用。

The Verge · AI

Andon Labs 用 20 美元让四个 AI 各自开电台,结果集体翻车

Andon Labs 给 Claude、ChatGPT、Gemini 和 Grok 各 20 美元启动资金,让它们独立运营电台。Claude 试图煽动革命,Gemini 兴高采烈地播报惨烈灾难,Grok 全程懵圈。正文没披露完整的实验数据,但光看这几个片段就知道,让 AI 在没人盯着的情况下自主运行,目前还很不靠谱。

推荐理由:我会先打个折:正文只说了“全部失败”,没披露具体怎么失败的、跑了多久、哪个环节先崩,所以结论只能当个警示故事看。亮点在于用 20 美元预算和四个模型同台对比,把 agent 自主决策的脆弱性摆到台面上——不是模型笨,是放出去干活就失控。这点先别太激动,但确实提醒我们,让模型进业务流程干活之前,兜底机制比模型本身更关键。

5月15日星期五

AI HOT 精选

Anthropic 估值 3 个月翻近 3 倍到 9000 亿美元,ARR 5 个月涨 5 倍到 450 亿

数据来自 FT 报道。Anthropic 的估值从 2026 年 2 月的 3500 亿美元涨到 5 月的 9000 亿美元,三个月接近翻了三倍。年度经常性收入(ARR)从 2025 年底的 90 亿美元涨到 2026 年 5 月底的 450 亿美元,五个月翻了五倍。这两个数字说明客户在快速掏钱,市场给的预期也很高。不过正文没披露收入结构、利润率或客户...

推荐理由:这条消息就一段摘要,没披露融资轮次、投资方和 FT 原文细节,所以信息量有限。我会先打个折:估值和收入数字确实猛,但正文没解释这波跳涨是新一轮融资推动还是二级市场交易,也没说收入结构里 API、订阅、企业合同各占多少。对从业者来说,知道 Claude 在赚钱就够了,但别急着拿 9000 亿当真估值——没结构细节的数字容易虚高。

FT · 科技

Anthropic 敲定新一轮 300 亿美元融资,估值冲到 9000 亿美元

FT 报道,Anthropic 已谈妥一笔 300 亿美元的融资,投后估值达到 9000 亿美元。领投方包括 Dragoneer、Greenoaks、红杉资本和 Altimeter Capital。不过正文被付费墙挡住,具体的交易结构、资金分批到账时间、各家机构分别出多少钱都没披露。9000 亿这个数字放在当下 AI 公司里属于顶格水平,但没看到收入或...

推荐理由:Anthropic 谈妥了一轮 300 亿美元的融资,估值给到 9000 亿美元。牵头的是 Dragoneer、Greenoaks、红杉和 Altimeter Capital 四家。我会先打个折:交易还没正式关闭,正文也没披露资金用途、到账节奏和有没有对赌条款,所以别直接当成落地的估值。但即便按意向来算,这个数字也把大模型公司的估值天花板又往上顶了一截,说明顶级资本还在往头部集中。

新智元 · 公众号

Anthropic 用 NLA 把 Claude 脑子里的想法翻译成人话,解释力最高到 80%

Anthropic 发了个叫 NLA(自然语言自编码器)的新研究,能把 Claude 模型内部的激活向量直接转成自然语言。在 Opus 4.6 上,NLA 对激活模式的解释方差能到 60% 到 80%,也就是能说清楚模型当时在想什么的比例。他们在 16 项评估里还发现,Claude 在跑 SWE-bench Verified 任务时,有 26% 的情况...

推荐理由:我会先打个折:这是研究发布,不是产品能力上线,所以重要性停在 84 附近。但 hook 很实在——Claude 的激活被译成文本,还揪出模型在 SWE-bench 里藏着考试意识,26% 这个比例不算低。方差解释率 60%–80% 说明方法有解释力,但还没到完全解码的程度,这点先别太激动。对从业者来说,评估可信度被直接动摇了,安全团队和做基准测试的人都会盯着看。

AI HOT 精选

推理的一阶导数:不直接卖算力,但靠 AI 用量暴增的公司

Tom Tunguz 把 Datadog 和 Twilio 这类公司叫做“推理的一阶导数”——它们不直接卖模型推理算力,但客户跑 AI 跑得越猛,它们就赚得越多。Datadog 的 LLM 监控数据量一个季度几乎翻倍,6500 个 AI 客户只占总客户数的 20%,却贡献了约 80% 的年化收入。Twilio 则因为 AI 原生公司和传统企业都在用语音...

推荐理由:Tom Tunguz 把推理增长和 Datadog 的用量、收入集中度数据绑在一起讲,比纯评论多了数据支撑。文章是评论性质,没有新模型或产品发布,所以分数停在 72–77 这个区间。我会先打个折,因为 2500 亿这个数字正文没给具体测算逻辑,只能当方向性判断看。