跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 1161–1180 条 · 共 1,303 条

4月24日星期五

量子位 · 公众号

Claude 承认三个 bug:推理降级、记忆清空、输出被限,越聊越傻不是错觉

Anthropic 在 4 月 23 号自己抖出了 Claude 近期的三个质量问题。第一个是 Claude Code 的推理强度,3 月 4 号起默认从高被偷偷调成了中,但界面还显示高,等于你花钱买高推理,实际跑的是省流版。第二个是 3 月 26 号出的缓存 bug,每次对话轮次都会清空思考状态,持续了 15 天,模型像失忆一样没法连贯想事。第三个是...

推荐理由:这是 Anthropic 自己发的故障复盘,不是用户单方面抱怨,所以信息可信度比一般吐槽高。HKR 三项都成立:标题自带钩子,三个 bug 都有日期和具体影响数字,而且把讨论从“AI 降智”的模糊叙事拉到了透明度和计费信任上,对从业者来说比单纯的情绪输出更有价值。不过毕竟只是复盘,不是新模型发布或重大安全事件,82 分合理。

彭博科技

DeepSeek 发布新一代旗舰模型预览版,距上次出圈正好一年

DeepSeek 放出了新旗舰模型的预览版本,官方说法是“迄今最强的开源平台”。目前只确认了开源定位和预览状态,正文没披露参数量、上下文长度、跑分成绩和正式发布时间。我会先打个折——能看到的硬信息还太少,先别太激动。

推荐理由:DeepSeek 在去年炸场之后又推新旗舰预览,开源这张牌继续打,话题度够高,所以给到 featured。但文章实质信息很少——没参数、没上下文窗口、没基准成绩、没时间表,只能确认“预览版”和“开源”两点,知识增量弱,重要性就压在 75 这个低位。我会先打个折:标题唬人,内容还撑不起更高的分数。

X · @dotey(宝玉)

DeepSeek 发了 V4 预览版并开源,百万上下文直接标配,不再分版本加价

DeepSeek 放出了 V4 系列模型的预览版,代码也同步开源。这次最实在的变化是,百万 token 的上下文窗口成了所有官方服务的默认配置,Pro 和 Flash 两个型号都一样,没有高价门槛。V4-Pro 是旗舰,推理能力追平了顶尖闭源模型,世界知识得分仅次于 Gemini-Pro-3.1;V4-Flash 是轻量经济版,推理接近 Pro,但知识...

推荐理由:DeepSeek 是国内头部的模型厂商,这次 V4 预览版把百万上下文做成全服务标配并开源,属于实质性发布。HKR 三项都满足:正文有机制解释和迁移截止日期,而且这种定价策略的调整让它值得当天就作为 P1 处理。

Computing Life · Share · 鸭哥调研

Skill 是天生带自杀基因的产品

作者认为 Anthropic 的 Skill 形态没法独立做成付费产品。直接卖文件会被零成本传播,PromptBase 跑了三年估算年收入才五百万美元;做成托管服务本质是卖服务器,不是卖 skill;做成 API 引流工具又只是免费营销物料。更深层的问题是,skill 把使用知识从隐性变显性,消灭了培训、咨询等原有价值链的盈利空间,自己却因为明文复制成...

推荐理由:我会先打个折:这不是 Anthropic 的新发布,是一篇评论,所以重要性停在 featured 档。但它的判断很锋利——作者不跟你绕弯子,上来就说 Skill 天生带“自杀基因”,然后一条条拆直售、托管、API 引流为什么都是死路。数字也留得有用,比如 Snyk 审计发现 13.4% 的 skill 有严重安全问题,这比空谈风险更有说服力。真正让我觉得值得推荐的是它把视线从 artifact 这种静态产出挪开,提醒你盯紧收费点正在往关系、此刻、物理责任和判断上转移。正文没给出 Skill 官方定价或分成政策,但靠公开数据和逻辑推演,已经把悲观结论...

The Verge · AI

Claude 开始直连你的 Spotify、Uber Eats 和 TurboTax 了

Anthropic 给 Claude 加上了个人应用连接器,首批接入 Spotify、Uber、AllTrails、Instacart 和 TurboTax 这类日常服务。连上之后,你在聊天里提需求,Claude 会主动推荐用哪个 App 来办——比如想找徒步路线,它就直接调 AllTrails。这标志着 Claude 从办公场景正式踏进个人生活消费的...

推荐理由:这条给 Anthropic 加的是正向分:产品更新有料,但不是模型发布。HKR 三项全过——个人应用连接器本身就是强钩子,文章证实了对话内调用,而且这事直接打在助手入口的争夺上。正文没提首批覆盖多少应用、哪些地区能用、要不要付费订阅,这些缺口让判断得打个折,但方向没错。

X · @dotey(宝玉)

Anthropic 给 Claude 托管智能体加了记忆功能,用文件系统存经验,不用向量库

Anthropic 把记忆功能做进了 Claude 托管智能体,现在公测。智能体能把之前会话里学到的经验存成文件,下次干活直接读,不用每次从头教。实现方式很朴素:记忆就是文件系统上的文件,智能体用 bash 和代码能力直接读写,开发者也能通过 API 导出或回滚。权限上支持多智能体共享,可设只读或读写,并发访问不冲突,所有改动有审计日志。Rakuten...

推荐理由:Anthropic 给 Claude 托管智能体加了跨会话记忆,目前公测。亮点是没上向量数据库,直接用文件系统接 bash 和代码执行链路,权限、审计、回滚都给了。两个用户数字挺硬:Rakuten 出错率砍掉 97%,Wisedocs 提速 30%。不过范围还锁在托管智能体 beta 版,所以重要性给 83,放 featured。

X · @claudeai

Claude 托管 Agent 的记忆功能开始公测,Agent 能跨对话记住上下文了

Claude 给托管 Agent 加了个记忆层,现在你的 Agent 可以从每次对话里学东西。官方说法是“智能优化的记忆层”,在性能和灵活性之间找平衡。但正文没披露记忆容量有多大、能记多久、怎么收费、哪些账号能用。对从业者来说,关键看两点:一是持久记忆什么时候变成默认配置,二是这会让 Agent 的评测和状态管理怎么变。

推荐理由:Claude 给托管代理加了记忆,这是个实打实的产品更新,对做代理的人吸引力够强,所以 H 和 R 都站得住。但公告信息量太薄,关键参数一个没给,K 这块只能打折扣,整体够不上 p1,放在 featured 低段比较合适。

FT · 科技

英国正跟 Anthropic 谈,想让银行用上 Mythos 模型做网络安全测试

英国政府正在和 Anthropic 接触,讨论让英国银行能接触到 Mythos 模型。目前公开的说法是用途会限定在网络安全测试上。不过这篇报道正文被付费墙挡住了,Mythos 具体能做什么、怎么部署、哪些银行能参与、什么时候落地,这些关键信息都没披露。这件事的重点不是银行要搞一个通用的 AI 工具,而是金融业能不能拿到一个前沿的、攻防兼备的安全模型的受...

推荐理由:FT 报道英国正和 Anthropic 谈,想让银行在网络安全测试场景下用 Mythos。我会先打个折:正文没写模型到底能干什么、怎么部署、给谁用、什么时候上线,所以现在只能当个信号看。但这件事的钩子在于,它不是普通 AI 采购,而是高敏感安全工具的受控入口,金融业拿到这种权限本身就值得关注。风险点也很明显,一旦落地,合规和供应商准入问题会立刻被放大。

X · @dotey(宝玉)

Codex 接入 GPT-5.5,新增浏览器操控、文档生成和自动审查,从写代码工具转向干活智能体

Codex 现在能用 GPT-5.5 了,一口气加了五个能力。它能直接操控浏览器,自己点击页面、填表、截图看结果,走完整个流程再告诉你哪里有问题。文档方面,可以在 Microsoft Office 和 Google Drive 里直接生成表格、幻灯片和文档,应用内还加了文件预览器,改完就能看效果。电脑操控能力跟着 GPT-5.5 增强,能看屏幕、点击、...

推荐理由:这次 Codex 更新干货不少,核心不是简单挂了个新模型,而是把定位从代码助手往能跑连续任务链的智能体上推。我会先打个折:正文是二手消息,没给定价、没讲推送范围,也没交代那个审查智能体的安全门槛到底设在哪,所以先别太激动。但五个升级里,浏览器和电脑操控、跨办公套件生成文档、自动审查这几项,确实让 Codex 的干活边界变宽了,值得从业者盯着后续落地细节。

X · @claudeai

Claude 新增 TripAdvisor、Booking、Resy 等十来个生活类 App 连接

Claude 官方发了一条产品更新,说现在能连接更多非工作类 App,列了 TripAdvisor、Booking.com、Resy、Instacart、Spotify、Audible、AllTrails、Thumbtack、TurboTax 等至少 10 个。正文没披露具体怎么连、能执行哪些操作、支持哪些地区、权限范围多大、什么时候推完。我会先打个折...

推荐理由:这是 Anthropic 官方产品更新,HKR 三项都踩中了。钩子是 Claude 从办公工具杀进生活消费场景,知识点是新增至少 10 个消费 App 连接器但操作细节和上线范围全都没说,关联点在于它把“助手能不能代办个人事务”这个平台级问题摆上了台面。分数维持 75,因为目前只是列了 App 名字,正文没给出可执行动作、权限边界、地区限制和发布时间,我会先打个折,等后续披露再考虑上调。

Hacker News 首页

GPT-5.5 在漏洞挖掘上追平了没公开的 Mythos,而且人人都能用

安全公司 XBOW 用真实漏洞库测了 GPT-5.5,漏报率压到 10%,比 GPT-5 的 40% 和 Opus 4.6 的 18% 都低。更关键的是,GPT-5.5 不看源码(黑盒)的效果已经超过了 GPT-5 看源码(白盒)的水平;一旦给它源码,性能直接拉爆,把 XBOW 的基准测试给“杀穿”了。在模拟登录这类实操任务里,它登录成功的交互轮次只有...

推荐理由:我会先打个折:数据来自 XBOW 自家的漏洞基准,不是 OpenAI 官方发布,所以不能当定论。但信息量够硬——GPT-5.5 在黑盒条件下漏报率只有 10%,比 GPT-5 有源码时的 40% 低了一大截,也比 Opus 4.6 的 18% 强。视觉敏锐度 97.5%,登录目标系统需要的尝试次数直接砍半,说明模型在真实攻击链里的效率明显跳了一级。XBOW 把它类比成 Mythos 级别的能力,这点先别太激动,正文没披露测试环境是否隔离、样本量多大、有没有针对性微调。不过对做攻防和安全评估的人来说,这个信号足够盯紧了:模型在没看到源码的情况下已经能...

Hacker News 首页

Anthropic 复盘 Claude Code 近期质量下滑:三次产品层改动惹的祸,API 没受影响

Anthropic 发了一篇事故复盘,解释了最近不少用户感觉 Claude Code 变笨、变健忘的原因。问题出在三次产品层的改动上,API 和模型本身没变。第一,3 月 4 日他们把默认的思考强度从“高”调成了“中”,想解决高思考模式下界面卡死的问题,结果用户普遍觉得模型变蠢了,4 月 7 日又改了回去。第二,3 月 26 日上线了一个缓存优化,本意...

推荐理由:Anthropic 这份事后说明给了三个具体根因、时间点和修复版本,HKR 三项都站得住。比普通产品更新更有分量,因为它暴露了默认值、记忆处理和系统提示这些非模型层的改动也能把编码体验拉下来,但本质上还是一份事故报告,不是重大突破。

4月23日星期四

The Verge · AI

AI 订阅要开始挤利润了,重度用户先挨刀

Anthropic 这个月大幅收紧了第三方工具 OpenClaw 调用 Claude 的权限,把那些把 AI 当“自动化流水线工人”用的重度用户往更贵的付费套餐里赶。公司给出的理由是系统压力太大、盈利压力也大,工程师 Boris Cherny 直说现有的订阅套餐根本不适合这种用法。不过正文没披露具体涨了多少、新限额是多少、以及这次调整波及多大范围。简单...

推荐理由:Anthropic 把 Claude 的代理用量变成定价和准入问题,直接影响工具开发者和重度用户。HKR 三项都踩中了,但正文没披露具体价格、配额和生效范围,所以分数只能给到 featured 的低段。我会先打个折,这点先别太激动——通用订阅被代理式高消耗用法挤出单独计费层,才是真正值得盯的趋势。

X · @op7418(歸藏)

Claude 桌面端能接第三方模型了,走开发者模式填 API 就行

有人在 Claude 桌面端发现一个入口:不登录状态下,从 Help → Troubleshooting 开启开发者模式,重启后右上角会多出 Developer 选项,里面可以配置第三方推理服务的 API 地址和 Key,点 Apply locally 就能用。这意味着客户端可以直接把请求打到别的模型或自建的 Claude API 上,不经过 Anth...

推荐理由:我会先打个折:这只是单条 X 帖子,Anthropic 没官宣支持范围、模型白名单或后续政策,所以分数停在 74。但 HKR 三项都踩中了——入口够隐蔽、路径可复现、话题直接打在客户端锁定上。正文没披露 Anthropic 是否默许,这点先别太激动,但如果是真的,等于 Claude 桌面端自己把围墙拆了个口子。

新智元 · 公众号

Anthropic 在私募二级市场报价冲到 1.05 万亿到 1.15 万亿美元,首次超过 OpenAI 的约 8800 亿美元

这个数字来自私募二级平台(比如 Forge Global)上的报价,不是新一轮融资估值。三个月前 Anthropic 的融资估值还是 3800 亿美元,现在二级市场直接翻了三倍左右。市场给出的理由是流通股少、Claude Code 和收入增长势头猛。但正文没披露实际成交量、具体收入数字,也没公司官方确认,所以这个万亿身价更像少数交易撑起来的价格,先别太当真。

推荐理由:我会先打个折:这不是官方融资估值,而是私募二级平台的报价,成交量、收入规模和公司确认都没披露,所以别太激动。但信息本身有嚼头——它把 Anthropic 从三个月前 3800 亿的融资估值直接拉到万亿级别,背后是流通股少、Claude 产品势头和投资者情绪在起作用。对从业者来说,这更像一个市场温度计,而不是一张成绩单。

纽约时报中文网

Anthropic 造了个能找软件漏洞的模型 Mythos,现在只给美国用,连盟友都急了

Anthropic 发布了一个叫 Mythos 的模型,专门用来发现银行、电网和政府软件里的隐藏漏洞。公司说它太危险,不能公开,目前只跟美国 11 家科技公司和 40 多家关键基础设施机构共享,海外只有英国拿到了访问权。英国安全研究所的测试证实,Mythos 能完成以前任何 AI 都做不到的复杂网络攻击。欧盟、德国等盟友还没拿到模型,只能干着急;中国和...

推荐理由:这篇不是常规模型发布,更像一次准地缘政治的网络能力管制实验。Anthropic 把 Mythos 圈在极小范围,只给美国及英国部分机构用,还拉上 11 家合作方修漏洞,说明他们自己都怕这东西被滥用。正文没披露具体评测方法和基准分数,所以“比核弹还糟糕”这种说法先打个折,但 18 个月内类似能力扩散的预估值得盯紧。

X · @claudeai

Claude Cowork 现在能直接在对话里生成可交互的图表了

Anthropic 给 Claude Cowork 加上了交互式图表和示意图功能,目前是 beta 版,所有付费套餐都能用。正文只说了这两点,没提支持哪些图表格式、怎么编辑、什么时候全量放开,也没说权限上有没有限制。

推荐理由:这条放在 featured 低段,靠的是 Anthropic 的信源分量和 Claude 用户群匹配度。钩子够具体——交互式图表直接进协作界面,不是画饼;知识增量也有,beta 覆盖所有付费方案这点是实打实的新信息。但我会先打个折:正文没交代怎么生成、支持哪些图表格式、能不能在协作流里直接改,这些缺口让讨论深度上不去,所以 R 分弱。整体判断是值得从业者扫一眼,但暂时没法展开聊。

The Verge · AI

Anthropic 的漏洞挖掘模型 Mythos 进了多个联邦机构,唯独漏了美国网络安全局 CISA

Axios 的消息说,Anthropic 那个专门找漏洞的模型 Mythos Preview 已经在商务部、国安局(NSA)等几个联邦机构用上了,但负责全国网络防御的 CISA 反而没拿到访问权限。文章没解释为什么偏偏跳过 CISA,也没提模型的具体性能、收费方式和部署规模。目前特朗普政府正在和 Anthropic 谈更广泛的合作,但 CISA 在现政...

推荐理由:我会先打个折:正文只说了谁在用、谁没在用,模型本身长什么样、花多少钱一概没提。但这条消息的看点不在技术,而在安排——管网络安全的部门反而没拿到漏洞发现模型,这要么是流程卡壳,要么是有意绕开。对从业者来说,这比一个模型刷榜更值得留意,因为它直接关系到联邦 AI 采购的走向和权限分配。

Hacker News 首页

有创业公司开始炫耀 AI 账单比员工工资还高,把 token 花费当成增长指标

Swan AI 的 CEO 发帖说,他们 4 个人的团队一个月给 Claude 花了 11.3 万美元,他把这笔钱看作本该用来招人的预算,目标是不到 10 个人做到 1000 万美元年收入。Fundable AI 的联合创始人也在底下附和,说 AI 能顶一个 15 人的文档处理团队。文章点出一个风向:token 花费正在被当成一种新的虚荣指标,但花得多...

推荐理由:我会先打个折:这篇不是硬核技术进展,而是一篇评论性质的趋势观察。H 分给得高,是因为它把“AI 账单超过人力成本”这个反转直接摆到台面上,容易引发讨论。K 分靠的是 Swan AI 那个 11.3 万美元/月的 Claude 账单,数字够具体,能让人直观感受小团队在模型调用上的投入有多猛。R 分确实有,它踩中了“用 token 消耗替代人头”的焦虑,但正文自己也承认这更像一种增长指标而非已验证的 ROI,Fundable AI 说能替代 15 人团队的说法也没给出验证细节,所以不能当市场级事件来推。整体判断:值得从业者看一眼,但别急着把它当成行业拐点。

4月22日星期三

The Verge · AI

Anthropic 最危险的模型 Mythos 被一群 Discord 用户白嫖了两周

事情很简单:Anthropic 的一个承包商权限没管好,加上网上公开的搜索技巧,让一小撮 Discord 用户摸到了内部模型 Claude Mythos Preview。这个模型能找出主流操作系统和浏览器里的漏洞并利用它们,听起来确实吓人。但报道里没写清楚到底有多少人拿到了权限、用了多久、Anthropic 现在有没有把漏洞堵上。核心问题其实是访问控制...

推荐理由:标题党归标题党,但这事本身是实打实的访问控制翻车。正文没披露到底多少人摸到了模型、摸了多久、修没修好,所以我会先打个折。真正值得盯的不是“最危险的模型”这种定性,而是入侵路径太简单了:承包商权限加常规侦查工具就进去了。如果是真的,说明 Anthropic 在第三方权限管理和模型隔离上出了纰漏,这对所有做前沿模型的公司都是一记警钟。