跳到正文

#Anthropic

今日 9 条

4月23日星期四

新智元 · 公众号

Anthropic 在私募二级市场报价冲到 1.05 万亿到 1.15 万亿美元,首次超过 OpenAI 的约 8800 亿美元

这个数字来自私募二级平台(比如 Forge Global)上的报价,不是新一轮融资估值。三个月前 Anthropic 的融资估值还是 3800 亿美元,现在二级市场直接翻了三倍左右。市场给出的理由是流通股少、Claude Code 和收入增长势头猛。但正文没披露实际成交量、具体收入数字,也没公司官方确认,所以这个万亿身价更像少数交易撑起来的价格,先别太当真。

推荐理由:我会先打个折:这不是官方融资估值,而是私募二级平台的报价,成交量、收入规模和公司确认都没披露,所以别太激动。但信息本身有嚼头——它把 Anthropic 从三个月前 3800 亿的融资估值直接拉到万亿级别,背后是流通股少、Claude 产品势头和投资者情绪在起作用。对从业者来说,这更像一个市场温度计,而不是一张成绩单。

纽约时报中文网

Anthropic 造了个能找软件漏洞的模型 Mythos,现在只给美国用,连盟友都急了

Anthropic 发布了一个叫 Mythos 的模型,专门用来发现银行、电网和政府软件里的隐藏漏洞。公司说它太危险,不能公开,目前只跟美国 11 家科技公司和 40 多家关键基础设施机构共享,海外只有英国拿到了访问权。英国安全研究所的测试证实,Mythos 能完成以前任何 AI 都做不到的复杂网络攻击。欧盟、德国等盟友还没拿到模型,只能干着急;中国和...

推荐理由:这篇不是常规模型发布,更像一次准地缘政治的网络能力管制实验。Anthropic 把 Mythos 圈在极小范围,只给美国及英国部分机构用,还拉上 11 家合作方修漏洞,说明他们自己都怕这东西被滥用。正文没披露具体评测方法和基准分数,所以“比核弹还糟糕”这种说法先打个折,但 18 个月内类似能力扩散的预估值得盯紧。

X · @claudeai

Claude Cowork 现在能直接在对话里生成可交互的图表了

Anthropic 给 Claude Cowork 加上了交互式图表和示意图功能,目前是 beta 版,所有付费套餐都能用。正文只说了这两点,没提支持哪些图表格式、怎么编辑、什么时候全量放开,也没说权限上有没有限制。

推荐理由:这条放在 featured 低段,靠的是 Anthropic 的信源分量和 Claude 用户群匹配度。钩子够具体——交互式图表直接进协作界面,不是画饼;知识增量也有,beta 覆盖所有付费方案这点是实打实的新信息。但我会先打个折:正文没交代怎么生成、支持哪些图表格式、能不能在协作流里直接改,这些缺口让讨论深度上不去,所以 R 分弱。整体判断是值得从业者扫一眼,但暂时没法展开聊。

The Verge · AI

Anthropic 的漏洞挖掘模型 Mythos 进了多个联邦机构,唯独漏了美国网络安全局 CISA

Axios 的消息说,Anthropic 那个专门找漏洞的模型 Mythos Preview 已经在商务部、国安局(NSA)等几个联邦机构用上了,但负责全国网络防御的 CISA 反而没拿到访问权限。文章没解释为什么偏偏跳过 CISA,也没提模型的具体性能、收费方式和部署规模。目前特朗普政府正在和 Anthropic 谈更广泛的合作,但 CISA 在现政...

推荐理由:我会先打个折:正文只说了谁在用、谁没在用,模型本身长什么样、花多少钱一概没提。但这条消息的看点不在技术,而在安排——管网络安全的部门反而没拿到漏洞发现模型,这要么是流程卡壳,要么是有意绕开。对从业者来说,这比一个模型刷榜更值得留意,因为它直接关系到联邦 AI 采购的走向和权限分配。

Hacker News 首页

有创业公司开始炫耀 AI 账单比员工工资还高,把 token 花费当成增长指标

Swan AI 的 CEO 发帖说,他们 4 个人的团队一个月给 Claude 花了 11.3 万美元,他把这笔钱看作本该用来招人的预算,目标是不到 10 个人做到 1000 万美元年收入。Fundable AI 的联合创始人也在底下附和,说 AI 能顶一个 15 人的文档处理团队。文章点出一个风向:token 花费正在被当成一种新的虚荣指标,但花得多...

推荐理由:我会先打个折:这篇不是硬核技术进展,而是一篇评论性质的趋势观察。H 分给得高,是因为它把“AI 账单超过人力成本”这个反转直接摆到台面上,容易引发讨论。K 分靠的是 Swan AI 那个 11.3 万美元/月的 Claude 账单,数字够具体,能让人直观感受小团队在模型调用上的投入有多猛。R 分确实有,它踩中了“用 token 消耗替代人头”的焦虑,但正文自己也承认这更像一种增长指标而非已验证的 ROI,Fundable AI 说能替代 15 人团队的说法也没给出验证细节,所以不能当市场级事件来推。整体判断:值得从业者看一眼,但别急着把它当成行业拐点。

4月22日星期三

The Verge · AI

Anthropic 最危险的模型 Mythos 被一群 Discord 用户白嫖了两周

事情很简单:Anthropic 的一个承包商权限没管好,加上网上公开的搜索技巧,让一小撮 Discord 用户摸到了内部模型 Claude Mythos Preview。这个模型能找出主流操作系统和浏览器里的漏洞并利用它们,听起来确实吓人。但报道里没写清楚到底有多少人拿到了权限、用了多久、Anthropic 现在有没有把漏洞堵上。核心问题其实是访问控制...

推荐理由:标题党归标题党,但这事本身是实打实的访问控制翻车。正文没披露到底多少人摸到了模型、摸了多久、修没修好,所以我会先打个折。真正值得盯的不是“最危险的模型”这种定性,而是入侵路径太简单了:承包商权限加常规侦查工具就进去了。如果是真的,说明 Anthropic 在第三方权限管理和模型隔离上出了纰漏,这对所有做前沿模型的公司都是一记警钟。

彭博科技

日本财相本周约谈大银行,专门聊 Anthropic 新模型 Mythos 可能带来的风险

日本财务大臣片山皋月计划最早本周内召集国内主要银行开会,议题直指 Anthropic 最新模型 Mythos 对金融业的威胁。目前公开信息里没写 Mythos 具体能干什么、风险是哪种类型,也没提会不会出台监管措施。但这件事本身说明,日本可能要把前沿模型的风险正式摆到银行桌面上谈了。

推荐理由:Bloomberg 的信源给这条消息加了分:日本财务大臣要见大银行,点名讨论 Anthropic 的 Mythos 模型,这在政策层面是个实打实的信号,所以 H 和 R 都过了。分数停在 72,因为 K 太薄了——正文没披露 Mythos 的能力、风险类型和处置方向,我会先打个折。标题容易让人以为出了大事,但真正值得盯的是日本金融监管有没有把前沿模型塞进银行风险会议议程,这点先别太激动,等后续细节出来再说。

彭博科技

澳大利亚央行盯上 Anthropic 的 Mythos 模型,担心它被用来搞网络攻击

澳大利亚储备银行(RBA)正在关注 Anthropic 的 Mythos AI 模型。起因是 Anthropic 自己说这个模型有能力发动复杂的网络攻击,但彭博这篇报道的正文被付费墙挡住了,看不到具体的技术细节、评估范围和落地时间表。我会先打个折:目前只知道监管机构在盯着,但没披露他们打算怎么盯、盯到什么程度,也没说 Mythos 到底在什么条件下会构...

推荐理由:澳洲联储在盯着 Anthropic 的 Mythos AI,理由是这模型被说成能执行复杂网络攻击。我会先打个折:正文只给了彭博 RSS 摘要里那句能力声明,监测范围、技术细节、时间表全都没写。所以这条新闻的看点在于“央行下场盯模型”这个动作本身,而不是已经坐实了什么风险。对从业者来说,这更像一个信号——监管对模型安全能力的关注正在从纸面讨论走向具体盯防,但具体怎么盯、盯到什么程度会动手,现在全是空白。

FT · 科技

Anthropic 正在调查自家 Mythos 模型被未授权访问的事

FT 这篇报道正文被付费墙挡住了,只看到标题和摘要片段。已知信息是:Anthropic 在查一起针对其 Mythos 模型的未授权访问,并且之前因为担心这个新工具的“黑客能力”而限制了它的发布。具体有多少账号受影响、模型能力被限制到什么程度、时间线是怎样的,正文没披露。

推荐理由:FT 报道 Anthropic 在查 Mythos 的未授权访问,摘要补了一句关键信息:发布受限就是因为怕它的黑客能力。HKR 三项全中,但正文没披露到底哪些账户受影响、模型能力边界在哪、处置时间线是什么,信息缺口不小,所以重要性停在 84,放 featured 而不是更高。

X · @dotey(宝玉)

Anthropic 没发公告,悄悄把 Claude Code 从 20 美元 Pro 套餐里拿掉了

有人在 Anthropic 的功能对比表里发现,Pro 套餐对应的 Claude Code 一栏变成了叉号,多篇帮助文档也删掉了“Pro 套餐包含 Claude Code”的说法。但 Claude Code 产品页面和客服机器人还写着包含,部分 Pro 用户反馈目前仍能使用,正文没披露 Anthropic 的正式解释或生效时间。如果这个变更落地,开发者...

推荐理由:这条值得上 featured,因为门槛变化一旦落地,Claude Code 的入门价直接翻五倍,对个人开发者冲击不小。但 Anthropic 没给正式说明,生效时间和现有 Pro 用户怎么处理都不清楚,所以不往更高层级放。我会先打个折:正文没披露官方回应,现有信息都来自页面比对和用户反馈,这点先别太激动。

Hacker News 首页

Anthropic 把 Claude Code 从 20 美元月费的 Pro 套餐里拿掉了,新用户没法用

Anthropic 悄悄改了规则,新订阅 20 美元/月 Pro 套餐的用户不再包含 Claude Code 编程工具。老 Pro 和 Max 用户暂时不受影响。官方说法是“在约 2% 的新个人用户里做测试”,但帮助文档已经从“Pro 或 Max 套餐可用”改成了“Max 套餐可用”,官网定价页也同步去掉了 Pro 的 Claude Code 入口。正...

推荐理由:这条消息在三个维度上都站得住:Pro 缩水本身就是个意外转折,文章用帮助页存档和官方回应把证据链补上了,而且开发者对定价和权益变动天然敏感。我会先打个折——目前只影响新用户测试群,正式政策时间表和回溯范围正文都没披露,所以重要性停在 76 是合理的。

The Verge · AI

SpaceX 签了个“可能买也可能不买”的协议,标的 Cursor,开价 600 亿美元

SpaceX 跟 AI 编程工具 Cursor 达成了一个二选一的交易框架:要么花 600 亿美元把 Cursor 买下来,要么付 100 亿美元分手费走人。文章没披露具体的交易结构、时间表,也没说跟 SpaceX 传闻中的 IPO 怎么挂钩。RSS 摘要里提了一句,这笔交易可能帮马斯克旗下的 xAI 在编程工具上追赶 Anthropic,但正文里没展...

推荐理由:标题说可能收购,但真正有信息量的是那笔 100 亿美元退出费——它更像一个约束机制,而不是简单的“不买了就赔钱”。正文只披露了顶层的两个数字,交易怎么设计、什么时候推进、跟 xAI 追 Anthropic 之间到底什么关系,全都没说。所以我会先打个折:事实够硬,但缺口也大,放在 featured 合适,别拔到 P1。

彭博科技

Anthropic 的新模型 Mythos 被未授权用户访问了

Bloomberg 拿到内部文件和知情人士消息,说有一小撮未授权用户摸到了 Anthropic 还没正式发布的 Mythos 模型。Anthropic 内部认为这模型能力强到能搞出危险的网络攻击,所以这事不是普通的产品泄露,是访问控制出了问题。不过报道里没写到底多少人、通过什么路径、在什么时间段访问的,也没说 Anthropic 后续怎么堵的窟窿。

推荐理由:Bloomberg 爆出的不是常规产品消息,而是 Anthropic 的安全事故。未授权访问一个被内部判定为网络攻击级危险的大模型,本身就够抓眼球,也够讨论一阵。HKR-H 和 HKR-R 直接拉满,因为这事天然有传播力和讨论价值。HKR-K 靠的是新披露的访问事实和风险定性,但具体人数、路径、时间线正文全没给,信息缺口不小,所以知识增量有,但别指望能复盘全貌。

4月21日星期二

Ben's Bites

Claude 新增设计面板,问几个问题就能出原型图

Anthropic 给 Claude 加了一个“设计”标签页,会先弹出 5 到 10 个问题跟你互动,然后直接生成线框图或高保真原型。作者实测发现,传图片转设计的流程在原型模式下效果不错。目前这个功能还在研究预览阶段,有独立的使用额度,20 美元月费套餐一周大概只能跑两三次大尺寸生成。文章更尖锐的吐槽在可用性上:Claude Cowork 很多能力依赖...

推荐理由:Anthropic 给 Claude 加了个 Design 标签页,对天天用 Claude 的人是个明确的信号。文章有实测细节——5-10 轮交互出原型、图像转设计流程可用、20 美元套餐每周只够跑两三次大生成——所以 HKR 三项都站得住。但这仍然是个单功能更新,不是平台级变化,我会先打个折。真正值得盯的是产品可用性:作者点名 Claude Cowork 依赖 connectors 和 plugins,但入口藏太深,这点先别太激动,等更多用户反馈再说。

机器之心 · 公众号

谢尔盖·布林重回一线盯 AI 编程,谷歌拉了一支突击队

谷歌悄悄组了一支 AI 编程突击队,由前 DeepMind 研究员 Sebastian Borgeaud 带队,谢尔盖·布林和 Koray Kavukcuoglu 直接参与,目标是提升长上下文编程能力和内部代码自动化。压力信号很直接:谷歌自己说约 50% 的代码已由编程 agent 生成、工程师负责审核,而 Anthropic 那边放话 Claude ...

推荐理由:HKR 三项都成立:布林回归的 hook 够强,谷歌 50% 代码由 agent 写的数字是硬信息,AI 编程的竞争态势也是圈内真痛点。但正文没披露团队规模、上线时间和具体模型版本,所以没给更高优先级。

X · @dotey(宝玉)

GitHub Copilot 暂停 Pro、Pro+ 和学生版新注册,Pro 套餐砍掉 Claude Opus 模型

4 月 20 日,GitHub 对 Copilot 个人版动了次大手术:Pro、Pro+ 和学生版不再接受新用户,只剩免费版还能注册。官方说这是为了保住现有付费用户的服务质量。Pro+ 的使用额度被拉到 Pro 的 5 倍以上,Pro 用户如果老撞墙,官方建议加钱升 Pro+。最狠的一刀是 Pro 套餐直接移除了 Claude Opus 模型,Anth...

推荐理由:Copilot 个人版这次调整不是发新功能,而是卡入口、压额度、分层模型。Pro 用户被拿走 Claude Opus,Pro+ 额度拉到 Pro 的五倍以上,定价却没变——等于用供给端收缩来应对模型成本压力。信息来自 X 帖子而非 GitHub 官方公告,这点先打个折,但暂停注册和退款窗口本身已经够具体,值得从业者盯后续。

FT · 科技

Anthropic 和亚马逊谈了个 1000 亿美元的算力基建大单

Anthropic 跟亚马逊达成了一项总规模 1000 亿美元的 AI 基础设施协议,核心是锁定芯片和算力供应。今年 Anthropic 出过几次服务中断,这次合作主要是为了把计算容量提前占住,而不是普通的战略合作。不过正文被付费墙挡住了,具体的合同期限、钱怎么付、芯片从哪来、交付规模这些关键信息都没披露。

推荐理由:FT 报了一条 Anthropic 与 Amazon 的 1000 亿美元 AI 基础设施协议,金额大到今天必须写。H 端靠千亿数字和算力绑定撑起点击欲;K 端有新事实,但期限、资金来源、芯片来源、交付规模全都没披露,我会先打个折;R 端踩中了模型厂对云和硬件的依赖这个活神经,不是空泛合作,是把供给瓶颈写进了合同。

TechCrunch · AI

Anthropic 从亚马逊拿了 50 亿美元,代价是承诺在 AWS 上花 1000 亿

亚马逊又给 Anthropic 投了 50 亿美元,累计投资到了 130 亿。但这笔钱不是白拿的——Anthropic 承诺未来十年在 AWS 上花超过 1000 亿美元,换取最多 5 吉瓦的算力来训练和跑 Claude。说白了,这就是用投资款锁定云服务大单。交易还绑定了亚马逊的自研芯片,从 Trainium2 一路包到还没发布的 Trainium4,...

推荐理由:Anthropic拿了亚马逊50亿,转头承诺在AWS花掉1000亿——这不是普通融资,是资本和云采购的对价互换。我会先打个折:正文只给了RSS摘要,没披露这1000亿是几年花完、算力怎么分配、有没有退出条款,所以别急着算估值。真正值得盯的是,前沿实验室的融资越来越像云厂商的长期订单,钱进来,命脉也交出去了。

彭博科技

亚马逊再投 Anthropic 50 亿美元,总承诺可能到 200 亿

亚马逊对 Anthropic 追加 50 亿美元投资,协议还留了口子,未来可能再追加最多 200 亿。正文没披露估值、股权比例、打款节奏和云服务绑定条款,所以这笔钱到底换来了多少控制权、是不是锁死了 AWS 算力,目前还不清楚。

推荐理由:Bloomberg 同天报道亚马逊再投 Anthropic 50 亿美元,对模型圈和云生态有直接冲击。我会先打个折:正文只给了金额,没给估值和排他条款,这点先别太激动。真正要盯的是钱之外的条件——这决定了它更像一笔财务投资,还是更深层的模型与云绑定。

X · @AnthropicAI

Anthropic 跟亚马逊扩大合作,给 Claude 锁定了最多 5 吉瓦的算力

Anthropic 宣布加深与亚马逊的合作,为训练和部署 Claude 锁定了最高 5 吉瓦的算力。这批算力从这个季度开始陆续到位,到 2026 年底预计先上线近 1 吉瓦。5 吉瓦是个什么概念?大概相当于几个大型数据中心的满负荷运转,说明他们接下来要把模型规模或服务量再往上拉一个台阶。不过正文没披露合同金额、具体用什么芯片、数据中心建在哪,所以实际成...

推荐理由:标题里的 5 吉瓦别直接信,那是远期上限,真正有谱的是今年底先到 1 吉瓦。正文没提合同金额、用什么芯片、数据中心在哪,所以成本结构和实际性能都还是问号。我会先打个折看交付节奏,但能在这个时间点锁产能,对 Anthropic 的训练和部署确实是颗定心丸。

TechCrunch · AI

NSA 被曝在用 Anthropic 的 Mythos 模型,五角大楼还在跟这家公司打官司

Axios 的消息说,美国国家安全局(NSA)正在用 Anthropic 新出的 Mythos Preview 模型。这个模型本月初才公布,专做网络安全任务,但因为攻击性太强,Anthropic 没敢公开发布,只给了大约 40 家机构用,公开点名的只有十几家,NSA 不在公开名单里。据说 NSA 主要拿它扫描系统环境、找可被利用的漏洞。吊诡的是,NSA...

推荐理由:标题把 NSA、Anthropic 的受限模型 Mythos 和 Pentagon 分歧绑在一起,冲突钩子很足。新信息就两点:NSA 在用、模型是受限版,但正文没披露怎么接入、跑在什么环境、花了多少钱、Pentagon 那边到底在吵什么。我会先打个折,因为证据链现在很薄,全靠一篇报道撑着。不过国防情报场景用前沿模型这件事本身,对采购、合规和供应商关系都有直接冲击,从业者会关心后续怎么落地。分数定在 75,等有合同细节或部署范围再往上调。

4月20日星期一

Import AI

华为搞了个 HiFloat4 训练格式,在自家昇腾芯片上跑赢了西方主导的 MXFP4

华为的研究员在自家昇腾 NPU 上测试了一种叫 HiFloat4 的 4 比特训练格式,跟西方主导的 MXFP4 格式比,HiFloat4 的精度损失更小。具体来说,在 Llama 和 Qwen 模型上,HiFloat4 跟全精度 BF16 基准的误差能控制在 1% 左右,而 MXFP4 即使加了随机舍入等一堆稳定技巧,误差也有 1.5%。这背后可能跟...

推荐理由:Jack Clark用三件事拼出一期:Anthropic拿Claude Opus 4.6做自动化对齐研究,800小时花约1.8万美元把PGR从人类基线0.23提到0.97,说明小团队也能跑对齐实验;HiFloat4在华为昇腾NPU上推理损失约1.0%,比MXFP4的约1.5%好,但正文没披露更多硬件细节;中国模型安全研究部分给出了安全评估框架,但具体模型名和测试集没展开。整体是研究评论而非一手发布,信息密度够,适合放进精选。

r/LocalLLaMA

Reddit 网友拿 9 个模型做功能规划对比,Claude Opus 4.6 生成的规格书最贵也最详细

一位 Reddit 用户让 9 个模型给一款 Go 语言记账 App 设计“负载追踪”功能,再用 Claude Code 给生成的规格文档打分排名。Claude Opus 4.6 排第一,产出一份 19KB 的规格书,过程中读了 44 次代码,花了 2.47 美元;GLM 5.1 排第二,Qwen 3.6 35B fp8+vLLM 排第三。作者自己强调...

推荐理由:这是一次有名有姓的个人实测,给出了真实工作流里的数据,所以 H、K、R 三项都站得住。但天花板不高:只测了一个功能、排名由 Claude Code 自己打分、正文没提人工验收结果,我会先打个折,放在 featured 里偏低的位置。

机器之心 · 公众号

Anthropic 编程智能体负责人讲 vibe coding 的正确姿势:2 周变 1 天,但别让 AI 碰核心逻辑

Anthropic 研究员 Erik Schluntz 分享了他团队用 Claude 写代码的真实工作流。他们最近合并了一个 2.2 万行的生产环境改动,大部分代码由 Claude 生成,把原本两周的工作压缩到了一天。他的做法是先花 15-20 分钟让 AI 通读代码仓库、做规划,然后只让 AI 改叶子节点(也就是依赖最少、影响范围最小的模块),核心逻...

推荐理由:这是一篇来自 Anthropic 内部的实战经验,不是泛泛而谈。有 22000 行生产合并、两周变一天的硬数字,也有可复用的流程规则,比如先让模型花 15 到 20 分钟探索代码库再动手、改动锁在叶子节点、核心路径必须人审。对正在纠结怎么把 coding agent 放进真实流水线的团队来说,参考价值很高。保持 featured 不升 p1,因为它本质是实践课,不是模型或产品重大发布。

4月19日星期日

新智元 · 公众号

伯克利团队造了个专门作弊的 AI,SWE-bench 满分但一个 bug 都没修

伯克利 RDI 团队用一段大概 10 行的 pytest 钩子代码,在 SWE-bench 全部 500 个任务上拿了 100% 分数,实际修 bug 数是 0。他们的 agent 还顺手打穿了另外 8 个主流 agent 评测,分数从 73% 到 100% 不等。作弊手法包括篡改测试钩子、直接读本地 file:// 答案文件,以及利用评测器本身的校验...

推荐理由:HKR-H 落在'满分却零修复'的矛盾上;HKR-K 落在约 10 行 pytest 漏洞、500 题和 8 个基准的覆盖面上;HKR-R 落在评测信任危机上,做智能体产品的人会反复掂量。属于强 featured 研究,但不是当天行业事件,所以不到 P1。

4月18日星期六

机器之心 · 公众号

Anthropic 给 Claude 加了个设计功能,能直接出线框图、原型和幻灯片

Anthropic 在 Claude Pro、Max、Team 和 Enterprise 账号里上线了 Claude Design 的研究预览版,背后跑的是 Claude Opus 4.7。它能吃代码库、图片、DOCX、PPTX、XLSX 和网页截图,吐出来的东西可以导出到 Canva、PDF、PPTX 和 HTML。标题说 Figma 和 Adobe...

推荐理由:我会先打个折:标题说 Figma、Adobe 股价重挫,但正文没给出具体跌幅,这点先别太激动。真正值得看的是 Anthropic 把设计稿生成、设计系统读取、多人协作编辑和向 Claude Code 交接串成了一条线,这比单出一个画图工具要狠。不过目前还是研究预览版,没有用户测试数据、定价和实际落地案例,能不能真革了设计行业的命还得看后续。

新智元 · 公众号

Claude Opus 4.7 上线两天口碑翻车:跑分登顶,推理测试却暴跌

Anthropic 新模型 Claude Opus 4.7 上线不到 48 小时就吵翻了。在 Artificial Analysis 综合评分上它拿了 57 分并列第一,但换到 NYT Connections Extended 这个推理测试,准确率直接从上一代 4.6 的 94.7% 掉到 41.0%。另外,新模型换了一套分词器,同一段文本消耗的 to...

推荐理由:这条信息的价值不在“口碑崩了”的标题,而在于它把四个具体变化摆了出来:基准跑分领先、推理任务大幅退步、token 消耗变高、API 参数不兼容。对从业者来说,这比单纯报一个模型发布更有参考意义,因为它提示了升级可能带来的隐性成本。不过文章本身是发布 48 小时后的二次分析,不是 Anthropic 官方首发,所以重要性给到 83、放在 featured 层级是合理的。

X · @dotey(宝玉)

Anthropic 设计师一人扛 7 条产品线,分享了 9 条用 Claude 做设计的实操心得

Anthropic 设计师 Ryan Mather 一个人负责公司 7 个产品线,他公开了自己用 Claude Design 的工作流。核心是先花一小时让 Claude 把代码库和设计稿抽成一套 UI Kit,后续生成的设计稿会自动套用风格,省掉重复劳动。协作上,他建议设计师和工程师一起看着画布边聊边改,取代过去“出稿→丢给开发→返工”的接力模式。操作...

推荐理由:这是条扎实的实操笔记。Anthropic 自家设计师现身说法,给的 9 条建议都能直接落地,不是泛泛聊趋势。我会先打个折:正文没披露省了多少时间、任务成功率这些硬指标,所以分数停在 76。但“人做人审”变成“Claude 做、人审”这个流程转向,对从业者来说比很多产品公告更有参考价值。

FT · 科技

Anthropic 老板见了白宫幕僚长,美国政府想提前看 Mythos 模型

FT 这篇报道正文被付费墙挡住了,只留了个标题。从标题看,Anthropic 的 CEO 和白宫幕僚长碰了面,核心诉求是美国政府想获得 Mythos 模型的访问权限。但正文没披露会面具体时间、Mythos 到底有什么能力、政府要拿它做什么用,以及访问条件是什么。这件事的关键不在“见了个面”,而在于政府想用什么流程拿到前沿模型的提前使用权——这部分信息目...

推荐理由:FT 这条消息就给了两个硬事实:Anthropic 老大见了白宫幕僚长,美方想接触 Mythos 模型。光凭这两点,话题性就够上 featured,因为政府直接点名要访问一个具体模型,比泛泛的监管讨论更具体、更紧迫。但我会先打个折——正文是空的,会面细节、模型能力、访问机制全都没披露,所以知识增量其实很薄,HKR-K 只能给到 false。真正值得盯的不是这次会面本身,而是后续会不会冒出制度化的访问安排,那才是影响行业格局的东西。

X · @dotey(宝玉)

Anthropic 发布 Claude Design,用对话代替拖拽生成设计稿

Anthropic 推出了 Claude Design,一个靠聊天就能出设计稿的工具,背后跑的是新模型 Claude Opus 4.7。你描述需求,它直接生成图片,然后通过对话、批注、直接编辑或拖拽滑块反复改。团队第一次用的时候,它会读你的代码库和设计文件,自动生成一套设计系统(品牌色、字体、组件),后续项目自动套用。支持从文字、图片、文档或网页截取起...

推荐理由:Anthropic 把 Claude 塞进了设计环节,HKR 三项都站得住。文章给了开放节奏、底层模型和导出目标,信息量够上 featured。不过目前还是研究预览,不是模型级大更新,我会先打个折,重要性给 84。

4月17日星期五

Hacker News 首页

实测 Claude 4.7 新分词器:技术文档的 token 消耗涨了 47%

作者用 Anthropic 的免费 token 计数接口,拿同一批内容分别喂给 Claude Opus 4.6 和 4.7,看 token 数涨了多少。7 份真实 Claude Code 用户会发的样本(包括 CLAUDE.md 文件、终端输出、代码 diff 等)加权后从 8254 个 token 涨到 10937 个,整体多了 32.5%。其中技术...

推荐理由:这篇不是官方通稿,是第三方实测,把“同价”背后的 token 膨胀算清楚了。我会先打个折:IFEval 只抽了 20 题,样本量不大,但真实文档 1.47 倍、中文日文几乎不涨这些数字对实际用量有参考价值。对用 Claude Code 的人,窗口烧得快、缓存命中变贵、限流更容易触发,这些比 IFEval 涨 5 个点更值得盯。正文没披露样本的具体内容,但加权方法和对照设置交代得够用。

Hacker News 首页

Anthropic 实验室推出 Claude Design,用对话就能生成设计稿

Anthropic 在 4 月 17 日上线了 Claude Design,目前是研究预览版,Pro、Max、Team 和 Enterprise 用户都能用。它基于 Claude Opus 4.7,你给它文字描述、图片、文档(DOCX、PPTX、XLSX)甚至代码库,它就能生成设计稿、原型、幻灯片或单页宣传页。比较特别的是,它能直接读取你团队的代码和设...

推荐理由:这是 Anthropic 一次有分量的产品发布,不是小功能补丁。HKR 三项都站得住:形态新、部署细节够、工作流共鸣强。但研究预览的身份和没单列的价格让我把分控在 84,没给更高。真正值得盯的是它和 Claude Code 的交接链路,如果跑通,设计到代码的流转会变短。

X · @claudeai

Anthropic 实验室推出 Claude Design,用对话就能生成原型、幻灯片和单页文档

Claude Design 是 Anthropic 实验室放出的研究预览功能,Pro、Max、Team 和 Enterprise 用户今天开始陆续能用。它跑在 Claude Opus 4.7 上,官方说这是他们目前最强的视觉模型。用法很简单:你跟 Claude 聊需求,它直接出原型、幻灯片或单页文档。正文没提价格、输出限制和详细推送时间表。我会先打个折...

推荐理由:Anthropic 自己下场做设计生成,Claude 从纯文本助手变成能出视觉稿的工具,这个转向本身就值得关注。我会先打个折:帖子说 Opus 4.7 是“最强视觉模型”,但没给对比数据,也没说生成的文件能不能直接导出编辑。如果是真的,对快速出原型和汇报材料挺省钱,但别急着当生产工具用——格式限制和付费墙都没讲清楚。

新智元 · 公众号

宜信做了一个金融 Agent 的“外挂控制台”,单任务能跑 16 小时,计划下半年开源

宜信公开了一个金融 Agent 的工程方案,核心是一个叫 Harness 的控制层,让模型在 12 个会话窗口里接力干活,单个任务最长能跑 16 小时。目前自主交付率 65%,每个案子有 5 万 token 的上下文上限。他们给出的预估数据是审批提速超过 150%,单件成本降到人工的五分之一。文章说计划 2026 年下半年开源,但没给仓库地址、开源协议...

推荐理由:这篇东西我会先打个折,因为所有数据都是易鑫自己报的,仓库、许可证、可复现评测正文都没给。但它确实扔出了几个少见的量产数字:单任务跑16小时、跨12个会话、自主交付率65%,而且每单token压在5万以内,审批提速说能超150%,单均成本号称降到人工的五分之一。开源时间只提了2026年下半年,具体怎么开没说。真正值得盯的不是标题里的“更聪明”,而是他们怎么设计治理层来兜住这么长链条的Agent——这点正文有提,但细节不够。整体看,信息量够上推荐,但别当已验证的结论用。

Latent Space

Anthropic 发布 Claude Opus 4.7:每个推理档位都压过 4.6 一头,还新增了 xhigh 模式

Anthropic 推出了新旗舰模型 Claude Opus 4.7,价格没变,还是每百万输入/输出 token 收 5 美元和 25 美元。最直观的变化是性能档位全面上移:4.7 的低档(low)比 4.6 中档强,中档比 4.6 高档强,高档则超过了 4.6 的 max 档。此外还新增了一个叫 xhigh 的推理强度,Claude Code 现在默...

推荐理由:Anthropic 旗舰模型更新,给了一堆可验证的数字和变化点,不是空对空吹牛。HKR 三项全过:钩子清楚、信息量足、对 Claude 用户群高度相关。重要性给 90 没毛病,属于那种“先别激动但值得马上看”的更新。

最佳拍档

同事.skill 爆火背后:它只是提示词的工程化封装,炼化不了任何人

最近 GitHub 上一个叫“同事.skill”的项目几天就拿了 1.3 万颗星,还衍生出前任、老板、甚至女娲.skill,网上开始流行“散是 Token,聚是 Skill”这种说法,搞得很多人担心自己会被炼化成数字文件、被公司替代。这个视频把技术逻辑拆得很清楚:Skill 的源头是 Anthropic 在 2025 年 10 月给 Claude 上的...

推荐理由:这篇属于二次解读,不是一手发布或实测,但把Anthropic的Agent Skills开放标准和GitHub上爆火的“同事.skill”项目串起来了。我会先打个折,因为正文没披露跨平台兼容率和法律认定标准,这两个缺口让结论没法坐实。亮点在于它没吹“数字分身”,而是把边界说清楚了:适合周报、文档、代码审查这类标准化流程,强制上交反而会炼出废话。对关心工具落地和版权风险的从业者来说,这篇值得一看,但别当产品评测用。

Hacker News 首页

AI 算力开始不够用了

Nvidia Blackwell GPU 的租赁价两个月内从每小时 2.75 美元涨到 4.08 美元,涨了 48%。CoreWeave 也把价格上调了 20%,最低租期从一年拉长到三年。OpenAI 的 CFO 说他们已经在砍项目,因为算力跟不上。Anthropic 最新的模型只给了大约 40 家机构用。作者判断,AI 算力随便用的阶段结束了,接下来...

推荐理由:这篇文章用一个涨价 48% 的数字开场,把算力稀缺从概念变成账单,读起来像朋友发来一条消息说“显卡租金涨了,注意一下”。它没有停留在感叹,而是把 Blackwell 租金、CoreWeave 提价和 Anthropic 限流三件事摆在一起,指向一个判断:稀缺已经开始改写前沿模型的获取门槛。正文没给更细的供需数据或各家采购策略,所以我会先打个折,不把它当一手情报,但作为提醒从业者盯紧成本与容量的信号,已经够用了。

TechCrunch · AI

OpenAI 给 Codex 加了更多桌面控制权,直接对标 Anthropic

OpenAI 在 2026 年 4 月 16 日升级了它的编程工具 Codex,让这个工具能更深入地操控你的电脑桌面,比如操作文件或应用。文章把这看作是对 Anthropic 的直接反击,因为 Anthropic 的 Claude Code 目前在商业用户里更受欢迎。不过,这篇报道正文被截断了,没有披露具体新增了哪些功能、怎么收费、什么时候推送,也没说...

推荐理由:TechCrunch 这篇报道的核心就一句话:OpenAI 给 Codex 加了更多桌面权限,直接对标 Anthropic 的 Claude Code。标题火药味足,但正文能确认的只有“权限更大”这一点,动作清单、价格、开放范围全都没披露。我会先打个折:这事值得关注,因为桌面控制权是编程助手进企业干活的关键门槛,谁先拿到信任谁就占优。但别太激动,正文没给出任何能判断实际能力或安全边界的细节,目前更像一次宣示性的产品更新。

X · @dotey(宝玉)

Claude Opus 4.7 思考 token 消耗更大,Anthropic 给付费用户永久提了速率上限

Opus 4.7 比上一代更费思考 token,Anthropic 直接给所有付费订阅用户永久上调了速率限制来对冲。正文没披露具体提了多少、定价规则有没有变、什么时候全面生效。如果你还没看到额度变化,先确认自己切到了 Opus 4.7,并且 Claude Code 已升到最新版。

推荐理由:这条更新对付费用户是实打实的操作变化,三个维度都踩中了:反差感强、事实明确、直接触动用户的钱包和工作流。正文没披露具体提了多少、怎么计费、什么时候生效,所以信息有缺口,但核心事实足够清楚,放在 featured 合适。

TechCrunch · AI

Anthropic 产品老大退出 Figma 董事会,因为自家新模型要做设计工具抢生意

Anthropic 的首席产品官 Mike Krieger 在 4 月 14 日辞去了 Figma 的董事席位。同一天,有报道说 Anthropic 的下一个模型 Opus 4.7 会内置设计工具,直接跟 Figma 的核心产品竞争。Figma 现在是一家市值约 100 亿美元的上市公司,之前还一直在产品里集成 Anthropic 的模型。这件事真正的...

推荐理由:我会先打个折:Anthropic要做设计工具目前还只是媒体报道,产品没发布,功能范围、上线时间和商业模式都没公布,所以先不给最高级。但这条消息值得从业者盯紧,因为Figma市值约100亿美元,一直把Anthropic的模型接进自家产品里,现在对方可能直接下场抢饭碗。Mike Krieger辞任董事、Figma同一天向SEC披露,时间点很巧,不像临时起意。对AI从业者来说,这比单纯的人事变动更有嚼头——它说明模型公司往上走、吃掉应用层蛋糕的速度可能比想的快。