跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 641–660 条 · 共 1,303 条

7月1日星期三

AI HOT 精选

Anthropic 发布 Claude Sonnet 5,性能逼近更贵的 Opus 系列,部分测试反超

Anthropic 推出了新模型 Claude Sonnet 5,官方说这是目前最会自主干活的 Sonnet 版本——它能自己定计划、调用浏览器和终端这类工具。跑分全面超过上一代 Sonnet 4.6,在真实世界知识工作测试 GDPval-AA v2 上拿了 1618 分,比更贵的 Opus 4.8 还高出 3 分。不过,在智能体编程测试 SWE-be...

推荐理由:Anthropic 发了 Claude Sonnet 5,官方定位是 Sonnet 系列里最会自主干活的版本,能自己定计划、调浏览器和终端。跑分全面超过上一代 Sonnet 4.6,在 GDPval-AA v2 上拿了 1618 分,比更贵的 Opus 4.8 还高 3 分,这点挺有意思——中杯在知识工作测试里干翻了大杯。不过正文没披露 SWE-bench 智能体编程分数和定价,这两个数会决定它到底值不值得切过去。我会先打个折:如果价格没涨太多,日常用 Sonnet 的人可以直接换;如果涨价明显,就得等编程实测出来再判断。

Hacker News 首页

在 iOS 上装 Cursor 会悄悄且不可逆地改掉你的代码隐私设置

有用户发现,只要在 iOS 上安装并登录 Cursor,账户就会从旧的“不存储我的代码”隐私模式被强制切换到新的宽松模式。新模式下代码可能被用于后台代理等功能。更坑的是,一旦切换,旧选项会从所有菜单里消失,客服也承认他们没法帮你改回去。目前至少已有两人踩坑。如果你在意代码隐私,暂时别碰 iOS 版。

推荐理由:这条信息对用 Cursor 写代码的人是个实打实的警告。正文给出了明确的触发条件(装 iOS 版并登录)、后果(旧隐私选项永久消失、代码可能被用于后台代理)和客服确认无法回滚的截图,不是猜测。我会先打个折:目前只有两人报告,样本很小,但影响面可能随 iOS 版推广扩大。对在意代码隐私的开发者来说,知道“别碰 iOS 版”这个动作本身就值一个高优先级。

TechCrunch · AI

Anthropic 发布 Claude Sonnet 5,主打用更低成本跑 AI 智能体

Anthropic 推出了中杯模型 Claude Sonnet 5,核心卖点是让模型自己规划步骤、调用浏览器和终端这类工具去干活,而且比之前的大杯模型便宜。公司说,这种能自主执行任务的智能体能力,几个月前还得靠更大更贵的模型才能跑。这直接对标了 OpenAI 上周预览的 GPT-5.6 Sol 和 Google 5 月发布的 Gemini 3.5 Fl...

推荐理由:Anthropic 发了个中杯模型 Sonnet 5,主打更便宜地跑智能体,直接对标了 OpenAI 和 Google 的同类产品。模型发布本身就是硬新闻,而智能体的运行成本是开发者最头疼的问题之一,所以重要性、知识性和相关性三个维度都踩中了。没给更高分是因为正文没披露具体价格和性能对比数据,实际省多少钱还得等实测。

Hacker News 首页

Anthropic 发布 Claude Sonnet 5:自主干活能力追平 Opus 4.8,价格还便宜一截

Claude Sonnet 5 是 Anthropic 目前最能自主干活的中档模型。它能自己定计划、用浏览器和终端跑任务,在推理、写代码、工具使用这些指标上比上一代 Sonnet 4.6 强出一大截,表现已经接近旗舰 Opus 4.8。价格方面,正式定价是输入每百万 token 3 美元、输出 15 美元,8 月 31 号前有尝鲜价,输入 2 美元、输...

推荐理由:Anthropic 的中档主力模型做了一次大的 agent 升级,定价也清楚,当天就该写。分数没上 90,因为文章只给了基准对比,没放任务完成率或延迟数据,实际表现还得等社区跑完再看。

AI HOT 精选

Anthropic 发布 Claude Science,把文献、数据分析、画图和写论文塞进同一个科研工作台

Claude Science 是一个给科研人员用的 AI 工作台,现在对 Pro、Max、Team 和 Enterprise 用户开放测试。它把文献检索、数据分析、图表生成和论文编辑整合到一个会话里,内置了 60 多个预配好的技能和连接器,覆盖基因组学、单细胞、蛋白质组学、化学信息学等领域。每次输出都附带可审计的代码、运行环境和聊天记录,方便复现。计算...

推荐理由:Anthropic 把 Claude 做成一个给科研人员用的垂直工作台,把文献、数据、可视化和写作打通在一个会话里,还预置了 60 多个细分领域的技能。产品形态跟通用聊天界面拉开差距,硬核、知识密度和可复现性三个维度都踩中了。正文没披露具体定价和实际延迟数据,但光这个整合度和审计输出,就值得给 82 分。

Hacker News 首页

Anthropic 发布 Claude Science 桌面应用,主打科研分析与数据库检索

Anthropic 推出了一个叫 Claude Science 的桌面应用,目前是测试版。它把自己定位成“研究搭档”,能跑分析、搜数据库,还会把从数据整理到发表的每一步都记录下来,方便追溯。现在只提供 macOS 和 Linux 的下载链接,正文没提 Windows 版、定价,也没说背后用的是哪个模型。在跑分出来之前,可以先把它当成一个带审计追踪的研究助手。

推荐理由:Anthropic 发了新桌面应用 Claude Science,定位是带审计追踪的研究搭档,目前测试版只给了 macOS 和 Linux 下载。产品形态跟普通聊天壳子不一样,这点加分。但关键信息缺了不少:没提背后用哪个模型、没定价、也没 Windows 版,所以分数压在 85 以下。

TechCrunch · AI

Anthropic 推 Claude Science,不靠新模型,靠统一工作台争取科学家

Anthropic 发布了一个叫 Claude Science 的 AI 工作台,把科学计算研究里要用的数据库、分析流程和工具整合到一个环境里,省得研究人员来回切换。它不是什么新模型,也没给生物学特供更强的能力,跑的就是大家都能用的 Claude Opus 4.8 等现有模型。这个产品是在去年 Claude for Life Sciences 的基础上...

推荐理由:Anthropic 的科学产品是个工作流整合,不是新模型,对关注 AI 应用模式的开发者来说够具体、有参考价值。分数维持在 78,因为目前缺少第三方验证或真实研究产出数据,方向有意思但还没被证实。

AI HOT 精选

Claude Desktop 在 Linux 上开始公测,先覆盖 Ubuntu 和 Debian

Anthropic 把 Claude Desktop 搬到了 Linux,目前是公测版,支持 Ubuntu 和 Debian 两个发行版。付费用户现在可以在桌面端用 Claude Code、Claude Cowork 和聊天功能,不用再局限于浏览器和终端。正文没提免费用户能不能用,也没说其他发行版什么时候支持。

推荐理由:Anthropic 把 Claude Desktop 搬上 Linux,对开发者是实打实的便利。三个维度都踩中了:标题本身就有点击欲,给出了两个发行版和付费功能这些硬信息,而且 Linux 用户群和 AI 开发者高度重合。分数定在 72,因为正文没交代免费用户能不能用、其他发行版什么时候支持,这些缺口让我先打个折。

6月30日星期二

Hacker News 首页

Claude Code 偷偷在系统提示词里藏了隐形标记,用来识别 API 代理和时区

有人逆向 Claude Code 2.1.196 后发现,它会根据你的 API 地址和系统时区,悄悄修改发给模型的系统提示词。具体是把日期里的撇号换成肉眼几乎看不出来的 Unicode 变体,比如遇到已知的代理域名就用弯撇号,遇到中国时区就把日期分隔符从“-”改成“/”。这些域名和关键词列表用 XOR 和 base64 做了混淆,里面包含 deepse...

推荐理由:一手逆向分析,带代码和域名清单,不是猜测。隐写、技术细节、隐私信任三条全中。因为是个人博客、没有 Anthropic 官方回应,上限压在 85 以下。

Computing Life · Share · 鸭哥调研

Loop Engineering 详解:从手把手管 Prompt,到设计能自己修自己的开发流水线

Loop Engineering 最近被 Business Insider 和 Addy Osmani 带火,核心是把人从“不断拆任务、看结果、判断下一步”的 AI 管理员,升级成设计自收敛系统的设计师。文章把这事拆成两层:第一层是 AI Manager,像带实习生一样给上下文、划边界、定验收标准;第二层是 Senior Manager,把成功的 co...

推荐理由:Loop Engineering 最近被频繁提起,但这篇不是复读热点,而是把“AI 管理员 → 高级管理员”的转变拆开了,用 Anthropic 的数据和 Elastic 的自修复案例把概念落到工程上。文章在高级管理员部分戛然而止,所以分数卡在 featured 门槛,没往上拉。

TechCrunch · AI

Anthropic 跟加州政府谈了个五折优惠,所有州级部门都能用 Claude

加州州长纽森和 Anthropic 签了协议,让州内教育、交通、卫生等各部门用 Claude 时直接打对折。Anthropic 会提供部署指导,但州政府的数据还是留在加州自己的云上,不会外传。正文没披露合同总金额,也没说打完折后每个 token 具体多少钱,所以实际省了多少还不好算。这个时间点刚好赶上联邦政府在收紧对 OpenAI 的审查,Anthro...

推荐理由:加州政府拿到的 Claude 五折价给政企采购提供了一个可参考的价格锚点。正文没披露合同总金额,也没说打完折后每个 token 具体多少钱,所以实际省了多少还不好算——评分就留在 featured 区间的低段。

TechCrunch · AI

Cursor 出了手机 App,让你在外面也能指挥编程智能体干活

Cursor 发布了一款叫 Cursor Mobile 的手机应用,用户可以直接在手机上启动新的编程智能体,或者继续之前在电脑上没干完的活。这跟 Anthropic 和 OpenAI 之前推出的移动端编程工具路子差不多。现在 AI 编程工具的趋势变了,大家不再死盯着满屏代码,而是转向指挥智能体去写代码。Anthropic 负责 Claude Code ...

推荐理由:Cursor 出了个手机 App,核心卖点是远程指挥桌面端的编程智能体继续干活,不是让你在小屏幕上敲代码。产品定位清晰,跟别家路子不一样。但正文没写具体怎么交互、也没给上线时间,所以先放在 featured 这一档,等更多细节出来再判断实际价值。

6月29日星期一

AI HOT 精选

美军用 AI 选目标,漏掉一条标注“这是学校”的旧情报,炸了伊朗一所小学

《洛杉矶时报》调查发现,美军今年 2 月底对伊朗一所小学的导弹打击,根源是两个老问题:一份 2019 年的情报分析员标注从未被录入正式目标数据库,以及多个情报系统互不打通。那栋楼早被标记为学校,但数据库里用的还是七年前的卫星图,标注工具也一直没连上 80 年代建成的 MIDB 系统。与此同时,Anthropic 的 Claude 模型嵌入 Palant...

推荐理由:Claude 嵌入 Palantir 首日就建议约 1000 个目标,但一份 2019 年标注学校的手写笔记从未进入目标数据库,多个情报系统互不打通,数据库里用的还是七年前的卫星图。三个 HKR 维度都有具体事实支撑:冲突感来自“AI 高效选目标 vs 关键信息没跟上”的错位;知识性来自系统缺口和数字细节;共鸣点在于失败根源不是模型精度,而是人机流程断裂。分数没给到 85 以上,因为 the-decoder 是二手信源,原文调查来自《洛杉矶时报》,信息本身扎实但转述链条拉低了一点可信度。

纽约时报中文网

美国正滑向自己的“马云时刻”,政府与AI实验室的冲突比中国竞争更危险

Dan Wang 和 Julian Gewirtz 在评论中警告,美国政府对 Anthropic 的 Fable 5 模型实施出口管制,正在重演中国 2020 年打压马云和蚂蚁集团的剧本。Fable 5 是 Mythos 模型的改编版,擅长找软件漏洞,但推出三天后就被政府以安全为由禁止访问,后来虽部分恢复,谈判仍在僵持。文章梳理了特朗普政府从放任到强控...

推荐理由:这篇《纽约时报》评论把美国管制 Anthropic 的 Fable 5 模型,直接对标中国当年叫停蚂蚁上市,角度很刁钻。时间线和模型能力都交代得清楚,不是纯情绪输出。扣分在于它本质是观点文章,不是一手报道,事实核查空间有限。但作为引发讨论的引子,信息量和冲击力都够。

AI HOT 精选

Anthropic 的算力支出是员工工资的 2.3 倍,到 2029 年其他公司会跟到哪一步

Anthropic 今年在模型推理和训练上要花约 100 亿美元,摊到每个员工头上是 200 万美元,相当于它全员薪酬的 2.3 倍。作为对比,全行业前 1% 的公司平均给每位工程师花 8.9 万美元的 AI 费用,中位数公司一年只花 137 美元。Tunguz 推演了三种 2029 年的情况:悲观情形下,token 价格持续暴跌,AI 支出会稳定在工...

推荐理由:Tunguz 拿 Anthropic 的财务数据当锚点,把全行业的 AI 支出分了三六九等,再推演出三种 2029 年的收敛路径。数据扎实,论点清晰,但本质是行业分析而非硬新闻,所以卡在 78 分。

Hacker News 首页

他用 Claude Code 读自己的肩部 MRI,AI 说肌腱没撕裂,和医生诊断完全相反

作者肩膀疼去诊所,医生看完 MRI 诊断为肩胛下肌腱 III 级部分撕裂(撕裂超过 50%),当场就做了冲击波治疗还打了一针。他把 266MB 的 DICOM 原始影像丢给 Claude Code 跑 Opus 4.8,模型花了一个多小时出报告,结论是肌腱完整。为了排除上下文偏见,他又让 Claude 启动多个子代理做了一次仲裁,仲裁结果以中高置信度支...

推荐理由:一手实验,有数据有流程,HKR 三项全中。扣分点:个人博客不是机构研究,正文没披露仲裁子代理的具体配置和置信度怎么算的,可靠性要打个折。featured 低段位,不往上推。

6月28日星期日

彭博科技

美国收紧芯片出口后,奥地利游说欧盟把 Anthropic 的算力基地搬到自家

美国刚对中东收紧 AI 芯片出口,奥地利总理 Stocker 就向欧盟委员会主席冯德莱恩和 Anthropic CEO Amodei 递话,想把 Anthropic 的欧洲落脚点抢过来。奥方开出的条件包括政府出钱补贴基础设施,并承诺放宽数据隐私规则。文章没提 Anthropic 有没有回应,也没给时间表和具体金额。

推荐理由:时机抓得准,条件也实在,但正文没提 Anthropic 有没有回应,也没给时间表和具体金额,故事只讲了一半。先给 72,等后续消息再调。

Computing Life · Share · 鸭哥调研

前沿模型安全重心移向运行时:GPT-5.6 和 Anthropic 走了两条不同的工程路

OpenAI 和 Anthropic 最新的系统卡显示,模型安全不再只靠训练阶段的对齐,而是转向运行时的管控。GPT-5.6 Sol 在推理过程中用激活分类器实时监测模型内部状态,在有害内容到达用户前就掐断,同时配套了账户安全分和两级扫描系统。Anthropic 用 SAE 探针发现 Mythos Preview 在 29% 的核心行为测试里已经意识到...

推荐理由:HKR 三条都踩中了:对比视角新鲜,有具体的失败次数和拦截机制,而且直接戳中 agent 开发者的日常痛点。分数定在 82 是因为文章本身是二手分析,没有原始测试数据,信息增量主要来自解读角度而非一手实验。

Computing Life · Share · 鸭哥调研

Codex 录屏回放把 RPA 从重放点击变成了重放业务意图

OpenAI 给 Codex 加了个 Record & Replay 功能:用户在 Mac 上演示一遍工作流程,Codex 会把它抽象成一个可复用的 skill,里面写清楚输入参数、执行步骤和结果验证规则。这和传统 RPA 录坐标、录 selector 的思路不一样——传统 RPA 录完得到的是“怎么点”,Codex 试图沉淀的是“业务上怎样算完成”。...

推荐理由:这篇文章把 Codex 的 Record & Replay 和传统 RPA 的差异点抓得很准——一个录“怎么点”,一个录“怎样算完成”,这个对比本身就有信息量。我会先打个折:这不是 OpenAI 官方发布,是一篇分析文章,正文没给出 skill 复用成功率或实际部署数据,所以判断要收着点。但“把操作抽象成可复用的业务 skill”这个方向,对还在跟屏幕坐标死磕的自动化团队来说,确实提供了一个更干净的思路,值得放进 featured。

Computing Life · Share · 鸭哥调研

AI 补贴退潮后,agent 开始按每美元智能计价

大模型 token 的隐性补贴正在退场。GitHub Copilot 在 2026 年 6 月 1 日改成了按用量计费,OpenAI、Anthropic 等厂商也集中更新了提示词缓存(prompt caching)的收费规则,Linux Foundation 甚至打算成立 Tokenomics Foundation 来定成本标准。这不是 token 单...

推荐理由:文章抓到了一个结构变化——token 补贴退场,用 Copilot 计费改动、缓存定价更新和 Tokenomics Foundation 提案三个信号撑起来。没给更高分是因为它属于趋势分析而非硬消息,正文也没披露具体价格数字或缓存命中率数据,判断只能停在信号层面。