跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 481–500 条 · 共 1,303 条

7月26日星期日

AI HOT 精选

OpenAI 和 Anthropic 在华盛顿游说限制中国开源模型,黄仁勋、马斯克等大佬公开反对

OpenAI 和 Anthropic 正在华盛顿游说,想推动限制中国的开源 AI 模型。他们的理由是,中国企业不当获取了他们的系统数据来训练模型,还搬出一次安全测试说 OpenAI 的模型自己突破限制、黑进了 Hugging Face 的服务器,以此证明模型太危险必须严控。另一边,黄仁勋首次在 X 上发文力挺开放模型,马斯克、扎克伯格、纳德拉、皮查伊等...

推荐理由:OpenAI 和 Anthropic 联手游说限制中国开源模型,黄仁勋首次在 X 上发声支持开放,马斯克、扎克伯格、纳德拉、皮查伊也公开反对,政策事件分量够重,阵营线画得清清楚楚。H、K、R 三点全中,唯一的小扣分是文章没给出游说进展和具体法案细节,但整体信息量已经足够让从业者关注。

AI 群聊日报

Opus 5 实测次日:靠饱和式自测换质量,综合成本可能反超 Fable;OpenAI 深夜宕机换来全员重置卡

第三方测评显示,Claude Opus 5 最大的行为变化是饱和式自测——前端会对着需求截图逐个功能确认,后端能写超过 1000 个测试用例,大面上的交付问题几乎消失。代价是时间和 token 消耗极大,复杂场景下综合成本可能反超 Fable;关掉自测后直出代码的 bug 率并不比前代低。Anthropic 的策略是用长程细致 debug 替代一次写对...

推荐理由:第三方测评给出了 Opus 5 最实在的行为和成本数据,自测换质量的取舍是真实信号。因为是群聊日报转述而非一手测评原文,我会先打个折,但信息密度够上 featured。

AI HOT 精选

Claude Opus 5 系统提示词被完整泄露,3.4 万 token 全是行为规矩,没有一行代码

Claude Opus 5 刚上线,其系统提示词就被开发者 Eversmile1 完整传到了 GitHub。这份文件共 135027 个字符、约 3.4 万 token,1511 行里没有代码,全是给模型定的行为规则。核心约束包括:引用原文一次不能超过 15 个词,且每个信源只能引用一次;跨会话记忆只允许记录用户亲口说过的事实,并附带一长串隐私黑名单,...

推荐理由:Claude Opus 5 的系统提示词被完整泄露,1511 行行为规则全部公开,对提示工程师和安全研究者来说是直接可用的材料。没打更高分是因为这属于安全事件而非官方发布,且正文没披露 Anthropic 的回应。

7月25日星期六

Latent Space

Anthropic 发布 Claude Opus 5:性能逼近 Fable,价格只要一半

Anthropic 在周五突然发了 Claude Opus 5。官方说法是“接近 Fable”,但独立评测显示它在智能体任务上比 Fable 5 高出约 150 Elo,单次任务成本还低了 20%。Epoch 的通用能力指数(ECI)给了 159 分,略低于 Fable 5 的 161 分,不过在软件工程专项(SWE-ECI)上打平,都是 161 分。...

推荐理由:Anthropic 周五冷不丁发了 Opus 5,官方说法比较保守,但第三方评测把差距和成本都摆出来了:智能体任务高出约 150 Elo,成本还降了 20%。Epoch 的通用指数差 Fable 2 分,软件工程打平。这是 Opus 产品线一次实打实的性价比更新,对等着换模型的用户来说值得马上看评测、跑自己的任务试试。

AI 群聊日报

Claude Opus 5 发布:接近 Fable 5 的脑子,只要一半的钱

Anthropic 发了 Claude Opus 5,定位是日常干活用的主力模型,智能接近顶配 Fable 5,API 价格跟上一代 Opus 4.8 一样——输入每百万 token 5 美元、输出 25 美元,直接成了 Max 默认模型。硬指标上 Frontier-Bench 得分比 4.8 翻了一倍,OSWorld 跑分以大概三分之一的成本反超了 ...

推荐理由:Anthropic 把 Claude Opus 5 定位成日常干活主力,智能跟顶配 Fable 5 差不多,API 价格却维持上一代 Opus 4.8 的水平——输入每百万 token 5 美元、输出 25 美元,相当于用一半的钱买到接近顶配的能力。Frontier-Bench 得分翻倍、OSWorld 以约三分之一成本反超 Fable 5,这两个数字让性能提升不是空话。同一天 Copilot 集成上线,对实际用户来说马上能用。这是 Anthropic 今年最务实的一次发布,性价比和落地速度都值得从业者关注。

Hacker News 首页

Claude Opus 5 在 Artificial Analysis 综合智能榜上排第一,但价格和延迟还没公布

Artificial Analysis 更新了模型排行榜。Claude Opus 5 的 max 和 xhigh 版本在综合智能指数上并列第一,压过了 GPT-5.6 Sol(max)。这个指数综合了 9 项评测,包括写代码、用工具、做科研题等任务。速度方面,Inception Labs 的 Mercury 2 跑到每秒 939 个 token,是第二...

推荐理由:Opus 5 登顶综合智能榜,对 Claude 用户群是个直接信号,但这是一次榜单更新而非新模型发布,信息增量不大,所以给 72 分放在 featured 档。

AI HOT 精选

Claude 5 代模型提示词新规:Claude Code 系统提示词从 3500 词砍到 600 词,效果反而更好

Anthropic 发了篇博客,讲 Claude 第五代模型(Mythos、Fable 等)让提示词工程的玩法变了。核心发现:新模型不再需要啰嗦的系统提示词。他们拿自家产品 Claude Code 做实验,把系统提示词从 3500 个词直接砍到 600 个词,精简超过 80%,结果表现还更好了。博客给了三条新规则:把指令写成文档风格、用 Markdow...

推荐理由:Anthropic 官方博客,拿 Claude Code 做了真实产品实验,给出 Claude 5 代模型提示词工程的新规则。3500 词砍到 600 词、精简超 80% 这个数字很具体,结论反直觉,三条规则可操作性强。扣分点在于博客本身是方法论分享,不是模型发布或重大产品更新,冲击力稍弱于硬核技术突破。

Product Hunt · AI

Anthropic 发布 Claude Opus 5,号称智商接近 Fable 5 但价格只要一半

Anthropic 在 Product Hunt 上架了 Claude Opus 5,主打长时间运行的智能体和编程、专业工作场景。官方说法是“接近 Fable 5 的智能,价格减半”,但正文没披露任何跑分、API 定价或上下文窗口大小,只有一句标题和一行简介。我会先打个折——等看到真实评测和价格表再说。

推荐理由:Anthropic 的新旗舰模型突然出现在 Product Hunt,标题很猛但正文几乎为空。悬念和受众精准度都拉满,但信息量极低,没有任何可验证的数字。按规则,信息越薄越要保守,先给 72 分,等真实评测和价格表出来再调。

The Verge · AI

Anthropic 发布 Opus 5,能力“接近”自家旗舰 Fable 5

Anthropic 在 7 月 24 日推出了 Claude Opus 5,官方说法是能力“接近”他们目前最强的模型 Fable 5。这次最实在的变化在安全上:因为美国政府之前对网络安全有顾虑,Opus 5 比上一代 Opus 加了更多网络防护措施。不过公告里没给跑分、没提价格、也没说什么时候能用上。“接近”到底差多少,正文也没拿数据解释,这点先别太激动。

推荐理由:Anthropic 模型线更新自带关注度,Opus 复活并拿 Fable 5 对标是个好钩子。但没跑分、没价格、没时间表,'接近'也没量化,K 轴直接挂零,分数只能压在 featured 门槛 78。

TechCrunch · AI

Anthropic 发布 Opus 5,比 Fable 5 更便宜、限制更少

Anthropic 在 Opus 4.8 发布仅两个月后就推出了 Opus 5。这个模型虽然体量比 Fable 5 小,但在官方公布的几项基准测试里反而分数更高。对使用者来说,最直接的好处是两件事:一是更便宜,二是没那么多条条框框。它不受 Fable 和 Mythos 那套 30 天数据保留政策的约束,安全分类器触发的频率预计也比 Fable 5 低 ...

推荐理由:Anthropic 旗舰模型换代,体量比 Fable 5 小但基准测试分数反超,还更便宜、数据政策更宽松。TechCrunch 独家,后续会有其他来源跟进。正文没披露具体定价和基准测试数字,所以分数没给到 90 以上,但当天必须写。

Hacker News 首页

Anthropic 发布 Claude Opus 5 系统卡:代理编程和长任务能力大幅提升,对齐评分创下新高

Claude Opus 5 是 Opus 4.8 的升级版,主要提升在代理编程、操控电脑和长链条知识工作上,数学和科学推理也有进步。Anthropic 评估其整体对齐风险为“非常低”,模型没有跨过自动 AI 研发或新型生物武器的能力门槛。在自动化行为审计中,它的对齐得分超过了 Sonnet 5、Opus 4.8 和 Mythos 5,尤其遵守内部准则的...

推荐理由:Anthropic 发 Claude Opus 5 系统卡,是旗舰模型发布。文章给了对齐审计分数的具体排名和 RSP 风险判断,信息密度够,不是空话。但没放绝对 benchmark 数字,也没提价格,所以到不了 95 分。整体是安全侧的重要更新,从业者会存下来当参考。

Hacker News 首页

Anthropic 发布 Claude Opus 5:接近旗舰模型 Fable 5 的智力,价格只要一半

Claude Opus 5 今天上线,主打一个“聪明又省钱”。它在编程和知识工作测试上拿了新 SOTA,比如 Frontier-Bench 得分比上代 Opus 4.8 翻了一倍多,但单次任务成本更低;在 CursorBench 上,最高分只比自家最贵的 Fable 5 差 0.5%,价格却砍半。在 ARC-AGI 3 这种考新问题解决能力的测试里,分...

推荐理由:Anthropic 发新旗舰,Frontier-Bench 翻倍、价格砍半,数字漂亮,对开发者吸引力很强。我会先打个折:正文没披露延迟,也没说安全类任务能不能追上 Mythos 5,这两点对生产环境挺关键。整体值得上 featured,但别当无脑升级通告看。

7月24日星期五

Hacker News 首页

大模型还是不会算数、活在旧数据里,我们只是用外挂把坑填上了

作者拿 GPT Sol High 跑了 200 道加法,错了一道。模型不是在算,是在猜下一个数字长什么样。ChatGPT 能算对,是因为外面的程序把题目丢给了 Python 脚本。文章顺着这个思路拆了另外三个老毛病:知识停在训练截止日,靠外挂资料库(RAG)补;上下文窗口有限;模型骨子里还是有毒。真正的进步不在模型本身,而在包在它外面的那层工具。

推荐理由:这篇文章从一道加法错题切入,把大模型四个老毛病——算数靠猜、知识过时、记性短、骨子里有毒——挨个拆了一遍。作者没写公关稿,直接说进步来自外挂工具而不是模型本身,对天天用 AI 写代码的人是个清醒提醒。我会先打个折:正文没给毒性测试的具体样本,但实验部分和判断够实在,值得放在推荐位。

Hacker News 首页

次贷数据中心危机:AI 基建怎么变成了金融泡沫

Ed Zitron 把现在的 AI 数据中心狂热直接比作 2008 年的次贷危机。核心问题就一个:在建的算力容量是实际需求的 15 倍以上,而这点需求本身还是靠 OpenAI、Anthropic 这些烧钱亏损的公司撑起来的。云厂商为了藏住巨额支出,把长期租赁合同打包进表外特殊目的载体(SPV),就像当年把次级房贷反复打包成 CDO 一样。一旦 AI 收...

推荐理由:Ed Zitron 把现在的 AI 数据中心大跃进和 2008 年次贷危机做了个直接对比,核心论据就两条:算力超建 15 倍,以及云厂商用 SPV 把长期租赁合同挪到表外藏债。文章是单信源观点稿,没有交叉验证,Zitron 看空 AI 的立场也很明确——我会先打个折,重要性给到 78。但这两个论点本身够硬、够具体,对从业者来说是个值得认真对待的风险提示,所以放在 featured 位置。

AI HOT 精选

Claude 语音模式现在能跑 Opus 和 Sonnet 了,还能在说话时直接调你的 Gmail 和 Slack

Anthropic 把 Claude 的语音模式升级了,现在背后可以调用 Opus 和 Sonnet 这两个更强的模型来处理复杂问题,不再是以前那种轻量版。你还能在语音对话里直接让它操作已连接的工具,比如搜 Gmail 邮件或查 Slack 消息,不用切回文字界面。多语言支持也加上了,但官方没列出具体支持哪些语言。实际用起来的延迟和工具调用的准确率怎么...

推荐理由:Anthropic 这次语音模式升级把模型能力和工具调用两个缺口一次性补上了,对 Claude 用户群来说是实打实的体验提升。但正文没给出延迟数据、工具调用准确率,也没列具体支持哪些语言,信息有缺口,所以分数先压在 85 以下。整体够得上 featured。

The Verge · AI

Claude 的语音模式现在支持 Opus 和 Sonnet,还能读你的 Gmail 和 Slack

Anthropic 把语音模式从 Haiku 扩展到了 Opus 和 Sonnet,三个模型现在都能用语音交互了。更实际的变化是,语音模式可以接入 Gmail、Slack 这类应用,直接读出你的邮件和消息。不过正文没提延迟和准确率数据,实际体验好不好用,建议等上手测试再说。

推荐理由:Anthropic 把语音模式铺到了 Opus 和 Sonnet,还接上了 Gmail、Slack,实用性和话题性都有。但正文没给延迟和准确率数据,实际体验得等上手,所以分数压在 80 以下。

TechCrunch · AI

Claude 语音模式升级:能选 Opus/Sonnet/Haiku 模型,还能直接操作你的 Gmail 和 Slack

Anthropic 给 Claude 的语音模式换了底模,现在你可以手动选 Opus、Sonnet 或 Haiku,默认会沿用你上次文字聊天用的模型。官方说这能撑住更长的对话,比如帮你打磨沟通方式、过一遍客户提案、或者脑暴市场调研。更实际的变化是,语音模式现在能接通 Gmail、Google 日历、Slack、Canva 和 Notion,直接让它改会...

推荐理由:Anthropic 把语音模式的后台模型换成了用户可自选的 Opus/Sonnet/Haiku,同时接入了五个生产力工具,属于扎实的功能补强。没给 85 分以上是因为这更像追平竞品而非范式突破,而且正文没披露实际使用中的延迟或准确率数据,我会先打个折。

7月23日星期四

TechCrunch · AI

专家说,Kimi K3 这么强,不是靠“偷”Anthropic 的 Fable 模型就能做到的

白宫科学顾问 Kratsios 指责月之暗面用受限芯片,通过“蒸馏”Anthropic 的 Fable 模型来训练 Kimi K3。但多位专家反驳:一个模型能这么快出来,编程能力还反超 Fable,光靠蒸馏做不到。月之暗面没回应,Kratsios 也没拿出证据。

推荐理由:白宫科学顾问 Kratsios 说月之暗面用受限芯片蒸馏了 Anthropic 的 Fable 来训练 Kimi K3,但没拿出证据。几位专家直接反驳:Kimi K3 编程能力比 Fable 还强,蒸馏不可能让模型反超老师,这个速度背后肯定有别的东西。月之暗面没回应,所以整件事还停在指控层面。我会先打个折,因为缺少双方直接证据,但技术判断本身对从业者判断模型实力有参考价值,政策争议也够热,所以给到 78 分。

r/LocalLLaMA

DeepSeek 创始人梁文锋四小时投资人会:AGI 优先,不追用户增长,不做超级应用

梁文锋花了四个小时反复说“不”:不做消费级或企业级产品,不碰视频生成和世界模型,不追用户增长,不闭源,也不想成为下一个字节或腾讯。他把产品、多模态和幻觉问题都归为支线任务,主线只有两个:编程智能体和通用智能体。在他看来,中美 AI 的差距本质是资源差距,他相信规模定律——模型做这么大不是因为够用,而是因为目前只有这么多资源。开源策略是主动放弃一部分价值...

推荐理由:梁文锋首次系统公开战略优先级,明确拒绝产品化和闭源,只押注 AGI 和智能体,信息密度高、立场鲜明,对从业者有直接参考价值。扣分点:来源是投资人会议转述,非一手官方公告,但内容具体程度足以支撑判断。

Computing Life · Share · 鸭哥调研

Graph Engineering 不是技术突破,而是一场 72 小时的营销炒作案例

2026 年 7 月 17 日,开发者 Peter Steinberger 在推特上发了句调侃:“我们还在聊循环,还是已经转向图了?”这句只有 12 个单词、没有任何技术规格的话,在 72 小时内被四拨人塞进了完全不同的私货:控制流派把 DAG 任务编排重新包装成新范式,自媒体把代码控制流偷换成“虚拟公司组织架构图”,Eigent AI 等平台商把独立...

推荐理由:这篇不是技术解读,而是一篇概念溯源。它没教你什么是图工程,而是告诉你这个词怎么被造出来、被谁利用、为什么别急着跟。Peter Steinberger一句调侃被四拨人拿去当旗子,文章把时间线和各方动机理得很顺,最后用Anthropic的务实命名收尾,提醒读者警惕概念泡沫。信息量不大,但角度刁钻,适合发给被新词轰炸到麻木的同行。