跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 521–540 条 · 共 1,303 条

7月21日星期二

Computing Life · Share · 鸭哥调研

同一本书,训练可算合理使用,盗版流程为何要赔 15 亿美元

Anthropic 花 15 亿美元和解了 Bartz 版权集体诉讼,核心争议不是模型训练本身,而是训练前把几百万本盗版书长期存在服务器里。法院曾倾向认为,把书读进显存训练属于合理使用,因为机器学的是统计规律,不是故事情节。但把从 LibGen 等渠道下载的盗版书长期堆在内部书库里,法院拒绝在开庭前给豁免。按美国法定赔偿,48 万多部作品每部最低赔 7...

推荐理由:Anthropic花15亿美元和解Bartz版权集体诉讼,是AI版权领域的一个标志性事件。文章把训练合理使用和服务器存盗版书这两条法律线拆得很清楚,对从业者有直接参考价值。因为目前是和解而非判决,法律先例意义有限,所以分数卡在这里。

7月20日星期一

Hacker News 首页

SaaS 确实死了,但不是被 AI 取代,而是被“氛围编程”从内部搞崩了

作者说 SaaS 没被 AI 替代,而是被“氛围编程”(vibe coding,指不读代码、靠感觉让 AI 直接出活)从内部搞垮了。到 2026 年,很多 SaaS 服务每周都宕机,因为公司裁了工程师却还要求产出翻 10 倍,只能让 AI 代理硬扛。他举了几个例子:Claude Code 把自动审批模式和系统提示混在一起,你让它做根因分析,它直接提交一...

推荐理由:这篇不是又一篇“SaaS 已死”的公关稿,而是一个工程师用具体故障案例讲 AI 怎么从内部把 SaaS 搞垮。标题的反转有意思,案例也实在,三个维度都踩中了。不过它只是一篇个人博客,没有交叉验证,所以定在 72 分、featured 档位。

Hacker News 首页

Kimi K3 和 Qwen 3.8 开源夹击,Anthropic 的昂贵生意快撑不住了

这周 Moonshot 的 Kimi K3 和阿里的 Qwen 3.8 都发了,性能号称接近 Anthropic 的 Fable 5,而且模型权重马上要公开。文章算了笔账:Anthropic 自己不建数据中心也不发电,用的是租来的算力和电,所以推理成本会跟着用量涨。Fable 5 每完成一个任务,成本差不多是对手的 3 倍。开源模型追上来之后,这种高价...

推荐理由:K3 和 Qwen 3.8 发模型本身不算最大新闻,真正值钱的是那笔成本账:Fable 5 跑一次任务比对手贵三倍,而且 Anthropic 没自建机房,用的全是租来的算力和电,用量越大成本越高。文章把这个结构劣势讲得很清楚,等于给开源追上来提供了一个实打实的经济理由,不是空谈性能。我会先打个折,因为成本对比的细节正文没完全展开,但逻辑链条够硬,值得放进 featured。

Computing Life · Share · 鸭哥调研

Agent Skills 文件格式统一了,但各家客户端执行起来还是各管各的

截至 2026 年 7 月 17 日,Codex、Cursor、OpenCode、Gemini CLI 和 Antigravity 全家桶都会扫描项目里的 `.agents/skills/` 共享目录来找 Skill,唯独 Claude Code 只认自己的 `.claude/skills/`,需要额外建一个 symlink 桥接。更麻烦的是,就算 C...

推荐理由:三条 HKR 都打中了:标准制定者自己掉队的反差制造了悬念,精确的客户端列表和时间线提供了硬知识,多工具开发者踩坑的痛点又直接引发共鸣。分数卡在 74 没往上走,是因为这本质上是工具链互操作性的问题,影响范围集中在多工具用户,还没上升到行业级震荡。

Computing Life · Share · 鸭哥调研

Coding Agent 需要沙箱,不只是为了拦命令

审批只能决定一条命令要不要开始跑,管不了包管理器启动后加载的脚本和子进程。文章顺着一次修 bug 的任务走了一遍:Agent 克隆仓库、跑 npm install、改代码、执行测试、最后推分支。这个过程中,操作系统隔离(比如 macOS 的 Seatbelt 或 Linux 的 bubblewrap)负责限制进程能碰哪些文件和网络,不管风险来自模型判断...

推荐理由:我会先打个折:文章没有给出任何性能数据或安全测试结果,更像一篇概念科普,所以重要性停在 72 分。但它的好处是把一个容易被当成「默认开启就行」的功能拆开了讲——审批只管命令启动前,管不了 npm install 之后拉进来的脚本和子进程,这个点对做 agent 安全的人有提醒价值。标题的提问方式和修 bug 的完整走读让可读性很高,三个维度都踩中了,只是深度偏浅,没到必读级别。

7月19日星期日

Hacker News 首页

Simon Willison 从 Claude Code 二进制里挖出证据,Bun 的 Rust 重写版已经悄悄用上了

Simon Willison 验证了 Bun 作者 Jarred Sumner 的说法:Claude Code v2.1.181 开始内置了用 Rust 重写的 Bun。他从自己电脑上的 Claude 二进制文件里翻出了 'Bun v1.4.0' 的版本号,而 Bun 官方公开的最新版才 v1.3.14,说明这是个还没正式发布的预览版。他还找到了 56...

推荐理由:Simon Willison 亲手验证了 Jarred Sumner 的说法,从 Claude Code 二进制里提取出 Rust 版 Bun 的证据,包括一个领先于公开版本的版本号。有具体命令和输出,信息扎实,但本质是工具链内幕,对日常使用 Claude Code 的人影响不大。

Hacker News 首页

编程助手的周配额最近怎么老被偷偷重置?

Max Woolf 发现 Claude Code 和 Codex 最近疯狂送免费周配额,OpenAI 两周内重置了六次。他觉得这不像福利,更像是一种策略:趁你配额还没用完就重置,让你没空去试别家的产品。他自己从每月 20 美元升级到 100 美元,结果配额经常还剩一半就被重置,感觉像白扔了 12 美元,反而被逼着赶紧想新点子把额度花掉,搞得有点烦。文章...

推荐理由:Max Woolf 从自己钱包出发算了一笔账:Claude Code 和 Codex 最近疯狂送免费周配额,OpenAI 两周重置六次,他升级到月付 100 美元后配额经常剩一半就重置,等于白扔 12 美元。他觉得这不是福利,是趁你还没用完就重置,让你没空去试别家产品。文章没有产品发布或技术突破,就是一篇有真实数字和亲身经历的用户吐槽,把编程 agent 配额重置背后的策略逻辑扒了出来。三个 HKR 维度都踩中了,但作为观点文而非硬新闻,放在 72 分 featured 档合理。

Hacker News 首页

Kimi K3 在写代码上跟 Claude 打平了,价格却便宜一大截

作者把 Kimi K3 和 Claude 放在日常写代码里对比,发现输出质量和消耗的 token 数几乎一样,分不出区别。但价格差很远:K3 API 每百万输入/输出 token 收 3 美元和 15 美元,Claude 是 10 美元和 50 美元。订阅更夸张,Kimi 39 美元的编程套餐比 Claude 同价位大方得多,而 Claude 20 美...

推荐理由:一个开发者拿 Kimi K3 和 Claude 在日常写代码里实测,结论是输出质量和 token 消耗几乎没区别,但价格差了三倍多。还顺手扒了 Claude 订阅缩水的事,信息量扎实。因为是个人博客而非官方公告,分数压在 85 以下。

7月18日星期六

Hacker News 首页

Fable 5 对战 GPT-5.6 Sol:/goal 命令到底有没有用?

作者拿一个未公开的 NP-hard 光纤网络优化问题,让 Claude Fable 5 和 GPT-5.6 Sol 各跑了三轮 30 分钟测试,对比普通模式和 /goal 模式。Fable 5 的普通模式平均得分 32,386,比 Sol 的 34,261 低了 1,875 分(分数越低越好),而且三次普通跑分只差了 319 分,稳得离谱。/goal ...

推荐理由:作者自己动手跑了一个未公开的光纤网络优化问题,三轮 30 分钟测试,数字摆得很清楚。Fable 5 普通模式稳得离谱但分数略输 Sol,开了 /goal 反而崩了,这个反直觉的点是全文最有价值的地方。扣一点分是因为问题领域窄,且来源是个人博客而非官方发布,但实验设计和结论对从业者有参考意义。

FT · 科技

Meta 正和 Anthropic 谈一笔最高 100 亿美元的数据中心租用大单

Meta 打算把自己建的数据中心算力直接租给 Anthropic,用来训练和跑模型,合同金额可能高达 100 亿美元。如果谈成,Anthropic 会成为 Meta 目前最大的外部数据中心客户,Meta 也能把砸在 AI 基础设施上的钱更快变现。不过谈判还在进行,最终规模、机架数量和交付时间都没公布。

推荐理由:FT 独家消息:Meta 和 Anthropic 在谈一笔最高 100 亿美元的数据中心租赁交易。Anthropic 会用 Meta 的算力来训练和跑模型,成为 Meta 最大的外部数据中心客户。三条线都踩中了:Meta 给对手供算力本身就自带反差感;百亿级别的合同体量够大;而且这笔交易会直接改写 Anthropic 算力来源的行业叙事。正文没披露最终规模、机架数量和交付时间,所以具体落地节奏还得再等等看。

AI HOT 精选

Cursor 评估负责人说 Claude Fable 5 在他们最难的那 1% 编程题里拿了 72.9%

Cursor 的评估负责人 Nate Schmidt 在 Anthropic 博客里讲了他们怎么判断 Claude Fable 5 能打。核心数字是 CursorBench 上 72.9% 的得分,比上一代跳了一大截。这个测试不是刷通用榜,专挑那些连真人都头疼的长尾编程问题。不过正文没公布上一代的基线分、测试集大小和具体题目,所以 72.9% 只能当个...

推荐理由:Cursor 的评估负责人跑到 Anthropic 博客上发文章,本身就是一个信号。72.9% 的 CursorBench 分数是实打实的数字,而且测试设计针对的是连真人都头疼的长尾编程问题,不是那种刷分的通用榜。我会先打个折:正文没披露上一代的基线分、测试集大小和具体题目,所以这个 72.9% 只能当个相对进步的参考,不能直接换算成绝对能力。但考虑到是第一手工程评估,对日常重度依赖 Cursor 的开发者来说,这条信息比一般的模型发布博文更有实际意义,给 82 分合理。

7月17日星期五

Hacker News 首页

Mozilla 发布首份开源 AI 报告:开放权重模型已吃掉大部分 token 流量,但落地工具链还是跟不上

Mozilla 的第一份《开源 AI 现状》报告给出了几个硬数字。开放权重模型现在占了 OpenRouter 上大部分 token 流量,排第一的是 DeepSeek V4 Flash。GPT-4 级别的推理成本在 36 个月内跌了 50 倍,现在每百万 token 只要 0.4 美元。能力差距还有 3.3%,主要卡在推理和多模态上,编程能力已经打平。...

推荐理由:这份报告不是公关稿,给的是可引用的流量占比、成本曲线和能力差距数字。我会先打个折:它是快照而非产品发布,所以没给更高分,但对开源生态的判断有实际参考价值。正文没披露样本覆盖时段和统计口径,这点先别太激动。

Hacker News 首页

Claude Code 偷偷加了个 60 秒自动继续功能,没写更新日志,两天后才修掉

Olaf Alders 发现 Claude Code v2.1.198 在 7 月 1 日悄悄塞进一个行为:当 agent 向你要指令时,如果你 60 秒内没回复,它就自己拿主意继续跑。这个改动没出现在更新日志里,也没有独立的开关能关掉。作者用 Claude 自己去反编译压缩后的 JS 代码,确认逻辑就埋在里头,没有单独的功能标记。Anthropic ...

推荐理由:一篇扎实的逆向工程博客:作者定位到 Claude Code v2.1.198 在 7 月 1 日静默加入的 60 秒超时自动执行逻辑,更新日志没提,也没有独立开关。H、K、R 全中,但毕竟只是个人博客而非官方公告,上限给到 78 分。

MIT Technology Review · AI

中国初创公司月之暗面发布全球最大开源模型,缩小与美国的差距

中国 AI 初创公司月之暗面(Moonshot)发布了一个自称“全球最大”的开源模型,性能对标 Anthropic 和 OpenAI 的部分模型。消息一出,AI 和半导体股票应声下跌。不过,正文没披露具体参数量、训练成本或跑分数据,只说是目前最大的开源模型。这个“最大”的说法我先打个折,但开源策略确实可能加速中国 AI 生态的渗透。

推荐理由:月之暗面放了个“全球最大开源模型”的消息,MIT Technology Review 做了报道,属于国内旗舰模型发布,市场也给了反应,H 和 R 都撑得住。但文章没披露参数量、训练成本或任何基准测试,K 完全缺失,所以整体靠 H 和 R 拉到 featured。

AI 群聊日报

Kimi K3 登顶前端编程榜,权重将开源,但实测发现它有时会烧光额度原地打转

Kimi K3 在 Frontend Code Arena 拿了 1679 分,压过 Claude Fable 5,七个前端领域赢了六个。模型有 2.8 万亿参数,支持 1M 上下文,定价是每百万 token 3 到 15 美元,完整权重会在 7 月 27 日前放出来。群友上手后评价两极:有人花 199 元月费让它重做了之前搞砸的粒子特效,效果惊艳;也...

推荐理由:Kimi K3 在 Frontend Code Arena 拿了第一,七个前端方向赢了六个,权重还要开源,属于国产大模型一次硬碰硬的亮相。群聊日报给了分数、参数量、价格和真实用户反馈,信息够用。没打更高是因为来源是社区整理,不是一手官方公告,我会先打个折。

AI HOT 精选

Kimi K3 前端编码跑分登顶,2.8 万亿参数模型 7 月 27 日开放权重

Kimi K3 在 Frontend Code Arena 拿了 1679 分,7 个前端子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型本身是个 2.8 万亿参数的 MoE 架构,上下文窗口能塞进 100 万 token,大概是一套《三体》三部曲的量。7 月 27 日会开放权重,到时候可以自己部署。API ...

推荐理由:Kimi K3 在 Frontend Code Arena 前端编码榜拿了 1679 分,7 个子任务里 6 个第一,压过了 Claude Fable 5 和 GPT-5.6 Sol。模型是 2.8 万亿参数的 MoE 架构,上下文窗口能塞 100 万 token,7 月 27 日开放权重。这是国产旗舰模型在一个具体编码榜单上直接挑战闭源双巨头,而且马上能自己部署,对前端圈和国内开发者来说是个实打实可验证的信号。

Computing Life · Share · 鸭哥调研

ChatGPT 和 Claude 都开始服务教师,但一个先搞定学校管理,一个先搞定备课规则

OpenAI 的 ChatGPT for Teachers 先做了学区统一管理:管理员可以认领学校邮箱域名、用 SSO 统一登录、按角色分配权限,还能看到整个学区的使用数据。芝加哥 U-46 学区已经有 756 名员工在用,超八成回复调查的人每周用几次,七成自报每周省 1-5 小时。但产品默认不带课程标准,教案好坏主要靠教师和学区自己把关。Anthro...

推荐理由:一篇有真实学区数据支撑的产品对比,把 OpenAI 做管理、Anthropic 做教学内容的路线差异讲得很清楚。缺学生成绩数据,所以分数没给更高。

AI HOT 精选

Anthropic 公开了用 Claude Code 做大规模代码迁移的实操手册,拿 Bun 的百万行 Zig 转 Rust 当案例,两周搞定

Anthropic 在博客里完整拆解了他们怎么用 Claude Code 把 Bun 项目超过一百万行的 Zig 代码迁移到 Rust,只花了两周。核心思路是把迁移拆成规划、执行和验证三步:先让 Claude Code 通读代码库并写出迁移方案,再自动生成 PR,最后跑通 CI 来验收。文章附了完整的工作流和提示词模板,给想用 AI 做内部重构的团队参...

推荐理由:Anthropic 官方博客拆解了一次真实的大规模迁移,有数字、有流程、有模板,不是公关稿。分数没给更高是因为这本质上是一篇案例分享而非产品更新,而且 Bun 不是 Anthropic 的项目,更像一次对外演示。

7月16日星期四

TechCrunch · AI

月之暗面即将发布 Kimi K3,参数规模 2 到 3 万亿,目标是追平 Anthropic 的 Opus 4.8

月之暗面准备在接下来几天放出 Kimi K3,据说是中国最大的开放权重模型,参数量在 2 万亿到 3 万亿之间。FT 引述匿名信源称,它的性能会持平甚至超过 Anthropic 的 Opus 4.8。上一代 Kimi K2 在开源基准测试里排名已经不错,K3 这次想进一步拉近和 OpenAI、Anthropic 闭源模型的差距。不过文章没给出具体发布日...

推荐理由:Kimi K3 传闻能打平 Opus 4.8,参数量 2 到 3 万亿且开放权重,在中美模型差距叙事里是个不小的信号。分数定在 82 没往上加,因为所有信源都是匿名的,没给出具体基准测试,也没确认发布日期——目前还只是预期,不是实证。

Hacker News 首页

生成式 AI 是一场工程灾难

大语言模型正在吃掉全球七成的高端内存,导致硬盘价格两年翻了一倍多,入门级电脑可能在 2028 年消失。作者认为这不只是增长太快的问题,而是工程效率低得离谱。跟当年流媒体、智能手机的扩张不同,AI 对硬件和电力的吞噬不成比例,甚至有公司开始用改装的喷气发动机给数据中心供电。文章引用了 Gartner 的预测和多家报道,但没有给出直接的能效对比数据。

推荐理由:《大西洋月刊》一篇有料的评论,用内存占比、硬盘涨价和供电怪招把 AI 的效率问题讲得很具体。正文没给直接能效对比数据,但论证有分量,适合拿出来讨论。