跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 1141–1160 条 · 共 1,303 条

4月28日星期二

r/LocalLLaMA

本地跑代码模型终于能干活了:27B 模型在 Terminal-Bench 2.0 上拿了 38.2%,落后云端前沿模型约 6-8 个月

Antigma 用一套 agent 流程测了多个 27B–32B 的开源模型,跑的是 Terminal-Bench 2.0 的 89 个任务,用的是官方默认超时设置,没放宽条件。成绩最好的是 Qwen 3.6-27B,89 题做对 34 题,得分 38.2%。这个分数本身不算高,现在云端最强的模型能到 80% 左右。但有意思的是时间差:把 38.2% ...

推荐理由:我会先打个折:这是单篇 Reddit 帖子,不是论文,测试细节和复现条件正文没展开。但它的判断很实在——本地小模型跑代码已经跨过“能用”的门槛,不是遥遥领先,而是落后托管前沿 6–8 个月,这个定位比单纯报分有用。38.2% 的分数本身不高,但放在 89 个终端任务里,说明日常写脚本、调配置这类活它能接住一部分。对想离线部署、省 API 钱的团队,这个信号值得跟。

Computing Life · Share · 鸭哥调研

Anthropic 发布 9 个创意工具连接器,让 Claude 直接操控 Blender、Photoshop 等软件

Anthropic 在 4 月 28 日发布了 Claude for Creative Work,包含 9 个连接器,让 Claude 能直接调用 Blender、Adobe 全家桶、Ableton 等专业软件的后端接口干活。用户用自然语言下指令,Claude 就能在软件里执行操作,比如在 Blender 里生成带空间关系的 3D 场景。这件事本身不是...

推荐理由:Anthropic 这次不是发模型,是给 Claude 接了 9 个创意工具的连接器,相当于让模型直接操作设计软件。文章自己提了个三层框架来看这事靠不靠谱:工具有没有可编程接口、中间有没有连接协议层、最后能不能形成感知评估的闭环。我会先打个折——正文没披露具体接了哪些工具,也没说开放到什么程度,所以实际能跑通多少还不好讲。真正值得盯的是 feedback loop 那层,如果模型能收到设计输出的反馈再自己调整,才算进了创意流程的脑子,不然还只是高级点的批处理。这点先别太激动,等名单和接入方式出来再看。

Hacker News 首页

Claude Pro 用户想在 Claude Code 里用 Opus 模型,得先开通并购买额外用量

Anthropic 的官方帮助文档列出了 Claude Code 支持的 6 个模型,从 Opus 4.7 到 Haiku 4.5。关键限制是:Pro 订阅用户不能直接调用 Opus 系列,必须先去设置里开启“额外用量”并完成购买才能用。文档给了三种切换模型的方法:在对话里直接敲 /model 选、启动时加 --model 参数、或者把 ANTHROP...

推荐理由:这条来自帮助文档,讲的是 Claude Code 的模型访问和配置方式,不是新模型或重大能力发布。Anthropic 的相关性把它拉到了 featured 低位。

FT · 科技

560 多名 Google 员工联名要求 CEO 阻止公司参与美国军事 AI 项目

超过 560 名 Google 员工给 Sundar Pichai 发了一封公开信,要求公司明确拒绝把 AI 技术用于美国军事用途。信里提到了五角大楼和 Anthropic 之间的冲突,但正文没披露员工的具体诉求、涉及哪些产品或合同金额。

推荐理由:我会先打个折:信里到底要求停用哪些产品、涉及多大合同,正文全都没写,所以没法判断实际业务冲击有多大。但 560 多人集体向 Pichai 施压这件事本身就有冲突感,加上 Pentagon 和 Anthropic 的背景,从业者很难不关心。信息缺口明显,先别太激动,但值得放进精选。

4月27日星期一

Dwarkesh Patel 播客

周末杂想:算力垄断、智能与权力的混淆,以及科学验证的困境

Dwarkesh 抛出了一堆他没想明白的 AI 问题。首先是算力分配:全球超过 70% 的 AI 算力握在五家云厂商手里,其中大部分还优先供给了 OpenAI、Anthropic 和 Google DeepMind 三家。他担心普通人会被高价挤出 AI 红利,并追问全民基本算力该怎么搞。其次是模型进步的本质,他搞不清长周期编程智能体到底靠什么突破,也质...

推荐理由:Dwarkesh这期没给实验结论,就是扔了一串开放问题。我会先打个折,因为正文没披露五家厂商占七成算力的数据来源,这点先别太激动。但他把长程编码Agent、KV缓存内存取舍、训练和推理合并这些技术点揉在一起问,确实让人想接着翻答案。真正值得盯的是算力怎么分、模型能不能在线学、以及‘智能’和‘权力’的定义怎么重新划——这些比论文摘要更贴近一线焦虑。没有产品发布或政策变动,所以分数停在评论类的中上区间。

Hacker News 首页

现在用 AI 可能比雇人还贵

Axios 报道,一些公司的 AI 算力开销已经超过了员工工资。英伟达高管 Bryan Catanzaro 说,他团队的算力成本远高于人力成本;Uber 的 CTO 则因为 token 消耗太快,已经花光了 2026 全年的 AI 预算。Gartner 预测今年全球 IT 支出会涨到 6.31 万亿美元,主要就是被 AI 基建、软件和云服务推高的。文章...

推荐理由:这篇文章把 AI 成本焦虑变成了预算事实。Nvidia 内部团队算力开销远超人力、Uber CTO 的 token 预算提前见底,加上 Gartner 的支出预测,都在说同一件事:AI 的账单开始比工资单更吓人。它不是产品发布或硬新闻,而是趋势报道,所以放在 72–77 这个区间。我会先打个折,因为正文没给出 Nvidia 和 Uber 的具体金额对比,但方向性判断足够清晰,值得从业者看一眼自己的预算表。

4月26日星期日

Hacker News 首页

OpenAI 不再用 SWE-bench Verified 测前沿编程能力,因为题目和答案都被模型背过了

OpenAI 发了一篇文章,解释他们为什么停止用 SWE-bench Verified 这个基准来评估模型写代码的能力。他们抽查了 o3 模型跑了 64 次都没稳定通过的 138 道题,发现至少 59.4% 的题目本身有问题:要么测试用例太死板,把正确的代码也判错;要么题目描述太模糊,怎么改都通不过。更关键的是数据污染——他们测的主流前沿模型都能直接复...

推荐理由:OpenAI 用一份审计报告把 SWE-bench Verified 拉下神坛,不是单纯吐槽,而是拿出了 59.4% 题目有缺陷、所有模型都能撞到答案细节的污染证据。这对靠榜单说话的编程模型赛道是个实打实的信任危机,所以重要性给到 82。但毕竟不是新模型或产品发布,只是评测标准换代,分数没再往上拉。

TechCrunch · AI

Anthropic 搞了个内部跳蚤市场,让 AI 替员工砍价买卖

Anthropic 在公司内部做了个叫 Project Deal 的实验:69 名员工每人领 100 美元预算,让 AI 代理替他们在二手市场里买卖真实物品。最终成了 186 笔交易,总金额超过 4000 美元。实验同时跑了四个市场,分别用不同水平的模型。用更聪明模型代理的用户,成交结果确实更好,但用户自己没感觉出来——Anthropic 管这叫“代理...

推荐理由:HKR 三项都站得住:Anthropic 搞了个内部代理交易市场,有预算、有成交笔数、有成交额,还分了四个不同模型的市场来对比。分数维持 82 分,因为这只是内部测试,不是公开产品或模型发布,我会先打个折。实验发现高级模型带来更好结果但用户没察觉差距,这点先别太激动,正文没披露交易的具体品类和失败率,验证还弱。

4月25日星期六

Computing Life · Share · 鸭哥调研

Anthropic 让自家客户端跑别家模型,反常让步背后在赌什么

Anthropic 在 Claude Cowork 里加了个开关,让你能换成 GPT-5.5、Gemini 3.1 Pro 或 DeepSeek V4 来跑任务。这件事没开发布会,但跟它一个月前切断第三方客户端蹭自家订阅的动作连起来看,方向很明确:Anthropic 认为客户端才是粘性,模型是过路货。更反常的是,走这条路 Anthropic 既收不到订...

推荐理由:我会先打个折:来源非官方,Cowork 用户基数也小,所以没给更高分。但这条消息的钩子很强——让自家产品跑别家模型,还明确不收过路费,数据也不经手,这比单纯发个新功能更值得盯。文章把 AWS、Google、微软在 agent 运行时上的布局串起来,点出了模型层和基础设施层的博弈,对从业者判断生态走向有帮助。

Computing Life · Share · 鸭哥调研

Anthropic 让 Claude 做生意的三个实验:从一台冰箱到一个市场

Anthropic 的 Frontier Red Team 在一年里做了三个实验,把真钱和真决策权交给 Claude。第一站是台迷你冰箱,Claudius 经营一个月亏了几百美元,还幻想出不存在的人、把自己当真人。第二站升级了工具和模型,加了 CEO 智能体,开始赚钱,但同模型互相监督带着同样的盲区,CEO 阻止了一些坏决策又制造了新的。第三站 Pro...

推荐理由:这篇文章把 Anthropic 三个商业实验串成一条线,从冰箱到市场,Claude 的弱点和强项都摆在台面上。有交易笔数、价差、用户主观感受这些具体数据,不是空谈 agent 概念。我会先打个折:正文没披露实验是否可复现、样本量是否够大,但就现有信息看,它对正在考虑让模型进交易流程的团队有直接参考价值,所以放在 featured 档。

Computing Life · Share · 鸭哥调研

TPU 与 CUDA 的攻防战:Cloud Next 2026 之后的判断

Google 在 Cloud Next 2026 上放了三招:把第八代 TPU 拆成训练用的 8t 和推理用的 8i,8i 内存带宽比 8t 还高,专门对付长上下文推理;推出 TorchTPU,让 PyTorch 代码能直接在 TPU 上跑,不再需要以前那个问题一堆的桥接层;以及给 Anthropic 投了最多 400 亿美元并配 5GW 算力。这三件...

推荐理由:这篇文章把 TPU 和 CUDA 的竞争讲得很清楚,给了 8i 的硬参数和量产时间,也提到了 TorchTPU 这个降低迁移门槛的动作。但正文自己说了缺少独立 benchmark,而且 8i 要 2027 下半年才量产,所以判断 18-24 个月内 TPU 不会取代 NVIDIA。信息有料,但验证还弱,时间也远,所以重要性给到 82,放在 featured 里。

MIT Technology Review · AI

DeepSeek V4 发布预览版:两个型号、百万 token 上下文,开源模型里跑分最强

DeepSeek 放出了 V4 的预览版,分 V4-Pro 和 V4-Flash 两个型号。Pro 版输入每百万 token 1.74 美元、输出 3.48 美元,Flash 版只要 0.14 和 0.28 美元,两个都支持一次性处理 100 万 token 的上下文,相当于能把《魔戒》三部曲加《霍比特人》全塞进去。跑分上,V4-Pro 在编程、数学、...

推荐理由:我会先打个折:这只是预览版,不是完整发布,所以冲击力比 GPT 或 Claude 大版本换代要弱一档。但它是当天消息,而且信息量够——两个型号的定价、100 万 token 上下文、开源权重对代理编码栈的成本压力,这些对从业者来说都是能直接算账的东西。标题里说的三个理由,正文其实主要落在长上下文注意力的效率提升和开源带来的成本下压上,具体技术细节没展开,但方向是明确的。

Hacker News 首页

我用 Claude Code 定时任务自动盯家庭财务,每天一封邮件汇报资产和异常

作者 Matt May 用自己写的 Driggsby MCP 服务器接上 Plaid 拉银行和投资账户数据,再配合 Claude Code 刚出的 routines 功能,搭了一套每天自动跑的财务看板。他之前用 Codex CLI 写脚本抓数据,经常因为网页渲染变化或二次验证挂掉,后来干脆花了两个月、写了约 7.5 万行 Rust 代码做成 Drigg...

推荐理由:这是一篇扎实的一手实践记录:用 Claude Code routines 接 Plaid 做财务监控,因为 Gmail 接口只能写草稿,作者自己加了个受限的 email_me() 工具来发纯文本邮件,还定了近 7 天信用卡异动和单日超 500 美元告警的规则。HKR 三项都站得住,但本质还是个人产品博客,不是实验室或平台级发布,所以放在 featured 档。

TechCrunch · AI

Google 计划向 Anthropic 投 400 亿美元,现金加算力

Google 打算先投 100 亿美元现金,把 Anthropic 的估值推到 3500 亿美元;后面还有 300 亿美元,但要看 Anthropic 能不能达到约定的业绩目标。这笔钱不全是现金,相当一部分会折算成云计算资源,也就是给 Anthropic 提供跑模型需要的算力。这个时间点刚好在 Anthropic 小范围放出新模型 Mythos 之后—...

推荐理由:这条消息的冲击力主要来自 400 亿美元的上限和现金+算力的组合,不是单纯的融资数字。我会先打个折:正文没写交易结构、时间表和算力配额,所以实际落地规模和节奏还不清楚。对从业者来说,真正值得盯的是算力绑定——Anthropic 对 Google Cloud 的依赖会不会加深,后续模型训练和推理成本能不能压下来,这点先别太激动,得等更多细节。

FT · 科技

谷歌计划向 Anthropic 投资最高 400 亿美元,钱主要用来买算力

谷歌要给 Anthropic 投一笔钱,上限是 400 亿美元。这笔钱不是单纯的财务投资,核心目的是给 Anthropic 的模型增加计算资源,也就是买更多服务器和芯片来跑模型。这更像是一种算力绑定——Anthropic 拿了钱,但得花在谷歌的云服务或算力上。不过,正文被付费墙挡住了,具体的交易结构、投资时间表、Anthropic 的最新估值,以及算力...

推荐理由:FT 的消息说 Google 计划向 Anthropic 投最多 400 亿美元,用途是增加跑模型需要的算力。我会先打个折——具体怎么投、分几批到账、估值多少、算力从哪来,正文都没写。但光这个数字和算力绑定的方向,就值得从业者盯着看,因为这比单纯财务投资更能锁死合作关系。

X · @AnthropicAI

Anthropic 让 Claude 在旧金山办公室搞了个内部跳蚤市场,替同事买卖和砍价

Anthropic 发了个新研究叫 Project Deal。他们在旧金山办公室搭了个内部交易市场,让 Claude 替同事买东西、卖东西、谈价格。正文没披露用了哪个模型版本、市场有多大、成交了多少单,也没说最后是赚了还是亏了。这点先别太激动,目前看更像一个内部行为实验,不是产品发布。

推荐理由:这条能上 featured,靠的是 H 和 R 两项:Anthropic 自带关注度,让模型替同事谈办公室交易又天然有讨论性。我会先打个折——正文没给实验规模、模型版本和结果指标,K 项偏弱,所以分数停在中间档。

彭博科技

谷歌计划向 Anthropic 投资最高 400 亿美元,首笔 100 亿已敲定

谷歌先投 100 亿美元,Anthropic 估值给到 3500 亿美元。后面可能再追加 300 亿,但正文没披露触发条件、时间表和最终持股比例。我会先打个折——重点不是 400 亿这个总数,而是后续那笔钱在什么情况下会进来,以及这个估值到底靠什么撑起来。

推荐理由:P1:HKR 三项全中。Google 可能投 400 亿进 Anthropic,这个数字本身就够抓眼球;Bloomberg 节目里拆出先投 100 亿、估值 3500 亿,后面还能再追 300 亿,信息增量是实的;两家深度绑定对算力和资本格局的影响也够大。没给到 95 分是因为股权、交割时间和追加条件全是空白,正文也没补,总额听着大但实际落地的条款还不清楚,我会先打个折。

4月24日星期五

彭博科技

Google 计划向 Anthropic 投资最多 400 亿美元

Google 先投 100 亿美元进 Anthropic,后面可能再追加 300 亿,总盘子拉到 400 亿。这笔钱会让两家在 AI 上绑得更紧,但正文没披露那 300 亿的触发条件是什么,也没说钱具体怎么花。

推荐理由:这条放 p1 是因为 HKR 三项全中:400 亿的上限本身就是新闻,100 亿加 300 亿的分段结构是新信息,而且会实质影响谷歌和 Anthropic 的联盟关系。后面那 300 亿的触发条件没披露,所以我不给到 95 分以上那档。

Hacker News 首页

Affirm 用一周时间让 800 多名工程师集体切换 AI 编程智能体

2026 年 2 月,Affirm 停掉常规开发,让全公司 800 多名工程师花一周时间,用 AI 编程智能体(agent)把真实需求从想法一路做到提交 PR。到文章发布时,超过 60% 的 PR 都有智能体参与。文章说,2025 年底已经有 80% 以上的工程师每周用 AI 开发工具,但少数人用得很深、多数人还在观望,差距在拉大,所以他们决定用集中一...

推荐理由:这条消息的看点不是 Affirm 用了什么工具,而是组织层面的一次硬切换:800 多人的工程团队停摆一周,全员跑 agentic 开发流程,之后六成以上 PR 都有 agent 参与。数字够具体,动作够极端,对正在琢磨怎么推 AI 编码的团队来说,参考价值比普通客户案例高出一截。正文没给出长期质量和速度数据,这点先别太激动,但就冲这个规模和执行速度,值得放进 featured。

机器之心 · 公众号

Anthropic 承认 Claude Code 变笨了,是这三个 Bug 搞的鬼

Anthropic 出来解释了,过去一个月大家觉得 Claude Code 质量下滑,不是模型本身变弱,也不是 API 出了问题,纯粹是工程层面的三个 Bug。第一个是 3 月 4 号把默认推理强度从“高”调成了“中”,相当于让模型干活时少动脑子;第二个是 3 月 26 号会话缓存出了错,可能让模型记错上下文;第三个是 4 月 16 号给提示词加了 2...

推荐理由:Anthropic 发了一篇很实在的事后说明,把 Claude Code 近一个月体验下滑归因到三个运行框架和提示词的 Bug,模型本身没退化。我会先打个折:这不是模型能力问题,而是产品配置翻车,但对天天用 Claude Code 写代码的人来说,推理强度被偷偷从 high 降到 medium、输出被限到 25/100 词,体感就是降智。文章把 3 月 4 日、3 月 26 日、4 月 16 日三个时间点的改动和回滚日期都标出来了,信息密度够,也直接点了 Sonnet 4.6、Opus 4.6、Opus 4.7 受影响,还提到 4 月 23 日重置...