跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 681–700 条 · 共 1,303 条

6月25日星期四

彭博科技

Anthropic 公开指控阿里“非法”获取其 AI 模型

Anthropic 发帖称阿里巴巴“非法”访问了它的 AI 模型。目前只有标题,正文没披露具体指什么——是模型权重被偷、API 输出被扒,还是通过其他方式获取。也没看到阿里方面的回应。我会先打个折,等更多细节出来再判断这件事的严重程度。

推荐理由:Anthropic 公开指控阿里巴巴这件事冲突感很强,讨论价值高,但正文目前只有一个标题,关键事实——到底访问了什么、阿里有没有回应——全是空白,所以评分只能保守一点。

彭博科技

Google 又有两名资深 AI 研究员要跳槽去 Anthropic

彭博社消息,Google 即将再失去两名资深 AI 研究员,去向是 Anthropic。这是 Google 向 Anthropic 持续流失人才的最新一例。不过,报道没有公布这两人的姓名和具体负责方向,所以暂时没法判断这对 Google 哪个团队影响最大。

推荐理由:彭博独家消息,Google 再失两名资深 AI 研究员给 Anthropic,人才流动的叙事本身就有吸引力。但缺了姓名和职责,知识增量打了折扣。H 和 R 都踩中,K 偏弱,刚好落在 featured 门槛上。

The Verge · AI

Anthropic 和 OpenAI 在纽约初选砸了 2700 万美元,结果打了个平手

纽约第 12 选区民主党初选成了两家 AI 公司较劲的战场。Anthropic 支持的 Alex Bores 没赢,但 OpenAI 也没把他打趴下。两边加起来花了 2700 万美元,文章没拆开说各自出了多少。这场选战被看作两家公司政治影响力的压力测试,最后谁都没拿到决定性胜利。

推荐理由:两家头部AI实验室在一个国会初选上砸了2700万美元打代理人战争,最后打成平手——这事本身就值得讲。标题里的"proxy war"把商业竞争和政治搅在一起,抓人。三个维度都踩中了,但文章没披露Anthropic和OpenAI各自掏了多少,所以分数卡在featured门槛上,不往上拔。

AI HOT 精选

Figma Config 2026 押注人能判断,但画布背后的 AI 靠的是别家模型

Figma 在 Config 2026 上把画布变成了能同时处理代码、动画、3D 和着色器的工作区。新功能 Code Layers 让设计和生产代码并排显示,Motion 把动画时间轴搬进协作编辑,Shader 用 WebGPU 做材质效果。但公司承认,调用第三方 AI 模型的推理成本太高,正在吃掉利润,而且这些模型来自 Anthropic 等正在做竞...

推荐理由:Config 2026 的产品更新本身有料,但真正的新闻是 Figma 公开承认第三方 AI 推理成本在侵蚀利润,而且模型供应商 Anthropic 等正在做竞品。我会先打个折:正文没披露具体成本数字或利润率变化,所以'吃掉利润'这个判断只能停在公司表态层面。但这件事对从业者的参考价值很直接——当你把核心画布 AI 能力押在第三方模型上,成本结构和竞争风险会同时找上门。

AI HOT 精选

Gemini 3.5 Flash 现在能直接操作电脑界面了

Google 给 Gemini 3.5 Flash 加了一个内置的“操作电脑”工具,模型可以自己截图、点按钮、填表单,去操作网页和桌面软件界面。这跟 Anthropic 和 OpenAI 之前做的方向一样,都是把屏幕控制能力直接做进模型里。官方说在 WebVoyager 这个网页操作基准测试上,3.5 Flash 跑赢了 Claude Sonnet 4...

推荐理由:Google 给 Gemini 3.5 Flash 内置了电脑操作工具,模型能自己截图、点按钮、填表单,跟 Anthropic 和 OpenAI 的路线一致。官方在 WebVoyager 基准上跑赢了 Claude Sonnet 4,这点有数字撑腰。但我会先打个折:这是一篇博客公告,没给 API 定价,也没说实际延迟,所以现在只能当技术方向看,还不能直接算账。

6月24日星期三

Hacker News 首页

NSA 被切断 Anthropic 模型访问,此前测试中该模型数小时内攻破几乎所有机密系统

NSA 的网络安全分析师一直在测试 Anthropic 的 Mythos 模型,结果发现它能在几小时内攻破他们几乎所有的机密系统。参议员 Mark Warner 在听证会上引述 NSA 局长的话说,Mythos 突破这些网络“不是几周,而是几小时”。本月特朗普政府对 Anthropic 实施出口管制后,Mythos 5 和 Fable 5 被撤回,NS...

推荐理由:纽约时报独家,有 NSA 测试结果和参议院听证会细节。'几小时而非几周'这个说法是硬核新信息,出口管制导致断供又加了政策层面的紧张感。扣分项是正文没具体说攻破了哪些系统、怎么攻破的,技术细节还是模糊的,所以判断上我会先打个折,但整体信息量和冲击力足够。

Latent Space

Anthropic 把 Claude 塞进 Slack 当同事,能跨频道跟进、等几天再干活

Anthropic 发布了 Claude Tag,让 Claude 以团队成员身份加入 Slack,可以跨频道被 @ 派活、主动跟进任务,甚至能等上几天直到阻塞项解除再继续。内部数据显示,它已经写了产品团队 65% 的 PR,包括 Claude Tag 自身的大部分代码。我会先打个折:这是内部数据,外部团队能不能复现这个比例还不好说。目前只开放给 En...

推荐理由:Anthropic 发了 Claude Tag,让 Claude 以团队成员身份加入 Slack,可以跨频道被 @ 派活、主动跟进任务,甚至能等上几天直到阻塞项解除再继续。内部数据显示它写了产品团队 65% 的 PR,包括 Tag 自己大部分代码。我会先打个折:这是内部数据,外部团队能不能复现这个比例还不好说。目前只开放给 Enterprise 客户,正文没披露具体定价和外部测试数据。

Computing Life · Share · 鸭哥调研

Claude Tag 拆开看:技术上没那么新,但企业授权的对象变了

Claude Tag 把 AI 塞进 Slack 当常驻同事,能主动插话、记住频道聊天。但拆开看,底下还是给 HTTP 端点发请求,记忆存的是原始聊天记录,不是组织经验。真正的变化在另一层:企业开始把 agent 当成需要正经授权、设预算、记审计的非人类执行体来管。微软的 Entra Agent ID 直接把 agent 当企业目录里的一等公民,定价也...

推荐理由:这篇没在复述功能,而是把 Claude Tag 拆成两层:表层是 Slack 里的主动插话和频道记忆,底层还是调 HTTP 端点,记忆也没做结构化提炼。真正的看点被拉到企业授权逻辑的转变上——微软 Entra Agent ID 直接把 agent 当目录里的独立身份来管,配权限、设预算、记审计。这个角度对从业者来说比技术细节更有用,因为落地卡住的往往不是模型能力,而是“这个 agent 到底算谁”。

彭博科技

Anthropic 客户因美国政府切断 Fable 模型访问权限而起诉

一家 Anthropic 的客户把美国政府告了,理由是政府没走正当程序就切断了一个叫 Fable 的付费 AI 模型服务。文章没说明 Fable 具体对应 Anthropic 的哪个模型。目前能确认的只有起诉状已经提交,案件细节和政府的回应都还没公开。

推荐理由:一家 Anthropic 的客户把美国政府告了,理由是没走正当程序就断了 Fable 这个付费 AI 模型的服务。这事本身有冲突感,也戳中从业者对政策风险的神经,所以 H 和 R 都成立。但文章太薄了——Fable 对应哪个模型、政府切断的理由、案件进展全都没披露,K 完全撑不起来,分数就卡在 featured 门槛上。

Hacker News 首页

Anthropic 推出 Claude Tag:在 Slack 里 @Claude,让它当主动干活的团队成员

Claude Tag 让团队可以在 Slack 频道里直接 @Claude 派活。它会自己拆解任务、调用接入的工具,异步把活干完,并在线程里回复结果。它还能记住频道上下文,不用每次都从头解释;如果开启了“主动感知”,它会自动提醒你可能需要关注的信息。Anthropic 说自家产品团队 65% 的代码已经是内部版 Claude Tag 写的,用途也扩展到...

推荐理由:Anthropic 把 Claude 从聊天界面搬进了团队协作工具 Slack,核心卖点是异步干活和记住频道上下文,不用每次都从头解释。65% 内部代码生成这个数字很硬,说明他们自己已经重度依赖。我会先打个折,外部团队的真实数据还没出来,但交互模式本身够新鲜,值得当天写。

TechCrunch · AI

Anthropic 推出 Claude Tag,让 AI 同事直接蹲在 Slack 频道里读消息学公司业务

Anthropic 发了个叫 Claude Tag 的新功能,相当于在 Slack 里塞了一个常驻 AI 同事。它不是那种你问一句才答一句的机器人,而是会持续读频道里的历史消息,慢慢攒出一套对公司业务、项目背景和团队默契的理解。你可以直接在消息里 @ 它问事,它会结合之前看过的上下文来回答,不用每次都重新交代背景。这招挺聪明:把组织里散落的信息变成 C...

推荐理由:Anthropic 给 Claude 加了个 Slack 集成,叫 Claude Tag。它不等着你问,而是持续读频道历史消息,自己攒出一套对公司业务和项目背景的理解。你 @ 它问事时,它直接用之前攒下的上下文回答,不用每次都重新交代一遍背景。这个产品形态挺新鲜,不是常见的问答机器人,机制上也和标准的外挂资料库检索不同。TechCrunch 的报道点出了关键:Slack 重度用户会想尝鲜,但也会担心一个 AI 天天读聊天记录的安全问题。我会先打个折,因为正文没披露它具体怎么处理权限和隐私边界,实际落地效果也还没验证。

6月23日星期二

Hacker News 首页

AI 的烧钱换规模模式撞墙了

David Rosenthal 算了笔账:SemiAnalysis 测试发现,花 200 美元买月费,能在 OpenAI 烧掉价值 1.4 万美元的 token,在 Anthropic 烧掉 8000 美元,相当于平台补贴了 40 到 70 倍的成本。Ed Zitron 拿到的 OpenAI 2025 年财务数据更直接——年收入 130.7 亿美元,总...

推荐理由:David Rosenthal 算了笔实在账。SemiAnalysis 测试发现,你花 200 美元月费,在 OpenAI 能烧掉价值 1.4 万美元的 token,在 Anthropic 能烧掉 8000 美元,相当于平台替你扛了 40 到 70 倍的成本。Ed Zitron 拿到的 OpenAI 2025 年财务数据更直接——年收入 130.7 亿美元,总成本高出一大截,亏损在扩大。这不是新观点,Sequoia 的 Cahn 2023 年就提过类似担忧,但这次数据更新了,账也更细了。我会先打个折:SemiAnalysis 的测试方法正文没详细披...

AI 群聊日报

Anthropic 40 万条编程会话报告:管理者成功率超工程师;Gemini 3.5 Flash 输出截断根因是思考独白吃光 token

Anthropic 分析了约 40 万条 Claude Code 真实会话,发现管理者在需要 git commit、PR 合并、测试通过等硬证据的“已验证成功”指标上得分最高,超过软件工程师。群里指出这有明显选择偏差——管理者只管灵光一现,不管边界情况死活。Sakana AI 发布多模型编排产品 Fugu,SWE Bench Pro 得分 73.7,特...

推荐理由:Anthropic 拿 40 万条真实会话做了量化分析,发现管理者在需要硬证据的指标上得分最高,群里已经指出选择偏差——管理者只管想法不管边界情况。HKR 三点都踩中了,但这是日报里的二手摘要,不是一手论文,所以给 72 分放在 featured 位置。

Latent Space

SpaceX 靠租 GPU 一年进账 280 亿美元,成了最大的新云厂商

SpaceX 签下了第三笔 GPU 租赁大单,把 GB300 服务器租给做开源模型的 Reflection AI,每月收 1.5 亿美元。加上之前租给 Anthropic(每月 12.5 亿)和 Google(每月 9.2 亿)的合同,分析师 Jamin Ball 算了一笔账:SpaceX 现在每月 GPU 收入 23.2 亿美元,一年下来约 280 ...

推荐理由:SpaceX 签下第三笔 GPU 大单,把 GB300 服务器租给做开源模型的 Reflection AI,月费 1.5 亿美元。加上之前租给 Anthropic(月费 12.5 亿)和 Google(月费 9.2 亿),分析师算出 SpaceX 现在每月 GPU 收入 23.2 亿美元,年化约 280 亿。这个体量已经超过很多传统云厂商的算力租赁业务,对关注 AI 基础设施的人来说是个值得重新评估竞争格局的信号。没给更高分是因为这属于二手财务分析,不是一手产品发布,而且正文没披露合同具体年限和交付时间,实际收入可能打折扣。

Hacker News 首页

Mythos 真那么神?一个盲测把各家模型拉出来找安全漏洞,结果都挺吃力

作者把 Anthropic 用 Mythos 发现的 9 个真实漏洞做成了盲测基准:给模型完整的源码树和要审查的文件,不给任何提示,看谁能找出漏洞。结果所有模型表现都低于预期。Gemma 4 MoE 以 4/9 的检出率暂时领先,但它中途崩溃重试了好几次;GPT 5.5 Pro 只跑了 4 个案例就烧掉了 100 美元预算,2/4 的成绩参考意义有限。...

推荐理由:作者用 Anthropic 自己披露的 Mythos 发现的 9 个真实漏洞搭了个盲测基准,给模型完整源码树但不给任何提示,看谁能找出漏洞。结果所有模型表现都低于预期,Gemma 4 MoE 以 4/9 暂时领先但中途崩溃重试了好几次,GPT 5.5 Pro 只跑了 4 个案例就烧掉 100 美元预算,2/4 的成绩说明不了太多问题。这是第一个用真实 Mythos 漏洞做的公开盲测,对想用模型辅助代码审计的团队来说,数据虽然少但很直接。

Computing Life · Share · 鸭哥调研

Fugu:一个学会当经理的 AI,但它藏的比经理多

Sakana AI 发布的 Fugu 是一个训练出来的多模型协调器,它不靠人写规则,而是自己判断该叫哪个模型、分什么角色、怎么验收。底层是两篇 ICLR 2026 论文:TRINITY 用进化策略训练了一个不到两万参数的极小协调器,Conductor 用强化学习训练了一个七十亿参数的编排器。Fugu Ultra 在 LiveCodeBench 上拿到 ...

推荐理由:Sakana AI 把多模型协调这件事从手工规则变成了训练出来的能力,背后有两篇顶会论文,机制说得清楚。但正文没给出 LiveCodeBench 的具体分数,也没提定价,产品刚发布还没社区验证,所以分数先打个折。

AI HOT 精选

Claude Desktop 现在能直接部署在 AWS、Google Cloud 和微软 Foundry 上了

Anthropic 把完整版 Claude Desktop 搬到了三大云平台里,企业可以在自己的云账号内直接跑,不用走公网。这对合规要求严的团队是个实打实的好处——数据不出自己的云环境。目前只面向 Claude Enterprise 客户,正文没提具体价格和上线时间,这点先别太激动。

推荐理由:Anthropic 把完整版 Claude Desktop 塞进了三大云平台的企业自有环境里,数据不出 VPC,对合规要求严的团队是个实打实的好处。正文没提价格和 GA 时间,只说了 Enterprise 客户能用,这点先别太激动——没这两项,企业采购根本没法走流程。

Hacker News 首页

AI 已经杀死了我们熟悉的学术界

作者是一位拿了终身教职、主编国际期刊的教授,他直言学术界的奖励机制在 AI 面前已经崩了。学生端,用两个付费模型互相打磨出来的作业,不仅查不出来,分数还比老实手写的更高,系统在惩罚诚实的人。研究端更严重,一个人靠 Consensus 加 Claude 一天能产出一篇够发表水平的论文,同行评审根本审不过来。基金申请也一样,五人团队轮流当主申请人,一个周期...

推荐理由:一位终身教授以第一人称视角,把学术奖励机制在 AI 冲击下如何崩盘讲得很具体,不是泛泛的担忧。扣分点在于这是个人博客而非机构报告,权威性稍弱,但操作细节和情绪冲击力足够强。

6月22日星期一

Hacker News 首页

Claude Code 的“长思考”输出是事后摘要,不是模型当时的真实推理

Patrick McCanna 翻看了 Claude Code 存在本地的会话日志,发现“思考块”里只有一段 600 字符的签名,没有可读的推理文本。Anthropic 把真正的推理过程加密塞进了这个签名里,解密密钥留在自己服务器上,API 只返回一份摘要。你在终端里按 ctrl+o 看到的“长思考”内容,是事后由 Fable/Opus 模型总结出来的...

推荐理由:Patrick McCanna 直接翻了 Claude Code 的本地日志,发现思考块里塞的是一个 600 字符的加密签名,不是可读推理。Anthropic 把真正的推理过程锁在自己服务器上,解密密钥不给你,API 只返回一份由 Fable/Opus 事后总结出来的摘要。你在终端按 ctrl+o 看到的那些'长思考',其实是二手货。这对靠思考链做调试、审计的开发者来说是个硬伤——你以为在看模型怎么想,实际在看另一个模型替你圆。文章信息来自一手逆向,不是公关口径,我会给 featured。

AI HOT 精选

Anthropic 天天喊 AI 危险,结果把自己喊进了出口管制名单

FT 统计了 2026 年的公开用词,Anthropic 每说一千个词就有五个跟风险、监管或限制有关,频率远高于 OpenAI。批评者认为,正是 Anthropic 反复强调高级 AI 的危险性,间接促使美国政府禁止外国用户访问其最新模型。不过正文没披露禁令的具体条款和生效时间,所以实际影响有多大还不好说。

推荐理由:故事的反讽感很强,FT 的词频统计是个扎实的钩子,三个维度都打中了。扣分是因为正文没写禁令的具体条款和生效时间,实际影响有多大还不清楚,所以分数压在 85 以下。