Anthropic 公开指控阿里“非法”获取其 AI 模型
Anthropic 发帖称阿里巴巴“非法”访问了它的 AI 模型。目前只有标题,正文没披露具体指什么——是模型权重被偷、API 输出被扒,还是通过其他方式获取。也没看到阿里方面的回应。我会先打个折,等更多细节出来再判断这件事的严重程度。
推荐理由:Anthropic 公开指控阿里巴巴这件事冲突感很强,讨论价值高,但正文目前只有一个标题,关键事实——到底访问了什么、阿里有没有回应——全是空白,所以评分只能保守一点。
Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。
Anthropic 发帖称阿里巴巴“非法”访问了它的 AI 模型。目前只有标题,正文没披露具体指什么——是模型权重被偷、API 输出被扒,还是通过其他方式获取。也没看到阿里方面的回应。我会先打个折,等更多细节出来再判断这件事的严重程度。
推荐理由:Anthropic 公开指控阿里巴巴这件事冲突感很强,讨论价值高,但正文目前只有一个标题,关键事实——到底访问了什么、阿里有没有回应——全是空白,所以评分只能保守一点。
彭博社消息,Google 即将再失去两名资深 AI 研究员,去向是 Anthropic。这是 Google 向 Anthropic 持续流失人才的最新一例。不过,报道没有公布这两人的姓名和具体负责方向,所以暂时没法判断这对 Google 哪个团队影响最大。
推荐理由:彭博独家消息,Google 再失两名资深 AI 研究员给 Anthropic,人才流动的叙事本身就有吸引力。但缺了姓名和职责,知识增量打了折扣。H 和 R 都踩中,K 偏弱,刚好落在 featured 门槛上。
纽约第 12 选区民主党初选成了两家 AI 公司较劲的战场。Anthropic 支持的 Alex Bores 没赢,但 OpenAI 也没把他打趴下。两边加起来花了 2700 万美元,文章没拆开说各自出了多少。这场选战被看作两家公司政治影响力的压力测试,最后谁都没拿到决定性胜利。
推荐理由:两家头部AI实验室在一个国会初选上砸了2700万美元打代理人战争,最后打成平手——这事本身就值得讲。标题里的"proxy war"把商业竞争和政治搅在一起,抓人。三个维度都踩中了,但文章没披露Anthropic和OpenAI各自掏了多少,所以分数卡在featured门槛上,不往上拔。
Figma 在 Config 2026 上把画布变成了能同时处理代码、动画、3D 和着色器的工作区。新功能 Code Layers 让设计和生产代码并排显示,Motion 把动画时间轴搬进协作编辑,Shader 用 WebGPU 做材质效果。但公司承认,调用第三方 AI 模型的推理成本太高,正在吃掉利润,而且这些模型来自 Anthropic 等正在做竞...
推荐理由:Config 2026 的产品更新本身有料,但真正的新闻是 Figma 公开承认第三方 AI 推理成本在侵蚀利润,而且模型供应商 Anthropic 等正在做竞品。我会先打个折:正文没披露具体成本数字或利润率变化,所以'吃掉利润'这个判断只能停在公司表态层面。但这件事对从业者的参考价值很直接——当你把核心画布 AI 能力押在第三方模型上,成本结构和竞争风险会同时找上门。
Google 给 Gemini 3.5 Flash 加了一个内置的“操作电脑”工具,模型可以自己截图、点按钮、填表单,去操作网页和桌面软件界面。这跟 Anthropic 和 OpenAI 之前做的方向一样,都是把屏幕控制能力直接做进模型里。官方说在 WebVoyager 这个网页操作基准测试上,3.5 Flash 跑赢了 Claude Sonnet 4...
推荐理由:Google 给 Gemini 3.5 Flash 内置了电脑操作工具,模型能自己截图、点按钮、填表单,跟 Anthropic 和 OpenAI 的路线一致。官方在 WebVoyager 基准上跑赢了 Claude Sonnet 4,这点有数字撑腰。但我会先打个折:这是一篇博客公告,没给 API 定价,也没说实际延迟,所以现在只能当技术方向看,还不能直接算账。
NSA 的网络安全分析师一直在测试 Anthropic 的 Mythos 模型,结果发现它能在几小时内攻破他们几乎所有的机密系统。参议员 Mark Warner 在听证会上引述 NSA 局长的话说,Mythos 突破这些网络“不是几周,而是几小时”。本月特朗普政府对 Anthropic 实施出口管制后,Mythos 5 和 Fable 5 被撤回,NS...
推荐理由:纽约时报独家,有 NSA 测试结果和参议院听证会细节。'几小时而非几周'这个说法是硬核新信息,出口管制导致断供又加了政策层面的紧张感。扣分项是正文没具体说攻破了哪些系统、怎么攻破的,技术细节还是模糊的,所以判断上我会先打个折,但整体信息量和冲击力足够。
Anthropic 发布了 Claude Tag,让 Claude 以团队成员身份加入 Slack,可以跨频道被 @ 派活、主动跟进任务,甚至能等上几天直到阻塞项解除再继续。内部数据显示,它已经写了产品团队 65% 的 PR,包括 Claude Tag 自身的大部分代码。我会先打个折:这是内部数据,外部团队能不能复现这个比例还不好说。目前只开放给 En...
推荐理由:Anthropic 发了 Claude Tag,让 Claude 以团队成员身份加入 Slack,可以跨频道被 @ 派活、主动跟进任务,甚至能等上几天直到阻塞项解除再继续。内部数据显示它写了产品团队 65% 的 PR,包括 Tag 自己大部分代码。我会先打个折:这是内部数据,外部团队能不能复现这个比例还不好说。目前只开放给 Enterprise 客户,正文没披露具体定价和外部测试数据。
Claude Tag 把 AI 塞进 Slack 当常驻同事,能主动插话、记住频道聊天。但拆开看,底下还是给 HTTP 端点发请求,记忆存的是原始聊天记录,不是组织经验。真正的变化在另一层:企业开始把 agent 当成需要正经授权、设预算、记审计的非人类执行体来管。微软的 Entra Agent ID 直接把 agent 当企业目录里的一等公民,定价也...
推荐理由:这篇没在复述功能,而是把 Claude Tag 拆成两层:表层是 Slack 里的主动插话和频道记忆,底层还是调 HTTP 端点,记忆也没做结构化提炼。真正的看点被拉到企业授权逻辑的转变上——微软 Entra Agent ID 直接把 agent 当目录里的独立身份来管,配权限、设预算、记审计。这个角度对从业者来说比技术细节更有用,因为落地卡住的往往不是模型能力,而是“这个 agent 到底算谁”。
一家 Anthropic 的客户把美国政府告了,理由是政府没走正当程序就切断了一个叫 Fable 的付费 AI 模型服务。文章没说明 Fable 具体对应 Anthropic 的哪个模型。目前能确认的只有起诉状已经提交,案件细节和政府的回应都还没公开。
推荐理由:一家 Anthropic 的客户把美国政府告了,理由是没走正当程序就断了 Fable 这个付费 AI 模型的服务。这事本身有冲突感,也戳中从业者对政策风险的神经,所以 H 和 R 都成立。但文章太薄了——Fable 对应哪个模型、政府切断的理由、案件进展全都没披露,K 完全撑不起来,分数就卡在 featured 门槛上。
Claude Tag 让团队可以在 Slack 频道里直接 @Claude 派活。它会自己拆解任务、调用接入的工具,异步把活干完,并在线程里回复结果。它还能记住频道上下文,不用每次都从头解释;如果开启了“主动感知”,它会自动提醒你可能需要关注的信息。Anthropic 说自家产品团队 65% 的代码已经是内部版 Claude Tag 写的,用途也扩展到...
推荐理由:Anthropic 把 Claude 从聊天界面搬进了团队协作工具 Slack,核心卖点是异步干活和记住频道上下文,不用每次都从头解释。65% 内部代码生成这个数字很硬,说明他们自己已经重度依赖。我会先打个折,外部团队的真实数据还没出来,但交互模式本身够新鲜,值得当天写。
Anthropic 发了个叫 Claude Tag 的新功能,相当于在 Slack 里塞了一个常驻 AI 同事。它不是那种你问一句才答一句的机器人,而是会持续读频道里的历史消息,慢慢攒出一套对公司业务、项目背景和团队默契的理解。你可以直接在消息里 @ 它问事,它会结合之前看过的上下文来回答,不用每次都重新交代背景。这招挺聪明:把组织里散落的信息变成 C...
推荐理由:Anthropic 给 Claude 加了个 Slack 集成,叫 Claude Tag。它不等着你问,而是持续读频道历史消息,自己攒出一套对公司业务和项目背景的理解。你 @ 它问事时,它直接用之前攒下的上下文回答,不用每次都重新交代一遍背景。这个产品形态挺新鲜,不是常见的问答机器人,机制上也和标准的外挂资料库检索不同。TechCrunch 的报道点出了关键:Slack 重度用户会想尝鲜,但也会担心一个 AI 天天读聊天记录的安全问题。我会先打个折,因为正文没披露它具体怎么处理权限和隐私边界,实际落地效果也还没验证。
David Rosenthal 算了笔账:SemiAnalysis 测试发现,花 200 美元买月费,能在 OpenAI 烧掉价值 1.4 万美元的 token,在 Anthropic 烧掉 8000 美元,相当于平台补贴了 40 到 70 倍的成本。Ed Zitron 拿到的 OpenAI 2025 年财务数据更直接——年收入 130.7 亿美元,总...
推荐理由:David Rosenthal 算了笔实在账。SemiAnalysis 测试发现,你花 200 美元月费,在 OpenAI 能烧掉价值 1.4 万美元的 token,在 Anthropic 能烧掉 8000 美元,相当于平台替你扛了 40 到 70 倍的成本。Ed Zitron 拿到的 OpenAI 2025 年财务数据更直接——年收入 130.7 亿美元,总成本高出一大截,亏损在扩大。这不是新观点,Sequoia 的 Cahn 2023 年就提过类似担忧,但这次数据更新了,账也更细了。我会先打个折:SemiAnalysis 的测试方法正文没详细披...
Anthropic 分析了约 40 万条 Claude Code 真实会话,发现管理者在需要 git commit、PR 合并、测试通过等硬证据的“已验证成功”指标上得分最高,超过软件工程师。群里指出这有明显选择偏差——管理者只管灵光一现,不管边界情况死活。Sakana AI 发布多模型编排产品 Fugu,SWE Bench Pro 得分 73.7,特...
推荐理由:Anthropic 拿 40 万条真实会话做了量化分析,发现管理者在需要硬证据的指标上得分最高,群里已经指出选择偏差——管理者只管想法不管边界情况。HKR 三点都踩中了,但这是日报里的二手摘要,不是一手论文,所以给 72 分放在 featured 位置。
SpaceX 签下了第三笔 GPU 租赁大单,把 GB300 服务器租给做开源模型的 Reflection AI,每月收 1.5 亿美元。加上之前租给 Anthropic(每月 12.5 亿)和 Google(每月 9.2 亿)的合同,分析师 Jamin Ball 算了一笔账:SpaceX 现在每月 GPU 收入 23.2 亿美元,一年下来约 280 ...
推荐理由:SpaceX 签下第三笔 GPU 大单,把 GB300 服务器租给做开源模型的 Reflection AI,月费 1.5 亿美元。加上之前租给 Anthropic(月费 12.5 亿)和 Google(月费 9.2 亿),分析师算出 SpaceX 现在每月 GPU 收入 23.2 亿美元,年化约 280 亿。这个体量已经超过很多传统云厂商的算力租赁业务,对关注 AI 基础设施的人来说是个值得重新评估竞争格局的信号。没给更高分是因为这属于二手财务分析,不是一手产品发布,而且正文没披露合同具体年限和交付时间,实际收入可能打折扣。
作者把 Anthropic 用 Mythos 发现的 9 个真实漏洞做成了盲测基准:给模型完整的源码树和要审查的文件,不给任何提示,看谁能找出漏洞。结果所有模型表现都低于预期。Gemma 4 MoE 以 4/9 的检出率暂时领先,但它中途崩溃重试了好几次;GPT 5.5 Pro 只跑了 4 个案例就烧掉了 100 美元预算,2/4 的成绩参考意义有限。...
推荐理由:作者用 Anthropic 自己披露的 Mythos 发现的 9 个真实漏洞搭了个盲测基准,给模型完整源码树但不给任何提示,看谁能找出漏洞。结果所有模型表现都低于预期,Gemma 4 MoE 以 4/9 暂时领先但中途崩溃重试了好几次,GPT 5.5 Pro 只跑了 4 个案例就烧掉 100 美元预算,2/4 的成绩说明不了太多问题。这是第一个用真实 Mythos 漏洞做的公开盲测,对想用模型辅助代码审计的团队来说,数据虽然少但很直接。
Sakana AI 发布的 Fugu 是一个训练出来的多模型协调器,它不靠人写规则,而是自己判断该叫哪个模型、分什么角色、怎么验收。底层是两篇 ICLR 2026 论文:TRINITY 用进化策略训练了一个不到两万参数的极小协调器,Conductor 用强化学习训练了一个七十亿参数的编排器。Fugu Ultra 在 LiveCodeBench 上拿到 ...
推荐理由:Sakana AI 把多模型协调这件事从手工规则变成了训练出来的能力,背后有两篇顶会论文,机制说得清楚。但正文没给出 LiveCodeBench 的具体分数,也没提定价,产品刚发布还没社区验证,所以分数先打个折。
Anthropic 把完整版 Claude Desktop 搬到了三大云平台里,企业可以在自己的云账号内直接跑,不用走公网。这对合规要求严的团队是个实打实的好处——数据不出自己的云环境。目前只面向 Claude Enterprise 客户,正文没提具体价格和上线时间,这点先别太激动。
推荐理由:Anthropic 把完整版 Claude Desktop 塞进了三大云平台的企业自有环境里,数据不出 VPC,对合规要求严的团队是个实打实的好处。正文没提价格和 GA 时间,只说了 Enterprise 客户能用,这点先别太激动——没这两项,企业采购根本没法走流程。
作者是一位拿了终身教职、主编国际期刊的教授,他直言学术界的奖励机制在 AI 面前已经崩了。学生端,用两个付费模型互相打磨出来的作业,不仅查不出来,分数还比老实手写的更高,系统在惩罚诚实的人。研究端更严重,一个人靠 Consensus 加 Claude 一天能产出一篇够发表水平的论文,同行评审根本审不过来。基金申请也一样,五人团队轮流当主申请人,一个周期...
推荐理由:一位终身教授以第一人称视角,把学术奖励机制在 AI 冲击下如何崩盘讲得很具体,不是泛泛的担忧。扣分点在于这是个人博客而非机构报告,权威性稍弱,但操作细节和情绪冲击力足够强。
Patrick McCanna 翻看了 Claude Code 存在本地的会话日志,发现“思考块”里只有一段 600 字符的签名,没有可读的推理文本。Anthropic 把真正的推理过程加密塞进了这个签名里,解密密钥留在自己服务器上,API 只返回一份摘要。你在终端里按 ctrl+o 看到的“长思考”内容,是事后由 Fable/Opus 模型总结出来的...
推荐理由:Patrick McCanna 直接翻了 Claude Code 的本地日志,发现思考块里塞的是一个 600 字符的加密签名,不是可读推理。Anthropic 把真正的推理过程锁在自己服务器上,解密密钥不给你,API 只返回一份由 Fable/Opus 事后总结出来的摘要。你在终端按 ctrl+o 看到的那些'长思考',其实是二手货。这对靠思考链做调试、审计的开发者来说是个硬伤——你以为在看模型怎么想,实际在看另一个模型替你圆。文章信息来自一手逆向,不是公关口径,我会给 featured。
FT 统计了 2026 年的公开用词,Anthropic 每说一千个词就有五个跟风险、监管或限制有关,频率远高于 OpenAI。批评者认为,正是 Anthropic 反复强调高级 AI 的危险性,间接促使美国政府禁止外国用户访问其最新模型。不过正文没披露禁令的具体条款和生效时间,所以实际影响有多大还不好说。
推荐理由:故事的反讽感很强,FT 的词频统计是个扎实的钩子,三个维度都打中了。扣分是因为正文没写禁令的具体条款和生效时间,实际影响有多大还不清楚,所以分数压在 85 以下。