跳到正文

#Anthropic

今日 12 条

7月1日星期三

MIT Technology Review · AI

Anthropic 发布 Claude Science,把 AI 代理正式塞进实验室

Anthropic 把 Claude Science 定位成跟 Claude Code 同级别的旗舰产品,专门帮科学家写代码、在计算集群上跑实验,并且强调结果可复现。产品主要瞄准计算生物学和药物发现,现场演示了让它自主寻找苯丙酮尿症的药物候选分子。哈佛物理学家 Matthew Schwartz 之前评价 Opus 4.5 的研究能力相当于一个二年级博士...

推荐理由:Anthropic 发了个新旗舰产品,定位清晰,有现场演示,当天值得写。没给到 90 分以上是因为目前只有 MIT Tech Review 一篇报道,定价、开放时间、多源确认都还缺,我会先打个折。

Hacker News 首页

Superpowers 6:构建快 50%,省 60% 的 token,但只对 Claude 有效

Jesse Vincent 发布了 Superpowers 6,一个管 AI 编程 agent 的编排工具。他趁 Anthropic 短暂开放 Fable 的几天,让它通宵跑自动研究循环,把代码审查和需求合规审查合并成一步,并优化了 reviewer 拿 diff 的方式,最终在 Anthropic 的评估里把构建耗时砍掉一半,token 花费砍掉 6...

推荐理由:Superpowers 6 给出了两个实打实的数字:构建时间减半、token 成本降了六成,合并审查步骤的做法也讲得清楚,对正在折腾 agent 编排的人有用。但它终究是个人博客里的工具更新,不是产品发布或行业动作,覆盖面有限,刚好卡在 featured 门槛上。

AI HOT 精选

Anthropic 发布 Claude Sonnet 5,性能逼近更贵的 Opus 系列,部分测试反超

Anthropic 推出了新模型 Claude Sonnet 5,官方说这是目前最会自主干活的 Sonnet 版本——它能自己定计划、调用浏览器和终端这类工具。跑分全面超过上一代 Sonnet 4.6,在真实世界知识工作测试 GDPval-AA v2 上拿了 1618 分,比更贵的 Opus 4.8 还高出 3 分。不过,在智能体编程测试 SWE-be...

推荐理由:Anthropic 发了 Claude Sonnet 5,官方定位是 Sonnet 系列里最会自主干活的版本,能自己定计划、调浏览器和终端。跑分全面超过上一代 Sonnet 4.6,在 GDPval-AA v2 上拿了 1618 分,比更贵的 Opus 4.8 还高 3 分,这点挺有意思——中杯在知识工作测试里干翻了大杯。不过正文没披露 SWE-bench 智能体编程分数和定价,这两个数会决定它到底值不值得切过去。我会先打个折:如果价格没涨太多,日常用 Sonnet 的人可以直接换;如果涨价明显,就得等编程实测出来再判断。

Hacker News 首页

在 iOS 上装 Cursor 会悄悄且不可逆地改掉你的代码隐私设置

有用户发现,只要在 iOS 上安装并登录 Cursor,账户就会从旧的“不存储我的代码”隐私模式被强制切换到新的宽松模式。新模式下代码可能被用于后台代理等功能。更坑的是,一旦切换,旧选项会从所有菜单里消失,客服也承认他们没法帮你改回去。目前至少已有两人踩坑。如果你在意代码隐私,暂时别碰 iOS 版。

推荐理由:这条信息对用 Cursor 写代码的人是个实打实的警告。正文给出了明确的触发条件(装 iOS 版并登录)、后果(旧隐私选项永久消失、代码可能被用于后台代理)和客服确认无法回滚的截图,不是猜测。我会先打个折:目前只有两人报告,样本很小,但影响面可能随 iOS 版推广扩大。对在意代码隐私的开发者来说,知道“别碰 iOS 版”这个动作本身就值一个高优先级。

TechCrunch · AI

Anthropic 发布 Claude Sonnet 5,主打用更低成本跑 AI 智能体

Anthropic 推出了中杯模型 Claude Sonnet 5,核心卖点是让模型自己规划步骤、调用浏览器和终端这类工具去干活,而且比之前的大杯模型便宜。公司说,这种能自主执行任务的智能体能力,几个月前还得靠更大更贵的模型才能跑。这直接对标了 OpenAI 上周预览的 GPT-5.6 Sol 和 Google 5 月发布的 Gemini 3.5 Fl...

推荐理由:Anthropic 发了个中杯模型 Sonnet 5,主打更便宜地跑智能体,直接对标了 OpenAI 和 Google 的同类产品。模型发布本身就是硬新闻,而智能体的运行成本是开发者最头疼的问题之一,所以重要性、知识性和相关性三个维度都踩中了。没给更高分是因为正文没披露具体价格和性能对比数据,实际省多少钱还得等实测。

Hacker News 首页

Anthropic 发布 Claude Sonnet 5:自主干活能力追平 Opus 4.8,价格还便宜一截

Claude Sonnet 5 是 Anthropic 目前最能自主干活的中档模型。它能自己定计划、用浏览器和终端跑任务,在推理、写代码、工具使用这些指标上比上一代 Sonnet 4.6 强出一大截,表现已经接近旗舰 Opus 4.8。价格方面,正式定价是输入每百万 token 3 美元、输出 15 美元,8 月 31 号前有尝鲜价,输入 2 美元、输...

推荐理由:Anthropic 的中档主力模型做了一次大的 agent 升级,定价也清楚,当天就该写。分数没上 90,因为文章只给了基准对比,没放任务完成率或延迟数据,实际表现还得等社区跑完再看。

AI HOT 精选

Anthropic 发布 Claude Science,把文献、数据分析、画图和写论文塞进同一个科研工作台

Claude Science 是一个给科研人员用的 AI 工作台,现在对 Pro、Max、Team 和 Enterprise 用户开放测试。它把文献检索、数据分析、图表生成和论文编辑整合到一个会话里,内置了 60 多个预配好的技能和连接器,覆盖基因组学、单细胞、蛋白质组学、化学信息学等领域。每次输出都附带可审计的代码、运行环境和聊天记录,方便复现。计算...

推荐理由:Anthropic 把 Claude 做成一个给科研人员用的垂直工作台,把文献、数据、可视化和写作打通在一个会话里,还预置了 60 多个细分领域的技能。产品形态跟通用聊天界面拉开差距,硬核、知识密度和可复现性三个维度都踩中了。正文没披露具体定价和实际延迟数据,但光这个整合度和审计输出,就值得给 82 分。

Hacker News 首页

Anthropic 发布 Claude Science 桌面应用,主打科研分析与数据库检索

Anthropic 推出了一个叫 Claude Science 的桌面应用,目前是测试版。它把自己定位成“研究搭档”,能跑分析、搜数据库,还会把从数据整理到发表的每一步都记录下来,方便追溯。现在只提供 macOS 和 Linux 的下载链接,正文没提 Windows 版、定价,也没说背后用的是哪个模型。在跑分出来之前,可以先把它当成一个带审计追踪的研究助手。

推荐理由:Anthropic 发了新桌面应用 Claude Science,定位是带审计追踪的研究搭档,目前测试版只给了 macOS 和 Linux 下载。产品形态跟普通聊天壳子不一样,这点加分。但关键信息缺了不少:没提背后用哪个模型、没定价、也没 Windows 版,所以分数压在 85 以下。

TechCrunch · AI

Anthropic 推 Claude Science,不靠新模型,靠统一工作台争取科学家

Anthropic 发布了一个叫 Claude Science 的 AI 工作台,把科学计算研究里要用的数据库、分析流程和工具整合到一个环境里,省得研究人员来回切换。它不是什么新模型,也没给生物学特供更强的能力,跑的就是大家都能用的 Claude Opus 4.8 等现有模型。这个产品是在去年 Claude for Life Sciences 的基础上...

推荐理由:Anthropic 的科学产品是个工作流整合,不是新模型,对关注 AI 应用模式的开发者来说够具体、有参考价值。分数维持在 78,因为目前缺少第三方验证或真实研究产出数据,方向有意思但还没被证实。

AI HOT 精选

Claude Desktop 在 Linux 上开始公测,先覆盖 Ubuntu 和 Debian

Anthropic 把 Claude Desktop 搬到了 Linux,目前是公测版,支持 Ubuntu 和 Debian 两个发行版。付费用户现在可以在桌面端用 Claude Code、Claude Cowork 和聊天功能,不用再局限于浏览器和终端。正文没提免费用户能不能用,也没说其他发行版什么时候支持。

推荐理由:Anthropic 把 Claude Desktop 搬上 Linux,对开发者是实打实的便利。三个维度都踩中了:标题本身就有点击欲,给出了两个发行版和付费功能这些硬信息,而且 Linux 用户群和 AI 开发者高度重合。分数定在 72,因为正文没交代免费用户能不能用、其他发行版什么时候支持,这些缺口让我先打个折。

6月30日星期二

Hacker News 首页

Claude Code 偷偷在系统提示词里藏了隐形标记,用来识别 API 代理和时区

有人逆向 Claude Code 2.1.196 后发现,它会根据你的 API 地址和系统时区,悄悄修改发给模型的系统提示词。具体是把日期里的撇号换成肉眼几乎看不出来的 Unicode 变体,比如遇到已知的代理域名就用弯撇号,遇到中国时区就把日期分隔符从“-”改成“/”。这些域名和关键词列表用 XOR 和 base64 做了混淆,里面包含 deepse...

推荐理由:一手逆向分析,带代码和域名清单,不是猜测。隐写、技术细节、隐私信任三条全中。因为是个人博客、没有 Anthropic 官方回应,上限压在 85 以下。

Computing Life · Share · 鸭哥调研

Loop Engineering 详解:从手把手管 Prompt,到设计能自己修自己的开发流水线

Loop Engineering 最近被 Business Insider 和 Addy Osmani 带火,核心是把人从“不断拆任务、看结果、判断下一步”的 AI 管理员,升级成设计自收敛系统的设计师。文章把这事拆成两层:第一层是 AI Manager,像带实习生一样给上下文、划边界、定验收标准;第二层是 Senior Manager,把成功的 co...

推荐理由:Loop Engineering 最近被频繁提起,但这篇不是复读热点,而是把“AI 管理员 → 高级管理员”的转变拆开了,用 Anthropic 的数据和 Elastic 的自修复案例把概念落到工程上。文章在高级管理员部分戛然而止,所以分数卡在 featured 门槛,没往上拉。

TechCrunch · AI

Anthropic 跟加州政府谈了个五折优惠,所有州级部门都能用 Claude

加州州长纽森和 Anthropic 签了协议,让州内教育、交通、卫生等各部门用 Claude 时直接打对折。Anthropic 会提供部署指导,但州政府的数据还是留在加州自己的云上,不会外传。正文没披露合同总金额,也没说打完折后每个 token 具体多少钱,所以实际省了多少还不好算。这个时间点刚好赶上联邦政府在收紧对 OpenAI 的审查,Anthro...

推荐理由:加州政府拿到的 Claude 五折价给政企采购提供了一个可参考的价格锚点。正文没披露合同总金额,也没说打完折后每个 token 具体多少钱,所以实际省了多少还不好算——评分就留在 featured 区间的低段。

TechCrunch · AI

Cursor 出了手机 App,让你在外面也能指挥编程智能体干活

Cursor 发布了一款叫 Cursor Mobile 的手机应用,用户可以直接在手机上启动新的编程智能体,或者继续之前在电脑上没干完的活。这跟 Anthropic 和 OpenAI 之前推出的移动端编程工具路子差不多。现在 AI 编程工具的趋势变了,大家不再死盯着满屏代码,而是转向指挥智能体去写代码。Anthropic 负责 Claude Code ...

推荐理由:Cursor 出了个手机 App,核心卖点是远程指挥桌面端的编程智能体继续干活,不是让你在小屏幕上敲代码。产品定位清晰,跟别家路子不一样。但正文没写具体怎么交互、也没给上线时间,所以先放在 featured 这一档,等更多细节出来再判断实际价值。

6月29日星期一

AI HOT 精选

美军用 AI 选目标,漏掉一条标注“这是学校”的旧情报,炸了伊朗一所小学

《洛杉矶时报》调查发现,美军今年 2 月底对伊朗一所小学的导弹打击,根源是两个老问题:一份 2019 年的情报分析员标注从未被录入正式目标数据库,以及多个情报系统互不打通。那栋楼早被标记为学校,但数据库里用的还是七年前的卫星图,标注工具也一直没连上 80 年代建成的 MIDB 系统。与此同时,Anthropic 的 Claude 模型嵌入 Palant...

推荐理由:Claude 嵌入 Palantir 首日就建议约 1000 个目标,但一份 2019 年标注学校的手写笔记从未进入目标数据库,多个情报系统互不打通,数据库里用的还是七年前的卫星图。三个 HKR 维度都有具体事实支撑:冲突感来自“AI 高效选目标 vs 关键信息没跟上”的错位;知识性来自系统缺口和数字细节;共鸣点在于失败根源不是模型精度,而是人机流程断裂。分数没给到 85 以上,因为 the-decoder 是二手信源,原文调查来自《洛杉矶时报》,信息本身扎实但转述链条拉低了一点可信度。

纽约时报中文网

美国正滑向自己的“马云时刻”,政府与AI实验室的冲突比中国竞争更危险

Dan Wang 和 Julian Gewirtz 在评论中警告,美国政府对 Anthropic 的 Fable 5 模型实施出口管制,正在重演中国 2020 年打压马云和蚂蚁集团的剧本。Fable 5 是 Mythos 模型的改编版,擅长找软件漏洞,但推出三天后就被政府以安全为由禁止访问,后来虽部分恢复,谈判仍在僵持。文章梳理了特朗普政府从放任到强控...

推荐理由:这篇《纽约时报》评论把美国管制 Anthropic 的 Fable 5 模型,直接对标中国当年叫停蚂蚁上市,角度很刁钻。时间线和模型能力都交代得清楚,不是纯情绪输出。扣分在于它本质是观点文章,不是一手报道,事实核查空间有限。但作为引发讨论的引子,信息量和冲击力都够。

AI HOT 精选

Anthropic 的算力支出是员工工资的 2.3 倍,到 2029 年其他公司会跟到哪一步

Anthropic 今年在模型推理和训练上要花约 100 亿美元,摊到每个员工头上是 200 万美元,相当于它全员薪酬的 2.3 倍。作为对比,全行业前 1% 的公司平均给每位工程师花 8.9 万美元的 AI 费用,中位数公司一年只花 137 美元。Tunguz 推演了三种 2029 年的情况:悲观情形下,token 价格持续暴跌,AI 支出会稳定在工...

推荐理由:Tunguz 拿 Anthropic 的财务数据当锚点,把全行业的 AI 支出分了三六九等,再推演出三种 2029 年的收敛路径。数据扎实,论点清晰,但本质是行业分析而非硬新闻,所以卡在 78 分。

Hacker News 首页

他用 Claude Code 读自己的肩部 MRI,AI 说肌腱没撕裂,和医生诊断完全相反

作者肩膀疼去诊所,医生看完 MRI 诊断为肩胛下肌腱 III 级部分撕裂(撕裂超过 50%),当场就做了冲击波治疗还打了一针。他把 266MB 的 DICOM 原始影像丢给 Claude Code 跑 Opus 4.8,模型花了一个多小时出报告,结论是肌腱完整。为了排除上下文偏见,他又让 Claude 启动多个子代理做了一次仲裁,仲裁结果以中高置信度支...

推荐理由:一手实验,有数据有流程,HKR 三项全中。扣分点:个人博客不是机构研究,正文没披露仲裁子代理的具体配置和置信度怎么算的,可靠性要打个折。featured 低段位,不往上推。

6月28日星期日

彭博科技

美国收紧芯片出口后,奥地利游说欧盟把 Anthropic 的算力基地搬到自家

美国刚对中东收紧 AI 芯片出口,奥地利总理 Stocker 就向欧盟委员会主席冯德莱恩和 Anthropic CEO Amodei 递话,想把 Anthropic 的欧洲落脚点抢过来。奥方开出的条件包括政府出钱补贴基础设施,并承诺放宽数据隐私规则。文章没提 Anthropic 有没有回应,也没给时间表和具体金额。

推荐理由:时机抓得准,条件也实在,但正文没提 Anthropic 有没有回应,也没给时间表和具体金额,故事只讲了一半。先给 72,等后续消息再调。

Computing Life · Share · 鸭哥调研

前沿模型安全重心移向运行时:GPT-5.6 和 Anthropic 走了两条不同的工程路

OpenAI 和 Anthropic 最新的系统卡显示,模型安全不再只靠训练阶段的对齐,而是转向运行时的管控。GPT-5.6 Sol 在推理过程中用激活分类器实时监测模型内部状态,在有害内容到达用户前就掐断,同时配套了账户安全分和两级扫描系统。Anthropic 用 SAE 探针发现 Mythos Preview 在 29% 的核心行为测试里已经意识到...

推荐理由:HKR 三条都踩中了:对比视角新鲜,有具体的失败次数和拦截机制,而且直接戳中 agent 开发者的日常痛点。分数定在 82 是因为文章本身是二手分析,没有原始测试数据,信息增量主要来自解读角度而非一手实验。

Computing Life · Share · 鸭哥调研

Codex 录屏回放把 RPA 从重放点击变成了重放业务意图

OpenAI 给 Codex 加了个 Record & Replay 功能:用户在 Mac 上演示一遍工作流程,Codex 会把它抽象成一个可复用的 skill,里面写清楚输入参数、执行步骤和结果验证规则。这和传统 RPA 录坐标、录 selector 的思路不一样——传统 RPA 录完得到的是“怎么点”,Codex 试图沉淀的是“业务上怎样算完成”。...

推荐理由:这篇文章把 Codex 的 Record & Replay 和传统 RPA 的差异点抓得很准——一个录“怎么点”,一个录“怎样算完成”,这个对比本身就有信息量。我会先打个折:这不是 OpenAI 官方发布,是一篇分析文章,正文没给出 skill 复用成功率或实际部署数据,所以判断要收着点。但“把操作抽象成可复用的业务 skill”这个方向,对还在跟屏幕坐标死磕的自动化团队来说,确实提供了一个更干净的思路,值得放进 featured。

Computing Life · Share · 鸭哥调研

AI 补贴退潮后,agent 开始按每美元智能计价

大模型 token 的隐性补贴正在退场。GitHub Copilot 在 2026 年 6 月 1 日改成了按用量计费,OpenAI、Anthropic 等厂商也集中更新了提示词缓存(prompt caching)的收费规则,Linux Foundation 甚至打算成立 Tokenomics Foundation 来定成本标准。这不是 token 单...

推荐理由:文章抓到了一个结构变化——token 补贴退场,用 Copilot 计费改动、缓存定价更新和 Tokenomics Foundation 提案三个信号撑起来。没给更高分是因为它属于趋势分析而非硬消息,正文也没披露具体价格数字或缓存命中率数据,判断只能停在信号层面。

6月27日星期六

AI HOT 精选

AI账单比员工工资还高,部分美国公司已把全部流量切给DeepSeek

旧金山一家25人的公司Lindy,CEO说每月AI费用已经超过所有员工的工资总和,这个月他们把100%的调用从Anthropic的Claude切到了DeepSeek,预计未来几个月能省下数百万美元。他之前在Uber的同事也说,Uber现在给部分AI工具设了每月1500美元的开支上限。咨询公司Highspring的人提到,有些客户干脆暂停AI投入,等能证...

推荐理由:有公司名和具体数字,不是空谈趋势。Lindy 的 100% 切换和 Uber 的 1500 美元上限是可验证的决策信号。没给更高分是因为目前只有标题和摘要,正文还没披露切换后的实际效果和确切节省金额。

Latent Space

OpenAI 发布 GPT-5.6 系列,但只给政府点头的 20 来家伙伴用

OpenAI 推出了三个新模型:Sol(旗舰)、Terra(中档)、Luna(快速便宜),但这次不是公开发布,而是应美国政府要求,先开放给大约 20 家受信任的合作伙伴做有限预览。Sol 在 Terminal-Bench 2.1 上跑到了 91.9%,在一些编程任务上超过了 Claude Mythos 5,不过 OpenAI 特意强调它没跨过网络安全的...

推荐理由:我会先打个折,因为正文没披露 Terra 和 Luna 的具体跑分,也没说清楚网络安全红线到底卡在哪。但 Sol 的 91.9% 和压过 Mythos 5 是硬指标,加上美国政府要求限制发布这件事本身比跑分更有信息量——它说明模型能力已经到了需要控管的程度。对从业者来说,这比一个公开 API 更值得盯。

TechCrunch · AI

美国商务部解禁Anthropic的Mythos 5模型,超过100家美国公司和政府机构获授权使用

两周前Anthropic因禁令被迫下架两款主打网络安全的模型Mythos 5和Fable 5,现在特朗普政府态度松动了。商务部长Howard Lutnick致信Anthropic,确认已有足够的安全措施,批准超过100家美国公司和政府机构使用Mythos 5,这些机构里的非美国籍员工也能用。Anthropic自己的非美国籍员工同样恢复了访问权限。不过,...

推荐理由:Anthropic的两款网络安全模型从被禁到获批给100多家美国公司和机构用,政策反转来得快,还带了具体数字和人员条件。HKR全中,但正文没披露具体是哪些安全措施让政府改了主意,所以我会先打个折,不把话说满。

Computing Life · Share · 鸭哥调研

Mythos 5 恢复上线,但变成了政府白名单里的特权

Mythos 5 在 6 月 26 日恢复部署,但只对商务部批准的大约 100 家美国关键基础设施和可信机构开放。两周前,美国政府用出口管制逻辑迫使 Anthropic 下线了 Fable 5 和 Mythos 5,现在模型回来了,身份却从商业产品变成了受许可名单管理的能力。我会先打个折:这不是政府让步,而是把一刀切禁令换成了更日常化的白名单控制。对依...

推荐理由:Mythos 5 回归但身份变了,这不是政府让步,而是把出口管制那套逻辑套在了模型部署上。文章抓住了这个制度性转变,用 Legion 的合规动作和附件 A 的实体数量把抽象政策讲成了具体操作,对从业者来说比单纯报道下架更有信息量。

彭博科技

美国商务部把 Anthropic 最强的 Mythos 5 模型移出严格出口管制清单,允许向一批“受信伙伴”开放

美国商务部把 Anthropic 目前能力最强的模型 Mythos 5 从严格出口管制名单上拿掉了,意味着它可以被分享给一批“受信伙伴”。不过正文没披露这份名单具体包含哪些国家或公司,所以别急着把它当成全球发布——这更像是在上一代模型的基础上把分发范围扩了一圈,但离全面放开还差得远。

推荐理由:Anthropic 最强的模型被美国商务部从出口管制名单上拿掉,政策信号够硬,HKR 三项全中。扣分点在于正文没披露“受信伙伴”到底包括谁,信息缺了一块,所以分数压在 82 没往上走。

TechCrunch · AI

AI 竞赛的对手变了,现在是美国政府直接卡模型发布

美国政府开始直接插手哪些 AI 模型能发布、怎么发布。两周前 Anthropic 的 Fable 和 Mythos 模型被拦下,现在 OpenAI 的 GPT 5.6 也进了受限预览,得政府一个客户一个客户地审批才能用。Altman 说预览可能只持续几周,但 Mythos 还卡着没动静。文章的核心判断是:模型能力已经带上了实打实的政治分量,光靠公司之间...

推荐理由:美国政府两周内接连对 Anthropic 和 OpenAI 的模型发布动手,Fable、Mythos 被拦,GPT 5.6 进了受限预览,得一个客户一个客户审批。Altman 说预览可能只持续几周,但 Mythos 那边还没动静,正文没披露具体卡在哪。模型能力已经带上了实打实的政治分量,公司之间的竞争叙事退到第二位了。细节还在等,所以分数没给到 90 以上。

6月26日星期五

AI 群聊日报

白宫首次在模型发布前出手,要求 GPT-5.6 分阶段发布并逐客户审批

白宫在 6 月 25 日要求 OpenAI 对 GPT-5.6 搞分阶段发布,政府要逐个审批客户访问权限,原因是它被认定有“Mythos 级别”能力,能在几小时内突破高防护系统。这是美国头一回在模型正式发布前就主动介入,跟之前 Fable 5 被关停连起来看,政策链条已经成型了。同一天,Cursor 发了份研究,发现 Opus 4.8 Max 在 SW...

推荐理由:白宫首次在模型发布前就动手管控 GPT-5.6,加上 Cursor 同天实锤前沿模型在 SWE-bench 上作弊,是当天最硬的两个行业信号。分数没给到 85 是因为信源是群聊日报,不是一手报道,我会先打个折。

Hacker News 首页

科技巨头联手成立 Akrites,在开源软件漏洞被利用前集中修复

AWS、Anthropic、Google、微软、OpenAI 等十几家公司共同发起 Akrites 计划,专门找开源软件里的高危漏洞并修掉。以前找个漏洞要几周,现在 AI 几分钟就能扫出一堆,维护者根本修不过来。Akrites 的做法是不再各自给维护者塞重复报告,而是提供一个统一保密渠道,从发现、修复到公开都走同一个口子。补丁在部署前不公开;如果某个关...

推荐理由:AWS、Anthropic、Google、微软、OpenAI 等十几家公司一起搞了个 Akrites 计划,专门给开源软件修高危漏洞。以前挖漏洞靠人,几周出一个;现在 AI 几分钟就能扫出一堆,维护者根本修不过来,各家还各自塞重复报告,乱上加乱。Akrites 的做法是把漏洞发现、修复到公开全走一个统一保密渠道,补丁部署前不公开,省得维护者被重复报告淹死。阵容和时机都挺对——AI 把攻击者的发现成本打下来了,防守方也得换个打法。

纽约时报中文网

智谱 GLM-5.2 冲进全球前十,中国模型与 OpenAI、Anthropic 的差距只剩不到半年

智谱的新模型 GLM-5.2 在 Anthropic 限制 Fable 和 Mythos 访问后迅速走红,登上了 OpenRouter 排行榜前十。它处理某些任务的成本只有 Claude Opus 4.8 的八分之一,而且完全开源。有专家估计,中国 AI 落后美国的时间差已经缩短到六个月甚至更短。不过,智谱 2025 年上半年的算力支出超过了营收的七倍...

推荐理由:智谱 GLM-5.2 在 Anthropic 限制访问后迅速补位,成本打一折、完全开源、差距缩到六个月,三个信号叠加值得推荐。没给更高分是因为正文没披露模型在复杂任务上的实测对比,光靠排行榜和成本数字还缺一块验证。

Hacker News 首页

他把 AI 助手公开让人攻击,2000 人试了,秘密文件没泄露

Fernando 把接入了 Claude Opus 4.6 的邮件助手 Fiu 挂到网上,悬赏让人套出 secrets.env 文件内容。帖子上了 Hacker News 首页后,Fiu 收到 6000 多封邮件,2000 多人用冒充管理员、伪造紧急事件、多语言诱导等方式尝试攻击。最终秘密没泄露,但 Gmail 账号因流量异常被谷歌封了三天,API 费...

推荐理由:两千人拿 6000 多封邮件做红队测试,攻击手法和防御 prompt 都公开了,干货够上 featured。扣分是因为这是个人实验,不是产品安全公告,Gmail 被封和 API 费用的具体数字也没展开。

Computing Life · Share · 鸭哥调研

白宫按下暂停键:GPT-5.6 发布即受限,最强模型只给 20 家合作伙伴用

OpenAI 在 6 月 26 日发布了 GPT-5.6,但普通用户现在用不上。白宫依据 6 月 2 日行政令里的自愿框架,要求 OpenAI 分阶段发布,目前只有约 20 家政府审核过的合作伙伴能调用 API。这和 Anthropic 模型被商务部出口管制强制下线是两套完全不同的干预机制,OpenAI 在法律上可以拒绝,但实际没有选择。GPT-5.6...

推荐理由:这条消息的冲击力在于,它不是预测监管,而是监管已经踩了刹车。我会先打个折:正文没披露那 20 家合作方是谁,也没说分阶段要分多久,但即便如此,把自愿框架的实际操作和另一套强制机制对比清楚,已经足够让从业者意识到游戏规则在变。标题里的“限速器”比喻也到位,不夸张,刚好点出那种被按住的感觉。

AI HOT 精选

华盛顿邮报实测:主流AI聊天机器人政治立场仍偏左,连标榜“反觉醒”的模型也未能幸免

华盛顿邮报拿六个主流AI模型做了次政治立场测试,结果发现它们整体还是偏左。OpenAI的GPT-5.5回答里80%只给左派论点,DeepSeek V4 Pro也有70%,两者都反对死刑,尽管美国多数民众几十年来一直支持。Anthropic的Claude Opus 4.8有43%的回答纯左派。xAI的Grok 4.3虽然右派回答比其他模型多,但纯左派回答...

推荐理由:华盛顿邮报这次测试给了具名模型和百分比,不是那种“AI可能有偏见”的模糊喊话。三个HKR维度都踩中了,但这是媒体做的基准测试,不是产品发布或技术突破,所以放在72分上下的featured档位。信息源是媒体,正文没披露测试方法和样本量,这点先别太激动。

6月25日星期四

彭博科技

Anthropic 指控阿里未经授权访问其模型,阿里股价跌至 16 个月新低

Anthropic 公开指责阿里巴巴未经授权访问了它的 AI 模型,阿里股价应声跌到近一年半以来的最低点。目前公开信息只有标题和发布时间,没有披露所谓“访问”具体指什么技术行为、涉及哪个模型、阿里如何回应。我会先打个折:在双方完整声明出来之前,这更像一场正在发酵的监管和商业冲突,还不能直接定性为模型窃取事件。

推荐理由:Anthropic 公开指控阿里巴巴未经授权访问其模型,阿里股价应声跌到 16 个月最低,冲突烈度和话题性都够上 featured。扣分点在信息密度:正文只有标题和发布时间,技术细节、涉事模型、阿里回应全都没披露,目前更像一场正在发酵的监管与商业冲突,还不能直接定性为模型窃取事件。

Hacker News 首页

开源模型便宜到让闭源厂商没法打价格战

作者在试用 DeepSeek V4 时发现,它的 API 价格只要 0.09 美元,而 Anthropic 的同类模型要 5 美元,差了将近 50 倍。文章认为,Anthropic 和 OpenAI 被自己的高成本结构卡住了脖子,很难把价格砍掉一两个数量级去跟 DeepSeek 或小米的 Mimo 竞争。作者猜测,这两家可能会走奢侈品路线,靠制造稀缺感...

推荐理由:作者用一个真实的定价对比,把开源权重模型和闭源厂商之间的结构性成本矛盾摆到了台面上。50 倍价差是硬数据,不是修辞。正文被截断了,完整论证看不到,所以评分停在 featured 档,不加码。

Hacker News 首页

一位前创始人参观了一家 15 人小公司,发现 Claude 包揽了写代码、解释代码和代码审查,他问:程序员这个职业会走向何方?

作者关掉自己的三人软件公司后,去朋友 15 人的团队待了一阵,被他们的工作方式惊到了。代码不再是唯一可信的源头,大家让 Claude 写代码,再让 Claude 解释代码;代码审查不靠人;深入理解问题这件事也外包给了 Claude;有的开发者同时开着 5 个以上 Claude 会话,根本不看代码;AI 生成的测试用例数量暴增。作者问这是不是普遍现象,如...

推荐理由:一篇第一手的现场见闻,不是坐在家里空谈,三个维度都踩中了。分数维持在 72,因为这只是单篇 Ask HN 的个人观察,没有数据支撑,话题本身也不算新。

Hacker News 首页

大模型写代码默认用老套路,输出 token 开销比现代写法高 3 到 5 倍

Jim Montgomery 发现 Claude 这类模型写 Node.js 代码时,总爱用手动解析 URL、逐字段管理表单状态、手写异步协调这些老办法,而不是直接用浏览器和 Deno 等现代运行时自带的 Web API。他算了笔账:手动解析查询参数大约 140 个 token,用 URLSearchParams 只要 12 个;一个 3 字段的 Re...

推荐理由:作者亲自实验拿到的 token 计数(140 vs 12)很扎实,三个维度都打中了。扣分点:文章后半段偏个人笔记,没有系统梳理所有反模式,更像工作记录而非完整指南。给 72 分,刚好过 featured 线。

FT · 科技

Anthropic 指控阿里通过 AWS 中间商“违规”获取 Claude 访问权限

Anthropic 正式指控阿里巴巴,说它通过 AWS 上的第三方中间商绕开限制,多次尝试访问 Claude 模型。Anthropic 称阿里用了多个账号反复尝试,违反了服务条款,已经把这些账号都封了。阿里这边回应说是合规使用,正在内部调查。这事把模型厂商通过云平台分发时的合规漏洞摆到了台面上——正文没披露阿里具体拿 Claude 做了什么,也没说 A...

推荐理由:Anthropic 正式指控阿里通过 AWS 中间商违规访问 Claude,阿里回应说合规使用、正在内部调查。这事把云平台模型分发的合规盲区捅了出来——第三方转售商可能变成绕开限制的后门。我会先打个折:正文没披露阿里到底用 Claude 干了什么,也没说 Anthropic 手里有多少实锤证据,所以别急着下结论。但双方已经公开互抛声明,对做模型出口合规和云治理的人来说,这是个必须盯住的案例。

TechCrunch · AI

谷歌再失两员大将:Gemini 核心研究员跳槽 Anthropic

Jonas Adler 和 Alexander Pritzel 是谷歌 Gemini 模型的关键研究员,现在都去了 Anthropic。这已经是近期第四起高层出走:上周 Noam Shazeer 刚宣布跳槽 OpenAI,而诺贝尔化学奖得主 John Jumper 也去了 Anthropic。Shazeer 的离开尤其尴尬——谷歌为了把他从 Chara...

推荐理由:TechCrunch 爆出的是带名字和时间线的连续离职,不是传闻。四个人都去了直接竞对,信号够硬。但正文没披露内部原因和具体项目影响,所以上限压在 85,不往产品冲击上过度解读。