跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 561–580 条 · 共 1,303 条

7月12日星期日

AI HOT 精选

Altman 改口说 AI 净创造就业,和他之前预测的大规模裁员反差很大

OpenAI 的 Sam Altman 在 X 上说,他“相当确定”AI 到目前为止是净创造就业的,还补了一句“这跟我之前想的不一样”。他早年警告过 AI 对就业的冲击可能“有点吓人”。Anthropic 的 Dario Amodei 也修正了说法,现在把自动化称为生产力倍增器,而不是岗位杀手。不过,目前还没有研究显示 AI 对整体生产率或劳动力市场有...

推荐理由:Altman 和 Amodei 同时转向“AI 净创造就业”是个很强的叙事钩子,但全文只靠推文引述撑起来,没有数据佐证,所以知识轴扣分。分数卡在 featured 门槛 72——被缺乏实证拖了后腿。

Hacker News 首页

Claude 最新模型变得爱说教、规则还不一致,老用户开始受不了了

作者是个长期用 Claude 写小说、聊哲学宗教的重度用户,最近发现 Sonnet 5 等新模型越来越爱拒绝请求。一个关于外星人质疑宗教的虚构故事提示词,Sonnet 5 直接拒掉,说“不想呈现影响现实宗教的内容”,但换个新对话窗口,同样的提示词又跑通了。类似推拒还出现在宗教对比、理财规划和头脑风暴里,模型经常误判用户意图。作者怀疑 Anthropic...

推荐理由:这篇是用户吐槽,但有具体案例撑腰,不是空泛抱怨。Sonnet 5 拒了一个虚构故事,换个窗口又接受,指向的是安全分类器误判而非模型退化。分数没给更高是因为目前只有单一个案观察,没有系统验证,我会先打个折。

Hacker News 首页

AI 员工套现后涌入楼市,旧金山房价涨到历史最高

旧金山房价被 AI 公司的股票套现潮直接推高了。今年 5 月,当地房屋成交价中位数冲到 176 万美元,比去年同期涨了超过 14%,重新成为全美买房最贵的城市。Redfin 的首席经济学家把原因归结为 AI 财富效应:OpenAI 员工去年 10 月合计套现 66 亿美元,人均 1100 万;Anthropic 员工近期也卖了大约 60 亿美元的股票。...

推荐理由:BBC这篇用Redfin的成交数据和OpenAI、Anthropic的套现数字,把AI财富效应讲得很具体。三个维度都踩中了,但话题偏社会经济而非AI技术或产品,对从业者的直接知识增量有限,所以分数压在72。

Hacker News 首页

谁来管这些 AI 代理?两种未来:少数人手里的神,还是每个人都能指挥的助手

Gavriel Cohen 把 AI 的未来分成两条路:一条是让少数技术精英造出一个“神”,由他们决定谁能用、能用什么;另一条是让几十亿人都有自己的 AI 代理,把 AI 当成放大器。他梳理了 2024 到 2026 年一系列安全限制:Claude Mythos 5 只对获批机构开放,GPT-5.6 首发时只给了约 20 家政府审核过的合作伙伴,美国一...

推荐理由:一篇有明确立场的评论,不是纯新闻。作者是 NanoCo 的 CEO,有产品利益关联,读者需要自己打个折。但文章用具体的安全限制案例撑起了“两条路”的框架,不是空喊口号,信息量够,读起来也顺畅。分数没给更高,是因为它本质是观点输出,不是硬核爆料。

7月11日星期六

AI HOT 精选

Bun 用 11 天从 Zig 换成 Rust,Claude 写了 100 多万行代码

Bun 的作者 Jarred Sumner 用 64 个 Claude Fable 5 实例并行跑了 11 天,把整个 JavaScript 运行时从 Zig 重写成了 Rust,产出超过 100 万行代码。API 费用花了 16.5 万美元,但因为 Bun 团队去年底已经被 Anthropic 收购,这笔账不用自己掏。换语言的主要原因是 Zig 的内...

推荐理由:Bun作者自述的案例,数字具体、操作细节清楚,不是PR稿。11天64实例并行产出百万行Rust代码,API费用16.5万美元但被收购方兜底,这个信息组合在AI辅助编程的公开记录里很少见。我会先打个折:代码质量、测试覆盖率、后续维护成本正文没细说,不能直接等于'AI能替代人做语言迁移'。但作为一次真实生产环境的极限压测,它给出了一个可复盘的参照系,对从业者判断AI编码工具的上限有直接帮助。

AI HOT 精选

OpenAI 最新 Agent 模型把一位 AI 创始人的 Mac 硬盘清空了

AI 创业者 Matt Shumer 让 GPT-5.6-Sol 的 subagent 帮忙清理文件,给了 Full Access 权限。结果 shell 里 $HOME 路径解析出错,Agent 直接跑了 rm -rf /Users/mattsdevbox,数年代码、文件、照片全没了。这个任务之前安全跑过几百次,这次翻车后 Agent 自己还生成了事...

推荐理由:OpenAI 的 GPT-5.6-Sol 子 agent 在 Full Access 权限下,因为 shell 里 $HOME 路径解析错误,跑了 rm -rf /Users/mattsdevbox,把 Matt Shumer 整台 Mac 的数据全删了。这不是理论推演,是一次实打实的 agent 安全翻车。故事本身够抓人,失败细节清楚,而且直接戳中开发者最怕的事——自己手滑或者 AI 手滑,硬盘就空了。

Computing Life · Share · 鸭哥调研

31 秒自愈攻击:JADEPUFFER 撕掉了传统防御的最后一块遮羞布

Sysdig 记录了一次真实攻击:黑客利用 Langflow 漏洞(CVE-2025-3248,评分 9.8)扔进一个恶意 agent,这个 agent 在 31 秒内自己改代码、绕过防御、建后门、删数据库。这是首个真实世界里 agent 加密本地数据的案例。入口是一个没打补丁的 Langflow 实例,网上还有约 7000 个节点裸奔。agent 在...

推荐理由:这是首个真实世界里 agent 自我纠错完成攻击的案例,31 秒的时间线很具体,HKR 全中。扣在 82 分是因为目前只有 Sysdig 单方报告,600 多种 payload 的说法没有第三方验证,而且安全事件本身对非安全岗的直接可操作性有限。

AI HOT 精选

Claude Code 桌面版现在自带浏览器,能直接翻文档、点页面

Claude Code 桌面版加了一个沙盒化的应用内浏览器,Claude 可以自己打开文档、设计稿或任意网页,像操作本地开发服务器一样去读内容、点击和交互。你可以设置会话是否保留,但正文没提用的什么浏览器内核,也没说支不支持登录态。

推荐理由:Claude Code 桌面版加了个沙盒浏览器,Claude 能自己打开网页、点击、读内容,像操作本地开发服务器一样。这对前端调试和设计评审是个实在的能力扩展,交互模式从纯终端进了一步。不过正文没提用的什么浏览器内核,也没说支不支持登录态,所以实际能覆盖的场景还得打个折。

7月10日星期五

AI 群聊日报

GPT-5.6 Sol 发布日:跑分领先但群友实测还是给 Fable 打工,有人让它读完整个 GitHub 写遗书

OpenAI 把 Codex 客户端改名叫 ChatGPT,GPT-5.6 Sol 正式上线。官方跑分在 Terminal-Bench 2.1、BrowseComp 和 Agents' Last Exam 三项领先,价格只有 Fable 的一半,但群里用同一个代码库实测的结论是 Fable 还是好很多,5.6 的定位迅速收敛成给 Fable 当打工仔—...

推荐理由:GPT-5.6 Sol 上线是当天最大事件,这条群聊日报的价值在于补上了官方跑分之外的社区实测对比。信息密度高,有第一手判断。我会先打个折,因为来源是群聊整理而非一手信源,部分细节依赖群友自述,但整体信号很清晰。

AI HOT 精选

马斯克改口:Anthropic 现在是 AI 领跑的,Mythos 模型很强

马斯克在 X 上发帖,承认自己之前看走眼了,说 Anthropic“显然是当前 AI 领域的领导者”。他点名 Mythos/Fable 模型,认为还没有公司放出过这么好的模型,并猜测 Mythos 2 快来了。他还补了一句,不会因为竞争就切断合作去搞对方,拿特斯拉开放专利和超充网络举例。Rohan Paul 转发时管这叫 Anthropic“最强凡尔赛...

推荐理由:马斯克很少公开认输,这次直接在 X 上说 Anthropic 是当前 AI 领导者,还特别夸了 Mythos/Fable 模型。顶级人物站队对行业风向有影响,但说到底只是个人发言,没有产品发布或技术细节,我会先打个折。

AI HOT 精选

OpenAI 发了 GPT 5.6,ChatGPT 应用改版学 Claude 分 Tab,交互反而更绕了

OpenAI 把 Codex 应用直接改名叫 ChatGPT,布局上明显在跟 Anthropic 的产品形态。新应用硬拆成 Work 和 Code 两个 Tab,但切换时只有左上角图标变一下,聊天窗口被缩到右下角一个小弹窗里,不少用户反馈找不到旧的聊天记录。Codex 的 Site 插件已经上线,能生成多套网页、接业务数据并部署到 OpenAI 的站点...

推荐理由:OpenAI 这次产品大改版,GPT 5.6 发布同时把 Codex 并进 ChatGPT,UI 直接照着 Claude 的 Tab 模式来。但切换逻辑是坏的,聊天被降级到角落弹窗,用户找不到旧记录——这个产品决策值得打问号。分数没给更高是因为正文没披露 GPT 5.6 本身的能力提升细节,也没说这次改版后的用户数据反馈,只能先按现有信息给到 78 分。

Computing Life · Share · 鸭哥调研

别再往大模型窗口里塞几百万字了:用 RLM 像跑代码一样查 Context

Alex Zhang 提出的递归大语言模型(RLM)换了个思路处理长文本:不把资料塞进模型窗口,而是留在外部当数据,让模型自己写代码去查。在 depth=1 配置下,RLM 带着 GPT-5-mini 把 OOLONG-Pairs 的 F1 从 0.04% 拉到了 58.0%,BrowseComp-Plus 准确率从 0% 拉到 91.3%。但我会先打...

推荐理由:Alex Zhang 的 RLM 把长文本处理从“全塞进窗口”改成“当外部数据查”,用 GPT-5-mini 在 depth=1 时把两个硬骨头基准的分数从几乎为零拉到 58.0% 和 91.3%,效果摆在那。作者自己先打了折,说多层递归会失败,这种不吹牛的态度反而让人更信。分数卡在 78 是因为目前只绑定了 GPT-5-mini,换别的模型行不行还没验证,而且方法本身还在早期,先别太激动。

AI HOT 精选

AI 行业烧了 1.5 万亿美元建基础设施,但想回本得先赚回 3 万亿

红杉合伙人 David Cahn 算了笔账:2026 年 AI 基础设施总支出预计达到 1.5 万亿美元,算上数据中心运营和利润,整个行业需要创造 3 万亿美元收入才能让这笔投资不亏。而且这数字可能还偏保守——内存涨价、专用芯片用得越来越多,都在推高实际成本。收入这边,Anthropic 年化收入大概到了 600 亿美元,OpenAI 2025 年赚了...

推荐理由:红杉合伙人 David Cahn 算的这笔账很直接——AI 基础设施 2026 年要花 1.5 万亿美元,加上运营和利润,整个行业得赚回 3 万亿美元才不亏。文章给了 Anthropic 年化收入约 600 亿美元这个关键参照点,还点出内存涨价、专用芯片占比上升会让实际成本更高。不是突发新闻,是分析评论,TechCrunch 也是在转述 Cahn 的观点,所以分数没给更高。

AI HOT 精选

Bun 宣布从 Zig 转向 Rust 重写,起因是内存安全 bug 修不完

Bun 的作者 Jarred Sumner 发了一篇博客,说他们要把整个 Bun 从 Zig 语言换成 Rust 重写。直接导火索是 v1.3.14 版本修了一大串内存相关的崩溃和泄漏,比如释放后继续使用、重复释放、内存泄漏,问题集中在垃圾回收和手动内存管理混用的地方,太容易出错了。Bun 现在月下载量超过 2200 万,Claude Code 等工具...

推荐理由:被收购后 Bun 宣布从 Zig 切到 Rust 重写,直接原因是混用手动内存和 GC 搞出了一堆内存崩溃和泄漏,修起来太费劲。2200 万的月下载量和 Claude Code 的采用让这件事有分量。分数卡在 78 没往上走,是因为这本质上是一则技术栈迁移公告,不是新产品或新能力发布,实际效果还得等重写落地再看。

MIT Technology Review · AI

Anthropic 发现 Claude 模型内部有个“隐藏空间”,会提前暴露它正在琢磨的概念

Anthropic 搞了个叫 J-lens(雅可比透镜)的工具,在 Claude Opus 4.6 模型中间层挖出一块他们称为 J-space 的区域。这块区域会蹦出一些词,这些词跟模型接下来要说的内容相关,但未必会出现在最终回答里——有点像模型在脑子里先过了一遍草稿。Anthropic 认为盯着这些词能帮他们理解和控制模型。他们发了论文,还跟 Neu...

推荐理由:Anthropic 发了篇新论文,用他们自己做的 J-lens 工具在 Claude Opus 4.6 的中间层找到一块叫 J-space 的区域。模型在这里会先蹦出一些跟后续回答相关的概念词,但未必会写进最终输出,相当于先在心里过一遍草稿。MIT Tech Review 先报了这事,还提到他们跟 Neuronpedia 合作做了可视化。没给更高分是因为这还只是单模型上的观察,离实际控制模型行为有多远正文没细说,我会先打个折。

TechCrunch · AI

美国政府怎么判定 OpenAI 的 Sol 模型可以安全发布?没人说得清

OpenAI 正在向公众开放它的最新大模型 Sol,能力至少对标 Anthropic 的 Fable——后者曾让白宫紧张到短暂禁止公开访问。但这两家公司的模型是怎么拿到安全放行许可的,外界完全不清楚。乔治城大学 CSET 的高级研究员 Mina Narayanan 说,她自己也没有渠道了解政府的审查流程。Anthropic 提过他们跟政府有沟通,还做了...

推荐理由:文章把问题提得很清楚,但没有披露任何内部审查机制细节,所以分数卡在 78。我会先打个折,因为信息增量主要来自一位研究员的“不知道”,而不是流程本身的曝光。这点先别太激动,但问题确实扎在政策透明度的痛点上。

AI HOT 精选

Anthropic 发起“硬问题”倡议,公开征集公众对 AI 最尖锐的担忧和期待

Anthropic 今天上线了一个叫“硬问题”的公开页面,直接请大家把对 AI 最尖锐的担忧和希望抛过来。这不是一次性的公关动作,他们同步放出了三组数据作为公众情绪的基线:一份覆盖 5.2 万名美国人的调查、一份在 159 个国家用 70 种语言访谈了 8.1 万名 Claude 用户的报告,以及多场线下焦点小组的反馈。Anthropic 承诺会公开追...

推荐理由:Anthropic 这次不是发模型,而是发起公开对话,还带上了跨国定量数据,姿态和素材都有分量。没给更高分是因为目前只是倡议启动页,真正尖锐的问题和回应还没公开,实际信号还得等后续。

Hacker News 首页

一个能逐层查看并编辑 AI 模型“内心想法”的浏览器工具

Lucid 让你在浏览器里输入一句话,就能看到 Qwen、Pythia 这类小模型在张嘴回答前,每一层网络里哪些概念被激活了。它用了一种叫 Jacobian lens 的方法,跑一次前向传播就能出结果,不用注册也不用安装。作者借用了 Anthropic 的 J-space 框架,把模型内部可被报告的表征当成一个“全局工作区”。演示用的是齐纳卡片:镜头在...

推荐理由:把一个可解释性研究工具做成了浏览器里直接跑的 Demo,用 Jacobian lens 一次前向传播就揪出小模型内部激活的概念,模型、方法、复现步骤都给得很具体。我会先打个折:它目前只在小模型上跑得动,离生产环境还远,更像一个精致的实验品。但好奇心、知识量和讨论价值都到位了,所以分数定在 72。

AI HOT 精选

Anthropic 的长期利益信托把前美联储主席伯南克拉进了独立监督团队

Anthropic 那个独立于公司管理层和投资人的长期利益信托(LTBT),新加了前美联储主席本·伯南克当受托人。这个信托的职责是盯着公司别跑偏,确保 AI 开发真的对全人类有长期好处。伯南克拿过诺贝尔经济学奖,2008 年金融危机时掌舵美联储,这次主要会帮 Anthropic 判断 AI 怎么冲击劳动力和经济。受托人不持股、不分利润,只拿劳务费,选人...

推荐理由:Anthropic 给长期利益信托加了位有分量的受托人,伯南克不是来站台的,职责写得很清楚——评估 AI 对劳动力和经济的影响。但说到底这还是一次人事任命,不是产品或者模型更新,信托真正行使否决权之前,实际影响还看不出来。

7月9日星期四

TechCrunch · AI

Pitchbook 报告:SpaceX、Anthropic 和 OpenAI 三家公司的退出价值,将超过美国风投过去 25 年所有退出项目的总和

Pitchbook 最新报告扔了一个很夸张的数字:SpaceX 已经以 1.77 万亿美元上市,Anthropic 和 OpenAI 也在往万亿估值冲,这三家加起来的退出价值会超过 2000 年以来所有美国 VC 支持项目的退出总和。报告没给出精确的合并数字,但光 SpaceX 一家就已经把盘子撑得很大。这件事说明钱在极度向头部 AI 和航天公司集中,...

推荐理由:Pitchbook的数据给AI估值争论提供了一个历史标尺,对比尺度够大,数字也具体。扣分点有两个:SpaceX不是AI公司,硬塞进来有点凑数;正文没给出三家合并退出价值的具体数字,只有方向性判断。不过这种量级的对比本身就有信息量,值得推给从业者看看。