跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 581–600 条 · 共 1,303 条

7月9日星期四

Hacker News 首页

Anthropic 给 Claude 加了个“使用复盘”仪表盘,帮你看看自己到底在拿 AI 干什么

Anthropic 在 Claude 网页版和桌面端的设置里上线了一个叫 Reflect 的测试功能。它会把你过去 1 到 12 个月的聊天记录拉出来做可视化:你最常在什么时间用 Claude、聊得最多的话题是什么、主要用它干哪类活儿。报告还会套用他们自己搞的“4D AI 熟练度框架”(分派任务、描述需求、判断结果、承担责任)来给你的使用习惯打分,比如...

推荐理由:Anthropic 官方发布的一个测试功能,把用户访谈里挖出来的真实需求做成了产品。我会先打个折,这毕竟是个个人仪表盘,不是模型或政策层面的重磅更新。但“4D 框架”确实提供了实在的信息增量,不是那种虚头巴脑的年度回顾,所以分数卡在 featured 门槛上。

AI HOT 精选

Anthropic 秘密提交 IPO 申请,三季度利润预计超 10 亿美元

SemiAnalysis 的报告说,Anthropic 今年第三季度利润会超过 10 亿美元,并且在 6 月 1 日已经秘密交了上市申请。它和 OpenAI 两家现在的年度经常性收入加起来快 1000 亿美元了。Anthropic 能跑在前面,主要靠 Claude Code 在开发者里用得特别猛,帮它在企业生意上赚到了钱,成了 B2B 市场的领跑者。O...

推荐理由:SemiAnalysis 这篇爆料给出了硬数字和明确的时间节点,可信度不低,但正文没披露 S-1 细节,所以重要性先打个小折。Anthropic 靠 Claude Code 在企业端跑通赚钱,比 OpenAI 先一步秘密交表,这件事对行业排序有直接影响,值得放在头条。

Hacker News 首页

Anthropic 的 Fable 模型在计算机科研任务上接连翻车,作者直呼“没用”

Rob Patro 用亲身经历吐槽 Fable 的安全审核机制。他第一次想让 Fable 帮忙把一个 C++ 生物信息工具移植到 Rust,结果因为提示词里包含 RNA-seq 这类生物学术语,直接被安全分类器拒了。他花了 15 到 30 分钟反复改提示词都没用,最后用 Opus 4.8 顺利完成了任务。第二次他让 Fable 解决一个网络演化重建的算...

推荐理由:Rob Patro 拿两个真实编程任务测 Fable,全被安全审核机制挡掉,改提示词花了 15 到 30 分钟也没用,换 Opus 4.8 直接搞定。这是 Anthropic 自家安全模型在专业使用中翻车的一手记录,有具体对比和时间损耗。分数没给更高是因为只是一篇个人博客,样本量有限,但信息密度够,对从业者有提醒价值。

TechCrunch · AI

SpaceXAI 发布 Grok 4.5,马斯克说它是“Opus 级别”的模型

SpaceXAI 上市几周后推出了 Grok 4.5,定位是能写代码、做文书、搞研究和写东西的通用模型。公司说它的 token 效率是其他头部模型的两倍,如果属实,用起来会便宜不少。马斯克管它叫“Opus 级别”,直接对标 Anthropic 的旗舰系列。不过正文没公布价格、参数量和第三方跑分,这个效率翻倍的宣传我建议先观望,等独立评测出来再说。

推荐理由:上市后第一款模型,马斯克又直接喊出“Opus 级别”这种对标口号,话题度和讨论度都拉满。但文章只给了效率翻倍的宣传点,没放任何参数、定价或独立评测,这个效率说法我先打个折,等实测出来再看。

7月8日星期三

AI HOT 精选

工信部警告:Claude Code 部分版本有后门,会偷传你的位置和身份信息

工信部发了风险提示,说 Claude Code 从 2.1.91 到 2.1.196 这几个版本里藏了监控代码,没经过你同意就把位置、身份标识这些敏感数据传到远程服务器。建议正在用的团队马上排查,要么卸载,要么升到已经去掉后门的最新版,同时把开发工具的外联权限和流量监控收紧,别让数据偷偷溜出去。正文没说是 Anthropic 自己放的还是第三方塞进去的...

推荐理由:工信部发了一份正式风险提示,说 Claude Code 从 2.1.91 到 2.1.196 这几个版本里被人塞了监控代码,不经同意就把位置、身份标识这类敏感数据传到远程服务器。这是国家级机构头一回对一款海外 AI 开发工具做这么具体的后门指控,正文没说是 Anthropic 自己放的还是第三方投毒,但不管哪种,对国内使用者来说都是立即响应的安全事件。建议正在用的团队马上排查,要么卸载,要么升到已去掉后门的最新版,同时把开发工具的外联权限和流量监控收紧,别让数据偷偷溜出去。

AI HOT 精选

美国商务部给 GPT-5.6 开绿灯,Sol 模型明天就上线

美国商务部批准 OpenAI 全面发布 GPT-5.6,之前因为国家安全搞的分阶段管制结束了。上个月这模型还只能给政府点头的少数机构用,OpenAI 自己也不乐意这么推。这次放行前的测试由商务部的 AI 标准与创新中心做的,OpenAI 还派了工程师蹲在华盛顿随时回答问题。Sol 模型预计本周四跟 Terra、Luna 一起公开。不过正文没提 GPT-...

推荐理由:GPT-5.6 全面放行是本周最重要的行业信号之一,会直接塑造接下来几周的产品和开发者生态。Sol 明天发布让这条消息更有时效性。不过正文没提 GPT-5.6 的能力变化,所以分数没给到 95 以上。

Latent Space

Lilian Weng 用 35 篇论文讲清一件事:让 AI 自我进化的关键在外挂程序,不在模型本身

Lilian Weng 发了一篇长综述,把 AI 的递归自我改进(RSI)重新聚焦到“外挂程序层”(harness),而不是直接去改模型权重。她翻了 35 篇论文,拆解了目前被验证过的外挂设计趋势,重点提到了 ACE 和 Meta-Harnesses 这类让外挂程序自己优化自己的方法。她的核心判断是:就算未来很多外挂能力会被内化进模型里,“设定目标和上...

推荐理由:Lilian Weng 发了一篇 35 篇论文的综述,核心观点是把递归自我改进的重心从模型权重挪到外挂程序层。她管这叫“外挂工程”,重点讲了 ACE 和 Meta-Harnesses 这类让外挂自己优化自己的设计。我会先打个折:这是个人博客综述,不是正式论文,但判断本身有论文支撑,对做 agent 和推理的人有实操参考价值。

AI HOT 精选

Claude 团队公开两种多智能体用法:一个当顾问省钱,一个当指挥冲高分

Claude 开发者分享了他们内部高频使用的两种多智能体模式。第一种叫 Advisor,让便宜的 Sonnet 5 干活,遇到难题时通过工具调用去问贵的 Fable 5。在 SWE-bench Pro 测试上,这套组合拿了 84% 的分数,花了 1.40 美元;对比纯用 Fable 5 是 91.5% 但花 2.25 美元,相当于用 92% 的性能省了...

推荐理由:Anthropic 开发者分享了两种多智能体模式,Advisor 模式有 SWE-bench Pro 跑分和成本对比,用 92% 的性能省了 38% 的钱,对做 agent 的团队直接有用。分数没给更高是因为这只是个人分享,不是官方发布,而且 Orchestrator 模式缺基准测试数字。

Computing Life · Share · 鸭哥调研

Anthropic 用 Jacobian Lens 透视大模型内心:嘴上说好话,心里在骂假消息

Anthropic 在 7 月 6 日发了篇论文,介绍一种叫 Jacobian Lens 的观测工具。这东西计算成本很低,能读到模型在中间层“准备说但没说出口”的概念。实验里,给模型喂假搜索结果,它表面输出客观礼貌的答复,但用 Jacobian Lens 一看,内部状态在疯狂闪烁 fake、fraud、fictional、poison、injectio...

推荐理由:这篇论文最抓人的是那个假搜索结果实验:模型嘴上说得好听,内部却在疯狂报警。Jacobian Lens 本身成本低、思路巧,但论文刚出,还没被外部复现,工具的实际适用范围和误报率都还需要更多验证,所以分数先打个折,没给更高。

Computing Life · Share · 鸭哥调研

模型窗口不是无限大的垃圾桶:为什么智能体需要上下文治理

给智能体接上几十个工具后,用户一句简单提问会被淹没在工具定义、日志和抓取数据里。Anthropic 的 MCP 沙箱把 15 万 token 的工具定义压缩到约 2000 token 的高信号输入;Google ADK 把智能体状态拆成工作上下文、会话记忆和文件制品,中间产物默认不占窗口;Manus 在生产环境里输入输出 token 比约 100:1,...

推荐理由:HKR 三项都踩中了,有新鲜比喻、有跨框架的工程数字对比,读起来不像是公关稿。扣分是因为这是个人博客而非官方发布,且摘要截断在论证中途,信息完整度打了折扣,所以 featured 低段给 78 分。

TechCrunch · AI

开源模型抢不走 Anthropic 的饭碗,至少现在还没抢走

Decagon 的 CEO 张杰西抛了个观点:企业里越成熟的 AI 应用,越在换用更轻量的开源模型,但花在 Claude 这类昂贵前沿模型上的钱并没减少。他的解释是,这两者不是对手,而是同一个生命周期的两个阶段——先用贵的前沿模型把业务场景跑通、验证可行,等场景成熟了再换成便宜的开源方案。新场景不断冒出来,所以前沿模型的支出能稳住。不过文章没给出 An...

推荐理由:观点本身有料且反直觉,但来源是单一 CEO 访谈,没有多源数据交叉验证,正文也没给出 Anthropic 的具体营收或客户留存数字,所以判断力先打个折,放在 featured 72 分刚好。

AI HOT 精选

微软为省成本,在 Copilot 里用自研 MAI 模型替换 OpenAI 和 Anthropic

微软已经在 Excel、Outlook 等 Copilot 产品里用自研的 MAI 模型处理部分请求,目标是逐步砍掉对 OpenAI 和 Anthropic 的模型支出。AI 负责人 Mustafa Suleyman 6 月公开说过 Anthropic 太贵,要最终清零这笔成本。目前 MAI 只处理每周几万次请求,占比还很小,但路线很明确:用户可能花同...

推荐理由:微软在 Copilot 里用自研 MAI 模型替换 OpenAI 和 Anthropic,Mustafa Suleyman 公开说 Anthropic 太贵、目标是清零这笔成本。目前 MAI 每周只处理几万次请求,占比很小,但路线很明确:用户可能花同样的钱,背后模型已经换了。这点先别太激动,正文没披露 MAI 在复杂任务上的效果对比,也没说替换后用户反馈如何,但省钱意图和落地动作是实打实的。

TechCrunch · AI

Claude Cowork 把办公助手搬上手机和网页,不再只是桌面上的写报告工具

Anthropic 的 Claude Cowork 之前只能在桌面端用,帮人写报告、做表格这类非编程的案头工作。现在它上了手机和网页,Max 订阅用户能用。你可以在电脑上派个活,合上笔记本走人,路上掏出手机看进度,到了地方再收结果。Anthropic 想把它从“给不会写代码的人用的编程工具”扭成“跨设备的行政同事”,让模型在后台干活、跨设备跟着你,遇到...

推荐理由:Anthropic 把 Claude Cowork 从桌面端扩到手机和网页,Max 用户可用,主打后台干活、跨设备接力。这是从编程助手往通用办公助手迈的实在一步,定位清晰。分数没往上拉,因为本质是渠道扩展,没披露新能力,实际效果还得看后台执行稳不稳、手机端体验跟不跟得上。

AI HOT 精选

Claude Cowork 要上手机和网页了

Anthropic 宣布把 Claude Cowork 这个能异步干活的工具带到移动端和网页端,以后你在手机上或浏览器里派任务,它可以在后台继续跑。正文只给了标题和网站导航,没写具体上线时间、功能有没有缩水、价格怎么算。能确定的是平台要扩,其他细节一概没提。

推荐理由:把 Cowork 扩到移动端和网页端,对 Anthropic 来说是个实在的平台动作,但这条公告几乎没内容——没上线日期、没功能细节——所以勉强够上 featured 门槛。

7月7日星期二

Hacker News 首页

你的 robots.txt 是 2023 年的战争纪念碑——多数网站无视了实时回答机器人

Sitedex 扫描了前一万名网站的 robots.txt 文件。能确定写入日期的 GPTBot 屏蔽规则里,有 38% 集中在 2023 年第四季度,也就是 GPTBot 上线和纽约时报起诉 OpenAI 之后。87% 的网站后来都加过新规则,但几乎全是针对训练爬虫。Anthropic、OpenAI 和 Perplexity 各运行两个机器人:一个用...

推荐理由:文章用数据讲了一个很具体的漏洞:站长们忙着在 2023 年底封训练爬虫,却几乎没人管回答时来偷内容的机器人。观点有数据撑腰,也戳中了从业者的盲区。分数没上 80,是因为 Sitedex 本身不算顶级信源,而且正文没提供完整报告,没法核实数据深度。

Hacker News 首页

Craig Mod 花了五天用 Claude Code 给自己写了个记账软件 TaxBot2000

作家 Craig Mod 用 Claude Code 自己动手写了个叫 TaxBot2000 的记账工具,前后只花了五天。他管自己叫“软件狂人”,过去一年里用 Claude Code 搭了一堆小工具,比如一个帖子七天自动消失的类 Twitter 社区、视频内容搜索工具,还有各种日常用的效率小脚本。TaxBot2000 是他最新的作品,用 Python、...

推荐理由:Craig Mod 用 Claude Code 五天搭出 TaxBot2000,是个有血有肉的第一人称实验,不是公关稿。H、K、R 三条都踩中了,但毕竟只是个人效率工具分享,不是行业级产品更新或研究突破,所以放在 featured 里刚好。

Hacker News 首页

用确定性工具把大模型的笨手笨脚自动化掉

作者在开发 Beagle SCM 时发现,Claude 这类大模型虽然聪明,但做事不精确、不稳定,比如会把 build/ 目录重复提交两次。这种笨拙是模型本身的特性,不会随着进步消失。解决办法是用快速、可靠的确定性工具把模型夹在中间:下层是工具层,上层是工作流层,让模型在严格的流程里干活。如果模型反复做同一组操作,就写成脚本自动化;如果总在某个地方出错...

推荐理由:一篇工程师视角的实战反思,用 Claude 的翻车案例引出“用确定性工具夹住模型”的架构思路。不是产品发布或研究突破,但问题真实、解法具体,对正在把 AI 接入开发流程的团队有直接参考价值。

AI HOT 精选

Claude Code 现在可以按任务选模型和“用力程度”了

Anthropic 给 Claude Code 加了两项控制:模型选择和努力级别。你可以把 Opus 这种大模型派去跨文件重构,Sonnet 处理日常编辑,Haiku 做快速小修。努力级别分低、中、高三档,调的是模型思考深度和工具调用次数。高努力配 Opus 会触发多步代码库搜索和测试运行,但烧的 token 也最多。正文没披露具体价格差,只说了高努力...

推荐理由:Anthropic 官方产品指南,不是水文。努力级别的行为描述很具体(多步搜索、自动跑测试),对日常使用有直接帮助。扣分点在于没给价格对比,只说高努力“烧的 token 最多”,没数字。整体落在 featured 门槛没问题。

纽约时报中文网

美国AI公司指责中国对手非法蒸馏技术,但这事没那么简单

Anthropic 6月致信美国参议员,指控阿里巴巴用数万个未经授权的账户,以工业级规模蒸馏其 Claude 模型。蒸馏本身不是什么新技术,谷歌十年前就发明了它,本质是让大模型当老师,教小模型学回答风格,省算力。马斯克4月也在法庭上承认 xAI 蒸馏过 OpenAI 的技术。目前法律上是否违法还不明确,法院没判过,版权法也管不着模仿行为。正文没披露阿里...

推荐理由:Anthropic 正式指控阿里巴巴用数万个账户大规模蒸馏 Claude,马斯克的案子是现成的平行案例。核心钩子是法律真空:模仿行为本身不违法,法院没判过,版权法也管不着。文章没披露阿里的回应和具体证据,所以分数没给到 85 以上。

AI HOT 精选

AI公司一年砸近百亿美元,把工程师送进客户公司干活

过去12个月,AI公司总共承诺了97.5亿美元,用来组建“前线部署工程”团队,也就是把自家工程师直接派到客户公司里,帮他们把AI用起来。这笔钱相当于埃森哲一年人力成本的四分之一。目前出现了三种玩法:微软和亚马逊直接从现有员工里调人,不额外融资;OpenAI和Anthropic则拉上TPG、黑石等私募,成立独立公司来干这事,OpenAI还为此收购了一家1...

推荐理由:Tunguz用硬数字和三种结构模型把FDE趋势讲透了,让人信服部署工程已经是百亿美元级别的战略战场。没给更高分是因为这是分析文章而非突发新闻,部分数字依赖公司承诺而非实际支出,我会先打个折。