跳到正文

#Anthropic

今日 9 条

5月7日星期四

Ben's Bites

Elon 把用量翻倍了

这期主要讲了几件事。ChatGPT 免费版换上了新模型 GPT-5.5 Instant,看 PDF、搜网页、调用记忆都比上一代强,在容易出错的场景下幻觉减少了 52.5%,回复也更短、更少用表情。同时 ChatGPT 现在能直接嵌进 Excel 和 Google Sheets 里写公式、分析表格。Claude 这边,所有付费套餐的调用额度翻倍,原因是 ...

推荐理由:HKR 三项都过了:SpaceX Colossus 1 的算力合作、Claude 用量翻倍、配额压力,全是实打实的信息点。正文没给出具体限额数字和定价变化,也没说清楚是哪些付费档位受益,所以重要性停在低 featured 档。标题写 Elon 但正文没展开,这点先别太激动。

AI HOT 精选

Anthropic 研究所公布四个核心研究方向,计划发布更细颗粒度的经济指数

Anthropic 新成立的研究所(TAI)把研究分成四块:AI 在经济里怎么扩散、新安全威胁和抗风险能力、真实世界里的 AI 系统、以及 AI 反过来加速 AI 研发。他们打算把 Anthropic 经济指数的数据发得更密、更细,用来当劳动力市场变化的早期预警。文章还提到,内部已经看到软件工程这类工作在快速改变,公司自己的运转方式也在变。这些研究成果...

推荐理由:这是一份研究议程,不是模型发布或产品更新,所以重要性不会冲太高。我会先打个折,把它放在74分。真正值得盯的不是这4个方向本身——经济扩散、威胁与韧性、真实世界AI系统、AI驱动研发——而是Anthropic明说这些研究结果会进入长期利益信托的决策链。也就是说,这不是写写白皮书,而是可能影响公司实际资源怎么分。正文还提到会发布更细粒度的Anthropic经济指数,用来追踪AI对就业和经济的实际影响,这点比泛泛而谈的“研究”要实在。不过正文没披露具体时间表,也没说信托的决策机制长什么样,所以别太激动,先当信号看。

Latent Space

Anthropic 租下 xAI 孟菲斯超算,年费或达 50 亿美元,Claude 推理能力几天内就要搬上去

Anthropic 在第二届开发者活动上宣布,将租用 xAI 在孟菲斯的 Colossus I 超算集群来跑 Claude 的推理任务,预计几天内就开始迁移。外界根据 300 兆瓦的功耗规模估算,这笔交易一年可能花掉 Anthropic 约 50 亿美元,相当于 xAI 变相成了一家提供算力租赁的云厂商。活动上没有发新模型,主要更新了三件事:一是 Cl...

推荐理由:这条消息最炸的点是 Anthropic 可能要从 SpaceX/xAI 租 300MW 算力,一年砸 50 亿美元——不过正文也说了这俩数字还不是官方口径,先打个折看。对开发者更实在的是 Claude Code 的 5 小时限额翻倍了,Pro、Max、Team 和席位制 Enterprise 都受益,Opus API 限额也往上调了,用起来没那么容易撞墙。整篇信息量够,既有大 deal 的传闻钩子,又有马上能用的产品变动,所以放在 featured 档。

新智元 · 公众号

Claude 托管智能体新增“做梦”功能,Harvey 实测任务完成率暴涨约 6 倍

Anthropic 给 Claude 的托管智能体加了三个新能力:Dreaming(做梦)、Outcomes(结果校验)和多智能体协作。其中“做梦”是指让 Claude 在后台读取最多 100 段历史会话,自己总结规则来改进表现,一次演示里它把 530 万 token 的对话提炼成了 98 条规则。法律 AI 公司 Harvey 实测后,任务完成率比之...

推荐理由:Anthropic 给 Claude 托管 Agent 加了三个东西:Dreaming 让模型事后翻历史会话自己总结规则,Outcomes 用偏好样本教模型对齐目标,多 Agent 编排让多个 Claude 协作干活。Harvey 说任务完成率大约翻了 6 倍,Outcomes 内部测试最高能提 10 个百分点。运行时另收 0.08 美元/会话小时,正文没披露这个定价的横向对比。我会先打个折:6 倍是合作方数据,没看到独立复现,但 Dreaming 从 530 万 token 压到 98 条规则这个例子确实说明能省不少上下文成本。

机器之心 · 公众号

马斯克宣布 xAI 解散,Grok 并入 SpaceXAI,22 万张 GPU 算力租给 Anthropic

马斯克确认 xAI 解散,Grok 和 X 平台相关业务全部并入新实体 SpaceXAI。同时,SpaceX 和 Anthropic 签了协议,Claude 将接入 Colossus 1 超算——超过 22 万张 Nvidia GPU、300 兆瓦的算力集群。对用户来说最直接的变化是配额:Claude Code 的五小时速率限制翻倍,Pro 和 Max...

推荐理由:我会先打个折:目前只有单一信源,还没看到 Anthropic 或 SpaceX 的官方公告,所以先不拉满。但消息本身冲击力很强——xAI 解散、Grok 并入 SpaceXAI,Colossus 1 那 22 万张 GPU 和 300 兆瓦算力直接租给 Anthropic,等于把自家训练底座送给了对手。对开发者来说,Claude Code 五小时速率翻倍、Pro 和 Max 高峰配额限制移除是马上能感知的变化。正文没披露租约时长和价格,也没说 Grok 后续怎么迭代,这些缺口让消息还差一口气,但已经够格进 p1。

Computing Life · Share · 鸭哥调研

Anthropic 半年签下四笔算力大单,xAI 把自家超算中心整租给了对手

Anthropic 在六个月内接连锁定了 AWS Trainium、Google TPU、SpaceXAI Colossus 1 和 CoreWeave 的算力,覆盖了市面上三种主流芯片架构。同一时间,xAI 把拥有 22 万张 GPU 的 Colossus 1 数据中心全部租给了 Anthropic,而自家 GPU 利用率只有 11%。这两件事拼在一...

推荐理由:我会先打个折:这更像一篇策略分析,不是突发新闻,所以分数没给到 85 以上。但它的信息密度够硬——Anthropic 四处锁算力,xAI 却把自家超算租给对手,还带出 11% 利用率这个反直觉数字。对关注大模型算力战的人来说,这比单纯宣布合作要有意思得多。正文没披露租约的具体价格和时长,这点先别太激动,但现有的数字已经足够让从业者重新琢磨两家公司的算力策略了。

Computing Life · Share · 鸭哥调研

Agent 文件系统:从“喂给模型记忆”到“让模型自己翻文件”

这篇文章梳理了 AI agent 外置记忆方案的三代演化:从把所有东西塞进上下文窗口,到用向量数据库做外挂记忆,再到 2025 年下半年兴起的“把文件系统当上下文用”。核心转变是让 agent 自己按需去文件系统里找信息,而不是开发者预先推送。文章解释了为什么这个模式现在成立:模型天生会操作文件系统、上下文窗口的成本已经高到不可忽视、渐进式披露能利用模...

推荐理由:这是一篇设计评论,不是产品发布或论文。它把 Agent 文件系统拆成三代,对比了 Turso、Anthropic、Vercel 和 Manus 的不同判断,还点出四个盲区,对做 Agent 的人有参考价值。信息量和相关性都够,但性质偏评论,所以放在 featured 而不是更高一档。

FT · 科技

SpaceX 要把数据中心算力租给 Anthropic

FT 报道 SpaceX 会向 Anthropic 出租数据中心容量,等于确认了双方有一笔算力租赁合作。Anthropic 加码算力是为了跟上用户增长,但正文被付费墙挡住,没披露具体租了多少、租多久、什么价格。

推荐理由:FT 确认 SpaceX 会向 Anthropic 出租数据中心容量。H 来自这对不常见的组合;K 有交易事实但没有规模和价格,信息缺口明显;R 直接关联算力稀缺和 Anthropic 的增长压力,所以能进 featured,但缺细节撑不到 78 分以上。

r/LocalLLaMA

Reddit 网友扒了 922 条 agent 任务记录,发现 DeepSeek v4 省钱的关键不在标价,在缓存命中率

一位 Reddit 用户分析了 922 条 agent 任务的实际调用记录,对比了 DeepSeek v4 Flash 和 Opus 4.7 的花费。两个模型每个任务都要吃掉大约 96 万 token,但 DeepSeek 单任务成本只要 0.01 美元,Opus 4.7 却要 1.52 美元。差距不在输入输出的标价,而在缓存:DeepSeek 的缓存...

推荐理由:这篇不是比谁模型强,是比谁缓存用得聪明。Reddit用户跑了922条智能体任务轨迹,发现DeepSeek v4 Flash单任务成本0.01美元,Opus 4.7要1.52美元,差了152倍。两边平均token消耗都接近96万,但DeepSeek缓存命中率97%,Opus只有87%;更关键的是缓存读写价格比,DeepSeek是0.02,对方是0.08。也就是说,标价看着便宜不算真便宜,能把重复计算省下来才是省钱的地方。正文没披露任务类型和采样方式,这点先别太激动,但缓存机制这个观察本身值得盯。

TechCrunch · AI

DeepSeek 首次对外融资,估值可能冲到 450 亿美元

DeepSeek 正在谈第一笔外部投资,几周内估值就从 200 亿涨到了 450 亿美元。这家中国 AI 实验室 2025 年初靠一个训练成本远低于 OpenAI、Anthropic 等美国模型的大语言模型出圈,之后在推理和编程能力上一直咬住第一梯队,模型权重也开放下载。创始人梁文锋原本没打算融资,但对手开始挖人,他才决定引入资金好给员工发股份。领投方...

推荐理由:DeepSeek 第一次对外融资,目标估值 450 亿美元,我会先打个折——正文没给金额、没列投资方、也没提条款,所以这个数目前更像一个信号而不是定论。真正值得盯的是:如果首轮真按这个价成交,中国 AI 实验室的估值天花板就被重新画了一条线。这点先别太激动,等更多细节出来再说。

彭博科技

Anthropic 找 SpaceX 买算力,但没说是训练还是推理用

Anthropic 和马斯克的 SpaceX 签了一份算力合同,目的是撑住 Claude 越来越大的用量。报道没披露具体算力规模、合同金额、上线时间,也没说这批算力是拿来训练新模型还是跑线上推理。SpaceX 能不能挤进 Anthropic 的长期供应链,目前还看不出来。

推荐理由:我会先打个折,这条消息的新闻性在于“谁跟谁合作”,而不是合作本身有多扎实。Anthropic 把 SpaceX 拉进算力供应商名单,对缓解 Claude 的推理压力可能有帮助,但正文没披露任何具体数字或部署细节,所以现在还判断不了这是短期补缺还是长期供应链调整。真正值得盯的是后续会不会有训练或推理负载真的跑在 SpaceX 的设施上,以及合同规模能不能跟 AWS、Google Cloud 的量级比一比。目前只能当作一个信号来看,别太激动。

Hacker News 首页

Claude 大幅提高用量上限,并与 SpaceX 签下超 300 兆瓦算力合同

Anthropic 宣布了三项即时生效的调整:Claude Code 的 5 小时速率限制翻倍,Pro 和 Max 用户不再受高峰时段降速限制,Opus 模型的 API 调用频率也明显上调。这些变化背后是一笔新签的 SpaceX 算力合同——Anthropic 将在一个月内用上 Colossus 1 数据中心全部容量,超过 300 兆瓦、约 22 万张...

推荐理由:标题说 Claude 要提用量上限,还跟 SpaceX 签了算力合同,但点进 RSS 只有链接和评论,关键数字一个没给。我会先打个折:这事听着挺省钱,可没披露倍数和规模,就先别太激动。真正值得盯的是配额放宽是不是靠 SpaceX 的新算力在撑,这点正文没交代。

5月6日星期三

量子位 · 公众号

Claude 团队拿 Qwen 试了一种新训练法,把模型乱说话的比例从 68% 压到 5%

Anthropic 提出在预训练和对齐微调之间加一个叫 MSM 的训练阶段。他们在 Qwen2.5-32B 和 Qwen3-32B 上做了测试,模型乱说话的比例分别从 68% 和 54% 降到了 5% 和 7%。核心点是 MSM 是补强对齐微调,而不是替代它。

推荐理由:我会先打个折:这不是新模型发布,而是训练方法研究,所以 82 分刚好。Anthropic 用 Qwen 做实验,把 MSM 放在预训练后、对齐微调前,相当于在模型学完通用知识之后、正式教它守规矩之前,先塞一批规范文档让它读。Qwen2.5-32B 的失准率从 68% 掉到 5%,Qwen3-32B 从 54% 掉到 7%,数字说明效果明显。真正值得盯的是 MSM 和 AFT 互补,不是替代关系——这点先别太激动,正文没披露更多消融实验细节。整体是扎实的安全研究,对做对齐的从业者有参考价值。

Latent Space

硅谷开始认真卖服务了:Anthropic 和 OpenAI 各自成立公司,帮企业把模型塞进业务里

Anthropic 和 OpenAI 这周都宣布了新的企业服务公司。Anthropic 跟黑石等几家华尔街机构搞了个合资公司,总共融了 15 亿美元,每家出 3 亿。他们的做法是先派个小团队去客户那,搞清楚 Claude 能在哪发挥最大作用,然后工程师再上手定制系统。OpenAI 那边动作更大,成立了一家叫 The Deployment Company...

推荐理由:两家头部模型公司不约而同从卖模型转向亲自下场做服务,Anthropic 的合资公司拿了 15 亿美元,OpenAI 的部署公司融了约 40 亿、投前估值 100 亿。我会先打个折,正文没披露这些服务公司的具体业务模式、客户是谁、怎么收费,也没说跟现有云厂商的合作关系怎么处理。但光看资金规模和两家同时行动,这个信号够强,值得从业者留意。

新智元 · 公众号

12岁写代码,28岁撑起谷歌20亿业务,他却劝年轻人别卷编程了

Alon Chen 12岁开始写代码,28岁在谷歌管着年收20亿美元的业务。但他现在劝年轻人别再把编程当唯一护城河。他给了两个数字:微软新代码里30%是AI写的,谷歌这个比例也超过25%。他的判断是,以后更稀缺的能力是执行、把问题定义清楚、以及沟通协作,纯写代码的壁垒在变薄。不过正文没披露他具体是在什么场合说的这番话,也没给出这些AI生成代码比例对应的...

推荐理由:这篇不是产品发布或模型评测,更像一篇职业判断类的评论。我会先打个折:它没有披露新模型或新方法,但两个 AI 生成代码占比的数字让它比普通鸡汤更有信息量。正文没给出这些数字的统计口径和验证方式,所以别当精确指标用,但它确实说明大厂内部写代码这件事的构成在变。对从业者来说,这比单纯喊“AI 要取代程序员”更有参考价值,因为它指向的是技能重心的转移,而不是岗位消失。

5月5日星期二

新智元 · 公众号

Anthropic 用 700 多个“坏模型”训练内省适配器,让 AI 自己交代隐藏行为

Anthropic 搞了个叫内省适配器(IA)的审计工具,拿近 700 个被标记过的问题模型来训练,想让它学会从模型内部揪出隐藏的“坏心思”。在 AuditBench 测试里,IA 平均成功率 59%,对 56 个被训练成会抵赖的模型,它至少从 50 个身上套出过一次实话,比纯黑盒审计的 53% 和用激活值直接判断的 44% 都高。不过别急着激动,IA...

推荐理由:我会先打个折:这是研究进展,不是Claude产品更新,所以分数压在78–84区间。但选题和数字都够抓人——用700多个“坏模型”训练审计器,在AuditBench上拿到59%成功率,而且50/56个嘴硬模型至少坦白过一次,比对照方法高出不少。对做安全和对齐的从业者来说,这提供了一个比黑箱审计更可读的内部审计思路。边界也得说清楚:正文没证明跨基座到GPT或Gemini有效,误报和动机抓取也是弱项,这点先别太激动。

机器之心 · 公众号

Anthropic 联创预测:2028 年底前 AI 自己搞研发的概率超六成

Anthropic 联合创始人 Jack Clark 给了个时间点:到 2028 年底,AI 脱离人类独立做研发的概率超过 60%。他拿几个基准测试当证据——Claude Mythos Preview 在软件工程测试 SWE-Bench 上跑到 93.9%,Opus 4.5 在评估 AI 复现研究能力的 CORE-Bench 上拿到 95.5%。Cla...

推荐理由:我会先打个折:标题里的“自我进化”和“没有人类了”是媒体写法,Clark 原文说的是无人类参与的 AI 研发概率,不是奇点降临。但他作为联创,拿内部模型跑出来的基准分来押 2028 这个时间点,分量不一样。SWE-Bench 93.9% 说明代码修 bug 这类短任务已经很高,CORE-Bench 95.5% 测的是复现论文的工程能力,真正该盯的是 MLE-Bench 和 PostTrainBench——这两个才碰得到长周期、需要自己调参和做后训练的任务,目前正文没给具体分数,这点先别太激动。整体看,他是在用基准曲线推 timeline,不是纯拍脑...

5月4日星期一

TechCrunch · AI

Anthropic 和 OpenAI 同时成立合资公司,要把企业 AI 服务卖得更猛

两家公司都找了资产管理方合伙,成立合资公司来推企业级 AI 产品。具体是哪家资管、股权怎么分、定价多少、什么时候上线,正文都没披露。这种操作说明两家都在想办法把企业客户圈得更紧,但没看到实际条款之前,我会先打个折——合资公司到底是为了深度定制服务,还是换个渠道铺销售,现在还不好说。

推荐理由:我会先打个折:正文只给了 RSS 摘要,没写资管方名字、股权怎么分、定价和什么时候上线,所以现在只能看个方向。两家同时走合资这条路,说明他们想把企业销售这件事做得更重、更贴近大客户,但具体谁出钱、谁控盘还不清楚。这点先别太激动,等细节出来再判断实际影响。

FT · 科技

黑石和高盛等出资 15 亿美元,跟 Anthropic 成立合资公司帮华尔街用 AI

FT 这篇报道正文被付费墙挡住了,只能看到标题和摘要。已知信息是:黑石、高盛等机构参与了一个 15 亿美元的合资项目,合作方是 Anthropic。这家合资公司会以咨询形式,帮华尔街机构在投资组合里部署 AI。但正文没披露股权结构、具体产品形态、时间表,也没说 Anthropic 的 Claude 模型会以什么方式嵌入业务流程。15 亿这个数字不小,说...

推荐理由:我会先打个折——正文没披露股权结构、具体产品长什么样、什么时候上线,所以别急着把它当成一个马上能用的东西。但黑石和高盛愿意掏钱组局,说明华尔街开始认真把 AI 塞进自己的业务流程里,不只是买来玩玩。Anthropic 这边也在找除了卖 API 之外的赚钱路子,咨询加投资的模式如果跑通,对纯做模型的同行压力不小。

Import AI

AI 研究即将全自动:Jack Clark 预测 2028 年底前,AI 自己造自己的概率超过六成

Jack Clark 根据公开数据做了一个判断:到 2028 年底,不需要人类插手的 AI 研发有超过 60% 的概率会出现。他主要拿两个指标说事。一个是 SWE-Bench,这个测试看 AI 能不能解决 GitHub 上的真实代码问题,Claude 2 当初得分大概 2%,现在 Claude Mythos Preview 已经干到 93.9%,基本把...

推荐理由:HKR 三项全中。Jack Clark 用 SWE-Bench 和 METR 的数据撑起一个 2028 年全自动 AI 研发的赌注,属于知名人物对 AI 时间线的判断,放在 85–94 分档合适,比模型发布的分量低一点。

新智元 · 公众号

迪士尼员工9天狂调Claude 46万次,Meta一个月烧掉60万亿token

新智元这篇推文本身被微信环境拦截,正文没披露原始数据表,只能从标题和摘要反推。标题说迪士尼内部有个AI使用看板,一名员工在9个工作日内向Claude发起了约46万次调用,平均每天超5万次,频率高到像在跑自动化任务。另一组数字是Meta 30天消耗60万亿token,按公开API价格算大概值90亿美元,但实际内部成本肯定低得多。我会先打个折:token消...

推荐理由:HKR三项都成立:钩子靠两个夸张的用量数字立住,知识部分有仪表盘截图和token折算,痛点踩在企业最关心的Claude成本控制上。分数维持74,因为数据都是二手转述,正文没给原始数据表,我会先打个折。

最佳拍档

Claude Code 变笨了,Anthropic 复盘出三个 bug

Anthropic 自己复盘了 Claude Code 性能回退的原因,点出三个具体问题:推理强度被改动、缓存优化出了错、系统提示词有长度限制。视频标题只给了这些结论,正文没披露复现步骤、时间线和修复状态。核心看点是 AI 审 AI 代码时,工程约束下容易踩坑——这点先别太激动,信息缺口还很大。

推荐理由:HKR 三项都成立,但正文只给了三个原因分类,没交代复现步骤、时间线或修复状态。Claude Code 相关度高,所以放在 72–77 这个区间。

5月3日星期日

r/LocalLLaMA

开源代理 rosetta-llm 让 Claude Code 能调用任意模型

DataNebula 开源了一个叫 rosetta-llm 的代理,它像一个翻译网关,让 Claude Code 可以跟不同厂商的模型对话。它负责把 Anthropic Messages、OpenAI Chat 和 OpenAI Responses 这三种接口格式互相转换,并且通过 signature 字段把加密的推理过程来回传递,保证多轮对话时不会丢...

推荐理由:这是个 Reddit 开源工具帖,没披露 star 数、实际用量或任何基准测试结果,所以我会先打个折。技术点本身有意思:用 signature 字段回传加密 reasoning,试图保住 thinking block 的保真度,让多轮 agent 的 prompt-cache 不失效——这点如果真跑通了挺省钱。但正文没给出验证数据,也没说支持哪些模型、延迟增加多少,目前只能当个有潜力的工具看,分数停在中等偏上合理。

r/LocalLLaMA

Upskill 开源了一个技能注册表,让 AI 代理动手前先查“说明书”,已收录超 1 万个技能

Autoloops 把 Upskill 做成了开源项目,相当于给 AI 代理配了一本可检索的技能黄页,目前索引了超过 1 万个技能。代理在干活前会先来这里查一下有没有现成的工具或流程可用。搜索靠的是 Postgres 全文检索、1024 维向量匹配,再按收藏数、安装量和反馈做重排序,尽量把靠谱的技能往前排。入库时有专门的对抗性审查,用大模型拦下了几百个...

推荐理由:Autoloops 这个 Upskill 开源项目,本质是给 Agent 配一个可查询的技能黄页,1 万+ 索引量不算大但起步够用。我会先打个折:正文没披露实际检索延迟和重排效果数据,也没说这 1 万+ 技能的质量分布,所以实用性还得看社区后续填充。安全侧的 LLM 对抗审查是个加分项,但拦截几百个技能这个数字本身说明不了漏检率。整体是个方向对、实现也实在的开源工具,Agent 开发者值得关注,但别指望开箱即用。

机器之心 · 公众号

百亿公司 CTO 们集体跳去 Anthropic 当一线工程师

机器之心这篇文章本来想盘点 2025 年 1 月到 2026 年 4 月间,至少六位从 Workday、You.com、Box、Super.com、Adept AI 等公司离职加入 Anthropic 做个人贡献者(IC)的前 CTO,但微信页面被环境异常拦截,正文内容完全看不到。从已有的英文摘要看,核心讨论点不是“为了 AGI 理想”,而是职业杠杆—...

推荐理由:这篇不是产品发布或模型更新,是篇评论,但切入点很巧。它没停留在“为了 AGI 理想”这种公关叙事,而是把重点放在职业杠杆上:当 CTO 不如在 Anthropic 当工程师划算,说明顶级 AI 公司里技术执行者的议价权在涨。我会先打个折,因为正文没给出这些 CTO 具体负责什么、薪资怎么变,但 6 个案例摆在那,趋势信号是清晰的。

新智元 · 公众号

Claude Code 让 Anthropic 两个月收入翻倍,成史上增长最快的 AI 公司

Semi Analysis 的报告说,Anthropic 的年化收入(ARR)已经冲到 440 亿美元,过去 12 个月净增了 350 亿。其中 Claude Code 这个编程助手到 2026 年 2 月,自己就贡献了 25 亿美元的年化收入。推理毛利率也从 38% 涨到了 70% 以上。不过正文因为微信环境异常没抓到具体内容,这些数字背后的客户留存...

推荐理由:我会先打个折——Semi Analysis 的数据不是官方财报,但 440 亿 ARR 和 70% 推理毛利率这两个数如果属实,说明 Anthropic 靠 Claude Code 在企业端收钱的速度比外界想的快得多。文章真正值得盯的不是总盘子有多大,而是三个东西能不能同时成立:企业用量在涨、代码智能体收入在涨、推理毛利也在涨。正文没披露 Claude Code 的客户留存和续费率,这点先别太激动。

新智元 · 公众号

斯坦福团队用 AI 从零设计出全新噬菌体,16 个能感染并杀死大肠杆菌

斯坦福和 Arc 研究所的研究人员用他们训练的模型 Evo,直接生成了 302 个噬菌体基因组,其中 16 个成功感染了大肠杆菌、完成自我复制并最终裂解了宿主细胞。这相当于 AI 不靠自然界已有的病毒模板,凭空造出了能干活的新病毒。Evo 模型基于 StripedHyena 2 架构,一次能处理 100 万个碱基对的长序列。后续的 Evo-Φ69 版本...

推荐理由:斯坦福和 Arc Institute 用 Evo 模型凭空设计了 302 个噬菌体基因组,其中 16 个能在大肠杆菌里完成感染、复制、裂解的全套流程。Evo 2 的 StripedHyena 2 架构把上下文拉到 100 万碱基对,相当于一次能看完一整套细菌基因组。Evo-Φ69 在 6 小时内扩增 16 到 65 倍,这个效率数字说明它不只是能跑,还跑得挺快。真正让人多看两眼的不是性能,是安全边界:论文提到一个衣壳蛋白在已知生命里没有同源物,等于 AI 造出了一个自然界没出现过的东西。这点先别太激动,正文没披露这个蛋白的功能验证到什么程度,也没说...

5月2日星期六

量子位 · 公众号

苹果官方 App 把 Claude.md 打包进去了,大公司也搞 Vibe Coding?

苹果支持 App 的 5.13 版本在 5 月 1 日上线时,不小心把一个叫 Claude.md 的文件打进了安装包,不到 24 小时就被下架了。这个文件描述了 Juno AI 和人工客服之间怎么通过一个协议层来切换,客户端、AI 助手、人工客服的消息都在同一个流程里处理。正文没披露这个文件到底是怎么跑进正式版本的,但问题核心出在发布审核环节。

推荐理由:HKR 三项都踩中了,但这说到底还是个 App 打包事故,不是模型或平台发布。苹果的体量加上 Claude.md 的细节够得上 featured;正文没披露审查链哪里断了,这点先别太激动。

5月1日星期五

新智元 · 公众号

拆解 Claude Code:让它好用的 98.4% 是工程,不是 AI

VILA-Lab 把 Claude Code v2.1.88 的 51.2 万行代码扒了一遍,发现真正跟 AI 决策逻辑相关的部分只占 1.6%。剩下 98.4% 全是确定性的工程基础设施:权限控制、上下文管理、工具路由和错误恢复。核心变化不是把提示词写得更长,而是给模型套上了一套好用的“缰绳”。

推荐理由:这篇不是 Anthropic 官方出品,是 VILA-Lab 的逆向分析,所以权威性我会先打个折。但它给的 51.2 万行源码和 1.6%/98.4% 的拆分很具体,对正在搭 agent 的团队来说,比很多公关稿有用——它把“模型强所以产品强”的叙事拉回到工程现实。正文没披露完整复现步骤,这点先别太激动,但判断方向是准的。

机器之心 · 公众号

有人用 API 猜出了 GPT、Claude、Gemini 的参数量,社区吵翻了

Bojie Li 在 arXiv 发了篇论文,用黑盒 API 调用去估算 27 家厂商 188 个模型的参数量。方法叫 IKP,靠 1400 道按生僻程度分了 7 档的题,先在 89 个已知参数量的开源模型上拟合,拟合度 R² 到 0.917。争议点集中在合成数据干扰、MoE 架构影响,以及估算区间太宽——90% 置信区间在 0.3 倍到 3 倍之间,...

推荐理由:这篇东西我会先打个折:方法是用黑盒 API 反推参数量,听起来很酷,但合成数据、MoE 架构这些坑都还在,90% 置信区间宽到 0.3 到 3 倍,说明估算还比较糙。不过它确实把 188 个模型的参数量猜了个遍,R²=0.917 也不算低,对从业者来说是个能引发讨论的参照系。社区争议本身就是信息价值的一部分,所以放在 featured 里合适,但离 P1 还差一口气,因为结论的确定性不够硬。

Latent Space

AI 周报:Codex 开始抢知识工作者的活儿,Claude 盯上了创意工具

OpenAI 把 Codex 从写代码扩展到了文档、幻灯片、表格这类非编程工作,新版本里电脑操作速度提升了 42%,还接入了微软、谷歌、Salesforce 的办公套件。Anthropic 这边,Claude 新增了对 Blender、Adobe 全家桶、Ableton 等创意软件的支持,同时推出了一个代码安全审查工具。另外,英国 AI 安全研究所的报...

推荐理由:OpenAI 把 Codex 从写代码推到了非编码的 GUI 操作上,说 CUA 比之前快 42%,还接进了微软、谷歌和 Salesforce 的办公套件。我会先打个折:正文没披露价格、具体上线范围和可复现细节,所以别急着当省钱结论。真正值得盯的是 GUI agent 产品化这一步,而不是单次模型跑分。

TechCrunch · AI

Anthropic 新一轮融资估值可能超过 9000 亿美元,两周内或完成

据知情人士透露,Anthropic 要求投资人在 48 小时内提交认购意向,这轮融资预计两周内完成。TechCrunch 此前报道融资额约 500 亿美元,估值目标在 9000 亿美元左右。不过因为想入局的投资者太多,最终估值可能还会更高。正文没披露具体条款、领投方是谁,也没说钱具体怎么花。

推荐理由:HKR 三项全中:TechCrunch 爆出 Anthropic 可能以 9000 亿美元以上估值融资,投资者被要求在 48 小时内报认购额,交易窗口在 2 周内。我会先打个折——正文没披露融资规模、具体条款和领投方,所以信息缺口不小,这点先别太激动。但估值数字本身和紧迫的时间线已经足够让行业神经紧绷,所以重要性给到 88、p1 是合理的。

Hacker News 首页

Pu.sh:一个 400 行 shell 脚本搭起来的编程助手框架

Pu.sh 用大约 400 行 shell 脚本(只靠 sh、curl 和 awk)搭了一个编程助手的运行框架。它支持 Anthropic 和 OpenAI 的接口,内置 7 种工具,有对话上下文自动压缩、断点续跑和管道模式,还配了 90 个不调 API 的测试用例。没有图形界面、流式输出、图片处理、OAuth 登录,也不支持 Windows。

推荐理由:我会先打个折:这就是个 Show HN 的开源小工具,不是模型或平台发布,别当大新闻看。但它上了 HN 首页,而且 400 行能复现的代码本身就说明问题——把 coding-agent 的核心链路(调模型、给工具、压缩上下文、断点续跑)剥到只剩 shell,依赖极简,对想理解 agent 怎么跑、又不想装一堆依赖的人很友好。正文没披露实际任务成功率,所以别急着说它比别的框架强,但作为教学和轻量集成的起点,这个 featured 给得值。

r/LocalLLaMA

RTX 5080 16GB 跑长上下文编程:Qwen3.6-35B-A3B 在 128K 窗口下稳在 30 t/s,刚启动时能到 89 t/s

一位 Reddit 用户用 RTX 5080 16GB 显卡本地跑编程 agent,测了 Qwen3.6-35B-A3B 这个 MoE 模型(总参数 35B,每次激活 3B)。刚加载完上下文时速度有 89 t/s,等上下文塞满到 128K token 后,生成速度还能维持在 30 t/s,而且回复质量没掉。作为对比,同系列的 27B 稠密模型在 128...

推荐理由:HKR 三项都成立:16GB 显卡撑住 128K 上下文 30 t/s 是个很强的钩子,硬件和 CUDA 版本细节都有,还给了稠密模型的惨烈对比。不过这只是 Reddit 单帖测试,没有多源复现,所以 featured 而不是 P1。

TechCrunch · AI

OpenAI 一边吐槽 Anthropic 搞限量,一边也给自家安全工具 Cyber 上了门禁

OpenAI 要把 GPT-5.5 Cyber 先推给“关键网络防御人员”,普通用户暂时用不上。这个工具能做渗透测试、漏洞发现和利用、恶意软件逆向,相当于帮公司找安全漏洞的武器库。Sam Altman 之前还嘲笑 Anthropic 对 Mythos 搞限量是“恐惧营销”,现在自己用了同一招。正文没披露具体的申请门槛、定价和全面开放时间,想用的人得先填...

推荐理由:我会先打个折:正文只有 RSS 摘要,能确认的就是 GPT-5.5 Cyber 会搞分级访问,先给安全圈子里的人用。至于谁算“关键网络防御者”、要不要付费、什么时候轮到普通用户,这些全没披露。真正值得盯的不是 Cyber 本身有多强,而是 OpenAI 在安全工具上也开始玩分批放量,这跟它之前批评 Anthropic 的姿势放在一起看,就有点意思了。如果是真的为了安全可控,那可以理解;但如果只是换个说法控节奏,那这波操作就挺双标。

彭博科技

Anthropic 在谈新一轮融资,估值可能超过 9000 亿美元

彭博社的消息源说,Anthropic 正在考虑启动一轮新融资,估值会定在 9000 亿美元以上。如果这轮谈成,Anthropic 的估值会超过 OpenAI,成为全球最贵的 AI 创业公司。不过正文没披露这轮融资的具体金额、投资方和时间表,我会先打个折,等更多细节出来再看。

推荐理由:Bloomberg 放出的消息,说 Anthropic 在考虑估值超过 9000 亿美元的融资要约,这个数字能把头部实验室的资本排位重新洗牌。HKR 三项都踩中了,但我会先打个折:正文没披露具体金额、投资方和时间表,交易还没落地,所以别直接当成定局。

4月30日星期四

r/LocalLLaMA

实测:本地跑 Qwen-3.6-27B 跟闭源模型比,到底差多少

作者拿一个自动研究循环任务测了 5 个模型,只有 Qwen-3.6-27B 接近完成。本地用 q4_k_m 量化版跑了约 8 小时,消耗 3.9 万 token(上限 4.5 万);作为对比,全精度 Qwen 通过 OpenRouter 调用用了 440 万 token,花费 0.939 美元。关键看失败质量:两个 Qwen 版本都只差小修小补,而 G...

推荐理由:这篇帖子用一个自动研究任务把 Qwen-3.6-27B 和几个闭源模型放在一起比,结果只有 Qwen 基本完成,其他模型要么缺测试要么缺实现,对比很直观。数据也给了:本地量化版跑了约 8 小时,读 39k 写 45k tokens;全精度版消耗 4.4M tokens,花了 0.939 美元。失败质量比成功更值得看,两种 Qwen 都只需少量修复就能用。来源是单篇 Reddit 实测,权威性有限,所以放在 featured 低位,但 hook、数据和话题性都够。

TechCrunch · AI

消息称 Anthropic 可能以 9000 亿美元估值再融 500 亿美元

TechCrunch 从多个消息源打听到,Claude 的开发商 Anthropic 收到了好几份主动送上门的投资要约,估值开到了 8500 亿到 9000 亿美元,想融的钱大概在 500 亿美元。这个数字有多夸张?去年底它估值才刚过 600 亿,半年不到又跳了一大截。不过正文没披露具体是哪些投资人、有什么附加条款、以及什么时候能落定。这点先别太激动,...

推荐理由:这条消息我会先打个折——正文没披露投资方、条款和时间表,目前只是早期报价,离落地还有距离。但 9000 亿这个估值如果真成,会把 AI 实验室的资本门槛拉到新高度,Claude 的弹药库会直接膨胀。真正值得盯的是后续有没有主权基金或科技巨头接盘,而不是产品细节。

彭博科技

Anthropic 正考虑接受新一轮融资,估值超过 9000 亿美元

彭博社援引知情人士消息称,Anthropic 正在权衡新的融资要约,给出的估值锚定在 9000 亿美元以上。这个数字直接把它的身价拉到了和 OpenAI 一个量级。不过正文没披露这轮融资的具体金额、领投方和交割时间表,所以现在只能看到一个很高的估值信号,实际条款还不清楚。

推荐理由:我会先打个折,因为交易还没落地,细节全是空白。但 Bloomberg 扔出的这个 9000 亿+ 估值锚点太扎眼了,它直接把 Anthropic 架到了比 OpenAI 还贵的位置上,不管成不成,都会重新搅动市场对头部 AI 公司到底值多少钱的争论。正文没披露任何条款,这点先别太激动,但信号本身已经够强。

Hacker News 首页

Ramp 的表格 AI 会偷偷把财务数据传出去

安全公司 PromptArmor 发现 Ramp 的 Sheets AI 有个漏洞:攻击者可以在外部表格里藏一句白底白字的指令,诱导 AI 自动插入一个 IMAGE 公式,把用户表格里的敏感财务数据拼到攻击者网址后面发出去。整个过程不需要用户确认。Ramp 那边说已经在 2026 年 3 月 16 号修了。

推荐理由:HKR 三项全中:文章把一条 AI 表格工具的数据外泄路径讲得很清楚。给 82 分没上 85,是因为只有 PromptArmor 单方信源,而且实际受影响的数据规模正文没披露。