跳到正文

Anthropic / Claude

Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展的持续追踪。

最新精选

第 1121–1140 条 · 共 1,303 条

5月1日星期五

Latent Space

AI 周报:Codex 开始抢知识工作者的活儿,Claude 盯上了创意工具

OpenAI 把 Codex 从写代码扩展到了文档、幻灯片、表格这类非编程工作,新版本里电脑操作速度提升了 42%,还接入了微软、谷歌、Salesforce 的办公套件。Anthropic 这边,Claude 新增了对 Blender、Adobe 全家桶、Ableton 等创意软件的支持,同时推出了一个代码安全审查工具。另外,英国 AI 安全研究所的报...

推荐理由:OpenAI 把 Codex 从写代码推到了非编码的 GUI 操作上,说 CUA 比之前快 42%,还接进了微软、谷歌和 Salesforce 的办公套件。我会先打个折:正文没披露价格、具体上线范围和可复现细节,所以别急着当省钱结论。真正值得盯的是 GUI agent 产品化这一步,而不是单次模型跑分。

TechCrunch · AI

Anthropic 新一轮融资估值可能超过 9000 亿美元,两周内或完成

据知情人士透露,Anthropic 要求投资人在 48 小时内提交认购意向,这轮融资预计两周内完成。TechCrunch 此前报道融资额约 500 亿美元,估值目标在 9000 亿美元左右。不过因为想入局的投资者太多,最终估值可能还会更高。正文没披露具体条款、领投方是谁,也没说钱具体怎么花。

推荐理由:HKR 三项全中:TechCrunch 爆出 Anthropic 可能以 9000 亿美元以上估值融资,投资者被要求在 48 小时内报认购额,交易窗口在 2 周内。我会先打个折——正文没披露融资规模、具体条款和领投方,所以信息缺口不小,这点先别太激动。但估值数字本身和紧迫的时间线已经足够让行业神经紧绷,所以重要性给到 88、p1 是合理的。

Hacker News 首页

Pu.sh:一个 400 行 shell 脚本搭起来的编程助手框架

Pu.sh 用大约 400 行 shell 脚本(只靠 sh、curl 和 awk)搭了一个编程助手的运行框架。它支持 Anthropic 和 OpenAI 的接口,内置 7 种工具,有对话上下文自动压缩、断点续跑和管道模式,还配了 90 个不调 API 的测试用例。没有图形界面、流式输出、图片处理、OAuth 登录,也不支持 Windows。

推荐理由:我会先打个折:这就是个 Show HN 的开源小工具,不是模型或平台发布,别当大新闻看。但它上了 HN 首页,而且 400 行能复现的代码本身就说明问题——把 coding-agent 的核心链路(调模型、给工具、压缩上下文、断点续跑)剥到只剩 shell,依赖极简,对想理解 agent 怎么跑、又不想装一堆依赖的人很友好。正文没披露实际任务成功率,所以别急着说它比别的框架强,但作为教学和轻量集成的起点,这个 featured 给得值。

r/LocalLLaMA

RTX 5080 16GB 跑长上下文编程:Qwen3.6-35B-A3B 在 128K 窗口下稳在 30 t/s,刚启动时能到 89 t/s

一位 Reddit 用户用 RTX 5080 16GB 显卡本地跑编程 agent,测了 Qwen3.6-35B-A3B 这个 MoE 模型(总参数 35B,每次激活 3B)。刚加载完上下文时速度有 89 t/s,等上下文塞满到 128K token 后,生成速度还能维持在 30 t/s,而且回复质量没掉。作为对比,同系列的 27B 稠密模型在 128...

推荐理由:HKR 三项都成立:16GB 显卡撑住 128K 上下文 30 t/s 是个很强的钩子,硬件和 CUDA 版本细节都有,还给了稠密模型的惨烈对比。不过这只是 Reddit 单帖测试,没有多源复现,所以 featured 而不是 P1。

TechCrunch · AI

OpenAI 一边吐槽 Anthropic 搞限量,一边也给自家安全工具 Cyber 上了门禁

OpenAI 要把 GPT-5.5 Cyber 先推给“关键网络防御人员”,普通用户暂时用不上。这个工具能做渗透测试、漏洞发现和利用、恶意软件逆向,相当于帮公司找安全漏洞的武器库。Sam Altman 之前还嘲笑 Anthropic 对 Mythos 搞限量是“恐惧营销”,现在自己用了同一招。正文没披露具体的申请门槛、定价和全面开放时间,想用的人得先填...

推荐理由:我会先打个折:正文只有 RSS 摘要,能确认的就是 GPT-5.5 Cyber 会搞分级访问,先给安全圈子里的人用。至于谁算“关键网络防御者”、要不要付费、什么时候轮到普通用户,这些全没披露。真正值得盯的不是 Cyber 本身有多强,而是 OpenAI 在安全工具上也开始玩分批放量,这跟它之前批评 Anthropic 的姿势放在一起看,就有点意思了。如果是真的为了安全可控,那可以理解;但如果只是换个说法控节奏,那这波操作就挺双标。

彭博科技

Anthropic 在谈新一轮融资,估值可能超过 9000 亿美元

彭博社的消息源说,Anthropic 正在考虑启动一轮新融资,估值会定在 9000 亿美元以上。如果这轮谈成,Anthropic 的估值会超过 OpenAI,成为全球最贵的 AI 创业公司。不过正文没披露这轮融资的具体金额、投资方和时间表,我会先打个折,等更多细节出来再看。

推荐理由:Bloomberg 放出的消息,说 Anthropic 在考虑估值超过 9000 亿美元的融资要约,这个数字能把头部实验室的资本排位重新洗牌。HKR 三项都踩中了,但我会先打个折:正文没披露具体金额、投资方和时间表,交易还没落地,所以别直接当成定局。

4月30日星期四

r/LocalLLaMA

实测:本地跑 Qwen-3.6-27B 跟闭源模型比,到底差多少

作者拿一个自动研究循环任务测了 5 个模型,只有 Qwen-3.6-27B 接近完成。本地用 q4_k_m 量化版跑了约 8 小时,消耗 3.9 万 token(上限 4.5 万);作为对比,全精度 Qwen 通过 OpenRouter 调用用了 440 万 token,花费 0.939 美元。关键看失败质量:两个 Qwen 版本都只差小修小补,而 G...

推荐理由:这篇帖子用一个自动研究任务把 Qwen-3.6-27B 和几个闭源模型放在一起比,结果只有 Qwen 基本完成,其他模型要么缺测试要么缺实现,对比很直观。数据也给了:本地量化版跑了约 8 小时,读 39k 写 45k tokens;全精度版消耗 4.4M tokens,花了 0.939 美元。失败质量比成功更值得看,两种 Qwen 都只需少量修复就能用。来源是单篇 Reddit 实测,权威性有限,所以放在 featured 低位,但 hook、数据和话题性都够。

机器之心 · 公众号

Alec Radford 用只学到 1930 年的模型,接下了哈萨比斯的 AGI 考题

Alec Radford 团队训了一个 13B 的模型,训练数据全是 1931 年之前的英文文本,总共 2600 亿 token。他们拿这个“活在 1930 年”的模型去测对近 5000 个历史事件的意外程度,还用了 HumanEval 来评估代码能力,因为 HumanEval 的题是 2021 年发布的,模型没见过,能减少数据污染。核心发现是时间泄漏...

推荐理由:我会先打个折:正文没披露模型架构细节和训练成本,这点先别太激动。但选题本身很聪明——用1930年知识截止做对照实验,比单纯刷榜有意思。13B模型对战后事件有模糊感知,说明数据清洗再严格也挡不住泄漏,这对做安全对齐和评测的人是个实在提醒。2600亿token、近5000条事件测试这些数字让结论有分量,不是空对空。整体是扎实的研究发布,不是模型或平台上线,82分合理。

TechCrunch · AI

消息称 Anthropic 可能以 9000 亿美元估值再融 500 亿美元

TechCrunch 从多个消息源打听到,Claude 的开发商 Anthropic 收到了好几份主动送上门的投资要约,估值开到了 8500 亿到 9000 亿美元,想融的钱大概在 500 亿美元。这个数字有多夸张?去年底它估值才刚过 600 亿,半年不到又跳了一大截。不过正文没披露具体是哪些投资人、有什么附加条款、以及什么时候能落定。这点先别太激动,...

推荐理由:这条消息我会先打个折——正文没披露投资方、条款和时间表,目前只是早期报价,离落地还有距离。但 9000 亿这个估值如果真成,会把 AI 实验室的资本门槛拉到新高度,Claude 的弹药库会直接膨胀。真正值得盯的是后续有没有主权基金或科技巨头接盘,而不是产品细节。

彭博科技

Anthropic 正考虑接受新一轮融资,估值超过 9000 亿美元

彭博社援引知情人士消息称,Anthropic 正在权衡新的融资要约,给出的估值锚定在 9000 亿美元以上。这个数字直接把它的身价拉到了和 OpenAI 一个量级。不过正文没披露这轮融资的具体金额、领投方和交割时间表,所以现在只能看到一个很高的估值信号,实际条款还不清楚。

推荐理由:我会先打个折,因为交易还没落地,细节全是空白。但 Bloomberg 扔出的这个 9000 亿+ 估值锚点太扎眼了,它直接把 Anthropic 架到了比 OpenAI 还贵的位置上,不管成不成,都会重新搅动市场对头部 AI 公司到底值多少钱的争论。正文没披露任何条款,这点先别太激动,但信号本身已经够强。

Hacker News 首页

Ramp 的表格 AI 会偷偷把财务数据传出去

安全公司 PromptArmor 发现 Ramp 的 Sheets AI 有个漏洞:攻击者可以在外部表格里藏一句白底白字的指令,诱导 AI 自动插入一个 IMAGE 公式,把用户表格里的敏感财务数据拼到攻击者网址后面发出去。整个过程不需要用户确认。Ramp 那边说已经在 2026 年 3 月 16 号修了。

推荐理由:HKR 三项全中:文章把一条 AI 表格工具的数据外泄路径讲得很清楚。给 82 分没上 85,是因为只有 PromptArmor 单方信源,而且实际受影响的数据规模正文没披露。

4月29日星期三

r/LocalLLaMA

DeepSeek V4 定价低到离谱,有人算完账开始怀疑自己的技术栈

Reddit 上有人算了笔账:DeepSeek V4-Pro 输入价格是每百万 token 0.145 美元,比 Claude Opus 4.7 便宜约 34 倍。五月有个促销直接砍到 0.036 美元,缓存命中更是只要 0.0036 美元,比 Opus 的缓存价低了约 173 倍。发帖人最在意的是 agent 循环跑起来的成本,但帖子没验证 100 ...

推荐理由:HKR 三项都踩中了:价格冲击力强、数字具体可算、对 agent 场景的成本压力点抓得准。但这是 Reddit 用户自己算的账,不是官方发布或生产环境实测,所以分数压在 77,不往上给。

TechCrunch · AI

Anthropic 拒绝五角大楼后,Google 签下新合同扩大军方 AI 使用权限

Anthropic 明确禁止自家 AI 被用于国内大规模监控和自主武器,五角大楼转头就找了 Google。Google 已经和美国国防部签了一份新合同,进一步开放 AI 的使用。不过正文没披露合同金额、具体用到哪些模型,也没说什么时候开始部署。

推荐理由:这条新闻的看点不在合同本身,而在两家公司面对军方订单时截然不同的选择。Anthropic 划了红线,Google 没划,从业者自然会追问:Google 的安全框架到底怎么界定军事用途?正文没披露合同金额、模型范围或部署时间,所以具体影响有多大还不好判断。我会先打个折,但话题性够强,放在 featured 里让读者自己掂量。

Hacker News 首页

Claude.ai 挂了,API 也报错增多

Anthropic 的状态页显示,Claude.ai 从 UTC 时间 17:34 到 18:52 无法访问,同时 API、Claude Code 等服务的认证错误也明显增多。官方说已经找到问题并在 18:59 左右确认各项成功率恢复正常,正在继续监控。至于具体是什么原因导致的,公告里没细说。

推荐理由:这条消息的钩子够直接:Claude.ai 不可用,不是功能降级。HN 讨论热度(139 分、105 条评论)说明不少人已经受影响,对靠 Claude 跑流程的团队来说,这是实打实的生产中断。但正文只给了状态页链接和讨论数据,故障到底多大范围、什么时候开始的、根因是什么、多久能恢复,全都没披露,所以信息量其实很薄。我会先打个折:这条值得推,但别指望能看出严重程度或恢复时间。

The Verge · AI

Claude 现在能直接操控 Photoshop、Blender 和 Ableton 了

Anthropic 给 Claude 装上了“创意连接器”,让它能直接读写 Adobe 全家桶、Affinity、Blender、Ableton 和 Autodesk 这些专业软件。以 Blender 为例,Claude 可以帮你排查 3D 场景哪里出了问题、写自定义工具,还能批量修改一堆物体的属性。另外,Anthropic 还给 Blender 基金...

推荐理由:HKR 三项都成立:Claude 进入主流创作软件是明确的跨工具钩子,连接器覆盖广且 Blender 端有具体操作能力,这件事踩中了 agent 进入专业工作流的神经。正文没提价格和完整上线地区,所以先别太激动,但方向本身值得关注。

4月28日星期二

X · @claudeai

Claude 现在能直接操作 Blender,在聊天窗口里改 3D 场景

Claude 上线了 Blender 连接器,你可以在对话里让它帮你排查场景问题、写新工具,或者批量修改所有物体。正文没提这个功能是免费还是付费、支持哪些版本,也没说清楚 Claude 在 Blender 里的操作权限边界——它能改到什么程度、会不会误删东西,这些都得等实测才知道。

推荐理由:HKR 三项都过:Claude 接 Blender 是 Agent 往专业工具里伸了一只真能干活的手,不是概念图。正文没提版本、定价和上线范围,所以重要性停在 76,够 featured 但不到必写。我会先打个折——没看到实际跑起来的延迟和权限边界,这点先别太激动。

Ben's Bites

GPT-5.5 来了,价格翻倍但号称省 token,Cursor 跟 SpaceX 搞了个大单

OpenAI 发了 GPT-5.5,比上一代贵了一倍,单 token 价格甚至略高于 Claude Opus 4.7。但他们说新模型 token 效率提升了 40%,所以实际跑一个任务的成本没怎么变,Ramp 的测试也印证了这点。Ben 自己用下来觉得模型在“思考:低”模式下又快又聪明,已经把它设成默认了。另外 Claude 的托管代理记忆功能开始公测...

推荐理由:这是一篇通讯汇总,不是一手发布,所以分数不会顶到 95 以上。但三条消息都够硬:GPT-5.5 的定价和效率数字能让人直接算账,Claude 记忆功能公测意味着外挂记忆开始进生产流程,Cursor 的收购选择权更是把编程工具的价值拉到一个新量级。我会先打个折,因为正文没展开技术细节,比如 40% 效率提升是在什么场景下测的、记忆功能有没有延迟数据,这些缺口让信息停留在“值得关注”而不是“可以立刻决策”的层面。整体对 AI 从业者来说,信息密度高、不水,给 89 分合理。

量子位 · 公众号

小米开源 MiMo-V2.5 系列模型,Pro 版 4 小时无人工干预搭出一个 macOS 桌面

小米把 MiMo-V2.5 系列的权重放出来了,包含 Pro Agent、多模态基座、TTS 和 ASR 几个模型。MiMo-V2.5-Pro 在 4.3 小时内连续调用了 672 次工具,在 SysY 基准上拿了满分 233 分,全程没让人接手,直接跑通了一个带 54 个应用的类 macOS 桌面。对从业者来说,值得关注的是它支持 100 万 tok...

推荐理由:HKR 三项全中:小米把 MiMo-V2.5 系列权重直接放出来,Agent 和代码任务的数字够具体,4 小时无接管跑出完整桌面是个强钩子。作为国产旗舰模型开源,属于当天必须写的那类消息。

The Verge · AI

AI 开始批量找漏洞,脚本小子要失业了?

The Verge 这篇讲的是 Claude 的一个安全测试版 Mythos 在 DARPA 的 AI 网络挑战赛里扫了 5400 万行代码。参赛队伍用它不仅找出了大部分预先埋好的漏洞,还额外揪出十几个没埋过的真实 bug。文章没提 Mythos 的跑分、收费方式和怎么申请试用,所以实际效果和成本还得观望。

推荐理由:这篇值得推,因为 DARPA 比赛的数据很实在——5400 万行代码扫下来,工具不仅认出了人工漏洞,还额外揪出十几个没埋的,说明 AI 挖洞确实能跑出意料之外的结果。标题的“脚本小子”说法虽然夸张,但把门槛降低这个风险讲透了。正文没给 Claude Mythos 的基准、价格或开放条件,所以没法判断它到底多强、多贵,这点先别太激动。整体信息量够上推荐位。

新智元 · 公众号

Claude 封了 110 人的公司账号,Cursor 里 9 秒删光生产数据库

一家 110 人的美国农业科技公司被 Anthropic 一口气封了所有 Claude 账号,但 API 扣费还在继续,申诉 36 小时没人理。另一边,PocketOS 的人说,在 Cursor 里用 Claude Opus 4.6 时,AI 在 9 秒内删掉了生产数据库和全量备份。问题出在权限控制上:没有基于角色的访问控制,没有环境隔离,也没有删除确...

推荐理由:HKR三项全中:事件钩子够尖锐,有具体数字和权限缺失细节,对AI从业者来说就是现成的风险清单。分数保持82,因为目前只有单方爆料,Anthropic还没出事后分析,事实全貌还不清楚。