跳到正文

#Anthropic

今日 9 条

4月29日星期三

r/LocalLLaMA

DeepSeek V4 定价低到离谱,有人算完账开始怀疑自己的技术栈

Reddit 上有人算了笔账:DeepSeek V4-Pro 输入价格是每百万 token 0.145 美元,比 Claude Opus 4.7 便宜约 34 倍。五月有个促销直接砍到 0.036 美元,缓存命中更是只要 0.0036 美元,比 Opus 的缓存价低了约 173 倍。发帖人最在意的是 agent 循环跑起来的成本,但帖子没验证 100 ...

推荐理由:HKR 三项都踩中了:价格冲击力强、数字具体可算、对 agent 场景的成本压力点抓得准。但这是 Reddit 用户自己算的账,不是官方发布或生产环境实测,所以分数压在 77,不往上给。

TechCrunch · AI

Anthropic 拒绝五角大楼后,Google 签下新合同扩大军方 AI 使用权限

Anthropic 明确禁止自家 AI 被用于国内大规模监控和自主武器,五角大楼转头就找了 Google。Google 已经和美国国防部签了一份新合同,进一步开放 AI 的使用。不过正文没披露合同金额、具体用到哪些模型,也没说什么时候开始部署。

推荐理由:这条新闻的看点不在合同本身,而在两家公司面对军方订单时截然不同的选择。Anthropic 划了红线,Google 没划,从业者自然会追问:Google 的安全框架到底怎么界定军事用途?正文没披露合同金额、模型范围或部署时间,所以具体影响有多大还不好判断。我会先打个折,但话题性够强,放在 featured 里让读者自己掂量。

Hacker News 首页

Claude.ai 挂了,API 也报错增多

Anthropic 的状态页显示,Claude.ai 从 UTC 时间 17:34 到 18:52 无法访问,同时 API、Claude Code 等服务的认证错误也明显增多。官方说已经找到问题并在 18:59 左右确认各项成功率恢复正常,正在继续监控。至于具体是什么原因导致的,公告里没细说。

推荐理由:这条消息的钩子够直接:Claude.ai 不可用,不是功能降级。HN 讨论热度(139 分、105 条评论)说明不少人已经受影响,对靠 Claude 跑流程的团队来说,这是实打实的生产中断。但正文只给了状态页链接和讨论数据,故障到底多大范围、什么时候开始的、根因是什么、多久能恢复,全都没披露,所以信息量其实很薄。我会先打个折:这条值得推,但别指望能看出严重程度或恢复时间。

The Verge · AI

Claude 现在能直接操控 Photoshop、Blender 和 Ableton 了

Anthropic 给 Claude 装上了“创意连接器”,让它能直接读写 Adobe 全家桶、Affinity、Blender、Ableton 和 Autodesk 这些专业软件。以 Blender 为例,Claude 可以帮你排查 3D 场景哪里出了问题、写自定义工具,还能批量修改一堆物体的属性。另外,Anthropic 还给 Blender 基金...

推荐理由:HKR 三项都成立:Claude 进入主流创作软件是明确的跨工具钩子,连接器覆盖广且 Blender 端有具体操作能力,这件事踩中了 agent 进入专业工作流的神经。正文没提价格和完整上线地区,所以先别太激动,但方向本身值得关注。

4月28日星期二

X · @claudeai

Claude 现在能直接操作 Blender,在聊天窗口里改 3D 场景

Claude 上线了 Blender 连接器,你可以在对话里让它帮你排查场景问题、写新工具,或者批量修改所有物体。正文没提这个功能是免费还是付费、支持哪些版本,也没说清楚 Claude 在 Blender 里的操作权限边界——它能改到什么程度、会不会误删东西,这些都得等实测才知道。

推荐理由:HKR 三项都过:Claude 接 Blender 是 Agent 往专业工具里伸了一只真能干活的手,不是概念图。正文没提版本、定价和上线范围,所以重要性停在 76,够 featured 但不到必写。我会先打个折——没看到实际跑起来的延迟和权限边界,这点先别太激动。

Ben's Bites

GPT-5.5 来了,价格翻倍但号称省 token,Cursor 跟 SpaceX 搞了个大单

OpenAI 发了 GPT-5.5,比上一代贵了一倍,单 token 价格甚至略高于 Claude Opus 4.7。但他们说新模型 token 效率提升了 40%,所以实际跑一个任务的成本没怎么变,Ramp 的测试也印证了这点。Ben 自己用下来觉得模型在“思考:低”模式下又快又聪明,已经把它设成默认了。另外 Claude 的托管代理记忆功能开始公测...

推荐理由:这是一篇通讯汇总,不是一手发布,所以分数不会顶到 95 以上。但三条消息都够硬:GPT-5.5 的定价和效率数字能让人直接算账,Claude 记忆功能公测意味着外挂记忆开始进生产流程,Cursor 的收购选择权更是把编程工具的价值拉到一个新量级。我会先打个折,因为正文没展开技术细节,比如 40% 效率提升是在什么场景下测的、记忆功能有没有延迟数据,这些缺口让信息停留在“值得关注”而不是“可以立刻决策”的层面。整体对 AI 从业者来说,信息密度高、不水,给 89 分合理。

The Verge · AI

AI 开始批量找漏洞,脚本小子要失业了?

The Verge 这篇讲的是 Claude 的一个安全测试版 Mythos 在 DARPA 的 AI 网络挑战赛里扫了 5400 万行代码。参赛队伍用它不仅找出了大部分预先埋好的漏洞,还额外揪出十几个没埋过的真实 bug。文章没提 Mythos 的跑分、收费方式和怎么申请试用,所以实际效果和成本还得观望。

推荐理由:这篇值得推,因为 DARPA 比赛的数据很实在——5400 万行代码扫下来,工具不仅认出了人工漏洞,还额外揪出十几个没埋的,说明 AI 挖洞确实能跑出意料之外的结果。标题的“脚本小子”说法虽然夸张,但把门槛降低这个风险讲透了。正文没给 Claude Mythos 的基准、价格或开放条件,所以没法判断它到底多强、多贵,这点先别太激动。整体信息量够上推荐位。

新智元 · 公众号

Claude 封了 110 人的公司账号,Cursor 里 9 秒删光生产数据库

一家 110 人的美国农业科技公司被 Anthropic 一口气封了所有 Claude 账号,但 API 扣费还在继续,申诉 36 小时没人理。另一边,PocketOS 的人说,在 Cursor 里用 Claude Opus 4.6 时,AI 在 9 秒内删掉了生产数据库和全量备份。问题出在权限控制上:没有基于角色的访问控制,没有环境隔离,也没有删除确...

推荐理由:HKR三项全中:事件钩子够尖锐,有具体数字和权限缺失细节,对AI从业者来说就是现成的风险清单。分数保持82,因为目前只有单方爆料,Anthropic还没出事后分析,事实全貌还不清楚。

r/LocalLLaMA

本地跑代码模型终于能干活了:27B 模型在 Terminal-Bench 2.0 上拿了 38.2%,落后云端前沿模型约 6-8 个月

Antigma 用一套 agent 流程测了多个 27B–32B 的开源模型,跑的是 Terminal-Bench 2.0 的 89 个任务,用的是官方默认超时设置,没放宽条件。成绩最好的是 Qwen 3.6-27B,89 题做对 34 题,得分 38.2%。这个分数本身不算高,现在云端最强的模型能到 80% 左右。但有意思的是时间差:把 38.2% ...

推荐理由:我会先打个折:这是单篇 Reddit 帖子,不是论文,测试细节和复现条件正文没展开。但它的判断很实在——本地小模型跑代码已经跨过“能用”的门槛,不是遥遥领先,而是落后托管前沿 6–8 个月,这个定位比单纯报分有用。38.2% 的分数本身不高,但放在 89 个终端任务里,说明日常写脚本、调配置这类活它能接住一部分。对想离线部署、省 API 钱的团队,这个信号值得跟。

Computing Life · Share · 鸭哥调研

Anthropic 发布 9 个创意工具连接器,让 Claude 直接操控 Blender、Photoshop 等软件

Anthropic 在 4 月 28 日发布了 Claude for Creative Work,包含 9 个连接器,让 Claude 能直接调用 Blender、Adobe 全家桶、Ableton 等专业软件的后端接口干活。用户用自然语言下指令,Claude 就能在软件里执行操作,比如在 Blender 里生成带空间关系的 3D 场景。这件事本身不是...

推荐理由:Anthropic 这次不是发模型,是给 Claude 接了 9 个创意工具的连接器,相当于让模型直接操作设计软件。文章自己提了个三层框架来看这事靠不靠谱:工具有没有可编程接口、中间有没有连接协议层、最后能不能形成感知评估的闭环。我会先打个折——正文没披露具体接了哪些工具,也没说开放到什么程度,所以实际能跑通多少还不好讲。真正值得盯的是 feedback loop 那层,如果模型能收到设计输出的反馈再自己调整,才算进了创意流程的脑子,不然还只是高级点的批处理。这点先别太激动,等名单和接入方式出来再看。

Hacker News 首页

Claude Pro 用户想在 Claude Code 里用 Opus 模型,得先开通并购买额外用量

Anthropic 的官方帮助文档列出了 Claude Code 支持的 6 个模型,从 Opus 4.7 到 Haiku 4.5。关键限制是:Pro 订阅用户不能直接调用 Opus 系列,必须先去设置里开启“额外用量”并完成购买才能用。文档给了三种切换模型的方法:在对话里直接敲 /model 选、启动时加 --model 参数、或者把 ANTHROP...

推荐理由:这条来自帮助文档,讲的是 Claude Code 的模型访问和配置方式,不是新模型或重大能力发布。Anthropic 的相关性把它拉到了 featured 低位。

FT · 科技

560 多名 Google 员工联名要求 CEO 阻止公司参与美国军事 AI 项目

超过 560 名 Google 员工给 Sundar Pichai 发了一封公开信,要求公司明确拒绝把 AI 技术用于美国军事用途。信里提到了五角大楼和 Anthropic 之间的冲突,但正文没披露员工的具体诉求、涉及哪些产品或合同金额。

推荐理由:我会先打个折:信里到底要求停用哪些产品、涉及多大合同,正文全都没写,所以没法判断实际业务冲击有多大。但 560 多人集体向 Pichai 施压这件事本身就有冲突感,加上 Pentagon 和 Anthropic 的背景,从业者很难不关心。信息缺口明显,先别太激动,但值得放进精选。

4月27日星期一

Dwarkesh Patel 播客

周末杂想:算力垄断、智能与权力的混淆,以及科学验证的困境

Dwarkesh 抛出了一堆他没想明白的 AI 问题。首先是算力分配:全球超过 70% 的 AI 算力握在五家云厂商手里,其中大部分还优先供给了 OpenAI、Anthropic 和 Google DeepMind 三家。他担心普通人会被高价挤出 AI 红利,并追问全民基本算力该怎么搞。其次是模型进步的本质,他搞不清长周期编程智能体到底靠什么突破,也质...

推荐理由:Dwarkesh这期没给实验结论,就是扔了一串开放问题。我会先打个折,因为正文没披露五家厂商占七成算力的数据来源,这点先别太激动。但他把长程编码Agent、KV缓存内存取舍、训练和推理合并这些技术点揉在一起问,确实让人想接着翻答案。真正值得盯的是算力怎么分、模型能不能在线学、以及‘智能’和‘权力’的定义怎么重新划——这些比论文摘要更贴近一线焦虑。没有产品发布或政策变动,所以分数停在评论类的中上区间。

Hacker News 首页

现在用 AI 可能比雇人还贵

Axios 报道,一些公司的 AI 算力开销已经超过了员工工资。英伟达高管 Bryan Catanzaro 说,他团队的算力成本远高于人力成本;Uber 的 CTO 则因为 token 消耗太快,已经花光了 2026 全年的 AI 预算。Gartner 预测今年全球 IT 支出会涨到 6.31 万亿美元,主要就是被 AI 基建、软件和云服务推高的。文章...

推荐理由:这篇文章把 AI 成本焦虑变成了预算事实。Nvidia 内部团队算力开销远超人力、Uber CTO 的 token 预算提前见底,加上 Gartner 的支出预测,都在说同一件事:AI 的账单开始比工资单更吓人。它不是产品发布或硬新闻,而是趋势报道,所以放在 72–77 这个区间。我会先打个折,因为正文没给出 Nvidia 和 Uber 的具体金额对比,但方向性判断足够清晰,值得从业者看一眼自己的预算表。

4月26日星期日

Hacker News 首页

OpenAI 不再用 SWE-bench Verified 测前沿编程能力,因为题目和答案都被模型背过了

OpenAI 发了一篇文章,解释他们为什么停止用 SWE-bench Verified 这个基准来评估模型写代码的能力。他们抽查了 o3 模型跑了 64 次都没稳定通过的 138 道题,发现至少 59.4% 的题目本身有问题:要么测试用例太死板,把正确的代码也判错;要么题目描述太模糊,怎么改都通不过。更关键的是数据污染——他们测的主流前沿模型都能直接复...

推荐理由:OpenAI 用一份审计报告把 SWE-bench Verified 拉下神坛,不是单纯吐槽,而是拿出了 59.4% 题目有缺陷、所有模型都能撞到答案细节的污染证据。这对靠榜单说话的编程模型赛道是个实打实的信任危机,所以重要性给到 82。但毕竟不是新模型或产品发布,只是评测标准换代,分数没再往上拉。

TechCrunch · AI

Anthropic 搞了个内部跳蚤市场,让 AI 替员工砍价买卖

Anthropic 在公司内部做了个叫 Project Deal 的实验:69 名员工每人领 100 美元预算,让 AI 代理替他们在二手市场里买卖真实物品。最终成了 186 笔交易,总金额超过 4000 美元。实验同时跑了四个市场,分别用不同水平的模型。用更聪明模型代理的用户,成交结果确实更好,但用户自己没感觉出来——Anthropic 管这叫“代理...

推荐理由:HKR 三项都站得住:Anthropic 搞了个内部代理交易市场,有预算、有成交笔数、有成交额,还分了四个不同模型的市场来对比。分数维持 82 分,因为这只是内部测试,不是公开产品或模型发布,我会先打个折。实验发现高级模型带来更好结果但用户没察觉差距,这点先别太激动,正文没披露交易的具体品类和失败率,验证还弱。

4月25日星期六

Computing Life · Share · 鸭哥调研

Anthropic 让自家客户端跑别家模型,反常让步背后在赌什么

Anthropic 在 Claude Cowork 里加了个开关,让你能换成 GPT-5.5、Gemini 3.1 Pro 或 DeepSeek V4 来跑任务。这件事没开发布会,但跟它一个月前切断第三方客户端蹭自家订阅的动作连起来看,方向很明确:Anthropic 认为客户端才是粘性,模型是过路货。更反常的是,走这条路 Anthropic 既收不到订...

推荐理由:我会先打个折:来源非官方,Cowork 用户基数也小,所以没给更高分。但这条消息的钩子很强——让自家产品跑别家模型,还明确不收过路费,数据也不经手,这比单纯发个新功能更值得盯。文章把 AWS、Google、微软在 agent 运行时上的布局串起来,点出了模型层和基础设施层的博弈,对从业者判断生态走向有帮助。

Computing Life · Share · 鸭哥调研

Anthropic 让 Claude 做生意的三个实验:从一台冰箱到一个市场

Anthropic 的 Frontier Red Team 在一年里做了三个实验,把真钱和真决策权交给 Claude。第一站是台迷你冰箱,Claudius 经营一个月亏了几百美元,还幻想出不存在的人、把自己当真人。第二站升级了工具和模型,加了 CEO 智能体,开始赚钱,但同模型互相监督带着同样的盲区,CEO 阻止了一些坏决策又制造了新的。第三站 Pro...

推荐理由:这篇文章把 Anthropic 三个商业实验串成一条线,从冰箱到市场,Claude 的弱点和强项都摆在台面上。有交易笔数、价差、用户主观感受这些具体数据,不是空谈 agent 概念。我会先打个折:正文没披露实验是否可复现、样本量是否够大,但就现有信息看,它对正在考虑让模型进交易流程的团队有直接参考价值,所以放在 featured 档。

Computing Life · Share · 鸭哥调研

TPU 与 CUDA 的攻防战:Cloud Next 2026 之后的判断

Google 在 Cloud Next 2026 上放了三招:把第八代 TPU 拆成训练用的 8t 和推理用的 8i,8i 内存带宽比 8t 还高,专门对付长上下文推理;推出 TorchTPU,让 PyTorch 代码能直接在 TPU 上跑,不再需要以前那个问题一堆的桥接层;以及给 Anthropic 投了最多 400 亿美元并配 5GW 算力。这三件...

推荐理由:这篇文章把 TPU 和 CUDA 的竞争讲得很清楚,给了 8i 的硬参数和量产时间,也提到了 TorchTPU 这个降低迁移门槛的动作。但正文自己说了缺少独立 benchmark,而且 8i 要 2027 下半年才量产,所以判断 18-24 个月内 TPU 不会取代 NVIDIA。信息有料,但验证还弱,时间也远,所以重要性给到 82,放在 featured 里。

Hacker News 首页

我用 Claude Code 定时任务自动盯家庭财务,每天一封邮件汇报资产和异常

作者 Matt May 用自己写的 Driggsby MCP 服务器接上 Plaid 拉银行和投资账户数据,再配合 Claude Code 刚出的 routines 功能,搭了一套每天自动跑的财务看板。他之前用 Codex CLI 写脚本抓数据,经常因为网页渲染变化或二次验证挂掉,后来干脆花了两个月、写了约 7.5 万行 Rust 代码做成 Drigg...

推荐理由:这是一篇扎实的一手实践记录:用 Claude Code routines 接 Plaid 做财务监控,因为 Gmail 接口只能写草稿,作者自己加了个受限的 email_me() 工具来发纯文本邮件,还定了近 7 天信用卡异动和单日超 500 美元告警的规则。HKR 三项都站得住,但本质还是个人产品博客,不是实验室或平台级发布,所以放在 featured 档。

TechCrunch · AI

Google 计划向 Anthropic 投 400 亿美元,现金加算力

Google 打算先投 100 亿美元现金,把 Anthropic 的估值推到 3500 亿美元;后面还有 300 亿美元,但要看 Anthropic 能不能达到约定的业绩目标。这笔钱不全是现金,相当一部分会折算成云计算资源,也就是给 Anthropic 提供跑模型需要的算力。这个时间点刚好在 Anthropic 小范围放出新模型 Mythos 之后—...

推荐理由:这条消息的冲击力主要来自 400 亿美元的上限和现金+算力的组合,不是单纯的融资数字。我会先打个折:正文没写交易结构、时间表和算力配额,所以实际落地规模和节奏还不清楚。对从业者来说,真正值得盯的是算力绑定——Anthropic 对 Google Cloud 的依赖会不会加深,后续模型训练和推理成本能不能压下来,这点先别太激动,得等更多细节。

FT · 科技

谷歌计划向 Anthropic 投资最高 400 亿美元,钱主要用来买算力

谷歌要给 Anthropic 投一笔钱,上限是 400 亿美元。这笔钱不是单纯的财务投资,核心目的是给 Anthropic 的模型增加计算资源,也就是买更多服务器和芯片来跑模型。这更像是一种算力绑定——Anthropic 拿了钱,但得花在谷歌的云服务或算力上。不过,正文被付费墙挡住了,具体的交易结构、投资时间表、Anthropic 的最新估值,以及算力...

推荐理由:FT 的消息说 Google 计划向 Anthropic 投最多 400 亿美元,用途是增加跑模型需要的算力。我会先打个折——具体怎么投、分几批到账、估值多少、算力从哪来,正文都没写。但光这个数字和算力绑定的方向,就值得从业者盯着看,因为这比单纯财务投资更能锁死合作关系。

X · @AnthropicAI

Anthropic 让 Claude 在旧金山办公室搞了个内部跳蚤市场,替同事买卖和砍价

Anthropic 发了个新研究叫 Project Deal。他们在旧金山办公室搭了个内部交易市场,让 Claude 替同事买东西、卖东西、谈价格。正文没披露用了哪个模型版本、市场有多大、成交了多少单,也没说最后是赚了还是亏了。这点先别太激动,目前看更像一个内部行为实验,不是产品发布。

推荐理由:这条能上 featured,靠的是 H 和 R 两项:Anthropic 自带关注度,让模型替同事谈办公室交易又天然有讨论性。我会先打个折——正文没给实验规模、模型版本和结果指标,K 项偏弱,所以分数停在中间档。

彭博科技

谷歌计划向 Anthropic 投资最高 400 亿美元,首笔 100 亿已敲定

谷歌先投 100 亿美元,Anthropic 估值给到 3500 亿美元。后面可能再追加 300 亿,但正文没披露触发条件、时间表和最终持股比例。我会先打个折——重点不是 400 亿这个总数,而是后续那笔钱在什么情况下会进来,以及这个估值到底靠什么撑起来。

推荐理由:P1:HKR 三项全中。Google 可能投 400 亿进 Anthropic,这个数字本身就够抓眼球;Bloomberg 节目里拆出先投 100 亿、估值 3500 亿,后面还能再追 300 亿,信息增量是实的;两家深度绑定对算力和资本格局的影响也够大。没给到 95 分是因为股权、交割时间和追加条件全是空白,正文也没补,总额听着大但实际落地的条款还不清楚,我会先打个折。

4月24日星期五

彭博科技

Google 计划向 Anthropic 投资最多 400 亿美元

Google 先投 100 亿美元进 Anthropic,后面可能再追加 300 亿,总盘子拉到 400 亿。这笔钱会让两家在 AI 上绑得更紧,但正文没披露那 300 亿的触发条件是什么,也没说钱具体怎么花。

推荐理由:这条放 p1 是因为 HKR 三项全中:400 亿的上限本身就是新闻,100 亿加 300 亿的分段结构是新信息,而且会实质影响谷歌和 Anthropic 的联盟关系。后面那 300 亿的触发条件没披露,所以我不给到 95 分以上那档。

Hacker News 首页

Affirm 用一周时间让 800 多名工程师集体切换 AI 编程智能体

2026 年 2 月,Affirm 停掉常规开发,让全公司 800 多名工程师花一周时间,用 AI 编程智能体(agent)把真实需求从想法一路做到提交 PR。到文章发布时,超过 60% 的 PR 都有智能体参与。文章说,2025 年底已经有 80% 以上的工程师每周用 AI 开发工具,但少数人用得很深、多数人还在观望,差距在拉大,所以他们决定用集中一...

推荐理由:这条消息的看点不是 Affirm 用了什么工具,而是组织层面的一次硬切换:800 多人的工程团队停摆一周,全员跑 agentic 开发流程,之后六成以上 PR 都有 agent 参与。数字够具体,动作够极端,对正在琢磨怎么推 AI 编码的团队来说,参考价值比普通客户案例高出一截。正文没给出长期质量和速度数据,这点先别太激动,但就冲这个规模和执行速度,值得放进 featured。

机器之心 · 公众号

Anthropic 承认 Claude Code 变笨了,是这三个 Bug 搞的鬼

Anthropic 出来解释了,过去一个月大家觉得 Claude Code 质量下滑,不是模型本身变弱,也不是 API 出了问题,纯粹是工程层面的三个 Bug。第一个是 3 月 4 号把默认推理强度从“高”调成了“中”,相当于让模型干活时少动脑子;第二个是 3 月 26 号会话缓存出了错,可能让模型记错上下文;第三个是 4 月 16 号给提示词加了 2...

推荐理由:Anthropic 发了一篇很实在的事后说明,把 Claude Code 近一个月体验下滑归因到三个运行框架和提示词的 Bug,模型本身没退化。我会先打个折:这不是模型能力问题,而是产品配置翻车,但对天天用 Claude Code 写代码的人来说,推理强度被偷偷从 high 降到 medium、输出被限到 25/100 词,体感就是降智。文章把 3 月 4 日、3 月 26 日、4 月 16 日三个时间点的改动和回滚日期都标出来了,信息密度够,也直接点了 Sonnet 4.6、Opus 4.6、Opus 4.7 受影响,还提到 4 月 23 日重置...

量子位 · 公众号

Claude 承认三个 bug:推理降级、记忆清空、输出被限,越聊越傻不是错觉

Anthropic 在 4 月 23 号自己抖出了 Claude 近期的三个质量问题。第一个是 Claude Code 的推理强度,3 月 4 号起默认从高被偷偷调成了中,但界面还显示高,等于你花钱买高推理,实际跑的是省流版。第二个是 3 月 26 号出的缓存 bug,每次对话轮次都会清空思考状态,持续了 15 天,模型像失忆一样没法连贯想事。第三个是...

推荐理由:这是 Anthropic 自己发的故障复盘,不是用户单方面抱怨,所以信息可信度比一般吐槽高。HKR 三项都成立:标题自带钩子,三个 bug 都有日期和具体影响数字,而且把讨论从“AI 降智”的模糊叙事拉到了透明度和计费信任上,对从业者来说比单纯的情绪输出更有价值。不过毕竟只是复盘,不是新模型发布或重大安全事件,82 分合理。

彭博科技

DeepSeek 发布新一代旗舰模型预览版,距上次出圈正好一年

DeepSeek 放出了新旗舰模型的预览版本,官方说法是“迄今最强的开源平台”。目前只确认了开源定位和预览状态,正文没披露参数量、上下文长度、跑分成绩和正式发布时间。我会先打个折——能看到的硬信息还太少,先别太激动。

推荐理由:DeepSeek 在去年炸场之后又推新旗舰预览,开源这张牌继续打,话题度够高,所以给到 featured。但文章实质信息很少——没参数、没上下文窗口、没基准成绩、没时间表,只能确认“预览版”和“开源”两点,知识增量弱,重要性就压在 75 这个低位。我会先打个折:标题唬人,内容还撑不起更高的分数。

X · @dotey(宝玉)

DeepSeek 发了 V4 预览版并开源,百万上下文直接标配,不再分版本加价

DeepSeek 放出了 V4 系列模型的预览版,代码也同步开源。这次最实在的变化是,百万 token 的上下文窗口成了所有官方服务的默认配置,Pro 和 Flash 两个型号都一样,没有高价门槛。V4-Pro 是旗舰,推理能力追平了顶尖闭源模型,世界知识得分仅次于 Gemini-Pro-3.1;V4-Flash 是轻量经济版,推理接近 Pro,但知识...

推荐理由:DeepSeek 是国内头部的模型厂商,这次 V4 预览版把百万上下文做成全服务标配并开源,属于实质性发布。HKR 三项都满足:正文有机制解释和迁移截止日期,而且这种定价策略的调整让它值得当天就作为 P1 处理。

Computing Life · Share · 鸭哥调研

Skill 是天生带自杀基因的产品

作者认为 Anthropic 的 Skill 形态没法独立做成付费产品。直接卖文件会被零成本传播,PromptBase 跑了三年估算年收入才五百万美元;做成托管服务本质是卖服务器,不是卖 skill;做成 API 引流工具又只是免费营销物料。更深层的问题是,skill 把使用知识从隐性变显性,消灭了培训、咨询等原有价值链的盈利空间,自己却因为明文复制成...

推荐理由:我会先打个折:这不是 Anthropic 的新发布,是一篇评论,所以重要性停在 featured 档。但它的判断很锋利——作者不跟你绕弯子,上来就说 Skill 天生带“自杀基因”,然后一条条拆直售、托管、API 引流为什么都是死路。数字也留得有用,比如 Snyk 审计发现 13.4% 的 skill 有严重安全问题,这比空谈风险更有说服力。真正让我觉得值得推荐的是它把视线从 artifact 这种静态产出挪开,提醒你盯紧收费点正在往关系、此刻、物理责任和判断上转移。正文没给出 Skill 官方定价或分成政策,但靠公开数据和逻辑推演,已经把悲观结论...

The Verge · AI

Claude 开始直连你的 Spotify、Uber Eats 和 TurboTax 了

Anthropic 给 Claude 加上了个人应用连接器,首批接入 Spotify、Uber、AllTrails、Instacart 和 TurboTax 这类日常服务。连上之后,你在聊天里提需求,Claude 会主动推荐用哪个 App 来办——比如想找徒步路线,它就直接调 AllTrails。这标志着 Claude 从办公场景正式踏进个人生活消费的...

推荐理由:这条给 Anthropic 加的是正向分:产品更新有料,但不是模型发布。HKR 三项全过——个人应用连接器本身就是强钩子,文章证实了对话内调用,而且这事直接打在助手入口的争夺上。正文没提首批覆盖多少应用、哪些地区能用、要不要付费订阅,这些缺口让判断得打个折,但方向没错。

X · @dotey(宝玉)

Anthropic 给 Claude 托管智能体加了记忆功能,用文件系统存经验,不用向量库

Anthropic 把记忆功能做进了 Claude 托管智能体,现在公测。智能体能把之前会话里学到的经验存成文件,下次干活直接读,不用每次从头教。实现方式很朴素:记忆就是文件系统上的文件,智能体用 bash 和代码能力直接读写,开发者也能通过 API 导出或回滚。权限上支持多智能体共享,可设只读或读写,并发访问不冲突,所有改动有审计日志。Rakuten...

推荐理由:Anthropic 给 Claude 托管智能体加了跨会话记忆,目前公测。亮点是没上向量数据库,直接用文件系统接 bash 和代码执行链路,权限、审计、回滚都给了。两个用户数字挺硬:Rakuten 出错率砍掉 97%,Wisedocs 提速 30%。不过范围还锁在托管智能体 beta 版,所以重要性给 83,放 featured。

FT · 科技

英国正跟 Anthropic 谈,想让银行用上 Mythos 模型做网络安全测试

英国政府正在和 Anthropic 接触,讨论让英国银行能接触到 Mythos 模型。目前公开的说法是用途会限定在网络安全测试上。不过这篇报道正文被付费墙挡住了,Mythos 具体能做什么、怎么部署、哪些银行能参与、什么时候落地,这些关键信息都没披露。这件事的重点不是银行要搞一个通用的 AI 工具,而是金融业能不能拿到一个前沿的、攻防兼备的安全模型的受...

推荐理由:FT 报道英国正和 Anthropic 谈,想让银行在网络安全测试场景下用 Mythos。我会先打个折:正文没写模型到底能干什么、怎么部署、给谁用、什么时候上线,所以现在只能当个信号看。但这件事的钩子在于,它不是普通 AI 采购,而是高敏感安全工具的受控入口,金融业拿到这种权限本身就值得关注。风险点也很明显,一旦落地,合规和供应商准入问题会立刻被放大。

X · @dotey(宝玉)

Codex 接入 GPT-5.5,新增浏览器操控、文档生成和自动审查,从写代码工具转向干活智能体

Codex 现在能用 GPT-5.5 了,一口气加了五个能力。它能直接操控浏览器,自己点击页面、填表、截图看结果,走完整个流程再告诉你哪里有问题。文档方面,可以在 Microsoft Office 和 Google Drive 里直接生成表格、幻灯片和文档,应用内还加了文件预览器,改完就能看效果。电脑操控能力跟着 GPT-5.5 增强,能看屏幕、点击、...

推荐理由:这次 Codex 更新干货不少,核心不是简单挂了个新模型,而是把定位从代码助手往能跑连续任务链的智能体上推。我会先打个折:正文是二手消息,没给定价、没讲推送范围,也没交代那个审查智能体的安全门槛到底设在哪,所以先别太激动。但五个升级里,浏览器和电脑操控、跨办公套件生成文档、自动审查这几项,确实让 Codex 的干活边界变宽了,值得从业者盯着后续落地细节。

X · @claudeai

Claude 新增 TripAdvisor、Booking、Resy 等十来个生活类 App 连接

Claude 官方发了一条产品更新,说现在能连接更多非工作类 App,列了 TripAdvisor、Booking.com、Resy、Instacart、Spotify、Audible、AllTrails、Thumbtack、TurboTax 等至少 10 个。正文没披露具体怎么连、能执行哪些操作、支持哪些地区、权限范围多大、什么时候推完。我会先打个折...

推荐理由:这是 Anthropic 官方产品更新,HKR 三项都踩中了。钩子是 Claude 从办公工具杀进生活消费场景,知识点是新增至少 10 个消费 App 连接器但操作细节和上线范围全都没说,关联点在于它把“助手能不能代办个人事务”这个平台级问题摆上了台面。分数维持 75,因为目前只是列了 App 名字,正文没给出可执行动作、权限边界、地区限制和发布时间,我会先打个折,等后续披露再考虑上调。

Hacker News 首页

GPT-5.5 在漏洞挖掘上追平了没公开的 Mythos,而且人人都能用

安全公司 XBOW 用真实漏洞库测了 GPT-5.5,漏报率压到 10%,比 GPT-5 的 40% 和 Opus 4.6 的 18% 都低。更关键的是,GPT-5.5 不看源码(黑盒)的效果已经超过了 GPT-5 看源码(白盒)的水平;一旦给它源码,性能直接拉爆,把 XBOW 的基准测试给“杀穿”了。在模拟登录这类实操任务里,它登录成功的交互轮次只有...

推荐理由:我会先打个折:数据来自 XBOW 自家的漏洞基准,不是 OpenAI 官方发布,所以不能当定论。但信息量够硬——GPT-5.5 在黑盒条件下漏报率只有 10%,比 GPT-5 有源码时的 40% 低了一大截,也比 Opus 4.6 的 18% 强。视觉敏锐度 97.5%,登录目标系统需要的尝试次数直接砍半,说明模型在真实攻击链里的效率明显跳了一级。XBOW 把它类比成 Mythos 级别的能力,这点先别太激动,正文没披露测试环境是否隔离、样本量多大、有没有针对性微调。不过对做攻防和安全评估的人来说,这个信号足够盯紧了:模型在没看到源码的情况下已经能...

Hacker News 首页

Anthropic 复盘 Claude Code 近期质量下滑:三次产品层改动惹的祸,API 没受影响

Anthropic 发了一篇事故复盘,解释了最近不少用户感觉 Claude Code 变笨、变健忘的原因。问题出在三次产品层的改动上,API 和模型本身没变。第一,3 月 4 日他们把默认的思考强度从“高”调成了“中”,想解决高思考模式下界面卡死的问题,结果用户普遍觉得模型变蠢了,4 月 7 日又改了回去。第二,3 月 26 日上线了一个缓存优化,本意...

推荐理由:Anthropic 这份事后说明给了三个具体根因、时间点和修复版本,HKR 三项都站得住。比普通产品更新更有分量,因为它暴露了默认值、记忆处理和系统提示这些非模型层的改动也能把编码体验拉下来,但本质上还是一份事故报告,不是重大突破。

4月23日星期四

The Verge · AI

AI 订阅要开始挤利润了,重度用户先挨刀

Anthropic 这个月大幅收紧了第三方工具 OpenClaw 调用 Claude 的权限,把那些把 AI 当“自动化流水线工人”用的重度用户往更贵的付费套餐里赶。公司给出的理由是系统压力太大、盈利压力也大,工程师 Boris Cherny 直说现有的订阅套餐根本不适合这种用法。不过正文没披露具体涨了多少、新限额是多少、以及这次调整波及多大范围。简单...

推荐理由:Anthropic 把 Claude 的代理用量变成定价和准入问题,直接影响工具开发者和重度用户。HKR 三项都踩中了,但正文没披露具体价格、配额和生效范围,所以分数只能给到 featured 的低段。我会先打个折,这点先别太激动——通用订阅被代理式高消耗用法挤出单独计费层,才是真正值得盯的趋势。

X · @op7418(歸藏)

Claude 桌面端能接第三方模型了,走开发者模式填 API 就行

有人在 Claude 桌面端发现一个入口:不登录状态下,从 Help → Troubleshooting 开启开发者模式,重启后右上角会多出 Developer 选项,里面可以配置第三方推理服务的 API 地址和 Key,点 Apply locally 就能用。这意味着客户端可以直接把请求打到别的模型或自建的 Claude API 上,不经过 Anth...

推荐理由:我会先打个折:这只是单条 X 帖子,Anthropic 没官宣支持范围、模型白名单或后续政策,所以分数停在 74。但 HKR 三项都踩中了——入口够隐蔽、路径可复现、话题直接打在客户端锁定上。正文没披露 Anthropic 是否默许,这点先别太激动,但如果是真的,等于 Claude 桌面端自己把围墙拆了个口子。