跳到正文

#产品更新

今日 25 条

4月28日星期二

Hacker News 首页

Claude Pro 用户想在 Claude Code 里用 Opus 模型,得先开通并购买额外用量

Anthropic 的官方帮助文档列出了 Claude Code 支持的 6 个模型,从 Opus 4.7 到 Haiku 4.5。关键限制是:Pro 订阅用户不能直接调用 Opus 系列,必须先去设置里开启“额外用量”并完成购买才能用。文档给了三种切换模型的方法:在对话里直接敲 /model 选、启动时加 --model 参数、或者把 ANTHROP...

推荐理由:这条来自帮助文档,讲的是 Claude Code 的模型访问和配置方式,不是新模型或重大能力发布。Anthropic 的相关性把它拉到了 featured 低位。

X · @dotey(宝玉)

GitHub Copilot 6 月 1 日起改按用量计费,重度用户账单会变不确定

GitHub Copilot 从 6 月 1 日起取消“高级请求次数”,换成 AI 积分(AI Credits),按输入、输出和缓存的 Token 消耗来扣费。各档订阅价格没变,Pro 每月给 10 美元积分,Pro+ 给 39 美元,但积分花完就没了,不再像以前那样能降级到便宜模型继续用。代码补全和“下一步编辑建议”这类基础功能不消耗积分。企业用户 ...

推荐理由:这条消息对用 Copilot 写代码的人影响很直接:订阅价没涨,但计费逻辑从包月变成了按 Token 消耗扣积分。Pro 每月给 10 美元额度,Pro+ 给 39 美元,超出部分怎么收费正文没写,这是个信息缺口。最该盯的是 Copilot Agent 跑长任务的消耗——这类任务 Token 用量大,账单可能跳涨,但具体费率还没公布,先别急着算账。整体判断挂在成本变化和缺失的费率信息上,分数维持 80 合理。

X · @dotey(宝玉)

Cursor 3 用户反馈:别光顾着炫,先把 Agent 和 IDE 无缝焊在一起

Eric Zakariasson 的 Cursor 3 反馈帖收到 431 条回复,核心诉求不是更花哨的界面,而是一个稳定可靠的 AI 开发工作台。用户最强烈的意见是:Agent Window 不能牺牲 IDE 基本能力,进去之后 LSP、调试、终端、diff 操作经常要切回旧界面,理想状态是 Agent 推进工作,人随时能无缝接管。多 Agent 和...

推荐理由:三条都过:431 条回复量够大,需求提得具体,而且正好打在开发者对 AI 工作台的焦虑点上。放在 featured 低段是因为这是用户反馈汇总,不是 Cursor 官方发布或路线图,信息增量有但权威性打折。

Hacker News 首页

GitHub Copilot 要从固定月费改成按用量计费了

GitHub 在 2026 年 4 月 27 日发了篇博文,标题就是 Copilot 要转向按用量计费。但正文只抓到了标题、发布时间和一堆导航栏,具体怎么个“按用量”法——比如按什么指标算钱、单价多少、有没有免费额度、超额怎么收费——全都没披露。所以现在只能知道计费模式要变,细节一概不清楚,先别急着算账。

推荐理由:Copilot 改按量计费,对用它的团队来说,账单结构变了,得重新算账。我会先打个折——正文只给了标题和时间,没写什么时候生效、按什么单位算钱、单价多少、超额怎么收,这些才是采购真正要盯的。所以这条消息的钩子在于提醒大家盯用量口径,而不是现在就能做决策。

4月27日星期一

Mistral AI

Mistral AI 发布 Workflows 公开预览版

Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工介入审批能力,ASML、ABANCA、CMA-CGM 等客户已用于自动化关键流程。

推荐理由:原文给出 Workflows 的编排能力、部署模型与客户案例,可据此判断企业级 AI 流程落地的工程门槛。

新智元 · 公众号

奥特曼喊完“红色警戒”五个月,GPT Image 2 在图像竞技场三项登顶,把谷歌甩开一大截

GPT Image 2 上线不到半天就在 Arena 图像榜拿了三个第一。文生图得分 1512,比第二名 Nano Banana 2 高出 241 分,Arena 说这是图像榜有史以来最大分差。盲测胜率 93%,文字渲染能力一口气涨了 316 分。核心变化是模型会“先想再画”:先规划构图、自己检查结果、能联网搜图,还能一次出 8 张风格统一的图。不过正...

推荐理由:GPT Image 2一上线就屠榜,分数和胜率都摆在那,1512分、93%盲测胜率、文字渲染涨316分,这些数字说明它确实把文生图拉到了新高度。我会先打个折:原生思考图像模型听起来很猛,但正文没披露具体架构和成本,这点先别太激动。不过一次生成8张连贯图、能联网搜图再画,对做设计和内容的人很实用。整体是近期多模态产品里最硬的一次更新,值得从业者盯一下。

量子位 · 公众号

DeepSeek V4 永久降价,缓存命中再打一折,实测编程成本降了 83%

DeepSeek V4 两天内连续降价,输入和输出价格直接砍掉 75%,缓存命中的输入还能再打一折。量子位的编程实测里,处理 3500 万 token 的成本从 31.73 元掉到 5.34 元,降了 83%。这个价格对缓存命中率高的场景最划算,V4-Pro 的缓存命中率大概在 95% 到 96%。

推荐理由:HKR三项都站得住:降价幅度和两次调价节奏有话题性,实测数据让便宜可验证,成本敏感型从业者会立刻对标自己的用量。不过它本质还是定价更新,不是新模型发布,所以分数没往上拉。

量子位 · 公众号

Meshy 用户破千万后开始做 3D 打印实物,ARR 一年翻了 14 倍

Meshy 的注册用户超过一千万,ARR(年经常性收入)做到 4000 万美元,2025 年收入同比翻了 14 倍。他们新推的 Meshy Creative Lab 能直接生成钥匙扣、冰箱贴、键帽这类小物件的 3D 模型,但正文没披露实物下单功能是否已上线。一个值得留意的数据是:他们测了 75 个模型,在拓竹切片软件里的切片通过率达到 97%,说明模型...

推荐理由:Meshy 这次更新不是画饼,是拿钱和打印通过率说话。我会先打个折:实物订购还没上线,正文只说“进入倒计时”,这点先别太激动。但 97% 的切片通过率对 3D 打印玩家是实打实的省事信号,说明模型不是只能看,真能打。ARR 年翻 14 倍也侧面印证头部厂商已经在买单,不是靠免费用户撑场面。整体是垂直 3D AI 产品的一次公司自曝数据更新,信息量够,但没到行业地震级别,放在 featured 低位合理。

Hacker News 首页

Chrome 内置 Prompt API:在浏览器里直接跑大模型

Chrome 给开发者提供了一个 Prompt API,让网页可以直接调用浏览器内置的 AI 模型来生成文本,不用把数据发到云端。这个 API 还支持会话管理(保持多轮对话上下文)和结构化输出(让模型按固定格式返回结果,方便程序解析)。文档里没写具体用的是什么模型、上下文窗口多大、收费不收费,也没提什么时候能正式上线。目前看起来还在早期试验阶段,适合想...

推荐理由:Chrome 把 AI 塞进浏览器里,网页调个 API 就能用,这个入口变化挺大。会话管理和结构化输出两份配套文档让方案看起来不是空壳,但正文没提模型规格、上下文窗口多大、要不要付费、什么时候正式上线,所以我会先打个折,放在 featured 里偏低的位置。

机器之心 · 公众号

Meshy 6 发布,这家靠 99 行代码复刻冰雪奇缘起家的公司,现在在欧美 3D AI 市场占了六成份额

Meshy AI 发了 Meshy 6,正文没披露具体技术细节。公司说自己在欧美发达市场占有率超过 60%,三年积累了 1000 万用户、年经常性收入超 4000 万美元,用 AI 生成了 1 亿多个 3D 模型。37 互娱用下来,基础雕刻工作量少了 30% 到 40%,说明工具确实能嵌进美术管线里省人力。不过文章因为环境异常没加载出完整内容,产品实际...

推荐理由:我会先打个折:欧美市场份额超60%是公司自己说的,正文没给第三方数据或基准测试,这点先别太激动。但 Meshy 6 的看点不在那个份额,而在三七互娱给出的30%到40%雕刻工作量减少,这是实打实的生产环节反馈。1000万用户和4000万美元 ARR 说明商业化跑起来了,对做 3D AI 工具的人有参考价值。整体信息量够,但缺独立验证,所以放在 featured 低段。

4月26日星期日

Hacker News 首页

DeepSeek-V4 发布当天,SGLang 和 Miles 就接好了推理和 RL 训练

SGLang 和 Miles 团队在 DeepSeek-V4 发布当天就完成了推理和强化学习训练的适配,覆盖了 1.6T 参数的 Pro 版和 284B 参数的 Flash 版。V4 模型用了混合稀疏注意力,把滑动窗口和两种 KV 压缩(4:1 或 128:1)混在一起,撑住了 100 万 token 的上下文窗口,专家权重还用了 FP4 精度。系统上...

推荐理由:我会先打个折:这篇不是给所有人看的,系统细节多,普通读者容易走神。但它的钩子够硬——V4 发布当天就有推理加验证 RL 的工程栈,而且把上下文长度、压缩比、注意力窗口这些直接影响成本和稳定性的数字都摊开了。ShadowRadix 那部分虽然正文没展开实现细节,但点出了多池一致性这个真正难啃的骨头,对做部署和调优的人比单纯跑分更有参考价值。

4月25日星期六

Computing Life · Share · 鸭哥调研

Anthropic 让自家客户端跑别家模型,反常让步背后在赌什么

Anthropic 在 Claude Cowork 里加了个开关,让你能换成 GPT-5.5、Gemini 3.1 Pro 或 DeepSeek V4 来跑任务。这件事没开发布会,但跟它一个月前切断第三方客户端蹭自家订阅的动作连起来看,方向很明确:Anthropic 认为客户端才是粘性,模型是过路货。更反常的是,走这条路 Anthropic 既收不到订...

推荐理由:我会先打个折:来源非官方,Cowork 用户基数也小,所以没给更高分。但这条消息的钩子很强——让自家产品跑别家模型,还明确不收过路费,数据也不经手,这比单纯发个新功能更值得盯。文章把 AWS、Google、微软在 agent 运行时上的布局串起来,点出了模型层和基础设施层的博弈,对从业者判断生态走向有帮助。

Computing Life · Share · 鸭哥调研

TPU 与 CUDA 的攻防战:Cloud Next 2026 之后的判断

Google 在 Cloud Next 2026 上放了三招:把第八代 TPU 拆成训练用的 8t 和推理用的 8i,8i 内存带宽比 8t 还高,专门对付长上下文推理;推出 TorchTPU,让 PyTorch 代码能直接在 TPU 上跑,不再需要以前那个问题一堆的桥接层;以及给 Anthropic 投了最多 400 亿美元并配 5GW 算力。这三件...

推荐理由:这篇文章把 TPU 和 CUDA 的竞争讲得很清楚,给了 8i 的硬参数和量产时间,也提到了 TorchTPU 这个降低迁移门槛的动作。但正文自己说了缺少独立 benchmark,而且 8i 要 2027 下半年才量产,所以判断 18-24 个月内 TPU 不会取代 NVIDIA。信息有料,但验证还弱,时间也远,所以重要性给到 82,放在 featured 里。

X · @dotey(宝玉)

Cursor 3 加了 /multitask,能让多个子智能体同时干活,不用排队等

Cursor 3 新出的 /multitask 命令,可以同时跑好几个异步子智能体,不用像以前那样一个任务做完才能开始下一个。已经在排队里的任务也能随时切成并行模式。帖子没提同时能跑几个、吃多少资源、一个崩了会不会带崩其他的。

推荐理由:这次更新解决的是 Cursor 里一个挺烦人的瓶颈——以前子任务只能串行,现在能并行跑了,排队中的任务也能随时切模式。我会先打个折:正文没披露并发上限、资源占用和失败回退机制,所以实际能并行多少个、会不会吃满内存、一个子任务崩了怎么收场,都还不知道。但光是把串行改并行这一点,对日常编码吞吐的提升就够实在,所以放在 featured 低位。

Hacker News 首页

Google 上线 Flow Music,用 Lyria 3 做歌、Veo 生成 MV

Google 悄悄上线了 Flow Music 网页版,目前有歌曲、歌单、空间、视频、项目和 Turntable 六个板块。核心功能是跟一个叫 Producer 的对话式工具聊天做歌,官方说它背后是 Lyria 3 模型,能生成带人声的完整歌曲;AI 音乐视频部分接的是 Veo 模型,可以自己控制角色和画面风格。页面还展示了一些示例曲目和可交互的迷你乐...

推荐理由:我会先打个折:正文没披露价格、地区、模型参数和版权机制,这些关键信息全缺,所以重要性停在 76 不动。但 Google 把 Lyria 3 和 Veo 打包成一个网页端音乐创作入口,6 类入口直接列出来,Producer 能出完整歌曲,这点对从业者来说信号很明确——大厂在认真推 AI 音乐工具,不是 demo。没写版权怎么处理,先别太激动,但上线本身已经够让做音乐 AI 的人盯着看了。

Hacker News 首页

我用 Claude Code 定时任务自动盯家庭财务,每天一封邮件汇报资产和异常

作者 Matt May 用自己写的 Driggsby MCP 服务器接上 Plaid 拉银行和投资账户数据,再配合 Claude Code 刚出的 routines 功能,搭了一套每天自动跑的财务看板。他之前用 Codex CLI 写脚本抓数据,经常因为网页渲染变化或二次验证挂掉,后来干脆花了两个月、写了约 7.5 万行 Rust 代码做成 Drigg...

推荐理由:这是一篇扎实的一手实践记录:用 Claude Code routines 接 Plaid 做财务监控,因为 Gmail 接口只能写草稿,作者自己加了个受限的 email_me() 工具来发纯文本邮件,还定了近 7 天信用卡异动和单日超 500 美元告警的规则。HKR 三项都站得住,但本质还是个人产品博客,不是实验室或平台级发布,所以放在 featured 档。

X · @OpenAI

OpenAI 把 GPT-5.5 和 GPT-5.5 Pro 放上了 API

OpenAI 发推说 GPT-5.5 和 GPT-5.5 Pro 现在可以通过 API 调用了。推文只给了个链接,没提价格、上下文长度、支持什么模态、速率限制,也没放跑分。具体变化得看 API 文档有没有跟着更新,光这条推文看不出太多东西。

推荐理由:这条更新在 H 和 R 上得分没问题:两个新模型同时上 API,开发者圈子肯定炸锅,而且后续动作全是实打实的工程活。但 K 只能给到 1,因为除了“已上线”三个字,正文什么都没披露——价格不知道、能传多长的上下文不知道、支不支持图片或语音也不知道。我会先打个折,等接口文档同步更新了再重新判断信息密度。

Hacker News 首页

OpenAI 在 API 文档里挂出了 GPT-5.5 和 GPT-5.5 Pro

OpenAI 的开发者文档更新日志里出现了 GPT-5.5 和 GPT-5.5 Pro 的入口,页面时间戳是 2026 年 4 月 24 日。目前这更像一个占位导航页,只给了一个“最新:GPT-5.5”的链接。正文没披露价格、上下文窗口大小、跑分成绩,也没说在哪些地区可用。我会先打个折:模型是真的要来了,但具体强在哪、贵不贵,还得等后续更新。

推荐理由:这条更新本身是个导航页,实质内容还没放出来。我会先打个折:标题够直接,API 上线对工程端影响明确,所以 H 和 R 都成立。但正文没披露任何硬参数,K 很弱,整体分数卡在 featured 门槛上,等 pricing 和模型卡补上才值得再往上调。

4月24日星期五

TechCrunch · AI

DeepSeek 放出 V4 预览版,自称推理能力快追上头部模型

DeepSeek 在 Hugging Face 上发了两个 V4 预览模型,说架构改动让它们比 V3.2 更省资源、跑分更高,在推理基准上“几乎追平”当前领先的开源和闭源模型。但正文没给出具体模型名、参数量、跑分数字和测试集,也没提什么时候正式发布。所以“追平”这个说法先别太激动——没有可复现的评测数据,没法验证。

推荐理由:这条消息的传播价值在于 DeepSeek 放话“缩小差距”,但正文没给任何可核对的数字,所以我会先打个折。H 和 R 靠竞争信号就能过,K 弱是因为关键信息全缺,没法验证它到底多强。真正该盯的是后续有没有可复现的实测,现在这点先别太激动。

The Verge · AI

DeepSeek 放出 V4 模型预览,说能跟 Google、OpenAI、Anthropic 的闭源模型正面打

DeepSeek 在 4 月 24 号发布了开源 V4 模型的预览版,声称性能可以对标美国几家头部公司的闭源系统。这次重点提了编程能力提升,并且强调跟华为的硬件兼容——这基本就是在说,模型能跑在中国自己的芯片上。不过正文没披露参数量、具体跑分和正式发布时间。我会先打个折:编程强了多少、在什么任务上强,都没给数据,这点先别太激动。

推荐理由:DeepSeek 这次放出的 V4 预览版,我会先打个折——参数、基准分数、商用时间全都没披露,所以别急着激动。但信息量还是够的:代码能力提升直接指向让模型进业务流程干活的 agent 场景,而华为兼容性把模型进展和国产芯片栈绑得更紧,这两点比单纯刷榜更有看头。正文没给具体数字,所以重要性停在 83,等有实测数据再往上调。

r/LocalLLaMA

DeepSeek V4 发布:1.6T 参数的 Pro 版和 284B 的 Flash 版,MIT 开源,支持 100 万 token 上下文

DeepSeek 放出了两个 V4 模型,都走 MIT 开源协议,上下文窗口拉到 100 万 token。Pro 版总参数 1.6T,每次推理只激活 49B;Flash 版总参数 284B,激活 13B。激活参数占比很低,意味着如果跑分靠谱,自己部署长上下文模型的硬件门槛和成本会降一截。不过原帖没给具体跑分、定价、训练数据量,也没提实际推理吞吐,这些都...

推荐理由:这是 DeepSeek 旗舰级开源发布,两个 MIT 权重加 1M 上下文,当天覆盖没问题。分数停在 86,因为正文没披露基准分数、吞吐、训练数据规模或定价,这些缺口让实际效果还得等实测。我会先打个折,别看到 1.6T 就上头。

Latent Space

GPT 5.5 和 OpenAI Codex 超级应用

OpenAI 发了 GPT-5.5,在 ChatGPT 和 Codex 里能用了,但 API 还要等安全加固。模型在 Terminal-Bench 2.0 上拿了 82.7%,SWE-Bench Pro 58.6%,API 支持 100 万 token 的上下文窗口。更值得看的是 Codex:内置浏览器操控,还把之前停掉的 Prism 功能并了进来,O...

推荐理由:OpenAI 发了 GPT-5.5,先在 ChatGPT 和 Codex 里上线,API 因为安全措施要等一等。跑分方面,Terminal-Bench 2.0 拿了 82.7%,SWE-Bench Pro 58.6%,API 上下文给到 1M token,算是能装下一整套代码库的水平。但真正值得盯的是 Codex 这边:浏览器控制能力和 Prism 合并,摆明了要做桌面端的超级入口,不只是聊天或写代码,而是直接操作你的电脑。这点先别太激动,正文没披露实际可用性和权限边界,但方向很明确——OpenAI 想把模型塞进业务流程里干活,而不只是当顾问。

X · @Yuchenj_UW

DeepSeek V4 来了,Pro 版用 MIT 协议开源,参数 1.6T 但只激活 49B

DeepSeek 放出了 V4 的消息。Pro 版本走 MIT 开源协议,总参数量 1.6 万亿,但每次推理只激活 490 亿参数,属于大模型小用,推理成本会比较友好。官方还提了一嘴 Pro Max 版,说跑分接近 Opus-4.6 Max 和 GPT-5.4 xHigh,但正文没披露具体跑分榜单、分数、发布时间和模型权重,这点先别太激动。

推荐理由:这条消息值得上 featured,我会先打个折,不往 p1 推。钩子很清晰:DeepSeek 发 V4,MIT 许可加 49B 激活参数,部署门槛明显降低。硬信息也有,1.6T 总参数量、MIT 许可都是新事实。但正文只喊口号式对标 Opus-4.6 Max 和 GPT-5.4 xHigh,没给出任何具体基准名称或分数,权重链接和发布时间也都没提,这点先别太激动。相关性上,这是旗舰开源模型发布,直接关系到推理成本和开源生态竞争,从业者肯定要盯。综合看,信息有缺口但信号够强,保持 84 分、featured 合理。

X · @op7418(歸藏)

DeepSeek V4 发了公告:Pro 版 1.6T 总参数量但只激活 49B,Flash 版更轻量,预训练都喂了 32T 数据

DeepSeek 放出了 V4 的官方说明。这次分两个版本:Pro 版总参数量 1.6 万亿,实际干活时只激活 490 亿参数;Flash 版总参数量 2840 亿,激活 130 亿参数,两个版本预训练都用了 32 万亿 token。网页和 App 里的“专家模式”对应 Pro,“快速模式”对应 Flash。官方说多项跑分跟 Opus 4.6 打平,A...

推荐理由:这是 DeepSeek 的旗舰发布,分量跟美国头部实验室发新模型看齐。HKR 三项都站得住:公告里参数规模、训练数据量、新注意力机制这些硬信息都有,也直接拿 Opus 4.6 做对比,对从业者选模型和算成本都有参考价值。不过摘要没提评测具体怎么跑的、定价和 API 开放时间,这些缺口让我对 benchmark 那部分先打个折。

X · @op7418(歸藏)

DeepSeek V4 发布,Flash 和 Pro 两个版本,Flash 输入每百万 token 只要两毛钱

DeepSeek 放出了 V4 模型,分 Flash 和 Pro 两档。Flash 主打便宜,每百万 token 输入 ¥0.2、输出 ¥1;Pro 贵不少,输入 ¥1、输出 ¥12。功能上支持 JSON 输出、工具调用、对话前缀续写和 FIM 补全。注意,如果上下文开到 100 万 token,输出价格会翻倍。正文没提模型规模、训练数据、基准跑分和具...

推荐理由:这是国内一线实验室的新旗舰模型发布,重要性和美国大厂发新模型看齐。摘要把 Flash/Pro 型号、JSON 输出、工具调用、FIM 和定价都列出来了,HKR 三项都站得住。不过正文没给评测基准、上下文窗口具体长度和开放范围,我会先打个折——信息缺口摆在那,别急着把话说满。

Hugging Face 博客

DeepSeek-V4 发布:百万 token 上下文,这次是给干活用的 agent 准备的

DeepSeek 发了 V4,分 Pro 和 Flash 两个版本,都支持 100 万 token 的上下文窗口。Pro 版总参数 1.6 万亿,每次推理激活 490 亿;Flash 版总参数 2840 亿,激活 130 亿。跑分不是最顶尖的,但这不是重点。真正的改进在推理成本上:跟 V3.2 比,Pro 版处理单个 token 的算力只要 27%,K...

推荐理由:DeepSeek-V4 是国产旗舰模型更新,Pro 版 1.6T 总参、49B 激活,Flash 版 284B 总参、13B 激活,都支持 100 万 token 上下文。最值得看的是成本:Pro 单 token 计算量只有 V3.2 的 27%,KV 缓存降到 10%;Flash 更狠,分别只有 10% 和 7%。这意味着跑长上下文 agent 时显存和算力开销大幅缩水,不是光喊口号。HKR 三项全中,放在当天必读档没问题。

The Verge · AI

Claude 开始直连你的 Spotify、Uber Eats 和 TurboTax 了

Anthropic 给 Claude 加上了个人应用连接器,首批接入 Spotify、Uber、AllTrails、Instacart 和 TurboTax 这类日常服务。连上之后,你在聊天里提需求,Claude 会主动推荐用哪个 App 来办——比如想找徒步路线,它就直接调 AllTrails。这标志着 Claude 从办公场景正式踏进个人生活消费的...

推荐理由:这条给 Anthropic 加的是正向分:产品更新有料,但不是模型发布。HKR 三项全过——个人应用连接器本身就是强钩子,文章证实了对话内调用,而且这事直接打在助手入口的争夺上。正文没提首批覆盖多少应用、哪些地区能用、要不要付费订阅,这些缺口让判断得打个折,但方向没错。

X · @dotey(宝玉)

Anthropic 给 Claude 托管智能体加了记忆功能,用文件系统存经验,不用向量库

Anthropic 把记忆功能做进了 Claude 托管智能体,现在公测。智能体能把之前会话里学到的经验存成文件,下次干活直接读,不用每次从头教。实现方式很朴素:记忆就是文件系统上的文件,智能体用 bash 和代码能力直接读写,开发者也能通过 API 导出或回滚。权限上支持多智能体共享,可设只读或读写,并发访问不冲突,所有改动有审计日志。Rakuten...

推荐理由:Anthropic 给 Claude 托管智能体加了跨会话记忆,目前公测。亮点是没上向量数据库,直接用文件系统接 bash 和代码执行链路,权限、审计、回滚都给了。两个用户数字挺硬:Rakuten 出错率砍掉 97%,Wisedocs 提速 30%。不过范围还锁在托管智能体 beta 版,所以重要性给 83,放 featured。

X · @claudeai

Claude 托管 Agent 的记忆功能开始公测,Agent 能跨对话记住上下文了

Claude 给托管 Agent 加了个记忆层,现在你的 Agent 可以从每次对话里学东西。官方说法是“智能优化的记忆层”,在性能和灵活性之间找平衡。但正文没披露记忆容量有多大、能记多久、怎么收费、哪些账号能用。对从业者来说,关键看两点:一是持久记忆什么时候变成默认配置,二是这会让 Agent 的评测和状态管理怎么变。

推荐理由:Claude 给托管代理加了记忆,这是个实打实的产品更新,对做代理的人吸引力够强,所以 H 和 R 都站得住。但公告信息量太薄,关键参数一个没给,K 这块只能打折扣,整体够不上 p1,放在 featured 低段比较合适。

FT · 科技

Meta 要裁掉 10% 的员工,给扎克伯格的 AI 烧钱计划腾地方

FT 这篇报道正文被付费墙挡住了,只能看到标题和摘要片段。已知信息是:Meta 计划裁员 10%,目的是“抵消”扎克伯格在 AI 上的巨额支出。RSS 片段提到今年数据中心要花掉 1350 亿美元。但员工总数、具体裁哪些部门、时间表、以及这 1350 亿具体怎么花,正文都没披露。

推荐理由:我会先打个折:正文只有 RSS 摘要,信息很薄。能抓住人的是那个赤裸裸的置换——裁 10% 的人去填 AI 的坑,1350 亿美元的数据中心计划也够扎眼。但裁员基数是多少、什么时候动手、砍哪些团队、AI 项目具体怎么花这笔钱,正文全没披露,所以判断只能停在 featured,上不了 p1。

X · @dotey(宝玉)

Codex 接入 GPT-5.5,新增浏览器操控、文档生成和自动审查,从写代码工具转向干活智能体

Codex 现在能用 GPT-5.5 了,一口气加了五个能力。它能直接操控浏览器,自己点击页面、填表、截图看结果,走完整个流程再告诉你哪里有问题。文档方面,可以在 Microsoft Office 和 Google Drive 里直接生成表格、幻灯片和文档,应用内还加了文件预览器,改完就能看效果。电脑操控能力跟着 GPT-5.5 增强,能看屏幕、点击、...

推荐理由:这次 Codex 更新干货不少,核心不是简单挂了个新模型,而是把定位从代码助手往能跑连续任务链的智能体上推。我会先打个折:正文是二手消息,没给定价、没讲推送范围,也没交代那个审查智能体的安全门槛到底设在哪,所以先别太激动。但五个升级里,浏览器和电脑操控、跨办公套件生成文档、自动审查这几项,确实让 Codex 的干活边界变宽了,值得从业者盯着后续落地细节。

X · @dotey(宝玉)

OpenAI 发布 GPT-5.5,跑分涨了但延迟没变,还顺手发了 Codex

GPT-5.5 现在向 ChatGPT 付费用户和 Codex 开放,API 随后到。OpenAI 说它每 token 延迟跟 GPT-5.4 一样,但完成同样任务用的 token 更少,相当于能力涨了、效率也涨了。跑分上,Terminal-Bench 2.0 从 75.1% 提到 82.7%,FrontierMath Tier 4 从 27.1% 跳...

推荐理由:这是一次核心模型发布,带了基准、定价和百万 token 上下文,HKR 三项都踩中。标题说 API“很快”跟进,摘要里却已经给了 API 定价,这个不一致让我对时效性稍微打个折,但整体还是必须写的 p1 级别。正文最值得盯的是那句“同等智能下总 token 消耗约为前沿竞品编码模型的一半”——如果属实,成本优势不小,但没给出具体对比对象和测试条件,这点先别太激动。

X · @claudeai

Claude 新增 TripAdvisor、Booking、Resy 等十来个生活类 App 连接

Claude 官方发了一条产品更新,说现在能连接更多非工作类 App,列了 TripAdvisor、Booking.com、Resy、Instacart、Spotify、Audible、AllTrails、Thumbtack、TurboTax 等至少 10 个。正文没披露具体怎么连、能执行哪些操作、支持哪些地区、权限范围多大、什么时候推完。我会先打个折...

推荐理由:这是 Anthropic 官方产品更新,HKR 三项都踩中了。钩子是 Claude 从办公工具杀进生活消费场景,知识点是新增至少 10 个消费 App 连接器但操作细节和上线范围全都没说,关联点在于它把“助手能不能代办个人事务”这个平台级问题摆上了台面。分数维持 75,因为目前只是列了 App 名字,正文没给出可执行动作、权限边界、地区限制和发布时间,我会先打个折,等后续披露再考虑上调。

TechCrunch · AI

OpenAI 发了 GPT-5.5,说是离“超级应用”又近了一步

OpenAI 在周四把 GPT-5.5 放出来了,官方说法是“最聪明、用起来最直观的模型”。总裁 Brockman 在媒体会上讲,这模型在多个方面能力都有提升,思考更快、更敏锐,而且花的 token 更少。他把这叫做迈向“更会干活的智能计算”的一步,也是未来“超级应用”的一块拼图。不过正文没披露模型规模、具体跑分、上下文窗口、定价和推送范围,所以这些提...

推荐理由:标题喊得挺响,但正文其实很空。GPT-5.5 发布了,能力有提升,可具体强在哪、贵不贵、一次能读多少字、跑分多少,全都没说。OpenAI 把它往“超级应用”的故事上靠,我会先打个折——这更像是一次产品路线表态,而不是一份能拿来评估的技术发布。对从业者来说,知道有这么个东西就够了,真正要盯的是后续怎么拆能力、怎么整合进 ChatGPT,以及定价会不会再涨。

X · @OpenAI

OpenAI 发布 GPT-5.5,强调能干活、会检查,但没给参数和跑分

OpenAI 在 X 上宣布推出 GPT-5.5,已经接入 ChatGPT 和 Codex。官方说法是它面向实际工作和 agent 场景,能理解复杂目标、调用工具、自我检查,把更多任务从头跑到尾。我会先打个折:正文没披露参数量、价格、上下文窗口和任何基准测试结果,所以现在只能看到一句“新的智能形态”和“新的干活方式”,具体强在哪、贵不贵、跑多快都还不知道。

推荐理由:OpenAI 在 ChatGPT 和 Codex 上线 GPT-5.5,属于当天必须覆盖的发布。HKR 三项全中:新模型发布本身就有话题性,正文给出了 agent 工作流和工具调用的具体方向,对日常做 AI 应用的人有直接影响。我会先打个折——参数、价格、上下文窗口和基准分正文都没披露,所以重要性停在 92,不往上拉。真正值得盯的是落地链路,不是标题里的“新一类智能”。

The Verge · AI

OpenAI 发了 GPT-5.5,说写代码更强、也更省资源

OpenAI 在 4 月 23 号公布了 GPT-5.5,主打编程和调试能力,还能跨表格、文档这些工具干活。官方说它比上个月发的 GPT-5.4 效率更高,但正文没给出具体的跑分、上下文窗口大小和定价。我会先打个折——没看到实测数据之前,这些“更强更省”的说法还不好直接当真。

推荐理由:OpenAI 发新模型是当天该追的事,而且这次把效率、编程和工具调用捆成一个升级点来讲,HKR 三项全中。正文没披露价格、上下文窗口和基准分数,所以分数停在 87 而不是 90+。我会先打个折:没跑分、没定价,光说“更强”还差点意思,但工具调用和多步骤执行这个方向本身值得盯。

4月23日星期四

X · @op7418(歸藏)

Claude 桌面端能接第三方模型了,走开发者模式填 API 就行

有人在 Claude 桌面端发现一个入口:不登录状态下,从 Help → Troubleshooting 开启开发者模式,重启后右上角会多出 Developer 选项,里面可以配置第三方推理服务的 API 地址和 Key,点 Apply locally 就能用。这意味着客户端可以直接把请求打到别的模型或自建的 Claude API 上,不经过 Anth...

推荐理由:我会先打个折:这只是单条 X 帖子,Anthropic 没官宣支持范围、模型白名单或后续政策,所以分数停在 74。但 HKR 三项都踩中了——入口够隐蔽、路径可复现、话题直接打在客户端锁定上。正文没披露 Anthropic 是否默许,这点先别太激动,但如果是真的,等于 Claude 桌面端自己把围墙拆了个口子。

The Verge · AI

微软在 Word、Excel、PPT 里上线 Agent Mode,让 Copilot 直接动手改文档

微软这周把 Copilot 的 Agent Mode 推给了 Microsoft 365 Copilot 和 Premium 用户,不再是只回答问题的聊天框,而是能直接在文档、表格、幻灯片里执行操作。Copilot 办公副总裁 Sumit Chauhan 说,之前的基础模型不够强,没法可靠地控制应用界面。不过这篇报道没写具体能执行哪些操作、覆盖哪些地区...

推荐理由:微软把 Agent Mode 塞进 Word、Excel 和 PowerPoint,等于让 Copilot 从“陪你聊”变成“替你干”,这个转向比单纯升级模型更值得关注。高管自己承认早期模型能力不够,只能被动回答,现在才敢放代理进画布,说明技术门槛确实在降。但正文没提开放范围、定价和具体能执行哪些动作,所以我会先打个折——如果后续披露的动作列表很窄或者只限企业版,实际影响就没标题听起来那么大。

OpenAI News

OpenAI 发布 GPT-5.5:干活更利索,写代码、查资料、跨软件操作都能自己跑通

OpenAI 推出了 GPT-5.5,主打让模型自己规划、调用工具、检查结果,去完成写代码、做研究、分析数据这类跨步骤的复杂任务。官方说它在 Terminal-Bench 2.0 这类命令行测试上准确率达到 82.7%,比上一代高,而且完成同样任务用的 token 更少,推理延迟跟 GPT-5.4 持平。正文没给具体的上下文窗口、定价和 API 开放时...

推荐理由:OpenAI 发新模型是当天新闻,点击和行业关联都拉满,所以 H 和 R 没悬念。K 不成立是因为这篇只确认了名字和大致用途,真正该盯的可复现参数一个都没披露,信息密度撑不起 p1,放在 featured 更合适。

彭博科技

阿里在通义千问 App 里接入了东航订票,用户能直接搜航班下单

阿里把中国东方航空的机票预订功能塞进了通义千问 App,用户不用跳转就能完成航班搜索和下单。这是通义千问的 agent 技术第一次开放给大型商业伙伴,意味着它从聊天助手往交易环节里走了一步。不过正文没披露具体上线地区、舱位覆盖、支付流程和双方怎么分账,所以实际体验和商业回报还得再等等看。

推荐理由:我会先打个折:正文没披露上线范围、支付流程和分成结构,所以别急着算账。但 Qwen 从纯聊天界面跨到交易闭环,是 agent 落地的硬信号。东航作为首个大型商业伙伴接入,说明阿里在推模型进业务流程干活,而不只是答问题。这点先别太激动,等看实际跑起来的订单量和客诉情况。