跳到正文

#MCP/工具调用

今日 5 条

4月25日星期六

Hacker News 首页

我用 Claude Code 定时任务自动盯家庭财务,每天一封邮件汇报资产和异常

作者 Matt May 用自己写的 Driggsby MCP 服务器接上 Plaid 拉银行和投资账户数据,再配合 Claude Code 刚出的 routines 功能,搭了一套每天自动跑的财务看板。他之前用 Codex CLI 写脚本抓数据,经常因为网页渲染变化或二次验证挂掉,后来干脆花了两个月、写了约 7.5 万行 Rust 代码做成 Drigg...

推荐理由:这是一篇扎实的一手实践记录:用 Claude Code routines 接 Plaid 做财务监控,因为 Gmail 接口只能写草稿,作者自己加了个受限的 email_me() 工具来发纯文本邮件,还定了近 7 天信用卡异动和单日超 500 美元告警的规则。HKR 三项都站得住,但本质还是个人产品博客,不是实验室或平台级发布,所以放在 featured 档。

TechCrunch · AI

Google 计划向 Anthropic 投 400 亿美元,现金加算力

Google 打算先投 100 亿美元现金,把 Anthropic 的估值推到 3500 亿美元;后面还有 300 亿美元,但要看 Anthropic 能不能达到约定的业绩目标。这笔钱不全是现金,相当一部分会折算成云计算资源,也就是给 Anthropic 提供跑模型需要的算力。这个时间点刚好在 Anthropic 小范围放出新模型 Mythos 之后—...

推荐理由:这条消息的冲击力主要来自 400 亿美元的上限和现金+算力的组合,不是单纯的融资数字。我会先打个折:正文没写交易结构、时间表和算力配额,所以实际落地规模和节奏还不清楚。对从业者来说,真正值得盯的是算力绑定——Anthropic 对 Google Cloud 的依赖会不会加深,后续模型训练和推理成本能不能压下来,这点先别太激动,得等更多细节。

4月24日星期五

Hacker News 首页

为什么你应该拒绝让医生用 AI 帮你记病历

Emily M. Bender 和 Decca Muldowney 给了 9 个理由,劝患者在诊室里拒绝 AI 自动记录系统。这类工具会录下你和医生的对话,自动生成病历草稿。她们的核心担忧不是技术出错,而是诊所会把省下的时间拿来塞更多病人,而不是让你多聊一会儿。具体风险包括:录音和文字稿交给第三方公司,隐私保护未必靠谱;患者很难在几分钟内真正搞懂数据会...

推荐理由:这篇文章不是技术评测,是一篇立场鲜明的评论。两位作者直接劝患者对诊室里的 AI 录音工具说不,理由集中在录音数据怎么用、谁有权限看、语音识别对带口音的人不公平,以及医生可能过度信任 AI 草稿而漏掉关键信息。我会先打个折:全文没有给出实证数据,更像一份风险清单,所以重要性不会拉太高。但它的传播价值在于把“省时”背后的代价摊开讲——机构可能把省下来的时间变成更多接诊量,而不是让医生更仔细看你。这点对从业者来说是个提醒,别只盯着效率数字。

Hacker News 首页

Affirm 用一周时间让 800 多名工程师集体切换 AI 编程智能体

2026 年 2 月,Affirm 停掉常规开发,让全公司 800 多名工程师花一周时间,用 AI 编程智能体(agent)把真实需求从想法一路做到提交 PR。到文章发布时,超过 60% 的 PR 都有智能体参与。文章说,2025 年底已经有 80% 以上的工程师每周用 AI 开发工具,但少数人用得很深、多数人还在观望,差距在拉大,所以他们决定用集中一...

推荐理由:这条消息的看点不是 Affirm 用了什么工具,而是组织层面的一次硬切换:800 多人的工程团队停摆一周,全员跑 agentic 开发流程,之后六成以上 PR 都有 agent 参与。数字够具体,动作够极端,对正在琢磨怎么推 AI 编码的团队来说,参考价值比普通客户案例高出一截。正文没给出长期质量和速度数据,这点先别太激动,但就冲这个规模和执行速度,值得放进 featured。

FT · 科技

Cohere 和 Aleph Alpha 谈成一笔 200 亿美元的大西洋两岸 AI 合作

两家公司宣布要联手搞“主权 AI”,也就是不依赖美国或中国的独立系统。但正文被付费墙挡了,没披露这 200 亿是估值、投资额还是营收目标,也没说钱怎么分、具体做什么产品、什么时候落地。这个数字很大,先别太激动,等看到交易结构再说。

推荐理由:FT 的信源分量把这条推到了 featured。200 亿的数字和主权 AI 的提法撑起了 H 和 R,但 K 偏弱——正文没讲怎么出钱、做什么产品、什么时候落地,所以分数停在 76。我会先打个折,真正该盯的是主权部署这个点,而不是标题里的金额。

机器之心 · 公众号

Anthropic 承认 Claude Code 变笨了,是这三个 Bug 搞的鬼

Anthropic 出来解释了,过去一个月大家觉得 Claude Code 质量下滑,不是模型本身变弱,也不是 API 出了问题,纯粹是工程层面的三个 Bug。第一个是 3 月 4 号把默认推理强度从“高”调成了“中”,相当于让模型干活时少动脑子;第二个是 3 月 26 号会话缓存出了错,可能让模型记错上下文;第三个是 4 月 16 号给提示词加了 2...

推荐理由:Anthropic 发了一篇很实在的事后说明,把 Claude Code 近一个月体验下滑归因到三个运行框架和提示词的 Bug,模型本身没退化。我会先打个折:这不是模型能力问题,而是产品配置翻车,但对天天用 Claude Code 写代码的人来说,推理强度被偷偷从 high 降到 medium、输出被限到 25/100 词,体感就是降智。文章把 3 月 4 日、3 月 26 日、4 月 16 日三个时间点的改动和回滚日期都标出来了,信息密度够,也直接点了 Sonnet 4.6、Opus 4.6、Opus 4.7 受影响,还提到 4 月 23 日重置...

Hacker News 首页

一个交互式网页,用可视化的方式拆解大语言模型是怎么造出来的

作者把 Andrej Karpathy 的技术讲座做成了一个可以点着看的网页教程,从爬互联网数据开始,一路讲到模型怎么生成文字。里面给了几个具体数字:训练用了 15 万亿个 token,模型参数 4050 亿,原始文本数据 44TB,词表大小 10 万个。网页把流程拆成了数据收集、分词、训练、推理和基础模型行为这几步,每一步都有动画或可交互的演示,比如...

推荐理由:我会先打个折:这不是新研究,是把 Karpathy 的公开课做成交互教材。但做得扎实——从 Common Crawl 抓数据、BPE 分词、Transformer 训练到温度采样,全流程可视化,还给了 15T tokens、405B 参数这些量级数字,让人对 LLM 的规模有体感。对想补基础的人很友好,正文没披露什么新 benchmark 或成本数据,所以别当行业信号看,就当一份高质量的学习材料。

量子位 · 公众号

Claude 承认三个 bug:推理降级、记忆清空、输出被限,越聊越傻不是错觉

Anthropic 在 4 月 23 号自己抖出了 Claude 近期的三个质量问题。第一个是 Claude Code 的推理强度,3 月 4 号起默认从高被偷偷调成了中,但界面还显示高,等于你花钱买高推理,实际跑的是省流版。第二个是 3 月 26 号出的缓存 bug,每次对话轮次都会清空思考状态,持续了 15 天,模型像失忆一样没法连贯想事。第三个是...

推荐理由:这是 Anthropic 自己发的故障复盘,不是用户单方面抱怨,所以信息可信度比一般吐槽高。HKR 三项都成立:标题自带钩子,三个 bug 都有日期和具体影响数字,而且把讨论从“AI 降智”的模糊叙事拉到了透明度和计费信任上,对从业者来说比单纯的情绪输出更有价值。不过毕竟只是复盘,不是新模型发布或重大安全事件,82 分合理。

Latent Space

GPT 5.5 和 OpenAI Codex 超级应用

OpenAI 发了 GPT-5.5,在 ChatGPT 和 Codex 里能用了,但 API 还要等安全加固。模型在 Terminal-Bench 2.0 上拿了 82.7%,SWE-Bench Pro 58.6%,API 支持 100 万 token 的上下文窗口。更值得看的是 Codex:内置浏览器操控,还把之前停掉的 Prism 功能并了进来,O...

推荐理由:OpenAI 发了 GPT-5.5,先在 ChatGPT 和 Codex 里上线,API 因为安全措施要等一等。跑分方面,Terminal-Bench 2.0 拿了 82.7%,SWE-Bench Pro 58.6%,API 上下文给到 1M token,算是能装下一整套代码库的水平。但真正值得盯的是 Codex 这边:浏览器控制能力和 Prism 合并,摆明了要做桌面端的超级入口,不只是聊天或写代码,而是直接操作你的电脑。这点先别太激动,正文没披露实际可用性和权限边界,但方向很明确——OpenAI 想把模型塞进业务流程里干活,而不只是当顾问。

X · @op7418(歸藏)

DeepSeek V4 发布,Flash 和 Pro 两个版本,Flash 输入每百万 token 只要两毛钱

DeepSeek 放出了 V4 模型,分 Flash 和 Pro 两档。Flash 主打便宜,每百万 token 输入 ¥0.2、输出 ¥1;Pro 贵不少,输入 ¥1、输出 ¥12。功能上支持 JSON 输出、工具调用、对话前缀续写和 FIM 补全。注意,如果上下文开到 100 万 token,输出价格会翻倍。正文没提模型规模、训练数据、基准跑分和具...

推荐理由:这是国内一线实验室的新旗舰模型发布,重要性和美国大厂发新模型看齐。摘要把 Flash/Pro 型号、JSON 输出、工具调用、FIM 和定价都列出来了,HKR 三项都站得住。不过正文没给评测基准、上下文窗口具体长度和开放范围,我会先打个折——信息缺口摆在那,别急着把话说满。

Computing Life · Share · 鸭哥调研

Skill 是天生带自杀基因的产品

作者认为 Anthropic 的 Skill 形态没法独立做成付费产品。直接卖文件会被零成本传播,PromptBase 跑了三年估算年收入才五百万美元;做成托管服务本质是卖服务器,不是卖 skill;做成 API 引流工具又只是免费营销物料。更深层的问题是,skill 把使用知识从隐性变显性,消灭了培训、咨询等原有价值链的盈利空间,自己却因为明文复制成...

推荐理由:我会先打个折:这不是 Anthropic 的新发布,是一篇评论,所以重要性停在 featured 档。但它的判断很锋利——作者不跟你绕弯子,上来就说 Skill 天生带“自杀基因”,然后一条条拆直售、托管、API 引流为什么都是死路。数字也留得有用,比如 Snyk 审计发现 13.4% 的 skill 有严重安全问题,这比空谈风险更有说服力。真正让我觉得值得推荐的是它把视线从 artifact 这种静态产出挪开,提醒你盯紧收费点正在往关系、此刻、物理责任和判断上转移。正文没给出 Skill 官方定价或分成政策,但靠公开数据和逻辑推演,已经把悲观结论...

Hugging Face 博客

DeepSeek-V4 发布:百万 token 上下文,这次是给干活用的 agent 准备的

DeepSeek 发了 V4,分 Pro 和 Flash 两个版本,都支持 100 万 token 的上下文窗口。Pro 版总参数 1.6 万亿,每次推理激活 490 亿;Flash 版总参数 2840 亿,激活 130 亿。跑分不是最顶尖的,但这不是重点。真正的改进在推理成本上:跟 V3.2 比,Pro 版处理单个 token 的算力只要 27%,K...

推荐理由:DeepSeek-V4 是国产旗舰模型更新,Pro 版 1.6T 总参、49B 激活,Flash 版 284B 总参、13B 激活,都支持 100 万 token 上下文。最值得看的是成本:Pro 单 token 计算量只有 V3.2 的 27%,KV 缓存降到 10%;Flash 更狠,分别只有 10% 和 7%。这意味着跑长上下文 agent 时显存和算力开销大幅缩水,不是光喊口号。HKR 三项全中,放在当天必读档没问题。

阮一峰的网络日志

第二次 API 开放浪潮

阮一峰在周刊里聊了一个正在发生的趋势:大模型能干活了,逼着各种平台重新开放 API。15 年前那波 API 开放没跑通,因为平台发现数据给别人用了,自己插不上广告,最后都缩回围墙花园里。但 2025 年下半年大模型达到生产可用水平后,逻辑变了——AI 要自动化执行任务,就必须能调用外部平台,没 API 就进不了 AI 工作流,用户会直接转向有接口的竞品...

推荐理由:阮一峰这篇周刊判断,2025 年下半年大模型开始真正进业务干活,会触发第二次 API 开放浪潮。核心逻辑是 Agent 不能光说不练,得调用外部服务才能完成动作,所以微信这类消费级平台的接口开放比云服务 API 更值得盯。文章给了腾讯开放微信接口、MCP 和 Skill 成为常见接入机制这些具体信号,不是空谈趋势。不过正文没给出这次“浪潮”的量化数据或开发者采用率,更像一个基于现象的预判,所以重要性我打个折,放在 76 分。

The Verge · AI

Claude 开始直连你的 Spotify、Uber Eats 和 TurboTax 了

Anthropic 给 Claude 加上了个人应用连接器,首批接入 Spotify、Uber、AllTrails、Instacart 和 TurboTax 这类日常服务。连上之后,你在聊天里提需求,Claude 会主动推荐用哪个 App 来办——比如想找徒步路线,它就直接调 AllTrails。这标志着 Claude 从办公场景正式踏进个人生活消费的...

推荐理由:这条给 Anthropic 加的是正向分:产品更新有料,但不是模型发布。HKR 三项全过——个人应用连接器本身就是强钩子,文章证实了对话内调用,而且这事直接打在助手入口的争夺上。正文没提首批覆盖多少应用、哪些地区能用、要不要付费订阅,这些缺口让判断得打个折,但方向没错。

X · @dotey(宝玉)

Anthropic 给 Claude 托管智能体加了记忆功能,用文件系统存经验,不用向量库

Anthropic 把记忆功能做进了 Claude 托管智能体,现在公测。智能体能把之前会话里学到的经验存成文件,下次干活直接读,不用每次从头教。实现方式很朴素:记忆就是文件系统上的文件,智能体用 bash 和代码能力直接读写,开发者也能通过 API 导出或回滚。权限上支持多智能体共享,可设只读或读写,并发访问不冲突,所有改动有审计日志。Rakuten...

推荐理由:Anthropic 给 Claude 托管智能体加了跨会话记忆,目前公测。亮点是没上向量数据库,直接用文件系统接 bash 和代码执行链路,权限、审计、回滚都给了。两个用户数字挺硬:Rakuten 出错率砍掉 97%,Wisedocs 提速 30%。不过范围还锁在托管智能体 beta 版,所以重要性给 83,放 featured。

FT · 科技

英国正跟 Anthropic 谈,想让银行用上 Mythos 模型做网络安全测试

英国政府正在和 Anthropic 接触,讨论让英国银行能接触到 Mythos 模型。目前公开的说法是用途会限定在网络安全测试上。不过这篇报道正文被付费墙挡住了,Mythos 具体能做什么、怎么部署、哪些银行能参与、什么时候落地,这些关键信息都没披露。这件事的重点不是银行要搞一个通用的 AI 工具,而是金融业能不能拿到一个前沿的、攻防兼备的安全模型的受...

推荐理由:FT 报道英国正和 Anthropic 谈,想让银行在网络安全测试场景下用 Mythos。我会先打个折:正文没写模型到底能干什么、怎么部署、给谁用、什么时候上线,所以现在只能当个信号看。但这件事的钩子在于,它不是普通 AI 采购,而是高敏感安全工具的受控入口,金融业拿到这种权限本身就值得关注。风险点也很明显,一旦落地,合规和供应商准入问题会立刻被放大。

彭博科技

旧金山一家店让 AI 当 CEO,结果蜡烛订太多了

旧金山 Cow Hollow 的 Andon Market 把选品和定价交给一个叫 Luna 的 AI agent 来管,标题直接说它蜡烛订多了。正文没披露具体多订了多少、是哪个环节出错、亏了多少钱、后来怎么补救。能确认的是,这家店真的把零售运营的决策闭环交给了 agent,而不只是拿 AI 做辅助分析。

推荐理由:Bloomberg 报道了旧金山一家便利店让 AI 代理 Luna 管选品和定价,标题说它蜡烛订多了。我会先打个折,因为正文没给具体数字——超采量、触发逻辑、亏了多少钱、怎么补救,这些全没写。但真正值得盯的不是店里卖什么,而是闭环经营权限已经交出去了,代理能直接下单,这比实验室跑分更说明风险。信息缺口让这件事停在 featured 低段,但话题性够强。

X · @dotey(宝玉)

Codex 接入 GPT-5.5,新增浏览器操控、文档生成和自动审查,从写代码工具转向干活智能体

Codex 现在能用 GPT-5.5 了,一口气加了五个能力。它能直接操控浏览器,自己点击页面、填表、截图看结果,走完整个流程再告诉你哪里有问题。文档方面,可以在 Microsoft Office 和 Google Drive 里直接生成表格、幻灯片和文档,应用内还加了文件预览器,改完就能看效果。电脑操控能力跟着 GPT-5.5 增强,能看屏幕、点击、...

推荐理由:这次 Codex 更新干货不少,核心不是简单挂了个新模型,而是把定位从代码助手往能跑连续任务链的智能体上推。我会先打个折:正文是二手消息,没给定价、没讲推送范围,也没交代那个审查智能体的安全门槛到底设在哪,所以先别太激动。但五个升级里,浏览器和电脑操控、跨办公套件生成文档、自动审查这几项,确实让 Codex 的干活边界变宽了,值得从业者盯着后续落地细节。

X · @claudeai

Claude 新增 TripAdvisor、Booking、Resy 等十来个生活类 App 连接

Claude 官方发了一条产品更新,说现在能连接更多非工作类 App,列了 TripAdvisor、Booking.com、Resy、Instacart、Spotify、Audible、AllTrails、Thumbtack、TurboTax 等至少 10 个。正文没披露具体怎么连、能执行哪些操作、支持哪些地区、权限范围多大、什么时候推完。我会先打个折...

推荐理由:这是 Anthropic 官方产品更新,HKR 三项都踩中了。钩子是 Claude 从办公工具杀进生活消费场景,知识点是新增至少 10 个消费 App 连接器但操作细节和上线范围全都没说,关联点在于它把“助手能不能代办个人事务”这个平台级问题摆上了台面。分数维持 75,因为目前只是列了 App 名字,正文没给出可执行动作、权限边界、地区限制和发布时间,我会先打个折,等后续披露再考虑上调。

X · @OpenAI

OpenAI 发布 GPT-5.5,强调能干活、会检查,但没给参数和跑分

OpenAI 在 X 上宣布推出 GPT-5.5,已经接入 ChatGPT 和 Codex。官方说法是它面向实际工作和 agent 场景,能理解复杂目标、调用工具、自我检查,把更多任务从头跑到尾。我会先打个折:正文没披露参数量、价格、上下文窗口和任何基准测试结果,所以现在只能看到一句“新的智能形态”和“新的干活方式”,具体强在哪、贵不贵、跑多快都还不知道。

推荐理由:OpenAI 在 ChatGPT 和 Codex 上线 GPT-5.5,属于当天必须覆盖的发布。HKR 三项全中:新模型发布本身就有话题性,正文给出了 agent 工作流和工具调用的具体方向,对日常做 AI 应用的人有直接影响。我会先打个折——参数、价格、上下文窗口和基准分正文都没披露,所以重要性停在 92,不往上拉。真正值得盯的是落地链路,不是标题里的“新一类智能”。

The Verge · AI

OpenAI 发了 GPT-5.5,说写代码更强、也更省资源

OpenAI 在 4 月 23 号公布了 GPT-5.5,主打编程和调试能力,还能跨表格、文档这些工具干活。官方说它比上个月发的 GPT-5.4 效率更高,但正文没给出具体的跑分、上下文窗口大小和定价。我会先打个折——没看到实测数据之前,这些“更强更省”的说法还不好直接当真。

推荐理由:OpenAI 发新模型是当天该追的事,而且这次把效率、编程和工具调用捆成一个升级点来讲,HKR 三项全中。正文没披露价格、上下文窗口和基准分数,所以分数停在 87 而不是 90+。我会先打个折:没跑分、没定价,光说“更强”还差点意思,但工具调用和多步骤执行这个方向本身值得盯。

Hacker News 首页

Anthropic 复盘 Claude Code 近期质量下滑:三次产品层改动惹的祸,API 没受影响

Anthropic 发了一篇事故复盘,解释了最近不少用户感觉 Claude Code 变笨、变健忘的原因。问题出在三次产品层的改动上,API 和模型本身没变。第一,3 月 4 日他们把默认的思考强度从“高”调成了“中”,想解决高思考模式下界面卡死的问题,结果用户普遍觉得模型变蠢了,4 月 7 日又改了回去。第二,3 月 26 日上线了一个缓存优化,本意...

推荐理由:Anthropic 这份事后说明给了三个具体根因、时间点和修复版本,HKR 三项都站得住。比普通产品更新更有分量,因为它暴露了默认值、记忆处理和系统提示这些非模型层的改动也能把编码体验拉下来,但本质上还是一份事故报告,不是重大突破。

4月23日星期四

The Verge · AI

AI 订阅要开始挤利润了,重度用户先挨刀

Anthropic 这个月大幅收紧了第三方工具 OpenClaw 调用 Claude 的权限,把那些把 AI 当“自动化流水线工人”用的重度用户往更贵的付费套餐里赶。公司给出的理由是系统压力太大、盈利压力也大,工程师 Boris Cherny 直说现有的订阅套餐根本不适合这种用法。不过正文没披露具体涨了多少、新限额是多少、以及这次调整波及多大范围。简单...

推荐理由:Anthropic 把 Claude 的代理用量变成定价和准入问题,直接影响工具开发者和重度用户。HKR 三项都踩中了,但正文没披露具体价格、配额和生效范围,所以分数只能给到 featured 的低段。我会先打个折,这点先别太激动——通用订阅被代理式高消耗用法挤出单独计费层,才是真正值得盯的趋势。

X · @op7418(歸藏)

Claude 桌面端能接第三方模型了,走开发者模式填 API 就行

有人在 Claude 桌面端发现一个入口:不登录状态下,从 Help → Troubleshooting 开启开发者模式,重启后右上角会多出 Developer 选项,里面可以配置第三方推理服务的 API 地址和 Key,点 Apply locally 就能用。这意味着客户端可以直接把请求打到别的模型或自建的 Claude API 上,不经过 Anth...

推荐理由:我会先打个折:这只是单条 X 帖子,Anthropic 没官宣支持范围、模型白名单或后续政策,所以分数停在 74。但 HKR 三项都踩中了——入口够隐蔽、路径可复现、话题直接打在客户端锁定上。正文没披露 Anthropic 是否默许,这点先别太激动,但如果是真的,等于 Claude 桌面端自己把围墙拆了个口子。

The Verge · AI

微软在 Word、Excel、PPT 里上线 Agent Mode,让 Copilot 直接动手改文档

微软这周把 Copilot 的 Agent Mode 推给了 Microsoft 365 Copilot 和 Premium 用户,不再是只回答问题的聊天框,而是能直接在文档、表格、幻灯片里执行操作。Copilot 办公副总裁 Sumit Chauhan 说,之前的基础模型不够强,没法可靠地控制应用界面。不过这篇报道没写具体能执行哪些操作、覆盖哪些地区...

推荐理由:微软把 Agent Mode 塞进 Word、Excel 和 PowerPoint,等于让 Copilot 从“陪你聊”变成“替你干”,这个转向比单纯升级模型更值得关注。高管自己承认早期模型能力不够,只能被动回答,现在才敢放代理进画布,说明技术门槛确实在降。但正文没提开放范围、定价和具体能执行哪些动作,所以我会先打个折——如果后续披露的动作列表很窄或者只限企业版,实际影响就没标题听起来那么大。

OpenAI News

OpenAI 发布 GPT-5.5:干活更利索,写代码、查资料、跨软件操作都能自己跑通

OpenAI 推出了 GPT-5.5,主打让模型自己规划、调用工具、检查结果,去完成写代码、做研究、分析数据这类跨步骤的复杂任务。官方说它在 Terminal-Bench 2.0 这类命令行测试上准确率达到 82.7%,比上一代高,而且完成同样任务用的 token 更少,推理延迟跟 GPT-5.4 持平。正文没给具体的上下文窗口、定价和 API 开放时...

推荐理由:OpenAI 发新模型是当天新闻,点击和行业关联都拉满,所以 H 和 R 没悬念。K 不成立是因为这篇只确认了名字和大致用途,真正该盯的可复现参数一个都没披露,信息密度撑不起 p1,放在 featured 更合适。

彭博科技

阿里在通义千问 App 里接入了东航订票,用户能直接搜航班下单

阿里把中国东方航空的机票预订功能塞进了通义千问 App,用户不用跳转就能完成航班搜索和下单。这是通义千问的 agent 技术第一次开放给大型商业伙伴,意味着它从聊天助手往交易环节里走了一步。不过正文没披露具体上线地区、舱位覆盖、支付流程和双方怎么分账,所以实际体验和商业回报还得再等等看。

推荐理由:我会先打个折:正文没披露上线范围、支付流程和分成结构,所以别急着算账。但 Qwen 从纯聊天界面跨到交易闭环,是 agent 落地的硬信号。东航作为首个大型商业伙伴接入,说明阿里在推模型进业务流程干活,而不只是答问题。这点先别太激动,等看实际跑起来的订单量和客诉情况。

X · @dotey(宝玉)

微软把 Copilot 智能体模式设为 Word、Excel、PPT 默认体验,个人和家庭版也能用

微软把 Copilot 的智能体模式(Agent Mode)设成了 Word、Excel、PowerPoint 的默认打开方式,Microsoft 365 Copilot 和 Premium 订阅用户现在就能用,个人和家庭版也一样。Satya Nadella 亲自发推,拿 Excel 举例说,电子表格的价值在于信息的空间关系,给智能体这样一张画布,一条...

推荐理由:这条消息够硬:微软把 Copilot 的 Agent Mode 设成 Office 三件套的默认体验,不是小范围测试,而是所有订阅用户即刻生效,个人版和家庭版都包括。我会先打个折,这不是新模型发布,但产品更新力度很大。内测数据有零有整,Excel 参与度涨 67%、点赞率涨 65%,Word 参与度涨 52%,PowerPoint 新用户留存涨 36%,说明默认开启确实拉动了使用。更值得盯的是文档内多步执行成了默认交互,用户能预览、保留或回退改动,这点降低了试错成本。正文没披露具体技术实现细节,但分发范围和默认策略本身已经够有话题性。

Hugging Face 博客

在 Chrome 插件里跑本地 AI:一份给开发者的架构避坑指南

Hugging Face 发了一篇技术指南,拆解了他们刚做的 Chrome 插件“Transformers.js Gemma 4 浏览器助手”。核心是把 Gemma 4 E2B 模型塞进浏览器的后台 Service Worker 里本地运行,不靠云端。文章重点讲了 Manifest V3 下三个运行环境的职责划分:后台负责跑模型推理,侧边栏做聊天界面,...

推荐理由:这是一篇 Hugging Face 的实操教程,不是模型或平台发布,但把 MV3 架构拆解得挺具体。我会先打个折,因为正文没给出实际延迟或内存占用的测试数据,效果验证还缺一块。不过对想在前端跑本地模型的开发者来说,这篇的工程参考价值够得上 featured 门槛。

X · @claudeai

Claude Cowork 现在能直接在对话里生成可交互的图表了

Anthropic 给 Claude Cowork 加上了交互式图表和示意图功能,目前是 beta 版,所有付费套餐都能用。正文只说了这两点,没提支持哪些图表格式、怎么编辑、什么时候全量放开,也没说权限上有没有限制。

推荐理由:这条放在 featured 低段,靠的是 Anthropic 的信源分量和 Claude 用户群匹配度。钩子够具体——交互式图表直接进协作界面,不是画饼;知识增量也有,beta 覆盖所有付费方案这点是实打实的新信息。但我会先打个折:正文没交代怎么生成、支持哪些图表格式、能不能在协作流里直接改,这些缺口让讨论深度上不去,所以 R 分弱。整体判断是值得从业者扫一眼,但暂时没法展开聊。

The Verge · AI

OpenAI 把能自己干活的定制机器人开放给团队用了

OpenAI 把 ChatGPT 里的“工作区代理”功能下放给了 Business、Enterprise、Edu 和 Teachers 套餐。团队现在可以搭一个定制机器人,让它自己在云端跑任务,比如上网搜产品反馈、整理成报告发到 Slack,或者在 Gmail 里草拟跟进销售的邮件。这跟以前一问一答的聊天不一样,机器人能直接进到业务流程里干活了。不过正...

推荐理由:OpenAI 把 ChatGPT 从聊天框推进到团队工作流代理,HKR 三项都踩中:钩子够强,文章补了计划覆盖和任务示例,也切中企业自动化需求。没给 P1 是因为价格、铺开细节和能力边界正文都没披露,我会先打个折。

X · @dotey(宝玉)

OpenAI 在 ChatGPT 里上线工作区智能体,能跨工具自动干活,目前只给付费企业用户试用

OpenAI 给付费企业版 ChatGPT 加了个叫“工作区智能体”的功能,你可以用自然语言描述一套工作流程,它就能在后台自动跑起来,比如筛选销售线索、汇总工单、定时出报告。它跟之前自定义 GPT 最大的区别是能直接连 Slack、Gmail、Salesforce 这些工具,不光读信息,还能动手更新工单、建文档、回消息。管理员可以设权限和审批节点,不是...

推荐理由:OpenAI 把 ChatGPT 从对话工具往企业工作流里推了一步,这次放出的工作区智能体可以跨多个常用办公软件自动执行任务,比如更新工单、回 Slack 消息。我会先打个折:目前还是研究预览,正文没写定价、调用次数上限和哪些地区能用,所以别急着算投入产出。但管理员侧的权限和审批设计是实打实的信号,说明 OpenAI 在认真考虑企业治理需求,这点值得盯后续落地细节。

Latent Space

Shopify 的 AI 用量在 2026 年爆发,CTO 聊了无限 Opus-4.6 预算和内部工具 Tangle、Tangent、SimGym

Shopify CTO Mikhail Parakhin 在这期播客里详细拆解了公司怎么把 AI 用进骨子里。他说 2025 年 12 月模型质量有个明显跃升,之后内部 AI 工具的使用量就炸了,而且命令行工具的增长比传统 IDE 插件还猛。现在写代码已经不是瓶颈,瓶颈变成了代码审查、CI/CD 流程和部署稳定性,所以他们自己搞了一套 AI 代码审查系...

推荐理由:这篇是 Shopify CTO 的深度访谈,信息密度高,没有公关腔。我会先打个折:正文没披露 2026 年使用激增的具体数据,所以不能当硬证据用。但真正值得盯的是他们内部把 AI 编程的瓶颈从生成代码推到了评审和部署环节,这个判断对从业者比一个孤立的增长数字更有用。三个内部项目名字和定位都给了,不是空泛的趋势发言。整体属于有料、有判断、缺一点量化验证的优质一手信源,放在 featured 没问题。

Hacker News 首页

OpenAI 在 ChatGPT 企业版里上线了能自己干活的“工作区智能体”,目前是研究预览版

OpenAI 给 ChatGPT Business、Enterprise、Edu 和 Teachers 套餐加了一个叫 Workspace agents 的功能。你可以把它理解成在聊天工具里建一个能自动跑流程的助手:建一次就能共享给全团队,可以定时执行重复任务(比如整理销售线索、生成报表),也能直接操作 Slack、Google Drive、微软系应用...

推荐理由:OpenAI 放出了一个实打实的企业代理预览,HKR 三项全中:钩子是跨应用工作流自动化,正文给了治理控制的具体名目,又切中了企业采纳的核心顾虑。没给 P1 是因为价格、模型规格、上线时间全都没说,实际效果也还没验证,所以先打个折。

Hacker News 首页

Flipbook:一个完全由图片模型实时生成的无限视觉浏览器

Flipbook 把整个网页变成一张张像素图片,你点击任何地方,它都会生成一张更深一层的新图片,没有 HTML、没有代码、没有文字图层。所有文字都是图片模型直接画出来的,所以偶尔会画歪或写错,这点随着模型变强会改善。内容来自智能体联网搜索和模型自己的知识,准确度大概跟用 ChatGPT、Gemini 这类对话产品查到的差不多。团队说他们做这个是因为现在...

推荐理由:我会先打个折:正文没披露延迟、成本、模型栈和实际用量,所以分数停在 76。但 Flipbook 这个实验值得盯,因为它把网站变成了一串实时生成的像素图,点击哪里就继续画哪里,连文字都是画出来的,不是叠上去的。信息来自 agentic 网页搜索加模型知识,交互机制比普通生成式 UI 激进得多。视频流功能目前还是高耗资源的实验开关,这点先别太激动。

X · @OpenAI

OpenAI 在 ChatGPT 里加了“工作区 agent”,一个能跨工具、跨团队跑长任务的共享助手

OpenAI 发了一条推,说 ChatGPT 现在有 workspace agents,可以当成团队共享的助手,处理复杂任务和跑长时间的工作流。正文没披露具体支持哪些工具、怎么收费、什么账号能用、权限怎么管、什么时候推。我会先打个折:共享 agent 的协作边界才是关键,比如它能看到什么数据、谁能改它的指令,这些都没说,光看标题别太激动。

推荐理由:OpenAI 自己发的产品预告,共享代理这个方向比普通助手更新鲜,H 和 R 都站得住。但正文只给了概念,没给任何落地细节,所以 K 分不高,整体放在 featured 而不是更高。我会先打个折,等工具权限和定价出来再重新判断。

Hacker News 首页

Zed 编辑器推出并行 Agent 功能,一个窗口里能同时跑多个 AI 助手

Zed 在 4 月 22 日更新了并行 Agent 功能,核心是在一个窗口里同时跑多个 AI 助手干活。新增的线程侧边栏可以给每个线程单独设置能访问哪些文件夹和代码仓库,还能随时停止、归档或新建线程。默认界面布局也改了,线程和 Agent 面板挪到了左边,项目文件树挪到右边,老用户需要手动切换才会生效。Zed 团队说这个设计是为了让开发者既能用 AI ...

推荐理由:Zed 官方产品更新,HKR 三项都踩实了:并行 agent 加线程级权限隔离。分数停在 76 是因为正文没给性能对比、价格影响、用户量或外部验证,目前还只是单个工具自己的迭代,我会先打个折。

The Verge · AI

Anthropic 的漏洞挖掘模型 Mythos 进了多个联邦机构,唯独漏了美国网络安全局 CISA

Axios 的消息说,Anthropic 那个专门找漏洞的模型 Mythos Preview 已经在商务部、国安局(NSA)等几个联邦机构用上了,但负责全国网络防御的 CISA 反而没拿到访问权限。文章没解释为什么偏偏跳过 CISA,也没提模型的具体性能、收费方式和部署规模。目前特朗普政府正在和 Anthropic 谈更广泛的合作,但 CISA 在现政...

推荐理由:我会先打个折:正文只说了谁在用、谁没在用,模型本身长什么样、花多少钱一概没提。但这条消息的看点不在技术,而在安排——管网络安全的部门反而没拿到漏洞发现模型,这要么是流程卡壳,要么是有意绕开。对从业者来说,这比一个模型刷榜更值得留意,因为它直接关系到联邦 AI 采购的走向和权限分配。

TechCrunch · AI

Google 要把 AI 概览塞进你的工作 Gmail 里了

Google 在 Cloud Next 大会上宣布,会把类似搜索结果的 AI 概览功能搬到企业版 Gmail 里。你可以用大白话提问,比如问项目进度、发票情况或差旅细节,AI 会直接跨多封邮件抓取信息,生成一段简短的总结,不用你一封封点开看。这个功能默认开启,前提是管理员已经打开了 Gemini for Workspace 和 Workspace In...

推荐理由:Google 要把 AI 自动摘要塞进企业版 Gmail,不是给单封邮件划重点,而是跨多封邮件直接生成总结。这点和普通邮件摘要不一样,更像是在收件箱里加了一层工作流收束。但正文没写什么时候上线、哪些套餐能用、背后模型是什么,所以我会先打个折。HKR 里 K 和 R 都过了,H 偏弱,整体放在 featured 低档就行。

The Verge · AI

Google Meet 的 AI 笔记功能现在也能用在面对面会议上了

Google 把 Gemini 的会议纪要功能从线上视频扩展到了线下面对面开会。你只要在房间里用手机或平板打开 Meet,它就能直接录下现场对话并生成文字稿和摘要。之前这个功能只在安卓测试版里小范围试过,现在正式开放了。另外,就算你用的是 Zoom 或微软 Teams 开会,它也能帮你记笔记,不再只绑在 Meet 自己的通话里。正文没提这个功能对多人说...

推荐理由:一条中等体量的产品更新。H 打在线下加跨平台这个组合拳上,K 落在对 Zoom 和 Teams 的具体支持以及摘要转录能力,R 则指向各家争夺会议记录工作流的暗线。正文没披露定价、铺开节奏和实际转录质量,所以我会先打个折,不把它当成颠覆性发布。