跳到正文

全部动态

今日 25 条

4月24日星期五

X · @dotey(宝玉)

Anthropic 给 Claude 托管智能体加了记忆功能,用文件系统存经验,不用向量库

Anthropic 把记忆功能做进了 Claude 托管智能体,现在公测。智能体能把之前会话里学到的经验存成文件,下次干活直接读,不用每次从头教。实现方式很朴素:记忆就是文件系统上的文件,智能体用 bash 和代码能力直接读写,开发者也能通过 API 导出或回滚。权限上支持多智能体共享,可设只读或读写,并发访问不冲突,所有改动有审计日志。Rakuten...

推荐理由:Anthropic 给 Claude 托管智能体加了跨会话记忆,目前公测。亮点是没上向量数据库,直接用文件系统接 bash 和代码执行链路,权限、审计、回滚都给了。两个用户数字挺硬:Rakuten 出错率砍掉 97%,Wisedocs 提速 30%。不过范围还锁在托管智能体 beta 版,所以重要性给 83,放 featured。

X · @claudeai

Claude 托管 Agent 的记忆功能开始公测,Agent 能跨对话记住上下文了

Claude 给托管 Agent 加了个记忆层,现在你的 Agent 可以从每次对话里学东西。官方说法是“智能优化的记忆层”,在性能和灵活性之间找平衡。但正文没披露记忆容量有多大、能记多久、怎么收费、哪些账号能用。对从业者来说,关键看两点:一是持久记忆什么时候变成默认配置,二是这会让 Agent 的评测和状态管理怎么变。

推荐理由:Claude 给托管代理加了记忆,这是个实打实的产品更新,对做代理的人吸引力够强,所以 H 和 R 都站得住。但公告信息量太薄,关键参数一个没给,K 这块只能打折扣,整体够不上 p1,放在 featured 低段比较合适。

FT · 科技

Meta 要裁掉 10% 的员工,给扎克伯格的 AI 烧钱计划腾地方

FT 这篇报道正文被付费墙挡住了,只能看到标题和摘要片段。已知信息是:Meta 计划裁员 10%,目的是“抵消”扎克伯格在 AI 上的巨额支出。RSS 片段提到今年数据中心要花掉 1350 亿美元。但员工总数、具体裁哪些部门、时间表、以及这 1350 亿具体怎么花,正文都没披露。

推荐理由:我会先打个折:正文只有 RSS 摘要,信息很薄。能抓住人的是那个赤裸裸的置换——裁 10% 的人去填 AI 的坑,1350 亿美元的数据中心计划也够扎眼。但裁员基数是多少、什么时候动手、砍哪些团队、AI 项目具体怎么花这笔钱,正文全没披露,所以判断只能停在 featured,上不了 p1。

X · @dotey(宝玉)

Codex 接入 GPT-5.5,新增浏览器操控、文档生成和自动审查,从写代码工具转向干活智能体

Codex 现在能用 GPT-5.5 了,一口气加了五个能力。它能直接操控浏览器,自己点击页面、填表、截图看结果,走完整个流程再告诉你哪里有问题。文档方面,可以在 Microsoft Office 和 Google Drive 里直接生成表格、幻灯片和文档,应用内还加了文件预览器,改完就能看效果。电脑操控能力跟着 GPT-5.5 增强,能看屏幕、点击、...

推荐理由:这次 Codex 更新干货不少,核心不是简单挂了个新模型,而是把定位从代码助手往能跑连续任务链的智能体上推。我会先打个折:正文是二手消息,没给定价、没讲推送范围,也没交代那个审查智能体的安全门槛到底设在哪,所以先别太激动。但五个升级里,浏览器和电脑操控、跨办公套件生成文档、自动审查这几项,确实让 Codex 的干活边界变宽了,值得从业者盯着后续落地细节。

X · @dotey(宝玉)

OpenAI 发布 GPT-5.5,跑分涨了但延迟没变,还顺手发了 Codex

GPT-5.5 现在向 ChatGPT 付费用户和 Codex 开放,API 随后到。OpenAI 说它每 token 延迟跟 GPT-5.4 一样,但完成同样任务用的 token 更少,相当于能力涨了、效率也涨了。跑分上,Terminal-Bench 2.0 从 75.1% 提到 82.7%,FrontierMath Tier 4 从 27.1% 跳...

推荐理由:这是一次核心模型发布,带了基准、定价和百万 token 上下文,HKR 三项都踩中。标题说 API“很快”跟进,摘要里却已经给了 API 定价,这个不一致让我对时效性稍微打个折,但整体还是必须写的 p1 级别。正文最值得盯的是那句“同等智能下总 token 消耗约为前沿竞品编码模型的一半”——如果属实,成本优势不小,但没给出具体对比对象和测试条件,这点先别太激动。

X · @claudeai

Claude 新增 TripAdvisor、Booking、Resy 等十来个生活类 App 连接

Claude 官方发了一条产品更新,说现在能连接更多非工作类 App,列了 TripAdvisor、Booking.com、Resy、Instacart、Spotify、Audible、AllTrails、Thumbtack、TurboTax 等至少 10 个。正文没披露具体怎么连、能执行哪些操作、支持哪些地区、权限范围多大、什么时候推完。我会先打个折...

推荐理由:这是 Anthropic 官方产品更新,HKR 三项都踩中了。钩子是 Claude 从办公工具杀进生活消费场景,知识点是新增至少 10 个消费 App 连接器但操作细节和上线范围全都没说,关联点在于它把“助手能不能代办个人事务”这个平台级问题摆上了台面。分数维持 75,因为目前只是列了 App 名字,正文没给出可执行动作、权限边界、地区限制和发布时间,我会先打个折,等后续披露再考虑上调。

TechCrunch · AI

OpenAI 发了 GPT-5.5,说是离“超级应用”又近了一步

OpenAI 在周四把 GPT-5.5 放出来了,官方说法是“最聪明、用起来最直观的模型”。总裁 Brockman 在媒体会上讲,这模型在多个方面能力都有提升,思考更快、更敏锐,而且花的 token 更少。他把这叫做迈向“更会干活的智能计算”的一步,也是未来“超级应用”的一块拼图。不过正文没披露模型规模、具体跑分、上下文窗口、定价和推送范围,所以这些提...

推荐理由:标题喊得挺响,但正文其实很空。GPT-5.5 发布了,能力有提升,可具体强在哪、贵不贵、一次能读多少字、跑分多少,全都没说。OpenAI 把它往“超级应用”的故事上靠,我会先打个折——这更像是一次产品路线表态,而不是一份能拿来评估的技术发布。对从业者来说,知道有这么个东西就够了,真正要盯的是后续怎么拆能力、怎么整合进 ChatGPT,以及定价会不会再涨。

X · @OpenAI

OpenAI 发布 GPT-5.5,强调能干活、会检查,但没给参数和跑分

OpenAI 在 X 上宣布推出 GPT-5.5,已经接入 ChatGPT 和 Codex。官方说法是它面向实际工作和 agent 场景,能理解复杂目标、调用工具、自我检查,把更多任务从头跑到尾。我会先打个折:正文没披露参数量、价格、上下文窗口和任何基准测试结果,所以现在只能看到一句“新的智能形态”和“新的干活方式”,具体强在哪、贵不贵、跑多快都还不知道。

推荐理由:OpenAI 在 ChatGPT 和 Codex 上线 GPT-5.5,属于当天必须覆盖的发布。HKR 三项全中:新模型发布本身就有话题性,正文给出了 agent 工作流和工具调用的具体方向,对日常做 AI 应用的人有直接影响。我会先打个折——参数、价格、上下文窗口和基准分正文都没披露,所以重要性停在 92,不往上拉。真正值得盯的是落地链路,不是标题里的“新一类智能”。

The Verge · AI

OpenAI 发了 GPT-5.5,说写代码更强、也更省资源

OpenAI 在 4 月 23 号公布了 GPT-5.5,主打编程和调试能力,还能跨表格、文档这些工具干活。官方说它比上个月发的 GPT-5.4 效率更高,但正文没给出具体的跑分、上下文窗口大小和定价。我会先打个折——没看到实测数据之前,这些“更强更省”的说法还不好直接当真。

推荐理由:OpenAI 发新模型是当天该追的事,而且这次把效率、编程和工具调用捆成一个升级点来讲,HKR 三项全中。正文没披露价格、上下文窗口和基准分数,所以分数停在 87 而不是 90+。我会先打个折:没跑分、没定价,光说“更强”还差点意思,但工具调用和多步骤执行这个方向本身值得盯。

4月23日星期四

X · @op7418(歸藏)

Claude 桌面端能接第三方模型了,走开发者模式填 API 就行

有人在 Claude 桌面端发现一个入口:不登录状态下,从 Help → Troubleshooting 开启开发者模式,重启后右上角会多出 Developer 选项,里面可以配置第三方推理服务的 API 地址和 Key,点 Apply locally 就能用。这意味着客户端可以直接把请求打到别的模型或自建的 Claude API 上,不经过 Anth...

推荐理由:我会先打个折:这只是单条 X 帖子,Anthropic 没官宣支持范围、模型白名单或后续政策,所以分数停在 74。但 HKR 三项都踩中了——入口够隐蔽、路径可复现、话题直接打在客户端锁定上。正文没披露 Anthropic 是否默许,这点先别太激动,但如果是真的,等于 Claude 桌面端自己把围墙拆了个口子。

The Verge · AI

微软在 Word、Excel、PPT 里上线 Agent Mode,让 Copilot 直接动手改文档

微软这周把 Copilot 的 Agent Mode 推给了 Microsoft 365 Copilot 和 Premium 用户,不再是只回答问题的聊天框,而是能直接在文档、表格、幻灯片里执行操作。Copilot 办公副总裁 Sumit Chauhan 说,之前的基础模型不够强,没法可靠地控制应用界面。不过这篇报道没写具体能执行哪些操作、覆盖哪些地区...

推荐理由:微软把 Agent Mode 塞进 Word、Excel 和 PowerPoint,等于让 Copilot 从“陪你聊”变成“替你干”,这个转向比单纯升级模型更值得关注。高管自己承认早期模型能力不够,只能被动回答,现在才敢放代理进画布,说明技术门槛确实在降。但正文没提开放范围、定价和具体能执行哪些动作,所以我会先打个折——如果后续披露的动作列表很窄或者只限企业版,实际影响就没标题听起来那么大。

OpenAI News

OpenAI 发布 GPT-5.5:干活更利索,写代码、查资料、跨软件操作都能自己跑通

OpenAI 推出了 GPT-5.5,主打让模型自己规划、调用工具、检查结果,去完成写代码、做研究、分析数据这类跨步骤的复杂任务。官方说它在 Terminal-Bench 2.0 这类命令行测试上准确率达到 82.7%,比上一代高,而且完成同样任务用的 token 更少,推理延迟跟 GPT-5.4 持平。正文没给具体的上下文窗口、定价和 API 开放时...

推荐理由:OpenAI 发新模型是当天新闻,点击和行业关联都拉满,所以 H 和 R 没悬念。K 不成立是因为这篇只确认了名字和大致用途,真正该盯的可复现参数一个都没披露,信息密度撑不起 p1,放在 featured 更合适。

新智元 · 公众号

浙大开源多智能体叙事系统 OpenStory:把孙悟空扔进大观园,几分钟后角色全跑光了

浙大放出了一个叫 OpenStory 的多智能体系统,专门用来跑开放剧情。他们搭了个 1:1 的《红楼梦》大观园沙盒,把孙悟空塞进去当变量。结果几分钟内,记忆模块就把“孙悟空滥杀无辜”这条信息广播了出去,恐惧直接压过了角色的日常行为逻辑。王熙凤被物理移除后,恐慌连锁反应让整个大观园变成了空城。这个实验暴露的是多智能体系统里记忆和共识链路有多脆。不过正文...

推荐理由:我会先打个折:正文没写用了什么模型、怎么评测、实验能不能复现,所以别急着把它当成熟系统看。但这个故事本身很直观——孙悟空 Agent 被放进《红楼梦》1:1 数字沙盒,系统用记忆模块向所有活跃角色广播“孙悟空滥杀无辜”,恐惧权重直接压过日常行为逻辑,王熙凤被物理移除后,其他 Agent 集体逃离,大观园变空城。真正值得盯的不是孙悟空有多强,而是记忆广播和共识链路太脆弱:一条消息就能让整个 Agent 社会崩掉,说明多 Agent 之间的信息传递和信任机制几乎没有韧性。对做 Agent 安全、多智能体协作的人来说,这是一个很具体的压力测试案例,暴露了...

彭博科技

阿里在通义千问 App 里接入了东航订票,用户能直接搜航班下单

阿里把中国东方航空的机票预订功能塞进了通义千问 App,用户不用跳转就能完成航班搜索和下单。这是通义千问的 agent 技术第一次开放给大型商业伙伴,意味着它从聊天助手往交易环节里走了一步。不过正文没披露具体上线地区、舱位覆盖、支付流程和双方怎么分账,所以实际体验和商业回报还得再等等看。

推荐理由:我会先打个折:正文没披露上线范围、支付流程和分成结构,所以别急着算账。但 Qwen 从纯聊天界面跨到交易闭环,是 agent 落地的硬信号。东航作为首个大型商业伙伴接入,说明阿里在推模型进业务流程干活,而不只是答问题。这点先别太激动,等看实际跑起来的订单量和客诉情况。

X · @dotey(宝玉)

微软把 Copilot 智能体模式设为 Word、Excel、PPT 默认体验,个人和家庭版也能用

微软把 Copilot 的智能体模式(Agent Mode)设成了 Word、Excel、PowerPoint 的默认打开方式,Microsoft 365 Copilot 和 Premium 订阅用户现在就能用,个人和家庭版也一样。Satya Nadella 亲自发推,拿 Excel 举例说,电子表格的价值在于信息的空间关系,给智能体这样一张画布,一条...

推荐理由:这条消息够硬:微软把 Copilot 的 Agent Mode 设成 Office 三件套的默认体验,不是小范围测试,而是所有订阅用户即刻生效,个人版和家庭版都包括。我会先打个折,这不是新模型发布,但产品更新力度很大。内测数据有零有整,Excel 参与度涨 67%、点赞率涨 65%,Word 参与度涨 52%,PowerPoint 新用户留存涨 36%,说明默认开启确实拉动了使用。更值得盯的是文档内多步执行成了默认交互,用户能预览、保留或回退改动,这点降低了试错成本。正文没披露具体技术实现细节,但分发范围和默认策略本身已经够有话题性。

Hugging Face 博客

在 Chrome 插件里跑本地 AI:一份给开发者的架构避坑指南

Hugging Face 发了一篇技术指南,拆解了他们刚做的 Chrome 插件“Transformers.js Gemma 4 浏览器助手”。核心是把 Gemma 4 E2B 模型塞进浏览器的后台 Service Worker 里本地运行,不靠云端。文章重点讲了 Manifest V3 下三个运行环境的职责划分:后台负责跑模型推理,侧边栏做聊天界面,...

推荐理由:这是一篇 Hugging Face 的实操教程,不是模型或平台发布,但把 MV3 架构拆解得挺具体。我会先打个折,因为正文没给出实际延迟或内存占用的测试数据,效果验证还缺一块。不过对想在前端跑本地模型的开发者来说,这篇的工程参考价值够得上 featured 门槛。

FT · 科技

特斯拉把资本支出计划提到 250 亿美元,马斯克在 AI 上继续加注

特斯拉把资本支出计划上调到 250 亿美元,马斯克要把更多钱砸向 AI 相关项目。从 RSS 片段看,这些项目包括自动驾驶出租车、卡车、机器人以及芯片工厂,增幅被形容为“非常显著”。不过正文被付费墙挡住,没披露这笔钱覆盖的时间范围、具体怎么分项,也没提模型细节。能确定的一个信号是:特斯拉在投的不只是训练模型,而是从芯片到终端产品的整套体系。

推荐理由:FT报了一个具体的资本支出跳升数字,直接关联自动驾驶出租车、卡车、机器人和芯片工厂。我会先打个折:时间范围和分项花销都没给,模型细节也缺,所以不是必写级别。但250亿这个数够大,而且投向的是车、机器人和芯片产能整条链,不是只训模型,战略意义摆在那。HKR三项都踩中了,只是信息缺口让它停在featured中段。

X · @claudeai

Claude Cowork 现在能直接在对话里生成可交互的图表了

Anthropic 给 Claude Cowork 加上了交互式图表和示意图功能,目前是 beta 版,所有付费套餐都能用。正文只说了这两点,没提支持哪些图表格式、怎么编辑、什么时候全量放开,也没说权限上有没有限制。

推荐理由:这条放在 featured 低段,靠的是 Anthropic 的信源分量和 Claude 用户群匹配度。钩子够具体——交互式图表直接进协作界面,不是画饼;知识增量也有,beta 覆盖所有付费方案这点是实打实的新信息。但我会先打个折:正文没交代怎么生成、支持哪些图表格式、能不能在协作流里直接改,这些缺口让讨论深度上不去,所以 R 分弱。整体判断是值得从业者扫一眼,但暂时没法展开聊。

The Verge · AI

OpenAI 把能自己干活的定制机器人开放给团队用了

OpenAI 把 ChatGPT 里的“工作区代理”功能下放给了 Business、Enterprise、Edu 和 Teachers 套餐。团队现在可以搭一个定制机器人,让它自己在云端跑任务,比如上网搜产品反馈、整理成报告发到 Slack,或者在 Gmail 里草拟跟进销售的邮件。这跟以前一问一答的聊天不一样,机器人能直接进到业务流程里干活了。不过正...

推荐理由:OpenAI 把 ChatGPT 从聊天框推进到团队工作流代理,HKR 三项都踩中:钩子够强,文章补了计划覆盖和任务示例,也切中企业自动化需求。没给 P1 是因为价格、铺开细节和能力边界正文都没披露,我会先打个折。

X · @dotey(宝玉)

OpenAI 在 ChatGPT 里上线工作区智能体,能跨工具自动干活,目前只给付费企业用户试用

OpenAI 给付费企业版 ChatGPT 加了个叫“工作区智能体”的功能,你可以用自然语言描述一套工作流程,它就能在后台自动跑起来,比如筛选销售线索、汇总工单、定时出报告。它跟之前自定义 GPT 最大的区别是能直接连 Slack、Gmail、Salesforce 这些工具,不光读信息,还能动手更新工单、建文档、回消息。管理员可以设权限和审批节点,不是...

推荐理由:OpenAI 把 ChatGPT 从对话工具往企业工作流里推了一步,这次放出的工作区智能体可以跨多个常用办公软件自动执行任务,比如更新工单、回 Slack 消息。我会先打个折:目前还是研究预览,正文没写定价、调用次数上限和哪些地区能用,所以别急着算投入产出。但管理员侧的权限和审批设计是实打实的信号,说明 OpenAI 在认真考虑企业治理需求,这点值得盯后续落地细节。

Latent Space

Shopify 的 AI 用量在 2026 年爆发,CTO 聊了无限 Opus-4.6 预算和内部工具 Tangle、Tangent、SimGym

Shopify CTO Mikhail Parakhin 在这期播客里详细拆解了公司怎么把 AI 用进骨子里。他说 2025 年 12 月模型质量有个明显跃升,之后内部 AI 工具的使用量就炸了,而且命令行工具的增长比传统 IDE 插件还猛。现在写代码已经不是瓶颈,瓶颈变成了代码审查、CI/CD 流程和部署稳定性,所以他们自己搞了一套 AI 代码审查系...

推荐理由:这篇是 Shopify CTO 的深度访谈,信息密度高,没有公关腔。我会先打个折:正文没披露 2026 年使用激增的具体数据,所以不能当硬证据用。但真正值得盯的是他们内部把 AI 编程的瓶颈从生成代码推到了评审和部署环节,这个判断对从业者比一个孤立的增长数字更有用。三个内部项目名字和定位都给了,不是空泛的趋势发言。整体属于有料、有判断、缺一点量化验证的优质一手信源,放在 featured 没问题。

Hacker News 首页

OpenAI 在 ChatGPT 企业版里上线了能自己干活的“工作区智能体”,目前是研究预览版

OpenAI 给 ChatGPT Business、Enterprise、Edu 和 Teachers 套餐加了一个叫 Workspace agents 的功能。你可以把它理解成在聊天工具里建一个能自动跑流程的助手:建一次就能共享给全团队,可以定时执行重复任务(比如整理销售线索、生成报表),也能直接操作 Slack、Google Drive、微软系应用...

推荐理由:OpenAI 放出了一个实打实的企业代理预览,HKR 三项全中:钩子是跨应用工作流自动化,正文给了治理控制的具体名目,又切中了企业采纳的核心顾虑。没给 P1 是因为价格、模型规格、上线时间全都没说,实际效果也还没验证,所以先打个折。

Hacker News 首页

Flipbook:一个完全由图片模型实时生成的无限视觉浏览器

Flipbook 把整个网页变成一张张像素图片,你点击任何地方,它都会生成一张更深一层的新图片,没有 HTML、没有代码、没有文字图层。所有文字都是图片模型直接画出来的,所以偶尔会画歪或写错,这点随着模型变强会改善。内容来自智能体联网搜索和模型自己的知识,准确度大概跟用 ChatGPT、Gemini 这类对话产品查到的差不多。团队说他们做这个是因为现在...

推荐理由:我会先打个折:正文没披露延迟、成本、模型栈和实际用量,所以分数停在 76。但 Flipbook 这个实验值得盯,因为它把网站变成了一串实时生成的像素图,点击哪里就继续画哪里,连文字都是画出来的,不是叠上去的。信息来自 agentic 网页搜索加模型知识,交互机制比普通生成式 UI 激进得多。视频流功能目前还是高耗资源的实验开关,这点先别太激动。

X · @OpenAI

OpenAI 在 ChatGPT 里加了“工作区 agent”,一个能跨工具、跨团队跑长任务的共享助手

OpenAI 发了一条推,说 ChatGPT 现在有 workspace agents,可以当成团队共享的助手,处理复杂任务和跑长时间的工作流。正文没披露具体支持哪些工具、怎么收费、什么账号能用、权限怎么管、什么时候推。我会先打个折:共享 agent 的协作边界才是关键,比如它能看到什么数据、谁能改它的指令,这些都没说,光看标题别太激动。

推荐理由:OpenAI 自己发的产品预告,共享代理这个方向比普通助手更新鲜,H 和 R 都站得住。但正文只给了概念,没给任何落地细节,所以 K 分不高,整体放在 featured 而不是更高。我会先打个折,等工具权限和定价出来再重新判断。

Hacker News 首页

Zed 编辑器推出并行 Agent 功能,一个窗口里能同时跑多个 AI 助手

Zed 在 4 月 22 日更新了并行 Agent 功能,核心是在一个窗口里同时跑多个 AI 助手干活。新增的线程侧边栏可以给每个线程单独设置能访问哪些文件夹和代码仓库,还能随时停止、归档或新建线程。默认界面布局也改了,线程和 Agent 面板挪到了左边,项目文件树挪到右边,老用户需要手动切换才会生效。Zed 团队说这个设计是为了让开发者既能用 AI ...

推荐理由:Zed 官方产品更新,HKR 三项都踩实了:并行 agent 加线程级权限隔离。分数停在 76 是因为正文没给性能对比、价格影响、用户量或外部验证,目前还只是单个工具自己的迭代,我会先打个折。

TechCrunch · AI

Google 要把 AI 概览塞进你的工作 Gmail 里了

Google 在 Cloud Next 大会上宣布,会把类似搜索结果的 AI 概览功能搬到企业版 Gmail 里。你可以用大白话提问,比如问项目进度、发票情况或差旅细节,AI 会直接跨多封邮件抓取信息,生成一段简短的总结,不用你一封封点开看。这个功能默认开启,前提是管理员已经打开了 Gemini for Workspace 和 Workspace In...

推荐理由:Google 要把 AI 自动摘要塞进企业版 Gmail,不是给单封邮件划重点,而是跨多封邮件直接生成总结。这点和普通邮件摘要不一样,更像是在收件箱里加了一层工作流收束。但正文没写什么时候上线、哪些套餐能用、背后模型是什么,所以我会先打个折。HKR 里 K 和 R 都过了,H 偏弱,整体放在 featured 低档就行。

The Verge · AI

Google Meet 的 AI 笔记功能现在也能用在面对面会议上了

Google 把 Gemini 的会议纪要功能从线上视频扩展到了线下面对面开会。你只要在房间里用手机或平板打开 Meet,它就能直接录下现场对话并生成文字稿和摘要。之前这个功能只在安卓测试版里小范围试过,现在正式开放了。另外,就算你用的是 Zoom 或微软 Teams 开会,它也能帮你记笔记,不再只绑在 Meet 自己的通话里。正文没提这个功能对多人说...

推荐理由:一条中等体量的产品更新。H 打在线下加跨平台这个组合拳上,K 落在对 Zoom 和 Teams 的具体支持以及摘要转录能力,R 则指向各家争夺会议记录工作流的暗线。正文没披露定价、铺开节奏和实际转录质量,所以我会先打个折,不把它当成颠覆性发布。

4月22日星期三

OpenAI News

OpenAI 给美国医生、执业护士和药剂师免费开放了临床版 ChatGPT

OpenAI 推出了一个专为临床工作设计的 ChatGPT 版本,主要用来辅助写病历、查文献和做医学研究。目前这个版本对美国境内经过身份验证的医生、执业护士、医师助理和药剂师免费开放。它能联网搜索经过同行评审的医学资料并给出引用来源,可以把病历摘要、转诊信、预授权申请这类重复性工作做成固定流程,还能在查资料的同时自动累积继续医学教育学分。正文没披露具体...

推荐理由:这条消息的钩子在于 OpenAI 开始直接拉个人临床用户,而不是只做机构生意。我会先打个折:正文没写模型版本、免费额度上限、上线时间和认证怎么走通,所以实际落地节奏还不清楚。但方向本身值得盯——医疗场景的 AI 工具以前多是医院买单、IT 部门部署,现在直接给一线医生、护士和药师免费入口,试用和反馈循环会快很多。覆盖的三类场景(临床、文档、研究)也说明不是单点功能,而是想嵌入日常诊疗流。这点先别太激动,等认证流程和实际使用限制出来再看,但准入逻辑确实在变。

The Verge · AI

Meta 开始记录员工电脑操作,用来训练能替你干活的 AI 助手

Meta 在美国员工的工作电脑上装了一个叫 MCI 的工具,会记录鼠标移动、点击、键盘输入,还会偶尔截屏。这些数据不是用来考核绩效,而是喂给 AI 模型,教它们像人一样操作电脑,以后自动处理员工现在做的重复性工作。Meta 说不会拿来做绩效评估,但正文没提数据会保留多久、员工能不能选择不用,也没说会不会推广到美国以外的地区。

推荐理由:我会先打个折:这不是产品发布或模型开源,而是一条内部工具被路透社挖出来的报道,所以信息缺口很明显。正文只说了美国员工和工作应用,保留多久、能不能退出、范围会不会扩大都没提。但这件事的传播力很强——Meta 直接拿员工的操作痕迹去教 agent 怎么像人一样用电脑,而且明确说数据不用于绩效考核,反而让人更想知道采集边界到底在哪。如果是真的,这种数据比外包标注便宜得多,但隐私和劳资关系的雷也埋得深。

r/LocalLLaMA

ServiceNow 放出一个 15B 模型,一个权重包能切出 8 种速度档位,最快解码吞吐量翻 10 倍

ServiceNow 在 Hugging Face 上发了 SuperApriel-15B-Instruct,一个 15B 参数的指令模型。它最特别的地方是用了“超级网络”设计:48 层解码器里,每层都塞了 4 种不同的注意力机制(全注意力、滑动窗口、Gated DeltaNet、Kimi Delta Attention),运行时可以像换挡一样选不同组...

推荐理由:一个 15B 模型靠单一检查点覆盖 8 档推理速度,吞吐跨度超过 10 倍,对实际部署的吸引力很强,H 和 K 都站得住。R 来自它把成本-延迟-质量的权衡做成可调开关,而不是让你换模型。不过这只是推理优化方向的发布,不是前沿实验室的旗舰更新,影响范围偏窄,所以 76 分、featured 合理。

OpenAI News

OpenAI 在 ChatGPT 里上线了团队版智能体,能自己跑流程、跨工具干活

OpenAI 给 ChatGPT 的企业版、教育版等付费计划加了一个叫“工作区智能体”的功能。你可以把它理解成能共享给整个团队用的自动化助手,背后由 Codex 驱动,在云端运行,人不在线它也能继续干活。它能跨多个工具(比如 Slack、CRM)执行多步骤任务,像自动筛选销售线索、写跟进邮件、每周五拉数据出报表、审核软件采购请求并生成 IT 工单。团队...

推荐理由:OpenAI 在 ChatGPT 里加了 workspace agents,等于把 Codex 塞进云端去跑跨工具的工作流,从纯聊天往团队自动化工作台又挪了一步。我会先打个折:正文没写价格、没列支持的工具、也没给延迟或成功率这些硬指标,所以重要性停在 86 分。H 打钩是因为从对话到 agent 的转变本身就有话题性;K 打钩是因为 Codex 驱动云端执行这个事实是新的,但信息缺口也明显;R 打钩是因为它直接踩在团队协作和自动化的关注点上,对做类似产品的团队会有压力。

OpenAI News

OpenAI 给 Responses API 加了 WebSocket,让 Codex 这类 agent 跑起来更快

OpenAI 发现,当模型推理速度从每秒 65 个 token 飙到近 1000 个 token 时,API 本身的处理开销反而成了拖慢 agent 循环的瓶颈。他们给 Responses API 加上了 WebSocket 支持,思路是把多次独立的 HTTP 请求换成一个长连接,在连接存活期间缓存住对话状态和可复用的上下文,只传新的工具调用结果,省掉...

推荐理由:这是 OpenAI 面向开发者的系统层更新:用 WebSocket 长连接加连接级缓存,把 agent 循环里反复建连、重复请求的开销压下去。HKR 三项都踩中了,但正文没给出延迟降了多少、吞吐多大、适合什么负载,所以只能算中等偏上的 featured,不能拉满。真正值得盯的是长连接怎么省掉往返成本,这不是换模型,是工程侧省钱省时间的优化。

量子位 · 公众号

商汤绝影把32B总参、3B激活的模型塞进车机,跑分压过GPT-5.4和Opus 4.6

商汤绝影发布了一个叫Sage的车载端侧多模态模型,总参数32B,但每次推理只激活3B参数。它在PinchBench上拿了94%,比Claude Opus 4.6的93.3%和GPT-5.4的90.5%都高。模型跑在Nvidia OrinX上,首字延迟约0.5秒,单token生成约0.03秒,吞吐80 tok/s。训练用了两个方法:SCOUT省了约60%...

推荐理由:我会先打个折:所有数据都是商汤自报,没有第三方复现,PinchBench 的对比对象和测试条件正文也没细说。但亮点在于它把 3B 激活模型塞进 OrinX,还给出了推理延迟和吞吐,这对车载场景比跑分更有参考价值。后训练省 60% GPU 小时、复杂任务完成率提 20% 这两个数,缺训练规模和消融细节,先别太激动。整体看,信息量够、落地指向明确,但验证链不完整,所以重要性给 79,放在 featured 里提醒大家关注端侧 Agent 的进展和水分。

机器之心 · 公众号

荣耀在 MagicBook 上预装 YOYO 爪,管它叫全球首款“智能体笔记本”

荣耀把 YOYO 智能体直接做进了 MagicBook 系统里,出厂自带 5 个主智能体和 23 个子智能体。官方说这套方案比外接 OpenClaw 省一半的 token 消耗,还加了本地处理、二次确认和内核级加密。说白了就是把智能体打包成笔记本默认功能,不用自己折腾部署。但正文没提具体用了哪个模型、硬件配置、卖多少钱、什么时候开卖,这些关键信息都缺着...

推荐理由:荣耀把 YOYO Claw 直接预装进 MagicBook,等于把智能体做成出厂能力,这点比跑分更有意思。文章列了 5 个主智能体、23 个子智能体,覆盖教育到内容创作,还提到本地处理、二次确认和内核级加密,信息量够硬。词元消耗降 50% 这个数我会先打个折,因为没给对比基准和测试条件。真正让我把分停在 76 的原因是正文没披露模型、硬件配置、价格和上市时间——缺了这些,没法判断实际成本和落地节奏。

Latent Space

OpenAI 发布 GPT-Image-2,图像生成模型开始能看懂文字、画 UI 和做排版了

OpenAI 正式推出了 GPT-Image-2,在 ChatGPT、Codex 和 API 里都能用。这次更新最明显的变化是文字渲染、排版和编辑能力大幅提升,能直接生成幻灯片、信息图、UI 稿和二维码,还支持多语言。模型分“思考”和“不思考”两个版本,思考版可以自己上网搜资料、生成多个候选图并自我检查。在 Arena 的图像排行榜上,GPT-Imag...

推荐理由:OpenAI 把 GPT-Image-2 同时铺到 ChatGPT、Codex 和 API,还特意强调 thinking 版本和文字渲染、布局编辑这些实用能力。Arena 上 Elo 1512、领先第二名 242 分,这个差距不小,说明在盲测里用户确实更愿意选它。我会先打个折——Arena 分数受采样和用户群影响,不能直接当绝对性能看,但三个第一同时拿下,至少说明在文生图这个赛道上它目前压了别人一头。对从业者来说,能不能稳定出可编辑、多语、带 QR 码的图,比单纯画质更重要,这条更新直接踩中了选型决策点。

TechCrunch · AI

Meta 要记录员工鼠标和键盘操作,拿来训练自家 AI 模型

Meta 搞了个内部工具,会抓取员工在特定应用里的鼠标移动、点击和按键操作,把这些真实操作数据喂给 AI 模型,目的是让模型学会怎么帮人完成日常电脑任务。公司说数据有保护措施,不会用于其他目的,但正文没披露具体抓取范围、员工是否知情同意、数据保留多久。标题写了记录按键,但 Meta 的声明里只明确提到鼠标移动和点击,按键这块的细节是缺失的。

推荐理由:我会先打个折:标题说击键,正文只确认了鼠标和点击信号,击键到底录没录、录多少,正文没披露。这点先别太激动。但即便只看鼠标和点击,Meta 把员工操作行为直接喂给模型训练,这事本身就够有话题性。正文没提采集范围、员工同意机制、数据保留多久,这些空白才是真正该盯的。所以重要性给 80,不上 P1,因为关键细节还缺着,但 hook、新知和争议性都到位了。

X · @dotey(宝玉)

Anthropic 没发公告,悄悄把 Claude Code 从 20 美元 Pro 套餐里拿掉了

有人在 Anthropic 的功能对比表里发现,Pro 套餐对应的 Claude Code 一栏变成了叉号,多篇帮助文档也删掉了“Pro 套餐包含 Claude Code”的说法。但 Claude Code 产品页面和客服机器人还写着包含,部分 Pro 用户反馈目前仍能使用,正文没披露 Anthropic 的正式解释或生效时间。如果这个变更落地,开发者...

推荐理由:这条值得上 featured,因为门槛变化一旦落地,Claude Code 的入门价直接翻五倍,对个人开发者冲击不小。但 Anthropic 没给正式说明,生效时间和现有 Pro 用户怎么处理都不清楚,所以不往更高层级放。我会先打个折:正文没披露官方回应,现有信息都来自页面比对和用户反馈,这点先别太激动。

Hacker News 首页

Anthropic 把 Claude Code 从 20 美元月费的 Pro 套餐里拿掉了,新用户没法用

Anthropic 悄悄改了规则,新订阅 20 美元/月 Pro 套餐的用户不再包含 Claude Code 编程工具。老 Pro 和 Max 用户暂时不受影响。官方说法是“在约 2% 的新个人用户里做测试”,但帮助文档已经从“Pro 或 Max 套餐可用”改成了“Max 套餐可用”,官网定价页也同步去掉了 Pro 的 Claude Code 入口。正...

推荐理由:这条消息在三个维度上都站得住:Pro 缩水本身就是个意外转折,文章用帮助页存档和官方回应把证据链补上了,而且开发者对定价和权益变动天然敏感。我会先打个折——目前只影响新用户测试群,正式政策时间表和回溯范围正文都没披露,所以重要性停在 76 是合理的。

X · @dotey(宝玉)

OpenAI 图片生成升级到 2.0,能听懂复杂指令、写对多国文字,所有 ChatGPT 和 Codex 用户都能用了

ChatGPT 的图片生成功能今天全面升级到 2.0,免费用户也能用。这次最大的改进是能处理复杂构图了,比如带文字的 UI 界面、密集排版,小字和图标渲染比之前靠谱很多。输出分辨率最高 2K,宽高比从 3:1 到 1:3 都支持,做横幅海报可以直接出图。多语言文字生成也有提升,OpenAI 说中文、日文、阿拉伯文这些非英文文本能写得语义连贯,不再乱码。...

推荐理由:这是一次有料的 OpenAI 产品更新:ChatGPT Images 2.0 同时铺到 ChatGPT、Codex 和 gpt-image-2 API,分辨率、宽高比、非英文文字稳定性都有具体数字,thinking 模式还加了联网搜索和自检。HKR 三项全中。不过原文是短摘要式转载,没写价格,也没说 thinking 模式什么时候给 Enterprise 用,这点先别太激动。

X · @OpenAI

OpenAI 发了 ChatGPT Images 2.0,说画图更准、能直接拿来用

OpenAI 在 X 上官宣了 ChatGPT Images 2.0,定位是能处理复杂视觉任务、出图直接可用的图像模型。帖子提到三点升级:编辑更精细、版式更丰富,以及加入了“思考级智能”,但没解释这具体指什么能力。视频演示看起来效果不错,不过正文没披露模型规模、定价、延迟和推送范围,我会先打个折——等看到实测和成本再说。

推荐理由:OpenAI 官方发的帖文,信源权威性没问题,加上“Images 2.0”这个名头,话题性和行业影响都够,所以 H 和 R 都给了。但我把分压在 featured 门槛附近,因为这条帖文信息量太薄:没模型细节、没定价、没延迟、没基准测试、也没说清楚谁现在能用,K 完全站不住。真正值得盯的是可编辑性和版式控制这两点,但光靠这条帖文还远不到能复现的程度,先打个折观望。