跳到正文

#Agent

今日 36 条

4月24日星期五

X · @claudeai

Claude 新增 TripAdvisor、Booking、Resy 等十来个生活类 App 连接

Claude 官方发了一条产品更新,说现在能连接更多非工作类 App,列了 TripAdvisor、Booking.com、Resy、Instacart、Spotify、Audible、AllTrails、Thumbtack、TurboTax 等至少 10 个。正文没披露具体怎么连、能执行哪些操作、支持哪些地区、权限范围多大、什么时候推完。我会先打个折...

推荐理由:这是 Anthropic 官方产品更新,HKR 三项都踩中了。钩子是 Claude 从办公工具杀进生活消费场景,知识点是新增至少 10 个消费 App 连接器但操作细节和上线范围全都没说,关联点在于它把“助手能不能代办个人事务”这个平台级问题摆上了台面。分数维持 75,因为目前只是列了 App 名字,正文没给出可执行动作、权限边界、地区限制和发布时间,我会先打个折,等后续披露再考虑上调。

Hacker News 首页

GPT-5.5 在漏洞挖掘上追平了没公开的 Mythos,而且人人都能用

安全公司 XBOW 用真实漏洞库测了 GPT-5.5,漏报率压到 10%,比 GPT-5 的 40% 和 Opus 4.6 的 18% 都低。更关键的是,GPT-5.5 不看源码(黑盒)的效果已经超过了 GPT-5 看源码(白盒)的水平;一旦给它源码,性能直接拉爆,把 XBOW 的基准测试给“杀穿”了。在模拟登录这类实操任务里,它登录成功的交互轮次只有...

推荐理由:我会先打个折:数据来自 XBOW 自家的漏洞基准,不是 OpenAI 官方发布,所以不能当定论。但信息量够硬——GPT-5.5 在黑盒条件下漏报率只有 10%,比 GPT-5 有源码时的 40% 低了一大截,也比 Opus 4.6 的 18% 强。视觉敏锐度 97.5%,登录目标系统需要的尝试次数直接砍半,说明模型在真实攻击链里的效率明显跳了一级。XBOW 把它类比成 Mythos 级别的能力,这点先别太激动,正文没披露测试环境是否隔离、样本量多大、有没有针对性微调。不过对做攻防和安全评估的人来说,这个信号足够盯紧了:模型在没看到源码的情况下已经能...

X · @OpenAI

OpenAI 发布 GPT-5.5,强调能干活、会检查,但没给参数和跑分

OpenAI 在 X 上宣布推出 GPT-5.5,已经接入 ChatGPT 和 Codex。官方说法是它面向实际工作和 agent 场景,能理解复杂目标、调用工具、自我检查,把更多任务从头跑到尾。我会先打个折:正文没披露参数量、价格、上下文窗口和任何基准测试结果,所以现在只能看到一句“新的智能形态”和“新的干活方式”,具体强在哪、贵不贵、跑多快都还不知道。

推荐理由:OpenAI 在 ChatGPT 和 Codex 上线 GPT-5.5,属于当天必须覆盖的发布。HKR 三项全中:新模型发布本身就有话题性,正文给出了 agent 工作流和工具调用的具体方向,对日常做 AI 应用的人有直接影响。我会先打个折——参数、价格、上下文窗口和基准分正文都没披露,所以重要性停在 92,不往上拉。真正值得盯的是落地链路,不是标题里的“新一类智能”。

The Verge · AI

OpenAI 发了 GPT-5.5,说写代码更强、也更省资源

OpenAI 在 4 月 23 号公布了 GPT-5.5,主打编程和调试能力,还能跨表格、文档这些工具干活。官方说它比上个月发的 GPT-5.4 效率更高,但正文没给出具体的跑分、上下文窗口大小和定价。我会先打个折——没看到实测数据之前,这些“更强更省”的说法还不好直接当真。

推荐理由:OpenAI 发新模型是当天该追的事,而且这次把效率、编程和工具调用捆成一个升级点来讲,HKR 三项全中。正文没披露价格、上下文窗口和基准分数,所以分数停在 87 而不是 90+。我会先打个折:没跑分、没定价,光说“更强”还差点意思,但工具调用和多步骤执行这个方向本身值得盯。

Hacker News 首页

Anthropic 复盘 Claude Code 近期质量下滑:三次产品层改动惹的祸,API 没受影响

Anthropic 发了一篇事故复盘,解释了最近不少用户感觉 Claude Code 变笨、变健忘的原因。问题出在三次产品层的改动上,API 和模型本身没变。第一,3 月 4 日他们把默认的思考强度从“高”调成了“中”,想解决高思考模式下界面卡死的问题,结果用户普遍觉得模型变蠢了,4 月 7 日又改了回去。第二,3 月 26 日上线了一个缓存优化,本意...

推荐理由:Anthropic 这份事后说明给了三个具体根因、时间点和修复版本,HKR 三项都站得住。比普通产品更新更有分量,因为它暴露了默认值、记忆处理和系统提示这些非模型层的改动也能把编码体验拉下来,但本质上还是一份事故报告,不是重大突破。

4月23日星期四

The Verge · AI

AI 订阅要开始挤利润了,重度用户先挨刀

Anthropic 这个月大幅收紧了第三方工具 OpenClaw 调用 Claude 的权限,把那些把 AI 当“自动化流水线工人”用的重度用户往更贵的付费套餐里赶。公司给出的理由是系统压力太大、盈利压力也大,工程师 Boris Cherny 直说现有的订阅套餐根本不适合这种用法。不过正文没披露具体涨了多少、新限额是多少、以及这次调整波及多大范围。简单...

推荐理由:Anthropic 把 Claude 的代理用量变成定价和准入问题,直接影响工具开发者和重度用户。HKR 三项都踩中了,但正文没披露具体价格、配额和生效范围,所以分数只能给到 featured 的低段。我会先打个折,这点先别太激动——通用订阅被代理式高消耗用法挤出单独计费层,才是真正值得盯的趋势。

量子位 · 公众号

Qwen3.6-27B 开源,参数只有前代旗舰的十五分之一,但在智能体编程上反超了 397B 模型

Qwen 放出了 Qwen3.6-27B 的权重,一个 270 亿参数的稠密模型。官方说它在四项智能体编程基准上全面超过了自家上一代 3970 亿参数的旗舰 Qwen3.5-397B。具体看,SkillsBench 从 30.0 跳到 48.2,GPQA Diamond 拿到 87.8,AIME26 达到 94.1,说明模型在需要调用工具、写代码解决问...

推荐理由:这是一次有料的 Qwen 开源发布,给出了智能体编程和推理的硬分数,HKR 三项都站得住。我维持 84 分不往上加,因为正文只给了基准数字,没提上下文窗口、推理成本或独立复现结果,这些缺口让判断先打个折。

The Verge · AI

微软在 Word、Excel、PPT 里上线 Agent Mode,让 Copilot 直接动手改文档

微软这周把 Copilot 的 Agent Mode 推给了 Microsoft 365 Copilot 和 Premium 用户,不再是只回答问题的聊天框,而是能直接在文档、表格、幻灯片里执行操作。Copilot 办公副总裁 Sumit Chauhan 说,之前的基础模型不够强,没法可靠地控制应用界面。不过这篇报道没写具体能执行哪些操作、覆盖哪些地区...

推荐理由:微软把 Agent Mode 塞进 Word、Excel 和 PowerPoint,等于让 Copilot 从“陪你聊”变成“替你干”,这个转向比单纯升级模型更值得关注。高管自己承认早期模型能力不够,只能被动回答,现在才敢放代理进画布,说明技术门槛确实在降。但正文没提开放范围、定价和具体能执行哪些动作,所以我会先打个折——如果后续披露的动作列表很窄或者只限企业版,实际影响就没标题听起来那么大。

新智元 · 公众号

Anthropic 在私募二级市场报价冲到 1.05 万亿到 1.15 万亿美元,首次超过 OpenAI 的约 8800 亿美元

这个数字来自私募二级平台(比如 Forge Global)上的报价,不是新一轮融资估值。三个月前 Anthropic 的融资估值还是 3800 亿美元,现在二级市场直接翻了三倍左右。市场给出的理由是流通股少、Claude Code 和收入增长势头猛。但正文没披露实际成交量、具体收入数字,也没公司官方确认,所以这个万亿身价更像少数交易撑起来的价格,先别太当真。

推荐理由:我会先打个折:这不是官方融资估值,而是私募二级平台的报价,成交量、收入规模和公司确认都没披露,所以别太激动。但信息本身有嚼头——它把 Anthropic 从三个月前 3800 亿的融资估值直接拉到万亿级别,背后是流通股少、Claude 产品势头和投资者情绪在起作用。对从业者来说,这更像一个市场温度计,而不是一张成绩单。

新智元 · 公众号

浙大开源多智能体叙事系统 OpenStory:把孙悟空扔进大观园,几分钟后角色全跑光了

浙大放出了一个叫 OpenStory 的多智能体系统,专门用来跑开放剧情。他们搭了个 1:1 的《红楼梦》大观园沙盒,把孙悟空塞进去当变量。结果几分钟内,记忆模块就把“孙悟空滥杀无辜”这条信息广播了出去,恐惧直接压过了角色的日常行为逻辑。王熙凤被物理移除后,恐慌连锁反应让整个大观园变成了空城。这个实验暴露的是多智能体系统里记忆和共识链路有多脆。不过正文...

推荐理由:我会先打个折:正文没写用了什么模型、怎么评测、实验能不能复现,所以别急着把它当成熟系统看。但这个故事本身很直观——孙悟空 Agent 被放进《红楼梦》1:1 数字沙盒,系统用记忆模块向所有活跃角色广播“孙悟空滥杀无辜”,恐惧权重直接压过日常行为逻辑,王熙凤被物理移除后,其他 Agent 集体逃离,大观园变空城。真正值得盯的不是孙悟空有多强,而是记忆广播和共识链路太脆弱:一条消息就能让整个 Agent 社会崩掉,说明多 Agent 之间的信息传递和信任机制几乎没有韧性。对做 Agent 安全、多智能体协作的人来说,这是一个很具体的压力测试案例,暴露了...

彭博科技

阿里在通义千问 App 里接入了东航订票,用户能直接搜航班下单

阿里把中国东方航空的机票预订功能塞进了通义千问 App,用户不用跳转就能完成航班搜索和下单。这是通义千问的 agent 技术第一次开放给大型商业伙伴,意味着它从聊天助手往交易环节里走了一步。不过正文没披露具体上线地区、舱位覆盖、支付流程和双方怎么分账,所以实际体验和商业回报还得再等等看。

推荐理由:我会先打个折:正文没披露上线范围、支付流程和分成结构,所以别急着算账。但 Qwen 从纯聊天界面跨到交易闭环,是 agent 落地的硬信号。东航作为首个大型商业伙伴接入,说明阿里在推模型进业务流程干活,而不只是答问题。这点先别太激动,等看实际跑起来的订单量和客诉情况。

X · @dotey(宝玉)

微软把 Copilot 智能体模式设为 Word、Excel、PPT 默认体验,个人和家庭版也能用

微软把 Copilot 的智能体模式(Agent Mode)设成了 Word、Excel、PowerPoint 的默认打开方式,Microsoft 365 Copilot 和 Premium 订阅用户现在就能用,个人和家庭版也一样。Satya Nadella 亲自发推,拿 Excel 举例说,电子表格的价值在于信息的空间关系,给智能体这样一张画布,一条...

推荐理由:这条消息够硬:微软把 Copilot 的 Agent Mode 设成 Office 三件套的默认体验,不是小范围测试,而是所有订阅用户即刻生效,个人版和家庭版都包括。我会先打个折,这不是新模型发布,但产品更新力度很大。内测数据有零有整,Excel 参与度涨 67%、点赞率涨 65%,Word 参与度涨 52%,PowerPoint 新用户留存涨 36%,说明默认开启确实拉动了使用。更值得盯的是文档内多步执行成了默认交互,用户能预览、保留或回退改动,这点降低了试错成本。正文没披露具体技术实现细节,但分发范围和默认策略本身已经够有话题性。

Hugging Face 博客

在 Chrome 插件里跑本地 AI:一份给开发者的架构避坑指南

Hugging Face 发了一篇技术指南,拆解了他们刚做的 Chrome 插件“Transformers.js Gemma 4 浏览器助手”。核心是把 Gemma 4 E2B 模型塞进浏览器的后台 Service Worker 里本地运行,不靠云端。文章重点讲了 Manifest V3 下三个运行环境的职责划分:后台负责跑模型推理,侧边栏做聊天界面,...

推荐理由:这是一篇 Hugging Face 的实操教程,不是模型或平台发布,但把 MV3 架构拆解得挺具体。我会先打个折,因为正文没给出实际延迟或内存占用的测试数据,效果验证还缺一块。不过对想在前端跑本地模型的开发者来说,这篇的工程参考价值够得上 featured 门槛。

FT · 科技

特斯拉把资本支出计划提到 250 亿美元,马斯克在 AI 上继续加注

特斯拉把资本支出计划上调到 250 亿美元,马斯克要把更多钱砸向 AI 相关项目。从 RSS 片段看,这些项目包括自动驾驶出租车、卡车、机器人以及芯片工厂,增幅被形容为“非常显著”。不过正文被付费墙挡住,没披露这笔钱覆盖的时间范围、具体怎么分项,也没提模型细节。能确定的一个信号是:特斯拉在投的不只是训练模型,而是从芯片到终端产品的整套体系。

推荐理由:FT报了一个具体的资本支出跳升数字,直接关联自动驾驶出租车、卡车、机器人和芯片工厂。我会先打个折:时间范围和分项花销都没给,模型细节也缺,所以不是必写级别。但250亿这个数够大,而且投向的是车、机器人和芯片产能整条链,不是只训模型,战略意义摆在那。HKR三项都踩中了,只是信息缺口让它停在featured中段。

The Verge · AI

OpenAI 把能自己干活的定制机器人开放给团队用了

OpenAI 把 ChatGPT 里的“工作区代理”功能下放给了 Business、Enterprise、Edu 和 Teachers 套餐。团队现在可以搭一个定制机器人,让它自己在云端跑任务,比如上网搜产品反馈、整理成报告发到 Slack,或者在 Gmail 里草拟跟进销售的邮件。这跟以前一问一答的聊天不一样,机器人能直接进到业务流程里干活了。不过正...

推荐理由:OpenAI 把 ChatGPT 从聊天框推进到团队工作流代理,HKR 三项都踩中:钩子够强,文章补了计划覆盖和任务示例,也切中企业自动化需求。没给 P1 是因为价格、铺开细节和能力边界正文都没披露,我会先打个折。

X · @dotey(宝玉)

OpenAI 在 ChatGPT 里上线工作区智能体,能跨工具自动干活,目前只给付费企业用户试用

OpenAI 给付费企业版 ChatGPT 加了个叫“工作区智能体”的功能,你可以用自然语言描述一套工作流程,它就能在后台自动跑起来,比如筛选销售线索、汇总工单、定时出报告。它跟之前自定义 GPT 最大的区别是能直接连 Slack、Gmail、Salesforce 这些工具,不光读信息,还能动手更新工单、建文档、回消息。管理员可以设权限和审批节点,不是...

推荐理由:OpenAI 把 ChatGPT 从对话工具往企业工作流里推了一步,这次放出的工作区智能体可以跨多个常用办公软件自动执行任务,比如更新工单、回 Slack 消息。我会先打个折:目前还是研究预览,正文没写定价、调用次数上限和哪些地区能用,所以别急着算投入产出。但管理员侧的权限和审批设计是实打实的信号,说明 OpenAI 在认真考虑企业治理需求,这点值得盯后续落地细节。

Latent Space

Shopify 的 AI 用量在 2026 年爆发,CTO 聊了无限 Opus-4.6 预算和内部工具 Tangle、Tangent、SimGym

Shopify CTO Mikhail Parakhin 在这期播客里详细拆解了公司怎么把 AI 用进骨子里。他说 2025 年 12 月模型质量有个明显跃升,之后内部 AI 工具的使用量就炸了,而且命令行工具的增长比传统 IDE 插件还猛。现在写代码已经不是瓶颈,瓶颈变成了代码审查、CI/CD 流程和部署稳定性,所以他们自己搞了一套 AI 代码审查系...

推荐理由:这篇是 Shopify CTO 的深度访谈,信息密度高,没有公关腔。我会先打个折:正文没披露 2026 年使用激增的具体数据,所以不能当硬证据用。但真正值得盯的是他们内部把 AI 编程的瓶颈从生成代码推到了评审和部署环节,这个判断对从业者比一个孤立的增长数字更有用。三个内部项目名字和定位都给了,不是空泛的趋势发言。整体属于有料、有判断、缺一点量化验证的优质一手信源,放在 featured 没问题。

Hacker News 首页

OpenAI 在 ChatGPT 企业版里上线了能自己干活的“工作区智能体”,目前是研究预览版

OpenAI 给 ChatGPT Business、Enterprise、Edu 和 Teachers 套餐加了一个叫 Workspace agents 的功能。你可以把它理解成在聊天工具里建一个能自动跑流程的助手:建一次就能共享给全团队,可以定时执行重复任务(比如整理销售线索、生成报表),也能直接操作 Slack、Google Drive、微软系应用...

推荐理由:OpenAI 放出了一个实打实的企业代理预览,HKR 三项全中:钩子是跨应用工作流自动化,正文给了治理控制的具体名目,又切中了企业采纳的核心顾虑。没给 P1 是因为价格、模型规格、上线时间全都没说,实际效果也还没验证,所以先打个折。

Hacker News 首页

Flipbook:一个完全由图片模型实时生成的无限视觉浏览器

Flipbook 把整个网页变成一张张像素图片,你点击任何地方,它都会生成一张更深一层的新图片,没有 HTML、没有代码、没有文字图层。所有文字都是图片模型直接画出来的,所以偶尔会画歪或写错,这点随着模型变强会改善。内容来自智能体联网搜索和模型自己的知识,准确度大概跟用 ChatGPT、Gemini 这类对话产品查到的差不多。团队说他们做这个是因为现在...

推荐理由:我会先打个折:正文没披露延迟、成本、模型栈和实际用量,所以分数停在 76。但 Flipbook 这个实验值得盯,因为它把网站变成了一串实时生成的像素图,点击哪里就继续画哪里,连文字都是画出来的,不是叠上去的。信息来自 agentic 网页搜索加模型知识,交互机制比普通生成式 UI 激进得多。视频流功能目前还是高耗资源的实验开关,这点先别太激动。

X · @OpenAI

OpenAI 在 ChatGPT 里加了“工作区 agent”,一个能跨工具、跨团队跑长任务的共享助手

OpenAI 发了一条推,说 ChatGPT 现在有 workspace agents,可以当成团队共享的助手,处理复杂任务和跑长时间的工作流。正文没披露具体支持哪些工具、怎么收费、什么账号能用、权限怎么管、什么时候推。我会先打个折:共享 agent 的协作边界才是关键,比如它能看到什么数据、谁能改它的指令,这些都没说,光看标题别太激动。

推荐理由:OpenAI 自己发的产品预告,共享代理这个方向比普通助手更新鲜,H 和 R 都站得住。但正文只给了概念,没给任何落地细节,所以 K 分不高,整体放在 featured 而不是更高。我会先打个折,等工具权限和定价出来再重新判断。

Hacker News 首页

Zed 编辑器推出并行 Agent 功能,一个窗口里能同时跑多个 AI 助手

Zed 在 4 月 22 日更新了并行 Agent 功能,核心是在一个窗口里同时跑多个 AI 助手干活。新增的线程侧边栏可以给每个线程单独设置能访问哪些文件夹和代码仓库,还能随时停止、归档或新建线程。默认界面布局也改了,线程和 Agent 面板挪到了左边,项目文件树挪到右边,老用户需要手动切换才会生效。Zed 团队说这个设计是为了让开发者既能用 AI ...

推荐理由:Zed 官方产品更新,HKR 三项都踩实了:并行 agent 加线程级权限隔离。分数停在 76 是因为正文没给性能对比、价格影响、用户量或外部验证,目前还只是单个工具自己的迭代,我会先打个折。

Hacker News 首页

有创业公司开始炫耀 AI 账单比员工工资还高,把 token 花费当成增长指标

Swan AI 的 CEO 发帖说,他们 4 个人的团队一个月给 Claude 花了 11.3 万美元,他把这笔钱看作本该用来招人的预算,目标是不到 10 个人做到 1000 万美元年收入。Fundable AI 的联合创始人也在底下附和,说 AI 能顶一个 15 人的文档处理团队。文章点出一个风向:token 花费正在被当成一种新的虚荣指标,但花得多...

推荐理由:我会先打个折:这篇不是硬核技术进展,而是一篇评论性质的趋势观察。H 分给得高,是因为它把“AI 账单超过人力成本”这个反转直接摆到台面上,容易引发讨论。K 分靠的是 Swan AI 那个 11.3 万美元/月的 Claude 账单,数字够具体,能让人直观感受小团队在模型调用上的投入有多猛。R 分确实有,它踩中了“用 token 消耗替代人头”的焦虑,但正文自己也承认这更像一种增长指标而非已验证的 ROI,Fundable AI 说能替代 15 人团队的说法也没给出验证细节,所以不能当市场级事件来推。整体判断:值得从业者看一眼,但别急着把它当成行业拐点。

4月22日星期三

The Verge · AI

Meta 开始记录员工电脑操作,用来训练能替你干活的 AI 助手

Meta 在美国员工的工作电脑上装了一个叫 MCI 的工具,会记录鼠标移动、点击、键盘输入,还会偶尔截屏。这些数据不是用来考核绩效,而是喂给 AI 模型,教它们像人一样操作电脑,以后自动处理员工现在做的重复性工作。Meta 说不会拿来做绩效评估,但正文没提数据会保留多久、员工能不能选择不用,也没说会不会推广到美国以外的地区。

推荐理由:我会先打个折:这不是产品发布或模型开源,而是一条内部工具被路透社挖出来的报道,所以信息缺口很明显。正文只说了美国员工和工作应用,保留多久、能不能退出、范围会不会扩大都没提。但这件事的传播力很强——Meta 直接拿员工的操作痕迹去教 agent 怎么像人一样用电脑,而且明确说数据不用于绩效考核,反而让人更想知道采集边界到底在哪。如果是真的,这种数据比外包标注便宜得多,但隐私和劳资关系的雷也埋得深。

Hacker News 首页

Qwen 开源 27B 稠密模型,编程能力超过自家 397B 的 MoE 老旗舰

Qwen 放出了 Qwen3.6-27B,一个 270 亿参数的稠密模型,主打编程,而且直接开源。它最狠的地方是跑分超过了上一代 3970 亿总参数(每次激活 170 亿)的 MoE 模型 Qwen3.5-397B-A17B。在 SWE-bench Verified 上拿了 77.2 分,比老旗舰的 76.2 高;在 Terminal-Bench 2....

推荐理由:Qwen3.6-27B 是一次有分量的开源模型发布,权重直接可下,编程基准分数明确,而且走的是稠密路线而非更大的 MoE。对 AI 从业者来说,这意味着用更低的部署成本去试一个旗舰级编程模型。HKR 三项都站得住,按规则,国内大模型的重要发布应该和同等美国实验室的发布给到同一档分数。

OpenAI News

OpenAI 在 ChatGPT 里上线了团队版智能体,能自己跑流程、跨工具干活

OpenAI 给 ChatGPT 的企业版、教育版等付费计划加了一个叫“工作区智能体”的功能。你可以把它理解成能共享给整个团队用的自动化助手,背后由 Codex 驱动,在云端运行,人不在线它也能继续干活。它能跨多个工具(比如 Slack、CRM)执行多步骤任务,像自动筛选销售线索、写跟进邮件、每周五拉数据出报表、审核软件采购请求并生成 IT 工单。团队...

推荐理由:OpenAI 在 ChatGPT 里加了 workspace agents,等于把 Codex 塞进云端去跑跨工具的工作流,从纯聊天往团队自动化工作台又挪了一步。我会先打个折:正文没写价格、没列支持的工具、也没给延迟或成功率这些硬指标,所以重要性停在 86 分。H 打钩是因为从对话到 agent 的转变本身就有话题性;K 打钩是因为 Codex 驱动云端执行这个事实是新的,但信息缺口也明显;R 打钩是因为它直接踩在团队协作和自动化的关注点上,对做类似产品的团队会有压力。

OpenAI News

OpenAI 给 Responses API 加了 WebSocket,让 Codex 这类 agent 跑起来更快

OpenAI 发现,当模型推理速度从每秒 65 个 token 飙到近 1000 个 token 时,API 本身的处理开销反而成了拖慢 agent 循环的瓶颈。他们给 Responses API 加上了 WebSocket 支持,思路是把多次独立的 HTTP 请求换成一个长连接,在连接存活期间缓存住对话状态和可复用的上下文,只传新的工具调用结果,省掉...

推荐理由:这是 OpenAI 面向开发者的系统层更新:用 WebSocket 长连接加连接级缓存,把 agent 循环里反复建连、重复请求的开销压下去。HKR 三项都踩中了,但正文没给出延迟降了多少、吞吐多大、适合什么负载,所以只能算中等偏上的 featured,不能拉满。真正值得盯的是长连接怎么省掉往返成本,这不是换模型,是工程侧省钱省时间的优化。

量子位 · 公众号

商汤绝影把32B总参、3B激活的模型塞进车机,跑分压过GPT-5.4和Opus 4.6

商汤绝影发布了一个叫Sage的车载端侧多模态模型,总参数32B,但每次推理只激活3B参数。它在PinchBench上拿了94%,比Claude Opus 4.6的93.3%和GPT-5.4的90.5%都高。模型跑在Nvidia OrinX上,首字延迟约0.5秒,单token生成约0.03秒,吞吐80 tok/s。训练用了两个方法:SCOUT省了约60%...

推荐理由:我会先打个折:所有数据都是商汤自报,没有第三方复现,PinchBench 的对比对象和测试条件正文也没细说。但亮点在于它把 3B 激活模型塞进 OrinX,还给出了推理延迟和吞吐,这对车载场景比跑分更有参考价值。后训练省 60% GPU 小时、复杂任务完成率提 20% 这两个数,缺训练规模和消融细节,先别太激动。整体看,信息量够、落地指向明确,但验证链不完整,所以重要性给 79,放在 featured 里提醒大家关注端侧 Agent 的进展和水分。

机器之心 · 公众号

荣耀在 MagicBook 上预装 YOYO 爪,管它叫全球首款“智能体笔记本”

荣耀把 YOYO 智能体直接做进了 MagicBook 系统里,出厂自带 5 个主智能体和 23 个子智能体。官方说这套方案比外接 OpenClaw 省一半的 token 消耗,还加了本地处理、二次确认和内核级加密。说白了就是把智能体打包成笔记本默认功能,不用自己折腾部署。但正文没提具体用了哪个模型、硬件配置、卖多少钱、什么时候开卖,这些关键信息都缺着...

推荐理由:荣耀把 YOYO Claw 直接预装进 MagicBook,等于把智能体做成出厂能力,这点比跑分更有意思。文章列了 5 个主智能体、23 个子智能体,覆盖教育到内容创作,还提到本地处理、二次确认和内核级加密,信息量够硬。词元消耗降 50% 这个数我会先打个折,因为没给对比基准和测试条件。真正让我把分停在 76 的原因是正文没披露模型、硬件配置、价格和上市时间——缺了这些,没法判断实际成本和落地节奏。

The Verge · AI

SpaceX 签了个“可能买也可能不买”的协议,标的 Cursor,开价 600 亿美元

SpaceX 跟 AI 编程工具 Cursor 达成了一个二选一的交易框架:要么花 600 亿美元把 Cursor 买下来,要么付 100 亿美元分手费走人。文章没披露具体的交易结构、时间表,也没说跟 SpaceX 传闻中的 IPO 怎么挂钩。RSS 摘要里提了一句,这笔交易可能帮马斯克旗下的 xAI 在编程工具上追赶 Anthropic,但正文里没展...

推荐理由:标题说可能收购,但真正有信息量的是那笔 100 亿美元退出费——它更像一个约束机制,而不是简单的“不买了就赔钱”。正文只披露了顶层的两个数字,交易怎么设计、什么时候推进、跟 xAI 追 Anthropic 之间到底什么关系,全都没说。所以我会先打个折:事实够硬,但缺口也大,放在 featured 合适,别拔到 P1。

X · @dotey(宝玉)

Google 把 Gemini Deep Research 拆成两个版本:一个求快求省,一个烧算力出深度报告

Google 把 Gemini Deep Research 拆成了标准版和 Max 版,背后都是 Gemini 3.1 Pro 模型。标准版走速度和成本优先路线,适合嵌在产品里做即问即答;Max 版会反复搜索、推理、打磨报告,官方举的例子是分析师下班前丢一个尽调任务,第二天早上收完整报告。这次最大的变化是支持 MCP,能把 FactSet、S&P、Pi...

推荐理由:这是一次有分量的产品更新:Gemini Deep Research 拆成标准版和 Max 版,在付费 API 里公开预览,标准版偏速度和成本,Max 版给更多算力、反复搜索和推理。HKR 三项都站得住,但官方没公布定价、调用限制和两版实际性能差距,所以分数压在 78-84 这个区间。

4月21日星期二

量子位 · 公众号

蚂蚁数科搞了个叫“大象”的百亿参数模型,跑分和效率都挺能打

蚂蚁集团的 Inclusion AI 团队被扒出是神秘模型“大象”的幕后作者。这个模型参数量 100B,上下文窗口 256K,一次能吐 32K 字,已经在 OpenRouter 上架。文章里测了修 bug、总结三千字会议纪要、跑轻量 agent 流程,效果都不错。AI BENCHY 跑分显示它平均每秒能出 2500 个 token,延迟大概 1 秒,一...

推荐理由:一个 100B 模型敢喊同规模 SOTA 还强调 Token 效率,钩子够硬。文章有实测数据也有失败案例,不是纯吹。训练细节、价格和官方模型卡都没披露,所以先别太激动,但方向值得跟。

Hacker News 首页

Brex 开源 CrabTrap:给 AI 智能体加一个 HTTP 代理,用 LLM 当裁判实时拦截危险请求

Brex 把内部用的安全工具 CrabTrap 开源了。它本质上是一个 HTTP 代理,插在你的 AI 智能体和外部服务之间,每次智能体要发请求都得先过它这关。它会对照你写的安全策略做判断,允许或拦截,而且判断方式分两条路:先走静态规则直接匹配,匹配不上再交给一个 LLM 裁判来拍板。后台日志会标清楚每个决定是规则拦的,还是模型判的。部署起来很快,官方...

推荐理由:这篇东西的看点不在开源本身,而在执行面选在了 HTTP 代理层。对从业者来说,这比 SDK 内置检查更通用,但正文没给延迟和误判数据,我会先打个折。钩子够抓人,机制也实在,所以 HKR 全亮,但分数停在 78 是因为关键性能指标全缺,别太激动。

Google DeepMind

Google DeepMind 与埃森哲、贝恩、BCG、德勤、麦肯锡合作加速企业 AI 转型

Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助全球企业规模化落地前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。

机器之心 · 公众号

谢尔盖·布林重回一线盯 AI 编程,谷歌拉了一支突击队

谷歌悄悄组了一支 AI 编程突击队,由前 DeepMind 研究员 Sebastian Borgeaud 带队,谢尔盖·布林和 Koray Kavukcuoglu 直接参与,目标是提升长上下文编程能力和内部代码自动化。压力信号很直接:谷歌自己说约 50% 的代码已由编程 agent 生成、工程师负责审核,而 Anthropic 那边放话 Claude ...

推荐理由:HKR 三项都成立:布林回归的 hook 够强,谷歌 50% 代码由 agent 写的数字是硬信息,AI 编程的竞争态势也是圈内真痛点。但正文没披露团队规模、上线时间和具体模型版本,所以没给更高优先级。

新智元 · 公众号

智能体团队不是人多就好:新综述从三个维度拆解大规模 Agent 网络的扩展瓶颈

埃默里大学、牛津大学和格里菲斯大学的研究人员发了一篇综述,把大规模智能体网络拆成三个维度来看:拓扑结构(怎么连)、记忆范围(能记住多少上下文)和更新行为(信息怎么刷新)。他们按这个框架把现有系统分成 8 类,指出真正的扩展瓶颈不光是通信协议,更在于不同智能体对世界的理解不一致。正文没披露具体实验数据,但提到现在的评测基准规模都偏小,而实际部署可能要面对...

推荐理由:这篇综述的价值在于把“智能体多了反而乱”这个模糊经验,用三维框架和 8 类系统做了结构化梳理。我会先打个折,因为它是综述而非实测,没有给出具体性能数字或成本对比。但“世界模型不一致才是瓶颈”这个判断,对正在搭多智能体系统的团队有直接参考意义,能帮他们少走弯路。正文也坦承现有基准大多只测小规模,未来上千到上百万智能体的真实表现还是未知数,这点先别太激动。

新智元 · 公众号

OpenAI 给 Codex 加了屏幕读取功能,奥特曼说这是“心灵感应”的第一步

OpenAI 在 4 月 21 日上线了 Codex 的 Chronicle 研究预览版,目前只开放给 ChatGPT Pro 用户,且仅限 Mac 端。它可以直接读取你最近的屏幕内容,省去反复交代背景信息的麻烦。OpenAI 声称数据“主要在本地处理”,但 The Next Web 报道指出部分情况会借助云端,截图会上传,本地记忆也未加密,上传比例和...

推荐理由:我会先打个折:这只是研究预览,功能边界和隐私细节都还模糊。但钩子够狠——Codex 开始读屏幕而不是等你喂上下文,等于把 agent 的记忆层从“你告诉它”推到“它自己看”。正文没披露云端辅助的具体触发条件和数据留存策略,这点先别太激动。对从业者来说,真正值得盯的是屏幕状态变成持续输入后,工作流设计和安全边界要怎么重画。

新智元 · 公众号

华为发布 Pura X Max,首发小艺伴随式 AI,能跨 App 读屏、记待办

华为在 4 月 20 日发布了 Pura X Max,同时推出鸿蒙 6.1 上的小艺伴随式 AI。调用方式有两种:双击导航条或语音唤醒。它能在你同意后读取屏幕内容,把不同 App 里的任务收进日历,还能直接联动高德地图和滴滴。核心卖点是系统级的跨应用操作和常驻侧边栏交互。正文没提价格、具体机型参数和覆盖范围,所以实际体验和稳定性还得等上手再看。

推荐理由:我会先打个折:正文没给价格、模型参数和适配覆盖率,所以只放在 featured 而不是更高。但 HKR 三条全中——常驻读屏助手这个钩子够强,操作流程和隐私开关写得明白,而且它踩中了 OS 级 agent 可能改写移动平台规则的那个点。

Latent Space

月之暗面发布 Kimi K2.6 开源模型,在长任务执行上对标 Claude Opus 4.6

月之暗面推出了 Kimi K2.6,一个总参数 1 万亿的混合专家模型,每次推理激活 320 亿参数,支持 25.6 万 token 的上下文窗口。它主打的是长时间、多步骤的智能体任务,官方宣称能连续跑 12 小时以上、调用超 4000 次工具、并行管理 300 个子智能体。在 SWE-Bench Pro 编程基准上得分 58.6,HLE 带工具得分 ...

推荐理由:我会先打个折:SWE-Bench Pro 58.6 这个数正文没给对比基线,不知道和 Opus 4.6 的差距到底多大,这点先别太激动。但 Kimi K2.6 真正值得盯的不是基座跑分,而是它把 agent 执行时长拉到 12 小时、能并行跑 300 个子代理,这在开源模型里算往前拱了一步。国内大模型旗舰发布本身就自带信号,加上抢在 DeepSeek v4 前出牌,对关注开源模型进展的人有信息差价值,所以给到 P1。

X · @dotey(宝玉)

OpenAI 给 Codex 加了 Chronicle,让它能“看”屏幕记住你在做什么

OpenAI 在 macOS 版 ChatGPT Pro 里灰度测试 Chronicle,这是 Codex 的 Memories 扩展。它会后台定时截屏、做 OCR、识别你用的工具,把近期屏幕活动整理成记忆,存为本地 Markdown 文件。你跟它说“这个报错”,它不用你解释就知道指什么。但要注意几点:后台 Agent 一直跑会很快吃掉 rate li...

推荐理由:OpenAI 让 Codex 能定时截屏、OCR 识别屏幕内容,然后写成记忆存到本地。这个功能目前只给 macOS 上的 ChatGPT Pro 用户灰度开放,欧盟、英国、瑞士用不了。我会先打个折:截图上传服务器处理后声称会删除、不用于训练,但官方自己也警告会放大网页 prompt 注入,而且记忆以明文 Markdown 放在 ~/.codex 目录下,泄露面不小。后台总结还会消耗 rate limit,这点先别太激动。整体信息量够、有可测试的细节,但受限于小范围灰度,所以放在 featured 而不是 p1。

The Verge · AI

Epic 给《堡垒之夜》创作者发了 AI 角色工具,但明令禁止和 NPC 谈恋爱

Epic 在《堡垒之夜》里上线了一个叫“对话”的工具,让创作者可以把自己岛上的 NPC 变成能自由聊天的 AI 角色。创作者用提示词设定角色的人设、知识范围、行为和声音,玩家就能跟 NPC 进行不按剧本走的对话。标题特意警告“别想和 AI 约会”,但正文没具体说防越狱和内容审核机制到底怎么做的。去年 Epic 在游戏里试水过 AI 版达斯·维达,结果角...

推荐理由:Epic 给 Fortnite 创作者发了个新工具,能让岛上的 NPC 跟玩家自由聊天,用提示词定人设、知识和行为,还能选语音。标题特意警告别拿来搞约会对象,但正文没写具体怎么审核、什么话不能说,也没提成本和用的哪家模型。我会先打个折:可控性才是重点,不是“会聊天”本身。