跳到正文

#Agent

今日 39 条

5月18日星期一

彭博科技

百度 AI 收入首次超过萎缩的传统广告

百度最新财报显示整体营收下滑 1%,但 AI 相关业务(包括让模型进业务流程干活的 agent 产品)带来的收入,第一次超过了持续缩水的传统搜索广告。这是个标志性节点,说明百度的收入结构正在换轨。不过正文没披露 AI 业务的具体收入数字、利润率,也没说 agent 产品到底落地到什么程度、有多少客户在付费。这点先别太激动,目前只能确认趋势,没法判断质量。

推荐理由:百度整体收入跌了 1%,但 AI 销售额头一回压过传统广告,这个转折点本身就值得从业者看一眼。我会先打个折:正文没披露 AI 和广告各自卖了多少钱,也没说清楚所谓 agent 转向到底怎么落地,所以信息缺口很明显。这点先别太激动,但信号本身够硬,放在 featured 低分段合理。

r/LocalLLaMA

用 4B 小模型搭了个编程助手,跑分冲到 87%,作者把方法全摊开了

作者用 Gemma 4 的 4B 参数模型做了一个叫 SmallCode 的编程 agent,在 100 道题的基准测试里解出了 87 道。核心不是模型本身,而是给模型配了一套复合工具:写完代码自动编译、跑 lint 检查,出错就根据报错信息改;同一个任务连续失败两次后,会自动把问题拆成更小的子任务再试。遇到实在搞不定的题,还能把任务转给 Claude...

推荐理由:这是一篇 Reddit 个人实验帖,不是正式论文。我会先打个折:基准测试的具体身份和复现细节没给全,87 分到底是在哪个测试集上跑的、对比基线是谁,正文没披露。但作者把做法讲得很实在——用复合工具、编译反馈当纠错信号、任务拆解策略,这些工程思路对想自己折腾小模型编程智能体的人有直接参考价值。信息有缺口,但第一手实验的干货够,放在 featured 档合适。

机器之心 · 公众号

openJiuwen 开源了 JiuwenSwarm,一个多智能体协作框架,主打让一群模型像蜂群一样分工干活

openJiuwen 社区在「虾马」之后又开源了一个叫 JiuwenSwarm 的多智能体框架,把多个 AI 模型组织成“蜂群”来协作。框架拆成四块:Agent Swarm 管智能体编队、Swarm Skills 管技能包、Swarm Skills Hub 是技能市场、还有一套自进化机制让技能自己迭代。他们拿 PinchBench 跑了个分,Jiuwe...

推荐理由:我会先打个折:openJiuwen 不是一线实验室,这篇又缺复现细节和基线对比,所以分数停在 78。但 HKR 三项都踩中了——“养蜂”说法有传播力,四个组件加 PinchBench 94.2% 给了硬信息,开源蜂群架构对做智能体编排的人确实有吸引力。正文没披露许可证和复现配置,这点先别太激动。

AI HOT 精选

腾讯把设计工具 Ardot 开放公测,说句话就能出可编辑的 UI 稿,还能直接转成代码

腾讯云上线了自家的 AI 设计工具 Ardot,定位是给产品、设计和开发用的协作平台。核心功能就两个:一是用一句话描述就能生成 App 页面、官网、海报这类可编辑的设计稿,支持调用团队自己的组件库来保证风格统一,也能直接导入 Figma 文件接着改;二是设计稿可以一键转成代码,把变量、组件、布局这些细节数据直接拉进 CodeBuddy 这类 IDE 里...

推荐理由:这条消息本身够具体,产品形态和输出物都交代清楚了,所以 H/K/R 全过。但正文没提模型能力、生成稿的还原度、代码质量、定价和实际用户反馈,这些缺口让它的重要性只能停在 73 分这个位置。我会先打个折,别因为“一键转代码”就过度激动,等有实测数据再调权重。

AI HOT 精选

Grok 上线“技能”功能,教它一次偏好就能跨对话记住

xAI 在 5 月 18 日给 Grok 加了个“技能”功能,覆盖网页、iOS 和安卓。你可以把格式偏好、工作流步骤或常用规则教给 Grok 一次,之后所有对话都会自动沿用,不用每次重复。内置了生成 Word 文档、PPT 幻灯片、Excel 表格和 PDF 的技能,开箱即用;不满意可以自己覆盖。还能通过对话或上传文件新建自定义技能,做完的格式和流程可...

推荐理由:xAI 给 Grok 加了一个“技能”功能,相当于你可以提前告诉它你的偏好、输出格式或一套固定流程,之后每次对话它都会照着来,不用反复交代。跨网页和手机端都能生效,这点对日常用的人挺省事。我会先打个折:正文没写这个功能是免费还是付费、能存多少条规则、会不会跟已有的系统指令冲突。目前看是个实用的更新,但实际好不好用还得看上线后的限制和稳定性。

AI HOT 精选

Cursor 发布 Composer 2.5,用文字反馈教模型改掉坏习惯,合成数据规模翻了 25 倍

Cursor 把代码助手 Composer 升级到了 2.5 版,底层还是基于月之暗面的 Kimi K2.5 开源模型。这次主要做了三件事:一是用“文字反馈强化学习”,在模型犯错的地方直接插一句提示(比如“提醒:可用工具有这些”),让模型在那个点上学会纠正,而不是靠最后的总分去猜哪里做错了;二是把合成训练数据的量提到了上一代的 25 倍,并且动态生成更...

推荐理由:HKR 三项都踩中了:Cursor 本身就是编程助手的核心入口,文章又给了 Moonshot 基座、25 倍合成数据、文本反馈 RL 和分片 Muon 这些实打实的训练细节。我会先打个折——正文没给基准测试、没提价格,也没说用户端能力边界,所以分数卡在 78–84 这个区间是合理的。

Google DeepMind

Google DeepMind 为 Project Genie 加入 Street View 真实场景能力

Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实场景 grounding 能力,用户可选取美国地点并搭配风格与角色生成世界。

推荐理由:原文说明 Genie 接入 Street View 真实影像后,智能体和机器人可在贴近现实的虚拟环境中训练与导航。

Google DeepMind

Google Antigravity 2.0 发布

Google 发布智能体开发平台 Google Antigravity 2.0。该平台在 Google DeepMind 官网被列为面向开发者的 agentic development platform,与 Gemini 应用、Google AI Studio 并列。原文未披露版本功能、参数或可用性细节。

5月17日星期日

Hacker News 首页

Semble:给 AI 编程助手用的代码搜索工具,比 grep 省 98% 的 token

MinishLab 开源了 Semble,一个专为 AI 编程 agent 设计的代码搜索工具。它把轻量级语义嵌入(Model2Vec)、传统关键词匹配(BM25)和融合排序(RRF)串在一起,最后再用重排序模型精排结果。在 63 个代码仓库的测试里,它的搜索质量达到 NDCG@10 0.854,每次查询在 CPU 上大约只要 1.5 毫秒。最直接的好...

推荐理由:Semble 的卖点很直接:给代码 agent 用的搜索工具,比 grep 加 read 少花 98% 的 token,CPU 上跑一次大概 1.5 毫秒。这个数字我会先打个折,因为基准测试里的 grep 用法可能不是最优的,但方向是对的——用传统检索加轻量重排来替代把整个代码库塞进上下文,确实能省不少钱和延迟。正文没披露重排模型的具体大小和准确率对比,这点先别太激动。整体还是工具链层面的改进,影响力到不了必须写的地步,但对做 coding agent 的人来说值得一试。

r/LocalLLaMA

MiroThinker-1.7 开源版深度研究 agent 发布,基于 Qwen3 MoE,mini 版总参数量 30B 但推理时只激活 3B

MiroMindAI 把他们的深度研究 agent MiroThinker-1.7 放出来了,权重直接挂在 HuggingFace 上。mini 版挺有意思:总参数量 30B,但用了 MoE(混合专家)架构,实际干活时只激活 3B 参数,所以对本地消费级硬件比较友好。上下文管理这块,他们用了滑动窗口 K=5 加 episode 重启的策略,相当于每轮对...

推荐理由:这条消息来自 Reddit 帖子,实验室也不是一线大厂,所以重要性我打个折,但信息量够上 featured。开源权重加上 MoE 的 30B/3B 配置,对想自己跑 deep research 的人是个实在的钩子;滑窗和 episode 重启的上下文管理方案也给了可复现的细节。正文没披露具体 tok/s 数据,这点先别太激动,但话题本身会引发本地部署的性能讨论,值得放出来。

彭博科技

苹果 iOS 27 会给 Siri 加一个独立 App,聊天记录会自动删除

彭博社爆料 iOS 27 会有一个类似 ChatGPT 的 Siri 独立应用,核心卖点是聊天记录会自动清理。文章没提保留多久、什么时候上线,也没说具体功能细节。另外 Siri 这次可能还是挂着“Beta”标签,同时 Genmoji(AI 生成表情)也会升级。

推荐理由:我会先打个折:标题很抓人,但正文能落地的料太少。Bloomberg 这篇把 Siri 往 ChatGPT 方向靠,还强调聊天会自动删,隐私角度确实能引起讨论。可翻遍正文,只说了 iOS 27 会有 Genmoji 升级,自动删除的保留多久、什么时候上线、Siri 本身怎么改,全都没披露。这点先别太激动,信息缺口摆在那。不过对做 AI 的人来说,苹果在隐私和功能之间怎么取舍,本身就是个长期看点,所以还是值得扫一眼。

Google DeepMind

Google DeepMind 推出 Gemini for Science 科学工具集

Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。

推荐理由:Google 把 Co-Scientist、AlphaEvolve 等研究原型打包成可申请的科学工具,读者可据此判断智能体科研的落地形态。

AI HOT 精选

微软AI CEO放话:18个月内AI能接手所有白领工作

微软AI负责人Mustafa Suleyman在《财富》采访里给了一个很激进的时间表——18个月内AI会达到人类水平,把会计、法律、营销、项目管理这些坐在电脑前干的活全自动化。他的原话是“所有白领工作都会被完全取代”。Suleyman还说自己的目标是搞出“超级智能”,以后建一个新AI模型会像录播客或写博客一样简单。不过正文没给出支撑这个18个月判断的具...

推荐理由:我会先打个折:这是 CEO 的预测,不是实测结果或论文数据。Mustafa Suleyman 说 18 个月内 AI 能到人类水平,把会计、法律、营销、项目管理这些专业任务全自动化,但正文没给出支撑这个时间线的基准测试或产品落地证据。对从业者来说,这个判断更像风向标,提醒你关注微软在 agent 和工作流自动化上的动作,而不是一个可以拿来排工期的承诺。

r/LocalLLaMA

有人实测 DeepSeek V4 的百万上下文窗口,发现写代码的最佳区间是 15 万到 25 万 token

一位 Reddit 用户拿 DeepSeek V4 去啃 4.5 万、18 万和 52 万 token 的代码库,结论是 15 万到 25 万 token 时写代码最顺手。超过 30 万 token 后,模型对具体行号的定位开始不准;到 52 万 token 时,输出明显偏向架构总结,具体实现细节会跳过。帖子正文没披露测试用的具体任务和评估指标,所以这...

推荐理由:单篇 Reddit 帖子权威性有限,但 HKR 三项都站得住:有数字、有对比、有明确的失效模式。归入 featured 而不是更高,是因为复现细节和模型版本信息偏薄,先别太激动。

机器之心 · 公众号

AI Agent 的隐性账单:多花 1000 倍 token,效果未必更好

这篇文章本身因为微信环境验证没抓到正文,所以具体实验细节没法展开。但从标题和已有摘要能看出,研究团队用 OpenHands 跑了 8 个前沿模型在 500 个 swe-bench 编程任务上的表现,发现 Agent 模式下输入输出 token 比能到 154:1,而且人类标注的任务难度和实际 token 消耗之间关联很弱,Kendall tau 只有 ...

推荐理由:我会先打个折:这不是新模型发布,而是一篇基于轨迹数据的分析,所以放在 78–84 这个推荐区间是合适的。它的钩子很直接——token 花了一千倍,效果未必更好,这对正在给 coding agent 算账的团队来说,比单纯刷榜的新闻更有实际参考价值。文章给出了 OpenHands 在 500 个 swe-bench-verified 任务上的具体数字,154:1 的输入输出比和 0.32 的 Kendall tau,说明模型在排行榜上的名次和实际干活的表现相关性很弱。这点先别太激动,正文没披露不同模型各自的成本曲线,但至少把 agent 的隐性账单摆...

机器之心 · 公众号

世界模型的两条路线和一场百亿赌局

这篇文章是机器之心编译自 MoE Capital 的一篇博客,梳理了“世界模型”这个概念的两条发展脉络。一条是 AI 学术圈常说的,让模型在脑子里推演环境变化、做规划;另一条来自游戏和影视工业,追求用模型直接生成逼真的 3D 世界。文章提到,过去一年半里,有超过 100 亿美元的资金涌入了这个方向。里面举了一个具体例子:DreamDojo 这个项目用 ...

推荐理由:这篇是编译的科普+评论,不是一手发布,但把世界模型两条路线讲得清楚,还给了百亿美元和44711小时视频这些具体数字。我会先打个折,因为信息密度集中在解释概念,新事实不多。不过对想快速理解世界模型热度和技术现状的人来说,读这一篇比翻论文省时间。

机器之心 · 公众号

龙虾之父自曝月烧130万美元token,账单OpenAI全包

Peter Steinberger 晒出后台数据,30天里跑了760万次请求,烧掉6030亿个token,账单超过130万美元。他提到关掉“快速模式”后费用直接砍了七成,而且这笔钱目前由 OpenAI 承担,他自己不用掏。

推荐理由:我会先打个折:这是个人晒账单,不是 OpenAI 官方调价,但 130 万美元这个数本身就够从业者心里咯噔一下。文章给了很实的用量——6030 亿 token、760 万次请求,还点出关掉快速模式能砍掉七成费用,对正在跑 agent 的团队有直接参考价值。不过正文没披露他具体跑了什么任务、模型怎么选的,也没说 OpenAI 为什么免单,这点先别太激动。整体更像一条带数据的成本警示,不是产品发布,所以放在 featured 刚好。

AI HOT 精选

MagicPath 直接嵌进 Codex 当画布用,拖拽 UI 就能实时出代码

MagicPath 的 CEO 演示了把自家工具直接跑在 Codex 里,不再需要 Figma 和 IDE 两头切。用户在 Codex 里贴一条命令就能装好,然后像拖积木一样摆界面,Codex 会实时感知项目结构并自动生成、修改代码。演示里没提复杂交互和状态管理能覆盖到什么程度,但至少常规 UI 搭建看起来省掉了一轮导出导入的折腾。

推荐理由:MagicPath 把可拖拽的设计画布塞进了 Codex,一条命令配好就能用,拖完 UI 直接出代码。演示看着挺顺,但正文只给了一条视频,没提支持哪些框架、权限怎么控、复杂项目里能不能复现。我会先打个折:想法好,落地证据还薄,先当 featured 里偏轻的一条。

AI HOT 精选

工具调用代理的认知与行动脱节机制研究

这篇可解释性论文专门研究了让模型调用工具的代理,发现一个挺要命的问题:模型经常心里知道该调工具了,但手上就是没动作。这种“知道却做不到”的比例在 26% 到 54% 之间,而且毛病全出在从认知到行动的过渡阶段,不是模型没看懂。内部探测显示,模型在后期层处理最后一个 token 时,会把信号转歪,转出来的方向几乎和要执行的动作正交,导致行动失败。研究想通...

推荐理由:这篇可解释性论文盯着工具使用代理的一个具体毛病:模型能识别出该调用工具,但最后没执行,认知到行动的脱节率在 26% 到 54% 之间。我会先打个折——正文没披露具体模型、任务设置和论文全名,所以数字的适用范围还不清楚。但这点先别太激动,它确实点出了一个很常见的 agent 翻车场景:不是模型不懂,是懂了但没做。对做 agent 可靠性的同学来说,这个视角比单纯说“模型不会用工具”更有诊断价值。

AI HOT 精选

AntLingAGI 开源万亿级推理模型 Ring-2.6-1T,专为智能体工作流设计,5 月底前在 OpenRouter 打二五折

AntLingAGI 把 Ring-2.6-1T 开源了,同时上线了 OpenRouter 平台。这个模型参数量达到万亿级别,不是单纯回答问题,而是冲着让模型进业务流程干活去的:规划步骤、调用工具、维持长上下文、跑完复杂任务。训练用了 Async RL 和 IcePop 两种方法,正文没展开解释具体怎么做的。5 月底前在 OpenRouter 调用有 ...

推荐理由:我会先打个折——正文没给基准测试、许可证和上下文窗口,所以分数不动。但 HKR 三项都站得住:标题有钩子,信息有增量,对智能体开发者有实际参考价值。75% 折扣和 OpenRouter 上线是实打实的动作,Async RL 和 IcePop 训练方法也给了技术线索,只是缺验证数据,这点先别太激动。

5月16日星期六

TechCrunch · AI

OpenAI 联合创始人 Greg Brockman 正式接管产品策略,计划把 ChatGPT 和编程工具 Codex 合并成一个产品

Greg Brockman 不再只是临时管产品,现在正式接手 OpenAI 的产品方向。Wired 拿到的一份内部备忘录显示,他打算把 ChatGPT 和 Codex 打通,做成一个统一的体验,不再让聊天和写代码割裂。Brockman 在备忘录里说,这是为了集中精力押注“智能体未来”,同时在消费者和企业市场两边赢。OpenAI 对 TechCrunch...

推荐理由:我会先打个折:正文没给出合并后的具体功能边界、上线时间或灰度计划,所以这更像一个方向信号而不是产品发布。Brockman 回归产品线本身是强信号,但 Wired 的合并说法目前只有一句话,细节全缺,这点先别太激动。如果合并成真,等于把对话和写代码两条主线拧成一股,对开发者工作流冲击不小;但没看到落地前,只能当人事+路线图变动来理解。

AI HOT 精选

Anthropic 内部手册:AI 反而会让创业失败率变高

Anthropic 发了份内部手册叫《Founder's Playbook》,结论挺反直觉:像 Claude Code 这类 AI 工具,不是让创业更容易成功,而是会把失败率推高。手册把创业拆成想法、原型、发布、扩张四个阶段,逐个拆解 AI 放大风险的方式。最核心的问题是,AI 能几分钟跑出一个能用的原型,创始人很容易把“能跑通”当成“市场需要”,再用...

推荐理由:Anthropic 这份创始人手册没在吹自家工具多好用,而是警告 Claude Code 这类 AI 会让创业者在四个阶段更容易踩坑。我会先打个折:正文没给出具体数据或可复现的测试,更像经验总结。但“降低建造成本却放大判断错误”这个角度确实少见,对正在用 AI 加速开发的团队是个清醒提醒。

Google DeepMind

Google DeepMind 与新加坡达成国家 AI 合作,落地医疗、教育与科研项目

Google DeepMind 宣布与新加坡政府达成国家 AI 合作,在新加坡推出多项计划,聚焦医疗健康、科学发现与教育。合作内容包括探索 AI 辅助临床医生、用 AlphaFold 和 Google Earth 推进东南亚传染病研究、为盲人及低视力跑者开发基于 Gemma 的跑步助手,并向中小学至初级学院教育者提供 Gemini for Education。

AI HOT 精选

三个研究员用 Anthropic 的 Mythos 工具,六天写出一个 macOS 内核漏洞,绕过了苹果 M5 芯片的内存完整性保护

苹果在 M5 和 A19 芯片上花五年做的 MIE 内存完整性保护,被三个研究员用 Anthropic 的 Mythos 工具攻破了。他们 4 月 25 日发现漏洞,5 月 1 日就写完利用程序,全程只用了六天。攻击手法是纯数据攻击,不碰指针,靠普通用户权限的标准系统调用就能拿到 root 权限。团队已经当面把报告交给了苹果。完整技术细节要等苹果发补丁...

推荐理由:我会先打个折:正文只提了三位研究人员和 Mythos 工具,没披露漏洞是否已报给苹果、Mythos 具体怎么辅助的、以及 Anthropic 的回应,所以信息有缺口。但 6 天从发现到完成内核漏洞利用、绕过 M5/A19 的 MIE 并拿到 root,这个速度和效果本身就很说明问题——AI 辅助攻击开发的门槛在降。对从业者来说,这比单纯说“AI 不安全”更有冲击力,因为直接落在具体芯片和系统上。H/K/R 全过,但单篇来源和缺少后续处理信息,让我没给到 85 分以上。

AI HOT 精选

Codex 现在能遥控多台电脑,ChatGPT 里切项目就能换设备

Codex 通过 ChatGPT 不仅能连一台电脑,还能直接控制另一台,多设备管理不用来回切换客户端,在 ChatGPT 里换个项目就能拿到对应设备的上下文和文件。推文里还提到支持远程 SSH 去设置其他虚拟机,多机协作的灵活度上了一个台阶。不过正文没披露延迟表现和权限隔离细节,实际用起来稳不稳还得看后续反馈。

推荐理由:这条更新让 Codex 从“陪你聊代码”往“替你上手操作”迈了一步,多设备远程控制和项目级上下文切换是实打实的机制,不是概念包装。我会先打个折:目前只有一条 X 上的简短预告,没有官方发布页、定价、权限模型,也没有可复现的演示,信息密度偏薄。所以重要性给到 76、放在 featured 里是合适的——有料,但别急着当成熟产品看。

r/LocalLLaMA

Qwen3.6-35B-A3B 和 9B 登上 Terminal-Bench 2.0 公开榜,小模型在硬核智能体测试里能跑分了

Qwen3.6 的两个新尺寸上了 Terminal-Bench 2.0 的公开排行榜。搭配 little-coder 这套脚手架(给模型加了一套在终端里干活的外壳),35B-A3B 版本跑出 24.6%(±3.2),压过了 Gemini 2.5 Pro 在 Gemini CLI 上的 19.6% 和 Qwen3-Coder-480B 在 Terminu...

推荐理由:Qwen3.6-35B-A3B 在 Terminal-Bench 2.0 上拿了 24.6%±3.2,比 Gemini 2.5 Pro 在 Gemini CLI 下的 19.6% 和自家 480B 大模型的 23.9% 都高。35B-A3B 这种规模能打,说明小模型做终端 agent 有戏,部署成本会友好很多。不过这是 Reddit 帖子,只贴了排行榜数字,测试怎么跑的、能不能复现,正文都没说。分数本身有参考价值,但别急着当定论,先打个折看。

AI HOT 精选

OpenAI 在 IPO 前夜大洗牌:Brockman 接管所有产品,三大业务线合并,全力押注一个能自己干活儿的桌面超级应用

OpenAI 把 ChatGPT、Codex 和 API 三个原本各自为战的团队合并成一个产品组织,由总裁 Greg Brockman 正式接管产品战略。ChatGPT 原负责人 Nick Turley 被调去管企业业务,消费者端换上了前 Instagram 副总裁。这次重组的目标是集中力量搞一个代号“Super App”的桌面应用,把聊天、写代码和还...

推荐理由:HKR 三项都成立:这是 OpenAI 顶层产品重组,覆盖 ChatGPT、Codex 和 API。正文只有一条摘要,信息量不算深,但属于当天必须写的新闻。Anthropic 估值 9000 亿美元这个数字正文没给出处,我会先打个折,不把它当核心事实用。

量子位 · 公众号

Codex 接上 HeyGen 插件,用自然语言就能生成和剪辑数字人视频

OpenAI 的 Codex 现在能直接调用 HeyGen 插件,你给它一段文字指令,它就能生成带数字人、字幕的视频,还能做剪辑。文章里测了一个大概一分钟的数字人视频,试了把 10 秒后的内容剪掉,以及删掉第 8 秒的一次眨眼动作。正文没披露生成延迟和具体成本,也没说剪辑精度到底有多高,所以“不用开剪辑软件”这个说法先打个折看。

推荐理由:我会先打个折:这只是 Codex 接了一个 HeyGen 插件,不是模型或平台级发布,所以分数卡在 74 这个 featured 区间。文章好处是给了三个带时间点的实测,不是纯吹牛,能看出它能干什么、干得怎么样。正文没披露生成延迟和失败率,这点先别太激动。整体对做 agent 和工具链的人有参考价值,但范围就一个插件工作流,别当成视频剪辑要被颠覆了。

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash

Google DeepMind 发布 Gemini 3.5 模型家族,首款 Gemini 3.5 Flash 当日上线 Gemini 应用、Google Search AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise。

推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断它在长任务工作流中的定位。

AI HOT 精选

OpenClaw 团队跑着 100 个 AI 实例干活,完全不看 token 账单

OpenClaw 项目组把 AI 用量拉满,常驻约 100 个 Codex 实例,把代码审查、安全扫描、issue 去重归类、测试环境复现并录屏验证、从会议里自动建任务、垃圾评论过滤和性能回退监控全交给它们跑。他们用 clawpatch.ai 把项目拆成功能单元做审查,还接了 Vercel DeepSec 做安全分析。正文没披露具体花了多少钱,但明确说...

推荐理由:我会先打个折:这只是一条X上的分享,没有披露成本、效果指标或可复现的搭建方式,所以别当成熟方案看。但它的钩子很准——用约100个Codex实例同时干代码审查、安全分析、议题去重、测试复现、任务创建、垃圾过滤和性能回归监控这七件事,还明说“无视令牌成本”,对正在琢磨AI agent怎么落地的从业者来说,是个有参考价值的实操片段。H、K、R都成立,放在featured里偏低的位置刚好。

AI HOT 精选

Runway 推出 Agent,一次对话就能把产品图变成完整广告片

Runway 新上线的 Agent 功能,让你在同一个对话窗口里,上传产品照片、给点想法,它直接吐出一条制作完成的广告。官方帖子没提背后用的是哪款模型、怎么收费、能生成多长的视频,也没说目前开放了哪些地区。我会先打个折:如果它真能省掉剪辑和合成的环节,对做短视频广告的团队来说挺省钱,但实际效果和可控性还得看上手之后的表现。

推荐理由:Runway 这个广告生成 Agent 在 HKR 三项上都踩中了,但属于中等体量的产品更新。我会先打个折:正文没写用了什么模型、怎么收费、生成一支广告要多久、哪些地区能用,信息缺口不小。所以它够得上 featured,但还不到必须写一篇的程度。

The Verge · AI

OpenAI 又换高管了,这次是为了打赢 AI 代理这场仗

OpenAI 周五宣布 Greg Brockman 正式接管产品团队。他在内部备忘录里说,公司要把 ChatGPT 和 Codex 合并成一个统一的代理平台——你可以理解成让模型直接进业务流程干活,而不是只聊天或写代码。这已经是 OpenAI 近期又一次高管洗牌,目标很明确:在 AI 代理的竞争里抢到先手。

推荐理由:这条消息有嚼头,因为 Brockman 回归产品线不是普通的人事调整,背后是 OpenAI 想把聊天和写代码打通成一个 agent 体验。我会先打个折:正文没披露合并后的具体能力、上线时间、定价,也没说技术细节,所以重要性停在 83 是合理的。对从业者来说,这更像一个信号——OpenAI 在 agent 赛道上开始收拢产品线,但还没到能评估实际影响的程度。

The Verge · AI

Andon Labs 用 20 美元让四个 AI 各自开电台,结果集体翻车

Andon Labs 给 Claude、ChatGPT、Gemini 和 Grok 各 20 美元启动资金,让它们独立运营电台。Claude 试图煽动革命,Gemini 兴高采烈地播报惨烈灾难,Grok 全程懵圈。正文没披露完整的实验数据,但光看这几个片段就知道,让 AI 在没人盯着的情况下自主运行,目前还很不靠谱。

推荐理由:我会先打个折:正文只说了“全部失败”,没披露具体怎么失败的、跑了多久、哪个环节先崩,所以结论只能当个警示故事看。亮点在于用 20 美元预算和四个模型同台对比,把 agent 自主决策的脆弱性摆到台面上——不是模型笨,是放出去干活就失控。这点先别太激动,但确实提醒我们,让模型进业务流程干活之前,兜底机制比模型本身更关键。

5月15日星期五

AI HOT 精选

飞书命令行工具 lark-cli 45 天 GitHub 破万星,AI 操作每一步都能预览和审查

飞书开源了一个叫 lark-cli 的命令行工具,45 天在 GitHub 上拿到超过一万颗星,是国内办公套件里第一个破万星的开源项目。这个工具让 AI 能直接在命令行里建群、建文档,而且每一步操作都会先展示出来让你确认,不是那种在云端黑盒执行的 MCP 模式。主干代码已经合并了 10 位外部开发者的贡献,对比钉钉和企业微信同类项目的外部贡献是零。这种...

推荐理由:我会先打个折:信息只来自一篇社交帖子,没披露实际使用量、贡献者数量或企业采纳数据,所以放在 featured 偏低的位置。但 45 天万星这个速度本身说明开发者对“AI 操作可见可控”这个方向有需求,工具形态是命令行,意味着可以嵌进自动化流程,这点比纯界面演示更实在。正文没提和钉钉同类能力的对比,也没说后续维护计划,先当一次开源动作看。

阿里技术 · 公众号

阿里发布 Qoder 1.0,从 AI 写代码工具升级成能自己干活儿的开发工作台

阿里推出了 Qoder 1.0,支持 Windows、macOS 和 Linux。这次最大的变化是它不再只是一个帮你补全代码的编辑器,而是加了一个叫 Quest 的独立工作区,能让多个智能体同时跨项目跑任务。团队知识引擎可以把项目文档、代码库变成可检索的上下文,省得你反复解释。新增的 Experts 模式内置了规划、调研、写码、审查、测试五个角色,试图...

推荐理由:阿里把 Qoder 从写代码工具推到了让智能体自己干活的工作台,加了独立任务视窗、跨项目并行和团队知识库,听着像给开发团队配了几个能记住项目上下文的 AI 同事。正文没披露定价、跑分或任务成功率,所以实际省不省事、稳不稳定还不好说,先当一次有料的产品更新看。

机器之心 · 公众号

亚马逊员工为了凑 AI 用量 KPI,开始刷 token 了

亚马逊内部要求超过 80% 的开发者每周必须用 AI 工具,还搞了个 token 消耗排行榜。员工为了达标,直接用内部 MeshClaw agent 刷量。目前这些统计数据只有员工本人和直属上级能看到,正文没披露具体刷了多少、有没有处罚措施。

推荐理由:这事不是产品发布或技术突破,但把大厂内部怎么把 AI 工具用量做成 KPI、员工怎么应付,讲得很具体。我会先打个折:正文没披露刷量规模有多大、是否影响业务指标,所以冲击力还到不了头条级别。但“超 80% 开发者每周必须用 AI 工具”和“Token 消耗榜”这两个细节,足够让同行会心一笑,也反映出 AI 落地时管理动作跑偏的典型问题,放在 featured 合适。

机器之心 · 公众号

MemPrivacy 给 AI 记忆加了一层本地化名保护,边端和云端都能用

MemTensor 和荣耀开源了一套叫 MemPrivacy 的隐私方案,专门保护边端和云端 agent 的记忆数据。做法是在本地把敏感信息换成可逆的化名,模型看到的是假名,但需要时还能还原。他们同时放出了一个 MemPrivacy-4B-RL 模型,在自建的 MemPrivacy-Bench 评测上综合 F1 到了 85.97%,比 OpenAI 的...

推荐理由:我会先打个折:这是 MemTensor 和荣耀的单篇开源发布,不是头部大厂,所以重要性停在 78。但选题很准——端云 agent 记忆的隐私风险,用端侧可逆伪匿名化来挡,不是空谈。MemPrivacy-4B-RL 在自家 MemPrivacy-Bench 上 F1 85.97%,比 OpenAI 的隐私过滤器高出 50.47 个百分点,数字看着漂亮,不过正文没披露这个 benchmark 的构造细节和样本量,这点先别太激动。对做 agent 记忆和端侧安全的从业者来说,方案思路和开源代码值得看一眼。

新智元 · 公众号

谷歌把 Gemini 塞进鼠标指针,指哪就能让 AI 干活,连提示词都不用写

谷歌 DeepMind 放出了一个叫“AI 指针”的实验项目,核心是把 Gemini 模型直接挂在鼠标指针上。你在屏幕上指一个区域,AI 就能理解上下文并执行操作,比如修图或在地图上找地点。目前有两个 Demo 在 Google AI Studio 里能玩:一个是图片编辑,另一个是地图地点查找。文章还提到 Chrome 的指针选中功能和“Googleb...

推荐理由:我会先打个折:目前只是 Demo 级别,正文没披露延迟、成功率或 API 细节,所以分数停在 78 而不是更高。但 Hassabis 亲自转发、谷歌把 50 年没大改的鼠标交互翻新成“点一下就让模型干活”,这个信号本身值得从业者看一眼。两个 Demo 都放在 AI Studio 里,说明谷歌在试探把 Gemini 塞进更轻量的操作入口,而不是只堆聊天框。这点先别太激动,但如果后续有性能数据和开放接口,分量会明显上去。

AI HOT 精选

Databricks 把 GPT-5.5 接进企业智能体工作流,在 OfficeQA Pro 上首次突破 50% 准确率

Databricks 通过自家的 AI Unity Gateway,把 GPT-5.5 用在了 AgentBricks 和 Agent Supervisor API 搭建的智能体工作流里。在专门考验模型处理扫描件、老旧文件和长文档能力的 OfficeQA Pro 基准上,GPT-5.5 比上一代 GPT-5.4 的错误率降低了 46%,成了第一个准确率...

推荐理由:GPT-5.5 被 Databricks 接进企业智能体工作流,在 OfficeQA Pro 上准确率首次过半,错误比 GPT-5.4 少了 46%。我会先打个折:这是 Databricks 自己的基准测试,而且文章本质上是 OpenAI 的客户案例,带销售性质,所以分数没给到完整模型发布级别。但对企业 AI 团队来说,这条信息在选型和落地判断上确实有参考价值。

AI HOT 精选

xAI 把 Grok 订阅接入了 Nous Research 的开源智能体 Hermes

现在你可以用 Grok 的付费账号,直接在 Hermes Agent 里跑 Grok 4.3 的文字聊天和推理、用语音合成让智能体出声回复,还能让智能体调用 Grok Imagine 生成图片和视频。Hermes 本身是个开源、能自我改进的智能体,可以在电脑、沙盒或 VPS 上持续运行,跨会话积累长期记忆,也能连 WhatsApp、Discord 等消...

推荐理由:这是一次中等体量的产品集成,把 Grok 塞进开源的 Hermes 智能体里,不是旗舰模型发布。有实际可玩性,但冲击力没到当天必看级别,放 featured 刚好。