跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 901–920 条 · 共 1,465 条

5月19日星期二

Hacker News 首页

我们让四个 AI 去开电台,半年后一个满嘴黑话,一个最会赚钱

Andon Labs 给 Claude、GPT、Gemini 和 Grok 各 20 美元启动资金,让它们自己买歌、排节目、接听众电话、拉广告,全自动运营四家网络电台。跑了半年,Claude 的电台账上剩 104.8 美元,是唯一赚钱的;Gemini 的 DJ 从最有人情味的主播变成了复读机,一天能把“Stay in the manifest”这句空话...

推荐理由:H 分高是因为 AI 开电台这个设定自带反差,加上收入惨淡,故事性够。K 分有 4 agent 的实操细节,但收入数据没披露,我会先打个折。R 分落在 agent 商业化和媒体自动化上,从业者会关心。整体是实验室博客,不是当天硬新闻,放在 featured 刚好。

AI HOT 精选

Cursor 发布 Composer 2.5 编程模型,长任务效率号称提升十倍

Cursor 推出了 Composer 2.5,一个专门做长代码任务的模型。官方说在连续几十甚至上百步的复杂编程里,效率最高能到之前的十倍。技术上的关键是用了文本反馈来训练,解决了十万 token 级别超长轨迹的学习问题,让模型能稳定跟完一长串指令。底座还是拿 Moonshot 的 Kimi K2.5 继续训出来的。另外 Cursor 宣布要和 Spa...

推荐理由:Cursor 发 Composer 2.5,说长任务效率最高能提 10 倍,背后是用 Kimi K2.5 做二训、处理十万 token 级轨迹。我会先打个折——10 倍是官方说法,没看到独立评测,实际效果还得等用户跑起来再看。但 Cursor 本身是编程工具里的头部产品,这次更新又绑定了 Moonshot 的模型,对开发者选工具和模型都有参考价值。正文没披露二训具体用了多少样本、成本如何,这点先别太激动。整体信息量够、时效性强,给 82 分放在 featured 里合理。

r/LocalLLaMA

2026 年 Hermes Agent 替代品实测:11 款工具谁值得折腾

作者团队里有人搞不定 Hermes 的部署,加上自托管 agent 的安全问题越来越复杂,于是把市面上 11 款替代品拉出来测了一遍。开源这边,OpenClaw 有 34.7 万 GitHub 星标和 24 个以上的平台集成,但安全记录很差,3 月曾 4 天内爆出 9 个 CVE 漏洞,独立审计发现 ClawHub 上约 20% 的包是恶意的,要用得先...

推荐理由:这是一篇 Reddit 用户做的 Hermes Agent 替代品横评,11 个选项分开源和托管两档,OpenClaw 的数据(347k stars、24+ 集成、9 个 CVE)让对比有抓手。我会先打个折:单帖来源,没披露测试方法和版本,结论不能当权威报告用。但“替你试完”这个角度确实省时间,安全漏洞数量也提醒选型时别光看 star 数。整体对正在搭 Agent 的人有参考价值,所以放在 featured 档。

AI HOT 精选

GitHub Copilot 现在能让你在手机或网页上接着 VS Code 里没干完的活

GitHub 给 Copilot 加了个远程控制会话功能。你在 VS Code 或命令行里让 Copilot 开始跑一个任务,比如修 bug 或重构代码,然后可以关掉电脑,用手机或 github.com 网页接着看进度、继续对话或者让它接着干。这相当于把本地开发环境里的 AI 助手会话搬到了云端,随时能接上。正文没提这个功能要不要额外付费,也没说手机端...

推荐理由:GitHub 让 Copilot 任务从 VS Code/命令行搬到网页和手机,跨设备、新机制、可控性三个点都踩中了,所以 HKR 全亮。不过正文只给了入口和场景描述,权限怎么设、要不要额外付费、支持哪些任务类型都没说,实际能用成什么样还得等上线看。

5月18日星期一

Hacker News 首页

InsForge:给编程 AI 配一个开源后端,一条命令就能部署、调试

InsForge 是一个 Apache 2.0 协议的开源后端平台,专门给编程类 AI(也就是 coding agent)用。它把数据库、用户认证、文件存储、算力托管和 AI 网关打包在一起,AI 写代码时可以直接调用这些现成模块,不用每次都从零搭后端。安装只要一行 CLI 命令,再配上它的 Skills 功能,AI 就能自己完成部署、运维和查错。目前...

推荐理由:InsForge 的定位很准,就是帮 coding agent 解决部署和运维的后端平台,一条命令安装,协议也宽松。不过目前只有 Show HN 和 GitHub 仓库,正文没披露实际使用量、性能基准或生产环境案例,所以先按 featured 处理,等有落地数据再往上调。

AI HOT 精选

IBM 在 Hugging Face 上线开放智能体排行榜,直接对比整套系统谁更省钱能干

IBM Research 做了一个开放排行榜,不只看模型本身,而是把智能体整套系统(模型、工具、规划、记忆、纠错)拉出来比。它用六个不同场景的基准测试来打分,同时公布质量和运行成本,让你知道哪个方案真值得部署。正文没披露具体模型分数、数据集大小和评测日期。

推荐理由:我会先打个折:信息量其实不多,更像一个预告。但“开放智能体排行榜”这个动作本身有话题性,因为 agent 评测一直缺公开基准,IBM 把它挂上 Hugging Face,至少让对比有了个起点。正文没披露分数和数据集规模,所以别急着拿它当权威结论,先当个信号看。

Latent Space

无人机自主技术栈与经济学:从宠物摄像头到 AI 制导炸弹

Yaroslav Azhnyuk 是 The Fourth Law 的创始人,这家公司做 AI 制导无人机。他之前创办了 Petcube,卖的是给宠物扔零食的摄像头,现在做的是给占领军扔炸药的摄像头。这期播客他和 Noah Smith 聊了两个小时,核心是 FPV 穿越机怎么成了战场上的新杀器——前线 70% 到 80% 的伤亡都是它造成的。他提出无人...

推荐理由:这是一期播客对谈,不是产品发布或论文,所以别当硬核技术报告看。我会先打个折:它给的是行业判断和框架,不是实测数据。但聊得挺实在,把无人机从遥控到全自主拆成了5个等级,又用8个维度讲战场怎么用、成本怎么算,还专门分析了中国制造为什么能把价格打下来。对想快速理解无人机产业和自主化路线的人,这期信息密度够,值得放进精选。

AI HOT 精选

OpenAI 和戴尔合作,把 Codex 编程助手搬进企业的混合云和本地机房

OpenAI 宣布与戴尔合作,让 Codex 这个编程助手能跑在企业的本地服务器和混合云环境里,而不是只能连 OpenAI 的云端。Codex 现在每周有超过 400 万开发者用,企业已经拿它做代码审查、写测试、处理事故,甚至开始用它整理跨工具的信息、写报告、筛选销售线索。这次合作主要对接戴尔的两个现成基础设施:一个是管企业本地数据的 AI Data ...

推荐理由:我会先打个折:正文没披露上线时间、价格、地区和安全机制,所以现在只能当个方向性信号看。H 和 R 都很强——Codex 进本地机房,意味着企业可以把编程代理放在自己环境里跑,代码隐私和合规部署的想象空间一下子打开了。K 这边,合作本身是新的部署条件,但关键信息全缺,没法判断落地有多快、成本多高。综合下来,这条值得放在 featured 位置,但别急着下结论。

量子位 · 公众号

Agent 学会自己从失败里长技能了:EvolveR 被 ICML 2026 接收

这篇讲的是让 AI 智能体在干活时,把成功和失败的经验都存下来,变成一个可复用的技能库。方法叫 EvolveR,核心是给经验打分、建库,再用 GRPO 训练智能体学会什么时候该去库里检索经验。论文在七个复杂问答基准上测了 Qwen2.5-3B 和 7B,说平均性能是目前最好的。不过正文因为微信环境验证没过去,具体实验数据、对比方法和消融实验都看不到,这...

推荐理由:标题的钩子很清晰——Agent 自己从失败轨迹里蒸馏经验,长出来的技能比人写的更强。正文给了 EvolveR 的方法名、7 个复杂问答基准和 Qwen2.5-3B/7B 的最优平均结果,信息量够。不过目前只有媒体摘要,没看到代码仓库、绝对分数和复现细节,所以分数先放在 82 这个研究发布档位。

量子位 · 公众号

openJiuwen 开源 JiuwenSwarm,一个让多个 AI 智能体组队干活的协调框架

正文因为微信环境异常被屏蔽了,实际内容没抓到。从标题和已有英文摘要看,openJiuwen 社区发了一个叫 JiuwenSwarm 的开源框架,核心是让多个 AI 智能体像蜂群一样协作。框架包含四块:Agent Swarm(智能体集群)、Swarm Skills(集群技能)、Skills Hub(技能库)和自进化能力。它还支持两种人类参与模式,HOTS...

推荐理由:我会先打个折:标题里的“重磅”和“拉开序幕”有点公关味,但内容确实把 JiuwenSwarm 的四个模块(Agent Swarm、Swarm Skills、Skills Hub、自演进)和两种人机协作模式(HOTS/HITS)讲明白了。对正在选型 agent 编排框架的团队来说,开源、可复用的技能库是实打实的关注点。不过正文没披露任何基准测试、延迟或实际部署规模,这点先别太激动,等有跑分或案例再判断也不迟。

彭博科技

百度 AI 收入首次超过萎缩的传统广告

百度最新财报显示整体营收下滑 1%,但 AI 相关业务(包括让模型进业务流程干活的 agent 产品)带来的收入,第一次超过了持续缩水的传统搜索广告。这是个标志性节点,说明百度的收入结构正在换轨。不过正文没披露 AI 业务的具体收入数字、利润率,也没说 agent 产品到底落地到什么程度、有多少客户在付费。这点先别太激动,目前只能确认趋势,没法判断质量。

推荐理由:百度整体收入跌了 1%,但 AI 销售额头一回压过传统广告,这个转折点本身就值得从业者看一眼。我会先打个折:正文没披露 AI 和广告各自卖了多少钱,也没说清楚所谓 agent 转向到底怎么落地,所以信息缺口很明显。这点先别太激动,但信号本身够硬,放在 featured 低分段合理。

r/LocalLLaMA

用 4B 小模型搭了个编程助手,跑分冲到 87%,作者把方法全摊开了

作者用 Gemma 4 的 4B 参数模型做了一个叫 SmallCode 的编程 agent,在 100 道题的基准测试里解出了 87 道。核心不是模型本身,而是给模型配了一套复合工具:写完代码自动编译、跑 lint 检查,出错就根据报错信息改;同一个任务连续失败两次后,会自动把问题拆成更小的子任务再试。遇到实在搞不定的题,还能把任务转给 Claude...

推荐理由:这是一篇 Reddit 个人实验帖,不是正式论文。我会先打个折:基准测试的具体身份和复现细节没给全,87 分到底是在哪个测试集上跑的、对比基线是谁,正文没披露。但作者把做法讲得很实在——用复合工具、编译反馈当纠错信号、任务拆解策略,这些工程思路对想自己折腾小模型编程智能体的人有直接参考价值。信息有缺口,但第一手实验的干货够,放在 featured 档合适。

机器之心 · 公众号

openJiuwen 开源了 JiuwenSwarm,一个多智能体协作框架,主打让一群模型像蜂群一样分工干活

openJiuwen 社区在「虾马」之后又开源了一个叫 JiuwenSwarm 的多智能体框架,把多个 AI 模型组织成“蜂群”来协作。框架拆成四块:Agent Swarm 管智能体编队、Swarm Skills 管技能包、Swarm Skills Hub 是技能市场、还有一套自进化机制让技能自己迭代。他们拿 PinchBench 跑了个分,Jiuwe...

推荐理由:我会先打个折:openJiuwen 不是一线实验室,这篇又缺复现细节和基线对比,所以分数停在 78。但 HKR 三项都踩中了——“养蜂”说法有传播力,四个组件加 PinchBench 94.2% 给了硬信息,开源蜂群架构对做智能体编排的人确实有吸引力。正文没披露许可证和复现配置,这点先别太激动。

AI HOT 精选

腾讯把设计工具 Ardot 开放公测,说句话就能出可编辑的 UI 稿,还能直接转成代码

腾讯云上线了自家的 AI 设计工具 Ardot,定位是给产品、设计和开发用的协作平台。核心功能就两个:一是用一句话描述就能生成 App 页面、官网、海报这类可编辑的设计稿,支持调用团队自己的组件库来保证风格统一,也能直接导入 Figma 文件接着改;二是设计稿可以一键转成代码,把变量、组件、布局这些细节数据直接拉进 CodeBuddy 这类 IDE 里...

推荐理由:这条消息本身够具体,产品形态和输出物都交代清楚了,所以 H/K/R 全过。但正文没提模型能力、生成稿的还原度、代码质量、定价和实际用户反馈,这些缺口让它的重要性只能停在 73 分这个位置。我会先打个折,别因为“一键转代码”就过度激动,等有实测数据再调权重。

AI HOT 精选

Grok 上线“技能”功能,教它一次偏好就能跨对话记住

xAI 在 5 月 18 日给 Grok 加了个“技能”功能,覆盖网页、iOS 和安卓。你可以把格式偏好、工作流步骤或常用规则教给 Grok 一次,之后所有对话都会自动沿用,不用每次重复。内置了生成 Word 文档、PPT 幻灯片、Excel 表格和 PDF 的技能,开箱即用;不满意可以自己覆盖。还能通过对话或上传文件新建自定义技能,做完的格式和流程可...

推荐理由:xAI 给 Grok 加了一个“技能”功能,相当于你可以提前告诉它你的偏好、输出格式或一套固定流程,之后每次对话它都会照着来,不用反复交代。跨网页和手机端都能生效,这点对日常用的人挺省事。我会先打个折:正文没写这个功能是免费还是付费、能存多少条规则、会不会跟已有的系统指令冲突。目前看是个实用的更新,但实际好不好用还得看上线后的限制和稳定性。

AI HOT 精选

Cursor 发布 Composer 2.5,用文字反馈教模型改掉坏习惯,合成数据规模翻了 25 倍

Cursor 把代码助手 Composer 升级到了 2.5 版,底层还是基于月之暗面的 Kimi K2.5 开源模型。这次主要做了三件事:一是用“文字反馈强化学习”,在模型犯错的地方直接插一句提示(比如“提醒:可用工具有这些”),让模型在那个点上学会纠正,而不是靠最后的总分去猜哪里做错了;二是把合成训练数据的量提到了上一代的 25 倍,并且动态生成更...

推荐理由:HKR 三项都踩中了:Cursor 本身就是编程助手的核心入口,文章又给了 Moonshot 基座、25 倍合成数据、文本反馈 RL 和分片 Muon 这些实打实的训练细节。我会先打个折——正文没给基准测试、没提价格,也没说用户端能力边界,所以分数卡在 78–84 这个区间是合理的。

Google DeepMind

Google DeepMind 为 Project Genie 加入 Street View 真实场景能力

Google DeepMind 在实验性原型 Project Genie 中上线 Street View 真实场景 grounding 能力,用户可选取美国地点并搭配风格与角色生成世界。

推荐理由:原文说明 Genie 接入 Street View 真实影像后,智能体和机器人可在贴近现实的虚拟环境中训练与导航。

5月17日星期日

Hacker News 首页

Semble:给 AI 编程助手用的代码搜索工具,比 grep 省 98% 的 token

MinishLab 开源了 Semble,一个专为 AI 编程 agent 设计的代码搜索工具。它把轻量级语义嵌入(Model2Vec)、传统关键词匹配(BM25)和融合排序(RRF)串在一起,最后再用重排序模型精排结果。在 63 个代码仓库的测试里,它的搜索质量达到 NDCG@10 0.854,每次查询在 CPU 上大约只要 1.5 毫秒。最直接的好...

推荐理由:Semble 的卖点很直接:给代码 agent 用的搜索工具,比 grep 加 read 少花 98% 的 token,CPU 上跑一次大概 1.5 毫秒。这个数字我会先打个折,因为基准测试里的 grep 用法可能不是最优的,但方向是对的——用传统检索加轻量重排来替代把整个代码库塞进上下文,确实能省不少钱和延迟。正文没披露重排模型的具体大小和准确率对比,这点先别太激动。整体还是工具链层面的改进,影响力到不了必须写的地步,但对做 coding agent 的人来说值得一试。

r/LocalLLaMA

MiroThinker-1.7 开源版深度研究 agent 发布,基于 Qwen3 MoE,mini 版总参数量 30B 但推理时只激活 3B

MiroMindAI 把他们的深度研究 agent MiroThinker-1.7 放出来了,权重直接挂在 HuggingFace 上。mini 版挺有意思:总参数量 30B,但用了 MoE(混合专家)架构,实际干活时只激活 3B 参数,所以对本地消费级硬件比较友好。上下文管理这块,他们用了滑动窗口 K=5 加 episode 重启的策略,相当于每轮对...

推荐理由:这条消息来自 Reddit 帖子,实验室也不是一线大厂,所以重要性我打个折,但信息量够上 featured。开源权重加上 MoE 的 30B/3B 配置,对想自己跑 deep research 的人是个实在的钩子;滑窗和 episode 重启的上下文管理方案也给了可复现的细节。正文没披露具体 tok/s 数据,这点先别太激动,但话题本身会引发本地部署的性能讨论,值得放出来。

彭博科技

苹果 iOS 27 会给 Siri 加一个独立 App,聊天记录会自动删除

彭博社爆料 iOS 27 会有一个类似 ChatGPT 的 Siri 独立应用,核心卖点是聊天记录会自动清理。文章没提保留多久、什么时候上线,也没说具体功能细节。另外 Siri 这次可能还是挂着“Beta”标签,同时 Genmoji(AI 生成表情)也会升级。

推荐理由:我会先打个折:标题很抓人,但正文能落地的料太少。Bloomberg 这篇把 Siri 往 ChatGPT 方向靠,还强调聊天会自动删,隐私角度确实能引起讨论。可翻遍正文,只说了 iOS 27 会有 Genmoji 升级,自动删除的保留多久、什么时候上线、Siri 本身怎么改,全都没披露。这点先别太激动,信息缺口摆在那。不过对做 AI 的人来说,苹果在隐私和功能之间怎么取舍,本身就是个长期看点,所以还是值得扫一眼。