跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1141–1160 条 · 共 1,465 条

5月1日星期五

The Verge · AI

微软在 Word 里塞了个法律 AI 助手,想让律师放心把合同交给它审

微软发布了一个叫 Legal Agent 的 Word 插件,专门帮法律团队审合同。它会按你预设的规则手册(playbook)逐条检查条款,还能直接处理文档里的修订痕迹。这个功能来自微软收购的 Robin AI 团队。不过正文没披露具体定价和推送范围,所以实际用起来贵不贵、什么时候能用上还不清楚。

推荐理由:微软把 AI 塞进 Word 给律师用,不是写泛泛摘要,而是按法律实务流程干活——对照内部 playbook 审条款、处理修订记录。这点比通用 copilot 更具体,但正文没披露价格、上线范围和客户验证,所以先打个折,放在 featured 低段。

新智元 · 公众号

一个开发者用10天婚假做了个AI世界生成器,一句话就能生成会自己运转的小镇

这个叫WorldX的项目,你输入一句话,它大概5分钟就能生成一个完整的AI世界。背后是一套6步地图生成流程,每个世界消耗约3万到18万个token。里面的NPC有自己的两层记忆和双轴情绪,会按Tick循环自主行动。比较有意思的是它用叠加标签加色差定位来做确定性坐标,让角色能真正走到具体位置而不是大概描述。不过正文没披露实际运行时的延迟和稳定性数据,这点...

推荐理由:我会先打个折,这是个独立项目不是大厂发布,所以分数压在75附近。但它的技术披露很实在,地图管线分6步、token消耗范围明确、坐标转换方案有工程参考价值,不是那种只放视频不说原理的展示。对正在折腾 Agent 记忆和世界生成的人,这篇文章能省不少试错时间,所以给 featured 没问题。

新智元 · 公众号

拆解 Claude Code:让它好用的 98.4% 是工程,不是 AI

VILA-Lab 把 Claude Code v2.1.88 的 51.2 万行代码扒了一遍,发现真正跟 AI 决策逻辑相关的部分只占 1.6%。剩下 98.4% 全是确定性的工程基础设施:权限控制、上下文管理、工具路由和错误恢复。核心变化不是把提示词写得更长,而是给模型套上了一套好用的“缰绳”。

推荐理由:这篇不是 Anthropic 官方出品,是 VILA-Lab 的逆向分析,所以权威性我会先打个折。但它给的 51.2 万行源码和 1.6%/98.4% 的拆分很具体,对正在搭 agent 的团队来说,比很多公关稿有用——它把“模型强所以产品强”的叙事拉回到工程现实。正文没披露完整复现步骤,这点先别太激动,但判断方向是准的。

新智元 · 公众号

OpenAI 把 Codex 升级成能直接操控 Mac 的助手,跨应用干活不用人插手

OpenAI 给 Codex 接入了 Slack、Google Workspace 和 Microsoft 365,重点不是帮你补代码,而是让它直接接管电脑操作。测试里 Mike Russell 让 Codex 在 Mac 上跨 Adobe Audition、Photoshop 和 Firefly 完成一套音频剪辑到出图的工作流,全程人只围观,大概 8...

推荐理由:HKR 三条全中。OpenAI Codex 这次不是补代码,是直接上手操作 Mac,集成 Slack、Google Workspace 和 Microsoft 365,等于把 agent 塞进日常办公软件里。Mike Russell 的实测给了具体数字:8 分钟跑完音频修复、Photoshop 封面和 Firefly 视频生成,效果 85—90 分,虽然只有单信源,但 OS-agent 这个方向本身就够重,P1 没毛病。

Latent Space

AI 周报:Codex 开始抢知识工作者的活儿,Claude 盯上了创意工具

OpenAI 把 Codex 从写代码扩展到了文档、幻灯片、表格这类非编程工作,新版本里电脑操作速度提升了 42%,还接入了微软、谷歌、Salesforce 的办公套件。Anthropic 这边,Claude 新增了对 Blender、Adobe 全家桶、Ableton 等创意软件的支持,同时推出了一个代码安全审查工具。另外,英国 AI 安全研究所的报...

推荐理由:OpenAI 把 Codex 从写代码推到了非编码的 GUI 操作上,说 CUA 比之前快 42%,还接进了微软、谷歌和 Salesforce 的办公套件。我会先打个折:正文没披露价格、具体上线范围和可复现细节,所以别急着当省钱结论。真正值得盯的是 GUI agent 产品化这一步,而不是单次模型跑分。

量子位 · 公众号

北大和快手可灵开源 OpenWorldLib,一个框架想统一视频生成、3D、机器人控制和推理

正文因为微信环境异常被拦截了,实际内容没抓到。从现有标题和英文摘要看,北大 DCAI 和快手可灵开源了一个叫 OpenWorldLib 的统一世界模型框架,把视频生成、3D 建模、VLA 机器人控制、多模态推理四类任务塞进一套 Pipeline 里。Pipeline 里分了 Operator、推理、合成、表征和记忆几个模块,支持前向和流式执行。核心看点...

推荐理由:HKR 三项都踩中了:框架覆盖四类任务、模块和推理模式交代得具体、落脚点在降低复现成本。但正文没给基准测试结果、没提实际部署规模或生态接入情况,所以分数先停在 78,别急着往上调。

Hacker News 首页

Pu.sh:一个 400 行 shell 脚本搭起来的编程助手框架

Pu.sh 用大约 400 行 shell 脚本(只靠 sh、curl 和 awk)搭了一个编程助手的运行框架。它支持 Anthropic 和 OpenAI 的接口,内置 7 种工具,有对话上下文自动压缩、断点续跑和管道模式,还配了 90 个不调 API 的测试用例。没有图形界面、流式输出、图片处理、OAuth 登录,也不支持 Windows。

推荐理由:我会先打个折:这就是个 Show HN 的开源小工具,不是模型或平台发布,别当大新闻看。但它上了 HN 首页,而且 400 行能复现的代码本身就说明问题——把 coding-agent 的核心链路(调模型、给工具、压缩上下文、断点续跑)剥到只剩 shell,依赖极简,对想理解 agent 怎么跑、又不想装一堆依赖的人很友好。正文没披露实际任务成功率,所以别急着说它比别的框架强,但作为教学和轻量集成的起点,这个 featured 给得值。

r/LocalLLaMA

Qwen3.6-27B 在单张 RTX 3090 上跑到 21.8 万上下文,工具调用也稳了

一位 Reddit 用户用一张 24GB 显存的 RTX 3090 跑 Qwen3.6-27B(一个 270 亿参数的模型),把上下文窗口推到了约 21.8 万个 token,生成速度在每秒 50 到 66 个 token 之间。之前工具调用时,如果返回结果有 2.5 万个 token 左右就会爆显存,他修了一个叫 Genesis PN12 补丁的锚点...

推荐理由:我会先打个折,这是 Reddit 个人实测,不是官方基准。但信息量够:修了 Genesis PN12 补丁后,25K token 的工具调用不再 OOM,198K 加 vision 能到 51/68 TPS。限制也说清楚了,单提示单卡在 50–60K 附近还有第二个内存断崖,这点先别太激动。对想用消费级显卡跑长上下文 agent 的人来说,这些数字和踩坑记录比论文更有参考价值。

r/LocalLLaMA

RTX 5080 16GB 跑长上下文编程:Qwen3.6-35B-A3B 在 128K 窗口下稳在 30 t/s,刚启动时能到 89 t/s

一位 Reddit 用户用 RTX 5080 16GB 显卡本地跑编程 agent,测了 Qwen3.6-35B-A3B 这个 MoE 模型(总参数 35B,每次激活 3B)。刚加载完上下文时速度有 89 t/s,等上下文塞满到 128K token 后,生成速度还能维持在 30 t/s,而且回复质量没掉。作为对比,同系列的 27B 稠密模型在 128...

推荐理由:HKR 三项都成立:16GB 显卡撑住 128K 上下文 30 t/s 是个很强的钩子,硬件和 CUDA 版本细节都有,还给了稠密模型的惨烈对比。不过这只是 Reddit 单帖测试,没有多源复现,所以 featured 而不是 P1。

NVIDIA 博客

NVIDIA 说 OpenClaw 开源智能体项目 60 天拿了 25 万星,但治理成本才是真问题

NVIDIA 这篇博客主要讲了两件事:一是 Peter Steinberger 做的自托管持久化智能体 OpenClaw 在 GitHub 上火了,到 2026 年 3 月已经攒了 25 万颗星,增速超过了 React。二是 NVIDIA 自己推出了 NemoClaw,用 OpenShell 沙箱和 Nemotron 模型来跑智能体。文章真正想聊的是治...

推荐理由:我会先打个折:这是 NVIDIA 官方博客,立场肯定偏向自家 Nemotron 和 NemoClaw,但文章没回避常驻 Agent 最要命的问题——token 成本暴涨和安全边界。OpenClaw 本身是 Peter Steinberger 做的自托管常驻 Agent,NVIDIA 用 OpenShell 沙箱和 Nemotron 模型给它加了网络、数据访问的默认限制,这个加固思路比单纯吹性能更有信息量。文中给出的推理后 token 增 100 倍、自治 Agent 再增 1000 倍的估算,虽然没披露测算口径,但把成本焦虑直接量化了,对做落地的人...

TechCrunch · AI

谷歌把 Gemini 助手装进了几百万辆车里

谷歌宣布 Gemini 会逐步替换掉车机里原来的 Google Assistant,首批覆盖的是内置谷歌服务的车型。官方说法是能让车载语音对话更自然、更聪明,但正文没披露具体用了哪个版本的 Gemini 模型、哪些功能会先上、什么时候推完,也没提要不要额外收费。这点先别太激动——目前看更像是一次品牌升级和底层模型切换,实际体验能好多少还得等实车评测。

推荐理由:标题说 Gemini 要上车,规模是“数百万辆”,听着挺唬人。但正文基本就是一句话新闻,没给车型、没给时间、没给功能细节,也没说要不要额外收费。我会先打个折:这事方向对,但落地信息太少,现在激动还太早。对从业者来说,知道 Google 在铺车载渠道就够了,具体怎么打、打不打得赢,还得等后续。

TechCrunch · AI

Stripe 推出 Link 数字钱包,AI 代理也能用它花钱

Stripe 在年度大会上发布了 Link,一个能绑卡、银行账户、订阅和加密钱包的数字钱包。它不只是给人用,还允许你授权 AI 代理(比如帮你订票、买东西的自动化程序)通过审批流程花你的钱。Link 有网页版和 iOS、Android 客户端,可以集中看支出和订阅。但正文没披露代理支付的手续费、额度上限、支持哪些商户,也没说授权边界具体怎么划——这点先...

推荐理由:我会先打个折:正文没披露费率、额度上限和商户覆盖范围,所以实际能用多广还不好说。但让 AI 代理进支付环节这件事,比很多 demo 都实在——它给出了一个具体的控制机制(审批),而不是让模型自己随便刷。这点先别太激动,但方向对,值得盯后续的授权粒度怎么细化。

The Verge · AI

Meta 用“快速致富”风格的广告推销自家 AI 工具

Meta 收购的 Manus 在 Instagram 和 Facebook 上投了一批广告,话术很像“别去打工了,用 AI 躺着赚钱”。广告瞄准的是本地小商家,尤其是那些没有网站或者网站做得很烂的店主,让他们用 Meta 的 AI 工具生成网站。Manus 还花钱请创作者在 Instagram、YouTube 和 TikTok 上发推广内容,其中一些 ...

推荐理由:The Verge 挖出 Meta 花 20 亿美元买的 Manus,在投广告教人用 AI 快速赚钱。套路是找没网站或网站很烂的本地商家,AI 自动建站再电话推销。Manus 还付钱让创作者运营社媒账号,部分 TikTok 账号被问后就下架了。这不是产品发布,是调查报道,但把平台自己搞 AI 垃圾生意的链条扒得很清楚,对行业名声打击不小。

4月30日星期四

MIT Technology Review · AI

Goodfire 发布 Silico,一个能让你像调试代码一样调试大模型内部参数的工具

Goodfire 推出了一款叫 Silico 的工具,让工程师可以在训练过程中直接查看和调整模型的参数,也就是决定模型行为的那些“旋钮”。它能把模型里的神经元和通路画成地图,比如他们在 Qwen 3 里发现一个神经元,激活后模型回答会变成电车难题式的道德困境。Silico 用智能体自动完成了大量原本需要人工做的可解释性工作,目标是让模型开发少点炼丹味,...

推荐理由:HKR 三项都成立:Silico 给出了一个可操作的机械可解释性调试手段。分数停在 76,因为目前只是一家创业公司的产品预览,正文没披露定价,也没有任何实际部署规模或客户数量的数据,所以我会先打个折,不往更高里推。

Ben's Bites

搭东西变简单了:Cloudflare 让 AI 能自己买域名部署,Stripe 给 AI 发了钱包

Ben 这期聊的是工具链在变,他最近迷上了 Codex 应用,用自然语言指挥 AI 写了个恐龙跳跳游戏、搭了套 Gmail 自动分类系统。重点在后面的产品更新:Cloudflare 现在允许 AI 代理自己创建账户、买域名、拿 API 令牌并部署,人只需要最后点个头,中间那些繁琐的后台配置被包装成了 AI 能读懂的接口。Stripe 在 Session...

推荐理由:这是一篇产品线索汇总,不是单一重磅发布,但 Cloudflare 和 Stripe 把代理权限落到了开户、支付、部署这些硬环节上,我会先打个折放在 featured 低段。正文没披露具体延迟或成本数字,如果是真的,代理跑通账号和支付流程确实省钱省事,但权限敞口也大,这点先别太激动。

r/LocalLLaMA

实测:本地跑 Qwen-3.6-27B 跟闭源模型比,到底差多少

作者拿一个自动研究循环任务测了 5 个模型,只有 Qwen-3.6-27B 接近完成。本地用 q4_k_m 量化版跑了约 8 小时,消耗 3.9 万 token(上限 4.5 万);作为对比,全精度 Qwen 通过 OpenRouter 调用用了 440 万 token,花费 0.939 美元。关键看失败质量:两个 Qwen 版本都只差小修小补,而 G...

推荐理由:这篇帖子用一个自动研究任务把 Qwen-3.6-27B 和几个闭源模型放在一起比,结果只有 Qwen 基本完成,其他模型要么缺测试要么缺实现,对比很直观。数据也给了:本地量化版跑了约 8 小时,读 39k 写 45k tokens;全精度版消耗 4.4M tokens,花了 0.939 美元。失败质量比成功更值得看,两种 Qwen 都只需少量修复就能用。来源是单篇 Reddit 实测,权威性有限,所以放在 featured 低位,但 hook、数据和话题性都够。

Google DeepMind

Google DeepMind 发布 AI co-clinician 医疗研究计划

Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据综合工具;在 140 项问诊技能评估中,它在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。

推荐理由:Google DeepMind 公开 AI co-clinician 研究计划与多模态问诊评测,可了解医疗智能体当前能力边界。

r/LocalLLaMA

实测:用小模型跑编程 agent,哪些环节会崩

作者花了几周时间,用 7B 以下的本地小模型和免费云端模型跑多文件编程任务,发现结构化输出很不靠谱。崩得最多的地方有三个:模型在回复里乱加 markdown 代码块标记,把编辑内容写到错误的文件里,以及分不清该读文件还是写文件。作者给的解法是做后处理清洗和加校验步骤,但正文没披露具体用哪些模型、测试了多少任务,也没给出量化的成功率,所以这些结论只能当经...

推荐理由:这篇 Reddit 帖子不是论文,是作者拿 Qwen、Gemma 等小模型实打实跑了几周多文件编程 agent 后的踩坑记录。我会先打个折:它只是单人经验,没有系统对比实验,所以给 75 分。但内容很实在——7B 以下模型连输出格式都稳不住,Markdown 围栏乱加、改错文件、读写成写这类问题反复出现。作者没灌水,直接给了后处理、JSON schema 校验、路径白名单和只读路由这些能落地的补救办法。正文没披露具体模型版本和测试任务量,这点让结论的普适性弱一些,但对想用本地模型搭 coding agent 的人,这些失败模式比 benchmark...

机器之心 · 公众号

罗剑岚团队发布 LWD,用失败数据训练机器人,16 台真机跑出 0.95 成功率

罗剑岚团队和智元机器人搞了个新训练框架 LWD,已经在 16 台 Agibot G1 真机上跑过验证。LWD Online 在 8 个任务上平均成功率 0.95,长流程任务也能到 0.91。它的核心思路是把失败轨迹当训练数据用——他们攒了 652.5 小时的机器人操作数据,里面失败样本占了 34.8%,然后用离线转在线的强化学习方式让模型从这些翻车经验...

推荐理由:HKR三项都站得住:真机规模、任务数和成功率给了硬数字,失败轨迹占比这个数据点对同行有参考价值。不过具身智能的受众比基础模型窄,所以重要性定在78,不上头条。

量子位 · 公众号

新加坡国立等团队提出 ViF,专治多智能体协作时的视觉幻觉传染

多智能体系统里有个麻烦:一个模型看图说话出错,把错误描述传给下一个模型,下一个模型再添油加醋,幻觉就像滚雪球一样越滚越大。新加坡国立大学 LV-Lab 等团队搞了个叫 ViF 的方法,不改造模型本身,即插即用。核心思路是不再只传文字,而是把视觉信息打包成“视觉接力令牌”塞进对话流里,同时用分层注意力重分配让模型多看该看的地方。论文已被 ICLR 202...

推荐理由:这篇入选 ICLR 2026 的工作解决的是多智能体视觉问答里一个很实际的毛病:纯靠文字传递信息,幻觉会一个 agent 传一个 agent,越传越离谱。他们提出的 ViF 用视觉中继令牌和分层注意力重分配,把图像信息直接塞进通信链路,不改模型就能插进现有系统。我会先打个折——论文没披露实际部署的延迟和额外算力开销,这点先别太激动。但 8 个基准、4 种结构、10 款模型上的提升摆在那里,幻觉严重度平均砍掉三成以上,环形结构接近四成,对做多模态 agent 的人来说是个值得跟的方案。