跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 681–700 条 · 共 1,465 条

6月2日星期二

AI HOT 精选

Anthropic 开发者公开了一套 Claude Code 工作流,核心是让 AI 当老师逼你真正搞懂代码,而不是只点“同意”

这套流程把 Claude Code 定位成“高效又聪明的老师”,目标不是替你写完代码,而是确保你能把问题、方案和影响讲清楚、辩得动。它沿着问题域、方案域和语境域三条线,拆成 8 个可执行步骤,用增量教学、用户复述、清单加测验的方式,在进入下一步前先确认你真的懂了。这么设计是为了对抗长会话里人慢慢变成“审批按钮”的问题,强制把决策上下文沉淀下来,让理解过...

推荐理由:我会先打个折:这不是产品发布,是一篇实操分享,所以放在 featured 低位。HKR 三项都踩实了——钩子把“人变按钮”这个痛点讲得很透,知识部分有 8 步工作流和验证循环,相关性直击开发者对 agent 失控的担忧。正文没披露这套流程在复杂项目里的失败率,这点先别太激动,但作为可落地的教程,信息密度够。

Computing Life · Share · 鸭哥调研

AI Agent 不用攻破,说服它就行

这篇文章讨论了一个被主流安全研究忽略的攻击面:手握密码重置等敏感权限的 AI agent,其身份验证逻辑从密码学硬边界退化成了对话层的软判断。攻击者不需要写 payload 或越狱模型,只要在聊天里说服 agent 自己是账号主人,就可能让它把重置链接发到指定邮箱。文章引用了 Hacker News 上一个声称用此法劫持上百个 Instagram 账号...

推荐理由:我会先打个折:正文没给出任何实际攻击案例、成功率数据,也没跟现有产品方案做对比,所以只能算一篇有启发的观点文章,不是验证过的解法。但它的好处是把 agent 安全从“防入侵”拽到了“防忽悠”上,这个视角本身就有提醒价值。what/who 分离的三层架构虽然细节不多,至少给了一个可讨论的起点,不是空喊口号。对正在给 agent 配权限的团队来说,这篇值得扫一眼,但别指望拿来就直接落地。

Computing Life · Share · 鸭哥调研

Google 推出后台常驻 AI 助手 Spark,Agent 产品形态从聊天窗口转向守护进程

Google 向美国 AI Ultra 用户推送了 Gemini Spark,一个能 24 小时在后台监控邮箱、日历和云盘,并按你设定的规则自动干活的 AI 助手。它和之前聊天式 AI 最大的区别是:你不用打开它,它也会在条件满足时自己行动。The Verge 的评测显示,Spark 在查开支、写邮件这类简单任务上表现惊人,但面对复杂任务会编造信息,结...

推荐理由:我会先打个折:正文没披露 Gemini Spark 的具体上线时间、推送范围,也没有实测数据,所以这更像一篇概念梳理,不是产品首发。但它的价值在于把“后台常驻 agent”这个方向讲明白了——从聊天窗口到守护进程,四代演化加上 periodic 和 reactive 两种模式,对正在做 agent 产品的人有参考意义。信息密度够,判断也克制,放在 featured 低分段合适。

r/LocalLLaMA

我花了几个月钻进 verl 的 RL 训练框架,最后还是放弃了:内部机制、维护分支的代价,还有一个 NCCL 的坑

作者深入研究了字节跳动的 verl(一个做 RLHF 强化学习微调的开源框架),把它的核心流程拆了一遍:DataProto 数据协议怎么走,模型怎么生成回答(rollout),怎么打分(reward),怎么算优势函数(advantage),最后怎么更新模型。作者本来维护了一个自己的分支,但因为上游几乎每天都有改动,同步的成本比自己做改动还高,最后只能停...

推荐理由:这是一篇来自一线的 RL 后训练框架使用报告,不是官方发布。作者没在推销什么,而是老实交代了 fork 又放弃的原因和踩坑记录。我会先打个折:信息密度不错,但只覆盖单机场景,正文没披露多机下的 NCCL 表现。对正在选型或折腾 verl 的人有参考价值,对其他人可能就只是看个热闹。

AI HOT 精选

Google AI Studio 现在能直接搭 Gmail、Drive 应用,不用跳出去

Google AI Studio 上线了应用构建功能,可以直接在里面连接 Gmail、Drive 和 Sheets 等 Google 自家服务,不用再切到别的网站。目前支持在 AI Studio 内部添加测试人员,但正文没披露完整的公开分享功能具体什么时候上线,只说“即将推出”。

推荐理由:这是个中等体量的产品更新:Workspace 连接和测试人员支持已确认,但分享机制、权限细节和定价都没披露。我会先打个折,因为目前更像内部测试能力,离正式开放还有信息缺口。

TechCrunch · AI

英伟达联手微软、戴尔和惠普,想用 AI 代理 PC 抢 2000 亿美元 CPU 市场的蛋糕

英伟达要把 AI 代理(能自主干活的软件助手)装进消费级 PC,合作方是微软、戴尔和惠普。他们瞄准的是价值 2000 亿美元的 CPU 市场。不过正文没披露具体配置、价格、上市时间,也没说怎么保证这些代理在个人电脑上安全运行不出乱子。如果真解决了易用、安全和实用这三个问题,这事儿确实不小,但现在只能先打个折看。

推荐理由:我会先打个折:正文没给任何规格、价格或上市时间,所以这更像一次生态站队宣示,不是产品发布。但“2000亿美元市场”这个钩子和微软/戴尔/惠普三家站台,足够让它进featured的低位。对从业者来说,知道Nvidia拉着OEM三巨头在铺AI agent PC的局就够了,具体能跑什么模型、卖多少钱,现在还没法判断。

The Verge · AI

Gemini Spark 上手:演示里能做的,实测基本也能做,但成本和隐私还是笔糊涂账

The Verge 的编辑用了一周 Gemini Spark,这个能 24 小时在后台跑多步骤任务的 AI 代理,干活能力确实和谷歌演示的差不多。但文章没提具体价格,也没说清楚隐私条款,只透露 Spark 会在执行大动作前先跟你确认。编辑觉得它替你办事时偶尔好得让人意外,可一想到要付出的钱和可能交出去的数据,就不太确定值不值了。

推荐理由:我会先打个折:正文没披露价格、隐私条款和完整测试结果,所以判断只能基于已有信息。The Verge 用了一周,结论是 Gemini Spark 确实能后台执行多步骤任务,但表现也就跟 Google 自己演示的差不多,没有超出预期。这点先别太激动,因为缺了成本和隐私细节,实际能不能在生产环境用还不好说。整体看,这是一次有参考价值的实测,但信息缺口明显,所以分数放在 72–77 这个区间。

AI HOT 精选

Meta 自家的 AI 客服被利用来劫持 Instagram 账号

攻击者直接跟 Meta 的 AI 客服聊天,让它把目标账号的绑定邮箱换成自己的,就能把号拿走。问题出在这个 AI 被赋予了直接操作账号的权限,而且它没法区分对面是号主还是骗子。报道没披露到底有多少账号受影响、漏洞现在修没修,也没给出能复现的具体步骤。

推荐理由:我会先打个折:正文没披露影响范围、修复时间和可复现步骤,所以不能往满分冲。但核心事实清楚——一个 AI 客服智能体因为能直接执行账户管理操作,被利用来接管 Instagram 账号。对做 agent 安全的人来说,这是个实打实的警钟,说明工具权限没卡死会直接变成攻击面。综合下来给 82 分,放在 featured 里提醒同行。

Hacker News 首页

黑客用 Meta 的 AI 客服机器人劫持 Instagram 账号

Brian Krebs 报道,上周末奥巴马白宫官方号和美国太空军高级士官长的 Instagram 账号被挂上亲伊朗图片,起因是 Telegram 上流传的一个教程:用 VPN 把 IP 切到目标账号常驻城市附近,申请密码重置,然后跟 Meta 的 AI 客服机器人说“把这个账号绑到我的新邮箱上”,机器人就会照做并发来一次性验证码,直接重置密码。攻击者声...

推荐理由:标题说黑客用 Meta 的 AI 支持机器人抢 Instagram 账号,听着挺吓人,但正文只给了 40 分和 14 条评论,没讲具体怎么做到的。我会先打个折:钩子够强,安全风险也确实存在,所以 H 和 R 都过;但关键信息全缺,K 过不了,只能放在 featured 的底线位置。

AI HOT 精选

Perplexity 把搜索流程写成代码,让 AI 代理直接调接口,不再绕函数循环

Perplexity 公开了一套叫 Search as Code 的搜索架构。它的做法是让 AI 代理直接写 Python 代码去调用自家的搜索栈,而不是像以前那样一步步循环调用函数。这套东西已经上线 Perplexity Agent API,并且成了 Computer 功能的默认选项。正文没披露具体性能对比数据,但思路很直接:省掉中间环节,让搜索更快...

推荐理由:我会先打个折:这篇只有 Perplexity 自己的公告,没给性能对比、定价细节和实际铺开范围,所以只能算一个低配版的产品更新。但亮点很实在——Perplexity 把搜索从“调 API 拿结果”变成了“让模型写代码操作搜索栈”,并且已经接进 Agent API,这对正在搭 agent 的团队来说是个省事的信号。正文没披露延迟和成本数据,这点先别太激动。

6月1日星期一

Latent Space

视频智能体是下一个方向:Ethan He 谈 xAI Grok Imagine 的三个月从零到一

Ethan He 在 NVIDIA 做完 Cosmos 世界模型后跳到了 xAI,带着一个小团队三个月就做出了 Grok Imagine。他有个很直接的观点:视频模型现在的智能主要来自语言模型,不是靠堆视频数据训练出来的。下一个 Sora 级别的突破不会是更好的视频生成模型,而是能规划、生成、修改、反复打磨一个完整创意任务的视频智能体。这期播客聊了从零...

推荐理由:我会先打个折:这篇是访谈级别的信号,不是论文或产品发布。它给了“三个月小团队从零搭建”这个事实,也点出了视频 Agent、音视频对齐和推理加速这几个方向,但正文没披露任何基准分数、具体成本数字或可复现的测试方法。所以它更像一份来自 xAI 内部的路线图预告,能帮你判断他们在往哪使劲,但暂时没法拿来做技术选型。对关注视频模型和多模态 Agent 的人来说值得扫一眼,别当结论用。

AI HOT 精选

开源与闭源模型,正走在两条不同的增长曲线上

作者 Nathan Lambert 的核心判断是:在编程智能体这类对智商极度敏感的场景里,用户会一直为最聪明的闭源模型付高价,他自己就愿意每月掏 2000 美元。闭源实验室会逐渐把最好的模型藏起来,不在 API 里轻易放出,以保护利润和防止被蒸馏。他预测 5 到 10 年内,OpenAI 和 Anthropic 的估值会到 2 万亿到 10 万亿美元,...

推荐理由:我会先打个折,这是一篇个人评论,不是系统研究,所以重要性停在 featured 门槛附近是合理的。但它的 HKR 三项都站得住:观点有明确的冲突框架(h),给出了可引用的价格和估值数字(k),讨论的议题正好是当下圈子里吵得最凶的那几个(r)。正文没披露这些估值模型的具体假设,所以数字本身先别太激动,但它们作为讨论的引子够用了。

AI HOT 精选

美团要把自己的 AI 助手“小美”接进腾讯元宝,让用户在聊天界面就能直接点外卖、叫跑腿

王兴在美团一季度财报电话会上说,美团的 AI 智能体“小美”很快会和腾讯元宝打通。以后你在元宝里说一句本地生活相关的需求,系统会直接跳转到美团的点餐、配送等服务,不用再切 App。王兴还提了一个新说法叫“To A”(服务 AI 智能体),认为这会是美团未来的重要方向。美团一季度营收 910.39 亿元,但亏了 68.27 亿元,由盈转亏。正文没披露“小...

推荐理由:我会先打个折:合作还是“即将”状态,具体上线时间、用户从元宝哪个入口唤起小美、订单收入怎么分账,正文都没披露。所以它是个中等体量的产品合作,放在featured层级刚好,别当重磅发布看。

AI HOT 精选

用 Claude Opus 4.8 把一本书做成 AI 技能,45 分钟、不到 20 块钱

作者拿《非暴力沟通》试了一遍,用 Claude Opus 4.8 把整本书拆成可调用的 AI 技能。流程分六步:先喂全书文本,让模型分析结构,再提炼框架、原则、技法、反模式和作者语气这五类内容,接着生成技能,最后做一轮自检。技能保留了书里的原始命名,比如 OFNR 四要素和“长颈鹿语言”,但触发词换成了“怎么提意见不像在指责”这种日常说法。全程花了约 ...

推荐理由:这是一篇带编号步骤的第一人称Claude实操教程,成本和token数据都摆出来了。因为属于个人教程而非Anthropic官方发布或模型更新,所以放在featured低位。

AI HOT 精选

Apache RocketMQ 出了个 AI 专用版,专门解决多智能体协作时状态丢失和流量打崩的问题

阿里云给 RocketMQ 加了一套 AI 场景的适配,叫 RocketMQ for AI。它主要干三件事:用 Lite-Topics 减少资源开销,靠有序消息防止多智能体协作时上下文乱掉,再通过流量整形避免突发请求把系统打挂。官方说已经在阿里云大规模跑过,代码也开源了,但正文没披露具体版本号和性能对比数据,实际省多少资源还得自己测。

推荐理由:这条更新把 RocketMQ 往 AI 场景推了一步,提的几个机制——轻量级主题、有序消息、流量整形——听着像是给多 agent 协作和长任务链路做减法,减少排队打架和资源争抢。我会先打个折,因为正文没给版本号、性能对比和实际落地案例,没法判断是已经能用的东西还是路线图上的规划。但方向本身不虚,agent 之间通信乱、调度不公正是真痛点,所以分数给到 74,放在 featured 里提醒一下做 agent 架构的人可以关注。

新智元 · 公众号

阶跃星辰发布 Step 3.7 Flash,196B 参数的 MoE 模型每次推理只激活 11B,速度冲到 400 tokens/秒,跑 Agent 任务...

阶跃星辰这次放出的 Step 3.7 Flash 是个混合专家模型,总参数量 196B,还挂了一个 1.8B 的视觉编码器,但每次推理实际只动用 11B 参数,所以能跑到每秒 400 个 token。官方说在 Agent 任务上,它的成本只有 Claude 的零头。不过正文因为微信环境验证没抓到具体内容,实际跑分、具体任务对比和定价细节都没披露,这点先...

推荐理由:速度和参数数字都摆出来了,标题里那个成本对比很抓人。但正文没披露具体定价、基准测试的细节和开源条款,所以分数只能停在 82 这个质量更新档位。

机器之心 · 公众号

OpenAI 为机器人团队招兵买马,由 Sora 负责人带队,部分岗位底薪开到 34 万美元以上

OpenAI 放出了十多个旧金山的机器人岗位,团队由 Sora 的负责人 Aditya Ramesh 带队,是从他之前的 Worldsim 项目演变过来的。其中执行器设计工程师的底薪现金在 34.2 万到 44.5 万美元之间,另外还有 PPU 激励。不过原文因为微信环境异常,具体岗位职责和团队规模都没披露,只能看到招聘信息的大致框架。

推荐理由:这条消息有明确的团队、负责人和薪资数字,不是模型或产品发布,但作为招聘信号已经够硬。我会先打个折:目前只是招人阶段,离实际产品还有距离,这点先别太激动。不过 OpenAI 把机器人当成全栈方向来做,薪酬又直接对标顶级硬件人才,对同行抢人和行业风向都有参考价值,所以放在 featured 档位没问题。

机器之心 · 公众号

VAST 发布 Project Eden,世界模型第一次能像游戏一样“存档”了

VAST 推出了一个叫 Project Eden 的三层世界模型架构,把场景的持久状态和画面渲染拆开了。简单说,就是给 AI 生成的 3D 世界加了个“存档”功能,你改过的东西下次打开还在,不用每次都重新生成。文章还提到 VAST 在 A+ 和 A++ 轮一共融了将近 2 亿美元。不过正文因为微信页面环境异常被屏蔽了,具体技术细节和效果演示都没看到,这...

推荐理由:我会先打个折:VAST 不是一线基础模型实验室,正文也没披露具体基准测试结果或开放接入方式,所以分数落在 78–84 区间。但 Project Eden 把世界状态推演和视觉渲染拆成三层,还给了“存档”这个产品钩子,加上近 2 亿美元的融资规模,对关注仿真基础设施的从业者来说信息量够硬。

AI HOT 精选

腾讯混元给智能体做了个长期记忆插件,叫 Hy-Memory

这个插件是给 OpenClaw 这类需要长期协作的智能体用的,相当于给它们装了个“第二大脑”。它用了一套六层记忆框架,还分了快慢两个系统来处理信息,目的是把零散的记忆整理成更有用的经验。官方给的数据是,记忆数量能砍掉 70% 以上,单条记忆的信息密度反而提升了 45% 多。在要处理超长文本的场景下,消耗的 token 能省下 35%,记忆更新速度也快了...

推荐理由:腾讯混元给OpenClaw这类长期协作智能体做了个记忆插件,思路是把记忆分层管理,再用快慢双系统决定什么时候调用什么记忆,目标是少记、记准、省 token。我会先打个折:目前只有官方一篇短文,没有可复现的测试、没提开源协议、也没有第三方对比,所以分数卡在 featured 门槛上。但给出的70%记忆缩减和35% token 节省这两个数,如果实测能复现,对跑长期 agent 的人来说确实挺省钱。

量子位 · 公众号

VAST 拿了近 2 亿美元,首次公开世界模型 Eden 的技术路线

VAST 在 A+ 和 A++ 轮融了近 2 亿美元,同时公布了 Project Eden 世界模型的架构。这套架构把“世界状态怎么变”和“画面怎么渲染”拆开了:先有一个结构化的状态层来推演变化,中间加一层条件接口做翻译,最后再用生成式渲染层出图。正文没披露具体估值、投资方和模型落地时间表,技术细节也只给了三层框架,没有实验数据和验证指标。

推荐理由:VAST拿了近2亿美元A+和A++轮,同时把Project Eden的三层架构亮出来:状态层管世界推演,条件接口层接外部输入,生成式渲染层负责最终画面。这个拆法让世界模型不再是一团黑盒,对做3D和具身智能的人有启发。不过正文没给出任何量化指标、开源时间或实际跑通的场景,所以我会先打个折,不往顶格推。