跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 581–600 条 · 共 1,465 条

6月8日星期一

机器之心 · 公众号

openJiuwen 搞了个叫 MANGO 的多智能体流网络,让一群模型自己学会怎么组队干活

openJiuwen 提出了 MANGO,一个多智能体流网络框架。它把强化学习、文本梯度(用自然语言反馈来调模型)和 Skip-k 机制(跳过不靠谱的中间步骤)揉在一起,让一群模型自己学会怎么组队、怎么分工。用 GPT-4o-mini 跑分,在 MATH500 数学题上比 MaAS 准确率高了 12.8 个百分点,在 DROP 阅读理解上比 AFlow...

推荐理由:我会先打个折:这还是个研究框架,不是大模型或平台级发布,所以别当重磅炸弹看。但 HKR 里 K 最扎实,机制和数字都给出来了,MATH500 上 +12.8% 的差距不算小。H 和 R 靠“流网络”这个角度撑住,对搞多智能体协作的人有参考价值。正文没提开源代码链接,这点先别太激动。

AI HOT 精选

OpenAI 公布第三阶段计划:2028 年让 AI 接手大部分研究,并给每人配一个个人 AGI

Sam Altman 和 Jakub Pachocki 在 6 月 8 日发文,把 OpenAI 的路线图摊开了讲。公司内部判断,到 2028 年 3 月,AI 系统可能承担他们研究工作里“相当大一部分”,所以第一个目标是造一个能自动做 AI 研究的系统,帮研究员更快地测试想法、找错和迭代。第二个目标是加速经济增长,同时把收益分出去。第三个目标最直接:...

推荐理由:Sam Altman 和 Jakub Pachocki 这次没画大饼,而是给了个带时间点的内部判断:到 2028 年 3 月,AI 可能接手 OpenAI 研究工作的相当一部分。我会先打个折,这种预测本身就有自我实现的成分,但把它写进公开路线图,说明内部对研究自动化的信心已经很高了。文章把目标拆成三个:造自动做研究的系统、加速经济并把收益分出去、以及最直接的安全对齐。信息量够,时间点具体,对从业者来说既是信号也是压力,值得马上写。

AI HOT 精选

Hugging Face 把 OpenEnv 交给社区委员会管了,Meta-PyTorch、Unsloth 等都在里面

OpenEnv 是一个给 AI 智能体用的训练环境,比如模拟终端、浏览器,让模型在里面干活并学习。Hugging Face 宣布这个项目不再自己说了算,改由一个委员会来协调,首批成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia 等。项目代码已经搬到 huggingface...

推荐理由:这条不是模型发布,但比很多模型发布更值得看。OpenEnv 做的事很简单:给智能体一个能反复试错、学会干活的沙盒,比如在终端里敲命令、在浏览器里点按钮。现在 Hugging Face 把控制权交出来,换成委员会模式,首批成员名单挺能打——Meta-PyTorch 管框架,Unsloth 管训练加速,Modal 和 Prime Intellect 管算力,Nvidia 也在。技术上两个点值得留意:一是 API 照着 Gymnasium 那套强化学习标准来,老玩家上手快;二是集成了 MCP,让智能体在环境里干活时能直接调外部工具,不用自己从头写胶水代码...

AI HOT 精选

ChatGPT 要变成 AgentGPT 了

OpenAI 准备给 ChatGPT 做上线以来最大的一次改版,从聊天机器人转成一个能直接干活的 Agent 平台。它会整合自家的编程工具 Codex、图像生成,还会接入 Canva、Booking 这类第三方应用。高管放话说“聊天已死”,目标是做成跨平台的个人 AI 助手,以后甚至不用你手动输入提示词。改版预计几周内在网页和手机端上线。商业压力不小:...

推荐理由:这条消息把改版讲得挺清楚,但来源只是一条 X 帖子,正文没披露正式上线时间、开放范围和定价,我会先打个折。高管那句“聊天已死”听着唬人,实际产品还没交付,这点先别太激动。整体判断是:方向重要,落地细节还缺,所以放在 84 分这个位置。

6月7日星期日

AI HOT 精选

北海道农民雇了个叫 Codex 的工程师,用 AI 干了 8 件农活

北海道农民富安弘毅把 ChatGPT 和 Codex 当工程师用,做了 8 件事:拍照识别西兰花病害、用卫星 NDVI 数据看作物长势、拿 ESP32 加 LINE 机器人远程开关温室卷帘、给农场群聊写了个管温度和排期的机器人、从聊天记录里自动统计播种数量、研究 RTK-GPS 自动转向原理并算了自建要花多少钱、用 Airtable 搭了农场管理数据库...

推荐理由:我会先打个折:全文只有一个人、一个农场,没有产量对比或省了多少工时的数字,所以不能当行业证据用。但它的价值不在严谨,而在把 AI 写代码这件事从屏幕拉到了泥地里——一个农民没找外包、没学编程,直接用 Codex 做出了 8 个能跑的工具。这种'非程序员用 AI 写代码干物理世界的活'的案例现在还很少,对国内做 agent 和 coding 方向的人是个挺新鲜的参照。

AI HOT 精选

Harness-1:一个用强化学习练出来的200亿参数检索子智能体,能记住搜索状态

UIUC 和 Chroma 发布了一个叫 Harness-1 的检索子智能体,参数量 200 亿,基于 gpt-oss-20b 训练。它被放在一个“有状态搜索框架”里用强化学习训练,简单说就是模型在搜索时能记住上一步干了什么,再决定下一步怎么查,而不是每次都从头瞎找。在 8 个基准测试上,它的平均整理召回率是 0.730,比目前最好的开源子智能体高出 ...

推荐理由:HKR三项都站得住:Harness-1把强化学习和有状态搜索结合,机制讲得明白,基准测试结果也给了具体数字。分数定在78-84区间,因为它是个子智能体的研究发布,不是大厂主力模型,但开源圈确实需要这种能打的检索方案。

新智元 · 公众号

Anthropic 联创说 Claude 现在写了公司 80% 的合并代码,两年内可能到 100%

Anthropic 联合创始人 Jack Clark 公开说,Claude 目前产出了公司里 80% 被合并进主干的代码,他预计两年内这个比例会到 100%。另外文章提到,2026 年第二季度 Anthropic 工程师人均每天合并的代码量是 2024 年的 8 倍。不过原文因为微信环境验证问题,正文没抓到,这些数字的具体口径和统计方式没法核实,先打个折看。

推荐理由:HKR 三项都成立:Jack Clark 亲口说的代码占比数字是个硬钩子,事实点够具体,而且对从业者的职业焦虑和效率想象都有触动。这不是模型发布或重大产品更新,所以分数留在 78–84 区间合理。正文没抓到,统计口径没法核实,我会先打个折看。

机器之心 · 公众号

ICML 2026 中稿的 FusionRoute:让多个模型在生成每个词时自己选最合适的专家,还能自我纠错

这篇 ICML 2026 的论文提出了一种叫 FusionRoute 的多模型协作方法。它不直接合并模型,而是冻结住几个专家模型不动,只训练一个轻量的路由器。这个路由器会在生成文本的每一个 token(词或子词)时,实时挑选一个最合适的专家模型来输出,同时把路由器的判断分数和专家模型的输出分数揉在一起,让最终选择更准。论文在 GSM8K、MATH-50...

推荐理由:这篇 ICML 2026 的 FusionRoute 论文,核心是让几个冻住的专家模型在生成每个 token 时都能被一个轻量路由器实时挑选,还加了自我修正来纠错。思路确实有意思,但文章没给出具体的性能提升数字、代码链接和实际部署成本,所以我会先打个折,放在 featured 里偏低的档位。

量子位 · 公众号

京东开源 JoyAI-Echo,5 分钟 AI 长视频不崩,推理速度提了 7.5 倍

京东放出了一个叫 JoyAI-Echo 的开源框架,专门解决 AI 生成 5 分钟长视频时画面容易崩、前后不一致的问题。它用跨模态记忆模块把视频里的角色、场景信息存下来,保证长镜头里不会突然变脸或换衣服。训练上用了 DMD 后训练技术,推理速度比原来快了大概 7.5 倍,生成一段视频的成本和时间都压下来了。输出端还做了实时超分,能把 720P 画面直接...

推荐理由:我会先打个折:正文没提第三方评测或用户实测,所有性能数据都来自京东自己,所以效果得等上手再看。但这条消息本身有料——JoyAI-Echo用记忆模块存角色和场景信息,解决长视频变脸换衣服的老毛病,推理还快了7.5倍,成本往下走。对做视频生成的团队来说,开源就意味着能拿来改、能压成本,这点挺实在。先给80分,等有实测对比再往上调。

AI HOT 精选

AI 公司开始集体换用更便宜的模型,成本能砍掉九成

Tomasz Tunguz 观察到,基础模型公司往上抢应用层生意、最聪明的闭源模型越来越贵、开源模型又已经够用,这三件事逼着 AI 买家开始大规模“换芯”。Coinbase 把简单任务分流到便宜模型,用量指数级涨但成本没变;Lindy 把所有流量从 Anthropic 切到 DeepSeek v4,省了几百万美元,核心场景效果反而更好;Harvey 在...

推荐理由:这篇不是那种“AI 要颠覆一切”的空话,而是把 Coinbase、Lindy、Harvey 这些公司怎么在实际业务里换模型、省了多少钱讲得很清楚。Harvey 那个 84 美元对 954 美元的例子尤其直观,让人一看就知道成本压力有多大。它属于对行业成本结构变化的扎实观察,不是重大模型发布或产品上线,所以放在 featured 里、76 分这个位置是合适的。

Computing Life · Share · 鸭哥调研

拆解 Claude Design:从开源插件反推一位 AI 设计师是怎么被组织起来的

Anthropic 没公开 Claude Design 的内部 prompt,但他们在 GitHub 开源了一套设计工作流插件。作者把它拆开看,发现它把设计工作分成了六类活动:设计评审、设计系统管理、开发者交接、UX 文案、无障碍扫描和用户研究综合,每类给 Claude 一份独立的操作指引。这么分不是随意的,因为设计评审和 UX 文案需要的判断标准完全...

推荐理由:这篇文章不是 Anthropic 官方发布,是第三方从开源插件反向推理 Claude Design 怎么干活,所以我会先打个折,但拆解质量够硬。作者把设计工作切成六类活动,每类给 Claude 一份独立 prompt 指引,还分析了工作流怎么串、审美怎么判断、效果怎么评估、插件怎么跟 Figma 等工具对接,信息密度比一般评论高。对做 agent 工作流设计和设计自动化的从业者来说,能直接拿来参考怎么给自己的模型拆任务、写指引。缺点也明显:正文没披露 Claude Design 实际产出的设计质量数据,也没对比其他设计 agent 的效果,所以别太...

TechCrunch · AI

OpenAI 推出锁定模式,关掉联网功能来防提示注入攻击

OpenAI 给 ChatGPT 加了一个叫 Lockdown Mode 的开关,主要给处理敏感数据的商业用户和个人用。打开后,ChatGPT 会禁用实时网页浏览(只能读缓存内容)、从网页抓取和显示图片、深度研究以及让模型进业务流程干活的 agent 模式。这么做的目的是降低一种叫“提示注入”的攻击风险——攻击者会把恶意指令藏在网页或文件里,诱导模型把...

推荐理由:OpenAI 把提示注入防御做成了一个用户可操作的开关,不是后台补丁,而是直接限制四个高风险功能。对处理敏感数据的企业和个人来说,这是个实打实的安全选项,虽然会牺牲一部分能力,但换来了更可控的环境。安全/产品类新闻里算有分量,但比不上模型发布或重大能力更新。

AI HOT 精选

五个实验室,五个心智:用小模型搭了个会内幕交易的金融宫斗剧

这个项目用四家不同实验室的小模型(OpenAI 的 gpt-oss-20b、OpenBMB 的 MiniCPM3-4B、NVIDIA 的 Nemotron-Mini-4B 和一个自己微调的 0.5B Qwen)分别扮演市场里的不同角色,玩家则充当幕后金主,可以放贷、散布真假内幕消息、做空和贿赂。模型之间的差异本身就是卖点,让市场博弈更像真的吵架而不是念...

推荐理由:我会先打个折:这只是个实验项目,不是产品。但它的切入点很巧——用小模型之间的差异来制造博弈感,而不是硬靠 prompt 演。技术细节也够实在,vLLM 版本冲突、0.5B 模型的表现数据都摆出来了,做 agent 的人能直接参考。正文没披露微调那 0.5B Qwen 的具体数据配方,这点先别太激动。整体值得一看,放在低 featured 合理。

6月6日星期六

AI HOT 精选

GitHub 开源 Spec Kit:先写产品规范再让 AI 写代码,把 vibe coding 的流程反过来

GitHub 把 Spec Kit 开源了,专门解决 AI 编程里一个常见毛病:需求还没说清楚,模型就开始写代码,结果边界漏了、反复返工。这个工具包把流程倒过来——先写产品功能规范,再让 AI 根据规范去澄清差距、做技术计划、拆任务,最后交给 agent 执行。规范本身成了可执行的开发合约,不是一份看完就扔的文档。目前支持 Copilot、Claude...

推荐理由:我会先打个折:正文没披露这套流程在实际项目里能省多少返工时间,也没给出和直接让 Copilot 写代码的对比数据。但故事本身够硬——GitHub 把“先写规范再写代码”这个老规矩做成 AI 编码的入口,规范不再是看完就扔的文档,而是驱动 agent 执行的合约。支持 Copilot、Claude 等多模型,109K+ 星说明开发者对这套思路的认可度不低。这点先别太激动,但方向对,值得跟。

r/LocalLLaMA

Claude 和本地模型写代码的差距有多大?有人用 4090 跑了一遍

这篇 Reddit 帖子正文被屏蔽了,只能从标题和摘要反推。作者拿一个 Laravel 12 + Livewire 的端到端测试任务,比了五套写代码的 agent 配置。Claude Opus 4.7 配 1M 上下文窗口,一口气生成了 203 个测试;本地最强的方案是 OpenCode 跑在一张 24GB 显存的 RTX 4090 上,产出 140 ...

推荐理由:正文被屏蔽了,只能从标题和摘要反推。作者拿一个 Laravel 12 + Livewire 的端到端测试任务,比了五套写代码 agent。Claude Opus 4.7 配 1M 上下文窗口一口气生成 203 个测试;本地最强方案 OpenCode 跑在 24GB 显存的 RTX 4090 上,产出 140 个,中间还压了 4 次上下文。差距摆在那,但本地方案不用把代码往外传,这点对隐私敏感的场景有吸引力。帖子本身是一次个人实验,不是标准化基准测试,结论别直接当采购依据。

AI 群聊日报

群聊周报 Vol.2|这一年你学的 AI 技巧,可能白学了

作者把自己折腾了一个多月的开源 AI 管家“龙虾”(OpenClaw)亲手退役了。这东西需要自己搭环境、接 API、家里留一台电脑常年开着,结果 Claude 官方桌面产品 Cowork 一出,原生就把他那些魔改的功能全包了,还更稳定。文章用投资圈的 Alpha 和 Beta 来解释这件事:追 Alpha 是跟全世界较劲,你精心调的提示词、手动接的插件...

推荐理由:这是一篇个人周报,不是模型或平台发布,但作者亲手退役自己折腾了一个多月的开源项目这件事本身就有说服力。HKR 三项都踩中了:技能焦虑够抓人,部署条件够具体,对从业者的决策有实际触动。正文没披露 OpenClaw 的具体性能数据和 Cowork 的对比测试,所以重要性停在 72 是合理的,等官方模型放出来再看。

新智元 · 公众号

Anthropic 花 280 美元一单,请 1000 名工程师给 Claude 的代码打分

Anthropic 通过 Snorkel 的 Marlin 项目招募了约 1000 名软件工程师,专门审查 Claude 写的代码。每完成一单任务给 280 美元,工作流包括在 GitHub 仓库里提 Pull Request、对 AI 生成的两版代码做 A/B 对比,然后从正确性、安全性、可靠性和可维护性四个维度打分。正文没披露这些工程师的资历门槛、...

推荐理由:HKR 三项都成立:价格和人数有传播力,流程和评估维度够细,对做代码 Agent 的团队有参考价值。放在 featured 合适,但不到 p1,因为这不是新模型或新能力发布,更像一次数据标注合作的具体披露。正文没披露工程师资历门槛和任务一致性控制,这点先别太激动。

新智元 · 公众号

ICRA 2026 叠衣服比赛,狮子山 AI 实验室拿了真机决赛第一

狮子山 AI 实验室在 ICRA 2026 LeHome 挑战赛的真机决赛里拿了第一。他们用一套叫 LiOS 的系统,把训练、部署、轨迹采样和 Real2Sim 遥操作串成一个数据循环,让机器人学会叠衣服这类软物操作。不过文章正文被微信环境验证挡住了,具体技术细节、比赛数据和对比成绩都没看到,只能从标题和现有摘要知道结果。

推荐理由:我会先打个折:正文被微信环境验证挡住了,技术细节、比赛数据和对比成绩都没看到,只能从标题和摘要知道结果。叠衣服拿第一确实抓眼球,LiOS 的 Real2Sim 遥操作循环听起来也靠谱,但信息缺口太大,没法判断这套方案的泛化能力和真实成本。这点先别太激动,等看到完整论文再下结论。

机器之心 · 公众号

普林斯顿用 DeepSeek V4 做数学证明,成本只要别人的五百分之一

普林斯顿的研究员搞了一套叫 Goedel-Architect 的智能体系统,专门让模型在 Lean 这种形式化证明语言里自动做数学题。他们拿 DeepSeek-V4-Flash 跑 PutnamBench 数学竞赛题,672 道题里正确率到了 75.6%,API 调用费总共才花了 294 美元。对比之前 Hilbert 系统用别的模型达到 70.0% ...

推荐理由:普林斯顿团队搞了个叫Goedel-Architect的智能体系统,让DeepSeek-V4-Flash在形式化证明语言Lean里自动做数学题。PutnamBench 672道题正确率75.6%,API调用费总共294美元,对比之前Hilbert系统用别的模型达到70.0%却花了约17万美元,成本差了近500倍。这个对比很直观,数字也扎实,但正文没详细拆解294美元是怎么算出来的,也没说Hilbert那17万是不是包含了大量试错和人工调参。所以“500倍”这个说法可以先打个折看,不过即使有水分,成本优势依然明显。整体还是偏学术研究,离工程落地有距离,...

机器之心 · 公众号

视频AI能一次生成5分钟了,京东开源JoyAI-Echo,告别抽卡式出片

京东放出了JoyAI-Echo,一个能一口气生成最长5分钟视频加音频的框架,而且全量开源。它主打跨镜头画面和声音的一致性,支持局部重绘,用8步DMD蒸馏来提速,最高能输出1472×2560分辨率的片子。不过原文因为微信环境验证没过去,具体效果和实测数据暂时看不到,这点先别太激动。

推荐理由:JoyAI-Echo把长视频生成的门槛拉到了5分钟,而且代码全放出来,不是只发篇论文。跨镜头画面和声音一致性、局部重绘、8步蒸馏提速这些点都踩在视频AI从业者的痛点上。不过原文因为微信环境验证没过去,具体效果和实测数据暂时看不到,这点先别太激动。单源覆盖、没有独立评测,分数放在78–84区间比较合理。