跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1041–1060 条 · 共 1,465 条

5月11日星期一

AI HOT 精选

Codex 自己找了个安全审计的活,花了 22 小时赚到 16.88 美元

有人让 Codex 去赚 5 美元,它自己找到开源项目的安全审计赏金,提交了能用的代码修复,跟维护者来回沟通,还搞定了 GitHub 的验证流程,最后代码被合并,拿到了 16.88 美元。整个过程大约 22 小时,如果每天重复,一个月能赚 506.40 美元。金额不大,但这是 AI 第一次自己跑通“接活—干活—收钱”的闭环。正文没披露 Codex 具体...

推荐理由:HKR 三项都站得住:一个 Codex agent 在 22 小时内走完了从接任务到收钱的闭环,有具体金额和流程细节。不过目前只有一条社交帖子作为证据,没有可复现的日志,所以先不打最高级。

AI HOT 精选

MachinaCheck:用本地大模型把 CNC 图纸审核从半小时压到 30 秒

MachinaCheck 是一个跑在 AMD MI300X 上的多智能体系统,专门分析 STEP 格式的 CNC 零件图,判断能不能做、需要什么刀具。它用 Qwen 2.5 7B 模型在本地推理,靠 192GB 显存把客户设计数据留在厂里,不往外传。核心流程是先用纯代码解析几何特征,再让多个模型分工做工序分类、刀具匹配、可行性判断和报告生成。团队说,以...

推荐理由:这是个AMD黑客松项目,不是大厂产品发布,但“30秒出CNC报价”的钩子够直接,技术条件也写得明白,所以给到featured。正文没披露实际准确率和误判案例,这点先别太激动。

5月10日星期日

r/LocalLLaMA

ByteBell 开源了一套代码索引方案:用 LLM 给每个文件生成语义信息存进图数据库,比向量、语法树和暴力塞上下文都管用

他们试了三种路线:向量相似度搜代码、用抽象语法树(AST)结构化匹配、以及直接把代码块塞进大窗口模型。最后发现,让 LLM 先给每个文件提炼出用途、摘要、业务背景、实体、类、函数、关键词和依赖关系,存到 Neo4j 图数据库里,再用全文搜索去查,效果最好。正文没披露具体评测指标和对比数据,这点先别太激动。工程上有个省钱设计:用 SHA-256 比对文件...

推荐理由:我会先打个折:文章来自 Reddit 分享,没有给出系统性的对比数据和量化指标,所以不能当正式评测看。但它的价值在于把一条反直觉的工程结论讲清楚了——向量、AST、暴力塞上下文都试过,最后是语义图赢了。做法也够具体:逐文件跑 LLM 摘要写入 Neo4j,用 SHA-256 diff 做增量更新,只重建改过的文件。这对正在搭代码检索或 agent 的人是个直接可抄的思路,踩坑记录比方法论更有用。信息缺口是没披露用了哪个模型做摘要、图查询的延迟和成本也没给,这点先别太激动。

机器之心 · 公众号

一个让 AI 做游戏不再靠“抽卡”的框架:先写玩法说明书,再分四步生成代码

这篇论文提出了 CreativeGame 框架,核心思路是让模型在写代码之前,先产出一份“玩法机制说明书”,把游戏规则、胜利条件、交互方式都定死,然后再分四步生成代码。这样做的好处是避免每次生成都像抽卡一样碰运气,也让后续迭代有据可依。评估部分用了两个硬性门槛:运行时错误和静态错误,不通过就直接打回,解决了评分虚高的问题。框架还引入了“谱系记忆”,同一...

推荐理由:这篇是游戏生成方向的研究框架,思路挺清楚,但正文没披露是否开源、有没有量化指标或实际落地案例。我会先打个折,放在 featured 里但不到必写级别。

新智元 · 公众号

硅谷顶尖 AI 甩开世界一年?这篇正文其实没给实锤

这篇文章的标题抛出一个很猛的判断,说硅谷最前沿的 AI 比外界领先一年,我们用的都是“技术余晖”。但点进去后,页面直接显示“环境异常,完成验证后即可继续访问”,正文内容完全没加载出来。所以,标题里提到的投资人 Elad Gil 的时间差说法(顶尖实验室员工领先硅谷 3-4 个月,硅谷又领先纽约 3-6 个月),以及 Mythos 在专家级网络攻击模拟中...

推荐理由:我会先打个折:这篇是二手评论,不是模型或产品发布,所以分数压在72–77这个区间。HKR三项都成立——“技术余晖”的钩子够抓人,时间差和73%成功率给了具体数字,地域焦虑感也拉满了。正文没披露Mythos测试的具体条件和样本量,这点先别太激动,但作为一篇制造FOMO的评论,它完成了任务。

量子位 · 公众号

浙大和腾讯优图搞了个会当“导演”的 AI 角色扮演框架,对话里能插旁白、场景和内心戏

浙大和腾讯优图在 ACL 2026 上发了 AdaMARP,让 AI 角色扮演不再只是你一句我一句,而是像导演一样调度四类消息:对话、旁白、场景描述和内心独白。框架里塞了个场景管理器,能根据剧情走向自动切分镜。训练数据从 81 部文学作品和 20 个合成主题里抽,评测集 AdaptiveBench 用 100 个种子场景来考模型能不能把故事讲下去。正文...

推荐理由:这篇 ACL 2026 的工作把角色扮演从“一问一答”拉到了多角色叙事,四通道消息和场景管理器是核心卖点,81 本书的数据集也算扎实。我会先打个折:它更像一个研究原型,没看到生产环境下的延迟、成本或安全约束,所以别急着想象它能直接跑在商业产品里。亮点在机制设计,短板在工程验证,整体值得关注但保持观望。

Computing Life · Share · 鸭哥调研

Anthropic 的 Computer Use 是怎么训练出来的——从一项专利读它的数据管线

Anthropic 一项专利披露了 Computer Use 的训练数据管线,核心不是录屏,而是把原始操作变成带推理链的数据。管线分三步:截获用户操作时允许附加思考标注,用多模态模型把点击坐标翻译成语义意图,再用更强的模型做合成扩展,一条真实轨迹变出几十条带推理变体的样本。学术数据集能训出跑 benchmark 的原型,但覆盖软件少、轨迹偏干净、缺少长...

推荐理由:这篇不是官方发布,是从专利里扒出来的分析,所以我会先打个折。但它把 Computer Use 的数据管线讲得很实在:先截屏记录人的操作,再用 transformer 推断操作背后的意图,最后让强模型把意图扩展成更多样的训练样本。对正在搭 agent 的团队来说,这套思路能直接参考,尤其是怎么把少量人工操作放大成训练数据。正文没披露具体模型规模和成功率数字,这点先别太激动。

5月9日星期六

AI HOT 精选

YC 老板 Garry Tan 开源了自己的 AI 系统 GBrain,五个月读了 20 多本书,管着 10 万页知识

Garry Tan 把 GBrain 放上了 GitHub,这是他给自己搭的一套个人 AI 操作系统,想做成能持续增值的“第二大脑”。系统按任务拆成几个模块:Book Mirror 负责深度处理书籍,Meeting Prep 自动做会前预习,五个月啃完 20 多本书,结构化知识库超过 10 万页,还在涨。架构上分三层——轻量路由层决定用哪个模型、可组合...

推荐理由:Garry Tan 把自用的 GBrain 开源,这件事我会先打个折——正文没披露 repo 活跃度、具体架构和有没有测试,所以别当成熟产品看。但亮点在于他真用了 5 个月,啃了 20 多本书、攒了 10 万页以上的结构化知识,说明系统至少跑通了个人知识复利这条链路。对想用模型管自己资料的人来说,这是个有参考价值的开源起点,不是公关稿。

AI HOT 精选

Peekaboo 3.0 发布,主打“先动手”的 Mac 操作和界面识别

Peekaboo 3.0 上线了,作者说这是 2.0 以来最大的一次更新。核心变化是把“操作”放在第一位,不再是先看再点,而是直接让模型去执行 Mac 上的任务。它把截图和界面检测统一成一个功能,CLI 和 MCP 之间的 JSON 交互也整理得更干净,快照功能有改进。作者提到去年就想做,但当时模型能力不够,现在时机到了。正文没披露定价、用了哪个模型,...

推荐理由:我会先打个折:正文没披露价格、模型细节和实际落地数据,所以判断只能停在工具更新本身。亮点是把截图和界面检测统一起来,再配上 CLI 和 MCP 的 JSON 交互,让 macOS 桌面 agent 的“看”和“动”更连贯。这点先别太激动,因为没有性能对比或用户反馈,但方向对做桌面自动化的团队有用。

AI HOT 精选

百度发了 ERNIE 5.1,参数量砍到原来的三分之一,训练费压到同规模模型的 6%

ERNIE 5.1 把总参数量压到原规模的大约三分之一,激活参数压到大约一半,预训练成本只花到同规模模型的 6% 左右。百度说性能没崩,Agent 能力超过 DeepSeek-V4-Pro,世界知识和创意写作接近头部闭源模型和 Gemini 3.1 Pro,推理仅次于 Gemini 3.1 Pro,深度搜索排全球第四。技术手段提了两个:弹性预训练用来提...

推荐理由:百度把 ERNIE 5.1 的参数和成本压到这个程度,我会先打个折——正文没披露具体参数量和基准测试细节,6% 的成本对比对象也没说清楚,这点先别太激动。但即便有水分,三分之一参数、一半激活、6% 预训练成本这三个数字摆出来,对正在头疼推理成本的团队来说就是强信号。加上已经上线 ERNIE 平台和 AI Studio,不是画饼,值得写。

AI HOT 精选

用 Codex 并行调试验证修复

作者查 bug 时会让 Codex 在临时沙盒里重建出问题现场,先确认 bug 能复现,再修,修完再验证一遍。本地环境不会被搞乱,因为所有操作都在隔离的临时环境里跑;速度也不掉,因为他同时开 10 个会话并行处理。正文没披露具体修复成功率或单次耗时。

推荐理由:这是一篇第一人称的工作流笔记,不是产品发布或基准测试,但 10 个 Codex 会话并行修 bug 的实操信号很强。我会先打个折——正文没披露修复成功率、单会话耗时和资源消耗,所以实用性还缺几块拼图。不过它把“临时沙盒 + 并行验证”这套打法讲清楚了,对想用 AI agent 干活的开发者有直接参考价值,放在 featured 里偏低的位置合理。

AI HOT 精选

百度发 ERNIE 5.1,预训练成本压到对标模型的 6%

百度在 ERNIE 5.0 的基础上做了 5.1,主要提升搜索、推理、知识问答、创意写作和智能体能力。最抓眼球的数字是预训练成本只有对标模型的 6%,但正文没披露对标的是谁、怎么算出来的,也没给具体金额或技术细节。我会先打个折——成本低到这个程度,要么是用了 5.0 的底子省了大笔算力,要么是统计口径有讲究。另外,模型在哪些基准上测了、效果提升多少,帖...

推荐理由:百度发了ERNIE 5.1,最抓人的一句话是“预训练成本约为对标模型的6%”。这个数字让一条模型更新变成了成本效率的故事,从业者会立刻想知道对标模型是谁、成本口径怎么算的,正文没展开说,所以冲击力有,但信息缺口也大。搜索、推理、问答、写作和智能体能力都提了升级,但没给具体评测或对比数据,技术细节偏薄。我会先打个折:话题性够强,靠成本数字和国产旗舰身份撑到了p1,但缺细节让它进不了90分以上的档位。

新智元 · 公众号

港中文开源 ArbiterOS:在模型动手前先拦一刀,高危操作拦截率拉到 92.95%

港中文 CURE 实验室把 ArbiterOS 开源了,这是一个给 AI 智能体(Agent)用的运行时治理内核。它的思路很直接:不让模型直接拿到执行权,而是在模型生成操作指令后、系统真正执行前,插一层拦截、解析、治理和观测。在 OpenClaw 的安全测试任务上,这套机制把高危步骤的拦截率从原来的 6.17% 提到了 92.95%。正文没披露具体延迟...

推荐理由:这篇不是大厂模型发布,是港中文 CURE Lab 的一个开源 agent 安全内核。我会先打个折,因为目前只在 OpenClaw 一个环境上测过,泛化性还没验证。但它的切入点很巧——不是事后审核,而是运行时拦截高危步骤,把拦截率从 6.17% 拉到 92.95%,这个提升幅度够大,说明原来的 agent 几乎不设防。对做 agent 安全或工具调用治理的人来说,这是个能直接拿来改的参考方案。信息量够,数字有解释,没有吹概念,所以放在 featured 档,重要性给 80 是合适的。

量子位 · 公众号

拆解 Claude Code 源码:它为什么不做“完美”的 AI 智能体

MBZUAI 和 UCL 的研究人员直接扒了 Claude Code v2.1.88 的源码,没看公关稿,就看代码怎么写的。他们从里面挖出了 5 条设计哲学、13 条设计原则、7 层权限控制和 5 层上下文压缩策略。核心结论是:Claude Code 没追求做一个万能 agent,而是主动做减法,把模型塞进一个边界清晰、行为可控的工程框架里。比如它的权...

推荐理由:这篇不是 Anthropic 官方通稿,而是第三方扒源码做的分析,把 Claude Code 为什么这么设计、在哪做了让步讲得很透。标题的反直觉钩子够强,内容有 v2.1.88 的版本号和具体机制撑住,对正在踩坑的 Agent 开发者来说,比看十篇趋势报告都管用。不过毕竟是外部解读,不是一手发布,所以放在 featured 而不是 must-write。

量子位 · 公众号

谷歌搞了个“AI 联合数学家”,用多智能体协作刷了最难数学基准的新纪录

谷歌 DeepMind 发布了一个叫 AI Co-Mathematician 的系统,它不是单个模型,而是一套异步协作的智能体工作区,专门用来做数学研究。在 FrontierMath 这个目前最难的数学基准测试里,它解开了 48 道 Tier 4 级私密题中的 23 道,正确率 48%。对比之下,GPT-5.5 Pro 的正确率是 39.6%。测试条件...

推荐理由:我会先打个折:正文没披露模型架构、训练数据和具体成本,所以没法判断这 48% 的含金量到底多实。但故事本身很抓人——牛津教授用这个系统解开了一个群论悬案,同时 FrontierMath Tier 4 这种非公开难题集上的成绩比 GPT-5.5 Pro 高了 8 个多点,说明在极难数学推理上确实往前走了一步。对做推理和 agent 的人来说,这是个值得盯的信号,但别急着把它当成通用数学家的雏形。

量子位 · 公众号

千问AI眼镜S1上线空间3D显示和主动服务,能提醒你叫车、帮你买东西

千问AI眼镜S1这次更新加了两个新东西:空间3D显示和主动提醒。空间3D显示是行业里第一个这么做的,眼镜里看到的画面会有立体感。主动提醒的意思是眼镜会自己跳出来提示你,比如该叫车了,还能直接帮你操作叫车。这个月还会上线即时购物和拍照搜题功能。另外Wellsenn XR的数据显示,从3月8号开始,千问AI眼镜拿下了国内线上AI眼镜53%的销量,卖得最多。...

推荐理由:这是一次功能更新,不是新模型或平台发布。空间3D显示和主动服务让眼镜更像一个能干活的东西,但正文没给出具体技术细节和实际延迟数据。53%的线上销量份额来自维深,统计口径和线下情况没展开,我会先打个折。整体信息量够,但偏产品节奏,放在featured低分段比较合适。

机器之心 · 公众号

DeepSeek 被曝正在谈一笔 500 亿人民币的融资,梁文锋自己掏四成,估值可能到 3500 亿

这条消息来自机器之心,但原文页面被微信判定环境异常,需要验证才能看,所以正文内容没拿到。标题和摘要里提到的关键数字是:融资额约 500 亿人民币(折合约 73 亿美元),估值约 3500 亿人民币(折合约 515 亿美元)。梁文锋个人计划出资 40%,腾讯和 600 亿规模的国家 AI 基金也在谈。这些数字如果属实,说明 DeepSeek 这轮融资规模...

推荐理由:这条DeepSeek融资传闻数字大、出资比例明确、资方有名有姓,HKR三项都站得住。但正文也说了还在谈,没有官方确认,所以分数和级别不动,保持84分和featured,不升p1。

机器之心 · 公众号

OpenAI 研究员翁家翌提出“启发式学习”:不调模型参数,靠改代码和记忆来训练 AI

OpenAI 的翁家翌抛出了一个叫“启发式学习”的新训练思路,核心是不再靠梯度去更新神经网络权重,而是让模型通过修改代码、测试用例、回放记录和记忆来提升自己。他拿 Atari 游戏做验证,提到 codex gpt-5.4 在打砖块(Breakout)上拿了满分 864 分,并在 Atari 57 个游戏里生成了 342 条搜索轨迹。不过文章正文因为微信...

推荐理由:OpenAI 研究员翁家翌提了个叫 Heuristic Learning 的思路,不是官方产品发布,更像研究评论和开源信号。亮点是 codex gpt-5.4 在 Breakout 拿了 864 满分,Atari 57 上只靠 342 条搜索轨迹就让模型自己改代码、测试和记忆。我会先打个折:正文没披露这套方法在更复杂任务上的泛化表现,也没说计算开销多大,所以“下一个训练范式”这个判断先别太激动。但如果是真的,意味着不用梯度也能让模型在具体环境里持续变强,对做 agent 自进化的团队是个值得盯的参考。

Latent Space

Anthropic 一年翻十倍,其他公司却在裁掉超过一成的人

Anthropic 现在被二级市场估到 1 万亿到 1.2 万亿美元,已经超过 OpenAI,排进全球前 15 大公司。这个估值背后有实打实的收入支撑:他们刚经历了一个“奇迹般”的第一季度,年化收入增速达到 80 倍,一个月内年化收入又跳涨了 150 亿美元。另一边,Block 裁了 40% 的人,Coinbase 裁了 14%,Cloudflare ...

推荐理由:这条不是官方融资或产品发布,属于行业评论,但信息密度高。Anthropic的10倍年增长和1万亿以上估值数字很扎眼,旁边又列了一串裁员百分比,对比强烈。我会先打个折:估值和增长数据正文没交代来源,是转述的说法,不能当实锤用。但即便保守看,它也点出了AI行业资金和人才在向头部集中的趋势,对从业者判断方向有参考价值。

5月8日星期五

AI HOT 精选

机器人终局:一份物理 AGI 路线图,用大语言模型的成功逻辑来推演

演讲者把机器人做成人形通用智能拆成六块:视频世界模型当第二预训练范式,世界行动模型(WAM)负责把感知转成动作,数据收集策略对标特斯拉 FSD 的物理数据飞轮,EgoScale 和灵巧性缩放定律试图量化训练规模与手部操作能力的关系,物理强化学习用来跑通最后一公里,DreamDojo 则是一个端到端的神经物理引擎。整体思路是照搬大语言模型的成功路径,但正...

推荐理由:我会先打个折:这是演讲者个人的路线图,不是论文或产品发布,所以别当官方公告看。但它的好处是把物理 AGI 拆成了 6 个能聊的模块,并且用 LLM 的发展阶段来类比,让做机器人的人能快速对齐讨论框架。正文没给出每个模块的具体验证结果或数据,所以这条路线图更多是观点而非实证。对从业者来说,值得扫一眼,但暂时不用太激动。