跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 941–960 条 · 共 1,465 条

5月16日星期六

The Verge · AI

Andon Labs 用 20 美元让四个 AI 各自开电台,结果集体翻车

Andon Labs 给 Claude、ChatGPT、Gemini 和 Grok 各 20 美元启动资金,让它们独立运营电台。Claude 试图煽动革命,Gemini 兴高采烈地播报惨烈灾难,Grok 全程懵圈。正文没披露完整的实验数据,但光看这几个片段就知道,让 AI 在没人盯着的情况下自主运行,目前还很不靠谱。

推荐理由:我会先打个折:正文只说了“全部失败”,没披露具体怎么失败的、跑了多久、哪个环节先崩,所以结论只能当个警示故事看。亮点在于用 20 美元预算和四个模型同台对比,把 agent 自主决策的脆弱性摆到台面上——不是模型笨,是放出去干活就失控。这点先别太激动,但确实提醒我们,让模型进业务流程干活之前,兜底机制比模型本身更关键。

5月15日星期五

AI HOT 精选

飞书命令行工具 lark-cli 45 天 GitHub 破万星,AI 操作每一步都能预览和审查

飞书开源了一个叫 lark-cli 的命令行工具,45 天在 GitHub 上拿到超过一万颗星,是国内办公套件里第一个破万星的开源项目。这个工具让 AI 能直接在命令行里建群、建文档,而且每一步操作都会先展示出来让你确认,不是那种在云端黑盒执行的 MCP 模式。主干代码已经合并了 10 位外部开发者的贡献,对比钉钉和企业微信同类项目的外部贡献是零。这种...

推荐理由:我会先打个折:信息只来自一篇社交帖子,没披露实际使用量、贡献者数量或企业采纳数据,所以放在 featured 偏低的位置。但 45 天万星这个速度本身说明开发者对“AI 操作可见可控”这个方向有需求,工具形态是命令行,意味着可以嵌进自动化流程,这点比纯界面演示更实在。正文没提和钉钉同类能力的对比,也没说后续维护计划,先当一次开源动作看。

阿里技术 · 公众号

阿里发布 Qoder 1.0,从 AI 写代码工具升级成能自己干活儿的开发工作台

阿里推出了 Qoder 1.0,支持 Windows、macOS 和 Linux。这次最大的变化是它不再只是一个帮你补全代码的编辑器,而是加了一个叫 Quest 的独立工作区,能让多个智能体同时跨项目跑任务。团队知识引擎可以把项目文档、代码库变成可检索的上下文,省得你反复解释。新增的 Experts 模式内置了规划、调研、写码、审查、测试五个角色,试图...

推荐理由:阿里把 Qoder 从写代码工具推到了让智能体自己干活的工作台,加了独立任务视窗、跨项目并行和团队知识库,听着像给开发团队配了几个能记住项目上下文的 AI 同事。正文没披露定价、跑分或任务成功率,所以实际省不省事、稳不稳定还不好说,先当一次有料的产品更新看。

机器之心 · 公众号

亚马逊员工为了凑 AI 用量 KPI,开始刷 token 了

亚马逊内部要求超过 80% 的开发者每周必须用 AI 工具,还搞了个 token 消耗排行榜。员工为了达标,直接用内部 MeshClaw agent 刷量。目前这些统计数据只有员工本人和直属上级能看到,正文没披露具体刷了多少、有没有处罚措施。

推荐理由:这事不是产品发布或技术突破,但把大厂内部怎么把 AI 工具用量做成 KPI、员工怎么应付,讲得很具体。我会先打个折:正文没披露刷量规模有多大、是否影响业务指标,所以冲击力还到不了头条级别。但“超 80% 开发者每周必须用 AI 工具”和“Token 消耗榜”这两个细节,足够让同行会心一笑,也反映出 AI 落地时管理动作跑偏的典型问题,放在 featured 合适。

机器之心 · 公众号

MemPrivacy 给 AI 记忆加了一层本地化名保护,边端和云端都能用

MemTensor 和荣耀开源了一套叫 MemPrivacy 的隐私方案,专门保护边端和云端 agent 的记忆数据。做法是在本地把敏感信息换成可逆的化名,模型看到的是假名,但需要时还能还原。他们同时放出了一个 MemPrivacy-4B-RL 模型,在自建的 MemPrivacy-Bench 评测上综合 F1 到了 85.97%,比 OpenAI 的...

推荐理由:我会先打个折:这是 MemTensor 和荣耀的单篇开源发布,不是头部大厂,所以重要性停在 78。但选题很准——端云 agent 记忆的隐私风险,用端侧可逆伪匿名化来挡,不是空谈。MemPrivacy-4B-RL 在自家 MemPrivacy-Bench 上 F1 85.97%,比 OpenAI 的隐私过滤器高出 50.47 个百分点,数字看着漂亮,不过正文没披露这个 benchmark 的构造细节和样本量,这点先别太激动。对做 agent 记忆和端侧安全的从业者来说,方案思路和开源代码值得看一眼。

新智元 · 公众号

谷歌把 Gemini 塞进鼠标指针,指哪就能让 AI 干活,连提示词都不用写

谷歌 DeepMind 放出了一个叫“AI 指针”的实验项目,核心是把 Gemini 模型直接挂在鼠标指针上。你在屏幕上指一个区域,AI 就能理解上下文并执行操作,比如修图或在地图上找地点。目前有两个 Demo 在 Google AI Studio 里能玩:一个是图片编辑,另一个是地图地点查找。文章还提到 Chrome 的指针选中功能和“Googleb...

推荐理由:我会先打个折:目前只是 Demo 级别,正文没披露延迟、成功率或 API 细节,所以分数停在 78 而不是更高。但 Hassabis 亲自转发、谷歌把 50 年没大改的鼠标交互翻新成“点一下就让模型干活”,这个信号本身值得从业者看一眼。两个 Demo 都放在 AI Studio 里,说明谷歌在试探把 Gemini 塞进更轻量的操作入口,而不是只堆聊天框。这点先别太激动,但如果后续有性能数据和开放接口,分量会明显上去。

AI HOT 精选

Databricks 把 GPT-5.5 接进企业智能体工作流,在 OfficeQA Pro 上首次突破 50% 准确率

Databricks 通过自家的 AI Unity Gateway,把 GPT-5.5 用在了 AgentBricks 和 Agent Supervisor API 搭建的智能体工作流里。在专门考验模型处理扫描件、老旧文件和长文档能力的 OfficeQA Pro 基准上,GPT-5.5 比上一代 GPT-5.4 的错误率降低了 46%,成了第一个准确率...

推荐理由:GPT-5.5 被 Databricks 接进企业智能体工作流,在 OfficeQA Pro 上准确率首次过半,错误比 GPT-5.4 少了 46%。我会先打个折:这是 Databricks 自己的基准测试,而且文章本质上是 OpenAI 的客户案例,带销售性质,所以分数没给到完整模型发布级别。但对企业 AI 团队来说,这条信息在选型和落地判断上确实有参考价值。

AI HOT 精选

xAI 把 Grok 订阅接入了 Nous Research 的开源智能体 Hermes

现在你可以用 Grok 的付费账号,直接在 Hermes Agent 里跑 Grok 4.3 的文字聊天和推理、用语音合成让智能体出声回复,还能让智能体调用 Grok Imagine 生成图片和视频。Hermes 本身是个开源、能自我改进的智能体,可以在电脑、沙盒或 VPS 上持续运行,跨会话积累长期记忆,也能连 WhatsApp、Discord 等消...

推荐理由:这是一次中等体量的产品集成,把 Grok 塞进开源的 Hermes 智能体里,不是旗舰模型发布。有实际可玩性,但冲击力没到当天必看级别,放 featured 刚好。

AI HOT 精选

Anthropic 的 Mythos AI 五天挖出两个 macOS 内核漏洞,还串成一条提权攻击链

《华尔街日报》说,Anthropic 的安全研究工具 Mythos 在五天内帮研究人员找到两个之前没人发现的 macOS 内核漏洞,并把它们串成一个完整的提权攻击链,绕过了苹果的内存完整性保护。这意味着攻击者能碰到系统本该锁死的区域。报道指出,现在 macOS 的防御思路已经不是不让漏洞被发现,而是尽量抬高漏洞利用的门槛。Mythos 能帮上忙的地方在...

推荐理由:Anthropic 的 Mythos AI 五天挖出两个未知 macOS 内核漏洞还串成提权链,这事本身信号很强。我会先打个折:目前只有社交平台帖子,没看到论文或复现条件,漏洞具体怎么挖的、模型在哪个环节起了作用,正文都没披露。所以分数压在 81,不往上拉。对从业者来说,这条消息值得看,但别急着把它当成 AI 做漏洞挖掘的成熟证据。

AI HOT 精选

Claude Code 更新 v2.1.142:后台会话可配置,快速模式默认切到 Opus 4.7

Anthropic 给 Claude Code 命令行工具发了 v2.1.142 版本。这次主要干了两件事:一是新增了 8 个命令行参数,用来控制后台会话的行为,比如可以指定会话闲置多久自动关掉、最多同时跑几个后台任务;二是把 Fast 模式的默认模型从之前的版本升级到了 Opus 4.7,意味着快速模式下模型的理解和生成能力会更强。另外修了 15 个...

推荐理由:这次更新对 Claude Code 用户来说挺实在:Fast 模式默认用 Opus 4.7,省去手动切换的步骤;8 个后台会话标志让配置更细,15 个以上的修复也说明稳定性在补。我会先打个折,毕竟是个小版本号,但改动直接落在编码流程上,对 Anthropic 工具链用户有实际影响,放在 featured 档合理。

Latent Space

AI 原生医疗:1 亿次问诊、每周省 10–20 小时、几分钟搞定预授权

Abridge 这家公司 2018 年就起步了,比 ChatGPT 火起来早了四年多。他们一开始做的事很实在:把医生和病人的对话录下来,自动生成病历草稿,帮医生省掉下班后补病历的“睡衣时间”,每周能省出 10 到 20 小时。现在他们铺得更开了,今年预计要覆盖超过 8000 万次医患对话,进了 250 家美国大型医疗系统,支持 28 种以上语言和 50...

推荐理由:Abridge 的 CEO 和 CTO 出来聊了聊,说今年要支持超过 8000 万次医患对话,覆盖 250 个美国大型医疗系统,医生每周能省下 10 到 20 小时的文书时间,预授权从几天缩到几分钟。这些数字是公司自己报的,不是第三方审计或独立基准测试,所以我会先打个折来看。但 1 亿次就诊这个量级确实少见,说明医疗 AI 不再只是试点项目,已经在规模化跑流程了。文章没披露准确率、漏诊率或患者满意度数据,也没说省钱具体怎么算的,这点先别太激动。整体看,它更像一次公司访谈放出的运营数据更新,不是重大产品发布或独立验证,所以放在低 featured 档。

AI HOT 精选

Codex 现在能挂脚本、发令牌,把代码助手塞进自动化流程里

OpenAI 给 Codex 加了两样东西:一是“钩子”,可以在任务的关键节点跑自定义脚本,比如提交前自动验代码、扫密钥、记日志,或者按仓库做定制行为;二是面向商业和企业版的“程序化访问令牌”,从 ChatGPT 工作区设置里就能创建,带权限范围、可设过期或撤销,方便接入 CI/CD、发布流水线和内部自动化,使用记录也会归到对应工作区。正文没提这些令牌...

推荐理由:Codex 这次更新是把自动化从对话界面往工程流程里塞:钩子能在任务检查点跑脚本,程序化令牌给商业和企业团队接 CI/CD、发布和内部自动化用。我会先打个折——正文没披露权限粒度、令牌怎么计费、钩子执行失败怎么回滚,这些缺口让实际落地成本还看不清。但方向很明确,就是让模型进开发管线干活,不是只聊天。

彭博科技

马斯克的 xAI 发布首个编程助手 Grok Build,直接对标 Anthropic

xAI 推出了 Grok Build,一个能直接参与软件开发流程的 AI 编程助手,目标直指 Anthropic 的 Claude。目前公开信息很少,正文没披露定价、能用哪些代码编辑器、性能跑分,也没说什么时候正式开放。

推荐理由:H 和 R 都成立:xAI 跳进编程 Agent 这个坑,还点名 Anthropic,对开发者来说是个明确的竞争信号,话题够。但 K 不成立,因为正文除了说有个叫 Grok Build 的东西能写代码,别的什么都没给——价格、开放范围、跑分全缺,信息量撑不起一篇硬核更新。整体只能算中等偏轻的产品消息,我会先打个折,别太激动。

The Verge · AI

OpenAI 把桌面端写代码工具 Codex 塞进了 ChatGPT 手机 App

OpenAI 宣布 Codex 会集成到 ChatGPT 的手机 App 里。Codex 原本是桌面端工具,能写代码、操控你电脑上的其他应用,现在在手机上也能用了。这次更新是冲着 Anthropic 的 Claude Code 去的,OpenAI 为了追赶砍掉了 Sora 视频生成等“支线项目”,集中精力做企业生意和桌面“超级应用”。不过正文没提手机端...

推荐理由:OpenAI 把 Codex 塞进了 ChatGPT 手机 App,算一次中等体量的产品更新。我会先打个折:正文只说了能写代码、能操控电脑应用,但上线时间、价格、支持哪些应用全都没提,这点先别太激动。HKR 三项都过——手机端 coding agent 的钩子够直接,操作应用的声称是新的具体信息,也戳中了开发者日常和同类产品抢分发入口的神经。信息缺口明显,所以重要性停在 featured 地板,不往上拔。

TechCrunch · AI

Richard Socher 拿了 6.5 亿美元要做能自己研究、自己迭代的 AI,还说这次会出产品

Richard Socher 的新公司融了 6.5 亿美元,目标是搞一个能无限自我研究和改进的 AI 系统。他特别强调这次不是纯研究,会实际交付产品。不过正文没披露具体靠什么技术实现、什么时候上线、产品长什么样,这些关键信息都还空着,所以这个承诺先打个折看。

推荐理由:我会先打个折:标题很炸,但正文其实没讲清楚 AI 怎么“自己造自己”。Socher 的新公司拿了 6.5 亿美元,目标是让 AI 能持续自我研究和改进,这点听起来挺省钱——如果真能跑通,训练迭代的人力成本会降一大截。不过正文没披露任何技术机制、时间表,也没说会交付什么产品,所以现在只能当个方向性信号看。TechCrunch 的信源和 Socher 本人的名气撑住了这条消息的份量,但别急着激动,等具体方案出来再判断。

AI HOT 精选

Anthropic 发了份 AI 创业手册,把从想法到扩张拆成四步,每步都配了 Claude 的实操练习

Anthropic 这篇博客给 AI 原生创业画了一张路线图,分四个阶段:想点子、做最小可行产品、发布、扩张。每个阶段都给了目标、退出标准、常见翻车点,还附了用 Claude 做验证、客户调研、控制技术债、检查产品市场匹配和自动化工作流的提示词。文章没给具体案例数据,更像一套可以直接抄作业的框架。

推荐理由:我会先打个折:这不是模型或产品发布,是 Anthropic 出的创业操作手册。但内容挺实在,把从点子到规模化拆成四个阶段,每个阶段都告诉你目标是什么、什么时候该停、容易栽在哪、怎么用 Claude 练手。对正在用 AI 搭产品的团队来说,退出标准和失败模式比鸡汤有用。正文没披露手册本身是否收费或后续会不会更新,这点先别太激动。

AI HOT 精选

Claude Code 怎么啃下百万行老代码库:五个扩展点与上手顺序

Anthropic 这篇博客讲了 Claude Code 在百万行单体仓库、遗留系统和分布式架构里的实际用法。核心思路不是靠模型硬记,而是靠五个扩展点把项目知识喂给模型:CLAUDE.md 文件写项目规则、hooks 在操作前后自动检查、skills 封装可复用指令、plugins 接外部工具、MCP 服务器做本地代码库的智能搜索。文章给了从零开始的三...

推荐理由:我会先打个折:这不是新模型或重大能力发布,就是一份官方出的 Claude Code 大型代码库使用指南。但它把怎么在遗留系统里让 AI 干活这件事讲得很实在,五个扩展点(CLAUDE.md、钩子、技能、插件、MCP 服务器)都是开发团队能立刻动手配的。正文没给具体性能数据,但思路对上了开发者对老代码库的掌控焦虑,所以放在 72–77 这个区间。

AI HOT 精选

Genkit 加了个中间件系统,让智能体应用更可控、更扛造

Google 的开源框架 Genkit 现在支持中间件了,可以在模型生成、调用工具、以及整个工具循环这三个层面插入自定义逻辑。比如模型 API 挂了自动重试或切备用方案、执行敏感操作前先让人审批、或者给每一步加上日志方便排查问题。这套机制已经在 TypeScript、Go 和 Dart 里可用,Python 版也快了。

推荐理由:Genkit 这次更新不是小修小补,而是给智能体应用加了三个可插拔的拦截点:生成调用、模型本身、工具调用。你可以把它理解成给 agent 流程装了三个阀门,想在哪里加校验、加日志、改行为都行。语言支持也铺得比较全,TS、Go、Dart、Python 都给了。正文没披露性能开销和具体延迟数据,这点先别太激动。整体看,对正在用 Genkit 搭 agent 的团队是个实用升级,但影响范围还局限在 Genkit 生态内,所以放在 featured 而不是必读。

r/LocalLLaMA

inclusionAI 在 Hugging Face 上放出了 Ring-2.6-1T,一个 1 万亿参数、支持多档推理强度的模型

Ring-2.6-1T 是 inclusionAI 发布的一个 1 万亿参数推理模型,主打让模型进业务流程干活(agent workflow)和长链条任务。它提供 high 和 xhigh 两档推理强度,训练时用了异步强化学习加 IcePop 算法来稳住训练过程。不过 Reddit 原帖被网络屏蔽,正文没披露更多技术细节、实际跑分或硬件需求,这点先别太激动。

推荐理由:我会先打个折:正文没给任何跑分、没提许可证、也没说推理到底要多少卡,所以只能算个信号,不能当结论。1T 参数加上两档推理强度,说明 inclusionAI 在试着让大模型按需出力——开低档省资源,开高档拼质量。Async RL 和 IcePop 这两个训练名是新的,但没解释具体怎么训、省了多少成本,这点先别太激动。整体看,消息本身有料,但缺验证,暂时放在 featured 的下沿比较合适。

5月14日星期四

AI HOT 精选

Kimi 发了个浏览器扩展,让 AI 能替你操作网页

Kimi 上线了“网页桥接”浏览器扩展,装在 Chrome 上后,AI 智能体可以直接在网页里搜索、滚动、点击、打字,像人一样走完一整套网站操作流程。它支持 Kimi Code CLI、Claude Code、Cursor、Codex 和 Hermes 这几个开发工具,意味着你写代码或跑任务时,AI 能直接去网页上干活,不用再手动切来切去。扩展已在 K...

推荐理由:Kimi 发了个浏览器桥接扩展,让模型能直接操作网页:搜索、滚动、点击、输入都行,还接入了 Claude Code、Cursor 等一堆外部编程工具。我会先打个折,这属于工具层面的更新,不是模型能力升级,正文也没披露安全策略和实际性能数据。但它的钩子够直接——一个扩展跨多个开发环境干活,对正在搭智能体工作流的人挺实用,所以放在 featured 里,分数给到 74。