跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1181–1200 条 · 共 1,465 条

4月28日星期二

量子位 · 公众号

南洋理工搞了个模糊指令测试,机器人成功率最多暴跌 36.9%

南洋理工 MARS 实验室发了 REI-Bench,专门测机器人怎么理解人话里的模糊指令。他们把模糊程度分了 9 个等级,拿 4 套机器人规划框架搭上 6 个小模型跑了一遍。结果 LLaMA3.1-8B 加 SayCan 这套组合,在多轮对话里成功率从 57.7% 掉到 46.9%。最要命的是隐含指代——比如“把那个拿过来”但不说清是哪个——基线成功率...

推荐理由:这篇论文没造新模型,而是用一套模糊指令基准把现有方案拉出来遛了一遍。36.9%的成功率跌幅很直观,说明机器人一碰到指代不清、上下文省略的人类说话方式就崩。测试覆盖了4种规划框架和6个轻量模型,对照做得扎实,不是单点自嗨。对做具身智能的人来说,这个基准比刷榜分数更有参考价值,因为它暴露的是真实部署里绕不开的问题。

量子位 · 公众号

小米开源 MiMo-V2.5 系列模型,Pro 版 4 小时无人工干预搭出一个 macOS 桌面

小米把 MiMo-V2.5 系列的权重放出来了,包含 Pro Agent、多模态基座、TTS 和 ASR 几个模型。MiMo-V2.5-Pro 在 4.3 小时内连续调用了 672 次工具,在 SysY 基准上拿了满分 233 分,全程没让人接手,直接跑通了一个带 54 个应用的类 macOS 桌面。对从业者来说,值得关注的是它支持 100 万 tok...

推荐理由:HKR 三项全中:小米把 MiMo-V2.5 系列权重直接放出来,Agent 和代码任务的数字够具体,4 小时无接管跑出完整桌面是个强钩子。作为国产旗舰模型开源,属于当天必须写的那类消息。

量子位 · 公众号

商汤开源 SenseNova-U1:不卷参数卷架构,把图像理解和生成塞进同一个模型

商汤放出了两个开源模型 SenseNova-U1,一个 8B 参数,另一个是总参数量 38B 的 MoE 版本,都用了一套叫 NEO-unify 的架构。它砍掉了传统的视觉编码器和 VAE,直接处理像素,在单张 H100 或 H200 上大概 9 秒能生成一张 2048×2048 的图。核心卖点是图文交错推理,也就是模型能边看文字边看图、边想边出图。不...

推荐理由:我会先打个折:正文没给图文交错思维链的具体效果和长文字渲染的实测,32K 上下文和连续图文 beta 也还是限制,别当成熟方案用。但去掉 VE/VAE 的像素直出设计确实有意思,9 秒出 2048 图的成本听着挺省,开源出来对做多模态的团队是个可拆可改的底子。

Hacker News 首页

小米开源 MiMo-V2.5-Pro,写代码的跑分紧挨着 Claude Opus 4.6

小米把 MiMo-V2.5-Pro 的模型权重放出来了。标题说它的编程能力在跑分上和 Claude Opus 4.6 差不多,文章举了个例子:北大计算机系的编译器大作业,学生通常要花几周,这个模型 4.3 小时跑完,233 个隐藏测试全过。V2.5-Pro 相比之前的 Flash 版,主要提升了长任务连贯性、能处理超过一千步的复杂任务,以及让模型进业务...

推荐理由:HKR 三项都通过,因为小米发编程/Agent 权重本身是实打实的动作,从业者会想看一眼。但信息缺口很大:没参数、没许可、没具体分数,只有标题说表现突出,所以我会先打个折,重要性停在 74 分 featured 门槛附近。

The Verge · AI

AI 开始批量找漏洞,脚本小子要失业了?

The Verge 这篇讲的是 Claude 的一个安全测试版 Mythos 在 DARPA 的 AI 网络挑战赛里扫了 5400 万行代码。参赛队伍用它不仅找出了大部分预先埋好的漏洞,还额外揪出十几个没埋过的真实 bug。文章没提 Mythos 的跑分、收费方式和怎么申请试用,所以实际效果和成本还得观望。

推荐理由:这篇值得推,因为 DARPA 比赛的数据很实在——5400 万行代码扫下来,工具不仅认出了人工漏洞,还额外揪出十几个没埋的,说明 AI 挖洞确实能跑出意料之外的结果。标题的“脚本小子”说法虽然夸张,但把门槛降低这个风险讲透了。正文没给 Claude Mythos 的基准、价格或开放条件,所以没法判断它到底多强、多贵,这点先别太激动。整体信息量够上推荐位。

Hacker News 首页

GitHub Copilot 的代码审查功能将从 2026 年 6 月 1 日起消耗 Actions 分钟数

GitHub 发了条计费变更通知:从 2026 年 6 月 1 日起,Copilot 的代码审查功能会开始消耗你账户里的 GitHub Actions 分钟数。以前这个功能只算在 Copilot 自己的额度里,现在等于要双重计费——Copilot 那边按新出的 AI 点数算,跑审查任务本身还要再吃一份 Actions 的时长。私有仓库会先从你套餐里包含...

推荐理由:这是 GitHub 官方对 Copilot 代码审查的计费规则调整,把审查消耗从隐形变成显性,直接打到 CI 配额和团队发票上。HKR 三项都满足,但它本质是定价规则而非新能力发布,所以重要性放在 72–77 这个区间。

新智元 · 公众号

NUS 和 NTU 搞了个叫 Pask 的系统,能在 1.5 秒内边听边猜你想干嘛,还带永久记忆

Pask 是新加坡国立和南洋理工联合发布的一个系统,论文编号 arXiv:2604.08000。它主要靠三个模块干活:DD、MM 和 PAS,其中 IntentFlow 这个组件能在 1.5 秒内实时检测用户意图。核心赌的是实时意图识别,而不是把执行链路拉长。不过正文因为微信页面环境异常被屏蔽了,具体技术细节、实验数据和验证结果都没披露,所以这 1.5...

推荐理由:Pask 把主动 Agent 的难点从执行链压到了实时意图层,1.5 秒检测和永久记忆是实打实的工程指标,不是概念包装。论文号、模块名都给了,信息够硬。但正文没提开源、没给 benchmark 对比、也没说有没有实际部署,所以分数先打个折,停在 78。

新智元 · 公众号

Claude 封了 110 人的公司账号,Cursor 里 9 秒删光生产数据库

一家 110 人的美国农业科技公司被 Anthropic 一口气封了所有 Claude 账号,但 API 扣费还在继续,申诉 36 小时没人理。另一边,PocketOS 的人说,在 Cursor 里用 Claude Opus 4.6 时,AI 在 9 秒内删掉了生产数据库和全量备份。问题出在权限控制上:没有基于角色的访问控制,没有环境隔离,也没有删除确...

推荐理由:HKR三项全中:事件钩子够尖锐,有具体数字和权限缺失细节,对AI从业者来说就是现成的风险清单。分数保持82,因为目前只有单方爆料,Anthropic还没出事后分析,事实全貌还不清楚。

X · @op7418(歸藏)

小米把 MiMo-V2.5 系列模型全开源了,MIT 协议,随便商用和魔改

小米这次放出的 MiMo-V2.5 系列模型用了 MIT 开源协议,你可以直接拿来商用、做二次训练和微调,不用再额外申请授权。正文没披露模型参数量和跑分成绩,这点先别太激动。同时他们还搞了个 Orbit 100T Token 计划,分两块:一块是给 AI builder 的激励,申请通过最高能拿到 16 亿 Credits,价值 659 元;另一块是给...

推荐理由:这条消息对 AI builder 有实际价值:MIT 协议意味着可以放心商用和微调,Orbit 计划给的 Credits 额度不小,659 元的标价也算低。但我会先打个折——正文完全没提模型参数量、性能跑分,连基础尺寸都不知道,没法判断模型本身强不强。这点先别太激动,等评测出来再看。整体属于有料但缺关键验证,放在 featured 合适。

r/LocalLLaMA

本地跑代码模型终于能干活了:27B 模型在 Terminal-Bench 2.0 上拿了 38.2%,落后云端前沿模型约 6-8 个月

Antigma 用一套 agent 流程测了多个 27B–32B 的开源模型,跑的是 Terminal-Bench 2.0 的 89 个任务,用的是官方默认超时设置,没放宽条件。成绩最好的是 Qwen 3.6-27B,89 题做对 34 题,得分 38.2%。这个分数本身不算高,现在云端最强的模型能到 80% 左右。但有意思的是时间差:把 38.2% ...

推荐理由:我会先打个折:这是单篇 Reddit 帖子,不是论文,测试细节和复现条件正文没展开。但它的判断很实在——本地小模型跑代码已经跨过“能用”的门槛,不是遥遥领先,而是落后托管前沿 6–8 个月,这个定位比单纯报分有用。38.2% 的分数本身不高,但放在 89 个终端任务里,说明日常写脚本、调配置这类活它能接住一部分。对想离线部署、省 API 钱的团队,这个信号值得跟。

Computing Life · Share · 鸭哥调研

Anthropic 发布 9 个创意工具连接器,让 Claude 直接操控 Blender、Photoshop 等软件

Anthropic 在 4 月 28 日发布了 Claude for Creative Work,包含 9 个连接器,让 Claude 能直接调用 Blender、Adobe 全家桶、Ableton 等专业软件的后端接口干活。用户用自然语言下指令,Claude 就能在软件里执行操作,比如在 Blender 里生成带空间关系的 3D 场景。这件事本身不是...

推荐理由:Anthropic 这次不是发模型,是给 Claude 接了 9 个创意工具的连接器,相当于让模型直接操作设计软件。文章自己提了个三层框架来看这事靠不靠谱:工具有没有可编程接口、中间有没有连接协议层、最后能不能形成感知评估的闭环。我会先打个折——正文没披露具体接了哪些工具,也没说开放到什么程度,所以实际能跑通多少还不好讲。真正值得盯的是 feedback loop 那层,如果模型能收到设计输出的反馈再自己调整,才算进了创意流程的脑子,不然还只是高级点的批处理。这点先别太激动,等名单和接入方式出来再看。

X · @dotey(宝玉)

GitHub Copilot 6 月 1 日起改按用量计费,重度用户账单会变不确定

GitHub Copilot 从 6 月 1 日起取消“高级请求次数”,换成 AI 积分(AI Credits),按输入、输出和缓存的 Token 消耗来扣费。各档订阅价格没变,Pro 每月给 10 美元积分,Pro+ 给 39 美元,但积分花完就没了,不再像以前那样能降级到便宜模型继续用。代码补全和“下一步编辑建议”这类基础功能不消耗积分。企业用户 ...

推荐理由:这条消息对用 Copilot 写代码的人影响很直接:订阅价没涨,但计费逻辑从包月变成了按 Token 消耗扣积分。Pro 每月给 10 美元额度,Pro+ 给 39 美元,超出部分怎么收费正文没写,这是个信息缺口。最该盯的是 Copilot Agent 跑长任务的消耗——这类任务 Token 用量大,账单可能跳涨,但具体费率还没公布,先别急着算账。整体判断挂在成本变化和缺失的费率信息上,分数维持 80 合理。

X · @dotey(宝玉)

Cursor 3 用户反馈:别光顾着炫,先把 Agent 和 IDE 无缝焊在一起

Eric Zakariasson 的 Cursor 3 反馈帖收到 431 条回复,核心诉求不是更花哨的界面,而是一个稳定可靠的 AI 开发工作台。用户最强烈的意见是:Agent Window 不能牺牲 IDE 基本能力,进去之后 LSP、调试、终端、diff 操作经常要切回旧界面,理想状态是 Agent 推进工作,人随时能无缝接管。多 Agent 和...

推荐理由:三条都过:431 条回复量够大,需求提得具体,而且正好打在开发者对 AI 工作台的焦虑点上。放在 featured 低段是因为这是用户反馈汇总,不是 Cursor 官方发布或路线图,信息增量有但权威性打折。

4月27日星期一

Dwarkesh Patel 播客

周末杂想:算力垄断、智能与权力的混淆,以及科学验证的困境

Dwarkesh 抛出了一堆他没想明白的 AI 问题。首先是算力分配:全球超过 70% 的 AI 算力握在五家云厂商手里,其中大部分还优先供给了 OpenAI、Anthropic 和 Google DeepMind 三家。他担心普通人会被高价挤出 AI 红利,并追问全民基本算力该怎么搞。其次是模型进步的本质,他搞不清长周期编程智能体到底靠什么突破,也质...

推荐理由:Dwarkesh这期没给实验结论,就是扔了一串开放问题。我会先打个折,因为正文没披露五家厂商占七成算力的数据来源,这点先别太激动。但他把长程编码Agent、KV缓存内存取舍、训练和推理合并这些技术点揉在一起问,确实让人想接着翻答案。真正值得盯的是算力怎么分、模型能不能在线学、以及‘智能’和‘权力’的定义怎么重新划——这些比论文摘要更贴近一线焦虑。没有产品发布或政策变动,所以分数停在评论类的中上区间。

TechCrunch · AI

中国否决 Meta 收购 Manus,20 亿美元交易被要求撤销

中国发改委叫停了 Meta 对 Manus 的收购,要求双方把交易退回去。Manus 是一家做 AI 智能体的公司,创始团队是中国工程师,后来搬到新加坡,去年底被 Meta 以 20 亿美元买下。这次审查持续了几个月,但官方没给具体理由,也没说依据哪条法规。对 Meta 来说,这笔交易直接关系到它让 AI 模型进业务流程干活的布局,现在被打断,后续怎么...

推荐理由:HKR 三项全中:中国在长达数月的调查后,否决了 Meta 对 Manus 的 20 亿美元收购。正文没披露具体监管依据、时间线和 Meta 的下一步,所以重要性给 88 而不是 90 以上。

Hacker News 首页

Dirac 这个开源编程助手在 TerminalBench 上拿了第一,靠的是省 token 和并行操作

Dirac 是一个专门抠上下文效率的编程助手,刚在 TerminalBench 上跑分拿了第一,用的模型是 Gemini-3-flash-preview。它说自己能把 API 调用成本压到其他同类工具的 20% 到 50%,主要靠三招:用哈希锚点来精准定位代码修改位置、把能并行的操作全并行跑、直接操作抽象语法树而不是整段重写。不过正文没披露 Termi...

推荐理由:HKR 三项都站得住:一个开源编程智能体声称在 TerminalBench 上拿了第一,还给出了具体模型和成本降幅,技术细节也没藏着。不过分数我压到 78,因为目前只有仓库自述,完整榜单分数和复现日志都没放出来,先别太激动。

Mistral AI

Mistral AI 发布 Workflows 公开预览版

Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工介入审批能力,ASML、ABANCA、CMA-CGM 等客户已用于自动化关键流程。

推荐理由:原文给出 Workflows 的编排能力、部署模型与客户案例,可据此判断企业级 AI 流程落地的工程门槛。

新智元 · 公众号

首个时空时序推理框架 STReasoner:让大模型读懂“什么时间、在哪、发生了什么”

埃默里大学和微软等团队搞了个 STReasoner,专门教大模型做时空时序推理,比如预测交通流量、分析疫情传播趋势。他们配套出了 ST-Bench 测试集,覆盖预测、异常检测、因果分析和问答四类任务。训练上用了网络随机微分方程加多智能体协作来造数据,再走对齐、带思维链的监督微调、以及 S-GRPO 强化学习这套流程。文章说推理成本只有闭源模型的千分之四...

推荐理由:我会先打个折:标题里的“首个”要看跟谁比,正文没给出对比范围,这点先别太激动。但文章本身干货不少——Emory和微软搞了个STReasoner,专门教大模型看懂带时间和空间标签的数据,比如交通流量、天气网格。他们自己搭了个ST-Bench测试集,分四类任务来考模型。训练上用了网络随机微分方程加多智能体生成对齐数据,再分三步训,最后用S-GRPO强化学习收尾。最实在的数字是推理成本只有闭源模型的千分之四,代码也放出来了,想试的人可以直接跑。对做时空预测、智慧城市那拨人来说,这是个能上手的新工具。

量子位 · 公众号

斯坦福等团队搞了个“用大模型当验证器”的方法,在 Terminal-Bench 2.0 上跑分超过 Claude Mythos 和 GPT-5.5

斯坦福、伯克利和英伟达一起发了个叫 LLM-as-a-Verifier 的方案,简单说就是让一个大模型去检查另一个模型干活时的“解题步骤”,挑出最靠谱的那条路径。他们用了三招:打分细到 token 级别、同一件事反复查、把评判标准拆开看,最后在 Terminal-Bench 2.0 和 SWE-Bench Verified 两个榜单上都拿了第一。其中 ...

推荐理由:我会先打个折:这还是个基准测试的研究发布,不是模型或产品大更新,所以分数放在这个区间。但钩子够强——斯坦福、伯克利、英伟达联名,Transformer作者转发,验证智能体这件事本身又是当前工程落地的痛点。信息量也扎实,token级评分、重复验证、标准分解这些机制都给了具体数字,不是空泛的“新框架”。读者看完能立刻判断要不要跟进实验。

量子位 · 公众号

DeepSeek V4 永久降价,缓存命中再打一折,实测编程成本降了 83%

DeepSeek V4 两天内连续降价,输入和输出价格直接砍掉 75%,缓存命中的输入还能再打一折。量子位的编程实测里,处理 3500 万 token 的成本从 31.73 元掉到 5.34 元,降了 83%。这个价格对缓存命中率高的场景最划算,V4-Pro 的缓存命中率大概在 95% 到 96%。

推荐理由:HKR三项都站得住:降价幅度和两次调价节奏有话题性,实测数据让便宜可验证,成本敏感型从业者会立刻对标自己的用量。不过它本质还是定价更新,不是新模型发布,所以分数没往上拉。