跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1061–1080 条 · 共 1,465 条

5月8日星期五

Hacker News 首页

re_gent:给 AI 编程助手配一个 Git,能回滚、能查它为什么改文件

regent-vcs 开源了一个叫 re_gent 的工具,想给 AI 编程助手(目前只支持 Claude Code)加上类似 Git 的版本控制。它能记录 AI 为什么改某个文件、支持把整个对话过程回滚到之前的状态,还能用二分法定位 AI 的哪一步操作引入了问题。项目刚发布,正文没披露许可证、数据存储格式和具体安装步骤,目前只有 42 个星标和 2 ...

推荐理由:HKR 三条都站得住:Git 的类比让人一眼就懂,功能描述具体到删除追踪和 bisect,Claude Code 用户回退的痛点是真实存在的。不过正文没披露许可证、存储格式和安装方式,信息缺口明显,所以分数先打个折,放在 featured 这一档。

AI HOT 精选

OpenAI 公开自家怎么安全跑 Codex:沙箱隔离、人工审批、网络管控和代理日志四道防线

OpenAI 发了一篇技术博文,讲他们内部部署编程代理 Codex 时用的安全方案。核心是四件事:第一,用沙箱把代理的执行环境圈起来,低风险操作自动放行,高风险动作必须等人拍板;第二,网络访问不做全开放,只允许访问已知域名,陌生域名要审批;第三,身份认证强制走 ChatGPT 企业工作区,凭证存在系统钥匙串里;第四,代理的所有行为都通过 OpenTel...

推荐理由:我会先打个折:正文没给评测数据、事故率,也没说企业部署要满足什么条件,所以分数停在 74。但 HKR 三项都踩中了——OpenAI 把 Codex 的安全拆成沙盒、人工审批、网络策略和遥测四层,对做代码 agent 的人来说是能直接参考的架构思路。这点先别太激动,毕竟没看到跑分或实际事故记录,但作为安全方案框架,信息量够用。

阿里技术 · 公众号

阿里许晓斌内部访谈:工程师用 AI 后,写代码时间从 30% 降到 5%,端到端交付效率提升 2-3 倍

许晓斌在内部访谈里给了几个数:工程师重度用 AI 后,写代码占工作时间从 30% 掉到 5%,跟 Agent 对话的时间从 5% 涨到 60%,端到端交付效率提升 2 到 3 倍,纯编码效率提升 10 倍。这些数字来自内部访谈,不是大规模统计,样本量和统计口径正文没披露,所以我会先打个折看。核心变化不是代码写得更快,而是工程师的时间分配被彻底打散重排—...

推荐理由:阿里技术这篇是内部访谈整理的组织方法论,不是产品发布或模型更新,但给出的数字很具体,能让人直观感受到 AI 把工程师的工作重心从写代码拽到了指挥 Agent 上。我会先打个折:效率提升 2 到 3 倍这个说法正文没交代是怎么算出来的,样本量和统计口径都不清楚,这点先别太激动。不过 HKR 三项都踩中了,放在 featured 门槛上刚好。

机器之心 · 公众号

英伟达和普渡大学用 agent 闭环做文生 3D 场景,让模型自己检查、自己改

这篇是 ICLR 2026 的论文,讲的是英伟达 Cosmos Lab 和普渡大学搞的 Scenethesis 框架。它让语言和视觉模型组成一个 agent 闭环,根据文字描述生成 3D 场景。流程里加了视觉定位、基于 SDF 的物理约束,还有一个裁判模块来挑错。实验数据是:首次生成成功率约 72%,模型自己检查修正后能拉到 91%,碰撞率从 6.1%...

推荐理由:我会先打个折:正文没披露 72% 和 91% 是在什么数据集上跑的,也没说 judge 模块本身会不会出错,所以这个自检提升幅度先别太激动。但思路本身挺实在——让 agent 自己生成、自己检查、自己修,相当于给文生 3D 加了个质检闭环。SDF 物理约束这个点也值得留意,它不是纯靠视觉打分,而是用几何和物理规则卡了一道,理论上能减少穿模和浮空这种低级错误。对做机器人仿真和 3D 资产管线的人来说,如果这套流程真能稳定跑通,省下来的手工修场景的时间会很可观。

量子位 · 公众号

OpenAI 把 GPT-5 级推理塞进语音模型,同传翻译成本打到地板价

OpenAI 发了三个实时语音模型:GPT-Realtime-2 能边听边推理,上下文窗口 128K;GPT-Realtime-Translate 支持 70 多种语言输入、13 种语言输出,做流式同传;GPT-Realtime-Whisper 实时转写每分钟只要 0.017 美元。正文没披露具体推理跑分和翻译延迟数据,实际效果还得等上手测。

推荐理由:OpenAI 一口气发了三个实时语音 API,覆盖推理、翻译和转写,HKR 全中。128K 上下文意味着能处理很长的对话,70 多种语言输入和每分钟 0.017 美元的转写价格,对做同传和语音 agent 的团队来说,成本和能力边界都清楚了,值得当天就写。

量子位 · 公众号

美国研究员 36 小时跑遍中国 AI 圈:字节让所有实验室紧张,DeepSeek 被所有人夸

Ai2 研究员 Nathan Lambert 在 36 小时内密集拜访了智谱、月之暗面、清华、美团、小米和零一万物。他观察到中国 AI 实验室普遍紧盯字节跳动的动向,同时对 DeepSeek 的技术实力和开源做法表示尊重。学生深度参与核心工作、开源习惯以及技术栈的自主掌控,是中美 AI 生态的几个明显差异。

推荐理由:这篇不是模型发布或大厂合作,属于一手见闻加行业判断,信息密度高但偏观察性质。我会先打个折,放在featured而不是p1。正文没给出具体数据验证,但研究员身份和走访名单让可信度不低,值得从业者花几分钟读。

AI HOT 精选

AI 终端智能化分级国标发布,手机、电脑、眼镜等 7 类产品有了 L1 到 L4 的官方划分

工信部等部门联合发布了《人工智能终端智能化分级》国家标准,把终端设备的 AI 能力分成 L1 响应级、L2 工具级、L3 辅助级和 L4 协同级四个等级,等级越高设备越“聪明”。标准覆盖手机、电脑、电视、眼镜、汽车座舱、音箱、耳机七类产品,起草单位包括小米、荣耀、华为、OPPO 等。L4 协同级的具体要求正文没披露,说后续再补。另外,具体的测试指标和判...

推荐理由:这条国标先把 AI 终端的智能化程度分成了 L1 响应级、L2 工具级、L3 辅助级、L4 协同级,首批覆盖手机、电脑、眼镜、电视、耳机等 7 个品类,框架是“2+N”。对从业者来说,分级标签本身是个对齐口径,但真正要盯的是测试方法——正文没给出具体指标,L4 的细则也说要后续修订。所以现在能参考的是等级定义和覆盖范围,能不能落地、怎么验证,还得等下一版。

阮一峰的网络日志

软件开发的第三种方式:像老太太盖神秘屋一样用 AI 写代码

阮一峰这期周刊把 AI 辅助编程比作“神秘屋”式开发——没有整体规划,想到哪写到哪,代码层层堆叠,充满个性但外人看不懂。这种开发方式可能取代传统的大教堂和集市模式,成为个人和小团队的主流。另外介绍了一个叫 HN SOTA 的大模型人气榜,通过扫描 Hacker News 每天最热的 200 个帖子里对模型的讨论和好评来排名,本周前三名是 Claude ...

推荐理由:阮一峰这期周刊把 AI 编程总结成“第三种方式”,核心是“神秘屋”——你给需求,模型直接出结果,中间过程你看不到。这个说法比“低代码”或“辅助编程”更直白,也更容易让人理解为什么开发者会又爱又怕。HN SOTA 的榜单用每天 200 个 HN 热门话题来量模型人气,不是跑分,而是看社区讨论热度,算是一种接地气的 benchmark。整篇是评论性质,没有新模型或产品发布,所以重要性停在 72。HKR 三项都过:比喻够新、方法够简单、情绪够普遍。

AI HOT 精选

OpenAI 发了官方命令行工具 openai-cli,终端里直接调 API,不用写 SDK 代码

OpenAI 在 GitHub 开源了 openai-cli,Apache 2.0 协议,Homebrew 或 Go 都能装。这个工具让你在终端里直接敲命令调用 API,省掉写 SDK 的步骤。它主要干几件事:一是支持 Responses API,能把网页搜索、代码解释器这些云端工具串起来,让模型进业务流程干活;二是输出 JSON、YAML 这类结构化...

推荐理由:HKR 三项都站得住:官方 CLI 本身就有话题性,安装和功能细节够具体,又切中开发者想少写胶水代码、让模型直接进流程干活的需求。不过它终究是个工具更新,不是新模型或重大能力发布,76 分放在 featured 里合理。

彭博科技

Cloudflare 要裁掉 1,100 多人,占员工总数五分之一,理由是转向“AI 优先”的运营模式

Cloudflare 计划在全球裁掉超过 1,100 个岗位,相当于每五个员工里就有一个要走人。公司把这轮裁员和转向“agentic AI-first”运营模式直接挂钩——也就是让 AI 代理接管一部分业务流程里的活。不过正文没披露具体砍掉哪些部门、什么时候执行,也没说省下来的成本目标是多少。我会先打个折:这更像是一个组织调整信号,但实际用 AI 替代...

推荐理由:Cloudflare 宣布全球裁员超 1100 人,占员工五分之一,理由是要转向 agentic AI-first 运营模式。这个信号很硬——不是用 AI 辅助现有流程,而是直接动组织架构。不过正文没给岗位分布、时间表和成本目标,所以省钱效果到底多大、裁的是哪些职能,现在全是缺口。光凭“压缩 90% Token 精度不掉”和“裁 20% 人做 AI-first”这两条,已经够上 featured,但信息密度还撑不起 P1。

AI HOT 精选

OpenAI 的 Codex 插件现在能在 Chrome 里跨标签页同时干活了

Codex 插件现在支持在 macOS 和 Windows 的 Chrome 上运行,可以跨标签页在后台并行处理网页和应用,不会抢走你对浏览器的控制权。正文没提具体版本号、同时能跑几个任务,也没说企业策略怎么管。想用的话,在 Codex 应用里装一下 Chrome 插件就行。

推荐理由:HKR-H/K/R 全过,但正文只给了平台和执行机制,版本号、并发上限、企业管控都没提。分数 76,算一个实用的 OpenAI Codex 产品更新。

NVIDIA 博客

美国能源部长与英伟达谈 Genesis 任务:用 AI 给电网审批提速,从几年缩到几周

美国能源部和英伟达要在阿贡国家实验室建两台 AI 超算。小的一台叫 Equinox,用 10,000 块 Grace Blackwell GPU;大的一台叫 Solstice,计划上 100,000 块还没发布的 Vera Rubin GPU。英伟达的 Ian Buck 说 Solstice 的算力能干到 5,000 exaflops,这个数字听听就好...

推荐理由:HKR 三项都踩实了:GPU 型号和数量是硬信息,DOE 与 NVIDIA 的角色分工清楚,电网瓶颈那段把 AI 的落地价值讲得很具体。不过来源是 NVIDIA 官方博客,信息偏单向,所以放在 featured 而不是 must-write 的档位,82 分在这个区间里是合理的。

AI HOT 精选

AI 代理生成的 PR 到处都是,GitHub 发了份审查指南

GitHub 这篇博客直接给了一套审查 AI 代理提交的 Pull Request 的方法。核心就三点:先看代码改了什么,别被大段生成代码吓住;再查逻辑漏洞和安全问题,因为模型容易写出看起来对但实际有坑的代码;最后在合并前把技术债清掉,别让自动提交把代码库搞乱。文章没给出具体的自动化检查工具,更多是人工审查的思路。

推荐理由:GitHub 这篇博客没推新模型或新功能,而是给了一份审查 AI 代理生成的 PR 的实操指南。我会先打个折:它更像经验总结,不是严格验证过的规范。但 3 个审查关注点——代码变更、逻辑/安全漏洞、合并前技术债——确实把“怎么审”拆成了能落地的步骤。对天天被 AI 提 PR 的工程师来说,这篇直接回应了“审不审得动”的问题,所以放在 featured 档位是合适的。

AI HOT 精选

Claude 现在能直接在你的 Excel、PPT、Word 和 Outlook 里干活了

Claude 正式接入了四个微软办公软件:Excel、PowerPoint、Word 和 Outlook。其中 Excel、PPT 和 Word 已经全面开放,Outlook 还在公开测试阶段。你可以跨应用跟 Claude 对话,比如让它分析 Excel 里的数据,再把结论写成 Word 报告,最后用 Outlook 发出去,上下文是打通的。企业管理员...

推荐理由:Claude 这次不是发模型,而是把能力塞进微软 Office 全家桶里。Excel、PPT、Word 已经全量上线,Outlook 在公测,企业管理员可以通过微软管理中心统一部署,还能用 OpenTelemetry 看全流程的调用情况。对 Anthropic 来说,这是把模型推到亿级用户的工作流里,入口价值比单发一个模型版本更大。但毕竟不是底层能力突破,所以分数卡在 83 这个位置,不往上拔了。

AI HOT 精选

Perplexity 把能操控电脑的 AI 助手做成了 Mac 应用,对所有用户开放

Perplexity 发布了 Mac 版“Personal Computer”应用,不再需要邀请码。这个应用可以跨本地文件、Mac 原生软件、网页和 Perplexity 自己的服务器干活,相当于让 AI 直接操作你的电脑。正文没提收费方式、权限边界(比如它能读写哪些文件夹)和任务成功率,我会先打个折:能跑起来和跑得靠谱是两回事。

推荐理由:一条产品更新,信息量中等。Perplexity 把 agent 能力搬上 Mac 桌面,能跨文件、应用和网页干活,听着挺实用。但正文没提价格、权限怎么划、任务成功率多少,我会先打个折——没这些硬指标,实际好不好用还不好说。评分放在中等偏上的产品更新档位,合理。

5月7日星期四

AI HOT 精选

万亿参数指令模型 Ling-2.6-1T 上线 OpenRouter,主打“快思考”和降本 75%

inclusionAI 把 Ling-2.6-1T 放到了 OpenRouter 上,这是一个万亿参数的指令模型,专门给现实世界的智能体任务用。它走“快速思考”路线,在 AIME26 和 SWE-bench Verified 这两个测试上成绩顶尖,同时宣称推理成本比同类低了大约 75%。官方列出的适用场景包括高级编程、复杂推理和大规模智能体工作流。正文...

推荐理由:我会先打个折:正文没披露具体价格、上下文窗口长度,也没给完整榜单分数,所以“顶尖表现”和“成本降低 75%”目前只能当声明看。但一个万亿参数指令模型敢上 OpenRouter 开放调用,本身信号就很强——说明 inclusionAI 对推理成本和稳定性有一定底气。真正值得盯的是后续会不会放出详细定价和完整评测,如果成本真能压到同类模型的四分之一,对做 agent 和代码任务的团队会是实打实的省钱。

Hacker News 首页

AlphaEvolve:DeepMind 用 Gemini 驱动的编程智能体,号称能跨领域放大影响力

Google DeepMind 发了一篇博客介绍 AlphaEvolve,说它是一个由 Gemini 驱动的编程智能体(coding agent),已经在多个领域落地并扩大影响。正文只给了标题和导航栏,没有披露具体用了哪一版 Gemini 模型、跑了什么基准测试、在哪些场景部署、效果数据如何。我会先打个折:目前能确认的只有“这是个 Gemini 驱动的...

推荐理由:标题说 AlphaEvolve 是 Gemini 驱动的编码 Agent,要跨领域放大影响,但正文只有一句话,没披露模型版本、评测结果或落地场景。我会先打个折:DeepMind 起名就是信号,编码 Agent 本身也够热,所以 H 和 R 都过;但 K 过不了,因为除了标题没任何可验证的事实。分数停在 72,没到 78+,就是因为缺评测和部署细节。

AI HOT 精选

Apify 的 mcpc 工具给 AI Agent 装了个能自动付钱的 USDC 钱包

Apify 发布了一个叫 mcpc 的通用 MCP 客户端,把 x402 支付协议塞了进去,让 AI Agent 在调用付费 API 时能自己签名付款。x402 把整套结算流程压成一次 HTTP 往返加一个签名,碰到 HTTP 402 状态码就自动完成支付,不用人插手注册绑卡。mcpc 支持 Claude Code 这类 MCP 兼容的 Agent,钱...

推荐理由:我会先打个折:这还是个集成层面的更新,正文没披露实际用量、定价或生产环境案例,所以别急着把它当成成熟方案。但它的价值在于把“机器替人付款”这件事从概念拉到了协议层——用 HTTP 402 触发、一次签名完成结算,链路很轻。对跑 Agent 工作流的人来说,付费 API 的自动结算一直是个脏活,x402 这条路径至少给出了一个可验证的起点。

r/LocalLLaMA

Qwen 发布 WebWorld 系列模型,用 100 多万条真实网页操作轨迹训练,让模型学会在浏览器里干活

Qwen 在 Qwen3 基础上微调出了 WebWorld 32B、14B、8B 三个尺寸的模型,专门用来训练和评测能在网页上执行任务的智能体。训练数据包含超过 100 万条真实网页操作轨迹,模拟环境支持 30 步以上的连续操作,并且能同时看懂无障碍树、HTML、XML、Markdown 和自然语言描述这五种页面状态。用这套数据生成的合成轨迹再去训智能...

推荐理由:我会先打个折:正文没披露合成轨迹的具体生成方式,也没说这 100 万条数据覆盖了哪些网站类型,所以别急着当通用方案。但亮点很实在——用合成轨迹训练小模型做网页操作,在 MiniWob++ 和 WebArena 上都拿到了 10% 左右的提升,说明这条路走得通。对正在折腾 Web agent 的人来说,数据和评测结果比模型本身更有用。

量子位 · 公众号

Vidu Claw 上线:一句话加一百块预算,直接生成一条广告片

生数科技把 Vidu Claw 放出来了,主打“一句话出广告片”。你给一句提示词,它能自动走完写脚本、配旁白、加音乐、剪辑合成全流程,最后吐出一条成品视频。官方拿龙虾当例子,说百元预算就能搓出“百万级”广告片,但正文没披露这个成本具体怎么算出来的,也没给实际成片链接,我会先打个折看。配套的 Video Plan 套餐每天最多能生成 40 分钟内容,覆盖...

推荐理由:我会先打个折:正文没披露生成一支片子的实际耗时和最终成本,也没给画质、可控性的横向对比,所以“百万级”更多是噱头,别太当真。但 Vidu Claw 把脚本、配音、配乐、剪辑打包成一句话工作流,还给了每天 40 分钟的生成额度,对做短视频和广告测试的人来说,试错成本确实低。龙虾广告这个例子够具体,能让人直观感受到“输入一句话、输出成片”的完整链路,比单纯讲参数更有说服力。不过没有定价细节和商用授权说明,这点先别太激动。