跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1401–1420 条 · 共 1,465 条

1月28日星期三

MIT Technology Review · AI

AI 开始记住你的一切,隐私保护要面对新麻烦了

Google 这个月推出了 Personal Intelligence,让 Gemini 直接读取你的 Gmail、相册、搜索和 YouTube 记录来提供个性化服务。OpenAI、Anthropic 和 Meta 也都在给自家产品加记忆功能。问题在于,现在的做法是把你在不同场景下的数据全倒进一个池子里——你问过医疗建议、写过工作邮件、搜过餐厅,这些信...

推荐理由:我会先打个折:这是篇评论,没有新数据或独家爆料,所以分数没再往上拉。但它的钩子很准——把“记忆”重新框成隐私问题,而不是体验优化。正文没停留在喊风险,而是列出记忆分区、来源追踪、可删改控制和隐私测试机制这几个具体设计点,对正在往产品里加记忆的团队有直接参考价值。Google 的 Personal Intelligence 案例也给了可对照的工程栈,不是泛泛而谈。

Mistral AI

Mistral 发布终端编码智能体 Mistral Vibe 2.0

Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。

推荐理由:原文列出 Vibe 2.0 的自定义子智能体、斜杠命令技能等具体能力与订阅入口,可据此判断终端编码智能体的工作流变化。

1月21日星期三

NVIDIA 博客

黄仁勋在达沃斯把 AI 分成五层蛋糕,说这是人类史上最大规模基建

黄仁勋在达沃斯论坛上把 AI 产业链拆成五层:能源、芯片与算力基建、云数据中心、模型、应用。他说 2025 年全球风投砸了超过 1000 亿美元,大部分钱流向了 AI 原生公司,重点在应用层和基建层。他举了个具体例子:美国护士缺口大概 500 万,AI 可以先把病历记录和转录这类活接过去。对从业者来说,他传递的信号是瓶颈不只在模型本身,整条基建和人力链...

推荐理由:这篇是黄仁勋在达沃斯的发言,不是产品发布或论文,所以分数不会给到顶。但他说的事够具体:1000 亿美金风投、五层栈结构、500 万护士缺口,而且把 AI 讨论从模型竞赛拽回基础设施和劳动力替代,对从业者有参考价值。我会先打个折,因为终究是高管讲话,不是可复现的结果,但信息量和切入角度都到位,80 分合理。

1月20日星期二

MIT Technology Review · AI

AI 代理即将陷入混乱,能救场的是数据,不是模型

一家中型公司跑 4000 个 AI 代理(让模型进业务流程干活的程序)是迟早的事,但大部分企业的数据基础根本接不住。BCG 的调查说,60% 的公司砸了大钱做 AI,收入却没怎么涨;而做得好的那批,收入增长是别人的 5 倍,成本多砍了 3 倍。差距不在模型多强,在于数据地基有没有打好。文章把代理出错的坑分成四块:模型本身、调用的工具、做决策需要的上下文...

推荐理由:这篇文章不是空谈,有 BCG 的调研数据撑腰,把 Agent 规模化后的混乱讲得很具体。我会先打个折:正文没披露 4000 个 Agent 这个数字是怎么算出来的,但四象限可靠性和数据债的论点对正在踩坑的 AI 团队有参考价值,所以推荐给关注企业级 Agent 落地的人看。

MIT Technology Review · AI

英国政府掏钱,让 AI 自己设计实验、自己跑流程

英国高级研究与发明署(ARIA)从 245 份提案里挑了 12 个项目,给每个团队约 50 万英镑(大概 67.5 万美元),让他们在九个月内做出能独立跑通“提假设—做实验—分析结果—再迭代”这套完整科研闭环的 AI 系统。ARIA 管这叫“AI 科学家”,说白了就是让大模型调用现有工具去干活,人类只负责定方向和监督。这次资助金额比 ARIA 平时给的...

推荐理由:英国 ARIA 这次不是撒概念,是真金白银选了 12 个团队做“AI 科学家”——系统要能自己提假设、设计实验、跑实验、分析结果再循环迭代。我会先打个折:目前获资助的项目主要还是调用现成工具,离全自动实验室还远。正文引了一项外部研究,说大模型代理跑完整科学流程的失败率有 75%,这点先别太激动。真正值得盯的是有没有团队做出可复现的实验闭环,而不是新闻稿里的热度。

1月19日星期一

Import AI

我的 AI 特工已经在干活了,你的呢?

Jack Clark 描述了他让多个研究型 AI 特工在他爬山、睡觉时替他读论文、交叉比对数据、生成分析报告的经历。这些活如果他自己干,每份报告得花一周,而特工们几小时就搞定了,读的论文还比他多。他还提到,让 Claude 帮他爬自己网站、做嵌入向量、搭本地搜索和图形界面,以前试了好几年都因为各种卡顿没做成,这次不到一小时全跑通了。正文没披露具体模型版...

推荐理由:Jack Clark 用自己走路睡觉时 agents 并行处理几千篇论文的例子,把 agent 从概念拉到了实操。可复现的机制是多代理检索、交叉核验和报告生成,但正文没披露模型版本、成本、失败率和评测数据,所以先别太激动。真正值得盯的是工作流摩擦已经低到可以忽略,AI 开始从单次问答转向持续代办,这点对从业者来说比任何 benchmark 都更有说服力。

1月16日星期五

阮一峰的网络日志

中国 AI 大模型领导者在想什么

阮一峰记录了1月10日北京一场闭门会上几位大模型负责人的发言。智谱唐杰说,对话式AI的范式基本到头了,下一步是让模型真正做事,他们把编程、智能体和推理能力整合在一起。阿里林俊旸坦言,美国可用的算力比国内大一到两个数量级,人家拿算力搞下一代研究,我们光交付就占掉绝大部分资源;他判断三到五年后全球最领先的AI公司是中国团队的概率只有20%。腾讯姚顺雨观察到...

推荐理由:这篇周刊摘录了一场闭门峰会的发言,把智谱、阿里 Qwen 和腾讯 AI 负责人对中国大模型路线的判断摆在一起。我会先打个折:它不是一手发布,是二手整理,所以分数没往更高走。但它的好处是给了具体数字和分歧点——唐杰押注 2025 年是 RLVR 爆发年,林俊旸押多模态基础智能体,姚顺雨强调企业愿意为强模型付 200 美元月费,林俊旸还给出中国团队 20% 概率诞生全球最领先 AI 公司。这些判断有可验证的时效,不是公关口径,对从业者判断方向有参考价值。

1月13日星期二

MIT Technology Review · AI

CES 2026 逛完,我理解了为什么中国科技公司这么乐观

今年 CES 来了超过 14.8 万人、4100 多家参展商,中国公司占了将近四分之一,在 AI 硬件和机器人区域尤其扎堆。作者临时决定去现场,结果发现中国厂商已经不只是“便宜量大”的路子——家用清洁机器人在美国市场把 Dyson 和 Shark 的份额抢得很凶,庭院设备也大多来自深圳,外观做得让人看不出是中国品牌。人形机器人展台围满了人,宇树甚至搭了...

推荐理由:这篇是 CES 现场观察,核心判断是:中国科技公司的乐观来自制造和供应链的迭代速度,不是单点技术突破。文章用 14.8 万参会者、4100 多家参展商、中国展商近四分之一这些数字撑住了场面感,也把联想 Qira、Nvidia Vera Rubin、AMD Helios 这些产品拉出来,说明竞争焦点正转向云端和混合 AI。我会先打个折:正文没给出货量、营收或订单数据,所以判断还停在趋势信号层面,但作为行业风向标,这篇值得一看。

1月12日星期一

Import AI

AI 版红皇后竞赛:让模型互相攻击,看谁活到最后

日本初创公司 Sakana 搞了个实验,让 GPT-4 mini 在 80 年代的老游戏 Core War 里互相厮杀、进化。他们用了一种叫 DRQ 的方法,让程序不断跟历代冠军对战,避免能力退化。结果很直观:单次生成的程序只能打赢 1.7% 的人类选手,但经过针对性进化后,这套程序能击败 89.1% 的人类选手,打平或击败的比例高达 96.3%。这相...

推荐理由:这是一条高信号密度的简报,不是一手发布,所以分数不会冲太高。H 落在‘AI 监管 AI’这个反直觉的框架上,K 落在 89.1% 和 ≤1% / <$10k 这些可测试的数字上,R 则同时踩中了自动化和治理的神经。

1月6日星期二

NVIDIA 博客

英伟达预告基于 Rubin 架构的 DGX SuperPOD,单柜 260TB/s 带宽,推理成本号称能降 10 倍

英伟达在博客里公布了下一代 DGX SuperPOD 的规划,核心是换装 Rubin GPU。今年下半年会先出两款机型:DGX Vera Rubin NVL72 和 DGX Rubin NVL8。一个 SuperPOD 可以把 8 台 NVL72 拼在一起,总共塞进 576 颗 Rubin GPU,FP4 算力 28.8 exaflops,总显存 60...

推荐理由:这是一份有硬数字的NVIDIA基础设施路线图:576颗Rubin GPU、28.8 exaflops FP4、600TB内存、260TB/s NVLink,以及推理token成本最多降10倍。HKR三项都站得住,但本质上还是厂商路线图预告,不是已发货的产品或大规模公开发布,所以我会先打个折,重要性给到81。

NVIDIA 博客

NVIDIA 的 DRIVE AV 软件将首发搭载于新款奔驰 CLA

新款奔驰 CLA 会成为美国市场第一辆用上 NVIDIA DRIVE AV 的量产车,今年底交付。这套系统是双架构设计:核心驾驶决策靠一个端到端 AI 模型,同时外面包了一层基于 Halos 的传统安全校验模块,用来兜底。功能上支持点到点辅助驾驶、城市道路导航、主动避撞和自动泊车,后续还能 OTA 升级。不过,博客里没提这套系统要加多少钱、用了哪些传感...

推荐理由:我会先打个折:正文没披露传感器配置、具体价格和 ODD,所以没法判断这套系统到底多能打。但亮点在于量产时间给了,双栈设计把端到端驾驶和传统安全冗余绑在一起,不是纯 demo。对从业者来说,这是看端到端方案能不能过车规安全关的一个真实样本,所以放在 featured 低位。

NVIDIA 博客

NVIDIA 一口气开源了一堆模型、数据和工具,覆盖智能体、机器人、自动驾驶和生物医药

NVIDIA 在 2026 年 1 月 5 日放出了一批新的开源模型和数据集。语言模型方面,有 Nemotron 系列的新成员,专门做语音、外挂资料库(RAG)和安全对齐;还有一个叫 Alpamayo 1 的模型,正文没具体说它擅长什么。物理 AI 这边,Cosmos 系列更新了 Reason 2、Transfer 2.5 和 Predict 2.5 ...

推荐理由:NVIDIA 这次不是发一篇通稿,而是把 Nemotron、Cosmos、GR00T、Clara 几条线的模型、数据集和工具一起开源了。我会先打个折:所有信息都来自厂商自己,没有第三方验证,实际可用性还得看后续社区反馈。但光看披露的数字——10 万亿 token 文本、50 万条机器人轨迹、100TB 车载数据、45.5 万个蛋白结构——规模确实够大,而且覆盖了代理、物理 AI、自动驾驶和生命科学几个热门方向。具体到模型,Nemotron Speech 做语音、Cosmos Reason 2 做推理、GR00T N1.6 做人形机器人、Alpama...

1月5日星期一

Import AI

Meta 用 GPT、Claude 和 Llama 自动写底层算子,开发时间从几周缩到几小时,部分性能比 PyTorch 基线快 17 倍

Meta 公开了一套叫 KernelEvolve 的系统,专门自动生成和优化 AI 底层算子(kernel),用来在自家不同芯片上跑推荐模型、服务广告。它会接收需求,然后调用内部和外部的大模型(Llama、GPT、Claude)生成候选算子,通过验证后把好的结果存进知识库,让后续生成越来越准。Meta 说这套系统把新算子的开发时间从几周压到了几小时,生...

推荐理由:我会先打个折:这是 newsletter 对技术工作的转述,不是一篇独立论文,所以停在 80 分。但 HKR 三项都站得住——让模型写算子这件事本身就新鲜,数字和流程交代得够具体,去中心化训练那条线又直接碰到算力成本和权力集中的神经。正文说去中心化训练按每年 20 倍在涨,但跟前沿训练还差约 1000 倍,这点先别太激动,差距能不能继续缩小才是政策影响的关键。

1月1日星期四

36 氪 · 直链

月之暗面融了5亿美金,账上趴着100亿,杨植麟说短期不上市

月之暗面在2025年最后一天宣布完成5亿美元融资,投后估值43亿美元,IDG领投,阿里、腾讯、高榕、今日资本等老股东超额跟投。创始人杨植麟发内部信说公司现金超过100亿元,短期不着急上市。2025年他们主动停掉烧钱投流,砍了多个C端产品,把重心转向开源和海外。7月开源的K2模型一周内冲上OpenRouter全球趋势榜第二,海外付费用户月均环比增长超17...

推荐理由:月之暗面是国内一线模型公司,新融资加运营数据本身就值得关注。HKR 三项全中:战略转向有信号、财务和收入数字够硬、话题踩中行业焦虑点。但本质还是融资和业务动态,不是重大模型或产品发布,所以留在 featured 不升 tier。

2025年12月9日星期二

Mistral AI

Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

Mistral AI 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

推荐理由:原文给出 Devstral 2 的 SWE-bench 成绩、开源许可与部署门槛,可据此判断开源编码模型的落地成本。

2025年10月24日星期五

Mistral AI

Mistral AI 发布 Mistral AI Studio 生产平台

Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。

推荐理由:原文给出企业级 AI 生产化的三大支柱与私有 beta 入口,可据此判断其与现有 MLOps 工具的差异。

2025年10月21日星期二

OpenAI News

OpenAI 发布 ChatGPT Atlas 浏览器,把 ChatGPT 直接嵌进浏览器里

OpenAI 在 2025 年 10 月 21 日推出了 ChatGPT Atlas,一个把 ChatGPT 内置在核心的浏览器,目前 macOS 版全球上线,免费、Plus、Pro 和 Go 用户都能用。Atlas 让 ChatGPT 能跟着你浏览网页,看懂你当前在看什么,不用复制粘贴就能回答问题或帮你干活。它还能记住你浏览过的网站内容(叫“浏览器记...

推荐理由:OpenAI 把 ChatGPT 做成一个独立浏览器,而不是继续在别人浏览器里当插件,这是分发层面的动作,不是日常功能更新,所以给到 88 分、p1。HKR 三项全中:钩子够新,不是又一个模型升级;信息量扎实,上线范围、付费策略、隐私开关都给了;从业者会盯着它怎么用浏览器记忆和页面可见性控制来卡位,这点先别太激动,但确实值得盯。

2025年10月6日星期一

OpenAI News

OpenAI 的 Codex 编程助手正式上线,新增 Slack 集成、SDK 和管理后台

OpenAI 在 10 月 6 日宣布 Codex 结束预览、进入正式可用阶段。这次主要加了三个东西:一是能在 Slack 频道里直接 @Codex 派活,像喊同事帮忙一样;二是放出了 Codex SDK,让你把驱动命令行版 Codex 的那个智能体嵌进自己的工具或流程里,官方说配合 GPT‑5‑Codex 模型不用额外调优就能用;三是给企业管理员上了...

推荐理由:OpenAI 把 Codex 从预览推到正式版,顺手加了 Slack 集成、SDK 和管理员控制,这比发个模型补丁重得多。我会先打个折:正文没披露云端任务的具体价格,这点先别太激动。但用量数据摆在那里,10 倍增长和 40 万亿 token 说明调用量是真金白银在跑。更值得盯的是内部数据——工程师全上、PR 合并效率提 70%,这是企业买单前最想看到的验证。整体看,这不是一次功能更新,是编码助手开始抢工作流入口和团队席位的明确动作。

OpenAI News

ChatGPT 里能直接调用 Booking、Canva 这些 App 了,OpenAI 还发了套开源 SDK 让开发者自己做

OpenAI 在 10 月 6 号给 ChatGPT 加了个新功能:你可以在聊天里直接喊 App 出来干活,比如让 Spotify 帮你排歌单,或者让 Zillow 在地图上筛房源。首批上线的有 Booking.com、Canva、Coursera、Expedia、Figma、Spotify 和 Zillow 这七家,后面还有 11 家会在年内跟上。目...

推荐理由:OpenAI 给 ChatGPT 装了个应用层,同时把开发工具包开源出来,等于把聊天界面升级成一个小型应用商店。我会先打个折:覆盖范围排除了欧洲经济区、瑞士和英国,应用怎么审核、怎么分成正文都没说,所以商业闭环还不完整。但首批 7 家合作方已经上线,年内还要再上 11 家,SDK 走的是 MCP 协议,开发者能直接触达 OpenAI 自称的 8 亿多用户,这对做工具和 agent 的团队是个实打实的信号。

OpenAI News

OpenAI 发布 AgentKit:一套工具把智能体开发、评测和微调打包在一起

OpenAI 在 10 月 6 日推出了 AgentKit,把做智能体需要的三块拼图拼到了一起:Agent Builder 是个画布,拖拽节点就能搭多智能体流程,支持版本管理和安全护栏;ChatKit 让你把对话界面嵌进自家产品,省掉两周前端开发时间;Connector Registry 统一管理 Dropbox、Google Drive、ShareP...

推荐理由:这次发布对 agent 开发者来说信息量挺大,Agent Builder、Connector Registry、ChatKit 三个组件都给了具体机制。Evals 那边 trace grading 和自动提示优化是实打实的新能力,第三方模型支持也扩大了适用范围。但标题里提到的 RFT,正文截出来的部分完全没讲训练怎么搞、多少钱、哪些人能先用,这点先别太激动。整体够重磅,但缺关键细节,所以给 84 分而不是顶格。