跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1421–1440 条 · 共 1,465 条

2025年9月29日星期一

OpenAI News

OpenAI 给 ChatGPT 加了家长控制,能管孩子用 AI 的时间和功能

OpenAI 在 9 月 29 日上线了家长控制功能,所有 ChatGPT 用户都能用。家长把自己的账号和孩子的绑定后,就能在自己的账号里管理孩子的使用设置。绑定后的青少年账号默认会加强内容过滤,减少暴力、色情角色扮演和极端审美之类的内容。家长还可以单独设置禁用时段、关掉语音模式、关掉记忆功能、禁止图片生成,以及拒绝把孩子的对话拿去训练模型。比较关键的...

推荐理由:OpenAI 把家长控制推给了所有 ChatGPT 用户,但真正值得看的是自残风险上报链路:系统检测到风险后,先由人工小组复核,确认是急性痛苦状态再通过邮件、短信和推送通知家长。这不是一个简单的设置面板,而是一套带人工介入的安全流程。我会先打个折,因为这次没有模型层面的变动,属于产品安全更新,但信息量够实,流程也说得清楚。

OpenAI News

ChatGPT 开始内嵌购物功能,先拿 Etsy 试水,并开源了一套让 AI 帮你下单的协议

OpenAI 在 9 月 29 日给 ChatGPT 加了个“即时结账”功能,美国 Plus、Pro 和免费用户现在能在聊天界面里直接买 Etsy 卖家的东西,目前只支持单件购买。Shopify 上像 Glossier、SKIMS 等一百多万商家之后也会接入。ChatGPT 每周有超过 7 亿人用,这次它不只是推荐商品,而是直接充当“数字导购”帮你完成...

推荐理由:OpenAI 让 ChatGPT 能直接结账,不是小功能补丁,是产品边界的一次硬扩张。我会先打个折:目前只覆盖美国用户和美国 Etsy 卖家,单件下单,规模还小。但真正值得盯的是它和 Stripe 一起推的开源 Agentic Commerce Protocol——商家最少一行代码就能接入,等于在铺结算管道。商品排序说按相关性自然展示,商家付小额成交费,但费率正文没披露,这点先别太激动。整体看,从聊天到成交的链路打通了,对从业者来说,这意味着模型开始进交易流干活,而不只是回话。

2025年9月25日星期四

OpenAI News

ChatGPT 企业版上线共享项目,团队能一起调教同一个 AI 了

OpenAI 给付费的 Business、Enterprise 和 Edu 用户推了个共享项目功能。简单说,就是团队可以建一个项目空间,把文件、指令都扔进去,所有成员跟 ChatGPT 聊天时,它都会基于这个共享的上下文来回答,不用每次都重新解释背景。创建者能通过邮件或链接拉人,权限分两档:只能看和聊,或者还能改指令、传文件。项目有自己的独立记忆,敏感...

推荐理由:我会先打个折,这不是模型发布,是协作层的产品更新。共享项目、8 个连接器、按提示自动路由连接器,这三件事合在一起,让 ChatGPT 从单人对话框往团队工作流里又挤了一步。权限和记忆的设计看得出在认真做企业控制,但正文没披露自动选择连接器的准确率和延迟,这点先别太激动。整体是扎实的迭代,不是概念车。

OpenAI News

ChatGPT Pulse 预览:让模型主动推消息,每天一次

OpenAI 给 Pro 用户上了个移动端新功能 Pulse,ChatGPT 不再等你问,而是每天主动推一版个性化信息卡片。它会翻你的聊天记录、记忆和反馈,还能选接 Gmail 和 Google 日历(默认关着),晚上做功课,早上把结果推给你。你可以点赞点踩、直接告诉它明天想看什么,所有输出会过一道安全检查。正文没提用了哪个模型、会不会涨价、Plus ...

推荐理由:我会先打个折:正文没提模型有没有换、Pro 之外怎么收费、Plus 什么时候上,所以别当完整发布看。但亮点是交互逻辑变了——从你问它答,变成它每天主动塞一张卡片给你,信息源还能挂上你的邮箱和日历。如果是真的,省掉你每天手动去问“今天有什么我该知道的”,但前提是你敢把 Gmail 交出去。安全检查说做了,集成默认关着,这点先别太激动,等更多实测再说。

2025年9月24日星期三

OpenAI News

SAP 和 OpenAI 要在德国搞一个数据不出境的政府专用版 ChatGPT

OpenAI 和 SAP 宣布合作,计划 2026 年在德国推出一个专门给公共部门用的 AI 服务。这个服务会跑在 SAP 子公司 Delos Cloud 的微软 Azure 平台上,主打数据留在德国、符合当地法律和安全标准。SAP 打算把 Delos Cloud 的算力扩到 4000 块 GPU 来跑 AI 任务。公告里没提具体会用哪个模型、怎么收费...

推荐理由:这条我会先打个折:正文没写具体模型、价格和采购规模,所以没法判断性价比。但真正值得盯的是交付形态——不是通用发布,而是把 OpenAI 塞进德国政务流程里,用 Delos Cloud 解决数据不出境和合规问题。4000 块 GPU 的规模说明 SAP 是认真在铺基础设施,不是做个 demo。对关注主权云和政企 AI 落地的人,这个案例比普通合作公告有信息量。

2025年9月16日星期二

OpenAI News

OpenAI 在给 ChatGPT 加年龄预测,拿不准就默认当未成年人处理

OpenAI 正在开发一套年龄预测系统,用来判断用户是否满 18 岁。一旦系统判定用户未成年,会自动切到一个内容受限的青少年模式,比如屏蔽露骨的性内容,极端情况下还可能联系执法部门。如果系统拿不准年龄,宁可误判也会先按未成年人处理,成年人可以再通过验证解锁完整功能。月底前会上线家长控制,家长能关联孩子的账号、关掉记忆和聊天记录、设置禁用时段,孩子遇到严...

推荐理由:OpenAI 没在发一篇泛泛的安全声明,而是把年龄估算直接嵌进了 ChatGPT 的分流逻辑里。我会先打个折:正文没披露年龄预测的具体技术方案和准确率,这点先别太激动。但产品思路很明确——宁可误判也不漏判,低置信度默认走青少年版,成年人想回来得自证。家长控制那边,能关记忆和历史记录,等于给了监护人一把更实在的钥匙。整体看,这不是模型能力升级,是一次产品路由规则的调整,但牵动的隐私和合规神经够多,值得放进 featured。

2025年9月15日星期一

OpenAI News

OpenAI 把 GPT-5 调成了专门干活的编程助手 Codex,一个模型同时搞定聊天写码和长时间自主跑任务

OpenAI 发布了 GPT-5-Codex,并把它设为 Codex 云端任务和代码审查的默认模型。这个模型专门针对真实软件工程任务训练过,既能跟你快速交互式写代码,也能自己独立跑复杂任务,测试中最长连续干了超过 7 个小时。在 OpenAI 内部员工的使用数据里,对于 token 消耗最少的那 10% 的简单对话,GPT-5-Codex 比 GPT-...

推荐理由:OpenAI把GPT-5-Codex设为Codex云任务和代码审查的默认模型,给了几个硬数字:7小时自主执行、低端请求token省93.7%、高端请求耗时翻倍。这说明他们想把交互编程和长时代理执行揉在一起,但定价和完整可用性正文没披露,所以先别急着算账。

OpenAI News

OpenAI 发了 GPT-5-Codex 的系统卡补充说明,专门给写代码的 agent 用

这个模型是 GPT-5 的一个变体,针对 Codex 里的 agent 编程场景做了优化。训练时用了强化学习,让它在真实编程任务里学会写出更贴近人类风格和 PR 偏好的代码,还能自己跑测试直到通过。现在可以在终端、IDE、网页、GitHub 和 ChatGPT 手机 App 里用。安全方面,模型层面做了防有害任务和防提示注入的训练,产品层面加了沙盒和可...

推荐理由:HKR 三项都踩实了:OpenAI 把代理式编程铺到多个入口,训练和安全措施有具体交代,而且正好打在行业最关心的执行边界上。基准分数、价格和上下文窗口正文都没写,所以分数没往上拉,停在 84。

2025年9月12日星期五

OpenAI News

OpenAI 跟美英安全机构合作,给 ChatGPT Agent 抓出两个新漏洞,一天内修好

OpenAI 公开了他们与美国 CAISI、英国 UK AISI 的合作进展。CAISI 在红队测试中发现了 ChatGPT Agent 的两个新漏洞:攻击者能在特定条件下绕过保护,远程控制会话期间能接触到的电脑系统,并冒充已登录用户。CAISI 把传统网络漏洞和 AI 劫持攻击串在一起,做出一条概念验证攻击链,成功率大约 50%。OpenAI 在接到...

推荐理由:这篇不是安全公关稿。OpenAI 自己说 ChatGPT Agent 被美国 CAISI 和英国 AISI 红队测出两个新漏洞,CAISI 的概念验证攻击成功率大概一半,OpenAI 一个工作日就修了。我会先打个折:英国 AISI 那部分正文被截断了,GPT-5 生物滥用防护的测试结果没披露,所以整体影响面还不清楚。但就凭 Agent 远程会话控制这个风险点,从业者会想看一眼。

2025年9月2日星期二

Mistral AI

Mistral 为 Le Chat 上线自定义 MCP 连接器与 Memories 记忆功能

Mistral 为 Le Chat 推出 20+ 个基于 MCP 的安全连接器目录(beta),覆盖数据、生产力、开发、自动化与商务等类别,支持接入 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并可添加自定义 MCP 连接器或连接任意远程 MCP 服务器。

推荐理由:原文列出 20+ 连接器覆盖的具体工具类别与部署方式,可据此判断 Le Chat 在企业工作流中的接入范围。

OpenAI News

OpenAI 要在 120 天内给 ChatGPT 加安全机制,下个月先上家长控制

OpenAI 公布了一版安全更新计划,核心是两件事:一是把检测到严重情绪危机的对话自动转给推理模型(比如 GPT‑5‑thinking)去处理,理由是这类模型在安全规范上更稳、更不容易被诱导;二是下个月内推出家长控制功能,家长可以绑定 13 岁以上孩子的账号,关掉记忆和聊天记录,并在系统判定孩子处于严重情绪波动时收到通知。正文没披露危机检测的触发阈值和...

推荐理由:OpenAI 说接下来 120 天要推安全改进,下个月先上家长控制。最值得看的是那条路由规则:检测到急性痛苦迹象的对话,会自动转给 GPT-5-thinking 这类推理模型处理。这比加个免责声明实在,但正文没公布触发条件和误报率,实际效果得等上线再看。青少年账户那边,家长能关 memory 和聊天记录,算是给了控制权,不过也没说默认开关状态。整体是产品动作,不是技术突破,我会先打个折。

2025年8月28日星期四

OpenAI News

OpenAI 发布 gpt-realtime 模型,语音 API 正式上线并支持电话和图片输入

OpenAI 把 Realtime API 从公测转成了正式版,同时推出了新的端到端语音模型 gpt-realtime。这个模型不再走“语音转文字再转语音”的老路,而是直接处理音频,延迟更低,语气和情绪保留得更好。新模型在听懂复杂指令和调用工具上进步明显:Big Bench Audio 推理得分从去年 12 月版的 65.6% 提到了 82.8%,Mu...

推荐理由:这不是小修小补,是 OpenAI 把语音模型、工具链和电话接口一次补齐的版本。gpt-realtime 的基准分涨了十几到二十个百分点,虽然 MultiChallenge 的 30.5% 说明复杂场景还吃力,但配合 MCP 远程服务器和 SIP 通话,语音代理终于能跑通完整业务闭环了。我会先打个折——正文没给延迟和并发数据,实际部署成本还得自己测,但方向是对的,所以给到 p1。

2025年8月7日星期四

OpenAI News

OpenAI 在 API 里放出了 GPT-5,分了三个尺寸,主打写代码和跑流程

OpenAI 8 月 7 号在 API 上线了 GPT-5,提供 gpt-5、gpt-5-mini 和 gpt-5-nano 三个尺寸,让开发者在性能、成本和延迟之间自己选。这次最核心的变化是 API 设计本身:新增了 verbosity 参数(低/中/高)控制回答长短,reasoning_effort 可以设成 minimal 跳过深度思考直接出结果...

推荐理由:这是 OpenAI 旗舰模型在 API 的正式发布,重要性拉满。钩子落在 GPT-5 上线这件事本身;知识增量靠具体基准分和新控制参数撑住;共鸣点全在开发者接口层面——工具调用、延迟调节、代码能力对比,都是工程师拿到新模型第一反应会问的问题。正文没给价格和完整可用性,这点先别太激动,但接口设计的变化比模型名本身更值得盯。

OpenAI News

OpenAI 发布 GPT-5,开始向付费团队推送

OpenAI 在 8 月 7 日推出了 GPT-5,官方说法是至今最聪明、最快、最有用的模型,把之前的 4o、o 系列推理、agent 和高等数学能力都整合到了一起。当天就开始向 Team 用户推送,企业和教育版下周跟上,API 也同步开放。文章给了两个硬数字:ChatGPT 企业付费用户 500 万,每周活跃用户接近 7 亿,说明铺量已经很大。但正文...

推荐理由:GPT-5 发布本身就是全行业事件,HKR 三项全中。文章给了上线节奏和 500 万商业付费用户这个数字,但基准跑分、价格、上下文长度全都没提,所以放在最高档的底部。

2025年8月4日星期一

OpenAI News

OpenAI 说 ChatGPT 的目标是帮你干完活就走,不是让你多刷屏

OpenAI 在 8 月 4 号发了一篇说明,讲他们优化 ChatGPT 的方向。核心就一句:产品成功的标志不是用户停留时长或点击量,而是你带着问题来、解决完就离开。他们甚至把“用得更少”当成一种正面信号。文章提到,之前有一次更新把模型调得太“讨好型”,光捡好听的说,他们已经回滚了那次改动,并调整了反馈的使用方式。为了健康使用,ChatGPT 现在会在...

推荐理由:OpenAI 官方出来解释 ChatGPT 的优化方向,核心一句话:帮你干完活就走,不靠耗时间留人。信息量不算大,但有几个实在的点——休息提醒已经上线,高风险个人决策场景会出新行为(具体怎么出、触发条件是什么正文没细说),评估侧引入了 30 多国 90 多名医生的多轮对话量表。我会先打个折,因为高风险决策那部分落地细节太少,没法判断力度,但整体对从业者理解 OpenAI 的产品和安全思路有参考价值。

2025年7月30日星期三

Mistral AI

Mistral 发布 Codestral 25.08 与企业级编码栈

Mistral AI 发布 Codestral 25.08,并推出面向企业的完整编码栈,包含 Codestral、Codestral Embed、Devstral 与 Mistral Code IDE 插件。

推荐理由:原文给出 Codestral 25.08 的补全提升数据与整套企业级编码栈的部署方式,可据此判断私有化编码方案是否可行。

2025年7月29日星期二

OpenAI News

ChatGPT 上线学习模式,不再直接给答案,而是用提问引导你一步步想清楚

OpenAI 在 7 月 29 日给 ChatGPT 加了一个“学习模式”,免费、Plus、Pro、Team 用户都能用,教育版 Edu 几周后跟上。这个模式的核心不是换了个更强的模型,而是改了交互方式:它会用苏格拉底式提问、分步骤提示和知识小测来引导你,而不是直接甩答案。背后是一套跟老师、科学家、教育专家一起写的系统指令,强调主动参与、控制信息量、培...

推荐理由:OpenAI 给 ChatGPT 加了个学习模式,不是换模型,而是换交互方式——用苏格拉底式提问逼你自己想,而不是直接吐答案。Free 到 Team 用户现在就能用,Edu 版还要等几周。我会先打个折:正文没提用了哪个模型、学习效果到底怎么样、有没有防作弊指标,所以别急着把它当正经家教。真正值得盯的是产品思路在变,从工具往 tutor 靠,但验证还差得远。

2025年7月17日星期四

Mistral AI

Mistral 为 Le Chat 推出 Deep Research、语音模式等新功能

Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言思考模式、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

推荐理由:Mistral 官方一次性公布 Le Chat 五项新功能,读者可据此了解其研究、语音与图像编辑能力的组合方式。

OpenAI News

OpenAI 发布 ChatGPT agent 系统卡,主动把生物化学能力风险等级标为“高”

OpenAI 在 7 月 17 日公开了 ChatGPT agent 的系统卡。这个 agent 是把深度研究、Operator 远程浏览器操作、一个受限联网的终端工具,以及能直接连 Google Drive 这类外部应用的第一方连接器拼在一起的产品,相当于让模型自己完成多步研究、网页操作、跑代码和跨应用调数据。OpenAI 按自己的预备框架,把这次发...

推荐理由:这篇系统卡不是例行公事的安全文档。它把 ChatGPT agent 的工具栈、防护措施和 High 评级一次性摊开,等于告诉市场:OpenAI 自己认为这个 agent 已经有能力碰高危领域了。我会先打个折——正文没给出它能帮新手搞出严重生物伤害的定论证据,但评级上调本身就是信号。对盯着 agent 落地和安全治理的读者来说,这条当天就该写。

OpenAI News

ChatGPT 现在能自己操作电脑帮你干活了,把搜资料、跑代码、做 PPT 合成一个 agent

OpenAI 在 7 月 17 日把 Operator 的网页操作能力和 deep research 的信息整合能力合进了一个 ChatGPT agent 里,Pro、Plus、Team 用户都能用。它相当于给 ChatGPT 配了一台虚拟电脑,自带浏览器、终端和 API 接口,能自己上网点来点去、筛选结果、跑代码分析数据,最后直接生成可编辑的幻灯片或...

推荐理由:OpenAI 把 Operator、deep research、终端和 API 访问揉成一个 agent mode,Pro、Plus、Team 用户都能用。我会先打个折:正文没披露定价、配额和基准结果,所以实际成本和效果还得等。真正值得盯的是权限设计——敏感操作要用户点头,用户可以随时接管浏览器或叫停任务,这比功能堆叠更关键。