跳到正文

#Agent

今日 0 条

3月9日星期一

OpenAI News

OpenAI 宣布收购 Promptfoo,要把安全测试直接做进 Frontier 平台

OpenAI 发公告说要收购做 AI 安全测试的 Promptfoo,交易完成后会把它的技术整合到企业级平台 Frontier 里。Promptfoo 的工具现在有超过四分之一的财富 500 强公司在用,主要帮开发者在模型上线前做安全评估和红队测试,比如检测提示词注入、越狱、数据泄露、工具滥用这些风险。收购后,OpenAI 打算把自动化安全测试、红队演...

推荐理由:这条消息我会先打个折,因为收购价格和时间表正文都没写,没法判断交易规模和落地节奏。但 OpenAI 把一家已有大客户基础的评测工具直接收进 Frontier,对做 agent 的团队来说是个强信号——以后安全测试和红队评估可能变成平台自带能力,不用再外挂工具。这点先别太激动,等更多细节出来再看。

3月6日星期五

OpenAI News

OpenAI 把代码安全扫描工具 Codex Security 开放给付费用户试用,下个月免费

OpenAI 在 3 月 6 日上线了 Codex Security 的研究预览版,面向 ChatGPT Pro、Enterprise、Business 和 Edu 用户,下个月可以免费用。这个工具相当于一个应用安全助手,会先读懂你的项目结构,生成一份可编辑的威胁模型,再根据这个模型去找漏洞、做验证、给修复建议。过去 30 天里,它扫了外部仓库超过 1...

推荐理由:这是 OpenAI 给开发和安全团队的一个实质性产品更新,不是泛泛的安全宣传。切入点新、有具体扫描和误报数据、回应了 AI 编码风险和告警疲劳,三个点都站得住。不过目前还是研究预览,正文没披露误报下降的具体测试条件和补丁的采纳率,效果得等正式版再看。

2月27日星期五

OpenAI News

OpenAI 与亚马逊达成战略合作,AWS 成为 OpenAI 企业级产品的独家第三方云分发渠道

OpenAI 和亚马逊宣布了一项多年合作,亚马逊将向 OpenAI 投资 500 亿美元,其中 150 亿先到账,剩下 350 亿要满足特定条件后才会支付。合作的核心看点有两个:一是分发渠道,AWS 成为 OpenAI Frontier(一个让企业搭建、部署、管理 AI 智能体团队的平台)的独家第三方云分发商;二是算力绑定,OpenAI 承诺在 AWS...

推荐理由:这不是一篇常规的合作通稿。分阶段 500 亿投资、Bedrock 上线 OpenAI 模型运行时、再加约 2 吉瓦 Trainium 算力消耗,这三件事合在一起,把 OpenAI 的分发和算力姿势都改了。HKR 三项全中,所以放在 P1。

2月26日星期四

OpenAI News

OpenAI 与 PNNL 合作测试用 AI 帮联邦政府写环评报告,每小节能省 1 到 5 小时

OpenAI 跟美国能源部旗下的太平洋西北国家实验室(PNNL)合作,找了 19 位专家一起搞了个叫 DraftNEPABench 的测试集,专门看 AI 能不能帮忙起草联邦基建项目的环境评估文件。测试用的是 Codex CLI 这个命令行工具搭配 GPT-5,让模型去读几百页的技术报告、交叉核对资料,再按法规要求写出结构化的分析草稿。在覆盖 18 个...

推荐理由:HKR 三项都过了:联邦审批这个场景够意外;有 19 位专家、102 个任务和 1–5 小时的时间节省,信息量不空;争议点在于代理开始碰监管流程,但文章自己划了边界,说这只是起草辅助,不是自动决策。分数没往上拉,因为这只是个限定范围的基准测试,不是已经落地的产品能力。

OpenAI News

OpenAI Codex 和 Figma 打通了代码与设计稿的来回转换

OpenAI 和 Figma 在 2026 年 2 月 26 日发布了一项新集成:在 Codex 桌面端里,你可以直接把代码转成 Figma 里能编辑的设计稿,也能把 Figma Design、Figma Make 和 FigJam 里的内容拉回代码里继续开发。这个来回转换的流程靠 Figma MCP Server 实现,走的是 MCP 协议,相当于给...

推荐理由:OpenAI 和 Figma 搞了个 Codex 集成,代码能直接生成可编辑的 Figma 设计,反过来 Figma 里的设计、Make 原型和 FigJam 白板也能回写成代码。底层走的是 MCP,通过 Figma MCP Server 接进 Codex 桌面应用。OpenAI 说 Codex 周活已经过百万,年初到现在用量涨了四倍多。我会先打个折,因为正文没披露支持哪些模型、权限怎么划、收不收费、双向转换稳不稳定——这些才是实际落地要盯的。

1月28日星期三

Mistral AI

Mistral 发布终端编码智能体 Mistral Vibe 2.0

Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。

推荐理由:原文列出 Vibe 2.0 的自定义子智能体、斜杠命令技能等具体能力与订阅入口,可据此判断终端编码智能体的工作流变化。

1月21日星期三

NVIDIA 博客

黄仁勋在达沃斯把 AI 分成五层蛋糕,说这是人类史上最大规模基建

黄仁勋在达沃斯论坛上把 AI 产业链拆成五层:能源、芯片与算力基建、云数据中心、模型、应用。他说 2025 年全球风投砸了超过 1000 亿美元,大部分钱流向了 AI 原生公司,重点在应用层和基建层。他举了个具体例子:美国护士缺口大概 500 万,AI 可以先把病历记录和转录这类活接过去。对从业者来说,他传递的信号是瓶颈不只在模型本身,整条基建和人力链...

推荐理由:这篇是黄仁勋在达沃斯的发言,不是产品发布或论文,所以分数不会给到顶。但他说的事够具体:1000 亿美金风投、五层栈结构、500 万护士缺口,而且把 AI 讨论从模型竞赛拽回基础设施和劳动力替代,对从业者有参考价值。我会先打个折,因为终究是高管讲话,不是可复现的结果,但信息量和切入角度都到位,80 分合理。

1月6日星期二

NVIDIA 博客

英伟达预告基于 Rubin 架构的 DGX SuperPOD,单柜 260TB/s 带宽,推理成本号称能降 10 倍

英伟达在博客里公布了下一代 DGX SuperPOD 的规划,核心是换装 Rubin GPU。今年下半年会先出两款机型:DGX Vera Rubin NVL72 和 DGX Rubin NVL8。一个 SuperPOD 可以把 8 台 NVL72 拼在一起,总共塞进 576 颗 Rubin GPU,FP4 算力 28.8 exaflops,总显存 60...

推荐理由:这是一份有硬数字的NVIDIA基础设施路线图:576颗Rubin GPU、28.8 exaflops FP4、600TB内存、260TB/s NVLink,以及推理token成本最多降10倍。HKR三项都站得住,但本质上还是厂商路线图预告,不是已发货的产品或大规模公开发布,所以我会先打个折,重要性给到81。

NVIDIA 博客

NVIDIA 的 DRIVE AV 软件将首发搭载于新款奔驰 CLA

新款奔驰 CLA 会成为美国市场第一辆用上 NVIDIA DRIVE AV 的量产车,今年底交付。这套系统是双架构设计:核心驾驶决策靠一个端到端 AI 模型,同时外面包了一层基于 Halos 的传统安全校验模块,用来兜底。功能上支持点到点辅助驾驶、城市道路导航、主动避撞和自动泊车,后续还能 OTA 升级。不过,博客里没提这套系统要加多少钱、用了哪些传感...

推荐理由:我会先打个折:正文没披露传感器配置、具体价格和 ODD,所以没法判断这套系统到底多能打。但亮点在于量产时间给了,双栈设计把端到端驾驶和传统安全冗余绑在一起,不是纯 demo。对从业者来说,这是看端到端方案能不能过车规安全关的一个真实样本,所以放在 featured 低位。

NVIDIA 博客

NVIDIA 一口气开源了一堆模型、数据和工具,覆盖智能体、机器人、自动驾驶和生物医药

NVIDIA 在 2026 年 1 月 5 日放出了一批新的开源模型和数据集。语言模型方面,有 Nemotron 系列的新成员,专门做语音、外挂资料库(RAG)和安全对齐;还有一个叫 Alpamayo 1 的模型,正文没具体说它擅长什么。物理 AI 这边,Cosmos 系列更新了 Reason 2、Transfer 2.5 和 Predict 2.5 ...

推荐理由:NVIDIA 这次不是发一篇通稿,而是把 Nemotron、Cosmos、GR00T、Clara 几条线的模型、数据集和工具一起开源了。我会先打个折:所有信息都来自厂商自己,没有第三方验证,实际可用性还得看后续社区反馈。但光看披露的数字——10 万亿 token 文本、50 万条机器人轨迹、100TB 车载数据、45.5 万个蛋白结构——规模确实够大,而且覆盖了代理、物理 AI、自动驾驶和生命科学几个热门方向。具体到模型,Nemotron Speech 做语音、Cosmos Reason 2 做推理、GR00T N1.6 做人形机器人、Alpama...

2025年12月9日星期二

Mistral AI

Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

Mistral AI 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

推荐理由:原文给出 Devstral 2 的 SWE-bench 成绩、开源许可与部署门槛,可据此判断开源编码模型的落地成本。

2025年10月24日星期五

Mistral AI

Mistral AI 发布 Mistral AI Studio 生产平台

Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。

推荐理由:原文给出企业级 AI 生产化的三大支柱与私有 beta 入口,可据此判断其与现有 MLOps 工具的差异。

2025年10月21日星期二

OpenAI News

OpenAI 发布 ChatGPT Atlas 浏览器,把 ChatGPT 直接嵌进浏览器里

OpenAI 在 2025 年 10 月 21 日推出了 ChatGPT Atlas,一个把 ChatGPT 内置在核心的浏览器,目前 macOS 版全球上线,免费、Plus、Pro 和 Go 用户都能用。Atlas 让 ChatGPT 能跟着你浏览网页,看懂你当前在看什么,不用复制粘贴就能回答问题或帮你干活。它还能记住你浏览过的网站内容(叫“浏览器记...

推荐理由:OpenAI 把 ChatGPT 做成一个独立浏览器,而不是继续在别人浏览器里当插件,这是分发层面的动作,不是日常功能更新,所以给到 88 分、p1。HKR 三项全中:钩子够新,不是又一个模型升级;信息量扎实,上线范围、付费策略、隐私开关都给了;从业者会盯着它怎么用浏览器记忆和页面可见性控制来卡位,这点先别太激动,但确实值得盯。

2025年10月6日星期一

OpenAI News

OpenAI 的 Codex 编程助手正式上线,新增 Slack 集成、SDK 和管理后台

OpenAI 在 10 月 6 日宣布 Codex 结束预览、进入正式可用阶段。这次主要加了三个东西:一是能在 Slack 频道里直接 @Codex 派活,像喊同事帮忙一样;二是放出了 Codex SDK,让你把驱动命令行版 Codex 的那个智能体嵌进自己的工具或流程里,官方说配合 GPT‑5‑Codex 模型不用额外调优就能用;三是给企业管理员上了...

推荐理由:OpenAI 把 Codex 从预览推到正式版,顺手加了 Slack 集成、SDK 和管理员控制,这比发个模型补丁重得多。我会先打个折:正文没披露云端任务的具体价格,这点先别太激动。但用量数据摆在那里,10 倍增长和 40 万亿 token 说明调用量是真金白银在跑。更值得盯的是内部数据——工程师全上、PR 合并效率提 70%,这是企业买单前最想看到的验证。整体看,这不是一次功能更新,是编码助手开始抢工作流入口和团队席位的明确动作。

OpenAI News

ChatGPT 里能直接调用 Booking、Canva 这些 App 了,OpenAI 还发了套开源 SDK 让开发者自己做

OpenAI 在 10 月 6 号给 ChatGPT 加了个新功能:你可以在聊天里直接喊 App 出来干活,比如让 Spotify 帮你排歌单,或者让 Zillow 在地图上筛房源。首批上线的有 Booking.com、Canva、Coursera、Expedia、Figma、Spotify 和 Zillow 这七家,后面还有 11 家会在年内跟上。目...

推荐理由:OpenAI 给 ChatGPT 装了个应用层,同时把开发工具包开源出来,等于把聊天界面升级成一个小型应用商店。我会先打个折:覆盖范围排除了欧洲经济区、瑞士和英国,应用怎么审核、怎么分成正文都没说,所以商业闭环还不完整。但首批 7 家合作方已经上线,年内还要再上 11 家,SDK 走的是 MCP 协议,开发者能直接触达 OpenAI 自称的 8 亿多用户,这对做工具和 agent 的团队是个实打实的信号。

OpenAI News

OpenAI 发布 AgentKit:一套工具把智能体开发、评测和微调打包在一起

OpenAI 在 10 月 6 日推出了 AgentKit,把做智能体需要的三块拼图拼到了一起:Agent Builder 是个画布,拖拽节点就能搭多智能体流程,支持版本管理和安全护栏;ChatKit 让你把对话界面嵌进自家产品,省掉两周前端开发时间;Connector Registry 统一管理 Dropbox、Google Drive、ShareP...

推荐理由:这次发布对 agent 开发者来说信息量挺大,Agent Builder、Connector Registry、ChatKit 三个组件都给了具体机制。Evals 那边 trace grading 和自动提示优化是实打实的新能力,第三方模型支持也扩大了适用范围。但标题里提到的 RFT,正文截出来的部分完全没讲训练怎么搞、多少钱、哪些人能先用,这点先别太激动。整体够重磅,但缺关键细节,所以给 84 分而不是顶格。

2025年9月29日星期一

OpenAI News

OpenAI 给 ChatGPT 加了家长控制,能管孩子用 AI 的时间和功能

OpenAI 在 9 月 29 日上线了家长控制功能,所有 ChatGPT 用户都能用。家长把自己的账号和孩子的绑定后,就能在自己的账号里管理孩子的使用设置。绑定后的青少年账号默认会加强内容过滤,减少暴力、色情角色扮演和极端审美之类的内容。家长还可以单独设置禁用时段、关掉语音模式、关掉记忆功能、禁止图片生成,以及拒绝把孩子的对话拿去训练模型。比较关键的...

推荐理由:OpenAI 把家长控制推给了所有 ChatGPT 用户,但真正值得看的是自残风险上报链路:系统检测到风险后,先由人工小组复核,确认是急性痛苦状态再通过邮件、短信和推送通知家长。这不是一个简单的设置面板,而是一套带人工介入的安全流程。我会先打个折,因为这次没有模型层面的变动,属于产品安全更新,但信息量够实,流程也说得清楚。

OpenAI News

ChatGPT 开始内嵌购物功能,先拿 Etsy 试水,并开源了一套让 AI 帮你下单的协议

OpenAI 在 9 月 29 日给 ChatGPT 加了个“即时结账”功能,美国 Plus、Pro 和免费用户现在能在聊天界面里直接买 Etsy 卖家的东西,目前只支持单件购买。Shopify 上像 Glossier、SKIMS 等一百多万商家之后也会接入。ChatGPT 每周有超过 7 亿人用,这次它不只是推荐商品,而是直接充当“数字导购”帮你完成...

推荐理由:OpenAI 让 ChatGPT 能直接结账,不是小功能补丁,是产品边界的一次硬扩张。我会先打个折:目前只覆盖美国用户和美国 Etsy 卖家,单件下单,规模还小。但真正值得盯的是它和 Stripe 一起推的开源 Agentic Commerce Protocol——商家最少一行代码就能接入,等于在铺结算管道。商品排序说按相关性自然展示,商家付小额成交费,但费率正文没披露,这点先别太激动。整体看,从聊天到成交的链路打通了,对从业者来说,这意味着模型开始进交易流干活,而不只是回话。

2025年9月25日星期四

OpenAI News

ChatGPT 企业版上线共享项目,团队能一起调教同一个 AI 了

OpenAI 给付费的 Business、Enterprise 和 Edu 用户推了个共享项目功能。简单说,就是团队可以建一个项目空间,把文件、指令都扔进去,所有成员跟 ChatGPT 聊天时,它都会基于这个共享的上下文来回答,不用每次都重新解释背景。创建者能通过邮件或链接拉人,权限分两档:只能看和聊,或者还能改指令、传文件。项目有自己的独立记忆,敏感...

推荐理由:我会先打个折,这不是模型发布,是协作层的产品更新。共享项目、8 个连接器、按提示自动路由连接器,这三件事合在一起,让 ChatGPT 从单人对话框往团队工作流里又挤了一步。权限和记忆的设计看得出在认真做企业控制,但正文没披露自动选择连接器的准确率和延迟,这点先别太激动。整体是扎实的迭代,不是概念车。

OpenAI News

ChatGPT Pulse 预览:让模型主动推消息,每天一次

OpenAI 给 Pro 用户上了个移动端新功能 Pulse,ChatGPT 不再等你问,而是每天主动推一版个性化信息卡片。它会翻你的聊天记录、记忆和反馈,还能选接 Gmail 和 Google 日历(默认关着),晚上做功课,早上把结果推给你。你可以点赞点踩、直接告诉它明天想看什么,所有输出会过一道安全检查。正文没提用了哪个模型、会不会涨价、Plus ...

推荐理由:我会先打个折:正文没提模型有没有换、Pro 之外怎么收费、Plus 什么时候上,所以别当完整发布看。但亮点是交互逻辑变了——从你问它答,变成它每天主动塞一张卡片给你,信息源还能挂上你的邮箱和日历。如果是真的,省掉你每天手动去问“今天有什么我该知道的”,但前提是你敢把 Gmail 交出去。安全检查说做了,集成默认关着,这点先别太激动,等更多实测再说。

2025年9月24日星期三

OpenAI News

SAP 和 OpenAI 要在德国搞一个数据不出境的政府专用版 ChatGPT

OpenAI 和 SAP 宣布合作,计划 2026 年在德国推出一个专门给公共部门用的 AI 服务。这个服务会跑在 SAP 子公司 Delos Cloud 的微软 Azure 平台上,主打数据留在德国、符合当地法律和安全标准。SAP 打算把 Delos Cloud 的算力扩到 4000 块 GPU 来跑 AI 任务。公告里没提具体会用哪个模型、怎么收费...

推荐理由:这条我会先打个折:正文没写具体模型、价格和采购规模,所以没法判断性价比。但真正值得盯的是交付形态——不是通用发布,而是把 OpenAI 塞进德国政务流程里,用 Delos Cloud 解决数据不出境和合规问题。4000 块 GPU 的规模说明 SAP 是认真在铺基础设施,不是做个 demo。对关注主权云和政企 AI 落地的人,这个案例比普通合作公告有信息量。

2025年9月16日星期二

OpenAI News

OpenAI 在给 ChatGPT 加年龄预测,拿不准就默认当未成年人处理

OpenAI 正在开发一套年龄预测系统,用来判断用户是否满 18 岁。一旦系统判定用户未成年,会自动切到一个内容受限的青少年模式,比如屏蔽露骨的性内容,极端情况下还可能联系执法部门。如果系统拿不准年龄,宁可误判也会先按未成年人处理,成年人可以再通过验证解锁完整功能。月底前会上线家长控制,家长能关联孩子的账号、关掉记忆和聊天记录、设置禁用时段,孩子遇到严...

推荐理由:OpenAI 没在发一篇泛泛的安全声明,而是把年龄估算直接嵌进了 ChatGPT 的分流逻辑里。我会先打个折:正文没披露年龄预测的具体技术方案和准确率,这点先别太激动。但产品思路很明确——宁可误判也不漏判,低置信度默认走青少年版,成年人想回来得自证。家长控制那边,能关记忆和历史记录,等于给了监护人一把更实在的钥匙。整体看,这不是模型能力升级,是一次产品路由规则的调整,但牵动的隐私和合规神经够多,值得放进 featured。

2025年9月15日星期一

OpenAI News

OpenAI 把 GPT-5 调成了专门干活的编程助手 Codex,一个模型同时搞定聊天写码和长时间自主跑任务

OpenAI 发布了 GPT-5-Codex,并把它设为 Codex 云端任务和代码审查的默认模型。这个模型专门针对真实软件工程任务训练过,既能跟你快速交互式写代码,也能自己独立跑复杂任务,测试中最长连续干了超过 7 个小时。在 OpenAI 内部员工的使用数据里,对于 token 消耗最少的那 10% 的简单对话,GPT-5-Codex 比 GPT-...

推荐理由:OpenAI把GPT-5-Codex设为Codex云任务和代码审查的默认模型,给了几个硬数字:7小时自主执行、低端请求token省93.7%、高端请求耗时翻倍。这说明他们想把交互编程和长时代理执行揉在一起,但定价和完整可用性正文没披露,所以先别急着算账。

OpenAI News

OpenAI 发了 GPT-5-Codex 的系统卡补充说明,专门给写代码的 agent 用

这个模型是 GPT-5 的一个变体,针对 Codex 里的 agent 编程场景做了优化。训练时用了强化学习,让它在真实编程任务里学会写出更贴近人类风格和 PR 偏好的代码,还能自己跑测试直到通过。现在可以在终端、IDE、网页、GitHub 和 ChatGPT 手机 App 里用。安全方面,模型层面做了防有害任务和防提示注入的训练,产品层面加了沙盒和可...

推荐理由:HKR 三项都踩实了:OpenAI 把代理式编程铺到多个入口,训练和安全措施有具体交代,而且正好打在行业最关心的执行边界上。基准分数、价格和上下文窗口正文都没写,所以分数没往上拉,停在 84。

2025年9月12日星期五

OpenAI News

OpenAI 跟美英安全机构合作,给 ChatGPT Agent 抓出两个新漏洞,一天内修好

OpenAI 公开了他们与美国 CAISI、英国 UK AISI 的合作进展。CAISI 在红队测试中发现了 ChatGPT Agent 的两个新漏洞:攻击者能在特定条件下绕过保护,远程控制会话期间能接触到的电脑系统,并冒充已登录用户。CAISI 把传统网络漏洞和 AI 劫持攻击串在一起,做出一条概念验证攻击链,成功率大约 50%。OpenAI 在接到...

推荐理由:这篇不是安全公关稿。OpenAI 自己说 ChatGPT Agent 被美国 CAISI 和英国 AISI 红队测出两个新漏洞,CAISI 的概念验证攻击成功率大概一半,OpenAI 一个工作日就修了。我会先打个折:英国 AISI 那部分正文被截断了,GPT-5 生物滥用防护的测试结果没披露,所以整体影响面还不清楚。但就凭 Agent 远程会话控制这个风险点,从业者会想看一眼。

2025年9月2日星期二

Mistral AI

Mistral AI 为 Le Chat 推出 Memories 记忆功能(beta)

Mistral AI 为 Le Chat 上线 Memories(beta)记忆功能,可自动保存有用信息,但回忆过程可见、可溯源,并附来源链接。用户可随时关闭记忆、开启不使用记忆的隐身对话、编辑或删除单条记忆,还能导出和从外部导入记忆。同步推出 Memory Insights,基于用户自身数据提示记忆趋势与摘要。

Mistral AI

Mistral 为 Le Chat 上线自定义 MCP 连接器与 Memories 记忆功能

Mistral 为 Le Chat 推出 20+ 个基于 MCP 的安全连接器目录(beta),覆盖数据、生产力、开发、自动化与商务等类别,支持接入 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等工具,并可添加自定义 MCP 连接器或连接任意远程 MCP 服务器。

推荐理由:原文列出 20+ 连接器覆盖的具体工具类别与部署方式,可据此判断 Le Chat 在企业工作流中的接入范围。

OpenAI News

OpenAI 要在 120 天内给 ChatGPT 加安全机制,下个月先上家长控制

OpenAI 公布了一版安全更新计划,核心是两件事:一是把检测到严重情绪危机的对话自动转给推理模型(比如 GPT‑5‑thinking)去处理,理由是这类模型在安全规范上更稳、更不容易被诱导;二是下个月内推出家长控制功能,家长可以绑定 13 岁以上孩子的账号,关掉记忆和聊天记录,并在系统判定孩子处于严重情绪波动时收到通知。正文没披露危机检测的触发阈值和...

推荐理由:OpenAI 说接下来 120 天要推安全改进,下个月先上家长控制。最值得看的是那条路由规则:检测到急性痛苦迹象的对话,会自动转给 GPT-5-thinking 这类推理模型处理。这比加个免责声明实在,但正文没公布触发条件和误报率,实际效果得等上线再看。青少年账户那边,家长能关 memory 和聊天记录,算是给了控制权,不过也没说默认开关状态。整体是产品动作,不是技术突破,我会先打个折。

2025年8月28日星期四

OpenAI News

OpenAI 发布 gpt-realtime 模型,语音 API 正式上线并支持电话和图片输入

OpenAI 把 Realtime API 从公测转成了正式版,同时推出了新的端到端语音模型 gpt-realtime。这个模型不再走“语音转文字再转语音”的老路,而是直接处理音频,延迟更低,语气和情绪保留得更好。新模型在听懂复杂指令和调用工具上进步明显:Big Bench Audio 推理得分从去年 12 月版的 65.6% 提到了 82.8%,Mu...

推荐理由:这不是小修小补,是 OpenAI 把语音模型、工具链和电话接口一次补齐的版本。gpt-realtime 的基准分涨了十几到二十个百分点,虽然 MultiChallenge 的 30.5% 说明复杂场景还吃力,但配合 MCP 远程服务器和 SIP 通话,语音代理终于能跑通完整业务闭环了。我会先打个折——正文没给延迟和并发数据,实际部署成本还得自己测,但方向是对的,所以给到 p1。

2025年8月7日星期四

OpenAI News

OpenAI 在 API 里放出了 GPT-5,分了三个尺寸,主打写代码和跑流程

OpenAI 8 月 7 号在 API 上线了 GPT-5,提供 gpt-5、gpt-5-mini 和 gpt-5-nano 三个尺寸,让开发者在性能、成本和延迟之间自己选。这次最核心的变化是 API 设计本身:新增了 verbosity 参数(低/中/高)控制回答长短,reasoning_effort 可以设成 minimal 跳过深度思考直接出结果...

推荐理由:这是 OpenAI 旗舰模型在 API 的正式发布,重要性拉满。钩子落在 GPT-5 上线这件事本身;知识增量靠具体基准分和新控制参数撑住;共鸣点全在开发者接口层面——工具调用、延迟调节、代码能力对比,都是工程师拿到新模型第一反应会问的问题。正文没给价格和完整可用性,这点先别太激动,但接口设计的变化比模型名本身更值得盯。

OpenAI News

OpenAI 发布 GPT-5,开始向付费团队推送

OpenAI 在 8 月 7 日推出了 GPT-5,官方说法是至今最聪明、最快、最有用的模型,把之前的 4o、o 系列推理、agent 和高等数学能力都整合到了一起。当天就开始向 Team 用户推送,企业和教育版下周跟上,API 也同步开放。文章给了两个硬数字:ChatGPT 企业付费用户 500 万,每周活跃用户接近 7 亿,说明铺量已经很大。但正文...

推荐理由:GPT-5 发布本身就是全行业事件,HKR 三项全中。文章给了上线节奏和 500 万商业付费用户这个数字,但基准跑分、价格、上下文长度全都没提,所以放在最高档的底部。

2025年8月4日星期一

OpenAI News

OpenAI 说 ChatGPT 的目标是帮你干完活就走,不是让你多刷屏

OpenAI 在 8 月 4 号发了一篇说明,讲他们优化 ChatGPT 的方向。核心就一句:产品成功的标志不是用户停留时长或点击量,而是你带着问题来、解决完就离开。他们甚至把“用得更少”当成一种正面信号。文章提到,之前有一次更新把模型调得太“讨好型”,光捡好听的说,他们已经回滚了那次改动,并调整了反馈的使用方式。为了健康使用,ChatGPT 现在会在...

推荐理由:OpenAI 官方出来解释 ChatGPT 的优化方向,核心一句话:帮你干完活就走,不靠耗时间留人。信息量不算大,但有几个实在的点——休息提醒已经上线,高风险个人决策场景会出新行为(具体怎么出、触发条件是什么正文没细说),评估侧引入了 30 多国 90 多名医生的多轮对话量表。我会先打个折,因为高风险决策那部分落地细节太少,没法判断力度,但整体对从业者理解 OpenAI 的产品和安全思路有参考价值。

2025年7月30日星期三

Mistral AI

Mistral 发布 Codestral 25.08 与企业级编码栈

Mistral AI 发布 Codestral 25.08,并推出面向企业的完整编码栈,包含 Codestral、Codestral Embed、Devstral 与 Mistral Code IDE 插件。

推荐理由:原文给出 Codestral 25.08 的补全提升数据与整套企业级编码栈的部署方式,可据此判断私有化编码方案是否可行。

2025年7月29日星期二

OpenAI News

ChatGPT 上线学习模式,不再直接给答案,而是用提问引导你一步步想清楚

OpenAI 在 7 月 29 日给 ChatGPT 加了一个“学习模式”,免费、Plus、Pro、Team 用户都能用,教育版 Edu 几周后跟上。这个模式的核心不是换了个更强的模型,而是改了交互方式:它会用苏格拉底式提问、分步骤提示和知识小测来引导你,而不是直接甩答案。背后是一套跟老师、科学家、教育专家一起写的系统指令,强调主动参与、控制信息量、培...

推荐理由:OpenAI 给 ChatGPT 加了个学习模式,不是换模型,而是换交互方式——用苏格拉底式提问逼你自己想,而不是直接吐答案。Free 到 Team 用户现在就能用,Edu 版还要等几周。我会先打个折:正文没提用了哪个模型、学习效果到底怎么样、有没有防作弊指标,所以别急着把它当正经家教。真正值得盯的是产品思路在变,从工具往 tutor 靠,但验证还差得远。

2025年7月17日星期四

Mistral AI

Mistral 为 Le Chat 推出 Deep Research、语音模式等新功能

Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言思考模式、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

推荐理由:Mistral 官方一次性公布 Le Chat 五项新功能,读者可据此了解其研究、语音与图像编辑能力的组合方式。

OpenAI News

OpenAI 发布 ChatGPT agent 系统卡,主动把生物化学能力风险等级标为“高”

OpenAI 在 7 月 17 日公开了 ChatGPT agent 的系统卡。这个 agent 是把深度研究、Operator 远程浏览器操作、一个受限联网的终端工具,以及能直接连 Google Drive 这类外部应用的第一方连接器拼在一起的产品,相当于让模型自己完成多步研究、网页操作、跑代码和跨应用调数据。OpenAI 按自己的预备框架,把这次发...

推荐理由:这篇系统卡不是例行公事的安全文档。它把 ChatGPT agent 的工具栈、防护措施和 High 评级一次性摊开,等于告诉市场:OpenAI 自己认为这个 agent 已经有能力碰高危领域了。我会先打个折——正文没给出它能帮新手搞出严重生物伤害的定论证据,但评级上调本身就是信号。对盯着 agent 落地和安全治理的读者来说,这条当天就该写。

OpenAI News

ChatGPT 现在能自己操作电脑帮你干活了,把搜资料、跑代码、做 PPT 合成一个 agent

OpenAI 在 7 月 17 日把 Operator 的网页操作能力和 deep research 的信息整合能力合进了一个 ChatGPT agent 里,Pro、Plus、Team 用户都能用。它相当于给 ChatGPT 配了一台虚拟电脑,自带浏览器、终端和 API 接口,能自己上网点来点去、筛选结果、跑代码分析数据,最后直接生成可编辑的幻灯片或...

推荐理由:OpenAI 把 Operator、deep research、终端和 API 访问揉成一个 agent mode,Pro、Plus、Team 用户都能用。我会先打个折:正文没披露定价、配额和基准结果,所以实际成本和效果还得等。真正值得盯的是权限设计——敏感操作要用户点头,用户可以随时接管浏览器或叫停任务,这比功能堆叠更关键。

OpenAI News

OpenAI 悬赏 2.5 万美元,找能一次性攻破 ChatGPT Agent 十道生化安全题的提示词

OpenAI 在 7 月 17 号开了一个生物安全漏洞悬赏,目标是 ChatGPT Agent 这个模型。规则很直接:你要找到一个“万能越狱提示词”,从空白对话开始,一次性答对它出的全部十道生物/化学安全题。第一个做到的团队或个人能拿 2.5 万美元。如果用了多个提示词才答完十道题,第一个完成的队伍也有 1 万美元。测试 7 月 29 号开始,只对通过...

推荐理由:OpenAI 直接悬赏找 agent 在生化题上的通用越狱方法,不是泛泛的安全声明。H 抓的是“一条提示通杀 10 题”这个钩子,K 落在清晰的测试范围和奖金结构,R 则指向 agent 越狱边界和生物安全责任这个行业痛点。80 分给 featured,是因为有具体规则和真金白银,但正文没披露测试题细节和 NDA 范围,所以不到 85。

2025年7月11日星期五

Mistral AI

Mistral 发布 Devstral Medium 并升级 Devstral Small 1.1

Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。

推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数和 API 定价,便于对比现有方案。

2025年5月27日星期二

Mistral AI

Mistral 发布 Agents API,内置连接器与 MCP 工具

Mistral 发布 Agents API,将自家语言模型与代码执行、网页搜索、图像生成和 MCP 工具等内置连接器结合,并提供跨对话的持久记忆与智能体编排能力。

推荐理由:官方给出 Agents API 的连接器、记忆与编排能力,读者可据此判断智能体平台的落地方式。