跳到正文

#Agent

今日 36 条

2月10日星期二

MIT Technology Review · AI

Moltbook 这波狂欢,跟 2014 年网友一起玩宝可梦差不多

Moltbook 是一个让 AI 智能体互相发帖的社交网络,上周被很多人说成是未来的样子。但 MIT Technology Review 的编辑觉得,它更像 2014 年 Twitch 上万人一起操控同一个宝可梦角色的社会实验——当时最高有 100 万人同时在线,热闹归热闹,最后没留下什么实质影响。Moltbook 也一样:表面上 AI 在帮你砍价买车...

推荐理由:我会先打个折:这篇文章不是技术报告,是一篇降温评论。它把 Moltbook 这场 AI agent 社交实验比作 2014 年 Twitch 上 100 万人一起玩 Pokémon——围观的人多,不代表方向就对了。正文还提到实验里混进了加密骗局,有些所谓 agent 发言其实是人在背后操作,这点先别太激动。真正值得盯的是它指出的硬伤:共享记忆怎么做、多个 agent 怎么协调、共同目标怎么定,这三个问题正文明确说还没解决。对从业者来说,这篇东西的价值不在答案,在于把 hype 拉回地面,提醒大家别把热闹当落地。

2月9日星期一

36 氪 · 直链

千问的1000万杯奶茶:阿里大发赛博鸡蛋始末

2月6日,阿里千问App搞了一场“免单喝奶茶”活动,一天涌进超1000万笔订单,直接把系统挤崩了。上午10点到中午12点,点单页面卡死、转圈,甚至弹出提示说自己“没有实体的手脚,无法连接支付系统”。宕机是因为千问的算力没扛住——AI处理下单、比价、支付比普通电商秒杀更吃资源,而初始服务器容量只有预估峰值的1/3,也没做充分的压力测试和扩容预案。线下门店...

推荐理由:我会先打个折:这本质是阿里的一场促销压力测试,不是模型突破。但1000万杯奶茶把服务器打崩的现场感很强,数字也够具体——10点到12点宕机、12点前200万单、算力只备了1/3,这些事实让文章有信息增量。对从业者来说,值得看的是阿里怎么用补贴把AI推到消费场景里,以及基础设施在真实并发下的表现,比单纯刷榜更有烟火气。

36 氪 · 直链

前百川智能联创焦可离职做来福电台,想造能记住你喜好的 AI 主播

焦可离开百川智能后,在 2025 年初创办了 AI 音频公司“来福电台”。他做的不是单纯的 AI 播客工具,而是 15 个中文和 2 个英文 AI 主播,每个主播风格不同,能根据用户收听历史推荐内容,用户也可以随时打断节目提问或聊天。焦可认为语音交互能产生足够多的长上下文,让 AI 记住用户偏好,这是建立情感链接和个性化服务的关键。来福在 2025 年...

推荐理由:这篇值得上featured,因为它把一个容易被当成“AI播客工具”的产品讲清楚了真正想赌的方向:不是生成音频,而是造有记忆、可交互的AI主播。硬信息够实,融资额、主播数量、使用时长、内容生成速度都有,而且把DTU和长记忆当成基础设施壁垒在说,不是空谈概念。车载合作这条线虽然没展开细节,但已经给出一个可验证的落地场景。公司阶段偏早期,所以放在featured而不是p1,但判断本身有信息量,我会先打个折观望后续数据。

2月7日星期六

MIT Technology Review · AI

Moltbook 是一场 AI 表演秀,不是机器觉醒

Moltbook 是一个给 AI 机器人玩的社交网络,上线几小时就火了。官方说现在有 170 万个机器人账号,发了 25 万条帖子,留下 850 万条评论。这些机器人靠一个叫 OpenClaw 的开源工具驱动,它能把 Claude、GPT-5 或 Gemini 这类大模型接上邮箱、浏览器等日常软件,让模型替你干点简单活。但文章指出,这场热闹基本是人在背...

推荐理由:这篇不是市场级事件,但反炒作评论写得干脆。我会先打个折:它没有新数据或新漏洞披露,更多是把已有的怀疑用“AI 剧场”这个说法串起来。HKR 三项都过关——钩子够狠,数字和机制分析补得扎实,安全风险那段让做 agent 的人会心里一紧。整体够 featured,但信息增量有限,所以停在 74 分这个位置。

2月6日星期五

TechCrunch · AI

OpenAI 和 Anthropic 在同一天抢着发布能自己干活的编程模型,前后只差几分钟

OpenAI 推出了 GPT-5.3 Codex,一个专门给自家编程工具 Codex 用的新模型。按 OpenAI 的说法,这个模型让 Codex 从“能写代码、审代码”升级到“几乎能替开发者在电脑上干所有事”,甚至能在几天内从零做出功能复杂的游戏和应用。速度比上一代 GPT-5.2 快了 25%,而且 OpenAI 说这是第一个“自己参与造自己”的模...

推荐理由:这条消息的看点全在时间差——OpenAI 在 Anthropic 发布后几分钟就甩出自己的代理式编码模型,说明两边在让模型进开发流程这件事上咬得很紧。但正文能用的信息太少:没模型名、没跑分、没价格、没上下文窗口、也没说谁能用,只提了一嘴跟 Codex 有关。所以我会先打个折,重要性给到 75、放在 featured 低位,因为话题热度够,但证据太薄,暂时没法判断性能或性价比。

2月4日星期三

硅谷101 播客

E224|Mac mini遭疯抢,为何Clawdbot能成为2026年第一个现象级产品?

这期播客录制于1月30日,但随后几天项目经历了改名、被起诉、安全漏洞曝光和服务器瘫痪等一系列反转。嘉宾们从用户、软件算法和硬件三个角度拆解了Clawdbot(后更名为Moltbot、OpenClaw)爆火的原因。用户侧嘉宾知县认为,核心是“活人感”:它能通过即时通讯软件主动推送提醒、做调研,甚至吐槽,像《钢铁侠》里的贾维斯。算法侧嘉宾祯豪指出,其主动性...

推荐理由:这期不是官方发布,更像一篇行业快评,但信息量够硬:14.6 万 stars 和改名风波都是新事实,机制拆解也到位。我会先打个折——正文没披露 Mac mini 实际销量,标题的“疯抢”更多是话题钩子;Agent 电脑的需求判断来自讨论,不是出货数据。不过对从业者来说,交互层怎么搭比模型本身更值得盯,这期把记忆、心跳、IM 入口这些拼法讲明白了,所以给 featured。

2月3日星期二

Computing Life · 鸭哥

学 AI 的人卡在配置和部署上,这个团队用工程基建代替教程来解决

作者团队两年开了四门课、教了 2500 多人,发现大部分学员不是学不会,而是被绑卡、配环境、部署这些琐事耗光了热情。他们做了一个叫 AI Builder Space 的教学平台,学员注册后直接拿到免绑卡的统一 API,背后接好了 GPT、Claude、Gemini 等主流模型,改个参数就能对比实验;写完代码调个接口就能一键部署到 <名字>.ai-bui...

推荐理由:这篇文章把老生常谈的“教程没用”落到了具体数字和产品设计上:2500多个学员,真正交付产品的很少,卡在配置、实验、部署和上下文整理四件事。团队没再写新教程,而是搭了个平台,把免绑卡API、一键部署、多模型切换和MCP接入打包进去,让Cursor和Claude Code一行命令就能用。思路对,但正文没披露转化率、留存和成本,所以判断先打个折,放在featured低段。

2月2日星期一

Import AI

走进迷雾:Moltbook、智能体生态与正在变脸的互联网

Jack Clark 聊了一个叫 Moltbook 的网站,它把成千上万个 AI 智能体塞进了一个类似 Reddit 的社交网络里,让它们自己发帖、回帖、讨论。刷这个网站的感觉就像走进一个房间,发现 90% 的聊天对象都是假装成人的外星人。帖子内容五花八门,有讨论把 Claude 当神拜的,有分享切换不同底层模型后“身份认同”变化的,也有在扒 Open...

推荐理由:这篇值得上精选。最抓人的是 Moltbook 上数万代理公开互动的画面,直接让人感受到互联网正在从人聊变成代理聊。Jack Clark 还点出了 OpenClaw 的电脑操控能力,等于把社交网络和物理操作串在一起,想象空间很大。另一个硬信息是闭门研讨里提到的 AI 研发闭环:一旦跑通,生产率可能跳 10 倍、100 倍甚至 1000 倍,数字够具体,但正文没给出可观测指标和外部透明度细节,所以我会先打个折。整体上,钩子、新知和共鸣点都到位,但缺少活跃代理数、留存和交易数据,分数停在 78 是合理的。

2月1日星期日

Lex Fridman 播客

2026年AI现状:大模型、编程、规模定律、中国、智能体、GPU与AGI

Lex Fridman 与 Sebastian Raschka、Nathan Lambert 聊了聊 2026 年的 AI 竞赛。他们把 2025 年 1 月 DeepSeek R1 的发布看作一个关键转折点,那次发布让很多人意识到,用少得多的算力和成本也能做出接近顶尖水平的模型。现在竞争已经不只是美国公司的事,中国这边除了 DeepSeek,还有 Z...

推荐理由:这期播客不是新闻爆料,而是高质量的行业判断。三位把 2025 年 1 月 DeepSeek R1 发布当作转折点,认为技术扩散在加速,差距更多体现在算力、预算和团队文化上,而不是某个模型刷榜。我会先打个折:正文没给任何硬数据支撑,所以别当技术报告读。但如果你关心 AI 竞争格局怎么变,这期值得听。

1月30日星期五

阮一峰的网络日志

你是第几级 AI 编程

史蒂夫·耶格把 AI 编程分成 8 级,从在 IDE 里装插件、逐条确认建议,到一路无脑点 Yes,再到同时开十几个 AI 窗口并行写代码,最后用编排器让机器自己管机器。他说自己已经到了第 8 级,还让 AI 写了个叫“煤气镇”的编排工具,攒了 22.5 万行 Go 代码,一行都没看过。这个工具已经拿到 6000 颗星,但他也直说用起来很费钱,而且可能...

推荐理由:Steve Yegge 这篇不是产品发布,是他自己的实践总结,但把“黑箱编程”从个人习惯抬到了工具链选择的层面。8 级分级本身有传播力,里面提到的并行跑 Agent 的成本和失控风险也写得很直白,没画饼。我会先打个折:这是二手评论,不是一手模型或产品,所以分数停在 77 合理。

1月29日星期四

阮一峰的网络日志

Kimi 把模型和智能体绑在一起发,Manus 则靠别人的模型做上层应用

Kimi 这次发布的重点不是 K2.5 模型本身,而是它同时推出了一个基于该模型的智能体应用,直接在官网上线了。这跟 Manus 的做法正好相反:Manus 用的是 Anthropic 的 Claude 模型,自己只做上层的智能体产品,属于分层开发。Kimi 走一体化路线,把底层模型和上层应用打包发布。文章实测了 K2.5 智能体的“视觉编程”功能,上...

推荐理由:这篇值得看,因为它讲的是产品形态的转向,而不只是模型跑分。Kimi 这次把 K2.5 模型和 Agent 模式一起塞进官网切换入口,等于告诉用户“你不用管底下是什么,直接用就行”。1500 步操作和 100 个 Agent 并发的数字,说明他们在长任务和并发上做了工程投入;视觉编程那条路,是从设计稿或录屏直接出页面,想法挺直接。但我会先打个折:正文没写价格、上下文长度和 API 条件,这些才是工程落地的硬指标。另外消息源本身是评论性质,不是一手技术报告,所以判断要留余地。整体来说,它把“一体化还是分层”这个老问题又拉回台面上,对做 Agent 产品...

1月28日星期三

MIT Technology Review · AI

AI 开始记住你的一切,隐私保护要面对新麻烦了

Google 这个月推出了 Personal Intelligence,让 Gemini 直接读取你的 Gmail、相册、搜索和 YouTube 记录来提供个性化服务。OpenAI、Anthropic 和 Meta 也都在给自家产品加记忆功能。问题在于,现在的做法是把你在不同场景下的数据全倒进一个池子里——你问过医疗建议、写过工作邮件、搜过餐厅,这些信...

推荐理由:我会先打个折:这是篇评论,没有新数据或独家爆料,所以分数没再往上拉。但它的钩子很准——把“记忆”重新框成隐私问题,而不是体验优化。正文没停留在喊风险,而是列出记忆分区、来源追踪、可删改控制和隐私测试机制这几个具体设计点,对正在往产品里加记忆的团队有直接参考价值。Google 的 Personal Intelligence 案例也给了可对照的工程栈,不是泛泛而谈。

Mistral AI

Mistral 发布终端编码智能体 Mistral Vibe 2.0

Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。

推荐理由:原文列出 Vibe 2.0 的自定义子智能体、斜杠命令技能等具体能力与订阅入口,可据此判断终端编码智能体的工作流变化。

1月21日星期三

NVIDIA 博客

黄仁勋在达沃斯把 AI 分成五层蛋糕,说这是人类史上最大规模基建

黄仁勋在达沃斯论坛上把 AI 产业链拆成五层:能源、芯片与算力基建、云数据中心、模型、应用。他说 2025 年全球风投砸了超过 1000 亿美元,大部分钱流向了 AI 原生公司,重点在应用层和基建层。他举了个具体例子:美国护士缺口大概 500 万,AI 可以先把病历记录和转录这类活接过去。对从业者来说,他传递的信号是瓶颈不只在模型本身,整条基建和人力链...

推荐理由:这篇是黄仁勋在达沃斯的发言,不是产品发布或论文,所以分数不会给到顶。但他说的事够具体:1000 亿美金风投、五层栈结构、500 万护士缺口,而且把 AI 讨论从模型竞赛拽回基础设施和劳动力替代,对从业者有参考价值。我会先打个折,因为终究是高管讲话,不是可复现的结果,但信息量和切入角度都到位,80 分合理。

1月20日星期二

MIT Technology Review · AI

AI 代理即将陷入混乱,能救场的是数据,不是模型

一家中型公司跑 4000 个 AI 代理(让模型进业务流程干活的程序)是迟早的事,但大部分企业的数据基础根本接不住。BCG 的调查说,60% 的公司砸了大钱做 AI,收入却没怎么涨;而做得好的那批,收入增长是别人的 5 倍,成本多砍了 3 倍。差距不在模型多强,在于数据地基有没有打好。文章把代理出错的坑分成四块:模型本身、调用的工具、做决策需要的上下文...

推荐理由:这篇文章不是空谈,有 BCG 的调研数据撑腰,把 Agent 规模化后的混乱讲得很具体。我会先打个折:正文没披露 4000 个 Agent 这个数字是怎么算出来的,但四象限可靠性和数据债的论点对正在踩坑的 AI 团队有参考价值,所以推荐给关注企业级 Agent 落地的人看。

MIT Technology Review · AI

英国政府掏钱,让 AI 自己设计实验、自己跑流程

英国高级研究与发明署(ARIA)从 245 份提案里挑了 12 个项目,给每个团队约 50 万英镑(大概 67.5 万美元),让他们在九个月内做出能独立跑通“提假设—做实验—分析结果—再迭代”这套完整科研闭环的 AI 系统。ARIA 管这叫“AI 科学家”,说白了就是让大模型调用现有工具去干活,人类只负责定方向和监督。这次资助金额比 ARIA 平时给的...

推荐理由:英国 ARIA 这次不是撒概念,是真金白银选了 12 个团队做“AI 科学家”——系统要能自己提假设、设计实验、跑实验、分析结果再循环迭代。我会先打个折:目前获资助的项目主要还是调用现成工具,离全自动实验室还远。正文引了一项外部研究,说大模型代理跑完整科学流程的失败率有 75%,这点先别太激动。真正值得盯的是有没有团队做出可复现的实验闭环,而不是新闻稿里的热度。

1月19日星期一

Import AI

我的 AI 特工已经在干活了,你的呢?

Jack Clark 描述了他让多个研究型 AI 特工在他爬山、睡觉时替他读论文、交叉比对数据、生成分析报告的经历。这些活如果他自己干,每份报告得花一周,而特工们几小时就搞定了,读的论文还比他多。他还提到,让 Claude 帮他爬自己网站、做嵌入向量、搭本地搜索和图形界面,以前试了好几年都因为各种卡顿没做成,这次不到一小时全跑通了。正文没披露具体模型版...

推荐理由:Jack Clark 用自己走路睡觉时 agents 并行处理几千篇论文的例子,把 agent 从概念拉到了实操。可复现的机制是多代理检索、交叉核验和报告生成,但正文没披露模型版本、成本、失败率和评测数据,所以先别太激动。真正值得盯的是工作流摩擦已经低到可以忽略,AI 开始从单次问答转向持续代办,这点对从业者来说比任何 benchmark 都更有说服力。

1月16日星期五

阮一峰的网络日志

中国 AI 大模型领导者在想什么

阮一峰记录了1月10日北京一场闭门会上几位大模型负责人的发言。智谱唐杰说,对话式AI的范式基本到头了,下一步是让模型真正做事,他们把编程、智能体和推理能力整合在一起。阿里林俊旸坦言,美国可用的算力比国内大一到两个数量级,人家拿算力搞下一代研究,我们光交付就占掉绝大部分资源;他判断三到五年后全球最领先的AI公司是中国团队的概率只有20%。腾讯姚顺雨观察到...

推荐理由:这篇周刊摘录了一场闭门峰会的发言,把智谱、阿里 Qwen 和腾讯 AI 负责人对中国大模型路线的判断摆在一起。我会先打个折:它不是一手发布,是二手整理,所以分数没往更高走。但它的好处是给了具体数字和分歧点——唐杰押注 2025 年是 RLVR 爆发年,林俊旸押多模态基础智能体,姚顺雨强调企业愿意为强模型付 200 美元月费,林俊旸还给出中国团队 20% 概率诞生全球最领先 AI 公司。这些判断有可验证的时效,不是公关口径,对从业者判断方向有参考价值。

1月13日星期二

MIT Technology Review · AI

CES 2026 逛完,我理解了为什么中国科技公司这么乐观

今年 CES 来了超过 14.8 万人、4100 多家参展商,中国公司占了将近四分之一,在 AI 硬件和机器人区域尤其扎堆。作者临时决定去现场,结果发现中国厂商已经不只是“便宜量大”的路子——家用清洁机器人在美国市场把 Dyson 和 Shark 的份额抢得很凶,庭院设备也大多来自深圳,外观做得让人看不出是中国品牌。人形机器人展台围满了人,宇树甚至搭了...

推荐理由:这篇是 CES 现场观察,核心判断是:中国科技公司的乐观来自制造和供应链的迭代速度,不是单点技术突破。文章用 14.8 万参会者、4100 多家参展商、中国展商近四分之一这些数字撑住了场面感,也把联想 Qira、Nvidia Vera Rubin、AMD Helios 这些产品拉出来,说明竞争焦点正转向云端和混合 AI。我会先打个折:正文没给出货量、营收或订单数据,所以判断还停在趋势信号层面,但作为行业风向标,这篇值得一看。

1月12日星期一

Import AI

AI 版红皇后竞赛:让模型互相攻击,看谁活到最后

日本初创公司 Sakana 搞了个实验,让 GPT-4 mini 在 80 年代的老游戏 Core War 里互相厮杀、进化。他们用了一种叫 DRQ 的方法,让程序不断跟历代冠军对战,避免能力退化。结果很直观:单次生成的程序只能打赢 1.7% 的人类选手,但经过针对性进化后,这套程序能击败 89.1% 的人类选手,打平或击败的比例高达 96.3%。这相...

推荐理由:这是一条高信号密度的简报,不是一手发布,所以分数不会冲太高。H 落在‘AI 监管 AI’这个反直觉的框架上,K 落在 89.1% 和 ≤1% / <$10k 这些可测试的数字上,R 则同时踩中了自动化和治理的神经。

1月6日星期二

NVIDIA 博客

英伟达预告基于 Rubin 架构的 DGX SuperPOD,单柜 260TB/s 带宽,推理成本号称能降 10 倍

英伟达在博客里公布了下一代 DGX SuperPOD 的规划,核心是换装 Rubin GPU。今年下半年会先出两款机型:DGX Vera Rubin NVL72 和 DGX Rubin NVL8。一个 SuperPOD 可以把 8 台 NVL72 拼在一起,总共塞进 576 颗 Rubin GPU,FP4 算力 28.8 exaflops,总显存 60...

推荐理由:这是一份有硬数字的NVIDIA基础设施路线图:576颗Rubin GPU、28.8 exaflops FP4、600TB内存、260TB/s NVLink,以及推理token成本最多降10倍。HKR三项都站得住,但本质上还是厂商路线图预告,不是已发货的产品或大规模公开发布,所以我会先打个折,重要性给到81。

NVIDIA 博客

NVIDIA 的 DRIVE AV 软件将首发搭载于新款奔驰 CLA

新款奔驰 CLA 会成为美国市场第一辆用上 NVIDIA DRIVE AV 的量产车,今年底交付。这套系统是双架构设计:核心驾驶决策靠一个端到端 AI 模型,同时外面包了一层基于 Halos 的传统安全校验模块,用来兜底。功能上支持点到点辅助驾驶、城市道路导航、主动避撞和自动泊车,后续还能 OTA 升级。不过,博客里没提这套系统要加多少钱、用了哪些传感...

推荐理由:我会先打个折:正文没披露传感器配置、具体价格和 ODD,所以没法判断这套系统到底多能打。但亮点在于量产时间给了,双栈设计把端到端驾驶和传统安全冗余绑在一起,不是纯 demo。对从业者来说,这是看端到端方案能不能过车规安全关的一个真实样本,所以放在 featured 低位。

NVIDIA 博客

NVIDIA 一口气开源了一堆模型、数据和工具,覆盖智能体、机器人、自动驾驶和生物医药

NVIDIA 在 2026 年 1 月 5 日放出了一批新的开源模型和数据集。语言模型方面,有 Nemotron 系列的新成员,专门做语音、外挂资料库(RAG)和安全对齐;还有一个叫 Alpamayo 1 的模型,正文没具体说它擅长什么。物理 AI 这边,Cosmos 系列更新了 Reason 2、Transfer 2.5 和 Predict 2.5 ...

推荐理由:NVIDIA 这次不是发一篇通稿,而是把 Nemotron、Cosmos、GR00T、Clara 几条线的模型、数据集和工具一起开源了。我会先打个折:所有信息都来自厂商自己,没有第三方验证,实际可用性还得看后续社区反馈。但光看披露的数字——10 万亿 token 文本、50 万条机器人轨迹、100TB 车载数据、45.5 万个蛋白结构——规模确实够大,而且覆盖了代理、物理 AI、自动驾驶和生命科学几个热门方向。具体到模型,Nemotron Speech 做语音、Cosmos Reason 2 做推理、GR00T N1.6 做人形机器人、Alpama...

1月5日星期一

Import AI

Meta 用 GPT、Claude 和 Llama 自动写底层算子,开发时间从几周缩到几小时,部分性能比 PyTorch 基线快 17 倍

Meta 公开了一套叫 KernelEvolve 的系统,专门自动生成和优化 AI 底层算子(kernel),用来在自家不同芯片上跑推荐模型、服务广告。它会接收需求,然后调用内部和外部的大模型(Llama、GPT、Claude)生成候选算子,通过验证后把好的结果存进知识库,让后续生成越来越准。Meta 说这套系统把新算子的开发时间从几周压到了几小时,生...

推荐理由:我会先打个折:这是 newsletter 对技术工作的转述,不是一篇独立论文,所以停在 80 分。但 HKR 三项都站得住——让模型写算子这件事本身就新鲜,数字和流程交代得够具体,去中心化训练那条线又直接碰到算力成本和权力集中的神经。正文说去中心化训练按每年 20 倍在涨,但跟前沿训练还差约 1000 倍,这点先别太激动,差距能不能继续缩小才是政策影响的关键。

1月1日星期四

36 氪 · 直链

月之暗面融了5亿美金,账上趴着100亿,杨植麟说短期不上市

月之暗面在2025年最后一天宣布完成5亿美元融资,投后估值43亿美元,IDG领投,阿里、腾讯、高榕、今日资本等老股东超额跟投。创始人杨植麟发内部信说公司现金超过100亿元,短期不着急上市。2025年他们主动停掉烧钱投流,砍了多个C端产品,把重心转向开源和海外。7月开源的K2模型一周内冲上OpenRouter全球趋势榜第二,海外付费用户月均环比增长超17...

推荐理由:月之暗面是国内一线模型公司,新融资加运营数据本身就值得关注。HKR 三项全中:战略转向有信号、财务和收入数字够硬、话题踩中行业焦虑点。但本质还是融资和业务动态,不是重大模型或产品发布,所以留在 featured 不升 tier。

2025年12月9日星期二

Mistral AI

Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

Mistral AI 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

推荐理由:原文给出 Devstral 2 的 SWE-bench 成绩、开源许可与部署门槛,可据此判断开源编码模型的落地成本。

2025年10月24日星期五

Mistral AI

Mistral AI 发布 Mistral AI Studio 生产平台

Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。

推荐理由:原文给出企业级 AI 生产化的三大支柱与私有 beta 入口,可据此判断其与现有 MLOps 工具的差异。

2025年10月21日星期二

OpenAI News

OpenAI 发布 ChatGPT Atlas 浏览器,把 ChatGPT 直接嵌进浏览器里

OpenAI 在 2025 年 10 月 21 日推出了 ChatGPT Atlas,一个把 ChatGPT 内置在核心的浏览器,目前 macOS 版全球上线,免费、Plus、Pro 和 Go 用户都能用。Atlas 让 ChatGPT 能跟着你浏览网页,看懂你当前在看什么,不用复制粘贴就能回答问题或帮你干活。它还能记住你浏览过的网站内容(叫“浏览器记...

推荐理由:OpenAI 把 ChatGPT 做成一个独立浏览器,而不是继续在别人浏览器里当插件,这是分发层面的动作,不是日常功能更新,所以给到 88 分、p1。HKR 三项全中:钩子够新,不是又一个模型升级;信息量扎实,上线范围、付费策略、隐私开关都给了;从业者会盯着它怎么用浏览器记忆和页面可见性控制来卡位,这点先别太激动,但确实值得盯。

2025年10月6日星期一

OpenAI News

OpenAI 的 Codex 编程助手正式上线,新增 Slack 集成、SDK 和管理后台

OpenAI 在 10 月 6 日宣布 Codex 结束预览、进入正式可用阶段。这次主要加了三个东西:一是能在 Slack 频道里直接 @Codex 派活,像喊同事帮忙一样;二是放出了 Codex SDK,让你把驱动命令行版 Codex 的那个智能体嵌进自己的工具或流程里,官方说配合 GPT‑5‑Codex 模型不用额外调优就能用;三是给企业管理员上了...

推荐理由:OpenAI 把 Codex 从预览推到正式版,顺手加了 Slack 集成、SDK 和管理员控制,这比发个模型补丁重得多。我会先打个折:正文没披露云端任务的具体价格,这点先别太激动。但用量数据摆在那里,10 倍增长和 40 万亿 token 说明调用量是真金白银在跑。更值得盯的是内部数据——工程师全上、PR 合并效率提 70%,这是企业买单前最想看到的验证。整体看,这不是一次功能更新,是编码助手开始抢工作流入口和团队席位的明确动作。

OpenAI News

ChatGPT 里能直接调用 Booking、Canva 这些 App 了,OpenAI 还发了套开源 SDK 让开发者自己做

OpenAI 在 10 月 6 号给 ChatGPT 加了个新功能:你可以在聊天里直接喊 App 出来干活,比如让 Spotify 帮你排歌单,或者让 Zillow 在地图上筛房源。首批上线的有 Booking.com、Canva、Coursera、Expedia、Figma、Spotify 和 Zillow 这七家,后面还有 11 家会在年内跟上。目...

推荐理由:OpenAI 给 ChatGPT 装了个应用层,同时把开发工具包开源出来,等于把聊天界面升级成一个小型应用商店。我会先打个折:覆盖范围排除了欧洲经济区、瑞士和英国,应用怎么审核、怎么分成正文都没说,所以商业闭环还不完整。但首批 7 家合作方已经上线,年内还要再上 11 家,SDK 走的是 MCP 协议,开发者能直接触达 OpenAI 自称的 8 亿多用户,这对做工具和 agent 的团队是个实打实的信号。

OpenAI News

OpenAI 发布 AgentKit:一套工具把智能体开发、评测和微调打包在一起

OpenAI 在 10 月 6 日推出了 AgentKit,把做智能体需要的三块拼图拼到了一起:Agent Builder 是个画布,拖拽节点就能搭多智能体流程,支持版本管理和安全护栏;ChatKit 让你把对话界面嵌进自家产品,省掉两周前端开发时间;Connector Registry 统一管理 Dropbox、Google Drive、ShareP...

推荐理由:这次发布对 agent 开发者来说信息量挺大,Agent Builder、Connector Registry、ChatKit 三个组件都给了具体机制。Evals 那边 trace grading 和自动提示优化是实打实的新能力,第三方模型支持也扩大了适用范围。但标题里提到的 RFT,正文截出来的部分完全没讲训练怎么搞、多少钱、哪些人能先用,这点先别太激动。整体够重磅,但缺关键细节,所以给 84 分而不是顶格。

2025年9月29日星期一

OpenAI News

OpenAI 给 ChatGPT 加了家长控制,能管孩子用 AI 的时间和功能

OpenAI 在 9 月 29 日上线了家长控制功能,所有 ChatGPT 用户都能用。家长把自己的账号和孩子的绑定后,就能在自己的账号里管理孩子的使用设置。绑定后的青少年账号默认会加强内容过滤,减少暴力、色情角色扮演和极端审美之类的内容。家长还可以单独设置禁用时段、关掉语音模式、关掉记忆功能、禁止图片生成,以及拒绝把孩子的对话拿去训练模型。比较关键的...

推荐理由:OpenAI 把家长控制推给了所有 ChatGPT 用户,但真正值得看的是自残风险上报链路:系统检测到风险后,先由人工小组复核,确认是急性痛苦状态再通过邮件、短信和推送通知家长。这不是一个简单的设置面板,而是一套带人工介入的安全流程。我会先打个折,因为这次没有模型层面的变动,属于产品安全更新,但信息量够实,流程也说得清楚。

OpenAI News

ChatGPT 开始内嵌购物功能,先拿 Etsy 试水,并开源了一套让 AI 帮你下单的协议

OpenAI 在 9 月 29 日给 ChatGPT 加了个“即时结账”功能,美国 Plus、Pro 和免费用户现在能在聊天界面里直接买 Etsy 卖家的东西,目前只支持单件购买。Shopify 上像 Glossier、SKIMS 等一百多万商家之后也会接入。ChatGPT 每周有超过 7 亿人用,这次它不只是推荐商品,而是直接充当“数字导购”帮你完成...

推荐理由:OpenAI 让 ChatGPT 能直接结账,不是小功能补丁,是产品边界的一次硬扩张。我会先打个折:目前只覆盖美国用户和美国 Etsy 卖家,单件下单,规模还小。但真正值得盯的是它和 Stripe 一起推的开源 Agentic Commerce Protocol——商家最少一行代码就能接入,等于在铺结算管道。商品排序说按相关性自然展示,商家付小额成交费,但费率正文没披露,这点先别太激动。整体看,从聊天到成交的链路打通了,对从业者来说,这意味着模型开始进交易流干活,而不只是回话。

2025年9月25日星期四

OpenAI News

ChatGPT 企业版上线共享项目,团队能一起调教同一个 AI 了

OpenAI 给付费的 Business、Enterprise 和 Edu 用户推了个共享项目功能。简单说,就是团队可以建一个项目空间,把文件、指令都扔进去,所有成员跟 ChatGPT 聊天时,它都会基于这个共享的上下文来回答,不用每次都重新解释背景。创建者能通过邮件或链接拉人,权限分两档:只能看和聊,或者还能改指令、传文件。项目有自己的独立记忆,敏感...

推荐理由:我会先打个折,这不是模型发布,是协作层的产品更新。共享项目、8 个连接器、按提示自动路由连接器,这三件事合在一起,让 ChatGPT 从单人对话框往团队工作流里又挤了一步。权限和记忆的设计看得出在认真做企业控制,但正文没披露自动选择连接器的准确率和延迟,这点先别太激动。整体是扎实的迭代,不是概念车。

OpenAI News

ChatGPT Pulse 预览:让模型主动推消息,每天一次

OpenAI 给 Pro 用户上了个移动端新功能 Pulse,ChatGPT 不再等你问,而是每天主动推一版个性化信息卡片。它会翻你的聊天记录、记忆和反馈,还能选接 Gmail 和 Google 日历(默认关着),晚上做功课,早上把结果推给你。你可以点赞点踩、直接告诉它明天想看什么,所有输出会过一道安全检查。正文没提用了哪个模型、会不会涨价、Plus ...

推荐理由:我会先打个折:正文没提模型有没有换、Pro 之外怎么收费、Plus 什么时候上,所以别当完整发布看。但亮点是交互逻辑变了——从你问它答,变成它每天主动塞一张卡片给你,信息源还能挂上你的邮箱和日历。如果是真的,省掉你每天手动去问“今天有什么我该知道的”,但前提是你敢把 Gmail 交出去。安全检查说做了,集成默认关着,这点先别太激动,等更多实测再说。

2025年9月24日星期三

OpenAI News

SAP 和 OpenAI 要在德国搞一个数据不出境的政府专用版 ChatGPT

OpenAI 和 SAP 宣布合作,计划 2026 年在德国推出一个专门给公共部门用的 AI 服务。这个服务会跑在 SAP 子公司 Delos Cloud 的微软 Azure 平台上,主打数据留在德国、符合当地法律和安全标准。SAP 打算把 Delos Cloud 的算力扩到 4000 块 GPU 来跑 AI 任务。公告里没提具体会用哪个模型、怎么收费...

推荐理由:这条我会先打个折:正文没写具体模型、价格和采购规模,所以没法判断性价比。但真正值得盯的是交付形态——不是通用发布,而是把 OpenAI 塞进德国政务流程里,用 Delos Cloud 解决数据不出境和合规问题。4000 块 GPU 的规模说明 SAP 是认真在铺基础设施,不是做个 demo。对关注主权云和政企 AI 落地的人,这个案例比普通合作公告有信息量。

2025年9月16日星期二

OpenAI News

OpenAI 在给 ChatGPT 加年龄预测,拿不准就默认当未成年人处理

OpenAI 正在开发一套年龄预测系统,用来判断用户是否满 18 岁。一旦系统判定用户未成年,会自动切到一个内容受限的青少年模式,比如屏蔽露骨的性内容,极端情况下还可能联系执法部门。如果系统拿不准年龄,宁可误判也会先按未成年人处理,成年人可以再通过验证解锁完整功能。月底前会上线家长控制,家长能关联孩子的账号、关掉记忆和聊天记录、设置禁用时段,孩子遇到严...

推荐理由:OpenAI 没在发一篇泛泛的安全声明,而是把年龄估算直接嵌进了 ChatGPT 的分流逻辑里。我会先打个折:正文没披露年龄预测的具体技术方案和准确率,这点先别太激动。但产品思路很明确——宁可误判也不漏判,低置信度默认走青少年版,成年人想回来得自证。家长控制那边,能关记忆和历史记录,等于给了监护人一把更实在的钥匙。整体看,这不是模型能力升级,是一次产品路由规则的调整,但牵动的隐私和合规神经够多,值得放进 featured。

2025年9月15日星期一

OpenAI News

OpenAI 把 GPT-5 调成了专门干活的编程助手 Codex,一个模型同时搞定聊天写码和长时间自主跑任务

OpenAI 发布了 GPT-5-Codex,并把它设为 Codex 云端任务和代码审查的默认模型。这个模型专门针对真实软件工程任务训练过,既能跟你快速交互式写代码,也能自己独立跑复杂任务,测试中最长连续干了超过 7 个小时。在 OpenAI 内部员工的使用数据里,对于 token 消耗最少的那 10% 的简单对话,GPT-5-Codex 比 GPT-...

推荐理由:OpenAI把GPT-5-Codex设为Codex云任务和代码审查的默认模型,给了几个硬数字:7小时自主执行、低端请求token省93.7%、高端请求耗时翻倍。这说明他们想把交互编程和长时代理执行揉在一起,但定价和完整可用性正文没披露,所以先别急着算账。

OpenAI News

OpenAI 发了 GPT-5-Codex 的系统卡补充说明,专门给写代码的 agent 用

这个模型是 GPT-5 的一个变体,针对 Codex 里的 agent 编程场景做了优化。训练时用了强化学习,让它在真实编程任务里学会写出更贴近人类风格和 PR 偏好的代码,还能自己跑测试直到通过。现在可以在终端、IDE、网页、GitHub 和 ChatGPT 手机 App 里用。安全方面,模型层面做了防有害任务和防提示注入的训练,产品层面加了沙盒和可...

推荐理由:HKR 三项都踩实了:OpenAI 把代理式编程铺到多个入口,训练和安全措施有具体交代,而且正好打在行业最关心的执行边界上。基准分数、价格和上下文窗口正文都没写,所以分数没往上拉,停在 84。

2025年9月12日星期五

OpenAI News

OpenAI 跟美英安全机构合作,给 ChatGPT Agent 抓出两个新漏洞,一天内修好

OpenAI 公开了他们与美国 CAISI、英国 UK AISI 的合作进展。CAISI 在红队测试中发现了 ChatGPT Agent 的两个新漏洞:攻击者能在特定条件下绕过保护,远程控制会话期间能接触到的电脑系统,并冒充已登录用户。CAISI 把传统网络漏洞和 AI 劫持攻击串在一起,做出一条概念验证攻击链,成功率大约 50%。OpenAI 在接到...

推荐理由:这篇不是安全公关稿。OpenAI 自己说 ChatGPT Agent 被美国 CAISI 和英国 AISI 红队测出两个新漏洞,CAISI 的概念验证攻击成功率大概一半,OpenAI 一个工作日就修了。我会先打个折:英国 AISI 那部分正文被截断了,GPT-5 生物滥用防护的测试结果没披露,所以整体影响面还不清楚。但就凭 Agent 远程会话控制这个风险点,从业者会想看一眼。