跳到正文

#MCP/工具调用

今日 5 条

3月17日星期二

OpenAI News

OpenAI 发了 GPT-5.4 mini 和 nano,主打编程和子任务,mini 跑得比 GPT-5 mini 快一倍多

OpenAI 在 3 月 17 号推出了 GPT-5.4 mini 和 nano,都是给高吞吐、低延迟场景用的轻量模型。mini 在编程、推理、看图、调工具上都比上一代 GPT-5 mini 强,速度还快了一倍多。跑分上,mini 在 SWE-Bench Pro 拿到 54.4%,跟大哥 GPT-5.4 的 57.7% 差距不大,但延迟低很多,适合需要...

推荐理由:这是 OpenAI 官方模型发布,不是小修小补。我会先打个折:虽然叫 GPT-5.4 mini,但别当它是 GPT-5.4 的完整缩小版,更像是一个专攻编码和子代理任务的轻量选手。真正值得盯的是它用更低价格和更快速度,把 SWE-Bench Pro 拉到 54.4%,离大模型只差 3.3 个百分点——这点先别太激动,正文没披露其他基准的对比,不知道通用能力缩水多少。nano 更极端,只走 API,价格压到输入 0.20 美元,明显是给大批量、简单任务准备的。整体看,OpenAI 在推‘够用且便宜’的代理专用模型,对频繁调用代码工具的场景挺省钱。

MIT Technology Review · AI

OpenAI 的技术可能出现在伊朗冲突的哪些环节

OpenAI 跟五角大楼签了涉密协议刚过两周,MIT Technology Review 就划出了三个可能用到它家技术的场景。一是目标排序:分析师把潜在目标清单丢给模型,让它结合后勤、情报等数据排出优先打击顺序,但正文没解释人工复核到底怎么提速。二是反无人机分析:OpenAI 之前跟 Anduril 合作,用模型做实时威胁识别和拦截建议,不过两家都没更...

推荐理由:MIT Technology Review 把 OpenAI 的涉密国防合作往伊朗冲突上套,列出目标排序、反无人机分析和行政支持三个可能落点。我会先打个折:文章没给出部署时间表,也没实锤任何战场使用,所以判断要收着点。但选题本身踩在军事 AI 的敏感线上,加上 OpenAI 刚进涉密圈,这个时间点发出来,话题性够强。

3月16日星期一

MIT Technology Review · AI

AI 智能体刚学会跑,企业的管理手段还没跟上

2025年底到2026年初,无代码工具和开源个人助手 OpenClaw 出现,让生成式 AI 从爬直接变成了跑。加州 AB 316 法案在 2026 年 1 月 1 日生效,企业不能再把责任推给 AI 说“是它干的,我没批准”。IDC 受 Data Robot 委托的调查显示,96% 的生成式 AI 部署和 92% 的智能体部署都超了预算。真正的麻烦在...

推荐理由:这篇不是产品发布,而是用数据说话的评论。AB 316 把法律责任钉死了,IDC 和 Data Robot 的调查又说明成本失控是普遍现象,不是个案。文章没画大饼,反而把治理跟不上自治速度的风险摊开讲,对正在落地 agent 的团队有直接参考价值。

3月11日星期三

MIT Technology Review · AI

中国 OpenClaw 热潮催生了一门帮人装“龙虾”的生意

北京工程师 Feng Qingyang 一月份开始帮人安装 OpenClaw(一个能接管设备自主干活的开源 AI 工具),到二月底辞职,现在团队超过 100 人,已经接了 7000 单,每单约 248 元人民币。淘宝和京东上现在有几百个相关商品,价格从 100 到 700 元不等。这波热潮的核心不是技术本身,而是安装门槛高、数据隔离有风险,把开源工具变...

推荐理由:这篇不是产品发布稿,是扎实的现场观察。一个副业变百人团队的故事有传播力,市场定价和订单量给了硬数字,数据隔离风险又让行业里的人不得不重视。我会先打个折:正文没披露团队构成和 7000 单的统计口径,但整体信息密度够高,值得放在精选位。

OpenAI News

OpenAI 给 Responses API 加了个电脑环境,让模型能自己敲命令行干活

OpenAI 在 2026 年 3 月 11 日说,他们的 Responses API 现在能调用一个 shell 工具,在托管的隔离容器里执行命令。模型(GPT-5.2 及之后版本)会自己提议该敲什么命令,API 负责在后台跑、把结果流式传回来,还能同时开多个会话并行处理。容器里带了文件系统、可选的 SQLite 和受限的网络访问。这相当于给模型配了...

推荐理由:这次更新把 Responses API 从“调工具”升级成“给模型一台隔离电脑”,shell 执行、流式输出、并行跑命令、上下文压缩都实装了,对 agent 开发者是实打实的新能力。正文后半段截断,定价、配额和完整安全边界都没写,所以实际落地成本和安全兜底还得等后续披露。

3月10日星期二

NVIDIA 博客

NVIDIA 和 Thinking Machines Lab 签了份长期大单,起步就是 1 吉瓦的算力

NVIDIA 和 Thinking Machines Lab 宣布了一项多年合作,核心是部署至少 1 吉瓦的 NVIDIA Vera Rubin 系统,目标明年年初上线,用来训练前沿模型和搭建可定制的 AI 平台。1 吉瓦这个数字很夸张,相当于一个大型核电站的发电量,说明这不是普通的云服务采购,而是直接锁定了一整座“算力电厂”的产能。合作还涉及基于 N...

推荐理由:1 吉瓦 Vera Rubin 承诺把这条合作从普通公关稿里拎了出来:H 靠规模,K 靠具名系统和部署时间,R 靠前沿算力竞争。没给 P1 是因为来源是厂商博客,投资金额、算力归属、分阶段细节正文都没披露,我会先打个折。

OpenAI News

ChatGPT 上线数学和科学互动图解,覆盖 70 多个核心概念

OpenAI 给 ChatGPT 加了一个学习功能:问勾股定理、理想气体方程这类问题时,它会直接弹出一个可拖拽的图表模块。你可以手动调参数、改公式,图表会跟着实时变,把抽象公式变成能上手试的东西。首批覆盖 70 多个数学和科学概念,所有付费和免费用户都能用。官方说每周有 1.4 亿人用 ChatGPT 学数学和科学,但正文没披露这个互动功能背后的模型、...

推荐理由:我会先打个折:这是个中等体量的产品更新,不是模型能力突破。钩子在于把抽象概念变成能动手玩的画面,对教学场景有直接吸引力。1.4 亿周活和 70+ 概念是实打实的数字,说明铺量已经很大。但正文完全没提模型怎么支撑这些交互、有没有做过学习效果验证,这点先别太激动。整体判断是产品化动作值得关注,技术深度和效果证据还缺位。

3月9日星期一

MIT Technology Review · AI

AI 正把伊朗冲突变成一场实时观战秀

作者一周内看了十几个伊朗战争仪表盘,它们把卫星图、船舶追踪、AI 摘要和赌盘链接拼在一起,把战争变成了可以边吃爆米花边看的实时界面。一个由 a16z 员工搭建的仪表盘直接接入了 Kalshi 的下注数据,而调查记者 Craig Silverman 已经记录了 20 个类似的工具。问题出在信息质量上:英国《金融时报》报道过 AI 生成的虚假卫星图正在网上...

推荐理由:我会先打个折:这不是产品发布或模型突破,而是一篇有事实支撑的评论。H 靠战争面板加博彩这个钩子立住了,K 靠具体案例和数字撑起来,R 打中了从业者对 AI 信息质量和伦理的敏感神经。文章没给解决方案,但把问题摆得很清楚,所以放在 featured 合适。

OpenAI News

OpenAI 宣布收购 Promptfoo,要把安全测试直接做进 Frontier 平台

OpenAI 发公告说要收购做 AI 安全测试的 Promptfoo,交易完成后会把它的技术整合到企业级平台 Frontier 里。Promptfoo 的工具现在有超过四分之一的财富 500 强公司在用,主要帮开发者在模型上线前做安全评估和红队测试,比如检测提示词注入、越狱、数据泄露、工具滥用这些风险。收购后,OpenAI 打算把自动化安全测试、红队演...

推荐理由:这条消息我会先打个折,因为收购价格和时间表正文都没写,没法判断交易规模和落地节奏。但 OpenAI 把一家已有大客户基础的评测工具直接收进 Frontier,对做 agent 的团队来说是个强信号——以后安全测试和红队评估可能变成平台自带能力,不用再外挂工具。这点先别太激动,等更多细节出来再看。

3月7日星期六

彭博科技

甲骨文和 OpenAI 叫停了得州旗舰数据中心的扩建计划

双方谈崩了,不再一起扩建位于得州阿比林的那座旗舰 AI 数据中心。原因是融资进度拖后腿,加上 OpenAI 自己的需求变了。现在 Meta 在考虑从运营商 Crusoe 手里租下这个场地,英伟达也在中间帮忙牵线。这类项目的造价动辄上百亿美元,正文没披露具体的分手条款和后续时间表。

推荐理由:Oracle 和 OpenAI 在得州阿比林那个旗舰数据中心的扩建计划谈崩了,原因是融资没谈拢,加上 OpenAI 自己的需求也变了。Meta 正考虑从开发商 Crusoe 手里租下原本要扩建的那块地,Nvidia 在中间帮忙牵了线。项目总成本只说在几百亿美元级别,具体数字没披露。我会先打个折:这事说明超大集群先卡在资本结构和多方协同上,不是先卡在芯片,这点比标题本身更值得盯。

彭博科技

OpenAI 和甲骨文叫停了得州旗舰 AI 数据中心的扩建计划

OpenAI 和甲骨文决定不再扩建位于得克萨斯州的那个旗舰 AI 数据中心。原因是融资谈判拖得太久,加上 OpenAI 自己对算力的需求也变了。不过正文没披露这个设施的具体名字、目标容量、资本开支和调整后的时间表。我会先打个折,因为原文被 Bloomberg 的机器人验证墙挡住了,只能看到摘要片段,更多细节暂时拿不到。

推荐理由:Bloomberg 报道 OpenAI 和 Oracle 放弃了得州一个旗舰数据中心的扩建计划,原因是融资没谈拢,OpenAI 的算力需求也变了。我会先打个折:正文没披露具体是哪个数据中心、原定扩多大、投多少钱、时间表怎么改,所以没法判断影响量级。但这件事值得盯,因为它可能说明 OpenAI 在重新盘算自己到底需要多少自建算力,而不只是地产项目黄了。HKR 三项都踩中,信源权威性也够,只是信息缺口把分数压在 80 出头。

彭博科技

Oracle 和 OpenAI 叫停了德州旗舰数据中心扩建计划

双方不再推进原定在德州扩建的那个旗舰级 AI 数据中心。彭博的报道被付费墙挡住了,正文没披露这个项目的具体规模、预算和时间表。从 RSS 片段看,谈判卡在了融资安排上,同时 OpenAI 自己的算力需求也在重新评估。我会先打个折:这不一定代表 AI 算力投资整体降温,更像是一次具体的合作没谈拢,但融资摩擦和需求重估这两个信号值得留意。

推荐理由:Bloomberg 报的是实打实的基础设施转向,不是传闻。H 和 R 都站得住:合作突然终止本身就意外,而且它同时牵动算力供应和资本开支这两根神经,OpenAI 的需求到底怎么变,会直接影响上下游判断。K 我给得保守,因为文章没给出规模、金额、时间线,信息缺口太大,没法做更实的判断。

MIT Technology Review · AI

五角大楼能用 AI 监控美国人吗?法律还没跟上

五角大楼想用 Anthropic 的 Claude 去分析批量购买的美国人商业数据,这件事引爆了公开争吵。核心矛盾在于:政府可以合法从数据市场买到你的手机位置、网页浏览记录,而现行法律大多不禁止把这些数据喂给 AI 做聚合和画像。法律教授指出,普通人觉得是监控的行为,在法律上可能根本不算搜查。OpenAI 后来修改了与国防部的合同,写明不用于国内监控,...

推荐理由:这篇直接给了一个具体冲突:五角大楼想用 Claude 分析商业数据,Anthropic 公开反对,OpenAI 随后改合同禁止境内监视。信息量够,但我会先打个折——OpenAI 新合同全文没公开,技术上的 safety stack 怎么落地正文也没说,所以重要性停在 79 是合理的。对从业者来说,真正值得盯的不是声明,是合同红线到底能不能约束国防部。

彭博科技

OpenAI 放出一个安全工具的研究预览版,让 AI 自己去数据库里找漏洞、打补丁

OpenAI 发了一个给安全团队用的 AI agent 研究预览版,主要用途是扫描大型数据库里的漏洞并自动修补。目前公开信息很少——正文没披露具体模型名、支持哪些数据库、怎么收费、什么时候正式上线。我会先打个折:这还是个研究预览,离生产环境能用还有距离,别看到“agent”就觉得能直接上岗。

推荐理由:我会先打个折:这还是个研究预览,离生产环境有距离。但 OpenAI 把代理放进安全流程里,不是再发一个聊天机器人,这个动作本身就值得盯。正文没披露模型、覆盖范围、定价和上线时间,所以别急着激动。真正让人在意的是它试图让 AI 直接碰漏洞修补,这会牵出责任、误报、权限控制一连串问题,企业安全团队不可能不关注。

彭博科技

Anthropic 要学亚马逊开 AI 软件商店,让企业客户在它的平台上买第三方工具

Anthropic 正在搞一个类似亚马逊的 AI 软件市场,企业客户可以直接在上面买第三方开发的软件,不再只卖自家模型。这步棋说明它想从卖模型转向做渠道分发。不过正文被 Bloomberg 的机器人验证挡住了,具体上线时间、抽成比例、首批上架哪些软件都没披露。另外文章提到公司正因五角大楼的合作争议面临业务不确定性,这个背景可能跟它急着铺渠道有关。

推荐理由:我会先打个折:上线时间、抽成、具体卖什么软件,正文全没给,所以别当马上落地的产品看。但方向值得盯——Anthropic 从卖模型转向做企业软件分发,等于在学亚马逊搭应用商店。这点先别太激动,因为没披露的东西太多,可它发生在跟 Pentagon 对峙带来业务不确定的节骨眼上,渠道动作本身就说明它在找模型销售之外的收入支点。

3月6日星期五

阮一峰的网络日志

科技爱好者周刊(第 387 期):你是领先的

阮一峰算了笔账:全球81亿人里,只有13.8亿人用过AI,占16%;付费订阅AI服务的只有1500万到2500万人,占0.3%;真正用AI生成过自己编程项目的人,更是只有200万到500万,占0.04%。如果你已经在关注AI动态、用AI写代码,其实已经跑赢了99%的人。文章还聊了最近爆火的个人AI助手OpenClaw,它四个月就在GitHub拿了25万...

推荐理由:阮一峰这期周刊用几组数字把“人人都在用 AI”的错觉拉回现实。我会先打个折:16% 的用过比例、0.3% 的付费比例和 0.04% 的编程使用比例,原文没交代数据出处,所以不能当精确统计用,但方向是对的——采用率断层比刷屏的新闻更有参考价值。对从业者来说,这篇的价值不在技术深度,而在提醒你盯紧真实渗透率,别被舆论带偏。

3月5日星期四

OpenAI News

OpenAI 把 ChatGPT 塞进 Excel 了,还接上了 Moody's、Factiva 等金融数据源

OpenAI 在 2026 年 3 月 5 日发布了 ChatGPT for Excel 的测试版,相当于在 Excel 里直接装了一个 GPT-5.4 助手。你可以用大白话让它帮你搭财务模型、跑情景分析、查公式错误,它改表之前会先问你,改完还能告诉你改了哪个格子、为什么。OpenAI 自己跑了一遍投行工作流测试,GPT-5 的正确率是 43.7%,换...

推荐理由:OpenAI 把 ChatGPT 塞进 Excel 测试版,不只是加个聊天框,而是让模型能直接在单元格里建模、追溯改动,还接入了 Moody's、道琼斯 Factiva、MSCI 等金融数据源。内部投行场景的基准分从 43.7% 跳到 87.3%,幅度很大,但这是内部测试,实际表现得等用户上手再看。企业版和教育版默认关闭,说明对合规和隐私留了后路。FactSet 标注“即将上线”,数据生态还在铺。整体看,这是 OpenAI 在抢专业工作流入口的一次重注,比单纯发个模型更有战略意味。

3月3日星期二

OpenAI News

GPT-5.3 Instant 发布:少说废话、少拒绝,日常对话更干脆

OpenAI 在 2026 年 3 月 3 日更新了 ChatGPT 里用得最多的模型,叫 GPT-5.3 Instant。这次改动主要冲着日常对话体验去的:模型不再动不动就拒绝回答,也不会在回答前先啰嗦一堆免责声明。文章给了一个具体对比——问远程射箭弹道计算,旧版 GPT-5.2 Instant 直接拒绝,说这能提高武器效能所以不能帮;新版 GPT-...

推荐理由:OpenAI 更新了 ChatGPT 最常用的日常模型,这篇帖子靠一个具体的 5.2 vs 5.3 行为对比把安全边界的变化讲清楚了,所以 HKR 三项都站得住。我会先打个折:正文没给系统卡、基准分、API 价格,信息缺口明显,所以重要性停在 84 不进 85。

2月27日星期五

MIT Technology Review · AI

AI 正在改写世界顶级围棋手的思考方式

AlphaGo 击败李世石十年后,AI 已经成为韩国职业围棋训练的标配,不用 AI 基本没法打职业。文章给了两个数:世界第一的申真谞落子与 AI 建议的重合率是 37.5%,而选手平均水平是 28.5%;另外 AlphaGo Zero 从零自学三天后,以 100 比 0 碾压了战胜李世石的那版 AlphaGo。现在棋手普遍用 KataGo 练棋,开局前...

推荐理由:这篇不是新模型发布或产品动作,而是一篇有数据的观察评论。我会先打个折:它没有给出可复现的方法或工程细节,但把 AI 如何渗入职业围棋训练这件事讲得很具体。申真谞 37.5% 的一致率比全体均值高出 9 个百分点,说明顶尖棋手更依赖 AI 选点;AlphaGo Zero 三天 100 比 0 的结果则把自我对弈的效率差距摆了出来。正文提到棋手常用 KataGo 且前 50 手常与 AI 建议一致,但又说他们仍难解释 AI 为什么这么下——这个信息缺口反而让判断更扎实,没有硬补因果。对从业者来说,这比泛泛谈“AI 改变行业”更有参考价值,所以放在 fe...

OpenAI News

OpenAI 与亚马逊达成战略合作,AWS 成为 OpenAI 企业级产品的独家第三方云分发渠道

OpenAI 和亚马逊宣布了一项多年合作,亚马逊将向 OpenAI 投资 500 亿美元,其中 150 亿先到账,剩下 350 亿要满足特定条件后才会支付。合作的核心看点有两个:一是分发渠道,AWS 成为 OpenAI Frontier(一个让企业搭建、部署、管理 AI 智能体团队的平台)的独家第三方云分发商;二是算力绑定,OpenAI 承诺在 AWS...

推荐理由:这不是一篇常规的合作通稿。分阶段 500 亿投资、Bedrock 上线 OpenAI 模型运行时、再加约 2 吉瓦 Trainium 算力消耗,这三件事合在一起,把 OpenAI 的分发和算力姿势都改了。HKR 三项全中,所以放在 P1。

36 氪 · 直链

抖音把资讯交给AI:长文上限提到8000字,AI写的新闻摘要也要进信息流了

抖音在2025年底正式上线了长图文功能,字数从内测时的4000字放宽到8000字,目前只能在网页端发布。内容多是深度故事、社会新闻这类非即时性的东西。同时,抖音热点频道里多了个“AI智选资讯”,AI会实时抓取全网热点,自动生成新闻摘要和总结。内部人士说,这些AI资讯很快会进入抖音的信息流,跟原创长文抢同一批流量。字节的思路很明确:用AI把内容生产成本打...

推荐理由:抖音把长文和 AI 资讯塞进同一个流量池,但正文没交代推荐权重、版权怎么谈、事实错了谁兜底。我会先打个折:功能上线是真的,可责任边界没画清楚之前,别急着把它当内容生态升级。

阮一峰的网络日志

当外卖员接入 AI:程序开始直接调动人力了

Waymo 无人出租车乘客下车后没关好门,车就走不了。这家公司没做远程关门功能,而是在外卖平台下单,花 6.25 美元叫小哥跑一公里去关门,完事再加 5 美元。新闻点不是关门本身,而是程序在自动调动人力完成自己搞不定的环节。外卖员自带 API,已经接入了软件系统,成了可以被程序随时调用的“自动化人力”。这件事说明,AI 模型一旦跟人力打通,就不只是操作...

推荐理由:这不是一手爆料,但 6.25+5 美元这个案例把“人变成 API”这件事讲得很实在。HKR 三项都踩中了,分数留在 featured 的低位,因为正文是评论,Waymo 的系统规模、调用频率和正式产品方案都没披露,判断先别拉满。

2月26日星期四

纽约时报中文网

美国在 AI 上“输”给中国的不是模型,是工厂

这篇文章的核心判断是:中国把 AI 用进了工厂车间,美国还在把 AI 当实验室项目。中国已建成 3 万多家智能工厂,2024 年全球新装的工业机器人超过一半进了中国工厂。极氪宁波工厂用了 800 多台机器人,小米北京工厂每 76 秒就能产一辆车,美的荆州工厂用 AI 把产线响应时间从几小时压到几秒。这些 AI 不是写诗画画,而是做视觉质检、生产调度和预...

推荐理由:这篇不是讲模型,是讲工厂里机器人、调度和质检的落地差距。我会先打个折:正文没披露3万多家智能工厂的具体认定标准,也没说美国18%这个数字的样本来源,所以数据力度要留个心眼。但极氪800多台机器人、小米76秒节拍这些车间数字是实的,对比美国三分之二试点推不向量产,差距感很直观。对看产线落地的人,这篇比模型跑分更有参考价值。

OpenAI News

OpenAI Codex 和 Figma 打通了代码与设计稿的来回转换

OpenAI 和 Figma 在 2026 年 2 月 26 日发布了一项新集成:在 Codex 桌面端里,你可以直接把代码转成 Figma 里能编辑的设计稿,也能把 Figma Design、Figma Make 和 FigJam 里的内容拉回代码里继续开发。这个来回转换的流程靠 Figma MCP Server 实现,走的是 MCP 协议,相当于给...

推荐理由:OpenAI 和 Figma 搞了个 Codex 集成,代码能直接生成可编辑的 Figma 设计,反过来 Figma 里的设计、Make 原型和 FigJam 白板也能回写成代码。底层走的是 MCP,通过 Figma MCP Server 接进 Codex 桌面应用。OpenAI 说 Codex 周活已经过百万,年初到现在用量涨了四倍多。我会先打个折,因为正文没披露支持哪些模型、权限怎么划、收不收费、双向转换稳不稳定——这些才是实际落地要盯的。

2月20日星期五

Hugging Face 博客

GGML 和 llama.cpp 团队加入 Hugging Face,本地跑大模型的项目会继续独立运营

Hugging Face 宣布 GGML 和 llama.cpp 的团队正式加入公司。Georgi Gerganov 和他的团队会继续把全部时间花在维护 llama.cpp 上,项目的技术方向和社区管理保持完全独立,不会变成闭源。这次合作最实际的变化是,他们会把 transformers 库里的模型定义更顺滑地接到 llama.cpp 里,目标是做到近...

推荐理由:我会先打个折:正文只说了团队加入和方向,没给时间表、团队规模和商业条款,所以别当成交割日来看。但这件事确实值得盯——HF 把 GGML/llama.cpp 团队收进来,等于把本地推理最核心的工程力量绑定了,同时承诺保持 100% 开源和社区自主。真正有意思的是技术对接:如果 transformers 的模型定义能一键落到 llama.cpp,对开发者来说省掉一大截适配工作。这点先别太激动,等他们真把“单击发布”做出来再说。

MIT Technology Review · AI

微软提了一套新方案,想让你分清网上哪些是真东西、哪些是 AI 生成的

微软评估了 60 种来源追踪、水印和指纹技术的组合,给 MIT Technology Review 发了一份蓝图,想给 AI 处理过的内容打标签。这套方案只标内容从哪来、有没有被改过,不判断真假。但一次审计发现,测试帖子里只有 30% 被正确标记,所以真正的麻烦是平台愿不愿意用、能不能用对。微软首席科学官说这是“自我监管”,但没承诺自家产品会照做。

推荐理由:HKR 三项都成立。钩子把问题讲得很白,不是空谈信任;知识增量靠 60 种方案测试和 30% 正确率这两个具体数字撑住;相关性在于它点出了溯源标签能不能变成平台默认基建这个现实争议。留在 featured 不往上提,是因为这还只是一份技术蓝图和标准讨论,不是已经部署的产品或有约束力的规则。

2月15日星期日

Computing Life · 鸭哥

OpenClaw 为什么突然火了:把程序员才有的本地 AI 代理,塞进了你的聊天软件

OpenClaw 在 2026 年 1 月底爆火,不是因为它技术有多新,而是它把 Cursor 这类能读写文件、执行命令的本地编程代理,接入了 Slack、WhatsApp 和飞书,让非技术人员第一次用上了有记忆、能干活、会自我进化的 AI。文章拆解了它背后的三个关键设计:统一的上下文池让 AI 跨平台记住你的一切;基于文件的持久化记忆加上自动维护机制...

推荐理由:这篇不是新闻通稿,是个人拆解。它把 OpenClaw 为什么火、代价是什么、真正该抄的设计模式(统一入口、文件化记忆、可组合 skills)都讲清楚了。HKR 三项全中,两个硬数字撑住了判断,但因为属于个人分析而非官方发布或行业事件,所以放在 featured 这一档。

Computing Life · 鸭哥

OpenClaw 为什么爆火:把程序员才有的 AI 代理体验,塞进了你的聊天软件

OpenClaw 在 2026 年 1 月底突然爆火,一周内换了三次名字,中间还被一个叫 $CLAWD 的假币骗走了 1600 万美元。它火的原因和一年前的 DeepSeek 几乎一样:不是技术上碾压对手,而是把一小撮早期用户已经用惯的体验——让 AI 能读文件、跑命令、记住上下文、持续迭代干活——第一次通过 WhatsApp、Slack、飞书这些日常...

推荐理由:我会先打个折:正文截断了,没看到后续成功因素的具体细节,所以这不是一手发布或官方研究,更像一篇二手深挖。但它的价值在于把OpenClaw为什么火说清楚了——不是技术多牛,而是分发路径对路。它把Agent接进WhatsApp、Slack、Lark,让不写代码的人第一次用上能读写文件、执行命令、带记忆的本地代理。同时也没回避风险,12%恶意技能和公网裸奔控制台这两条,比一般公关稿实在。综合来看,78分、featured层级是合理的。

2月14日星期六

阮一峰的网络日志

字节 Seed 2.0 模型搭配 TRAE 工具,用 Skill 文件给 AI 编程加技能

阮一峰用字节刚发的 Seed 2.0 Code 模型和 TRAE 编程工具,跑了一个把 ASCII 字符画转成手绘风格图的网页应用,本地预览直接能用。Seed 2.0 是字节的通用基座模型,分 Pro、Lite、Mini 和 Code 四个版本,能处理文字、图片、视频等多种数据,也支持让模型调用外部工具。文章重点讲了 Skill 怎么用:把反复要写的提...

推荐理由:这篇文章不是官方通稿,而是一个能跟着跑的通路演示。H 和 K 都站得住,因为既有完整应用产出,又有模型矩阵和 Skill 机制的具体拆解。R 也成立,Skill 文件的设计直接踩中 coding agent 工作流复用的痛点。整体是强教程而非重大发布,所以重要性停在 75。

MIT Technology Review · AI

渐冻症夺走了这位音乐人的声音,AI 让他重新站上舞台唱歌

32 岁的 Patrick Darling 在确诊渐冻症两年后,用 AI 克隆了自己的歌声,2 月 11 日在伦敦重新和乐队一起演出。他的声音克隆不是用录音棚素材做的,而是从嘈杂的手机视频和厨房录音里拼出来的,ElevenLabs 的音乐工具花了大约六周调校。这件事的信号不在感人,在于门槛:ElevenLabs 把工具免费开放给因渐冻症等疾病失声的人,...

推荐理由:我会先打个折:这不是模型或产品大更新,而是一个应用案例。但案例本身够硬——ALS 患者用旧录音唱歌,不是概念演示,是真实上台。正文给了两个关键条件:10 分钟清晰语音和 6 周从噪音片段里抠出歌声,说明门槛和代价。ElevenLabs 把这个流程做成免费项目,但正文没披露底层模型细节,这点先别太激动。整体看,故事性强、有可复现信息、踩中声音权利话题,适合放低 featured。

2月12日星期四

Lex Fridman 播客

OpenClaw:那个爆火的 AI 代理,以及它背后的 Peter Steinberger

这期播客里,Lex Fridman 和 OpenClaw 的创建者 Peter Steinberger 聊了聊这个一夜爆红的开源 AI 代理。OpenClaw 在 GitHub 上已经拿到了超过 17.5 万颗星,它能接入 Telegram、WhatsApp、Signal 和 iMessage 这些聊天软件,用 Claude Opus 4.6 或 GP...

推荐理由:我会先打个折:这期播客更像一次现象级开源项目的快速围观,不是技术深潜。OpenClaw 的传播力来自它做了两件让人睡不着觉的事——自己过验证码、自己改代码,而且已经跑在大家日常用的聊天 App 里。18 万星标说明开发者用脚投票了,但正文没披露架构、评测方法和安全约束,所以别急着把它当生产级方案。真正值得盯的是系统级权限和自修改能力带来的攻击面,这点先别太激动,等有白皮书或独立审计再说。

MIT Technology Review · AI

安全的 AI 助手到底能不能做出来?

OpenClaw 这个开源项目把大模型接进了邮箱、浏览器和本地文件,等于给 AI 穿了一身机甲,让它能 24 小时帮你干活。但安全研究员快疯了,因为一旦模型读到恶意网页或邮件,攻击者就能通过“提示注入”直接劫持它,后果比聊天框里胡说八道严重得多。文章说现在网上可能有几十万个 OpenClaw 智能体在跑,连中国政府都发了公开警告。核心问题是:目前还没有...

推荐理由:这不是产品发布稿,但 HKR 三项都站得住:问题本身是个好钩子,文章补了规模和“无银弹”这两个事实,而且直接打在 agent 安全这个从业者神经上。放 featured 而不是 p1,是因为正文截断,没给出可复现的防护方案,我会先打个折。

2月10日星期二

36 氪 · 直链

OpenAI 要把 ChatGPT 装进美国国防部的内部 AI 平台

美国国防部打算跟 OpenAI 合作,把 ChatGPT 接入他们自己的生成式 AI 平台 GenAI.mil,覆盖大约 300 万人员。目前公开的消息只说了要集成、平台名字和用户规模,没提用的是哪个模型版本、权限怎么控制、具体用在什么业务上,也没说什么时候上线。

推荐理由:这条消息的看点不是“ChatGPT 被国防部用了”,而是分发链路:一个面向约 300 万人的内部平台把 ChatGPT 接进去,规模不小。但正文只说了集成关系和平台名,模型版本、谁能用、怎么管、什么时候上线全都没提,所以先别急着下结论。我会打个折,因为信息缺口明显,后续得盯军方实际部署和权限设计。

36 氪 · 直链

穹彻智能拿了数亿元A轮融资,要把机器人“大脑”装进药房和洗衣房

穹彻智能刚完成数亿元A轮融资,领投方是C资本,跟投的还有东南亚互联网平台Sea Limited、普华资本,老股东Prosperity7 Ventures也追加了钱。这家公司2023年11月成立,核心产品叫Noematrix Brain,相当于给机器人装一个能理解指令、自己规划步骤、适应环境变化的“大脑”。目前这个大脑已经用在轮式单臂、轮式双臂和人形双臂...

推荐理由:HKR 三项都踩中了:融资标题本身有海外加注的钩子,正文又补了真机数据量和落地场景,比单纯报一轮钱更有信息量。我会先打个折——估值、收入和客户数都没披露,所以放在 featured 的低位。

2月9日星期一

36 氪 · 直链

小红书把搜索框改成了语音问答,想让你用说话代替打字来搜生活经验

小红书在1月27日全量上线了“语音问一问”,用户在搜索页长按就能用语音提问,最长能说三分钟,也支持外语和方言。它给出的答案不是通用百科,而是把站内用户分享的真人经验总结成结构化回复,比如剪头发怎么跟理发师沟通这种非标问题。正文没披露背后的语音识别和模型技术方案,也没提延迟和准确率数据。这次改动的核心是把搜索从三四个字的关键词匹配,拉长到口语化的长句提问...

推荐理由:小红书把搜索框改成能长按语音提问,这事我会先打个折——正文没披露用的什么语音识别方案、模型延迟和准确率,所以实际体验稳不稳还不好说。但值得盯的是,它把原本短关键词搜索变成了长语音问题入口,等于在抢更细颗粒度的查询需求。对AI从业者来说,这是内容平台用语音+外挂资料库做搜索的落地样本,虽然技术细节缺位,但产品方向和上线节奏本身就有信号意义。

36 氪 · 直链

千问的1000万杯奶茶:阿里大发赛博鸡蛋始末

2月6日,阿里千问App搞了一场“免单喝奶茶”活动,一天涌进超1000万笔订单,直接把系统挤崩了。上午10点到中午12点,点单页面卡死、转圈,甚至弹出提示说自己“没有实体的手脚,无法连接支付系统”。宕机是因为千问的算力没扛住——AI处理下单、比价、支付比普通电商秒杀更吃资源,而初始服务器容量只有预估峰值的1/3,也没做充分的压力测试和扩容预案。线下门店...

推荐理由:我会先打个折:这本质是阿里的一场促销压力测试,不是模型突破。但1000万杯奶茶把服务器打崩的现场感很强,数字也够具体——10点到12点宕机、12点前200万单、算力只备了1/3,这些事实让文章有信息增量。对从业者来说,值得看的是阿里怎么用补贴把AI推到消费场景里,以及基础设施在真实并发下的表现,比单纯刷榜更有烟火气。

2月7日星期六

MIT Technology Review · AI

Moltbook 是一场 AI 表演秀,不是机器觉醒

Moltbook 是一个给 AI 机器人玩的社交网络,上线几小时就火了。官方说现在有 170 万个机器人账号,发了 25 万条帖子,留下 850 万条评论。这些机器人靠一个叫 OpenClaw 的开源工具驱动,它能把 Claude、GPT-5 或 Gemini 这类大模型接上邮箱、浏览器等日常软件,让模型替你干点简单活。但文章指出,这场热闹基本是人在背...

推荐理由:这篇不是市场级事件,但反炒作评论写得干脆。我会先打个折:它没有新数据或新漏洞披露,更多是把已有的怀疑用“AI 剧场”这个说法串起来。HKR 三项都过关——钩子够狠,数字和机制分析补得扎实,安全风险那段让做 agent 的人会心里一紧。整体够 featured,但信息增量有限,所以停在 74 分这个位置。

2月6日星期五

TechCrunch · AI

OpenAI 和 Anthropic 在同一天抢着发布能自己干活的编程模型,前后只差几分钟

OpenAI 推出了 GPT-5.3 Codex,一个专门给自家编程工具 Codex 用的新模型。按 OpenAI 的说法,这个模型让 Codex 从“能写代码、审代码”升级到“几乎能替开发者在电脑上干所有事”,甚至能在几天内从零做出功能复杂的游戏和应用。速度比上一代 GPT-5.2 快了 25%,而且 OpenAI 说这是第一个“自己参与造自己”的模...

推荐理由:这条消息的看点全在时间差——OpenAI 在 Anthropic 发布后几分钟就甩出自己的代理式编码模型,说明两边在让模型进开发流程这件事上咬得很紧。但正文能用的信息太少:没模型名、没跑分、没价格、没上下文窗口、也没说谁能用,只提了一嘴跟 Codex 有关。所以我会先打个折,重要性给到 75、放在 featured 低位,因为话题热度够,但证据太薄,暂时没法判断性能或性价比。

2月4日星期三

硅谷101 播客

E224|Mac mini遭疯抢,为何Clawdbot能成为2026年第一个现象级产品?

这期播客录制于1月30日,但随后几天项目经历了改名、被起诉、安全漏洞曝光和服务器瘫痪等一系列反转。嘉宾们从用户、软件算法和硬件三个角度拆解了Clawdbot(后更名为Moltbot、OpenClaw)爆火的原因。用户侧嘉宾知县认为,核心是“活人感”:它能通过即时通讯软件主动推送提醒、做调研,甚至吐槽,像《钢铁侠》里的贾维斯。算法侧嘉宾祯豪指出,其主动性...

推荐理由:这期不是官方发布,更像一篇行业快评,但信息量够硬:14.6 万 stars 和改名风波都是新事实,机制拆解也到位。我会先打个折——正文没披露 Mac mini 实际销量,标题的“疯抢”更多是话题钩子;Agent 电脑的需求判断来自讨论,不是出货数据。不过对从业者来说,交互层怎么搭比模型本身更值得盯,这期把记忆、心跳、IM 入口这些拼法讲明白了,所以给 featured。