跳到正文

全部动态

今日 25 条

4月9日星期四

X · @claudeai

Claude 推出托管 Agent 服务公测版,把原型到上线压缩到几天

Claude 平台上线了 Claude Managed Agents 公测版,核心卖点是给了一套调过性能的 agent 运行框架加上生产环境基础设施,号称能把 agent 从原型做到上线的时间压到几天。正文没披露具体怎么收费、支持哪些工具链、能跑什么模型、有没有调用额度限制,这些关键信息都得等后续公布。

推荐理由:Anthropic 这次放出的 Managed Agents 是个公开测试,核心卖点是把 agent 从想法到上线的时间压到几天,对用 Claude 搭业务的人是个直接利好,所以重要性和相关性都过关。但我会先打个折——文章只说了有“性能调优的 agent harness”和配套生产设施,具体怎么收费、支持哪些工具、能跑什么模型、有没有调用上限,一概没写。这点先别太激动,缺的信息恰恰是决定能不能真省钱、真省事的关键。整体看,它解决的是 agent 规模化落地的运维和速度问题,对从业者来说是个实在信号,但落地效果还得等更多细节。

X · @Yuchenj_UW

Meta 放出 Avocado 模型,内部叫 Muse Spark,训练成本比 Llama 4 Maverick 省了十倍以上

Meta 的 TBD 实验室用 9 个月重写了整套预训练流程,做出了 Avocado(对外叫 Muse Spark)。正文说它的能力跟 Llama 4 Maverick 差不多,但训练用的算力不到后者的十分之一。模型没开源,也没公布参数量、跑分成绩和发布时间。这件事真正的看点是训练基础设施的效率,不是改个名字。

推荐理由:我会先打个折:正文没披露参数量、评测集和发布时间,目前只是一条帖文,别当正式发布看。但信息量够硬——TBD lab 用 9 个月重建预训练栈,把训练算力压到 Llama 4 Maverick 的十分之一以下,能力还接近,这对算力成本敏感的人是个信号。Meta 把它叫 Muse Spark,不是开源模型,所以重点不在命名,而在基础设施效率。HKR 全过,给 74 分,因为缺关键参数,验证还弱,但省钱的故事本身够吸引从业者盯后续。

4月8日星期三

量子位 · 公众号

小米放出两个语音生成框架,想让普通人也能当“声音导演”

小米大模型应用团队公开了 Any2Speech 和 Midasheng-audio-generate 两个框架。Any2Speech 一次推理能生成最长约 10 分钟的语音,Midasheng 则能根据一段文字描述直接合成包含人声、音乐和环境音的混合音频。技术方案里提到了 GST 标注、双路径规划加维度丢弃、Flow Matching 以及五字段结构化...

推荐理由:小米放出两套语音框架,核心看点是可控长音频和场景统一建模,一句提示词出混合音频、单次推理能跑10分钟,这两个点确实抓人。技术细节也给了,不是纯画饼。但我会先打个折:基准跑分没给,训练数据多大不知道,开不开源、能不能商用也没说,这些信息缺口让实际价值不好判断。整体有亮点但缺关键验证,放在 featured 低段比较合适。

量子位 · 公众号

DeepSeek 深夜更新网页版,新增快速和专家模式,灰度测试视觉模型

DeepSeek 网页版悄悄加了两个模式:快速模式主打日常对话,专家模式则专攻代码、网页搜索和更难的生成任务。有用户通过对话套话,模型自己说专家模式就是 V4,但官方没发公告,正文也没披露模型 ID、上下文规格、定价和发布时间,这点先别太激动。目前专家模式限量供应,不支持多模态和文件上传,有用户测出上下文上限大约 13.3 万 token。另外,视觉模...

推荐理由:我会先打个折:V4 这个说法目前只有网友实测和模型自述,官方没确认模型名、价格和上下文窗口,这点先别太激动。但文章把能复现的行为讲清楚了——专家模式偏代码和复杂生成、限量、不能传文件,还给了约 133K token 的长度上限,对实际用的人有参考价值。真正该盯的是官方后续会不会补参数和上下文说明,现在信息缺口不小。

X · @dotey(宝玉)

Anthropic 发了 Claude Mythos Preview,跑分断崖式领先,但不公开用,只借给 12 家大厂找漏洞

Anthropic 的新模型 Claude Mythos Preview 在 SWE-bench Verified 上拿到 93.9%,USAMO 数学证明冲到 97.6%,比自家上一代旗舰 Opus 4.6 提升巨大,对比 GPT-5.4 和 Gemini 3.1 Pro 也是全面领先。但 Anthropic 不开放 API 和公开访问,理由是模型自...

推荐理由:这条帖子抓人的点不在跑分第一,而在 Anthropic 把 Mythos Preview 锁死给苹果、微软等 12 家合作伙伴做漏洞挖掘,普通用户和 API 都用不上。我会先打个折:帖子本身是 X 上的二手总结,没贴官方公告链接,也没列全 12 家名单,所以重要性停在 84 不往上提。但 SWE-bench 93.9%、USAMO 97.6% 和 244 页系统卡这些数字够具体,1 亿美元额度和 400 万美元捐赠也说明 Anthropic 在安全分发上下了本钱。对从业者来说,真正该盯的是高危能力被封闭分发这件事,而不是又一个 benchmark 冠军。

X · @dotey(宝玉)

Hermes Agent 开源不到两个月 GitHub 星标近三万,核心卖点是会自己写技能、自我迭代的闭环学习引擎

Nous Research 今年 2 月底开源的 Hermes Agent,上线不到两个月 GitHub 星标接近三万,被社区看作 OpenClaw 的第一个真正对手。两者都是自托管、多模型、MIT 协议,但设计思路完全不同。OpenClaw 是网关,负责把聊天应用接到 AI agent;Hermes 是引擎,围绕 agent 怎么越用越强来设计。它最...

推荐理由:我会先打个折:目前证据主要来自社区反馈和少量个人试用,不是正式评测或大规模验证。但 H、K、R 三条都踩中了——开源热度够高,技能沉淀和记忆检索的机制讲得清楚,自托管学习型 agent 也确实戳到成本和工作流复用的神经。正文没披露安全五层的具体实现和长期稳定性数据,这点先别太激动。综合看,给 78 分合理,值得盯后续。

X · @AnthropicAI

Anthropic 启动 Glasswing 项目,用新模型 Claude Mythos Preview 找关键软件漏洞

Anthropic 发了个新项目叫 Project Glasswing,专门盯着最关键的软件做安全加固。背后用的是他们最新的前沿模型 Claude Mythos Preview,官方说它找漏洞的能力仅次于最顶尖的人类专家。不过正文没给出具体跑分、测试范围、怎么申请试用,也没说什么时候正式开放,所以实际效果还得等可复现的评测出来再看。

推荐理由:这篇 Anthropic 一手公告,标题和摘要确认了 Project Glasswing 和 Claude Mythos Preview 两个名字,说能力仅次于顶尖人类专家,但正文没披露任何可复现的评测数据、软件范围或接入细节。我会先打个折:真正该盯的是他们后续会不会放出基准分数和第三方验证,现在只能当个方向性信号看。

4月7日星期二

X · @dotey(宝玉)

Milla Jovovich 和开发者发布开源记忆系统 MemPalace,声称 LongMemEval 满分,但被指只测了检索、没测端到端问答

MemPalace 想解决 AI 对话一结束就失忆的问题:不靠 AI 自己挑重点,而是把全部对话按“宫殿—翼—房间—走廊”的结构存下来,全部本地运行,不依赖云服务。它配套了一个叫 AAAK 的压缩语法,号称能把上下文压到 30 倍,但实测压缩后检索准确率从 96.6% 掉到 84.2%,差了 12 个百分点,无损压缩不会这样。项目宣称的 LongMem...

推荐理由:我会先打个折,满分这事别太激动。项目亮点是全本地运行、不用云服务,AAAK 压缩语法号称能把上下文压到原来的三十分之一,MCP 接入后能调 19 个工具翻历史记录。但 Penfield Labs 直接指出这个满分只测了检索,不是端到端问答,而且用上 AAAK 后检索准确率反而从 96.6% 跌到 84.2%,说明压缩是有代价的。正文没披露模型规模、硬件要求和实际延迟,这些缺口让实用性还不好判断。明星光环和开源旗号能带来关注,但技术验证还得看后续实测。

4月4日星期六

X · @dotey(宝玉)

Anthropic 正式封堵订阅漏洞:Claude Pro/Max 不再给 OpenClaw 等第三方工具买单

Claude Code 负责人 Boris Cherny 发公告,太平洋时间 4 月 4 日中午起,Claude Pro 和 Max 订阅的额度不再覆盖通过 OpenClaw 这类第三方工具产生的用量。想继续在这些工具里用 Claude,要么买打折的用量包,要么用 API Key 按量付费。现有订阅用户会拿到一笔等于月费的一次性补偿,觉得不够的明天邮件...

推荐理由:这不是常规价格调整,是 Anthropic 在收紧第三方 Claude 套壳工具的账单和访问权限。HKR 三项都成立:冲突钩子够硬,截止时间和补偿方案具体,开发者圈子里反响会很大。不过影响范围比发新模型或改产品定位要窄,所以重要性没给更高。

X · @dotey(宝玉)

DeepSeek V4 推迟发布,重写底层代码,就为了跑在华为昇腾 950PR 上

V4 跳票了几个月,原因是 DeepSeek 把模型底层模块重写了一遍,专门适配华为和寒武纪的硬件。现在 V4 能直接跑在华为昇腾 950PR 芯片上,预计几周内发布。这颗芯片单卡算力号称是英伟达 H20 的 2.87 倍,有 112GB 显存,带宽 1.4TB/s,还是国内唯一支持 FP4 低精度推理的芯片。FP4 的好处是大幅压缩显存占用,一个原本...

推荐理由:这条消息 H、K、R 都站得住:华为芯片部署是强钩子,底层重写和芯片规格有料,国产算力替代的话题自带传播。没给更高分是因为这还属于发布前报道,模型规模、价格和实测性能都没披露,我会先打个折。

X · @dotey(宝玉)

Mintlify 给 AI 文档助手造了个假文件系统,启动从 46 秒降到 100 毫秒

Mintlify 把 AI 文档助手的检索方式从向量 RAG 换成了 ChromaFs——一套用数据库查询模拟 grep、cat、ls 的假文件系统。AI 以为自己在一个真实的文件系统里翻文档,实际上每个命令都被拦截翻译成 Chroma 查询。效果是会话启动时间从沙箱方案的 46 秒压到 100 毫秒,每次对话的边际计算成本几乎为零。按他们月均 85 ...

推荐理由:Mintlify 这篇工程博客写得很实在,没有吹概念,而是把方案和取舍摊开来讲。核心思路是把文档页映射成“文件”、章节映射成“目录”,让模型用熟悉的命令行工具去探索,背后实际是数据库查询。效果很直观:启动时间从 46 秒砍到 100 毫秒,边际计算成本接近零。我会先打个折——这个方案强依赖文档本身有清晰的层级结构,正文也承认不适合无层级知识库,所以别把它当成万能 RAG 替代品。但它的真正价值不在省钱,而在检索范式的切换:不是把资料塞给模型,而是让模型自己动手翻。这点对正在折腾 agent 检索链路的人,比单纯跑分更有启发。

4月3日星期五

X · @claudeai

Claude 全系套餐都能直连微软办公三件套了

Anthropic 把 Microsoft 365 连接器开放给了所有 Claude 付费套餐,不再只限高价版本。你可以把 Outlook 邮件、OneDrive 文档和 SharePoint 文件直接拽进对话里,让 Claude 帮你翻邮件、总结文档或从公司资料库里找东西。帖子确认了覆盖范围和对接的应用,但没提权限边界怎么划、管理员要不要额外配置、有...

推荐理由:这是一条中等体量的 Claude 产品更新:Anthropic 把 Microsoft 365 连接器铺到所有方案,改变了 Outlook、OneDrive 和 SharePoint 的实际接入范围。HKR 三项都踩中,但正文没披露价格、权限边界、地区限制和管理后台条件,所以只能放在 featured 低段。我会先打个折——全量放开比加新功能更值得盯,但缺的信息让人没法判断企业能不能直接推。

X · @op7418(歸藏)

阿里发了 Qwen 3.6 Plus,上下文拉到 100 万 token,Agent 和编程能力提升明显

阿里在百炼上线了 Qwen 3.6 Plus,主打 Agent 任务和编程能力,相比 3.5 版有明显提升。图像和文档理解也加强了,数学图像识别、真实世界问答和 OCR 表现都不错。这次默认支持 100 万 token 上下文,最长输出接近 99.1 万 token,输入 6.4 万 token,比之前 256K 的版本开发体验好很多。价格是输入每百万...

推荐理由:阿里放出 Qwen 3.6 Plus,是国内模型一次实打实的更新。HKR 三项都站得住,核心是 100 万上下文和 2/12 元定价这个组合拳,对实际干活的人诱惑很大。但正文没给具体测评分数、对比基线和测试条件,所以先不打最高级,等看到跑分再说。

X · @op7418(歸藏)

谷歌发布 Gemma 4,四个尺寸全 Apache 2.0 开源,主打本地跑 agent 和多模态

Gemma 4 一口气发了四个版本:E2B 给手机和 IoT 用,E4B 给移动端和 Jetson/树莓派,26B MoE 每次只激活 3.8B 参数、延迟低吞吐高,31B 全密集版适合桌面或单卡 H100。这次把 agent 工作流当第一优先级,原生支持函数调用、JSON 输出和系统指令,还直接能处理图像、视频和语音转文本,可以做本地语音助手。全部用...

推荐理由:谷歌发 Gemma 4 是一次有分量的开源模型更新。HKR 三项都成立:26B MoE 只激活 3.8B 的部署弹性够抓人,四个规格和商用许可给了新事实,成本敏感场景的参考价值也明确。分数定在 81 是因为基准、上下文窗口和测试细节都没披露,我会先打个折,这点先别太激动。

X · @claudeai

Claude 的电脑操控功能 Cowork 和 Code Desktop 现在支持 Windows 了

Claude 把电脑操控能力带到了 Windows 上,覆盖 Cowork 和 Code Desktop 两个入口。正文只发了一句话和一条链接,没提支持哪些 Windows 版本、权限怎么管、操作延迟多少、要不要额外付费,也没说什么时候正式推送。对想在 Windows 上跑桌面 agent 的人来说,现在只能知道功能有了,但稳定性和实际跑起来怎么样,这...

推荐理由:Claude 把 computer use 能力从非 Windows 平台扩到了 Windows,标题就这一句事实。正文没披露支持哪些 Windows 版本、权限怎么隔离、操作延迟多少、要不要加钱、什么时候正式上线,这些才是决定能不能在生产环境用的关键。我会先打个折:桌面代理在 Windows 上的稳定性边界还没给可复现条件,别急着全量上。分数维持 74,因为这是官方更新,但信息密度只够确认可用性,离评估还差一截。

X · @OpenAI

ChatGPT 上车了,现在能在 CarPlay 里用语音模式

OpenAI 把 ChatGPT 的语音模式搬进了 CarPlay,iPhone 用户升级到 iOS 26.4 以上就能在车里用。正文没提支持哪些国家、哪些车型,也没说功能有没有阉割,比如能不能连续对话、能不能读长文章。这次动作的重点是把对话入口塞进驾驶界面,不是发了新模型。

推荐理由:这次更新更像是一次分发渠道的扩展,而不是模型本身有什么变化。ChatGPT 出现在 CarPlay 里,意味着它开始抢占车载语音交互的位置,这点比功能细节更值得关注。不过正文没披露地区、车型和功能限制,实际落地范围还得再观察,先别太激动。

3月31日星期二

Mistral AI

Mistral AI 推出 Spaces:一款为人类与智能体打造的 CLI

Mistral AI 发布 Spaces CLI,同时面向人类开发者与编码智能体。它通过 `spaces init`、`spaces dev` 等命令快速搭建多服务项目,并为每个交互式提示提供对应的 flag 与 `-y` 选项,使智能体可自主完成配置与部署。每次 init 还会生成 context.json 和 AGENTS.md,为智能体提供项目上下文与操作规则。

MIT Technology Review · AI

AI 健康工具越来越多,但没人说得清它们到底靠不靠谱

微软上线了 Copilot Health,亚马逊把 Health AI 从 One Medical 会员专属开放给所有人,加上年初 OpenAI 的 ChatGPT Health 和能调取健康档案的 Claude,面向普通人的 AI 健康问答成了大厂标配。微软说 Copilot 每天收到 5000 万个健康问题,需求确实摆在那里,尤其对看病不方便的人群...

推荐理由:这篇文章不是产品发布,而是趋势报道加安全质疑。我会先打个折:微软和 Amazon 都在推消费级健康聊天机器人,但正文没披露任何独立安全评测,六位受访学者也点出这个问题。Mount Sinai 的研究是全文最硬的信息——ChatGPT Health 会误判轻重,说明光靠公司自测基准不够。这点先别太激动,因为研究样本和具体方法正文没展开,但方向值得盯。整体看,信息量够、风险点明确,适合放进 featured。

3月25日星期三

OpenAI News

OpenAI 开了个安全漏洞赏金计划,专门收 AI 滥用和越权操作的问题

OpenAI 在 2026 年 3 月 25 日上线了一个公开的“安全漏洞赏金”计划,跟之前的安全漏洞赏金不同,这次专门盯着 AI 被滥用或绕过安全限制的场景。主要收三类问题:一是智能体(比如浏览器里的 ChatGPT Agent)被第三方提示词注入劫持,导致泄露用户信息或执行有害操作,复现率得超过 50%;二是模型输出里意外暴露了 OpenAI 自己...

推荐理由:这不是模型发布或能力升级,而是一次治理流程更新,所以放在低 featured 档。但 OpenAI 把 AI 安全漏洞悬赏公开化,还划出了代理风险、专有信息泄露这些具体受理项,同时明确排除普通越狱,等于给行业打了个样。我会先打个折:正文没披露赏金金额和实际处理时效,实际效果还得看后续执行。

3月24日星期二

OpenAI News

ChatGPT 把购物功能做成了视觉化比价工具,用 ACP 协议直接拉商品信息

OpenAI 给 ChatGPT 加了一套更直观的购物功能,你可以上传图片找同款、用对话筛预算和偏好,还能把商品并排比价格、评价和规格。背后靠的是他们扩展的 Agentic Commerce Protocol(ACP,一种让 AI 直接跟商家系统对接商品数据的协议),把商品信息实时拉进聊天界面。这次更新面向所有用户,免费版也能用。正文没披露具体覆盖了多...

推荐理由:OpenAI 放了个标题,说 ChatGPT 要支持商品发现,但正文没给任何细节。我会先打个折:功能机制、覆盖范围、具体数字一概没提,所以只能当个信号看。好处是官方亲自下场把聊天框变成购物入口,这点对行业触动很大;坏处是现在除了标题什么都没有,没法判断是真落地还是先占坑。

3月20日星期五

MIT Technology Review · AI

OpenAI 要造一个全自动 AI 研究员,先别急着喊“科学家要失业”

OpenAI 把“造一个全自动 AI 研究员”定成了接下来几年的北极星目标。首席科学家 Jakub Pachocki 跟 MIT Technology Review 聊了分两步走的计划:今年 9 月先搞一个“AI 研究实习生”,能独立啃一小批特定研究问题;2028 年再上完整的多智能体自动化系统。但正文没披露这个系统要怎么评估产出靠不靠谱、打算烧多少算...

推荐理由:HKR-H 落在“全自动研究员”这个具体到能让人立刻理解野心的钩子上,HKR-K 靠两个可验证的时间节点撑住信息量,HKR-R 则抓住了研究岗位替代和实验室军备竞赛这两条从业者最关心的线。没给 must-write 是因为正文没披露评测标准、算力预算和研究范围,目前只能算一个强路线信号,离可验证产出还有距离。

MIT Technology Review · AI

OpenAI 把全自动 AI 研究员定为未来几年的北极星,计划 9 月先上线一个能独立解决少量问题的实习研究员

OpenAI 首席科学家 Jakub Pachocki 说,公司正把所有资源押注在一个叫“全自动 AI 研究员”的目标上。这个系统不是单一模型,而是一套让多个 AI 智能体协作干活(multi-agent)的流程,能自己跑去啃又大又复杂的问题,比如数学猜想、生物化学实验设计,甚至商业和政策难题。他们给了个时间表:今年 9 月先做出一个“AI 研究实习生...

推荐理由:这篇是战略路线图报道,不是已发布产品,所以没给 p1。亮点在于 OpenAI 首次把“全自动研究员”拆成实习生版和多 Agent 版两步走,时间节点清楚,但正文没写成本、算力需求和怎么评判好坏,这些才是落地关键。我会先打个折,等看到能跑多久、任务拆得怎么样再调整判断。

3月18日星期三

Mistral AI

Mistral AI 推出企业级模型训练系统 Forge

Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 架构,并可处理多模态输入,模型可在企业内部基础设施中训练与治理。Mistral AI 已与 ASML、Ericsson、欧洲空间局、新加坡 DSO National Laboratories 等机构合作,用其专有数据训练模型。

推荐理由:原文给出企业用自有数据训练前沿模型的分阶段能力与已合作机构,可据此判断企业自建模型的路径。

3月17日星期二

NVIDIA 博客

GTC 上 NVIDIA 用 RTX 电脑和 DGX Spark 跑本地 AI 助手,还发了新模型

NVIDIA 在 GTC 上主推两件事:一是让 AI 助手直接在 RTX 电脑和 DGX Spark 小超算上本地跑,不用联网,隐私和 token 成本都省了。DGX Spark 有 128GB 统一内存,能塞下 120B 参数以上的模型。二是发新模型,包括小号的 Nemotron 3 Nano 4B 和大号的 Nemotron 3 Super 120...

推荐理由:我会先打个折:正文没披露标题里“最新开放模型”的全量清单和价格,所以不能给更高分。但 HKR 三项都站得住——本地跑大模型和代理的钩子够强,128GB 统一内存和 PinchBench 分数是实打实的数字,而且本地推理正好踩在隐私和成本这两个行业痒点上。保留 featured,不往上提,因为信息有缺口,来源也是厂商发布稿。

OpenAI News

OpenAI 发了 GPT-5.4 mini 和 nano,主打编程和子任务,mini 跑得比 GPT-5 mini 快一倍多

OpenAI 在 3 月 17 号推出了 GPT-5.4 mini 和 nano,都是给高吞吐、低延迟场景用的轻量模型。mini 在编程、推理、看图、调工具上都比上一代 GPT-5 mini 强,速度还快了一倍多。跑分上,mini 在 SWE-Bench Pro 拿到 54.4%,跟大哥 GPT-5.4 的 57.7% 差距不大,但延迟低很多,适合需要...

推荐理由:这是 OpenAI 官方模型发布,不是小修小补。我会先打个折:虽然叫 GPT-5.4 mini,但别当它是 GPT-5.4 的完整缩小版,更像是一个专攻编码和子代理任务的轻量选手。真正值得盯的是它用更低价格和更快速度,把 SWE-Bench Pro 拉到 54.4%,离大模型只差 3.3 个百分点——这点先别太激动,正文没披露其他基准的对比,不知道通用能力缩水多少。nano 更极端,只走 API,价格压到输入 0.20 美元,明显是给大批量、简单任务准备的。整体看,OpenAI 在推‘够用且便宜’的代理专用模型,对频繁调用代码工具的场景挺省钱。

3月12日星期四

NVIDIA 博客

英伟达开源 Nemotron 3 Super:120B 模型只激活 12B 参数,跑 agent 任务吞吐量翻五倍

英伟达发了 Nemotron 3 Super,一个总参数量 120B、但每次推理只激活 12B 参数的混合专家模型。它用了混合 MoE、隐式 MoE 和一次预测多个 token 的技术,上下文窗口拉到 100 万 token。官方说在跑 agent 这类多步骤任务时,吞吐量比之前方案高 5 倍;如果搭配 Blackwell 的 NVFP4 精度,推理速...

推荐理由:这是一条扎实的模型发布消息,H、K、R 三点都踩中了。H 靠 5 倍吞吐这个具体承诺抓眼球;K 把参数量、激活量、上下文长度、训练规模和硬件对比都列清楚了,信息密度高;R 在于开放权重和配方,不是只给个模型让你猜。没给更高分是因为关键性能数据都来自 NVIDIA 自家博客,还没看到第三方验证,这点先别太激动。

3月11日星期三

OpenAI News

OpenAI 给 Responses API 加了个电脑环境,让模型能自己敲命令行干活

OpenAI 在 2026 年 3 月 11 日说,他们的 Responses API 现在能调用一个 shell 工具,在托管的隔离容器里执行命令。模型(GPT-5.2 及之后版本)会自己提议该敲什么命令,API 负责在后台跑、把结果流式传回来,还能同时开多个会话并行处理。容器里带了文件系统、可选的 SQLite 和受限的网络访问。这相当于给模型配了...

推荐理由:这次更新把 Responses API 从“调工具”升级成“给模型一台隔离电脑”,shell 执行、流式输出、并行跑命令、上下文压缩都实装了,对 agent 开发者是实打实的新能力。正文后半段截断,定价、配额和完整安全边界都没写,所以实际落地成本和安全兜底还得等后续披露。

3月10日星期二

OpenAI News

ChatGPT 上线数学和科学互动图解,覆盖 70 多个核心概念

OpenAI 给 ChatGPT 加了一个学习功能:问勾股定理、理想气体方程这类问题时,它会直接弹出一个可拖拽的图表模块。你可以手动调参数、改公式,图表会跟着实时变,把抽象公式变成能上手试的东西。首批覆盖 70 多个数学和科学概念,所有付费和免费用户都能用。官方说每周有 1.4 亿人用 ChatGPT 学数学和科学,但正文没披露这个互动功能背后的模型、...

推荐理由:我会先打个折:这是个中等体量的产品更新,不是模型能力突破。钩子在于把抽象概念变成能动手玩的画面,对教学场景有直接吸引力。1.4 亿周活和 70+ 概念是实打实的数字,说明铺量已经很大。但正文完全没提模型怎么支撑这些交互、有没有做过学习效果验证,这点先别太激动。整体判断是产品化动作值得关注,技术深度和效果证据还缺位。

3月7日星期六

彭博科技

甲骨文和 OpenAI 叫停了得州旗舰数据中心的扩建计划

双方谈崩了,不再一起扩建位于得州阿比林的那座旗舰 AI 数据中心。原因是融资进度拖后腿,加上 OpenAI 自己的需求变了。现在 Meta 在考虑从运营商 Crusoe 手里租下这个场地,英伟达也在中间帮忙牵线。这类项目的造价动辄上百亿美元,正文没披露具体的分手条款和后续时间表。

推荐理由:Oracle 和 OpenAI 在得州阿比林那个旗舰数据中心的扩建计划谈崩了,原因是融资没谈拢,加上 OpenAI 自己的需求也变了。Meta 正考虑从开发商 Crusoe 手里租下原本要扩建的那块地,Nvidia 在中间帮忙牵了线。项目总成本只说在几百亿美元级别,具体数字没披露。我会先打个折:这事说明超大集群先卡在资本结构和多方协同上,不是先卡在芯片,这点比标题本身更值得盯。

彭博科技

OpenAI 放出一个安全工具的研究预览版,让 AI 自己去数据库里找漏洞、打补丁

OpenAI 发了一个给安全团队用的 AI agent 研究预览版,主要用途是扫描大型数据库里的漏洞并自动修补。目前公开信息很少——正文没披露具体模型名、支持哪些数据库、怎么收费、什么时候正式上线。我会先打个折:这还是个研究预览,离生产环境能用还有距离,别看到“agent”就觉得能直接上岗。

推荐理由:我会先打个折:这还是个研究预览,离生产环境有距离。但 OpenAI 把代理放进安全流程里,不是再发一个聊天机器人,这个动作本身就值得盯。正文没披露模型、覆盖范围、定价和上线时间,所以别急着激动。真正让人在意的是它试图让 AI 直接碰漏洞修补,这会牵出责任、误报、权限控制一连串问题,企业安全团队不可能不关注。

彭博科技

Anthropic 要学亚马逊开 AI 软件商店,让企业客户在它的平台上买第三方工具

Anthropic 正在搞一个类似亚马逊的 AI 软件市场,企业客户可以直接在上面买第三方开发的软件,不再只卖自家模型。这步棋说明它想从卖模型转向做渠道分发。不过正文被 Bloomberg 的机器人验证挡住了,具体上线时间、抽成比例、首批上架哪些软件都没披露。另外文章提到公司正因五角大楼的合作争议面临业务不确定性,这个背景可能跟它急着铺渠道有关。

推荐理由:我会先打个折:上线时间、抽成、具体卖什么软件,正文全没给,所以别当马上落地的产品看。但方向值得盯——Anthropic 从卖模型转向做企业软件分发,等于在学亚马逊搭应用商店。这点先别太激动,因为没披露的东西太多,可它发生在跟 Pentagon 对峙带来业务不确定的节骨眼上,渠道动作本身就说明它在找模型销售之外的收入支点。

3月6日星期五

OpenAI News

OpenAI 把代码安全扫描工具 Codex Security 开放给付费用户试用,下个月免费

OpenAI 在 3 月 6 日上线了 Codex Security 的研究预览版,面向 ChatGPT Pro、Enterprise、Business 和 Edu 用户,下个月可以免费用。这个工具相当于一个应用安全助手,会先读懂你的项目结构,生成一份可编辑的威胁模型,再根据这个模型去找漏洞、做验证、给修复建议。过去 30 天里,它扫了外部仓库超过 1...

推荐理由:这是 OpenAI 给开发和安全团队的一个实质性产品更新,不是泛泛的安全宣传。切入点新、有具体扫描和误报数据、回应了 AI 编码风险和告警疲劳,三个点都站得住。不过目前还是研究预览,正文没披露误报下降的具体测试条件和补丁的采纳率,效果得等正式版再看。

3月5日星期四

OpenAI News

OpenAI 发布 GPT-5.4,把写代码、操作电脑和做报表揉进了一个模型里

OpenAI 推出了 GPT-5.4,一个面向专业工作的新模型,在 ChatGPT、API 和 Codex 里都能用。它把之前 GPT-5.3-Codex 的代码能力整合了进来,还首次让通用模型能直接操作电脑软件,比如跨应用完成复杂流程。模型支持最长 100 万 token 的上下文,方便处理长线任务。在模拟 44 种职业工作的 GDPval 测试里,...

推荐理由:这条消息的新闻价值在于 OpenAI 放出了一个新模型名,所以 H 和 R 都成立。但正文除了标题什么都没有,模型到底多大、贵不贵、能处理多长的上下文、跑分怎么样,一概没提,所以 K 不成立,分数只能停在 80 分这个区间。真正该盯的是后续的技术页,不是这条标题本身。

OpenAI News

OpenAI 把 ChatGPT 塞进 Excel 了,还接上了 Moody's、Factiva 等金融数据源

OpenAI 在 2026 年 3 月 5 日发布了 ChatGPT for Excel 的测试版,相当于在 Excel 里直接装了一个 GPT-5.4 助手。你可以用大白话让它帮你搭财务模型、跑情景分析、查公式错误,它改表之前会先问你,改完还能告诉你改了哪个格子、为什么。OpenAI 自己跑了一遍投行工作流测试,GPT-5 的正确率是 43.7%,换...

推荐理由:OpenAI 把 ChatGPT 塞进 Excel 测试版,不只是加个聊天框,而是让模型能直接在单元格里建模、追溯改动,还接入了 Moody's、道琼斯 Factiva、MSCI 等金融数据源。内部投行场景的基准分从 43.7% 跳到 87.3%,幅度很大,但这是内部测试,实际表现得等用户上手再看。企业版和教育版默认关闭,说明对合规和隐私留了后路。FactSet 标注“即将上线”,数据生态还在铺。整体看,这是 OpenAI 在抢专业工作流入口的一次重注,比单纯发个模型更有战略意味。

3月3日星期二

OpenAI News

GPT-5.3 Instant 发布:少说废话、少拒绝,日常对话更干脆

OpenAI 在 2026 年 3 月 3 日更新了 ChatGPT 里用得最多的模型,叫 GPT-5.3 Instant。这次改动主要冲着日常对话体验去的:模型不再动不动就拒绝回答,也不会在回答前先啰嗦一堆免责声明。文章给了一个具体对比——问远程射箭弹道计算,旧版 GPT-5.2 Instant 直接拒绝,说这能提高武器效能所以不能帮;新版 GPT-...

推荐理由:OpenAI 更新了 ChatGPT 最常用的日常模型,这篇帖子靠一个具体的 5.2 vs 5.3 行为对比把安全边界的变化讲清楚了,所以 HKR 三项都站得住。我会先打个折:正文没给系统卡、基准分、API 价格,信息缺口明显,所以重要性停在 84 不进 85。

2月28日星期六

36 氪 · 直链

阿里千问计划推出 AI 眼镜、耳机和指环,把点外卖、打车功能搬出手机

阿里内部人士透露,千问将在 2026 年面向全球发布三款 AI 可穿戴硬件:眼镜、耳机和指环。眼镜会在 MWC 2026 亮相,3 月 2 日开放预约。千问 App 上已有的点外卖、打车等功能会直接迁移到这些设备上。阿里把这件事看得很重,去年底已经将千问 App、夸克和 AI 硬件业务合并成一个“千问 C 端事业群”。模型端也做了配合,新开源的 Qwe...

推荐理由:这篇独家把阿里的硬件路线图摊开了,三款设备一起上,摆明是要把千问 App 里的外卖、打车能力搬到眼镜和耳机上。我会先打个折,毕竟还没看到真机和实测,但 Qwen3.5-Plus 的成本和吞吐数据如果属实,跑端侧推理确实省钱了。值得从业者盯的是生态联动那部分,正文没细说硬件和支付宝、高德的具体打通方式,这点先别太激动,但方向本身比单品参数重要。

2月27日星期五

36 氪 · 直链

抖音把资讯交给AI:长文上限提到8000字,AI写的新闻摘要也要进信息流了

抖音在2025年底正式上线了长图文功能,字数从内测时的4000字放宽到8000字,目前只能在网页端发布。内容多是深度故事、社会新闻这类非即时性的东西。同时,抖音热点频道里多了个“AI智选资讯”,AI会实时抓取全网热点,自动生成新闻摘要和总结。内部人士说,这些AI资讯很快会进入抖音的信息流,跟原创长文抢同一批流量。字节的思路很明确:用AI把内容生产成本打...

推荐理由:抖音把长文和 AI 资讯塞进同一个流量池,但正文没交代推荐权重、版权怎么谈、事实错了谁兜底。我会先打个折:功能上线是真的,可责任边界没画清楚之前,别急着把它当内容生态升级。

2月14日星期六

阮一峰的网络日志

字节 Seed 2.0 模型搭配 TRAE 工具,用 Skill 文件给 AI 编程加技能

阮一峰用字节刚发的 Seed 2.0 Code 模型和 TRAE 编程工具,跑了一个把 ASCII 字符画转成手绘风格图的网页应用,本地预览直接能用。Seed 2.0 是字节的通用基座模型,分 Pro、Lite、Mini 和 Code 四个版本,能处理文字、图片、视频等多种数据,也支持让模型调用外部工具。文章重点讲了 Skill 怎么用:把反复要写的提...

推荐理由:这篇文章不是官方通稿,而是一个能跟着跑的通路演示。H 和 K 都站得住,因为既有完整应用产出,又有模型矩阵和 Skill 机制的具体拆解。R 也成立,Skill 文件的设计直接踩中 coding agent 工作流复用的痛点。整体是强教程而非重大发布,所以重要性停在 75。

MIT Technology Review · AI

渐冻症夺走了这位音乐人的声音,AI 让他重新站上舞台唱歌

32 岁的 Patrick Darling 在确诊渐冻症两年后,用 AI 克隆了自己的歌声,2 月 11 日在伦敦重新和乐队一起演出。他的声音克隆不是用录音棚素材做的,而是从嘈杂的手机视频和厨房录音里拼出来的,ElevenLabs 的音乐工具花了大约六周调校。这件事的信号不在感人,在于门槛:ElevenLabs 把工具免费开放给因渐冻症等疾病失声的人,...

推荐理由:我会先打个折:这不是模型或产品大更新,而是一个应用案例。但案例本身够硬——ALS 患者用旧录音唱歌,不是概念演示,是真实上台。正文给了两个关键条件:10 分钟清晰语音和 6 周从噪音片段里抠出歌声,说明门槛和代价。ElevenLabs 把这个流程做成免费项目,但正文没披露底层模型细节,这点先别太激动。整体看,故事性强、有可复现信息、踩中声音权利话题,适合放低 featured。

2月13日星期五

OpenAI News

OpenAI 给 Codex 和 Sora 换了一套“先用额度,超了再扣钱”的访问系统

OpenAI 发了一篇工程博文,解释他们怎么解决 Codex 和 Sora 用户老撞速率限制的问题。核心做法是自研了一套实时访问引擎,把速率限制和预购点数揉在一起:请求先走免费速率额度,额度用完了自动从点数余额里扣,用户不用切换系统。文章说这套“决策瀑布”模型能在一个请求里同步完成判断,点数扣减异步处理,并且有三套独立数据(产品用量、计费事件、余额变动...

推荐理由:这是 OpenAI 官方的产品更新,标题抛出了“超越速率限制”这个钩子,对开发者来说很抓眼球,所以 H 和 R 都成立。但正文完全没披露具体怎么调、调多少、谁受益、花多少钱、什么时候上,信息密度极低,K 不成立。我会先打个折,把它放在 featured 底线,等后续有参数再重新评估。