Mistral 在慕尼黑开设德国中心,推进工业 AI 与 Physics AI
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将携手 BMW 开展碰撞仿真与工程 AI 合作、与 Siemens Energy 推进工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将携手 BMW 开展碰撞仿真与工程 AI 合作、与 Siemens Energy 推进工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,并能在本地执行代码、调用第三方 API。作者认为聊天只是 AI 的通用兜底界面,用户明确任务时更该让智能体生成可复用工具,而非把智能体本身当工具、白白消耗 token。示例包括 Connect 4 游戏、Winget 包管理、SQLite 操作和开发工作流自动化。
GitHub Copilot 应用重建了 pull request 视图,以流畅渲染含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 PR。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确算好,评论高度按块懒测量并锚定到文件、行与侧,避免滚动跳动。
Google DeepMind 公布 Private AI Compute 的新技术能力,将私密的服务端持久记忆引入该平台,使 AI 助手能跨设备保留上下文。数据密封在加密存储中,解锁密钥仅保存在用户设备上,模型访问时通过端到端加密通道进入云端安全隔区,在隔离内存中临时解密并即时重新加密。
推荐理由:原文说明云端持久记忆如何用安全隔区与设备端密钥实现隐私保护,可了解云端 AI 记忆的隐私架构思路。
NVIDIA 发了一篇博客,核心观点是 AI 工厂(大规模部署 GPU 做推理/训练的数据中心)应该用“每瓦特产出多少 token”来衡量效率,而不是只盯着 GPU 的浮点算力。文章从数据中心设计、散热到推理调优讲了一整套优化思路,想把 AI 工厂跑成生产线。但正文没有披露具体的效率提升数字,也没有提到新硬件型号。如果你在规划数据中心或买卡,这个衡量思...
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,数据与模型所有权均归企业,模型基于开放权重。Cloudera 平台上客户管理的数据规模达 30 exabytes。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。
Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,同时 Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理端点、SLA 服务层级与第三方开源模型接入放在同一套基础设施上,读者可据此判断欧洲主权 AI 的落地路径。
微软 Build 大会上,两家宣布把 AI 部署的底层打通了。简单说,就是同一个 AI 应用,既能在你笔记本的 RTX 显卡上跑,也能无缝切到 Azure 云或者公司本地的 DGX 工作站上,不用重写代码。现场还亮了两款新硬件:RTX Spark 是个小盒子,能提供 1 petaflop 的 AI 算力(大概相当于每秒一千万亿次计算);DGX Stat...
推荐理由:HKR 三项都过了。NVIDIA 和微软这次合作,把 agent 部署从 Windows 到 Azure 再到本地串成一条线,还亮出了 1 petaflop 和 20 petaflops FP4 两个硬件规格,对从业者来说有信息增量。不过消息源是厂商自己,正文没给定价、跑分和迁移细节,所以分数没往上拉。
南京大学 LAMDA 组和阿里智能引擎团队提出了一种叫 DAR 的方法,把 DiT 模型里固定的残差累积,换成了按时间步动态选择路径的跨层路由。在 ImageNet 256×256 上拿 SiT-XL/2 试,FID 从 9.67 降到了 7.56,而且只用原来大约九分之一的训练步数就达到了同等收敛质量。不过原文因为微信环境验证拦截,具体怎么实现路由、...
推荐理由:我会先打个折:这还是一个针对DiT架构的训练方法改进,不是新模型或产品发布,所以分数没往78以上走。但它的亮点很实在——把残差流这个大家默认的组件揪出来说是收敛瓶颈,然后用一个时间感知的路由去替代固定累加,效果是FID更好、收敛快近9倍。对正在烧钱训视觉模型的人,这个省钱省时间的信号够强,featured没问题。
Mistral AI 宣布已达成收购 Physics AI 先驱 Emmi AI 的最终协议,以强化其作为工业企业 AI 转型伙伴的定位。Emmi AI 成立于奥地利,专注物理 AI 与大型工程模型,可加速工程工作流、以实时仿真替代多日计算并构建数字孪生。Emmi 的联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 通过收购 Physics AI 公司 Emmi 补强工业仿真能力,读者可了解其向工程与制造场景延伸的路径。
Mistral 在 Studio 发布 Connectors,所有内置连接器和自定义 MCP 现可通过 API/SDK 用于全部模型与智能体调用。新功能包括直接工具调用、human-in-the-loop 审批流程,以及对连接器的创建、修改、列出和删除等编程访问。
推荐理由:原文给出 Connectors 的 API 用法与代码示例,读者可据此判断企业级 MCP 集成如何落地。
NVIDIA 在 COMPUTEX 2026 上靠 Vera Rubin NVL72、Jetson Thor 和 Alpamayo 拿了四个 Best Choice 奖。Vera Rubin NVL72 把 36 颗 Vera CPU 和 72 颗 Rubin GPU 连在一起,NVIDIA 说它每瓦推理性能是上代的 10 倍,每个 token 的成本...
推荐理由:我会先打个折:这是 NVIDIA 自己活动博客发的,不是第三方实测,10 倍能效得看什么负载、跟谁比。但 Vera Rubin NVL72 的规格和能效数字本身够硬,对算力成本和采购节奏有直接参考价值,所以给 featured。正文没披露具体基准测试条件和上市时间,这点先别太激动。
阿里平头哥的真武 M890 AI 芯片首次公开,主打 Agent 场景的算力底座。配套的 128 卡超节点服务器,卡间直连延迟低于 150 纳秒,机架带宽达到 Pb/s 级别。这套硬件已经在阿里云百炼平台跑起来了,支持通义千问、DeepSeek 和 Kimi 等模型。不过正文因为环境验证问题没加载出来,具体的芯片架构、制程、显存规格和实测性能数据暂时看...
推荐理由:HKR三项都踩中了,但得先打个折——消息源是阿里自己的技术文章,没有第三方实测、没提定价、也没说量产规模。所以分数就卡在featured门槛上,当个基础设施产品更新看比较合适。
Google 发布智能体开发平台 Google Antigravity 2.0。该平台在 Google DeepMind 官网被列为面向开发者的 agentic development platform,与 Gemini 应用、Google AI Studio 并列。原文未披露版本功能、参数或可用性细节。
美国能源部和英伟达要在阿贡国家实验室建两台 AI 超算。小的一台叫 Equinox,用 10,000 块 Grace Blackwell GPU;大的一台叫 Solstice,计划上 100,000 块还没发布的 Vera Rubin GPU。英伟达的 Ian Buck 说 Solstice 的算力能干到 5,000 exaflops,这个数字听听就好...
推荐理由:HKR 三项都踩实了:GPU 型号和数量是硬信息,DOE 与 NVIDIA 的角色分工清楚,电网瓶颈那段把 AI 的落地价值讲得很具体。不过来源是 NVIDIA 官方博客,信息偏单向,所以放在 featured 而不是 must-write 的档位,82 分在这个区间里是合理的。
NVIDIA 在 Spectrum-X 以太网平台上新增了 MRC(多路径 RDMA)支持,允许一个 RDMA 连接把流量分散到多条网络路径上,而不是死绑一条。这项技术已经在 Blackwell 集群里跑起来了,硬件层面能做到微秒级故障绕行和重路由。MRC 走的是 OCP 开放规范,支持多平面组网,目标是把集群规模推到几十万张 GPU。不过博客没给出具...
推荐理由:我会先打个折:这是英伟达自己的产品稿,不是第三方评测。MRC 把一条 RDMA 流拆到多条物理路径上跑,微秒级检测断连并硬件重路由,正文说已经在 Blackwell 部署里用了。这点先别太激动,因为没给第三方验证数据。真正值得看的是他们把这套东西推到 OCP 开放规范,配合多平面网络,目标是撑住几十万卡级别的训练集群——如果真能落地,对大规模训练的网络成本会有实打实的影响。
OpenAI 把自家训练大模型用的网络方案 MRC(多路径可靠连接)通过 OCP 开源了。MRC 解决的是老问题:集群大到一定程度,网络抖动和链路故障会频繁卡死训练任务,GPU 空转烧钱。它的做法是把一次数据传输拆成几百条路径同时发(packet spraying),哪条路断了就在微秒级绕开,不用等全网重算路由。协议跑在 800Gb/s 网卡上,基于 ...
推荐理由:MRC 是个多路径可靠连接协议,简单说就是给 GPU 集群的通信多备几条路,一条断了还能走别的,训练不容易崩。OpenAI 通过 OCP 公开这个方案,对自建大规模训练集群的团队是个信号——他们可能也在解决类似的网络稳定性问题。但正文没给任何性能数据,延迟降多少、吞吐提多少、实际跑过多大的集群,全都没写。所以我会先打个折,这更像一个技术方向的路标,离能评估效果还差得远。
NVIDIA 这篇博客主要讲了两件事:一是 Peter Steinberger 做的自托管持久化智能体 OpenClaw 在 GitHub 上火了,到 2026 年 3 月已经攒了 25 万颗星,增速超过了 React。二是 NVIDIA 自己推出了 NemoClaw,用 OpenShell 沙箱和 Nemotron 模型来跑智能体。文章真正想聊的是治...
推荐理由:我会先打个折:这是 NVIDIA 官方博客,立场肯定偏向自家 Nemotron 和 NemoClaw,但文章没回避常驻 Agent 最要命的问题——token 成本暴涨和安全边界。OpenClaw 本身是 Peter Steinberger 做的自托管常驻 Agent,NVIDIA 用 OpenShell 沙箱和 Nemotron 模型给它加了网络、数据访问的默认限制,这个加固思路比单纯吹性能更有信息量。文中给出的推理后 token 增 100 倍、自治 Agent 再增 1000 倍的估算,虽然没披露测算口径,但把成本焦虑直接量化了,对做落地的人...
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工介入审批能力,ASML、ABANCA、CMA-CGM 等客户已用于自动化关键流程。
推荐理由:原文给出 Workflows 的编排能力、部署模型与客户案例,可据此判断企业级 AI 流程落地的工程门槛。
DeepSeek 发了 V4,分 Pro 和 Flash 两个版本,都支持 100 万 token 的上下文窗口。Pro 版总参数 1.6 万亿,每次推理激活 490 亿;Flash 版总参数 2840 亿,激活 130 亿。跑分不是最顶尖的,但这不是重点。真正的改进在推理成本上:跟 V3.2 比,Pro 版处理单个 token 的算力只要 27%,K...
推荐理由:DeepSeek-V4 是国产旗舰模型更新,Pro 版 1.6T 总参、49B 激活,Flash 版 284B 总参、13B 激活,都支持 100 万 token 上下文。最值得看的是成本:Pro 单 token 计算量只有 V3.2 的 27%,KV 缓存降到 10%;Flash 更狠,分别只有 10% 和 7%。这意味着跑长上下文 agent 时显存和算力开销大幅缩水,不是光喊口号。HKR 三项全中,放在当天必读档没问题。
Hugging Face 发了一篇技术指南,拆解了他们刚做的 Chrome 插件“Transformers.js Gemma 4 浏览器助手”。核心是把 Gemma 4 E2B 模型塞进浏览器的后台 Service Worker 里本地运行,不靠云端。文章重点讲了 Manifest V3 下三个运行环境的职责划分:后台负责跑模型推理,侧边栏做聊天界面,...
推荐理由:这是一篇 Hugging Face 的实操教程,不是模型或平台发布,但把 MV3 架构拆解得挺具体。我会先打个折,因为正文没给出实际延迟或内存占用的测试数据,效果验证还缺一块。不过对想在前端跑本地模型的开发者来说,这篇的工程参考价值够得上 featured 门槛。
OpenAI 发现,当模型推理速度从每秒 65 个 token 飙到近 1000 个 token 时,API 本身的处理开销反而成了拖慢 agent 循环的瓶颈。他们给 Responses API 加上了 WebSocket 支持,思路是把多次独立的 HTTP 请求换成一个长连接,在连接存活期间缓存住对话状态和可复用的上下文,只传新的工具调用结果,省掉...
推荐理由:这是 OpenAI 面向开发者的系统层更新:用 WebSocket 长连接加连接级缓存,把 agent 循环里反复建连、重复请求的开销压下去。HKR 三项都踩中了,但正文没给出延迟降了多少、吞吐多大、适合什么负载,所以只能算中等偏上的 featured,不能拉满。真正值得盯的是长连接怎么省掉往返成本,这不是换模型,是工程侧省钱省时间的优化。
Anthropic 宣布加深与亚马逊的合作,为训练和部署 Claude 锁定了最高 5 吉瓦的算力。这批算力从这个季度开始陆续到位,到 2026 年底预计先上线近 1 吉瓦。5 吉瓦是个什么概念?大概相当于几个大型数据中心的满负荷运转,说明他们接下来要把模型规模或服务量再往上拉一个台阶。不过正文没披露合同金额、具体用什么芯片、数据中心建在哪,所以实际成...
推荐理由:标题里的 5 吉瓦别直接信,那是远期上限,真正有谱的是今年底先到 1 吉瓦。正文没提合同金额、用什么芯片、数据中心在哪,所以成本结构和实际性能都还是问号。我会先打个折看交付节奏,但能在这个时间点锁产能,对 Anthropic 的训练和部署确实是颗定心丸。
Mistral AI 发布 Spaces CLI,同时面向人类开发者与编码智能体。它通过 `spaces init`、`spaces dev` 等命令快速搭建多服务项目,并为每个交互式提示提供对应的 flag 与 `-y` 选项,使智能体可自主完成配置与部署。每次 init 还会生成 context.json 和 AGENTS.md,为智能体提供项目上下文与操作规则。
NVIDIA 在 GTC 上主推两件事:一是让 AI 助手直接在 RTX 电脑和 DGX Spark 小超算上本地跑,不用联网,隐私和 token 成本都省了。DGX Spark 有 128GB 统一内存,能塞下 120B 参数以上的模型。二是发新模型,包括小号的 Nemotron 3 Nano 4B 和大号的 Nemotron 3 Super 120...
推荐理由:我会先打个折:正文没披露标题里“最新开放模型”的全量清单和价格,所以不能给更高分。但 HKR 三项都站得住——本地跑大模型和代理的钩子够强,128GB 统一内存和 PinchBench 分数是实打实的数字,而且本地推理正好踩在隐私和成本这两个行业痒点上。保留 featured,不往上提,因为信息有缺口,来源也是厂商发布稿。
NVIDIA 和 Thinking Machines Lab 宣布了一项多年合作,核心是部署至少 1 吉瓦的 NVIDIA Vera Rubin 系统,目标明年年初上线,用来训练前沿模型和搭建可定制的 AI 平台。1 吉瓦这个数字很夸张,相当于一个大型核电站的发电量,说明这不是普通的云服务采购,而是直接锁定了一整座“算力电厂”的产能。合作还涉及基于 N...
推荐理由:1 吉瓦 Vera Rubin 承诺把这条合作从普通公关稿里拎了出来:H 靠规模,K 靠具名系统和部署时间,R 靠前沿算力竞争。没给 P1 是因为来源是厂商博客,投资金额、算力归属、分阶段细节正文都没披露,我会先打个折。
Hugging Face 宣布 GGML 和 llama.cpp 的团队正式加入公司。Georgi Gerganov 和他的团队会继续把全部时间花在维护 llama.cpp 上,项目的技术方向和社区管理保持完全独立,不会变成闭源。这次合作最实际的变化是,他们会把 transformers 库里的模型定义更顺滑地接到 llama.cpp 里,目标是做到近...
推荐理由:我会先打个折:正文只说了团队加入和方向,没给时间表、团队规模和商业条款,所以别当成交割日来看。但这件事确实值得盯——HF 把 GGML/llama.cpp 团队收进来,等于把本地推理最核心的工程力量绑定了,同时承诺保持 100% 开源和社区自主。真正有意思的是技术对接:如果 transformers 的模型定义能一键落到 llama.cpp,对开发者来说省掉一大截适配工作。这点先别太激动,等他们真把“单击发布”做出来再说。
Mistral AI 团队在 vLLM 上排查一起内存泄漏:在 Mistral Medium 3.1、开启 graph compilation 的 Prefill/Decode 分离部署中,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。Heaptrack 显示堆内存稳定,泄漏发生在堆外,最终指向 NIXL 经 UCX 传输 KVCache 的环节。
NVIDIA 在 CES 上放出了一套本地 AI 视频生成方案,核心是开源模型 LTX-2 和升级版 ComfyUI。在 GeForce RTX 显卡上,生成速度比之前快 3 倍,显存占用最多能降 60%。这主要靠 PyTorch-CUDA 的底层优化,以及 ComfyUI 原生支持了 NVFP4/FP8 低精度计算。下个月还会推一个 RTX Vide...
推荐理由:我会先打个折:这是厂商博客发的生态优化更新,不是新模型发布或平台级变动,所以重要性停在 76 不动。但 HKR 三项都站得住——提速降显存的数据够具体,技术路径也交代清楚了,对玩本地 ComfyUI 的人来说是实打实的好消息。正文没提 LTX-2 模型本身的画质对比,这点先别太激动,等实测。
NVIDIA 在 CES 2026 上宣布,由六颗芯片组成的 Rubin AI 平台已经进入全面量产。最直接的好处是生成 token 的成本能压到上一代平台的十分之一左右。Rubin 的 GPU 在 NVFP4 精度下推理算力达到 50 petaflops,并且通过一个叫 KV-cache 的存储层把性能又提升了 5 倍。另外,他们还发布了一套叫 Al...
推荐理由:HKR-H 成立,因为 Rubin 进入量产状态本身就是信号,不是路线图更新。HKR-K 靠 50 PFLOPS、5 倍吞吐和约 1/10 成本这几组数字撑起来,比口号实在。HKR-R 成立,因为推理经济学和 NVIDIA 的节奏仍然牵动整个行业,不过公司博客的包装感让它到不了 90 分。
英伟达在博客里公布了下一代 DGX SuperPOD 的规划,核心是换装 Rubin GPU。今年下半年会先出两款机型:DGX Vera Rubin NVL72 和 DGX Rubin NVL8。一个 SuperPOD 可以把 8 台 NVL72 拼在一起,总共塞进 576 颗 Rubin GPU,FP4 算力 28.8 exaflops,总显存 60...
推荐理由:这是一份有硬数字的NVIDIA基础设施路线图:576颗Rubin GPU、28.8 exaflops FP4、600TB内存、260TB/s NVLink,以及推理token成本最多降10倍。HKR三项都站得住,但本质上还是厂商路线图预告,不是已发货的产品或大规模公开发布,所以我会先打个折,重要性给到81。
Mistral 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率,并称准确率超过企业文档处理方案和 AI 原生 OCR 方案。
推荐理由:Mistral OCR 3 在表单、手写和复杂表格上的升级与每千页 2 美元的定价,可供评估文档解析方案时参考。
Mistral AI 宣布与 SAP 建立多年合作伙伴关系,为其 AI Foundation 集成 Mistral 模型,并共同开发面向欧洲复杂行业与公共部门的定制方案。同时与 Helsing 合作加速面向国防与安全应用的视觉-语言-动作模型研发。Mistral AI 还将在未来数月内于德国开设办公室,并大幅扩充本地团队。
Mistral AI 发布 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
推荐理由:原文给出企业级 AI 生产化的三大支柱与私有 beta 入口,可据此判断其与现有 MLOps 工具的差异。
OpenAI 自己设计芯片和系统,博通负责把加速器、以太网、PCIe 和光纤网络打包成整机柜,从 2026 年下半年开始上架,2029 年底前完成全部 10 吉瓦的部署。10 吉瓦这个数字很大,说明 OpenAI 在为未来几年的算力需求提前铺路,而且明确走自研芯片加全以太网集群的路线,不再只依赖英伟达。不过公告没提芯片用几纳米工艺、具体性能参数,也没说...
推荐理由:OpenAI 把自研芯片路线图摆上台面了:和 Broadcom 合作,目标是 10 吉瓦加速器,2026 下半年开始上架,2029 年底前铺完。我会先打个折——正文没披露芯片制程、单卡规格和资本开支,所以别急着算成本优势。真正值得看的是他们选了自研芯片加以太网集群这条路,Broadcom 负责网络和互连,说明不是小规模试水。这点先别太激动,但如果是真的,对英伟达依赖会松一扣。
OpenAI在10月1日宣布,三星和SK海力士正式加入它的星门(Stargate)AI基建项目。合作的核心是两件事:一是三星电子和SK海力士计划把先进内存芯片的产能拉到每月90万片DRAM晶圆,用来喂饱OpenAI的下一代模型;二是OpenAI跟韩国科技部、SK电讯、三星物产等签了一堆协议,打算在首尔圈外找地方建AI数据中心。三星和SK还会在自己公司内...
推荐理由:OpenAI 拉三星和 SK 进 Stargate,比一般合作多了一层供应链实锤:90 万片 DRAM 月产能目标摆在那,数据中心评估也签了协议。HKR 三项都站得住,但正文没披露投资额、时间表和具体机房规模,所以放在 featured 而不是 p1。
Stargate 项目在美国新增了五个 AI 数据中心选址,加上已有的德州 Abilene 旗舰园区和与 CoreWeave 的合作,总规划容量接近 7 吉瓦,三年内投资超过 4000 亿美元。这让他们有望在 2025 年底前提前锁定最初承诺的 5000 亿美元、10 吉瓦目标。其中 Oracle 负责的三个新址加一个扩建项目能提供超过 5.5 吉瓦容...
推荐理由:这是 OpenAI 官方放出的基建扩容消息,带着具体数字,不是泛泛的宣传稿。五个美国新站点把 Stargate 规划容量拉到近 7 吉瓦,Abilene 已经开始跑早期训练和推理,信息量够硬。HKR 三项全中:规模本身是钩子,新披露的容量、投资额和交付进度是增量知识,而算力供给紧张正是行业当下的核心焦虑,所以值得推。
OpenAI 和英伟达宣布了一份合作意向书,计划部署至少 10 吉瓦的英伟达系统,用来训练和跑 OpenAI 的下一代模型。10 吉瓦是什么概念?大概对应几百万张 GPU 的规模。英伟达打算按部署进度分批投钱,总额最高 1000 亿美元。第一阶段 1 吉瓦预计 2026 年下半年上线,会用英伟达新的 Vera Rubin 平台。不过得说清楚,目前这还只...
推荐理由:我会先打个折:目前只是一份意向书,最终条款还没敲定,所以别太激动。但即便只是意向,10 吉瓦的规模和最高 1000 亿美元的投资框架已经足够重磅。文章把交付节奏说清楚了——第一个 1 吉瓦 2026 下半年用 Vera Rubin 平台上线,后面按吉瓦分批落地、分批注资。如果是真的,这会是 AI 基础设施的一次大赌注,也解释了为什么微软的名字会出现在标签里。正文没披露具体的合同约束条款和退出机制,这点先留个心眼。
OpenAI 在 8 月 7 日公开了 GPT-5 系统卡。GPT-5 不是一个单一模型,而是一套组合:一个叫 gpt-5-main 的快模型负责回答大多数问题,一个叫 gpt-5-thinking 的深度推理模型处理难题,中间靠一个实时路由器根据对话类型、复杂度和用户意图(比如你说“仔细想想”)来决定调用谁。用量超标后,系统会切到各模型的 mini ...
推荐理由:这份 GPT-5 系统卡把架构说清楚了:gpt-5-main 干活,gpt-5-thinking 做推理,路由器实时调度,超额就切 mini 省资源。API 直接给 thinking、thinking-mini 和 thinking-nano 三个版本,ChatGPT 还多一个 thinking-pro。正文没写价格、上下文窗口和具体跑分,这点先别太激动。真正要盯的是安全分级——OpenAI 把 gpt-5-thinking 在生物和化学上的能力标成 High,说明模型在这些领域已经强到需要上防护了,不是走形式的例行文档。