跳到正文

#部署/工程

今日 0 条

2025年8月5日星期二

OpenAI News

OpenAI 开源了两个新模型 gpt-oss-120b 和 gpt-oss-20b,用 Apache 2.0 协议,主打低成本部署和强推理能力

OpenAI 发了两个开源模型,大的叫 gpt-oss-120b,小的叫 gpt-oss-20b,都用了 Apache 2.0 协议,可以商用。这两个模型是 OpenAI 自 GPT-2 之后第一次开源的语言模型。它们用了混合专家架构,120B 版本总参数 1170 亿,但每次只激活 51 亿参数,一张 80GB 显存的显卡就能跑;20B 版本总参数 ...

推荐理由:当天就写。OpenAI 走 Apache 2.0 开源权重路线是策略转向,不是常规更新。H 落在动作意外性上,K 落在部署规格够具体,R 落在成本和开源闭源之争。没给 95+ 是因为正文截断,完整评测分数没披露,这点先别太激动。

2025年7月31日星期四

OpenAI News

OpenAI 在挪威建首个欧洲数据中心,计划 2026 年底塞进 10 万张英伟达 GPU

OpenAI 宣布了它在欧洲的第一个数据中心项目 Stargate Norway,选址在挪威的纳尔维克。这个项目由 Nscale 和 Aker 两家公司合资建设,初期规划供电容量 230 兆瓦,远期还想再扩 290 兆瓦。目标是到 2026 年底部署 10 万张英伟达 GPU,全部用可再生能源和直接到芯片的闭路液冷散热。OpenAI 是首批算力租户,但...

推荐理由:这是 OpenAI 把 Stargate 基建铺到欧洲的第一站,选址挪威纳尔维克,规模不小——先上 230MW,后面还规划再加 290MW,目标 2026 年底塞进 10 万张 NVIDIA GPU。我会先打个折:这更像战略基础设施的落地,不是马上能用的模型或产品能力更新。文章没披露具体投了多少钱、用的什么型号 GPU,所以别急着算性价比。真正值得看的是算力怎么分:OpenAI 自己先吃下一部分,剩下的容量开放给挪威、英国和北欧用户,这对欧洲的 AI 开发者来说是个实在的算力补给。整体判断维持 84 分,因为它是布局型大动作,不是即战力发布。

2025年7月30日星期三

Mistral AI

Mistral 发布 Codestral 25.08 与企业级编码栈

Mistral AI 发布 Codestral 25.08,并推出面向企业的完整编码栈,包含 Codestral、Codestral Embed、Devstral 与 Mistral Code IDE 插件。

推荐理由:原文给出 Codestral 25.08 的补全提升数据与整套企业级编码栈的部署方式,可据此判断私有化编码方案是否可行。

2025年7月23日星期三

2025年7月22日星期二

OpenAI News

OpenAI 与 Oracle 签下 4.5 GW 数据中心协议,Stargate 总规划容量已超 5 GW

OpenAI 和 Oracle 达成新协议,要在美国再建 4.5 GW(吉瓦)的 Stargate 数据中心。加上得州 Abilene 已在运行的 Stargate I 站点,Stargate 在建总容量超过 5 GW,能装下超过 200 万颗芯片。Abilene 那边已经收到首批 Nvidia GB200 机柜,开始跑早期训练和推理任务了。OpenA...

推荐理由:这条消息 HKR 三项全中:钩子是 4.5GW 这个量级本身,正文有具体容量和芯片数,算力供给是当下最要命的竞争变量。88 分放在当天基础设施新闻里合理,比模型发布或高管变动低一档,但战略影响够大。我会先打个折——正文没写这 4.5GW 具体分布在哪些州、什么时候能全部通电,也没提 Oracle 在这笔交易里出什么、OpenAI 出什么,这些缺口让判断只能停在“规模够猛、兑现待观察”上。

2025年7月3日星期四

Mistral AI

Mistral AI 推出 AI for Citizens 计划,助力各国政府自主掌控 AI

Mistral AI 推出 AI for Citizens 协作计划,帮助各国政府和公共机构战略性地运用 AI 改造公共服务、推动创新并保障竞争力。该计划提供开放模型与产品组合、自托管或 SaaS 部署选择、数据主权保障以及定制化研发,已与法国、卢森堡、新加坡、荷兰、英国、瑞士等国政府及公共部门展开合作。

2025年6月11日星期三

Mistral AI

Mistral AI 发布 Mistral Compute AI 基础设施

Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成堆栈,涵盖 GPU、编排、API 与产品服务。该服务由 Mistral 自研训练套件支撑,可训练和部署任意 AI 负载,作为 NVIDIA 合作伙伴将提供最新参考架构与数万块 GPU。

2025年6月4日星期三

Mistral AI

Mistral AI 发布企业级编码助手 Mistral Code

Mistral AI 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量或本地 GPU 气隙部署,代码保留在企业边界内。

推荐理由:官方给出企业级编码助手的模型组合、部署方式与客户案例,可据此判断私有化编码方案的落地路径。

2025年5月28日星期三

2025年5月22日星期四

OpenAI News

OpenAI 把 Stargate 项目首次搬到海外,在阿联酋建 1GW 算力集群

OpenAI 宣布与 G42、Oracle、英伟达、思科和软银合作,在阿布扎比启动 Stargate UAE,这是 Stargate 算力基建项目第一次在美国之外落地。整个站点规划总容量 1GW,其中 200MW 预计 2026 年上线。这也是 OpenAI for Countries 计划的第一单,阿联酋会成为全球首个全国性接入 ChatGPT 的国...

推荐理由:这条消息我会先打个折:正文没披露钱怎么分摊、芯片数量多少、ChatGPT 全国接入到底怎么落地,所以没法给更高分。但它是 Stargate 第一次出海,还直接挂上主权算力这根敏感神经,对从业者来说,比单纯建个数据中心更值得盯。

2025年5月8日星期四

OpenAI News

OpenAI 向美国能源部提交 AI 基建方案,核心是催联邦政府出地、加速审批、给钱

OpenAI 在 5 月 7 日公开了对美国能源部的回应,核心诉求就三条:联邦土地拿出来建 AI 超算园区、审批流程要走快速通道、用优惠电价和税收减免帮私人投资兜底。第一个 Stargate 园区已经在得州 Abilene 动工,更多选址还在得州和其他州评估,但具体租金、电价折扣、税收条款正文都没披露。整篇东西本质上是政策游说,把数据中心、能源和审批包...

推荐理由:这是一份政策文件,不是产品更新,但 HKR 三项都踩中了。它把联邦土地、审批和电力跟 AI 算力扩张绑在一起,Abilene 的 Stargate 园区动工是实锤,税收激励、电价和租赁条款正文没披露,这点先别太激动。

2025年5月7日星期三

Mistral AI

Mistral AI 推出 Le Chat Enterprise,由 Mistral Medium 3 驱动

Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。

推荐理由:原文列出企业版的功能清单与部署方式,可据此判断它对企业知识接入和自托管需求的覆盖程度。

Mistral AI

Mistral AI 发布 Mistral Medium 3,主打低成本与企业部署

Mistral AI 发布 Mistral Medium 3,称其在各项基准上达到或超过 Claude Sonnet 3.7 的 90%,成本为每百万 token 输入 $0.4、输出 $2。

推荐理由:Mistral Medium 3 以更低成本对标 Claude Sonnet 3.7,并给出企业私有化部署与定制路径。

2025年3月31日星期一

OpenAI News

OpenAI 拿了 400 亿美元新融资,估值冲到 3000 亿

OpenAI 宣布完成 400 亿美元融资,投后估值 3000 亿美元。这笔钱主要用来扩建算力基础设施,以及给每周 5 亿人用的 ChatGPT 开发更强功能。软银是这轮的关键合作方。公告没提钱分几批到账、有没有对赌条款,也没说具体产品路线图,AGI 的说法比较笼统。

推荐理由:标题拿 AGI 说事,但正文其实没讲怎么通向 AGI,我会先打个折。核心信息是 OpenAI 又拿了 400 亿美元,软银领投,估值推到 3000 亿,钱主要砸算力,同时提了一嘴 ChatGPT 现在每周有 5 亿人在用。这几个数字摆出来,对行业里看资本流向和算力储备的人来说,已经够直接了。不过正文没披露融资结构、钱分几批到账、具体产品什么时候出来,所以别把 AGI 的标题太当真,重点还是这轮融资的规模和投向。

2024年10月23日星期三

OpenAI News

OpenAI 把一致性模型简化并扩展到 15 亿参数,两步出图,质量追平扩散模型

OpenAI 发了个新方法叫 sCM,把连续时间一致性模型的训练搞稳定了,直接扩到 15 亿参数,在 512×512 的 ImageNet 上跑。它只用两步采样,出图质量就能跟现在最好的扩散模型打平,单张 A100 上 0.11 秒出一张图,比扩散模型快大约 50 倍。论文里对比了有效算力,sCM 花不到 10% 的算力就拿到差不多的 FID 分数。不...

推荐理由:这篇论文把连续时间一致性模型真正做大了,15 亿参数在 ImageNet 512×512 上跑通,两步采样就能拿到跟扩散模型差不多的样本质量,墙钟速度快了大约 50 倍。单张 A100、batch size=1、没做推理优化时 0.11 秒出一张图,这个数对实际部署有参考价值。我会先打个折:正文没披露跟其他快速采样方案(比如蒸馏模型)的直接对比,也没说训练用了多少算力,所以“快 50 倍”是跟谁比、代价多大,还得看后续细节。但能把快采样和大规模训练同时稳住,本身就是一个信号,说明这条路在工程上开始走得通了。

2024年10月2日星期三

OpenAI News

OpenAI 拿了 66 亿美元新融资,估值推到 1570 亿美元

OpenAI 宣布完成 66 亿美元融资,投后估值 1570 亿美元。钱会花在前沿 AI 研究、增加算力和继续做产品工具上。现在 ChatGPT 每周有超过 2.5 亿人在用。正文没披露具体投资人名单、持股条款,也没说算力具体会扩到多大规模。

推荐理由:OpenAI 官方发的融资公告,66 亿美元、1570 亿估值、2.5 亿周活用户,三个数摆出来就够了。我会先打个折:投资方是谁、股权怎么安排、算力具体扩多少,正文全没写,所以别急着脑补。真正值得盯的是钱又流向了算力,这条线比估值本身更说明问题。

2024年10月1日星期二

OpenAI News

OpenAI API 自动缓存重复的提示词前缀,费用直接打五折

OpenAI 给 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini 的 API 加上了自动提示词缓存。只要你的请求里有一段超过 1024 个 token 的前缀最近被用过,系统就会自动命中缓存,这部分输入 token 的价格直接减半。缓存从 1024 token 起步,按 128 token 的粒度往上加。不过这个缓存不是...

推荐理由:OpenAI 这次没发新模型,但给 API 加了自动提示缓存,复用前缀就能省一半输入费用。我会先打个折:缓存不是永久的,空闲 5-10 分钟就可能被清,最长活不过 1 小时,所以别把它当长期存储。真正有用的地方是 cached_tokens 这个返回字段,能直接看命中率,团队可以据此优化公共前缀设计。对跑长上下文、固定系统提示或大批量推理的团队,这是近期最直接的成本优化手段,值得马上测一下自己的复用率。

2024年8月6日星期二

OpenAI News

OpenAI 给 API 加了“结构化输出”,让模型按你给的 JSON 模板回话

OpenAI 在 2024 年 8 月 6 日上线了 Structured Outputs 功能,模型能严格按开发者提供的 JSON Schema 输出,不再只是生成合法 JSON 就完事。新模型 gpt-4o-2024-08-06 在复杂 schema 测试里拿了 100% 的准确率,而老模型 gpt-4-0613 不到 40%。用法上,在函数调用里...

推荐理由:我会先打个折,这不是新模型发布或公司级大事件,但把 JSON 模式从“输出合法 JSON”升级到“严格匹配你的 schema”,并且给出 100% 对不到 40% 的评测对比,对天天跟解析错误搏斗的开发者来说太解渴了。约束解码加模型训练这套组合拳,比旧版 JSON mode 靠谱得多,直接拉高了工具调用的下限。84 分给的是一个高价值的 API 能力更新,不是行业地震,但够实用。