跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 101–107 条 · 共 107 条

2025年6月10日星期二

Mistral AI

Mistral AI 发布首款推理模型 Magistral,含 24B 开源版与企业版

Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。

推荐理由:Mistral AI 推出推理模型 Magistral,同时给出 24B 开源版与企业版,并披露两者在 AIME2024 上的得分,可比较开源与商用版本的性能差距。

2025年5月21日星期三

Mistral AI

Mistral AI 发布智能体编码模型 Devstral,Apache 2.0 开源

Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SOTA 模型高出 6 个百分点以上。

推荐理由:Mistral 与 All Hands AI 联合发布的智能体编码模型,给出了 SWE-Bench Verified 成绩与本地部署门槛。

2025年5月7日星期三

Mistral AI

Mistral AI 发布 Mistral Medium 3,主打低成本与企业部署

Mistral AI 发布 Mistral Medium 3,称其在各项基准上达到或超过 Claude Sonnet 3.7 的 90%,成本为每百万 token 输入 $0.4、输出 $2。

推荐理由:Mistral Medium 3 以更低成本对标 Claude Sonnet 3.7,并给出企业私有化部署与定制路径。

2025年3月17日星期一

Mistral AI

Mistral AI 发布 Mistral Small 3.1,支持多模态与 128k 上下文

Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能、多模态理解,并将上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,以 Apache 2.0 许可开源。

推荐理由:Mistral AI 以 Apache 2.0 许可开源 Mistral Small 3.1,将上下文扩至 128k tokens 并加入多模态理解,可在单张 RTX 4090 或 32GB 内存的 Mac 上运行。

2025年3月12日星期三

Hugging Face 博客

谷歌发布 Gemma 3 系列开源模型,最高 270 亿参数,能看图、懂 140 多种语言

Gemma 3 是谷歌最新放出的开放权重模型,有 1B、4B、12B、27B 四个尺寸。4B 及以上的版本能同时处理图片和文字,支持超过 140 种语言,上下文窗口拉到 128k token(1B 是 32k)。官方说 4B 的指令版在跑分上能打赢上一代 27B,27B 则超过了 Gemini 1.5 Pro。

推荐理由:谷歌放出 Gemma 3 开放权重模型,4B 及以上版本同时处理图文并支持超 140 种语言,官方称 4B 指令版跑分超过上一代 27B。

2024年10月1日星期二

OpenAI News

OpenAI 在 API 里上线了模型蒸馏,让你用大模型的回答去教小模型

OpenAI 10 月 1 号在自家 API 里推了一套模型蒸馏工具,核心思路是:先用 GPT-4o 或 o1-preview 这类大模型跑出结果,再用这些结果去微调 GPT-4o mini 这种便宜模型,让它在特定任务上接近大模型的表现,但成本更低。

推荐理由:OpenAI 把模型蒸馏做成 API 内置流程,用 GPT-4o 或 o1-preview 的输出微调 GPT-4o mini,让团队不必自建这套流水线就能压低特定任务的推理成本。

2024年9月12日星期四

OpenAI News

OpenAI 发布 o1 系列模型,先想清楚再回答,数学推理从 13% 飙到 83%

OpenAI 在 9 月 12 日推出了 o1-preview 和 o1-mini 两个新模型,主打“先思考再回答”。在数学奥赛预选题上,GPT-4o 正确率只有 13%,o1 推理模型做到了 83%,编程能力也到了 Codeforces 前 11%。

推荐理由:OpenAI 推出 o1-preview 和 o1-mini,主打先思考再回答,数学奥赛预选题正确率从 GPT-4o 的 13% 提升到 83%,编程达到 Codeforces 前 11%。