Mistral AI 发布首款推理模型 Magistral,含 24B 开源版与企业版
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral AI 推出推理模型 Magistral,同时给出 24B 开源版与企业版,并披露两者在 AIME2024 上的得分,可比较开源与商用版本的性能差距。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral AI 推出推理模型 Magistral,同时给出 24B 开源版与企业版,并披露两者在 AIME2024 上的得分,可比较开源与商用版本的性能差距。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SOTA 模型高出 6 个百分点以上。
推荐理由:Mistral 与 All Hands AI 联合发布的智能体编码模型,给出了 SWE-Bench Verified 成绩与本地部署门槛。
Mistral AI 发布 Mistral Medium 3,称其在各项基准上达到或超过 Claude Sonnet 3.7 的 90%,成本为每百万 token 输入 $0.4、输出 $2。
推荐理由:Mistral Medium 3 以更低成本对标 Claude Sonnet 3.7,并给出企业私有化部署与定制路径。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能、多模态理解,并将上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,以 Apache 2.0 许可开源。
推荐理由:Mistral AI 以 Apache 2.0 许可开源 Mistral Small 3.1,将上下文扩至 128k tokens 并加入多模态理解,可在单张 RTX 4090 或 32GB 内存的 Mac 上运行。
Gemma 3 是谷歌最新放出的开放权重模型,有 1B、4B、12B、27B 四个尺寸。4B 及以上的版本能同时处理图片和文字,支持超过 140 种语言,上下文窗口拉到 128k token(1B 是 32k)。官方说 4B 的指令版在跑分上能打赢上一代 27B,27B 则超过了 Gemini 1.5 Pro。
推荐理由:谷歌放出 Gemma 3 开放权重模型,4B 及以上版本同时处理图文并支持超 140 种语言,官方称 4B 指令版跑分超过上一代 27B。
OpenAI 10 月 1 号在自家 API 里推了一套模型蒸馏工具,核心思路是:先用 GPT-4o 或 o1-preview 这类大模型跑出结果,再用这些结果去微调 GPT-4o mini 这种便宜模型,让它在特定任务上接近大模型的表现,但成本更低。
推荐理由:OpenAI 把模型蒸馏做成 API 内置流程,用 GPT-4o 或 o1-preview 的输出微调 GPT-4o mini,让团队不必自建这套流水线就能压低特定任务的推理成本。
OpenAI 在 9 月 12 日推出了 o1-preview 和 o1-mini 两个新模型,主打“先思考再回答”。在数学奥赛预选题上,GPT-4o 正确率只有 13%,o1 推理模型做到了 83%,编程能力也到了 Codeforces 前 11%。
推荐理由:OpenAI 推出 o1-preview 和 o1-mini,主打先思考再回答,数学奥赛预选题正确率从 GPT-4o 的 13% 提升到 83%,编程达到 Codeforces 前 11%。