# OpenAI 在 API 里发了 GPT-4.1 系列，代码和指令跟随提升明显，还多了个超便宜的 nano 版

> 原标题：Introducing GPT-4.1 in the API

- 来源：OpenAI News
- 发布时间：2025-04-14T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/583
- 原文：https://openai.com/index/gpt-4-1

## 摘要

OpenAI 在 4 月 14 号往 API 里塞了三个新模型：GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano。它们上下文窗口都拉到 100 万 token，知识截止到 2024 年 6 月。先说代码能力，GPT-4.1 在 SWE-bench Verified（一个让模型看代码库修 bug 的测试）上拿了 54.6%，比 GP...

## 推荐理由

OpenAI 这次发布不是刷榜，而是把 100 万 token 上下文、小模型价效比和明确的旧模型下线时间一起端出来。54.6% 的 SWE-bench 分数和 mini 成本降 83% 都是可复现的硬指标，nano 模型也第一次露面。对做 API 产品的人来说，这些数字直接决定要不要切模型、怎么控成本，所以 HKR 三项都成立。

## 锐评

这次更新最实在的是代码能力。GPT-4.1 在 SWE-bench Verified 上拿了 54.6%，比 GPT-4o 高出 21.4 个百分点，这个测试是让模型看真实代码库修 bug，比刷选择题硬核得多。指令遵循也涨了 10.5 个百分点，意味着它更听使唤，不容易跑偏。上下文窗口统一拉到 100 万 token，看超长文档或视频的能力有提升，Video-MME 长视频无字幕理解拿了 72%，是目前最高分。

省钱方面，GPT-4.1 mini 比 GPT-4o 便宜 83%，延迟还砍半，但官方说很多基准测试上 mini 能打平甚至超过 4o——这点先别太激动，得看具体任务，通常小模型在复杂推理上还是会露怯。nano 版主打分类和自动补全这类轻活，MMLU 拿了 80.1%，比 4o mini 还高，适合对延迟极度敏感的场景。

要注意的是，这些模型只走 API，ChatGPT 里不会直接叫 GPT-4.1，而是把部分能力陆续合进 4o。另外 GPT-4.5 Preview 三个月后下线，官方明说 4.1 在关键能力上相似或更好，还更便宜更快，等于变相承认 4.5 性价比不行。正文没披露这些模型的具体参数量和训练细节，安全评估也只字未提，实际落地前最好在自己业务数据上跑一轮。
