# 英伟达开源 Polar 框架，不改代码就能让 Codex 跑分涨近 6 倍

> 原标题：英伟达推出 AI 框架 Polar，让 Codex 跑分暴涨 594.74%

- 来源：AI HOT 精选
- 发布时间：2026-05-28T02:14:52.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/28825
- 原文：https://www.ithome.com/0/956/293.htm

## 摘要

英伟达搞了个叫 Polar 的开源框架，专门解决一个实际问题：怎么在不重写 Codex、Claude Code 这些现成代码工具的前提下，用强化学习（GRPO，一种让模型在多步任务里根据奖励信号自己学会更优操作的训练方法）去训练它们。Polar 的做法很取巧，它不碰工具本身的执行逻辑，而是在模型和工具之间的 API 接口上做文章，把对话记录、采样结果这...

## 推荐理由

英伟达开源 Polar，用 GRPO 训练小模型 Qwen3.5-4B，Codex 在 SWE-Bench Verified 上从 3.8% 冲到 26.4%，这个提升幅度在代码 agent 圈子里很能打。技术细节和基准分都给得清楚，属于扎实的研究开源项，不是大模型或产品发布，所以放在 featured 档、82 分合理。

## 锐评

Polar 解决了一个很实际的工程问题：怎么给现成的代码工具（比如 Codex、Claude Code）加上强化学习训练，又不用把它们的内部逻辑拆了重写。做法是在模型和工具之间的 API 接口上做文章，把对话记录、采样结果这些信息截获下来，重建成训练数据。这比传统方法省事很多，不用去改那些复杂的执行外壳。

效果上，基于 Qwen3.5-4B 这个小模型，Codex 在 SWE-Bench Verified 上的 pass@1 从 3.8% 提到了 26.4%，确实涨了不少。但要注意，起点很低，3.8% 基本等于不会做，26.4% 也还远没到能用的程度。其他几个框架的提升幅度就小多了，Claude Code 只从 29.8% 提到 34.6%。效率方面，用了 prefix_merging 后训练步骤从 1185 次降到 218 次，时间快了 5 倍多，GPU 利用率也从 20% 拉到 87%，这部分工程优化挺扎实。

文章没提在大模型上的表现，也没说训练成本和最终模型的实际编程能力到底怎么样。4B 模型上的实验只能说明方法可行，离生产环境还有距离。
