# OpenAI 发了个训练集 IH-Challenge，专门教大模型分清指令的优先级

> 原标题：Improving instruction hierarchy in frontier LLMs

- 来源：OpenAI News
- 发布时间：2026-03-10T11:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/165
- 原文：https://openai.com/index/instruction-hierarchy-challenge

## 摘要

OpenAI 这篇博客讲的是怎么让前沿大模型更听话——不是听所有人的话，而是学会按“系统 > 开发者 > 用户 > 工具”这个优先级来执行指令。他们做了一个叫 IH-Challenge 的训练数据集，用强化学习来练模型。设计上避开了三个坑：指令本身太复杂导致模型搞不清、靠另一个模型打分不靠谱、以及模型学会偷懒（比如无脑拒绝所有请求）。每个训练任务都很简...

## 推荐理由

OpenAI 公开了一个叫 IH-Challenge 的研究物件，专门搞指令层级和防注入，所以 HKR 三项都站得住。正文没给指标、没提具体模型、也没说怎么发布，信息缺口不小，分数就先打在 77 这个位置。

## 锐评

这篇博客讲的是 OpenAI 怎么让模型学会分辨指令的优先级，核心思路是用强化学习训练一个叫 IH-Challenge 的数据集。他们自己总结了三个容易踩的坑：指令本身太复杂导致模型分不清、靠另一个模型打分不靠谱、以及模型学会偷懒（比如无脑拒绝所有请求）。针对这些，他们设计的训练任务都尽量简单，并且能用 Python 脚本直接判对错，避免用 LLM 当裁判带来的偏差。

从结果看，这套方法主要提升了两个能力：一是模型更听系统提示里的安全策略（他们叫安全可操控性），二是对藏在工具输出里的提示注入攻击抵抗力更强。但正文没披露具体用了哪个基座模型、训练消耗了多少算力，也没给出量化的攻击成功率下降数据。这些缺口让“前沿模型”这个说法暂时只能当个方向性判断，实际效果还得等论文里的消融实验和第三方评测来验证。
