跳到正文
OpenAI News

OpenAI 发了个训练集 IH-Challenge,专门教大模型分清指令的优先级

Improving instruction hierarchy in frontier LLMs

OpenAI 这篇博客讲的是怎么让前沿大模型更听话——不是听所有人的话,而是学会按“系统 > 开发者 > 用户 > 工具”这个优先级来执行指令。他们做了一个叫 IH-Challenge 的训练数据集,用强化学习来练模型。设计上避开了三个坑:指令本身太复杂导致模型搞不清、靠另一个模型打分不靠谱、以及模型学会偷懒(比如无脑拒绝所有请求)。每个训练任务都很简...

推荐理由:OpenAI 公开了一个叫 IH-Challenge 的研究物件,专门搞指令层级和防注入,所以 HKR 三项都站得住。正文没给指标、没提具体模型、也没说怎么发布,信息缺口不小,分数就先打在 77 这个位置。

读原文 ↗导出 Markdown