# Harness-1：一个用强化学习练出来的200亿参数检索子智能体，能记住搜索状态

> 原标题：Harness-1：基于强化学习训练的有状态搜索20B检索子智能体

- 来源：AI HOT 精选
- 发布时间：2026-06-07T06:25:18.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35007
- 原文：https://www.marktechpost.com/2026/06/06/meet-harness-1-a-20b-retrieval-subagent-trained-with-reinforcement-learning-inside-a-stateful-search-harness-on-gpt-oss-20b

## 摘要

UIUC 和 Chroma 发布了一个叫 Harness-1 的检索子智能体，参数量 200 亿，基于 gpt-oss-20b 训练。它被放在一个“有状态搜索框架”里用强化学习训练，简单说就是模型在搜索时能记住上一步干了什么，再决定下一步怎么查，而不是每次都从头瞎找。在 8 个基准测试上，它的平均整理召回率是 0.730，比目前最好的开源子智能体高出 ...

## 推荐理由

HKR三项都站得住：Harness-1把强化学习和有状态搜索结合，机制讲得明白，基准测试结果也给了具体数字。分数定在78-84区间，因为它是个子智能体的研究发布，不是大厂主力模型，但开源圈确实需要这种能打的检索方案。

## 锐评

这条新闻值得点开看，因为它解决了一个很实际的痛点：让模型在多次搜索时别像金鱼一样忘事。Harness-1 的做法是把检索过程本身当成一个“有状态”的任务来训练，模型能根据前一步拿到了什么，调整下一步的查询词和检索策略，而不是每次都从零开始瞎碰。

数字上，它在 8 个基准上的平均整理召回率是 0.730，比目前最好的开源子智能体高出 11.4 个百分点，只输给 Opus-4.6。这个提升幅度不小，说明“记住上一步”确实管用。但要注意，文章没披露训练用了多少算力、推理延迟是多少，也没说这个 200 亿参数的模型在实际业务里跑起来成本高不高。

还缺一个关键信息：它是在 gpt-oss-20b 上训的，但没交代基座模型本身的能力边界。如果基座推理就弱，那检索策略再聪明也白搭。另外，所有测试都在基准上，真实场景里资料库乱七八糟的时候表现如何，正文没提。这点先别太激动。
