# OpenAI 开源 BrowseComp：一个专测 AI 浏览器特工找冷门信息能力的 1266 题基准

> 原标题：BrowseComp: a benchmark for browsing agents

- 来源：OpenAI News
- 发布时间：2025-04-10T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/584
- 原文：https://openai.com/index/browsecomp

## 摘要

OpenAI 放出了一个叫 BrowseComp 的基准测试，里面有 1266 道题，专门用来考 AI 浏览器特工（就是能自己上网查资料的模型）能不能找到那些藏得很深的信息。这个测试的设计思路是“难找但好验证”：每道题都要求一个简短、唯一的答案，出题的人会先确认 GPT-4o、o1 和早期深度研究模型都答不上来，并且用五个简单搜索在结果首页也找不到答案...

## 推荐理由

OpenAI 放出了一个具体的浏览器代理基准，HKR 三点都站得住。钩子是“难找但易验”，正文把出题规则讲清楚了，不是随便凑的题。这是研究/基准发布，不是模型或产品发布，重要性给 80、放 featured 合理。

## 锐评

这个基准测的不是“能不能搜到”，而是“能不能在几十上百个网页里挖出唯一答案”。出题逻辑挺聪明：先让人确认 GPT-4o、o1 和早期深度研究模型都答不上来，再用五个简单搜索确认首页找不到答案，最后才把题目放进去。1266 道题，答案都短且唯一，方便自动判分。

OpenAI 自己说，这种短答案设计让基准好用好验证，但也承认跟真实用户那种开放式提问的关联度还不清楚。这点先别太激动，它更像一个专项压力测试，不是通用能力标尺。

正文没披露具体模型在 BrowseComp 上的得分，也没说题目覆盖哪些领域、难度分布如何。光看例子，题目确实绕，需要跨多个信息源拼凑线索。如果后续有更多模型的跑分对比，才能看出这个基准到底能拉开多大差距。
