# OpenRouter 发布实时网页搜索基准：搜索预算比引擎和模型都重要

> 原标题：OpenRouter 推出实时网页搜索基准测试：如何为智能体选择引擎、深度与模型

- 来源：AI HOT 精选
- 发布时间：2026-08-12T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50274
- 原文：https://openrouter.ai/blog/announcements/web-search-benchmark

## 摘要

OpenRouter 搞了个实时更新的排行榜，把 Exa、Parallel、Perplexity 和各家模型自带的搜索引擎，搭配不同模型和搜索轮数，跑了一遍 BrowseComp、DeepSearchQA 等四个测试。最核心的发现是：多给模型几次搜索机会，是提升回答质量最便宜的办法。比如 Claude Opus 5 用 Perplexity 搜 1 次...

## 推荐理由

OpenRouter 自己下场跑跨引擎对比，对实际干活的人有参考价值。最核心的发现——多搜几次比升级模型更划算——能直接指导选型。没给更高分是因为这是平台方自己出的基准，不是独立第三方评测，我会先打个折。

## 锐评

OpenRouter 这次把 Exa、Parallel、Perplexity 和各家模型自带的搜索，搭配不同模型和搜索轮数跑了一遍排行榜。最核心的发现是：搜索预算（让模型多搜几次）对质量的提升，比换引擎或换模型都更直接。比如在 BrowseComp 这个硬核找事实测试里，Claude Opus 5 用 Perplexity 搜 1 次准确率只有 35.8%，搜 25 次直接拉到 89%，而成本只涨了 2.5 到 7 倍，性价比很高。

但也不是搜得越多越好。在 HLE 这种专家考试题上，GPT-5.6 Sol 搜 1 次和搜 25 次分数差不多，成本却翻了 3 倍，纯属浪费。另外有个坑要注意：模型找不到答案时会用光所有搜索次数，导致最坏情况下的成本飙升。正文没披露具体延迟数据，如果你对响应速度敏感，光看准确率和成本还不够。

排行榜是实时更新的，今天的冠军明天可能就换了。建议拿自己的业务场景测一下，别只看公开基准分。
