# OpenRouter 上线 Ori Eval：用你自己的代码和提示词，跑分找出最合适的模型

> 原标题：OpenRouter 推出 Ori Eval：用你的数据证明哪款模型最适合你的项目

- 来源：AI HOT 精选
- 发布时间：2026-07-31T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48455
- 原文：https://openrouter.ai/blog/announcements/ori-eval

## 摘要

OpenRouter 在 7 月 31 日推出了 Ori Eval，一个能直接在你代码库里跑模型对比的工具。它会自动扫描你代码里所有调用模型的地方，问你更在意准确度、延迟还是成本，然后根据你的回答生成评测文件，并用你真实的提示词去跑 5 款最新的模型。最后给你一张表，列出每款模型的 bug 捕获率、中位延迟和每次任务的花费。文章里给的例子是 Claud...

## 推荐理由

OpenRouter 发了一个实用工具，让开发者用自己的代码库和真实提示词给模型跑分，输出 bug 捕获率、延迟和成本。机制具体，痛点真实，对天天选模型的人有用。没给更高分是因为正文没披露评测的统计稳定性，比如样本量够不够大、结果可复现性如何，这点先别太激动。

## 锐评

OpenRouter 在 7 月 31 日发布了 Ori Eval，一个能直接在你代码库里跑模型评测的工具。它会自动扫描你代码里所有调用模型的地方，问你更在意准确度、延迟还是成本，然后根据你的回答生成评测文件，并用你真实的提示词去跑 5 款最新的模型。最后给你一张表，列出每款模型的表现，比如文章里给的例子是 Claude Opus 5 抓到了 94% 的 bug，中位延迟 38 秒，每次任务花费 0.041 美元。

这个工具最大的好处是让评测结果直接和你的业务挂钩，而不是看通用排行榜。它生成的评测文件本身就是代码，可以放进 CI 流程里，以后模型更新或者代码改动时能自动跑一遍，防止性能倒退。正文没披露它具体怎么判断开放式回答的质量，只提了会用 LLM 当裁判，这点先别太激动，实际效果得看你的场景。另外，它目前只跑 5 款模型，如果你有特定想测的模型，得确认是否在候选列表里。
