OpenRouter 上线 Ori Eval:用你自己的代码和提示词,跑分找出最合适的模型
OpenRouter 推出 Ori Eval:用你的数据证明哪款模型最适合你的项目
OpenRouter 在 7 月 31 日推出了 Ori Eval,一个能直接在你代码库里跑模型对比的工具。它会自动扫描你代码里所有调用模型的地方,问你更在意准确度、延迟还是成本,然后根据你的回答生成评测文件,并用你真实的提示词去跑 5 款最新的模型。最后给你一张表,列出每款模型的 bug 捕获率、中位延迟和每次任务的花费。文章里给的例子是 Claud...
推荐理由:OpenRouter 发了一个实用工具,让开发者用自己的代码库和真实提示词给模型跑分,输出 bug 捕获率、延迟和成本。机制具体,痛点真实,对天天选模型的人有用。没给更高分是因为正文没披露评测的统计稳定性,比如样本量够不够大、结果可复现性如何,这点先别太激动。