跳到正文
AI HOT 精选

olmo-eval:一个给模型开发阶段反复跑分的评测台

olmo-eval:面向模型开发循环的评估工作台

Allen AI 把 OLMES 标准做成了一个叫 olmo-eval 的评测台,专门解决模型开发过程中需要反复测试的麻烦。它把让模型调用工具、多轮对话这类评测当成一等公民来支持,你可以根据任务需求选轻量跑分,或者用容器隔离跑更复杂的场景。整个架构是模块化的,模型、工具、运行环境、辅助模型都能独立替换。跑完分不只给个数字,还会附上标准误差和最小可检测效...

推荐理由:Allen AI 把自家的 OLMES 标准做成了 olmo-eval 评测台,专门解决模型开发时反复测试的麻烦。它把让模型调用工具、多轮对话这类评测当成一等公民来支持,你可以根据任务需求选轻量跑分,或者用容器隔离跑更复杂的场景。整个架构是模块化的,模型、工具、运行环境、辅助模型都能独立替换。跑完分不只给个数字,还会附上标准误差和最小可检测效应——这点挺加分,说明他们知道分数波动多大才算真变化。不过正文没披露具体支持哪些工具和任务,实际覆盖范围得打个问号。

读原文 ↗导出 Markdown