跳到正文
热点事件历史事件

OpenRouter 基准测试 Jev 与大模型:客服分类便宜百倍但无法生成文本

2 篇报道1 个报道来源7 天前更新

先了解这件事

报道摘要

OpenRouter 拿 TypeSafe 的 Jev 1.13 跟 GPT Luna、Claude Opus 跑了 60 张客服工单。Jev 做分类和判断要不要升级,每 1000 张票只要 0.025 美元,中位延迟 194 毫秒;Luna 要 0.09 美元,Opus 要 2.88 美元。Jev 直接返回带概率的类型化结果,不用再解析 JSON。但...

摘自 AI HOT 精选

报道时间线

沿着报道,了解事件的不同侧面。

9月22日
  1. AI HOT 精选
    OpenRouter 实测:Jev 1.13 做银行客服意图分类,准确率比 Claude Opus 5 低 3.3 个百分点,但快 13 倍、便宜 22 倍

    OpenRouter 拿 Banking77 数据集里的 3080 条客服原话,让 Jev 1.13 和 Claude Opus 5 分别把每条分到 77 个意图里。Jev 准确率 81.0%,Opus 84.4%,差了 3.3 个百分点,但 Jev 的中位延迟只有 175 毫秒,Opus 要 2266 毫秒;每处理一千条请求,Jev 成本 0.11 ...

9月19日
  1. AI HOT 精选
    OpenRouter 实测:Jev 做决策比大模型便宜 100 倍,但它不会写回复

    OpenRouter 拿 TypeSafe 的 Jev 1.13 跟 GPT Luna、Claude Opus 跑了 60 张客服工单。Jev 做分类和判断要不要升级,每 1000 张票只要 0.025 美元,中位延迟 194 毫秒;Luna 要 0.09 美元,Opus 要 2.88 美元。Jev 直接返回带概率的类型化结果,不用再解析 JSON。但...