热点事件历史事件
OpenRouter 基准测试 Jev 与大模型:客服分类便宜百倍但无法生成文本
2 篇报道1 个报道来源7 天前更新
先了解这件事
报道摘要
OpenRouter 拿 TypeSafe 的 Jev 1.13 跟 GPT Luna、Claude Opus 跑了 60 张客服工单。Jev 做分类和判断要不要升级,每 1000 张票只要 0.025 美元,中位延迟 194 毫秒;Luna 要 0.09 美元,Opus 要 2.88 美元。Jev 直接返回带概率的类型化结果,不用再解析 JSON。但...
摘自 AI HOT 精选
报道时间线
沿着报道,了解事件的不同侧面。
9月22日
- AI HOT 精选OpenRouter 实测:Jev 1.13 做银行客服意图分类,准确率比 Claude Opus 5 低 3.3 个百分点,但快 13 倍、便宜 22 倍
OpenRouter 拿 Banking77 数据集里的 3080 条客服原话,让 Jev 1.13 和 Claude Opus 5 分别把每条分到 77 个意图里。Jev 准确率 81.0%,Opus 84.4%,差了 3.3 个百分点,但 Jev 的中位延迟只有 175 毫秒,Opus 要 2266 毫秒;每处理一千条请求,Jev 成本 0.11 ...
9月19日
- AI HOT 精选OpenRouter 实测:Jev 做决策比大模型便宜 100 倍,但它不会写回复
OpenRouter 拿 TypeSafe 的 Jev 1.13 跟 GPT Luna、Claude Opus 跑了 60 张客服工单。Jev 做分类和判断要不要升级,每 1000 张票只要 0.025 美元,中位延迟 194 毫秒;Luna 要 0.09 美元,Opus 要 2.88 美元。Jev 直接返回带概率的类型化结果,不用再解析 JSON。但...