跳到正文
r/LocalLLaMA

Qwen 3.8 27B 在新版评测中依然能打

New Artificial Analysis scores but Qwen 3.8 27b Still holds up

Artificial Analysis 发布了 v4.2 版智能指数,Qwen 3.8 27B 排名没掉。这次更新加了两个新测试:AA-Briefcase(让模型模拟知识工作者的任务流程)和 Surge's GDP.pdf(一篇 4592 页的 PDF,测长文档推理能力),同时去掉了 GPQA Diamond,因为大家分数都刷满了,没区分度了。有用户说...

读原文 ↗导出 Markdown