跳到正文
r/LocalLLaMA

Nonobench v1.2 用数织谜题测了43个模型:开源DeepSeek V4 Pro排第四,但20×20困难模式全军覆没

Nonobench v1.2: 43 LLMs on nonogram puzzles. Open-weight DeepSeek V4 Pro ties for 4th, and no open model solves the new 20×20 Hard mode

一个叫Nonobench的基准测试用数织(Nonogram,类似像素填图谜题)考了43个大模型。开源模型DeepSeek V4 Pro跟几个闭源模型并列第四,但新出的20×20困难模式没有一个模型能解出来。正文只给了排名和难度分级,没披露具体得分和测试样本量,所以这个第四名含金量有多高、困难模式到底多难,目前还不好判断。

读原文 ↗导出 Markdown