跳到正文
热点事件观察中

Nonobench v1.2 用数织谜题测了43个模型:开源DeepSeek V4 Pro排第四,但20×20困难模式全军覆没

1 篇报道1 个报道来源3 天前更新

先了解这件事

事实说明

一个叫Nonobench的基准测试用数织(Nonogram,类似像素填图谜题)考了43个大模型。开源模型DeepSeek V4 Pro跟几个闭源模型并列第四,但新出的20×20困难模式没有一个模型能解出来。正文只给了排名和难度分级,没披露具体得分和测试样本量,所以这个第四名含金量有多高、困难模式到底多难,目前还不好判断。

报道时间线

沿着报道,了解事件的不同侧面。

9月27日
  1. r/LocalLLaMA
    Nonobench v1.2 用数织谜题测了43个模型:开源DeepSeek V4 Pro排第四,但20×20困难模式全军覆没

    一个叫Nonobench的基准测试用数织(Nonogram,类似像素填图谜题)考了43个大模型。开源模型DeepSeek V4 Pro跟几个闭源模型并列第四,但新出的20×20困难模式没有一个模型能解出来。正文只给了排名和难度分级,没披露具体得分和测试样本量,所以这个第四名含金量有多高、困难模式到底多难,目前还不好判断。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。