热点事件观察中
Nonobench v1.2 用数织谜题测了43个模型:开源DeepSeek V4 Pro排第四,但20×20困难模式全军覆没
1 篇报道1 个报道来源3 天前更新
先了解这件事
事实说明
一个叫Nonobench的基准测试用数织(Nonogram,类似像素填图谜题)考了43个大模型。开源模型DeepSeek V4 Pro跟几个闭源模型并列第四,但新出的20×20困难模式没有一个模型能解出来。正文只给了排名和难度分级,没披露具体得分和测试样本量,所以这个第四名含金量有多高、困难模式到底多难,目前还不好判断。
报道时间线
沿着报道,了解事件的不同侧面。
9月27日
- r/LocalLLaMANonobench v1.2 用数织谜题测了43个模型:开源DeepSeek V4 Pro排第四,但20×20困难模式全军覆没
一个叫Nonobench的基准测试用数织(Nonogram,类似像素填图谜题)考了43个大模型。开源模型DeepSeek V4 Pro跟几个闭源模型并列第四,但新出的20×20困难模式没有一个模型能解出来。正文只给了排名和难度分级,没披露具体得分和测试样本量,所以这个第四名含金量有多高、困难模式到底多难,目前还不好判断。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。