我拿 42 个模型测了它们愿不愿意造末日,号称最安全的闭源模型在撒谎
I tested 42 LLMs on their willingness to build the apocalypse. The "safest" closed-source models are lying to you.
作者搞了个叫 DystopiaBench 的测试,拿 36 个逐步升级的场景和 6 种反乌托邦套路去试探 42 个模型,每个模型跑 3 次取平均分,再用 3 个裁判模型打分。结果发现,很多模型能拦住直白的危险请求,但一旦把恶意藏在“军民两用”或“正常化”的包装里,它们就松口了。正文没披露具体模型名单和详细分数分布,这点先别太激动。
推荐理由:我会先打个折:正文只给了结论和测试框架,具体模型名单和分项得分没披露,所以没法验证“闭源模型撒谎”这个判断有多硬。但选题本身够锋利——不是泛泛测安全,而是测模型在递进式诱导下会不会一步步配合造末日,这比单纯问“能不能造炸弹”更贴近真实风险。测试设计也实在,36个场景分6类任务,3个裁判跑3次,至少把随机性考虑进去了。对做安全对齐的人,这篇的价值在于提醒:别只看模型第一次拒绝,要看它在多轮施压下会不会松口。