安全对齐不该一刀切:只拒绝话题里的有害部分,而不是整个话题
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
现在的安全对齐有个通病:把整个话题当成拒绝单位。比如 LlamaGuard-3 把“选举”归为“事实错误信息”,导致模型连“选举流程是什么”这种无害问题也拒答。Multiverse Computing 这篇论文提出“窄边界安全”,核心想法是,在同一个话题(比如政治)里,只拒绝有害的子集(比如写定向操纵内容),正常回答无害问题(比如选举事实)。做法是让部...
推荐理由:H 和 K 都打中了:角度尖锐,LlamaGuard-3 误标选举话题的例子很具体。R 偏弱,这是安全对齐的细分话题,不会在更广的圈子里被主动提起。定在 featured 门槛 72 分,没再往上是因为正文只给了摘要,完整实验和验证细节还没看到。