跳到正文
TechCrunch · AI

Base Labs 联手 Hugging Face 和 Goodfire,要给开源模型做一套安全护栏

Base Labs launches an open-weight AI safety partnership with Hugging Face and Goodfire

Base Labs(Baseten 拆分出来的研究部门)宣布跟 Hugging Face、Goodfire 合作,专门为开放权重模型搭建安全评估和监控的基础设施。他们计划公开训练和监测方法,直接应对一个现实风险:有人用“abliteration”这类技术把模型的安全限制洗掉,让模型变得危险。abliteration 说白了就是通过修改模型内部参数,抹掉...

推荐理由:Base Labs 联手 Hugging Face 和 Goodfire,专门解决开放权重模型被“洗掉安全限制”的问题。我会先打个折,正文没披露具体的评估指标和延迟数据,但合作方阵容和公开方法的承诺,让这条消息对做模型部署的团队来说很实在。

读原文 ↗导出 Markdown