# Base Labs 联手 Hugging Face 和 Goodfire，要给开源模型做一套安全护栏

> 原标题：Base Labs launches an open-weight AI safety partnership with Hugging Face and Goodfire

- 来源：TechCrunch · AI
- 发布时间：2026-09-17T17:15:59.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57297
- 原文：https://techcrunch.com/2026/09/17/base-labs-launches-an-open-weight-ai-safety-partnership-with-hugging-face-and-goodfire/

## 摘要

Base Labs（Baseten 拆分出来的研究部门）宣布跟 Hugging Face、Goodfire 合作，专门为开放权重模型搭建安全评估和监控的基础设施。他们计划公开训练和监测方法，直接应对一个现实风险：有人用“abliteration”这类技术把模型的安全限制洗掉，让模型变得危险。abliteration 说白了就是通过修改模型内部参数，抹掉...

## 推荐理由

Base Labs 联手 Hugging Face 和 Goodfire，专门解决开放权重模型被“洗掉安全限制”的问题。我会先打个折，正文没披露具体的评估指标和延迟数据，但合作方阵容和公开方法的承诺，让这条消息对做模型部署的团队来说很实在。

## 锐评

Base Labs 从 Baseten 拆分出来后，第一件事就是跟 Hugging Face、Goodfire 搭伙，专门给开放权重模型做安全评估和监控。他们想公开训练和监测方法，直接堵一个很实际的漏洞：有人用“abliteration”技术，通过修改模型内部参数把安全护栏洗掉，让模型变得危险。

合作方里有 Hugging Face 这种模型分发平台，还有 Goodfire 这种做可解释性工具的公司，组合比单纯发篇安全白皮书要实在。但文章没写具体怎么做、什么时候落地，也没提会覆盖哪些模型、用什么指标衡量安全。这些信息缺了，就没法判断这套东西到底能防住多少攻击。

对从业者来说，这事的意义在于：开放模型的安全问题终于有人想从基础设施层面解决，而不是只靠模型发布时的一次性对齐。但能不能跑通，还得看他们后续放出的方法和实际效果。
