跳到正文
Hacker News 首页

用 DeepSeek 教出来的模型,没学会它的审查习惯

Show HN: Distilling DeepSeek into GPT-OSS doesn't transfer censorship. Try it

CTGT 拿 DeepSeek V4 Flash 当老师,蒸馏出一个 120B 的金融模型。在 152 组配对测试里,老师碰到中国敏感话题时审查得分高出 45.45 分,但学生模型完全没这毛病——四个美国实验室的裁判一致认定它不审查。更意外的是,让学生自己改自己的错题再训练,金融推理成绩跟用 DeepSeek 教出来的一样好,成本却只有用 Inklin...

推荐理由:CTGT拿DeepSeek V4 Flash当老师,蒸馏出一个120B金融模型,发现审查行为没跟着迁移过来。152组测试里,老师碰到中国敏感话题审查倾向明显偏高,学生模型在四个独立裁判那里一致被判为不审查。更意外的是,让学生自己改自己的错题再训练,金融推理成绩跟用DeepSeek教出来的一样好,成本却只有用Inklin方案的一小截。正文没披露具体成本数字和Inklin的对比基准,这点先别太激动。但权重和评估框架都开源了,可复现性加分。

读原文 ↗导出 Markdown