# 德国团队发布开源模型 Soofi S，30B 参数跑出 3B 成本，德语英语跑分双杀

> 原标题：German AI consortium releases Soofi S, an open 30B model that tops benchmarks

- 来源：Hacker News 首页
- 发布时间：2026-07-16T17:44:46.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44775
- 原文：https://the-decoder.com/german-ai-consortium-releases-soofi-s-an-open-30b-model-that-tops-benchmarks-in-both-english-and-german/

## 摘要

Soofi S 是一个 31.6B 参数的混合专家模型，每次生成只激活 3.2B 参数，推理成本压得很低。它用了 Mamba 加 Transformer 的混合架构，处理长文本时速度几乎不掉，这点比很多同尺寸模型强。训练数据故意向德语倾斜，结果在德语、英语和编程基准上分数都超过了 Olmo 3 32B 和 Apertus 70B。模型在德国电信的慕尼黑...

## 推荐理由

德国 AI 联盟放出的 Soofi S，一个 31.6B 参数的混合专家模型，每次只激活 3.2B 参数，推理成本压得很低。它用 Mamba 加 Transformer 的混合架构，长文本处理不掉速，在德语、英语和编程基准上分数都超过了 Olmo 3 32B 和 Apertus 70B。虽然德语优先的定位会限制它在中文圈的传播，但开源 30B 级别模型做到这个性能和成本，对从业者来说值得看一眼。

## 锐评

Soofi S 最值得看的是它的省钱思路：31.6B 参数的混合专家模型，每次生成只叫醒 3.2B 参数干活，处理 256K 长文本时推理速度几乎不降。这对需要处理大量文档又不想烧太多算力的场景很友好。训练数据故意向德语倾斜，结果在德语、英语和编程基准上分数都超过了 Olmo 3 32B 和更大的 Apertus 70B，说明数据配比比单纯堆参数有效。

争议集中在训练量上。按 Chinchilla 法则，模型参数和训练数据量有个最佳比例，但 Soofi S 用了约 27 万亿 token 训练，远超建议值。项目技术负责人反驳说，混合专家架构不适用老法则，因为不同专家可以重复看相同数据，Nvidia 也用过 25 万亿 token 训练。这个解释有道理，但正文没给出他们自己验证新法则的实验数据，说服力要打个折。

模型在德国电信的慕尼黑云上完成全部训练，代码和权重都开放，对想自己复现或微调德语模型的团队是个不错的起点。不过目前只看到基准跑分，缺真实业务场景的测试反馈，比如客服、合同审查这些德语强需求场景表现如何，还得等社区验证。
