新闻
2026-07-15
9
AI主权新突破:德国研究联盟发布开源大模型Soofi S

核心要点
- 1.德国研究联盟发布开源大模型Soofi S30B-A3B,采用混合专家架构,结合Mamba-2与注意力层。
- 2.模型总参数量316亿,推理时每token仅激活约32亿参数,实现高效生成。
- 3.在4万token上下文中生成吞吐量达同规模稠密模型的8倍。
- 4.训练数据强化德语,第二阶段德语数据占比提升至15.3%,在德语任务上表现突出。
- 5.基准测试超越OLMo332B和Apertus70B等开源模型,但超长上下文提取和德语数学推理仍有改进空间。
关键数据
总参数量: 316亿(Soofi S30B-A3B模型总参数量为316亿(31.6B)。)激活参数量: 32亿(推理时每个token仅激活约32亿参数,约为总参数的十分之一。)训练token总量: 27万亿(模型在长达27万亿token的数据上训练。)德语数据第一阶段占比: 7.2%(训练第一阶段德语数据占比。)德语数据第二阶段占比: 15.3%(训练第二阶段德语数据占比提升。)吞吐量提升倍数: 8倍(在4万token上下文长度下,生成吞吐量达到同规模传统稠密模型的8倍。)GPU数量: 512块(使用512块Nvidia B200 GPU在德国电信工业AI云上完成训练。)
影响评估
正面
该模型标志着欧洲在主权AI领域取得重要突破,为开源社区提供了高效、高性能的模型,增强了欧洲AI自主性。
Soofi S通过创新的混合专家架构实现了计算效率与性能的平衡,特别强化了德语能力,为欧洲工业应用提供了可信基座。其开源策略有助于推动透明研发和行业合作,但在超长上下文提取和德语数学推理方面仍有提升空间。
相关工具
Soofi S30B-A3B— 新发布的开源大语言模型。Mamba-2— 模型混合专家架构中使用的组件。Nvidia B200— 训练模型使用的GPU。OLMo332B— 被超越的开源模型之一。Apertus70B— 被超越的开源模型之一。
德国研究联盟发布开源大模型Soofi S30B-A3B,助力欧洲主权AI。该模型采用混合专家架构,融合Mamba-2与注意力层,总参数量316亿,但推理时每token仅激活部分参数,实现高效生成,为高性能开源模型领域注入新活力。
来源: aibase阅读原文