返回新闻列表
2026-07-15 09:13
aibase

AI主权新突破:德国研究联盟发布开源大模型Soofi S

文本核心速览
  1. 德国发布开源大模型Soofi S由德国人工智能协会协调的研究联盟正式发布Soofi S30B-A3B开源大模型,总参数316亿,采用混合专家架构,结合Mamba-2与注意力层,推理时每token仅激活约32亿参数。
  2. 长文本生成效率优势显著在4万token上下文环境中,Soofi S生成吞吐量达到同规模传统稠密模型的8倍,且随上下文增加保持极高稳定性,计算成本大幅降低。
  3. 训练数据强化德语能力训练过程使用27万亿token,德语数据占比从第一阶段7.2%提升至第二阶段15.3%,融合报纸、维基百科及技术文档,显著提升德语复杂任务表现。
  4. 基准测试超越多款主流模型在英语和德语综合测试中,Soofi S超越OLMo332B、Apertus70B等开源模型,在代码生成、专业推理及德国区域性知识测试中表现顶尖。
  5. 开源基础设施与环保承诺模型在慕尼黑德国电信工业AI云上训练,使用512块Nvidia B200 GPU,完全由可再生能源驱动,后续将开源权重、代码及数据清单。

德国开源大模型Soofi S参数量316亿但只激活32亿,长文本吞吐量是同类8倍

德国人工智能协会协调的研究联盟直接甩出一个开源大模型——Soofi S30B-A3B,训练数据量高达27万亿token,德语占比从第一阶段的7.2%一路提高到第二阶段的15.3%。有开发者试了说,这货在德语任务上比英语还猛,专治各种“德国特色询问”。

架构够骚:Mamba-2加注意力,只让32亿参数干活

模型走的是混合专家架构,Mamba-2和标准注意力层混着用。总参数316亿,但每次生成只激活32亿参数——相当于你雇了316个员工,但每次只让32个人干活,省电又省算力。在4万token的上下文长度下,它的生成吞吐量是传统稠密模型的8倍左右,而且上下文越长越稳,群里在传“长文本读写速度像开了挂”。

数据偏科:德语占比从7.2%涨到15.3%,报纸维基百科技术文档全往里塞

训练过程分阶段,德语语料比例从第一阶段的7.2%拉到第二阶段的15.3%。素材包括报纸、维基百科、专业技术文档。有试用者反馈,用它处理德语合同、技术手册时,准确率明显高于其他开源模型,但要是问它“德国某小城市的数学题”,它可能会卡壳。

基准测试打脸:OLMo332B和Apertus70B被按在地上摩擦

在英语和德语综合测试里,Soofi S直接碾压OLMo332BApertus70B这类知名模型。代码生成、专业推理、德国区域性知识测试都拿到顶尖分数。不过研究团队自己也承认,超长上下文的精准提取和德语数学推理还有坑——比如给一个5万token的法律文档让它找一句话,它偶尔会跑偏。

基础设施:512块Nvidia B200 GPU,全部靠可再生能源跑

整个训练在慕尼黑德国电信工业AI云上搞完,用了512块Nvidia B200 GPU——烧了这么多顶级显卡,但电费全由可再生能源兜底。后续参数、训练代码、数据清单都会陆续开源,参与测试的开发者说“这透明度在欧洲是头一份”。

接下来盯着看什么

  • 欧洲企业会不会拿它做技术文档自动生成或代码审查——毕竟德语圈工业文档处理是个大市场。
  • 长上下文提取和德语数学推理的短板谁能先补上,这事直接影响它能不能替代闭源模型。
  • 让谁难受?OLMo332BApertus70B这类选手肯定要重新评估定价策略了。谁受益?所有需要低算力跑德语任务的团队,尤其那些被谷歌和OpenAI卡脖子的欧洲公司。
来源: aibase阅读原文

其他新闻

查看全部