返回新闻列表
2026-07-29 09:12

国产GPU海光DCU适配Kimi K3,896专家并行稳跑万亿大模型

文本核心速览
  1. 全栈适配零改代码海光DCU完成Kimi K3万亿参数模型的全栈适配,模型无需任何代码改动即可直接运行,迁移成本几乎为零,开发者可快速上线部署。
  2. 针对MoE架构深度优化海光团队对Kimi K3的896专家MoE架构进行算子级定制,优化KDA注意力与通信开销,实现百万级上下文重载场景下的高效稳定推理。
  3. 性能折损控制在12%以内官方实测显示,国产GPU DCU相比海外芯片的性能折损不超过12%,已满足商用部署门槛,在成本与供应链安全上具备实际竞争力。
  4. 三方联合调优保障月之暗面、海光与中科曙光三方面联合,基于海光DCU硬件栈和中科曙光8000集群,从模型训练到推理全链路打通,保障稳定运行。

国产算力突破:万亿大模型跑在国产GPU上

海光信息近日宣布,已完成对月之暗面(Moonshot AI)万亿参数大模型Kimi K3在其DCU(Deep Computing Unit)平台上的全栈适配与性能验证。这标志着国产算力首次有能力稳定承载万亿级参数模型,不再局限于少数几款海外旗舰芯片。

零改代码,迁移成本极低

海光DCU从底层算子优化到推理引擎,模型代码无需任何改动即可直接运行,开发者拿到算力即可上线部署,迁移成本几乎为零。这种兼容性对于希望采用国产算力的团队来说是一大利好。

针对MoE架构的深度优化

Kimi K3采用KDA注意力机制与896专家组成的MoE(混合专家)架构。海光团队为DCU做了算子级的定制打磨:

  • 针对KDA注意力进行了特殊优化,减少通信开销
  • 896个专家同时并行时,通过算力调度确保推理高效稳定
  • 百万级上下文的超长文本场景下,依然保持流畅,不会出现卡顿

应用场景:长程智能体到芯片设计

在DCU上,Kimi K3能够支撑多种前沿应用场景:

  • 长程智能体工程:处理复杂多步骤任务
  • 视觉闭环创作:结合视觉与语言的多模态能力
  • 自主芯片设计:辅助EDA工具进行大规模逻辑综合

国产算力用户因此也能亲手跑通万亿级的开源模型,打破了过去依赖海外硬件的局面。

三方联合调优:月之暗面、海光与中科曙光

值得指出的是,月之暗面在发布K3之前,便已联合海光与中科曙光完成了完整的兼容性调优:

  • 中科曙光基于海光DCU硬件栈,打通了Kimi MoE架构的分布式训练与多卡并行推理链路
  • 海光DCU则依靠底层硬件与软件栈的协同优化,在曙光8000集群上实现了长文本推理的稳定运行

性能基准:折损控制在12%以内

官方实测数据给出了信心:国产GPU的性能折损被控制在12%以内,已经达到商用部署的门槛。这意味着在成本、供应链安全等维度上,国产算力具备了实际竞争力。

当万亿模型与国产GPU之间的那道墙被推开一道缝,智能时代的算力版图正在悄悄挪动。

海光DCU的突破不仅是一次技术验证,更是国产AI基础设施迈向成熟的重要一步。未来,随着更多模型适配和算力优化,国产芯片将在AI大模型部署中扮演越来越关键的角色。

来源: aibase阅读原文

其他新闻

查看全部