2026-07-29 09:12
国产GPU海光DCU适配Kimi K3,896专家并行稳跑万亿大模型
文本核心速览
- 全栈适配零改代码—海光DCU完成Kimi K3万亿参数模型的全栈适配,模型无需任何代码改动即可直接运行,迁移成本几乎为零,开发者可快速上线部署。
- 针对MoE架构深度优化—海光团队对Kimi K3的896专家MoE架构进行算子级定制,优化KDA注意力与通信开销,实现百万级上下文重载场景下的高效稳定推理。
- 性能折损控制在12%以内—官方实测显示,国产GPU DCU相比海外芯片的性能折损不超过12%,已满足商用部署门槛,在成本与供应链安全上具备实际竞争力。
- 三方联合调优保障—月之暗面、海光与中科曙光三方面联合,基于海光DCU硬件栈和中科曙光8000集群,从模型训练到推理全链路打通,保障稳定运行。
国产算力突破:万亿大模型跑在国产GPU上
海光信息近日宣布,已完成对月之暗面(Moonshot AI)万亿参数大模型Kimi K3在其DCU(Deep Computing Unit)平台上的全栈适配与性能验证。这标志着国产算力首次有能力稳定承载万亿级参数模型,不再局限于少数几款海外旗舰芯片。
零改代码,迁移成本极低
海光DCU从底层算子优化到推理引擎,模型代码无需任何改动即可直接运行,开发者拿到算力即可上线部署,迁移成本几乎为零。这种兼容性对于希望采用国产算力的团队来说是一大利好。
针对MoE架构的深度优化
Kimi K3采用KDA注意力机制与896专家组成的MoE(混合专家)架构。海光团队为DCU做了算子级的定制打磨:
- 针对KDA注意力进行了特殊优化,减少通信开销
- 896个专家同时并行时,通过算力调度确保推理高效稳定
- 百万级上下文的超长文本场景下,依然保持流畅,不会出现卡顿
应用场景:长程智能体到芯片设计
在DCU上,Kimi K3能够支撑多种前沿应用场景:
- 长程智能体工程:处理复杂多步骤任务
- 视觉闭环创作:结合视觉与语言的多模态能力
- 自主芯片设计:辅助EDA工具进行大规模逻辑综合
国产算力用户因此也能亲手跑通万亿级的开源模型,打破了过去依赖海外硬件的局面。
三方联合调优:月之暗面、海光与中科曙光
值得指出的是,月之暗面在发布K3之前,便已联合海光与中科曙光完成了完整的兼容性调优:
- 中科曙光基于海光DCU硬件栈,打通了Kimi MoE架构的分布式训练与多卡并行推理链路
- 海光DCU则依靠底层硬件与软件栈的协同优化,在曙光8000集群上实现了长文本推理的稳定运行
性能基准:折损控制在12%以内
官方实测数据给出了信心:国产GPU的性能折损被控制在12%以内,已经达到商用部署的门槛。这意味着在成本、供应链安全等维度上,国产算力具备了实际竞争力。
当万亿模型与国产GPU之间的那道墙被推开一道缝,智能时代的算力版图正在悄悄挪动。
海光DCU的突破不仅是一次技术验证,更是国产AI基础设施迈向成熟的重要一步。未来,随着更多模型适配和算力优化,国产芯片将在AI大模型部署中扮演越来越关键的角色。
来源: aibase阅读原文