云天励飞IFWA软件栈完成DeepSeek-V4.1-Flash零等待适配
2026年9月,高效推理模型DeepSeek-V4.1-Flash正式发布。云天励飞依托自研IFWA软件栈实现该模型的Day 0(零等待)快速适配,并基于真实量化权重完成全链路数值精度与执行一致性验证。
作为DeepSeek-V4系列迭代版本,V4.1-Flash在推理架构上实现多项升级,对算力软件栈综合能力提出更高要求。本次适配中,IFWA秉持“能力复用、差异迭代”思路,复用5项成熟原生接口,仅新增2项接口,针对性适配模型缓存量化、Sinkhorn语义等全新特性,大幅降低新模型接入成本。
低精度模型具有体积小、速度快、省显存的优点。目前IFWA对低精度模型的支持已从“可运行”升级为可精准加载、可正确传参数、可落地低精度计算的全链路稳定能力。稀疏计算方面,IFWA新增专属缓存量化接口,全面适配大模型推理加速框架DSpark中草稿模型与主模型协同推理流程,覆盖Token生成、模型验证、连续自回归续写等场景,保障多轮推理状态传递与计算逻辑的一致性。
依托可复用的编译器、自研算子、低精度计算与测试验证体系,IFWA无须为新模型重构底层能力,即可快速适配各类大模型架构迭代。截至目前,该软件栈已完成DeepSeek全系列、Kimi、Qwen等十余款主流先进模型的适配,覆盖稀疏计算、MoE、投机解码、混合精度等前沿推理机制。未来,云天励飞将持续迭代IFWA软件栈核心能力,推进先进AI模型在国产GPGPU平台的快速适配与规模化落地。
- 2026-09-14 20:30 | 中国科技网:云天励飞Day 0适配DeepSeek-V4.1-Flash 助力夯实国产算力软件底座阅读原文
2026-09-14 20:30:18 来源: 科技日报 点击数: 0 ...