返回新闻列表
2026-09-10 16:01
AI123

寒武纪宣布完成DeepSeek V4.1 Flash的Day 0推理适配

9月10日,寒武纪宣布已基于vLLM推理框架完成对DeepSeek最新开源模型V4.1 Flash的Day 0适配。这意味着DeepSeek V4.1 Flash在发布当天即可在寒武纪芯片上稳定运行。

DeepSeek V4.1 Flash是DeepSeek全新模型结构系列中尺寸最小的一款,总参数达552B的MoE模型。该模型采用全新的Causal-Encoder-Decoder结构,输入侧激活参数为8B,输出侧激活参数为16B,原生具备多模态视觉理解能力。据官方介绍,该模型成本显著低于已知同尺寸模型。此外,V4.1 Flash在KV缓存压缩上实现突破,对HBM的需求降至上一代的1/4,对SSD的需求降至1/8,相较初代模型KV缓存缩小437倍。

为完成此次快速适配,寒武纪利用自研高性能融合算子库Torch-MLU-Ops对Engram、Compressor等模型结构进行专项加速,并使用BangC高性能编程语言编写稀疏、压缩Attention等热点算子的优化Kernel。在推理框架层面,寒武纪在vLLM中支持TP/PP/SP/DP/EP 5D混合并行、通信计算并行、低精度量化以及PD分离部署等优化技术。

此次适配依托于寒武纪NeuWare软件生态的积累。9月8日,寒武纪正式加入PyTorch基金会,成为最高级别白金成员,将在基金会管理委员会拥有一个席位。截至目前,寒武纪已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产主流大模型的推理适配。

来源
  1. 2026-09-10 15:33 | 新浪财经:国产芯片神速!寒武纪Day 0适配DeepSeek V4.1 Flash:模型发布当天就能跑
    阅读原文

    快科技9月10日消息,寒武纪今日宣布已基于vLLM推理框架完成对DeepSeek最新开源模型V4.1 Flash的Day 0适配。这意味着DeepSeek V4.1 Flash发布当天即可在寒武纪芯片上稳定运行。DeepSeek V4.1 Flash是DeepSeek全新模型结构系列中尺寸最小的一款,总参数552B的MoE模型。该模型采用全新的Causal-Encoder-Decoder结构,输入侧激活仅8B参数,输出侧激活16B参数,原生具备多模态视觉理解能力。官方称其成本显著低于已知同尺寸模型。值得关注的是,V4.1 Flash在KV缓存压缩上实现了重大突破。新模型对HBM的需求降至上一代...

其他新闻

查看全部