2026-09-24 11:16
AI123

小米大模型MiMo-V3新架构核心组件HySparse2披露,长上下文计算量降至约1/5

9月23日晚,小米MiMo大模型负责人罗福莉发文,提前披露MiMo-V3的新架构,其核心组件HySparse2率先亮相,相关技术论文同步公布。该架构主要解决Agent多轮任务中长输入计算量大、缓存占用高以及长上下文信息检索难三个问题。

根据论文数据,与MiMo-V2.6采用的Hybrid SWA架构相比,在100万Token上下文下,HySparse2的预填充(Prefill)计算量降至约1/5,KV Cache占用降至约1/4.5;同时长上下文检索表现进一步提升,AgentPPL和LongPPL均有所下降。

实现这一效果的关键是两级KV共享。HySparse2将模型主体分为Self-Decoder和Cross-Decoder两部分,通过KV Bridging让后半部分直接复用前半部分产生的隐藏状态,再通过KV Reuse让一个全注意力层生成的KV Cache和Token选择结果供后续多个稀疏注意力层复用。由此,Prefill阶段执行完Self-Decoder即可退出,无需完整处理全部网络层。HySparse2还将上一代的Block级选择改为Token级选择,可直接从上下文不同位置选取相关Token。

训练验证方面,小米团队以80B-A3B MoE模型对比了HySparse2、HySparse和Hybrid SWA三种架构。在256K上下文下,HySparse2的RULER-v2得分达58.45,高于HySparse的32.61和Hybrid SWA的35.74。在通用能力测试上,三种架构整体表现大致相当。

论文由小米LLM-Core团队完成,共15位作者,罗福莉为通讯作者。此次披露距离小米发布并开源MiMo-V2.6系列仅两天,MiMo-V3的技术方向也随之明朗。

来源
  1. 2026-09-24 10:56 | 36氪:MiMo-V2.6刚发,小米罗福莉扔出MiMo-V3新架构,引用DeepSeek多项成果
    阅读原文

    智东西9月24日报道,昨晚,小米MiMo大模型负责人罗福莉发文,提前披露了MiMo-V3的新架构,其核心组件HySparse2率先登场,相关技术论文同步公布。 ▲罗福莉发文 简单来说,这套新架构主要解决Agent越做越多轮之后出现的三个问题:长输入算得太多、缓存占得太大,以及如何从越来越长的上下文里准确找到需要的信息。 罗福莉直接给出了一组数据:与MiMo-V2.6采用的Hybrid SWA架构相比,在100万Token上下文下,HySparse2处理长输入时所需的预填充(Prefill)计算量降至约1/5,KV Cache占用降至约1/4.5;与此同时,其长上下文检索表现进...

其他新闻

查看全部