2026-09-22 11:47
AI123

SemiAnalysis发布深度报告:大模型推理服务构成'Token工厂'

9月22日,研究机构SemiAnalysis发布深度技术报告,系统拆解大模型推理服务的底层架构。报告将推理过程划分为预填充(Prefill)、中间填充(Midfill)、解码注意力(Decode Attention)和解码专家(Decode Experts)四个工作阶段,并将其整体比作一座“Token工厂”。

报告指出,四个阶段对算力、内存带宽与网络的需求截然不同。预填充阶段因大量token共享权重加载,属于计算密集型;中间填充阶段在长缓存前缀上追加少量新token,兼具计算与内存压力;解码阶段则几乎被内存带宽主宰,其中注意力读取的数据量在长上下文下甚至可超过模型权重本身。将不同阶段混同处理,会损失混合专家(MoE)模型架构的结构性优势——MoE通过路由器为每个token动态选择少数专家参与计算,避免全部参数被激活。

报告以英伟达Blackwell系列GPU为案例进行推演,并利用SemiAnalysis推理模拟器对Kimi K3模型在B200、B300与GB200系统上的配置进行了性能投影。结果显示,GB200在解码阶段的延迟-吞吐权衡曲线大部分区间领先;内存占用方面,多数前沿配置的每GPU HBM峰值驻留量维持在80GB以下。报告由此强调,在许多推理场景下,内存带宽比容量更能创造收益,HBM应优先用于承载活跃批次数据,闲置KV状态应及时迁移至CPU DRAM或更廉价的存储。

此外,报告还讨论了调度层设计的重要性,警告大规模集群中可能出现“延迟反馈震荡”风险,并比较了分离式与聚合式两种推理架构的取舍。该报告为硬件设计者、云服务商和模型部署方提供了具有直接参考价值的分析框架。

来源
  1. 2026-09-22 11:11 | 华尔街见闻:Semianalysis硬核拆解:AI回答你一句话,背后发生了什么
    阅读原文

    当你向AI提问并收到回复,这个看似瞬间完成的交互背后,是一套横跨计算、存储、内存与网络调度的复杂工业体系。 9月22日,研究机构SemiAnalysis发布深度技术报告,系统拆解了大模型推理服务的底层架构。从用户发出请求到AI生成每一个token,每个环节如何运作、哪里是瓶颈、什么样的硬件在什么阶段真正创造价值。 报告指出,推理服务并非一个整体,而是由预填充(Prefill)、中间填充(Midfill)、解码注意力(Decode Attention)和解码专家(Decode Experts)四个工作阶段构成的"Token工厂"。 这一分析框架对于理解AI基础设施竞争的核心逻辑具有重要参考价值。...

其他新闻

查看全部