智谱联合清华等提出ZCube组网架构:大模型推理吞吐提升15%,网络成本削减三分之一
- ZCube论文发表并落地—智谱联合驭驯网络与清华大学在ACM SIGCOMM2025发表ZCube网络架构,并于2026年5月成功部署于GLM-5.1 coding生产环境,实现千卡集群稳定运行。
- 性能与成本双突破—在GPU、软件栈与应用不变下,ZCube使交换机与光模块资本支出减少33%,GPU平均推理吞吐提升15%,首Token时延(TTFT P99)降低40.6%。
- 传统架构痛点—传统ROFT架构因静态拓扑限制,在长上下文推理与PD分离部署中,KV Cache跨节点传输不对称,导致局部热点与PFC反压瓶颈。
- ZCube架构创新—取消Spine层,采用扁平化两组交换机二部图互联,结合双端口网卡单/多轨混合接入与专属路由,保证任意GPU对间独享最优路径,支持数万至数十万GPU扩展。
- 改造与未来意义—驭驯网络利用自动化工具快速完成布线与路由重构,集群平稳升级。该成果预示网络拓扑、通信库与调度策略深度耦合将成为提升Token效率的核心。
ZCube让交换机光模块开支砍掉33%,GPU推理快15%
2026年5月21日,智谱、驭驯网络与清华大学搞的ZCube网络架构,已经在GLM-5.1 coding生产环境里跑起来,基准测试结果直接亮出来:交换机与光模块的资本支出减少33%(省了将近三分之一的硬件钱),GPU平均推理吞吐提升15%(同样数量的GPU多干15%的活),首Token时延(TTFT P99)降低40.6%(用户等第一个字的时间少了近一半)。整个改造过程中GPU、软件栈和应用都没动,纯粹靠网络拓扑和路由策略翻新。
痛点在哪
当前长上下文推理和Prefill-Decode(PD)分离部署成主流,KV Cache在跨节点传输时流量极其不对称。传统ROFT(Rail-Optimized Fat-Tree)架构靠着多层交换机堆叠,静态拓扑像固定管道——总带宽看起来宽裕,但局部频繁拥堵,PFC反压一来,GPU等数据等到怀疑人生。群里在传,有开发者拆解过ROFT在大规模部署时的案例,抱怨说“光看总带宽够用,一跑推理就卡在某个节点上”。
ZCube怎么干
ZCube直接把传统Clos架构的层次化堆叠思路掀翻了:取消Spine层交换机,改用完全扁平化的两组交换机做二部图互联,再配合双端口网卡的单/多轨混合接入机制。有开发者试了说,这结构等于每条GPU之间都有一条私密通道,配合专门的路由策略,任意GPU对都能拿到独享的最优路径,流量负载均衡从根源上解决。官方测试数据称,这套玩法能支持数万张到数十万张GPU的扩展,不怕规模爆炸。
落地细节
在生产环境改造中,驭驯网络团队用了自动化控制与校验工具,搞定了布线重构和路由策略重写的麻烦。目前这个千卡集群已经稳定运行两周以上,没有翻车。阿克群里有运维吐槽过传统网络升级要停机几天,但这次改造好像没折腾太多时间——具体怎么平滑迁移的,团队没细说,但工具链应该是关键。
接下来盯着看什么:这套架构能否在更大规模(比如万卡级)集群里复制成功,以及它会不会逼着传统网络设备商(比如思科、华为)重新设计交换机产品。谁受益?搞长上下文推理的MaaS服务商——Token生产成本降了,MaaS综合成本才有机会压下来。