阿里智谱同日发布高性价比MoE Flash模型
8月26日,阿里与智谱同日发布高性价比Flash模型。阿里通义千问推出Qwen3.8-Flash,智谱AI上线并开源GLM-5.3-Flash,两款产品均采用混合专家MoE架构,并对外开源权重。
Qwen3.8-Flash为下一代Qwen4架构的先导预览版,MoE总参数125B,叠加51B N-gram Embedding记忆库,每Token仅激活6B参数。其训练成本较前代Qwen3.7-Plus下降近90%,推理定价每百万Tokens输入1元、输出3元,发布次日阿里云进一步下调至输入0.8元、输出2.7元。
GLM-5.3-Flash是GLM-5系列首个原生多模态模型,总参数320B,单Token激活18B参数,采用稀疏注意力+线性注意力混合架构。其API价格仅为GLM-5.3的十分之一,限时折扣阶段进一步降至二十分之一。正式发布前,该模型以匿名模型Ox-Alpha在OpenRouter、OpenCode两大海外平台测试,Token调用量达62T。
8月27日港股收盘,智谱收涨12.62%,报1160港元/股。有分析认为,Flash模型以更少的计算资源实现接近旗舰的综合能力,推理成本下降一个数量级,正在成为大模型商业化落地的关键方向。MoE架构通过稀疏激活降低单Token计算压力,也让国产算力有机会承接前沿模型。
- 2026-08-27 19:53 | 新浪财经:阿里智谱同日上新,效能与性价比重塑大模型竞争阅读原文
21世纪经济报道记者 董静怡8月26日,阿里、智谱两款“高性价比”模型同日发布。阿里通义千问正式发布Qwen3.8‑Flash,智谱AI上线并开源GLM‑5.3‑Flash,两款产品均采用混合专家MoE架构。前者为下一代Qwen4架构的先导预览版,MoE总参数125B,每Token仅激活6B参数;后者是GLM‑5系列首个原生多模态模型,总参数320B,单Token激活18B参数。两个模型都对外开源权重,主打高并发、低成本、原生多模态与Agent能力,引发社区关注。发布还不足24小时,阿里云把Qwen3.8-Flash的定价又砍了一刀——输入每百万Tokens 0.8元,输出2.7元。用更少的计...