返回新闻列表
2026-08-27 02:26
AI123

智谱官宣“牛来”真身:新一代大模型GLM-5.3 Flash开放权重

GLM模型智谱

智谱AI于2026年8月26日正式官宣,此前以匿名身份“牛来”出现在OpenRouter平台的模型实为新一代大模型GLM-5.3 Flash。该模型总参数规模达320B,实际激活参数为18B,采用全新Flash架构,支持图文视频多模态交互,并宣布将开放权重供开发者本地部署。

据官方介绍,GLM-5.3 Flash在架构上进行了多项调整:层数从GLM-4.5的92层优化至45层,结合线性注意力与稀疏注意力混合架构,并基于30T Token多模态预训练语料训练。相比传统注意力机制,计算量降低3.01倍,KV Cache缩小4.44倍,可支持1M超长上下文处理。

在正式官宣前,该模型曾以匿名身份在OpenRouter平台进行测试,凭借领先的编程与智能体能力登顶调用量榜单,匿名测试期间创下OpenRouter、OpenCode双平台调用量新高。智谱AI表示,开放权重后开发者可在本地部署并进行二次开发。中国数据研究中心《2026中国AI大模型竞争力TOP20》显示,智谱AI此前凭借GLM-5.2位居榜单第4位。

此外,GLM-5.3 Flash已在国产加速芯片上实现高效部署。通过将多模态编码、Prompt预填充和逐Token解码拆分为独立调度的分离式架构,并叠加Layer Split、混合缓存量化等优化,端到端服务性能提升3倍,单Token成本与主流英伟达GPU相当。

来源
  1. 2026-08-27 08:22 | 华尔街见闻:智谱新模型“牛来”跑在10万国产卡上,SemiAnalaysis评价“英伟达护城河再受考验”
    阅读原文

    8月26日,智谱正式确认:此前在开发者社区引发热议的匿名模型Ox Alpha(中文社区称“牛来”),就是其最新发布的GLM-5.3-Flash。模型代号灵感来源于国内近期热映电影《牛来》。 这个模型在正式亮相前,以匿名形式在OpenRouter和OpenCode上免费开放测试,5天内流量累计超过50万亿token,刷新了两个平台的流量增长纪录,当前使用量已超过DeepSeek的两倍以上。但真正引发市场关注的,是智谱随后披露的一个细节:这些流量,全部由国产芯片承载。 智谱在官方技术文档中表示,调用超过10万张国产芯片集群用于该模型推理服务,“硬件效率及单token成本已经达到了与主流英伟达GPU...

  2. 2026-08-27 02:11 | 新浪:智谱AI全新GLM-5.3 Flash模型(牛来)320B参数凭啥屠榜OpenRouter?
    阅读原文

    智谱AI神秘“牛来”身份实锤:320B参数GLM-5.3 Flash登顶OpenRouter,实测性能超上一代  智谱AI旗下神秘“牛来”模型于2026年8月26日正式官宣为GLM-5.3 Flash,这款拥有320B总参数的多模态大模型此前以匿名身份空降OpenRouter平台,凭借领先的编程与智能体能力登顶调用量榜单,将多款头部模型挤下榜首,引发AI圈热议。  据新浪新闻报道,“牛来”模型在匿名测试期间创下OpenRouter、OpenCode双平台调用量新高,背后依托国产芯片提供算力支持。其采用的全新Flash架构在保持320B总参数规模的同时,将实际激活参数压缩至18B,层数从GLM-...

其他新闻

查看全部