智谱唐杰公开GLM-5.3-Flash推理优化细节:10万颗国产AI加速器两周完成生产部署
9月17日,智谱GLM首席科学家唐杰在X平台公开了一项关于GLM-5.3-Flash推理系统优化的研究。该模型部署在超过10万颗国产AI加速器集群上,团队用两周时间完成从首次运行到承载全部生产流量的过程,端到端吞吐能力提升3.2倍。
唐杰透露,整个优化过程中,由GLM-5.3驱动的Infra Agent参与了性能瓶颈分析、优化方案提出和部分代码修改。团队还引入了dense feedback机制,让模型在调优时能获得更接近工程判断过程的反馈信号,如正确性确认、耗时分析和实验验证结果。唐杰认为,这标志着AI开始参与优化承载自身运行的系统,虽然距离真正的递归自我改进仍远,但早期形态已经出现。
大规模部署面临多重挑战,包括国产芯片显存容量和互联带宽限制、新架构适配、100万token长上下文支持以及多模态请求处理等。智谱团队采用ReplaySSM以计算换内存空间、INT8/FP8/BF16混合精度缓存、Encode-Prefill-Decode(EPD)分离式架构等方案完成优化。部署完成后,GLM-5.3-Flash曾以匿名模型名Ox-Alpha在OpenCode和OpenRouter平台运行,一周内成为使用量最高的模型之一,六天处理超过62万亿token。
在dense feedback帮助下,Infra Agent还定位了KDA上下文并行路径中TF32计算舍入误差随序列长度累积的问题,并将修复合并至Flash Linear Attention项目PR #1180。它同时优化了KV Transfer与DeepEP调度之间的重叠,使额外开销从超过30%降至1%以下,并通过对已有Kernel的学习重构了Decode Kernel计算结构,获得1.71倍性能提升。
- 2026-09-18 16:07 | 36氪:智谱实现RSI最小闭环,A社:我来监督阅读原文
“智谱已经实现了最小的闭环。模型优化系统,系统服务模型。” 近日,智谱首席科学家唐杰在社交媒体上,用这句话概括了智谱向递归自我改进(RSI)迈出的一步。 在智谱发布的《通往递归自我改进》中,一个由GLM-5.3驱动的Infra Agent,参与了GLM-5.3-Flash推理服务的搭建与优化。这套服务运行在十万张以上的国产AI芯片上,从第一次跑通到承接全部线上流量,只用了两周。 模型开始给自己干活了。它帮助优化自己赖以运行的系统,让推理更快、成本更低;优化过程中积累的任务、验证结果和修正经验,又可以成为后续研发的资源。唐杰所说的“最小闭环”,就从这里转了起来。 这距离AI完全自...
- 2026-09-18 09:56 | 界面新闻:半导体ETF鹏华(159813)标的指数涨超1.7%,国产芯片持续放量阅读原文
有连云快讯 29分钟前 消息面上,智谱GLM 团队披露其在递归自我改进(Recursive Self-Improvement,RSI)方向的首个工程化实践。 消息面上,智谱GLM 团队披露其在递归自我改进(Recursive Self-Improvement,RSI)方向的首个工程化实践:由GLM-5.3驱动的Infra Agent完成了...
- 2026-09-17 21:02 | 新浪财经:智谱唐杰披露首个RSI进展:AI在十万卡集群上自主优化,不到两周吞吐量提升至3倍阅读原文
国内大模型巨头智谱公布RSI进展。9月17日,澎湃新闻记者获悉,智谱(2513.HK)创始人兼首席科学家唐杰在X平台上发表长文,并转发智谱技术博客,披露智谱在递归自我改进(Recursive Self-Improvement,RSI)方向的首个工程化实践:由GLM-5.3驱动的Infra Agent(基础设施智能体)完成了GLM-5.3-Flash推理基础设施的设计、调试与优化,实现模型对自身运行系统的反向改进。这是国内大模型厂商首次公开跑进生产环境的RSI案例。据官方博客,Infra Agent在超10万张国产芯片组成的集群上从零完成生产级推理服务搭建,不到两周将端到端吞吐提升至初始基线的3...
- 2026-09-17 19:18 | 新浪财经:国产AI开始自我优化国产芯片:GLM-5.3 Flash两周实现3.2倍性能阅读原文
快科技9月17日消息,新一代大模型开始转向RSI自我递归升级,国内的大模型公司智谱今天也宣布这方面的进展,GLM-5.3 Flash在两周时间内自我优化大幅提升了国产AI芯片的性能。GLM-5.3 Flash是智谱前不久才发布的多模态大模型,跟GLM-5.3相比速度快得多,而且是首次使用了全国产芯片部署,多达10万块国产AI芯片使得单位Token推理成本较年初下降80%。不仅硬件上有所突破,智谱这次还首次看到了RSI自我递归能力上的早期迹象,创始人唐杰表示GLM-5.3开始帮助优化GLM-5.3-Flash在国产芯片上的部署。根据他公布的信息,一个由GLM-5.3驱动的Infra Agent用...
- 2026-09-17 17:59 | 华尔街见闻:智谱首个 RSI 成果发布,10 万国产卡用 GLM 造 GLM阅读原文
两周时间,10 万颗国产 AI 加速器,一个开始优化自己的模型。 就在刚刚,智谱 GLM 首席科学家唐杰在 X 平台分享了一项关于 GLM-5.3-Flash 推理系统优化的研究。 他透露,从 GLM-5.3-Flash 首次运行在国产 AI 加速器上,到完成全部生产流量承载,仅用了两周时间。在这个过程中,系统端到端吞吐能力提升了 3.2 倍。 最让唐杰印象深刻的是,完成大量优化工作的并非只有基础设施工程师,还有一个由 GLM-5.3 驱动的 Infra Agent。 「一个帮助优化服务自身的模型。」唐杰这样描述这一变化。 在他看来,这意味着 AI 开始参与优化承载自身运行的系统。虽然距离真...
- 2026-09-17 17:57 | 爱范儿:刚刚,智谱首个 RSI 成果发布,10 万国产卡用 GLM 造 GLM阅读原文
两周时间,10 万颗国产 AI 加速器,一个开始优化自己的模型。 就在刚刚,智谱 GLM 首席科学家唐杰在 X 平台分享了一项关于 GLM-5.3-Flash 推理系统优化的研究。 他透露,从 GLM-5.3-Flash 首次运行在国产 AI 加速器上,到完成全部生产流量承载,仅用了两周时间。在这个过程中,系统端到端吞吐能力提升了 3.2 倍。 最让唐杰印象深刻的是,完成大量优化工作的并非只有基础设施工程师,还有一个由 GLM-5.3 驱动的 Infra Agent。 「一个帮助优化服务自身的模型。」唐杰这样描述这一变化。 在他看来,这意味着 AI 开始参与优化承载自身运行的系统。虽然距离真...