2026-05-25 09:18
全球大模型速度纪录刷新!智谱发布 GLM-5.1 高速版 AI
文本核心速览
- 发布GLM-5.1高速版API—智谱推出GLM-5.1-highspeed高速版API,输出速度达400 tokens/s,刷新全球大模型API速度纪录。
- 突破速度与体积不可兼得—该模型打破行业惯例,首次在国产大模型中实现旗舰级能力与低延迟并存,宣告快不等于小。
- 三大层面系统级优化—由GLM与TileRT团队联合打造,从推理引擎、调度系统到基础设施进行深度优化,确保400 TPS稳定可用。
- 适用于低延迟关键场景—该高速模型特别适合AI编程、实时语音交互、高频商业决策等场景,已在智谱MaaS平台向部分企业开放。
GLM-5.1 高速版 API 输出速度飙到 400 tokens/s,刷新全球大模型 API 速度上限
智谱今天悄悄向部分企业客户开放了 GLM-5.1 高速版 API,代号 “GLM-5.1-highspeed”,输出速度达到 400 tokens/s——这直接干翻了全球所有大模型 API 的已知上限,快得能让你盯着屏幕看字符一行行蹦出来。
群里在传,这个速度意味着模型每秒能吐 400 个 token,换算成中文大约 200-300个字,比之前主流模型快了 3-5倍,基本感觉不到延迟。
打破“快等于小”的行业惯例
过去行业里有个共识:模型跑得快,能力就得降——参数量大的模型必然慢。但这次 GLM-5.1 高速版 直接把旗舰级技术能力和极低延迟塞进了同一个 API 接口,有开发者试了说“又大又快,还稳如老狗”。
智谱 GLM 团队 和 TileRT 团队 联合搞出来的。他们放弃了传统的动态调度策略,在三个层面做了深度优化:
- 推理引擎层:重写了核心推理路径,专门针对模型架构优化单卡吞吐。
- 调度系统层:通过动态批处理降低高并发场景下的排队延迟。
- 基础设施层:协同优化,确保 400 TPS 成为稳定可用的生产级能力,不是实验室里的峰值数据。
哪些场景能吃上这口红利
技术群里有人画了重点:对响应延迟要求极其苛刻的场景,这次都适合。
- AI 编程:代码补全不再等几秒,敲完就能看到候选。
- 实时语音交互:对话机器人反应速度跟真人差不多。
- 高频商业决策:比如交易辅助、风控判断,延迟差一点就少赚一笔。
目前这个 API 已经在 智谱 MaaS 平台 上向部分企业开放了,不是全网公测,得申请。
接下来盯着看什么
这会让 百度文心、阿里通义、字节豆包 这些主打 API 的玩家很难受——自家旗舰模型速度跟不上,就得降价或者推轻量版来对冲。而对 实时语音赛道 的创业公司(比如 AI 客服、语音助手)来说,直接受益,门槛一下降了。
但更值得盯的是:其他厂商多久能追上这个 400 速?以及智谱会不会把高速版扩展到更多模型尺寸,甚至向个人开发者开放。
来源: aibase阅读原文