返回新闻列表
2026-08-15 09:14

智谱发布GLM-5.3:7400亿参数,后训练提升50%性能

智谱发布 GLM-5.3:7400 亿参数没涨,靠后训练硬拉 50% 性能

8 月 14 日,智谱正式发布大模型 GLM-5.3。基座参数量仍然是 7400 多亿,与 GLM-5.2 保持同一套底子,此前传闻中的万亿参数升级并未出现——那枚“大牌”大概率被留给了未来的 GLM-5.5。但智谱凭借后训练这一招,硬是让 GLM-5.3 的性能比上一代提升了 50%,并在多项主流基准测试中拿下当前开源模型的最高排名,编程与智能体能力接近 Claude Fable5,编程体感超过其他国产模型。

关键基准成绩跃升

几项关键基准的得分提升很有说服力:

  • Terminal-Bench 3.0:衡量模型在真实终端环境中完成复杂任务的能力,得分从 4.6 飙升到 28.3
  • DeepSWE v1.1:聚焦长程软件工程与持续代码修改能力,得分从 46.2 涨到 66.9
  • Agents' Last Exam:覆盖多类真实专业场景,强调跨工具协作与长程任务,得分从 23.8 提升到 28.5
  • GDPval-AA v2:覆盖 44 种职业、考察真实高价值知识工作,GLM-5.3 拿到 1769 分,展现出基于编程能力涌现出的专业任务执行力。

整体来看,GLM-5.3 在复杂软件工程、终端操作和更广泛的真实世界 Agent 任务上都有显著进步。

Z.ai Code Bench:更高效的 Coding Agent 体感

最能说明问题的是智谱自研的 Z.ai Code Bench——这套评估把模型塞进真实的本地开发环境,在不同思考档位下执行端到端任务,尽可能还原开发者实际使用 Coding Agent 时的体感。测试结果显示,GLM-5.3 在效果和 Token 利用率之间找到了更好的平衡:

  • High 档位下,准确率达到 31.4%,超过 Claude Opus 4.8 最高档位的 29.5%。
  • 每项任务平均只输出约 5 万 tokens,而 Opus 4.8 则需要约 12 万 tokens

这意味着 GLM-5.3 能用更短的执行路径完成同样的任务,大幅降低推理成本,提升实际开发效率。

产品落地与开源计划

产品落地方面,GLM-5.3 即日起上线智谱官方编程工具 ZCode 和效率工具 AutoClaw,同步开放给 GLM Coding Plan 全量用户及订阅用户。此外,TraeWork、TraeCode、扣子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode 等第三方编码平台也开放了抢先体验。

API 很快将上线,完整模型权重会在两周内完成必要的安全加固后开源。智谱的策略是尽可能限制模型的潜在攻击能力,同时保留其防御价值。今天 13:00,GLM Coding Plan 全员额度已经重置,所有用户后台的用量统计均可看到额度回满。

小结

GLM-5.3 以不变的参数规模和大幅提升的后训练技术,证明了在基座模型之外,训练策略与对齐优化仍有巨大的挖掘空间。对于开发者和企业用户而言,更强的编程能力和更低的 Token 消耗,意味着更实用的 Agent 体验。随着开源权重即将发布,我们有望看到更多基于 GLM-5.3 的生态应用落地。

来源: aibase阅读原文

其他新闻

查看全部