蚂蚁百灵发布Ling-3.0-Flash:124B参数激活仅5.1B,智效比超越业界
- 发布Ling-3.0-Flash—蚂蚁百灵7月24日发布新一代原生混合推理模型Ling-3.0-Flash,总参数量124B,单次激活仅5.1B,实现更高智效比。
- 性能对标更大模型—该模型在基础推理、指令遵循等核心指标上对标甚至超越参数规模达2至3倍的行业领先模型,展现高效落地性价比。
- Agent场景深度优化—扩展超10000个真实交互训练环境,优化自我纠错与长程规划机制,在代码编写、任务拆解等场景中提升自主闭环交付能力。
- 混合注意力架构创新—采用KDA线性注意力层与MLA层5:1比例交替堆叠,升级KDA注意力并引入细粒度对角门控,专家激活比例压缩至1/64,提升效率。
- 工程协作与开源计划—引入集群级分级缓存,长输入下首字响应延迟降低60%-80%;模型已上线OpenRouter,限免一周后将正式开源。
蚂蚁百灵发布Ling-3.0-Flash:124B参数激活仅5.1B,智效比超越业界
7月24日,蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-Flash。该模型总参数量 124B,单次计算激活仅 5.1B。在大幅精简体量与降低算力开销的同时,Ling-3.0-Flash 在基础推理、指令遵循及长文本处理等核心指标上,对标甚至超越了参数规模达其2至3倍的行业领先模型,展现出更高的“智效比”与落地性价比。据了解,该模型已上线 OpenRouter,限时免费一周,之后将正式开源。
Agent 场景深度优化
作为该版本的重点,Ling-3.0-Flash 针对 Agent 的实际应用场景进行了深度打磨。模型扩展了超 10000 个真实交互训练环境,并优化了复杂任务的自我纠错与长程规划机制。无论是在代码编写、复杂任务拆解,还是多源信息深度调研等场景中,Ling-3.0-Flash 均展现出更强的自主闭环交付能力,解决了传统模型在大任务中容易“跑偏”或断档的难题。
混合注意力架构:KDA 与 MLA 的 5:1 组合
据介绍,实现“小体量、高智能”的关键,源于模型底层计算架构的重新设计。Ling-3.0-Flash 放弃了单纯堆砌参数的思路,从预训练阶段即采用 混合注意力架构,以 5:1 的比例交替堆叠 KDA 线性注意力层 与 MLA 层,让模型在长上下文效率与模型能力之间实现更优平衡。
此外,Ling-3.0-Flash 将上一代的 Lightning Attention 升级为 KDA(Kimi Delta Attention),在 Delta Rule 的状态更新中引入细粒度对角门控,让模型在处理长文档和代码库时能更精准地记住关键信息。同时,Ling-3.0-Flash 进一步压缩了单次计算的专家激活比例,每个 Token 的专家激活比例由前代的 1/32 进一步压缩至 1/64,并由此带来了更高的“效率杠杆”。
工程与协作架构:响应速度提升 60%-80%
为了让 AI Agent 运行更快、更稳,百灵还为其匹配了配套的工程与协作架构。在响应速度上,通过引入 集群级分级缓存,避免了长对话和多轮交互中的重复计算,将长输入下的首字响应延迟降低了 60% 至 80% 以上;在任务稳定性上,升级后的 多智能体协同架构 允许不同 Agent 分工协作、相互校验,有效减少了单一模型的误判风险,为高频线上服务与真实业务落地提供了支撑。
开源与开放计划
Ling-3.0-Flash 已在 OpenRouter 上线,提供 限时免费一周 的体验。之后,蚂蚁百灵计划将模型正式开源,以推动社区在 Agent 场景下的创新应用。