返回新闻列表
2026-05-27 10:51

小米 MiMo-V2.5 系列 API 永久降价,最高降幅达 99%

文本核心速览
  1. API永久降价,最高99%小米MiMo于5月27日宣布MiMo-V2.5系列API永久降价,最高降幅达99%。其中MiMo-V2.5Pro输入缓存命中价格降至0.025元/百万tokens,输出价格降至6元/百万tokens。
  2. 计费体系升级简化小米优化Token Plan计费体系,在保持原价格标准下,Token实际用量额度提升至原来的5至8倍,并引入Credits积分概念,简化计费规则,使成本计算更直观。
  3. 推理技术突破支撑降价小米基于SGLang HiCache支持SWA滑动窗口注意力机制,KV Cache多级搬运数据量减少至1/7;可缓存Token数量提升近5倍,集群通过专家并行和输入长度分桶策略提升输入吞吐,摊薄单位成本。

MiMo-V2.5系列API最高降99%,有开发者称“比白嫖还便宜”

5月27日0点,小米旗下MiMo大模型把V2.5和V2.5Pro两个版本的API价格永久砍到了地板价:输入缓存命中价格最低0.02元/百万tokens,降幅98%起,最高99%——相当于处理一部长篇小说的成本不到一分钱。


价格有多低?

  • MiMo-V2.5Pro:输入缓存命中价格 0.025元/百万tokens(降幅99%),输出价格 6元/百万tokens(降幅86%)。对比之前,输出端每百万tokens从约43元直接腰斩再腰斩。
  • MiMo-V2.5:输入缓存命中价格 0.02元/百万tokens(降幅98%),输出价格 2元/百万tokens(降幅93%)。群里在传“这比调用一些开源模型自部署还划算”。
  • 所有版本不再区分上下文窗口长度,定价变成极简一刀切。有开发者试了说“以前算成本要小心翼翼盯着窗口,现在闭着眼睛调”。

计费怎么变?

除了单价下调,小米还改了Token Plan计费体系:

  • 额度翻倍:在原价不变的前提下,实际Token用量额度提升至 5至8倍。技术圈在传“相当于买一送五”。
  • 引入Credits积分:取代之前复杂的计费规则,让消耗和成本更直观。有开发者试了说“终于不用在几个表格里换算‘上下文窗口×长度系数’了”。

凭什么降价?

技术拆解发现,降价的底气来自推理系统底层架构的突破:

  • SWA推理优化:基于SGLang HiCache完整支持滑动窗口注意力机制,KV Cache在GPU显存、CPU内存及SSD之间的多级搬运数据量减少至原来的1/7。有开发者扒了技术文档说“这相当于把仓库从郊区搬到了城中心的货运站”。
  • 缓存效率提升:可缓存的Token数量激增至优化前的近5倍,直接拉高缓存命中率,摊薄单位推理成本。群里在传“模型每次推理省下的钱够买一顿午饭”。
  • 集群吞吐优化:引入专家并行(MoE)方案与输入长度分桶策略,集群输入吞吐能力质变。有开发者试了说“高峰期调用响应速度没降,价格先降了”。

这会让谁难受/谁受益?

接下来盯着看其他国内大模型厂商会不会跟牌——谁不降,谁的用户可能在一周内被MiMo抢走。最难受的可能是那些刚融完钱、还没跑通推理优化的创业公司,他们的成本结构被小米这一刀直接打穿。受益的是那些靠调用API吃饭的独立开发者和小团队,现在能拿同样的预算跑五倍以上的实验。

来源: aibase阅读原文

其他新闻

查看全部