2026-09-17 16:31
AI123

小米大模型MiMo-V2.6训练中途公开,累计成本超128万美元

9月17日,小米MiMo大模型团队负责人罗福莉在X平台发文,公开了最新大模型MiMo-V2.6的强化学习(RL)训练过程,并分享了实时训练页面。这是外界首次看到该模型强化学习阶段的部分训练状态。

罗福莉表示,MiMo-V2.6正处于强化学习运行中途,团队正从三方面进行扩展:计算资源(每步约20亿token,1568个提示×16次rollout,完全异步)、环境和测试框架(多任务代理式RL,在一次运行中混合多个测试框架)以及评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励)。她透露,未来几周将逐步开源细节。

从训练页面来看,MiMo-V2.6正在进行大规模Agent强化学习实验,页面展示模型训练进度、Token消耗、训练成本、样本数量及多个内部指标变化,包含MiMo-V2.6-Pro和MiMo-V2.6-Flash两个版本。两个版本当前累计训练成本已超过128万美元,其中Pro版本训练时长1天19小时,耗费89万美元;Flash版本训练时长1天14小时,耗费39.7万美元。

公开资料显示,罗福莉曾任阿里巴巴达摩院机器智能实验室研究员,后加入DeepSeek参与研发DeepSeek-V2等模型,2025年11月正式宣布加入小米。雷军此前也曾多次提及小米在AI领域的进展。

来源
  1. 2026-09-17 23:37 | 新浪财经:“AI才女”罗福莉直播展示“钞能力”:每小时“烧掉”超20万元!雷军此前给出“定心丸”:今年投160亿元
    阅读原文

    “沉默近半年,我们一直在用这段时间研究一个问题:强化学习(RL)到底可以走多远。”9月17日凌晨,小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。据罗福莉透露,目前小米MiMo-V2.6正处于强化学习中间阶段,其团队正在进行三方面的扩展:一是计算资源(每步约20亿个Token,1568个 Prompt × 16次Rollout,完全异步);二是环境和测试框架(多任务智能体强化学习,一次运行中混合多个框架);三是评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励)。小米MiMo团队将在接下来的几周内逐步开源相关细节。值得注意的是,罗福莉还直接晒出了MiMo-V...

  2. 2026-09-17 18:11 | 36氪:每小时“烧钱”超20万元,罗福莉直播小米大模型训练
    阅读原文

    “沉默近半年,我们一直在用这段时间研究一个问题:强化学习(RL)到底可以走多远。”9月17日凌晨,小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。 据罗福莉透露,目前小米MiMo-V2.6正处于强化学习中间阶段,其团队正在进行三方面的扩展:一是计算资源(每步约20亿个Token,1568个 Prompt × 16次Rollout,完全异步);二是环境和测试框架(多任务智能体强化学习,一次运行中混合多个框架);三是评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励)。小米MiMo团队将在接下来的几周内逐步开源相关细节。 值得注意的是,罗福莉还直接...

  3. 2026-09-17 16:53 | 界面新闻:每小时“烧钱”超20万元!罗福莉直播小米大模型训练
    阅读原文

    “沉默近半年,我们一直在用这段时间研究一个问题:强化学习(RL)到底可以走多远。”9月17日凌晨,小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。 据罗福莉透露,目前小米MiMo-V2.6正处于强化学习中间阶段,其团队正在进行三方面的扩展:一是计算资源(每步约20亿个Token,1568个 Prompt × 16次Rollout,完全异步);二是环境和测试框架(多任务智能体强化学习,一次运行中混合多个框架);三是评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励)。小米MiMo团队将在接下来的几周内逐步开源相关细节。 值得注意的是,罗福莉还直接晒出了...

  4. 2026-09-17 14:28 | 澎湃新闻:每小时成本超3万美元!沉寂半年后小米罗福莉直播大模型训练过程
    阅读原文

    沉寂半年后,小米罗福莉再次卷入大模型“厮杀”战场,并全程直播大模型训练过程。9月17日凌晨,小米MiMo大模型团队负责人、前DeepSeek研究员罗福莉在X平台发文表示,目前正在研究强化学习(RL)能走多远。目前,小米旗下最新大模型MiMo-V2.6正处于其RL运行的中途,在此期间,团队正在进行三方面扩展:第一是计算资源(每步约20亿token,1568个提示×16次rollout,完全异步),第二是环境和测试框架(多任务代理式RL,在一次运行中混合多个测试框架),第三是评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励),并透露将在未来几周逐步开源细节。罗福莉分享了MiMo-V2.6...

其他新闻

查看全部