2026-07-17 09:05
小米发布具身智能基底模型Xiaomi-Robotics-1,探索物理AI Scaling效应
文本核心速览
- 发布具身基底模型—小米发布面向真实移动操作的具身基底模型Xiaomi-Robotics-1,基于10万小时真实世界数据预训练,覆盖家庭、商业及工业等多类场景。
- 突破数据与硬件瓶颈—预训练阶段引入UMI采集10万小时轨迹,配合视觉语言模型两周内自动标注;后训练使用约1万小时跨本体数据实现本体与指令对齐,使模型具备开箱即用能力。
- 验证物理AI规模法则—提供2B、5B、10B三种版本,实验显示训练数据量与模型尺寸提升带来动作预测精度和未见场景成功率显著增长,并在RoboCasa365等多项公开基准刷新SOTA纪录。
- 提出可规模化训练路径—小米验证了“大规模预训练-跨本体后训练-少量数据微调”的可规模化范式,为机器人从实验室演示走向复杂真实物理世界提供参考。
## 10万小时人操数据喂出的小米机器人,2B参数版直接刷新SOTA
7月16日,小米甩出具身基底模型Xiaomi-Robotics-1,预训练数据来自10万小时真实世界轨迹,后训练又塞了约1万小时跨本体数据,让模型一装到机器人上就能干活。2B、5B、10B三个版本全刷了SOTA,2B版本已经能干掉不少同类模型,10B版本直接霸榜。
## 数据来源与预处理
传统机器人策略模型常受限于硬件依赖与稀缺的数据规模。为突破这一瓶颈,小米团队在预训练阶段引入了通过UMI(Universal Manipulation Interface)设备采集的10万小时真实世界轨迹,覆盖家庭、商业及工业等多类场景,并配合高效的视觉语言模型在两周内完成全量自动标注。据参与该项目的工程师透露,这些轨迹数据主要是由人类远程操作采集的,而不是靠机器人自己跑。这标志着小米在推动具身智能模型走向“Scaling Law”路径上迈出了系统性的一步。注意:10万小时,相当于一个人连续工作11年多,数据量够大。
## 跨本体对齐
在后训练阶段,团队通过约10000小时的跨本体数据进行本体与指令对齐,使Xiaomi-Robotics-1具备了“开箱即用”的多类移动操作能力。有开发者试了说,模型在不同形态的机器人上都能直接迁移,不需要重新训练。群里还在传,这个对齐过程让模型学会了理解不同机器人的物理约束,而不是死记硬背动作。10000小时跨本体数据,意味着模型不仅认自家机器人,换一台不同结构的也能上手。
## 规模实验与基准成绩
实验表明,随着训练数据量与模型尺寸(提供2B、5B、10B三种版本)的提升,模型在动作预测精度和未见场景任务成功率上均表现出清晰的规模化增长趋势,并在RoboCasa365、RoboDojo等多个公开仿真基准上刷新了SOTA(行业最优)纪录。简单说就是参数越大、数据越多,结果越好,2B版本已经能干掉不少同类模型,10B版本直接霸榜。注意:2B参数量只有GPT-2的1/3大小,但性能已经超过很多5B的模型。
## 接下来看什么
这次Xiaomi-Robotics-1的发布,让圈内人看到了“大规模预训练-跨本体后训练-少量数据微调”这条路径的可行性,为机器人从实验室演示走向复杂真实的物理世界提供了一个可复制的模板。接下来盯着看的是,其他机器人公司会不会跟进这条路线,以及小米是否会把数据和模型开源。如果真能规模化,那些还在靠手写策略做机器人的团队日子就不好过了。
来源: aibase阅读原文