StarVLA团队发布VLA底座VLAct,仅用16卡完成持续预训练
2026年9月7日,StarVLA团队发布面向VLA(视觉-语言-动作模型)的VLM底座VLAct。该模型的continued pre-training仅使用开源数据和16张GPU,在多项机器人基准测试中验证了其跨任务、跨动作头、跨机器人迁移的能力。
评测结果显示,VLAct在RoboTwin 2.0上Clean设置下成功率达92.5%;在RoboDojo榜单上取得10.66 Score和7.60%的成功率,超过所有明确标注为World Action Model(WAM)的参赛模型。在面向预训练阶段从未见过的GR-1机器人的跨本体实验中,VLAct仅使用20%的RoboCasa-GR1下游数据即达到49.5%的成功率,超过NVIDIA GR00T N1.6和Qwen3VL-OFT的全量数据基线;数据量提升至100%时,成功率进一步达到54.0%。
VLAct的continued pre-training基于Qwen3-VL-4B,训练中保护视觉编码器和较浅的LLM层,并同时挂载OFT、PI、GR00T三种连续动作头共同预测,避免骨干网络被单一动作头带偏。目前,模型权重、Checkpoint、数据处理及训练Pipeline均已开源。
- 2026-09-07 06:28 | 新浪:20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!阅读原文
(来源:机器之心) 机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上:除了继续 scale 数据以外,能不能让每一条数据都学得更值? 他们最新发布了面向 VLA 的 VLM 底座 VLAct。 VLAct 的整个 continued pre-training 只使用开源数据和 16 张 GPU,但成绩相当能打:RoboTwin 2.0 成功率达到 92.5%;在 RoboDojo 榜单中超过所有明确标注为 World Action Model(WAM)的模型;面对预训练阶段从未见过的 GR-1 机器人,只使用 20%的 RoboCasa-GR1 下游数据...