返回新闻列表
2026-08-28 19:55
AI123

加州大学伯克利分校与斯坦福大学提出BeyondMimic框架,机器人可学习人类动作并组合技能

加州大学伯克利分校与斯坦福大学团队在Science Robotics发表研究论文,提出基于强化学习的运动跟踪框架BeyondMimic。该框架使人形机器人能够从人类动作中学习并组合技能,实现空中侧手翻、旋踢、翻踢、冲刺等高动态动作。

BeyondMimic分为两个阶段:第一阶段采用统一的运动跟踪流程和共享超参数,从约2.5小时的人类动作数据中学习数百种动作,无需为每个动作单独设计奖励;第二阶段训练统一的潜在状态-动作扩散模型,将多种技能整合进同一运动分布,并通过分类器引导(classifier guidance)在推理阶段根据新目标生成和组合动作。

研究团队将21个代表性动作部署到真实机器人,覆盖单腿站立、起身等平衡行为以及空中侧手翻等高动态动作。在室外软土、落叶等未见过地面上,机器人仍能完成动作并保持稳定。用户研究中,77名参与者对行走和奔跑片段进行偏好选择,BeyondMimic整体获得70.8%的偏好率。

该框架还能处理训练阶段未出现的路径导航、摇杆遥操作、障碍物躲避和动作插入任务,使机器人根据速度指令在行走与奔跑间切换,或从行走平滑进入翻滚等动作。研究团队表示,BeyondMimic的未来迭代版本有望发展出直接从人类示范中学习的模型,并使机器人在不同环境中实现多样化动作。相关论文于2026年8月发表于Science Robotics。

来源
  1. 2026-08-28 02:55 | 36氪:Science Robotics:机器人会空翻并不稀奇,伯克利、斯坦福团队搞定了“什么时候该空翻”
    阅读原文

    人形机器人要真正进入为人类设计的环境,行走只是起点。它们还需要完成奔跑、跳跃、翻滚、转身、躲避障碍等高动态动作,并在任务变化时自然切换技能。更难的是,这些动作既要稳定,又要有类似人类的协调性与节奏感。 传统方法通常依赖简化动力学模型、分层规划器或针对单一任务设计的奖励函数,容易产生“持续迈步”“膝盖长期弯曲”“身体冲击较重”等不自然动作;强化学习(RL)虽然已经让人形机器人掌握了平地行走、爬楼梯、奔跑和复杂地形穿越,但每增加一种行为,往往都需要新的奖励设计、参数调节,甚至从头训练。 而且,这些方法通常局限于特定动作或特定目标,缺乏组合多样化技能的通用性,尤其是在处理未见过的任务时。 ...

其他新闻

查看全部