返回新闻列表
2026-08-28 17:22
AI123

大晓机器人联合香港大学发布StreamPI,突破单帧智能瓶颈

2026年8月28日,大晓机器人联合香港大学发布连续物理智能研究成果StreamPI,旨在突破VLA模型长期存在的“单帧智能”瓶颈,通过建立持续的多模态时序上下文,让机器人理解连续发生的物理过程。

相较于传统VLA依据当前观测独立决策,StreamPI将每个时刻组织为“视觉观测+任务指令”时序单元,让语言指令持续绑定每次观测,作为贯穿任务的语义锚点,并按时间顺序读取和聚合历史信息。推理采用流式方式,首帧编码后存入键值缓存,后续只处理新信息并复用历史表示,避免重复计算整个窗口;该方法未额外引入视频编码器或独立记忆模块,而是重构原VLA注意力机制,直接继承π0.5的视觉—语言表征能力,不增加额外参数。

在四项真机任务中,StreamPI将π0.5的成功率分别从46.7%提升至80.0%(猜杯子)、26.7%提升至63.3%(滚动物体抓取)、40.0%提升至66.7%(窄瓶口插笔)、60.0%提升至92.0%(纸杯插入杯套)。

大晓机器人是一家机器人公司,由商汤科技联合创始人王晓刚出任董事长,AI科学家陶大程院士担任首席科学家。未来,团队将探索超过100帧的高效时序训练与自适应缓存裁剪,将时序理解延伸至更长、更复杂的真实任务。

来源
  1. 2026-08-28 15:32 | 新浪财经:让VLA真正理解时间,香港大学联合大晓机器人发布连续物理智能研究成果
    阅读原文

    (来源:上观新闻)当VLA模型理解语言、感知环境并直接生成机器人(14.420, -0.18, -1.23%)动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近还是远离目标——真正决定下一步动作的信息,往往不只存在于当前一帧,而存在于连续的时间之中。近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果 StreamPI,直指VLA长期存在的“单帧智能”瓶颈,为其补上关键的“时间维度”。不同于传统VLA主要依据当前观测独立决策,StreamPI 为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判...

其他新闻

查看全部