2026-06-02 09:40
全行业首创!复旦系团队发布时空一体世界动作模型,半年豪斩 5 轮融资
文本核心速览
- 全球首款时空一体模型—眸深智能发布全球首款机器人原生通用具身大脑STI-WM,实现空间、时间、物理与执行四维一体化,突破传统VLA模型在空间感知、长时序规划和真机鲁棒性上的局限。
- 四维一体化技术突破—模型首次融合空间结构、时间演化、物理一致性及执行鲁棒性,支持百秒级长时程任务推演与精细化动作输出,构建“理解—推演—规划—纠错”智能闭环。
- 复旦铁三角团队—团队由复旦大学陈涛教授、前英特尔首席科学家张益民博士、前英伟达技术负责人及95后连续创业者穆泽林组成,已完成7代动作模型技术迭代,斩获多项顶级赛事冠军。
- 半年五轮融资—眸深智能半年内密集完成5轮融资,Pre-A轮3亿元获5倍超额认购;已与宇树科技、禾川科技等头部企业合作,未来三年预计锁定10亿元订单。
全球首款机器人专用具身大脑STI-WM:百秒级任务推演+百亿参数塞进端侧芯片
5月31日,复旦孵化的眸深智能直接把全球首款专为机器人原生打造的通用具身大脑STI-WM扔了出来——模型把空间结构、时间演化、物理一致性与执行鲁棒性四维统一,能兼容RGB图像和深度点云,上层推演百秒级长时程任务,下层输出精细化动作片段,彻底跳出纯视觉推演的坑。
四维一体化:干了啥
- 空间感知:用点云做原生三维感知,不靠2D图像猜深度。有开发者试了说,以前机器人抓杯子经常抓空,现在点云直接建模,连杯子倾斜角度都算进去了。
- 时间演化:支持百秒级任务推演——意思是机器人能预判接下来一百秒内每一步动作的物理结果,而不是看着画面瞎猜。群里在传,这相当于在机器人脑内跑了一个“小世界模拟器”。
- 物理一致性:模型内置碰撞检测与动力学约束引擎。行业观察者解释,以前大模型生成的机器人动作经常违反牛顿定律(比如把手穿过桌子),STI-WM从底层就杜绝了这种“鬼畜操作”。
- 执行鲁棒性:动作规划后能自动纠错,比如抓取时手滑了,模型会立刻调整抓握角度,不用重新计算全盘。
六大核心技术壁垒
除了上面说的时空一体化原生建模和基于点云的原生三维感知,还有:
- 物理一致性引擎:融合碰撞检测与动力学约束。有工程师试了说,拿STI-WM在仿真里推倒一堆积木,机器人动作看起来和真人一样自然,没有浮空或者穿模。
- 模型压缩与量化蒸馏:把百亿级参数的大模型直接压缩到能跑在机器人端侧芯片上(比如英伟达的Jetson系列)。群里在传,这等于把GPT级别的脑子塞进一块巴掌大的电路板,算力门槛从服务器级别砍到板子级别。
- 其他几项技术原文没细写,但团队自2021年起迭代了7代动作模型,拿过ICCV和CVPR全球冠军。
团队:复旦铁三角
- 科研底层:复旦大学陈涛教授坐镇。
- 工程化落地:前英特尔中国首席科学家张益民博士,加上英伟达技术负责人。
- 商业化:95后复旦连续创业者穆泽林带队。 有开发者说,这组合是“学术+工业+资本三条腿走路”,比纯学术派或纯创业团靠谱。
融资与产业化
- 融资:半年内完成5轮融资,Pre-A轮3亿元,超额认购5倍。群里在传,投资方抢着上车,觉得这是“人形机器人里最缺的那个大脑”。
- 合作:已与宇树科技(四足机器人)、禾川科技(工业机器人)、颐家养老(服务机器人)等头部企业签约,战略合作伙伴中5家以上是千亿级产业龙头。
- 订单:未来三年预计锁定10亿元订单支撑,加速人形、四足等多品类落地。行业观察者算了一笔账:单说宇树科技的机器人,如果每台装一块STI-WM大脑,光这一家就能吃三年产能。
接下来盯着看什么
人形机器人公司能不能用STI-WM把部署成本砍到现有方案的1/5?或者,这会让那些还在搞“纯视觉+大语言模型”的VLA厂商(比如谷歌的RT-2、斯坦福的Mobile ALOHA)直接调头重写架构——他们烧掉的几十亿算力预算,现在可能全白费了。
来源: aibase阅读原文