返回新闻列表
2026-07-08 09:04

机器人视觉迎来新突破!蚂蚁灵波空间感知模型LingBot-Depth 2.0正式发布

文章提及的 AI 工具Gemini
文本核心速览
  1. 灵波发布LingBot-Depth 2.0蚂蚁集团旗下灵波科技于7月7日发布空间感知模型LingBot-Depth 2.0,训练数据从1.0版本的300万条扩充至1.5亿条,在边缘清晰度、细小物体识别等维度全面升级。
  2. 测评多项第一,深度误差减半在深度补全基准16项测评中获得12项第一;室内大面积深度缺失场景中,RMSE从0.132降至0.062,误差较上一代减半,在玻璃、镜面等困难场景表现突出。
  3. 同步推出视觉基座模型LingBot-VisionLingBot-Vision是业内首个将“边界结构”作为预训练目标的视觉基础模型,支持亚像素级边界定位,训练语料仅1.6亿张图像,深度估计精度优于DINOv3,开源ViT-G/L/B/S四个版本。
  4. 通过奥比中光认证,深度合作商业化LingBot-Depth 2.0已通过奥比中光深度视觉实验室专业认证,双方计划年底推出集成该模型的一体化相机产品,并适配数采场景的专用版本。
  5. 开源模型权重,推动具身智能落地技术报告和LingBot-Vision模型权重已开源,蚂蚁灵波旨在以开放方式共建机器人视觉底座,突破“看懂、看准、看稳”瓶颈,加速具身产业规模化。
7月7日,蚂蚁集团旗下具身智能公司灵波科技正式发布空间感知模型LingBot-Depth2.0。该模型基于1.5亿规模数据训练,在边缘清晰度、细小物体识别、远距离深度估计以及复杂场景鲁棒性等方面实现了全面升级。 LingBot-Depth是灵波自研的空间感知模型,相当于机器人在物理世界中的“眼睛”。1.0版本已解决机器人看清透明、反光等复杂场景的空间感知难题。相较LingBot-Depth1.0,LingBot-Depth2.0的训练数据从300万扩充至1.5亿规模,性能全面升级:在深度补全基准的16项测评中,获得12项第一;在最难的室内大面积深度缺失场景中,深度误差较上一代减半(RMSE从0.132降至0.062);在玻璃、镜面、透明物体等传统深度相机最容易失灵的场景中,表现尤为突出。 此次还同步推出了LingBot-Depth2.0的视觉基座模型——LingBot-Vision,构建起机器人从“看懂”到“看准”的能力链路,旨在应对机器人视觉在空间感知、精细识别和复杂环境适应等方面的核心挑战。 (图说1:LingBot-Depth2.0在镜面、玻璃等困难场景中补全出完整、平整的三维结构) LingBot-Depth2.0的突破性进展得益于LingBot-Vision突出的视觉表征能力。作为一款通用视觉模型,LingBot-Vision也是业内首个把“边界结构”作为预训练目标的视觉基础模型,实现了空间感知训练范式的突破。它拥有亚像素级的边界定位与空间结构理解能力,实现了更高精度、更稳定的空间感知能力。 LingBot-Vision的预训练语料仅为1.6亿张图像,比DINOv3小一个数量级,但深度估计精度优于DINOv3;并且,LingBot-Vision对物体边界的判定足够稳定,能在视频中连续追踪物体边界。LingBot-Vision本次开源了4个版本——ViT-G/L/B/S。 据了解,LingBot-Vision除了支持LingBot-Depth2.0的训练,还具备“一模多用”的通用能力。 (图说2:LingBot-Depth2.0在真实传感器深度补全测试中表现领先) (图说3:与主流视觉基础模型相比,LingBot-Vision对物体边界和空间结构的识别更清晰、更稳定) 目前,LingBot-Depth2.0已通过奥比中光深度视觉实验室专业认证。实际场景测试显示,基于奥比中光Gemini330系列双目3D相机提供的芯片级3D原始数据,LingBot-Depth2.0在边缘清晰度、物体轮廓完整性、细小物体识别、远距离深度估计及复杂光照、材质场景下的鲁棒性等方面均有明显提升。 (图说4:LingBot Depth2.0通过奥比中光深度视觉实验室专业评测,在多型号传感器的空间和时域深度估计任务上都展现了极高的精度和稳定性) 在商业化方面,蚂蚁灵波已与奥比中光在诸多方面展开深度合作。据了解,奥比中光最新推出的无本体数据采集产品矩阵中,RGB-D版本的EGO设备会适配灵波科技专门为数采场景优化的LingBot-Depth版本,后续还将进一步集成更高级别商业版本模型,持续补全深度缺失、优化物体边缘和空间结构细节,为具身智能模型训练提供更精准、更稳定、更可用的真实世界数据底座。 此外,奥比中光将推出集成LingBot-Depth最新模型能力的SDK产品,供机器人客户在端侧使用,让使用Gemini330系列相机的机器人获得更好的深度效果;并计划于年底推出集成LingBot-Depth商业版的一体化相机产品,实现“3D相机+空间感知能力”的一体化交付。随着两款模型的发布,双方合作有望延展至更多领域。 目前,两款模型的技术报告和LingBot-Vision的模型权重已开源。蚂蚁灵波科技表示,希望以开放的方式与行业共建机器人视觉底座,让机器人突破在真实物理世界中“看懂、看准、看稳”的行业瓶颈,加速具身产业规模化落地。
来源: aibase阅读原文

其他新闻

查看全部