2026-10-07 19:10
AI123

TwelveLabs发布Pegasus 1.6,面向机器人训练优化第一人称视频理解

视频AI公司TwelveLabs于2026年10月7日发布Pegasus 1.6模型,新增对第一人称视角视频的专门支持,面向机器人开发者与数据供应商,旨在将物理作业录像转化为带标签、带时间戳的训练数据。

Pegasus 1.6延续了Pegasus 1.5的视频描述与分割能力,并在此基础上针对第一人称(egocentric)画面进行了专项训练。官方表示,前代版本对该类视频的处理效果不佳。新模型主打原生时序推理与端到端视频理解,可识别动作顺序、涉及对象、执行手以及动作起止时间,将原始视频转换为结构化的时间元数据。

除视频外,该版本还新增原生图像分析能力,并改进了人物与物体识别,客户可通过同一API处理静态图像。TwelveLabs描述了五个主要工作流:将录像拆分为带标签的动作、生成详细字幕、筛查视频质量、发现异常事件与重复内容,以及在下游使用前标记潜在敏感素材。

定价方面,Pegasus 1.6延续前代水平:输入视频每小时1.75美元,图像输入token每百万3美元,输出token每百万7.5美元。企业客户可选择定制合同。

TwelveLabs联合创始人兼CEO Jae Lee表示,公司此前主要服务媒体、娱乐、体育和广告领域,进入机器人领域是将视频理解能力应用于物理行为识别。他认为,当前机器人模型“非常渴望数据”,第一人称录像可作为一种演示来源,但Pegasus只能提供动作描述与粗略轨迹理解,压力、触感与精确控制仍需与其他数据及控制系统结合。

来源
  1. 2026-10-07 02:17 | venturebeat.com:TwelveLabs debuts Pegasus 1.6 to improve robotics training data from first-person video
    阅读原文

    A worker assembling a component demonstrates more than the finished task: which hand holds the part, when the other reaches for a tool, and how to recover when something slips. TwelveLabs wants to make those details usable for companies teaching robots to do similar work.The video AI company today r...

其他新闻

查看全部