返回新闻列表
2026-05-22 11:12

拒绝彩排,真刀真枪上舞台!美团LongCat-Video-Avatar1.5开源:全面击败主流闭源模型

文本核心速览
  1. 商用级开源模型发布美团龙猫团队开源LongCat-Video-Avatar1.5,实现从开源SOTA向商业应用的跨越。在唇形同步、物理合理性、长视频稳定性、多人互动等核心维度显著提升,致力于解决传统数字人视频痛点。
  2. 三大核心技术升级升级Whisper-large编码器提升唇动精度;构建多人、静默、情绪三类增强数据体系;引入GRPO人类偏好对齐缓解手部畸变和动作不连贯,增强开放域泛化能力。
  3. 推理效率提升15倍采用DMD分布匹配蒸馏技术,将生成步数从50步压缩至8步;使用“共享基础模型+LoRA适配器”架构替代三模型并行,显存释放,10秒视频生成仅需约1分钟。
  4. 权威评测全面领先基于EvalTalker基准,用户偏好胜率:较Kling Avatar2.0达65.9%,较OmniHuman-1.5达61.1%,较HeyGen达54.3%;画面稳定性及音画协调性均优于所有对比模型。

美团龙猫数字人模型开源15倍提速:10秒视频只需1分钟

美团龙猫大模型团队今天把商用级数字人视频生成模型 LongCat-Video-Avatar1.5 开源了,在唇形同步、多人互动、推理效率等维度直接对飙商业产品,而且生成 10秒 视频只要 约1分钟——比上一代快了一个数量级。

三大升级:专治数字人“抖、畸、慢”

传统数字人视频常见的 抖动、畸变、高延迟 问题,这个版本做了三刀精准手术:

基础体验商用化:音频编码器换血

  • 音频特征提取从 Wav2Vec2 升级为 Whisper-large(参数量更大,多语言先验更丰富)。有开发者试了说,长句、快语速、唱歌时嘴唇终于能对上,面部、头部、肢体动作跟语音也能自然协同,长视频里的跳帧和身份漂移明显减少。

强开放域泛化:多阶段数据灌入

团队构建了一套“离线标注+在线验证”的流水线,专门注入三类数据:

  • 多人数据:用主动说话人检测消除歧义,准确区分谁在说、谁在听。
  • 静默数据:挑未说话的视频片段,让模型学会无语音时的自然微表情,避免配角乱张嘴。
  • 情绪数据:帧级情绪识别精筛,模型能理解语音和表情的深层关联。

手部与连续性专项对齐:引入 GRPO

针对电商直播、产品展示等频繁露手的场景,模型用了 GRPO(人类偏好对齐),奖励信号细化到逐帧,还加了首帧手部检测。群里在传,手部畸变、局部结构崩塌、动作不连贯这些行业硬伤被压下去不少。

推理效率飙升15倍:告别昂贵算力

  • 采用 DMD(分布匹配蒸馏)技术,生成步骤从 50步 压缩到 8步
  • 架构换成“一个共享基础模型 + 多个 LoRA 适配器”,替代传统三模型并行方案,显存大幅释放。
  • 实测 15倍 推理效率提升,生成 10秒 视频只要 约1分钟——这速度商用不心疼算力了。

基准评测:全面碾压头部商业模型

基于 EvalTalker 评测基准,770名 评估者与 10名 专家对新闻、教育、娱乐等复杂场景做了结构化打分:

  • 用户偏好胜率:相比 Kling Avatar2.0 胜率 65.9%;相比 OmniHuman-1.5 胜率 61.1%;相比 HeyGen 胜率 54.3%
  • 单/多人场景得分:单人场景 3.336,显著高于 HeyGen;多人场景 2.730,大幅领先 InfiniteTalk(2.339)。
  • 画面稳定性:主体变形率仅 23.1%,背景变形率仅 9.4%;跳帧问题率低至 0.8%,所有对比模型中最好。
  • 音视频协调性:面部-身体同步问题率 5.1%,唇形同步问题率 29.8%,均优于传统商业系统。

开源链接(直接拿去跑)

接下来盯着看什么

  • HeyGen、Kling 这类商业数字人产品会不会被迫降价或开源?
  • 手部畸变虽然缓解,但 GRPO 在复杂手势下的泛化能持续多久?
  • 开源社区能不能基于这个基座堆出更便宜的数字人直播、客服方案?
来源: aibase阅读原文

其他新闻

查看全部