xAI升级Imagine Video1.5:新增图像语音参考与原生1080p生成
xAI升级Imagine Video1.5:图像参考、语音参考与原生1080p生成
概述
近日,xAI 对旗下视频生成模型 Imagine Video1.5 进行了重大升级。此次更新带来了图像参考、语音参考、纯文本生成视频以及原生1080p输出等多项新能力,显著提升了 AI 视频创作中的角色一致性、场景控制力和画面质量。
核心新特性
图像参考
用户可以将目标图像作为参考,控制视频中的角色、产品或场景。无论是固定人物面部、展示产品细节,还是设定环境氛围,图像参考都能提供更直接的视觉引导。单次生成最多支持七个视觉参考,帮助创作者同时锁定多个要素。
语音参考
语音参考功能让 AI 视频生成更“有灵魂”。通过结合角色图片与语音样本,模型可以在不同镜头中保持角色外观和声音的一致性,解决了以往 AI 视频中角色面部漂移、声音不稳定等常见问题。这一功能尤其适合需要多镜头叙事的内容创作。
纯文本生成视频与1080p输出
除了参考图像和语音,创作者仍可使用纯文本描述直接生成视频。同时,模型支持原生1080p分辨率输出,相比以往更高清,满足更高质量的视频创作需求。
灵活的多重参考控制
在多重参考模式下,用户能够自由组合视觉元素。例如:
- 保留角色身份,仅替换背景;
- 保持场景不变,更换角色;
- 只调整动作,维持整体视觉设定。
这些选项为创作者提供了丰富的创作空间,使得 AI 视频生成更接近专业影视制作中的可控性。
功能上线与用户开放情况
目前,文本转视频 和 1080p视频生成 功能已在 Grok Imagine 的网页版、iOS 和 Android 客户端全面上线。而图像参考 和 语音参考 功能率先面向美国地区的 SuperGrok Heavy 和 SuperGrok Plus 用户开放。xAI 表示,后续将逐步覆盖更多用户群体。
开发者 API 支持
对于开发者,xAI API 已支持通过 grok-imagine-video-1.5 模型调用图像引用、文本转视频和原生1080p视频生成能力。开发者可在 API 请求中传入提示词、参考图像 URL、视频时长、宽高比和分辨率等参数,灵活生成视频。语音参考功能则通过独立的请求方式接入,满足更多定制化需求。
媒体评价与行业影响
Imagine Video1.5 于上个月发布,当时 xAI 强调该版本在运动表现、物理模拟和音频生成方面进行了优化。此次升级进一步强化了模型对身份、场景和产品细节的控制能力,标志着 AI 视频生成正从简单的画面转换走向更接近专业影视制作流程的多模态创作工具。随着图像和语音参考功能的加入,AI 视频创作的门槛将进一步降低,同时也为短视频、广告、影视预演等领域带来新的可能性。