2026-09-16 16:58
AI123

OpenArt发布AI图像与视频生成模型公共基准测试平台OpenArt Arena

OpenArt宣布推出公共基准测试平台OpenArt Arena,用于评估AI图像与视频生成模型。该平台将模型排名按照电影制作、电商、平面设计、动态设计、视频编辑、唇形同步等用例分类,由创意从业者及“品味家”通过盲测进行成对评估。

OpenArt表示,每个排行榜会根据对应工作任务定制评估标准。以电影制作为例,评审更关注镜头运动、光线、电影质感和皮肤真实感;广告类任务则更看重文字可读性、标志准确性、产品保真度及摆放位置。由于同一模型在不同任务上的表现可能差异明显,平台希望通过分任务排名帮助团队找到更适合特定生产环节的模型。

在评估方式上,OpenArt Arena设置了两层评审:创意专家委员会,以及约800至1000名从用户、创意社区和广告等领域招募的“品味家”。评审在不知道模型名称的情况下进行一对一的盲测比较,平台使用Bradley-Terry统计模型聚合偏好结果并生成排名,排行榜同时展示95%置信区间。

为降低模型针对基准调优的风险,OpenArt将在发布时公开评估方法论及部分提示集,同时保留部分活跃评估提示不对外公开。公司方面表示,完全公开全部测试素材可能导致模型开发者针对数据集进行优化,从而削弱基准对未知创意任务的泛化衡量能力。

OpenArt是一家总部位于旧金山的创意AI工具初创公司,由前谷歌员工联合创立,平台支持多个第三方图像与视频生成模型,并提供面向多场景视频生成的工作流产品。公司称,许多企业客户在开始采用生成式AI时,面临的第一个挑战便是选择模型,Arena希望为这一决策提供参考。

来源
  1. 2026-09-15 22:00 | venturebeat.com:What's the best AI model for graphic design, video ads, lip sync and more? OpenArt's new Arena offers leaderboards for different media jobs
    阅读原文

    OpenArt, the four-year-old San Francisco creative AI tooling startup co-founded by former Googlers Coco Mao and John Qiao, wants to answer an increasingly pertinent question for enterprises and individuals using AI models to create multimedia: not simply “which model is best?” but “which model is be...

其他新闻

查看全部