返回新闻
产品展示AI Understanding 简报

OpenArt 推出 Arena 进行特定任务的 AI 创意模型排名

OpenArt 推出了一个名为 Arena 的新公共基准,该基准根据电影制作、电子商务和口型同步等特定创意任务,使用创意专业人士的盲目成对评估对 AI 图像和视频模型进行排名。

5 min readRead the original reporting
Source-provided image accompanying OpenArt launches Arena for task-specific AI creative model rankings
归因报告来源记录
出版商
venturebeat.com
来源链接
venturebeat.comhttps://venturebeat.com/orchestration/whats-the-best-ai-model-for-graphic-design-video-ads-lip-sync-and-more-openarts-new-arena-offers-leaderboards-for-different-media-jobs
来源类型
新闻媒体的报道——不是第一方文件。

我们无法独立确认的内容: 此声明归因于指定的商店。我们没有根据第一方文件对其进行验证。 (venturebeat.com)

背景60 秒内了解这一点

从这里开始

关键术语

API(应用程序编程接口)
一种软件系统向另一个系统发送请求并接收响应的结构化方式。
生成式 AI
生成文本、图像、音频、视频或代码等新内容的人工智能系统。
基准测试
用于测量和比较模型性能的标准化测试或数据集。
测试一下自己AI 模型解释测验

发生了什么

总部位于旧金山的创意 AI 工具初创公司 OpenArt 推出了 OpenArt Arena,这是一个公共基准测试平台,旨在帮助用户为特定多媒体作业选择最佳的 AI 模型,而不是依赖单一的总体得分。该平台将模型排名划分为电影制作、电子商务、图形设计、动作设计、视频编辑和口型同步等任务的用例板。它利用来自创意实践者和“品味创造者”的盲目成对评估,并使用 Bradley-Terry 统计模型汇总偏好。初步结果显示,字节跳动的 Seedance 2.5 在整体视频板中领先,而阿里巴巴的 Wan 3.0 在视频编辑方面排名第一。在图像生成方面,OpenAI的GPT Image 2在图形设计和编辑方面领先,而阿里巴巴的Seedream 5.0 Pro在整体图像板中名列前茅。该公司计划发布其部分方法和提示集,同时将主动评估提示保密以防止模型调整。

OpenArt 由前 Google 员工 Coco Mao 和 John Qiaois 共同创立,推出了 OpenArt Arena,以回答哪种人工智能模型最适合特定媒体工作的问题。该平台具有用于图像和视频生成的独立排行榜,按电影制作、电子商务、图形设计、动作设计、视频编辑和口型同步等用例进行分类。

基准测试过程包括从每个板的策划提示集中生成输出,并将其呈现给没有模型标签的评估人员。评委们做出并排选择,OpenArt 使用 Bradley-Terry 统计模型汇总这些偏好。评审团包括由指定从业者组成的创意专家委员会以及从用户和创意社区招募的约 800 至 1,000 名“时尚引领者”组成的更大团体。

在最初的视频排名中,字节跳动专有的 Seedance 2.5 以 1,081 分领先整体板,其次是阿里巴巴的 Wan 3.0(1,004 分)和字节跳动的 Seedance 2.0(1,000 分)。 Seedance 2.5 在电影、动作设计和口型同步方面也排名第一,而 Wan 3.0 在视频编辑方面以 1,034 分微弱领先,而 Seedance 2.5 的得分为 1,033 分。

对于图像生成来说,结果更加碎片化。 OpenAI的GPT Image 2在图形设计和图像编辑方面排名第一,而阿里巴巴的Seedream 5.0 Pro在面向电影的图像和电子商务方面领先。 Seedream 5.0 Pro 也以 1,010 分名列整体图像板榜首,略高于 GPT Image 2。值得注意的是,阿里巴巴的 Wan 3.0 是唯一被描述为开源的前三名中唯一的一个,尽管其当前的公开版本尚未包括用于自托管的可下载模型权重。

OpenArt 表示,它将在发布时发布部分方法和提示集,但会将一些主动评估提示保密,以降低模型调整到基准的风险。该公司的目标是让 Arena 成为选择人工智能模型进行创意工作的公认行业标准。

来源详情: venturebeat.com ↗

为什么这很重要

此次发布解决了企业和创意团队的一个关键痛点:在快速扩张且分散的市场中选择最佳人工智能模型的困难。通过按特定工作职能对绩效进行细分,OpenArt Arena 提供了比通用排行榜更具可操作性的指导,而通用排行榜可能会掩盖模型在利基领域的优势。这对于采用生成式人工智能的企业尤其重要,其中模型选择通常是第一个主要障碍。该基准还强调了基于 API 的专有模型与开源选项之间的权衡,影响数据驻留、成本和部署控制方面的决策。虽然存在类似的基准,但 OpenArt 对精细、特定任务的创意工作流程的关注为专业创意制作提供了独特的价值主张。

OpenArt Arena 的推出提供了一种更细致的方法来评估人工智能创意模型,重点关注特定的工作职能而不是单一的总体分数。这对于需要将特定生产任务分配给最有能力的模型的企业和创意团队来说非常重要,因为在一个领域强大的模型在另一个领域可能不是最好的。

该基准强调了模型选择的实际影响,包括基于 API 的专有模型和开源选项之间的权衡。例如,虽然字节跳动的 Seedance 2.5 在视频性能方面领先,但它是专有模型,而阿里巴巴的 Wan 3.0 是开源的,但缺乏用于自托管的可下载权重。这种区别会影响企业的部署控制、数据驻留和总拥有成本。

OpenArt Arena 解决了采用生成式人工智能的公司面临的一个常见挑战:从快速扩张的市场中选择正确模型的困难。通过提供特定于任务的排名,该平台提供了可行的指导,可以帮助创意团队做出明智的决策,并有可能提高人工智能辅助制作工作流程的效率和质量。

该基准还有助于促进有关人工智能评估标准化的更广泛讨论。虽然 Contra Labs 和 Artificial Analysis 等其他平台也提供类似的特定任务排名,但 OpenArt 专注于精细的创意工作流程及其与商业创意平台的集成,可能会使其在成为广泛认可的行业标准方面具有竞争优势。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
交互式概念检查+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

接下来看什么

关注 OpenArt Arena 的排名如何随着新模型的发布而变化,以及该平台是否成为创意 AI 采购事实上的行业标准。请关注完整方法和提示集的发布,这将允许对结果进行独立验证。此外,观察 Contra Labs 的人类创造力基准和 Artificial Analysis 的 Image Arena 等竞争基准如何响应 OpenArt 的推出,这可能会导致评估创造性 AI 能力的更加标准化的方法。

OpenArt 完整方法论和提示集的发布对于基准测试结果的独立验证至关重要。评估过程的透明度将有助于在用户之间建立信任,并确保排名准确反映模型性能。

随着新模型的发布,OpenArt Arena 排名的演变将是该平台相关性和准确性的重要指标。监控排名随时间的变化将有助于深入了解人工智能创意模型的快速发展以及基准在捕捉这些变化方面的有效性。

Contra Labs 的 Human Creativity 和 Artificial Analysis 的 Image Arena 等竞争基准的反应将非常重要。这些平台可能会根据 OpenArt 的发布调整其方法或推出新功能,从而有可能形成更加标准化和全面的方法来评估创意 AI 能力。

企业和创意专业人士对 OpenArt Arena 的采用将是其成功的关键指标。如果该平台成为广泛使用的模型选择工具,它可能会影响人工智能创意模型的开发以及人工智能提供商寻求优化其基准性能的策略。

相关指南和测验

人工智能模型解释AI 的未来什么是人工智能?测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?