뉴스로 돌아가기
제품AI Understanding 브리핑

OpenArt, 작업별 AI 크리에이티브 모델 순위를 위한 Arena 출시

OpenArt는 창의적인 전문가의 블라인드 쌍별 평가를 사용하여 영화 제작, 전자 상거래, 립싱크와 같은 특정 창의적 작업을 기반으로 AI 이미지 및 비디오 모델의 순위를 매기는 Arena라는 새로운 공개 벤치마크를 출시했습니다.

5 min readRead the original reporting
Source-provided image accompanying OpenArt launches Arena for task-specific AI creative model rankings
기여 보고녹음된 소스
출판사
venturebeat.com
소스 링크
venturebeat.comhttps://venturebeat.com/orchestration/whats-the-best-ai-model-for-graphic-design-video-ads-lip-sync-and-more-openarts-new-arena-offers-leaderboards-for-different-media-jobs
소스 유형
자사 문서가 아닌 뉴스 매체를 통한 보도입니다.

자체적으로는 확인할 수 없었던 내용: 이 소유권 주장은 해당 매장에 귀속됩니다. 당사는 자사 문서와 비교하여 이를 확인하지 않았습니다. (venturebeat.com)

맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

API(애플리케이션 프로그래밍 인터페이스)
한 소프트웨어 시스템이 다른 시스템에 요청을 보내고 응답을 받는 구조화된 방식입니다.
생성형 AI
텍스트, 이미지, 오디오, 비디오, 코드 등 새로운 콘텐츠를 생산하는 AI 시스템.
벤치마크
모델 성능을 측정하고 비교하는 데 사용되는 표준화된 테스트 또는 데이터 세트입니다.
자신을 테스트해 보세요AI 모델 설명 퀴즈

무슨 일이 일어났나요?

샌프란시스코에 본사를 둔 창의적인 AI 툴링 스타트업인 OpenArt는 사용자가 단일 전체 점수에 의존하지 않고 특정 멀티미디어 작업에 가장 적합한 AI 모델을 선택할 수 있도록 설계된 공개 벤치마킹 플랫폼인 OpenArt Arena를 출시했습니다. 플랫폼은 모델 순위를 영화 제작, 전자상거래, 그래픽 디자인, 모션 디자인, 비디오 편집, 립싱크 등의 작업에 대한 사용 사례 보드로 나눕니다. 브래들리-테리(Bradley-Terry) 통계 모델을 사용하여 선호도를 집계하는 창의적인 실무자 및 '테이스트메이커' 풀의 블라인드 쌍별 평가를 활용합니다. 초기 결과에 따르면 ByteDance의 Seedance 2.5가 전체 비디오 보드를 주도하는 반면 Alibaba의 Wan 3.0은 비디오 편집 분야에서 1위를 차지했습니다. 이미지 생성의 경우 OpenAI의 GPT Image 2가 그래픽 디자인 및 편집 분야를 주도하고 Alibaba의 Seedream 5.0 Pro가 전체 이미지 보드에서 1위를 차지했습니다. 회사는 모델 조정을 방지하기 위해 활성 평가 프롬프트를 비공개로 유지하면서 방법론과 프롬프트 세트의 일부를 게시할 계획입니다.

전 Google 직원인 Coco Mao와 John Qiaois가 공동 창립한 OpenArt는 어떤 AI 모델이 특정 미디어 작업에 가장 적합한지에 대한 질문에 답하기 위해 OpenArt Arena를 시작했습니다. 이 플랫폼은 영화 제작, 전자 상거래, 그래픽 디자인, 모션 디자인, 비디오 편집, 립싱크와 같은 사용 사례별로 분류된 이미지 및 비디오 생성을 위한 별도의 리더보드를 제공합니다.

벤치마킹 프로세스에는 각 보드에 대해 선별된 프롬프트 세트에서 출력을 생성하고 이를 모델 레이블 없이 평가자에게 제시하는 작업이 포함됩니다. 심사위원은 나란히 선택을 하고 OpenArt는 Bradley-Terry 통계 모델을 사용하여 이러한 선호도를 집계합니다. 심사위원단에는 지명된 실무자와 사용자 및 창작 커뮤니티에서 모집된 약 800~1,000명의 '테이스트메이커'로 구성된 대규모 그룹으로 구성된 크리에이티브 전문가 위원회가 포함됩니다.

초기 동영상 순위에서는 ByteDance의 독점 Seedance 2.5가 1,081점으로 전체 보드에서 선두를 달리고 있으며, Alibaba의 Wan 3.0이 1,004점, ByteDance의 Seedance 2.0이 1,000점으로 그 뒤를 이었습니다. Seedance 2.5는 영화, 모션 디자인, 립싱크 부문에서도 1위를 차지했으며, Wan 3.0은 비디오 편집 부문에서 1,034점으로 Seedance 2.5의 1,033점에 비해 간신히 선두를 달리고 있습니다.

이미지 생성의 경우 결과가 더욱 단편화됩니다. OpenAI의 GPT Image 2는 그래픽 디자인과 이미지 편집 분야에서 1위를 차지하고, Alibaba의 Seedream 5.0 Pro는 영화 중심 이미지와 전자상거래 분야에서 선두를 달리고 있습니다. Seedream 5.0 Pro는 또한 GPT Image 2보다 약간 앞선 1,010점으로 전체 이미지 보드 1위를 차지했습니다. 특히, Alibaba의 Wan 3.0은 오픈 소스로 설명된 유일한 상위 3개 진입자이지만 현재 공개 릴리스에는 아직 자체 호스팅을 위한 다운로드 가능한 모델 가중치가 포함되어 있지 않습니다.

OpenArt는 출시 시 방법론과 프롬프트 세트의 일부를 게시할 예정이지만 모델이 벤치마크에 맞춰 조정될 위험을 줄이기 위해 일부 활성 평가 프롬프트는 비공개로 유지할 것이라고 밝혔습니다. 회사는 Arena가 창의적인 작업을 위한 AI 모델을 선택하는 데 있어 업계 표준으로 인정받는 것을 목표로 합니다.

소스 세부정보: venturebeat.com ↗

왜 중요한가요?

이번 출시는 기업과 크리에이티브 팀의 중요한 문제점, 즉 빠르게 확장되고 세분화된 시장에서 최적의 AI 모델을 선택하는 어려움을 해결합니다. 특정 직무별로 성과를 분류함으로써 OpenArt Arena는 틈새 영역에서 모델의 강점을 모호하게 만들 수 있는 일반 순위표보다 더 실행 가능한 지침을 제공합니다. 이는 특히 모델 선택이 첫 번째 주요 장애물인 생성 AI를 채택하는 기업과 관련이 있습니다. 또한 벤치마크는 독점 API 기반 모델과 오픈 소스 옵션 간의 장단점을 강조하여 데이터 상주, 비용 및 배포 제어에 대한 결정에 영향을 미칩니다. 유사한 벤치마크가 존재하지만 OpenArt는 세분화된 작업별 창의적 워크플로에 중점을 두어 전문적인 창의적 제작을 위한 독특한 가치 제안을 제공합니다.

OpenArt Arena의 출시는 단일 전체 점수가 아닌 특정 직무에 초점을 맞춰 AI 크리에이티브 모델을 평가하는 데 있어 보다 미묘한 접근 방식을 제공합니다. 이는 특정 생산 작업을 가장 유능한 모델에 전달해야 하는 기업 및 크리에이티브 팀에게 중요합니다. 한 영역에서 강력한 모델이 다른 영역에서는 최고가 아닐 수 있기 때문입니다.

벤치마크는 독점 API 기반 모델과 오픈 소스 옵션 간의 균형을 포함하여 모델 선택의 실질적인 의미를 강조합니다. 예를 들어, ByteDance의 Seedance 2.5는 비디오 성능을 선도하지만 독점 모델인 반면, Alibaba의 Wan 3.0은 오픈 소스이지만 자체 호스팅을 위한 다운로드 가능한 가중치가 부족합니다. 이러한 차이는 배포 제어, 데이터 상주 및 비즈니스의 총 소유 비용에 영향을 미칩니다.

OpenArt Arena는 생성 ​​AI를 채택하는 회사의 공통 과제, 즉 빠르게 성장하는 시장에서 올바른 모델을 선택하는 어려움을 해결합니다. 플랫폼은 작업별 순위를 제공함으로써 크리에이티브 팀이 정보에 입각한 결정을 내리고 잠재적으로 AI 지원 제작 워크플로우의 효율성과 품질을 향상시키는 데 도움이 되는 실행 가능한 지침을 제공합니다.

벤치마크는 AI 평가의 표준화에 대한 광범위한 논의에도 기여합니다. Contra Labs 및 Artificial Analysis와 같은 다른 플랫폼은 비슷한 작업별 순위를 제공하지만 OpenArt는 세분화된 창의적 작업 흐름에 중점을 두고 상업용 창의적 플랫폼과의 통합을 통해 널리 인정받는 업계 표준이 되는 경쟁 우위를 확보할 수 있습니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
대화형 개념 확인+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

다음에 무엇을 볼 것인가

새로운 모델이 출시됨에 따라 OpenArt Arena의 순위가 어떻게 변화하는지, 플랫폼이 창의적인 AI 조달을 위한 사실상의 업계 표준이 되는지 모니터링하세요. 결과를 독립적으로 검증할 수 있는 전체 방법론과 프롬프트 세트의 공개를 지켜보십시오. 또한 Contra Labs의 Human Creativity 및 Artificial Analysis의 Image Arena와 같은 경쟁 벤치마크가 OpenArt의 출시에 어떻게 반응하는지 관찰하여 잠재적으로 창의적인 AI 기능을 평가하는 보다 표준화된 접근 방식으로 이어질 수 있습니다.

OpenArt의 전체 방법론과 프롬프트 세트의 공개는 벤치마크 결과를 독립적으로 검증하는 데 중요합니다. 평가 과정의 투명성은 사용자 간의 신뢰를 구축하고 순위가 모델 성능을 정확하게 반영하도록 보장하는 데 도움이 됩니다.

새로운 모델이 출시됨에 따라 OpenArt Arena 순위의 변화는 플랫폼의 관련성과 정확성을 나타내는 중요한 지표가 될 것입니다. 시간이 지남에 따라 순위가 어떻게 변하는지 모니터링하면 AI 크리에이티브 모델의 급속한 개발과 이러한 변화를 포착하는 벤치마크의 효율성에 대한 통찰력을 얻을 수 있습니다.

Contra Labs의 Human Creativity , Artificial Analysis의 Image Arena 등 경쟁 벤치마크의 반응이 중요할 것입니다. 이러한 플랫폼은 OpenArt의 출시에 맞춰 방법론을 조정하거나 새로운 기능을 출시할 수 있으며 잠재적으로 창의적인 AI 기능을 평가하는 보다 표준화되고 포괄적인 접근 방식으로 이어질 수 있습니다.

기업과 창의적 전문가의 OpenArt Arena 채택은 성공의 핵심 지표가 될 것입니다. 플랫폼이 모델 선택을 위해 널리 사용되는 도구가 되면 AI 창의적 모델 개발과 벤치마크에서 성능을 최적화하려는 AI 제공업체의 전략에 영향을 미칠 수 있습니다.

관련 가이드 및 퀴즈

AI 모델 설명AI의 미래AI란 무엇인가?알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?