비주얼 AI 가이드

GLIGEN 접지 생성

GLIGEN(Grounded-Language-to-Image Generation)을 사용하면 텍스트 프롬프트와 함께 모델 경계 상자 및 레이블을 제공하여 생성된 이미지에서 객체가 나타나는 위치를 정확하게 제어할 수 있습니다.

2분 읽기마지막 업데이트

개요

It turns vague text-to-image into precise, layout-controllable synthesis.

심층 분석

표준 텍스트-이미지 모델은 공간 제어에 어려움을 겪습니다. '개 왼쪽에 고양이'를 요청하면 배치가 잘못된 경우가 많습니다. 2023년에 도입된 GLIGEN은 텍스트 또는 이미지 엔터티, 키포인트 또는 참조 이미지와 쌍을 이루는 경계 상자와 같은 접지 입력을 추가하여 이 문제를 해결합니다. 결정적으로, 원래의 사전 훈련된 확산 모델의 가중치를 동결하고 접지 토큰을 흡수하는 새로운 훈련 가능한 Gated Self-Attention 레이어를 주입합니다. 이는 학습된 지식을 파괴하지 않고 Stable Diffusion과 같은 모델을 기반으로 구축되며 게이팅이 0 근처에서 시작되므로 기본 모델의 동작이 훈련 초기에 보존된다는 의미입니다. 결과는 개방형 접지 생성입니다. 설명된 임의의 개체를 지정된 위치에 배치할 수 있으며 접지 훈련 중에 볼 수 없는 개념과 레이아웃으로 일반화됩니다.

기술적 통찰력

GLIGEN은 푸리에 기능을 통해 인코딩된 경계 상자의 4개 좌표와 같은 공간 정보와 텍스트 또는 이미지 삽입을 결합한 토큰으로 각 접지 엔터티를 나타냅니다. 이러한 접지 토큰은 기존 Self-Attention 블록과 Cross-Attention 블록 사이에 새로 삽입된 Gated Self-Attention 레이어를 통해 동결 확산 U-Net에 들어갑니다. 0으로 초기화된 학습 가능한 게이트는 접지가 생성에 미치는 영향을 제어하므로 제어를 추가하면 성능이 저하되고 훈련은 안정적으로 유지됩니다.

전략적 영향

속도와 규모

Visual AI는 대규모 검사, 감지 및 태그 지정 작업을 자동화할 수 있습니다.

빌드 선택

크리에이티브 팀은 수동 수정 횟수를 줄여 컨셉의 프로토타입을 더 빠르게 제작할 수 있습니다.

팀과 워크플로우

이전에는 처리하기 어려웠던 이미지 및 비디오 신호를 작업에 사용할 수 있습니다.

GLIGEN 접지 발전의 미래

접지형 및 레이아웃 제어 가능 생성이 생산 도구의 표준이 되고 있습니다. GLIGEN 스타일 공간 조정이 ControlNet 및 지역 프롬프트와 같은 다른 제어 방법과 통합되고 시간과 공간에 따른 개체 배치가 더욱 중요한 비디오 및 3D로 확장될 것으로 기대합니다. 모델이 지시에 따른 인터페이스를 채택함에 따라 드래그 앤 드롭 레이아웃 제어 및 언어 지정 장면 그래프를 통해 신속한 엔지니어링 트릭 없이도 정확한 구성에 액세스할 수 있습니다.

실제 구현

경계 상자를 사용하여 생성된 광고의 정확한 영역에 로고나 제품 배치

렌더링하기 전에 각 캐릭터나 객체가 앉아야 할 위치를 지정하여 복잡한 장면 구성

알려진 실측 상자 위치를 사용하여 객체 감지를 위한 훈련 데이터 생성

설명된 개체를 기존 사진의 사용자가 그린 영역에 다시 그리기

위험 및 가드레일

출처가 불분명할 경우 이미지 권리 및 동의는 법적 위험이 될 수 있습니다.

모델 성능은 조명, 인구통계, 환경에 따라 달라질 수 있습니다.

신뢰도 임계값을 모니터링하지 않으면 거짓양성이 발견되지 않을 수 있습니다.

구현 로드맵

1

정밀도, 재현율, 오류 비용에 대한 허용 기준을 정의합니다.

2

실제 생산 조건과 일치하는 데이터로 테스트합니다.

3

신뢰도가 낮거나 영향력이 큰 예측에 대해 인적 검토를 추가합니다.

4

모델 드리프트를 추적하고 카메라 또는 데이터 세트가 변경된 후 재검증합니다.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GLIGEN Grounded Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

자주 묻는 질문

What is GLIGEN Grounded Generation?

GLIGEN(Grounded-Language-to-Image Generation)을 사용하면 텍스트 프롬프트와 함께 모델 경계 상자 및 레이블을 제공하여 생성된 이미지에서 객체가 나타나는 위치를 정확하게 제어할 수 있습니다. 모호한 텍스트 대 이미지를 정확하고 레이아웃 제어가 가능한 합성으로 바꿔줍니다.

GLIGEN은 주로 어떤 문제를 해결하나요?

GLIGEN은 경계 상자와 같은 접지 입력을 추가하므로 일반 텍스트 프롬프트에서는 제대로 처리되지 않는 객체 배치 위치를 정확하게 제어할 수 있습니다.

GLIGEN은 사전 훈련된 확산 모델에 대한 지식을 어떻게 보존합니까?

GLIGEN은 기본 모델을 동결하고 새로운 Gated Self-Attention 레이어를 주입하므로 원래 학습된 지식은 그대로 유지됩니다.

GLIGEN이 허용하는 일반적인 접지 입력은 무엇입니까?

GLIGEN은 텍스트/이미지 엔터티, 키포인트 및 참조 이미지가 있는 경계 상자를 통한 접지를 지원합니다.

GLIGEN의 새로운 Attention 레이어의 게이트가 0으로 초기화되는 이유는 무엇입니까?

0으로 초기화된 게이트는 접지가 처음에는 아무런 영향을 미치지 않음을 의미하며 원래 모델을 보존하고 제어가 증가함에 따라 훈련을 안정적으로 유지합니다.

GLIGEN에서 '오픈 월드' 기반 세대는 무엇을 의미합니까?

GLIGEN은 접지 훈련 세트를 넘어 일반화하여 지정된 위치에 새로운 설명 개체를 배치합니다.