비주얼 AI 가이드

널 텍스트 반전

Null 텍스트 반전은 변경을 요청하지 않은 모든 것을 완벽하게 그대로 유지하면서 Stable Diffusion과 같은 텍스트 기반 확산 모델을 사용하여 실제 사진을 편집할 수 있는 기술입니다.

2분 읽기마지막 업데이트

개요

It bridges the gap between generating fresh images and faithfully reconstructing and re-editing ones you already have.

심층 분석

확산 모델을 사용하여 실제 이미지를 편집하려면 먼저 생성 프로세스를 역방향으로 실행하여 이미지를 재현하는 노이즈를 찾아야 합니다. DDIM 반전이라는 빠른 방법이 이를 수행하지만 표류하므로 재구성이 약간 잘못된 것처럼 보입니다. 텍스트 프롬프트가 이미지를 조종하는 정도를 높이는 분류자 없는 안내는 이러한 표류를 심하게 증폭시킵니다. 2022년에 Google 연구원이 도입한 Null 텍스트 반전은 모델을 고정한 상태로 두고 대신 안내에 사용되는 'null'(빈) 텍스트 임베딩을 노이즈 제거 시간 단계당 하나씩 최적화하여 이 문제를 해결합니다. 이렇게 하면 재구성된 내용이 원본 이미지에 다시 고정되므로 '개'를 '고양이'로 바꾸는 등 나중에 즉각적인 편집을 통해 의도한 내용만 변경할 수 있습니다.

기술적 통찰력

분류기가 없는 지침은 조건부 예측(프롬프트 포함)과 무조건 예측(빈 프롬프트 임베딩 포함) 사이를 추정합니다. Null 텍스트 반전은 실제 프롬프트와 가중치를 고정한 상태로 유지하고 대략 50개 확산 단계 각각에서 빈 임베딩만 그라데이션 최적화하여 안내 궤적이 사전 계산된 DDIM 경로를 추적하도록 합니다. 그 결과 전체 안내 강도를 통해 거의 픽셀에 가까운 완벽하게 재구성되어 프롬프트에서 자유롭게 정확한 편집을 수행할 수 있습니다.

전략적 영향

속도와 규모

Visual AI는 대규모 검사, 감지 및 태그 지정 작업을 자동화할 수 있습니다.

빌드 선택

크리에이티브 팀은 수동 수정 횟수를 줄여 컨셉의 프로토타입을 더 빠르게 제작할 수 있습니다.

팀과 워크플로우

이전에는 처리하기 어려웠던 이미지 및 비디오 신호를 작업에 사용할 수 있습니다.

널 텍스트 반전의 미래

Null 텍스트 반전은 이미지별로 최적화되기 때문에 속도가 느렸습니다. 따라서 최신 작업에서는 최적화가 필요 없는 즉각적인 반전을 지향합니다. Negative-Prompt Inversion, Direct Inversion과 같은 방법과 더 빠른 일관성 및 몇 단계 모델을 기반으로 하는 접근 방식은 단일 정방향 전달에서 동일한 충실도를 목표로 합니다. 반전은 소비자 사진 편집기 내부에 조용하고 내장된 단계가 되어 사용자가 수학을 보지 않고도 안정적인 실제 이미지 편집을 가능하게 할 것으로 기대됩니다.

실제 구현

거리, 사람, 조명은 그대로 유지하면서 주차된 차량은 다른 색상으로 변경되도록 실제 휴가 사진을 편집합니다.

배경이나 포즈를 변경하지 않고 가족사진에서 실제 애완동물의 품종을 바꾸는 것

프롬프트 단어만 편집하여 풍경 사진의 계절(여름 단풍에서 가을)로 변경

연구 데모 및 편집 앱 내에서 사용자가 업로드한 이미지에 대한 '즉시' 스타일의 로컬 편집 기능 제공

위험 및 가드레일

출처가 불분명할 경우 이미지 권리 및 동의는 법적 위험이 될 수 있습니다.

모델 성능은 조명, 인구통계, 환경에 따라 달라질 수 있습니다.

신뢰도 임계값을 모니터링하지 않으면 거짓양성이 발견되지 않을 수 있습니다.

구현 로드맵

1

정밀도, 재현율, 오류 비용에 대한 허용 기준을 정의합니다.

2

실제 생산 조건과 일치하는 데이터로 테스트합니다.

3

신뢰도가 낮거나 영향력이 큰 예측에 대해 인적 검토를 추가합니다.

4

모델 드리프트를 추적하고 카메라 또는 데이터 세트가 변경된 후 재검증합니다.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Null-Text Inversion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

Make-A-Video 텍스트-비디오

자주 묻는 질문

What is Null-Text Inversion?

Null 텍스트 반전은 변경을 요청하지 않은 모든 것을 완벽하게 그대로 유지하면서 Stable Diffusion과 같은 텍스트 기반 확산 모델을 사용하여 실제 사진을 편집할 수 있는 기술입니다. 새로운 이미지를 생성하는 것과 이미 가지고 있는 이미지를 충실하게 재구성 및 재편집하는 것 사이의 격차를 해소합니다.

널 텍스트 반전은 실제로 무엇을 최적화합니까?

모델과 실제 프롬프트를 고정한 상태로 유지하고 각 단계에서 무조건/널 텍스트 임베딩만 최적화하므로 빠르고 비파괴적입니다.

편집에 사용할 때 일반 DDIM 반전이 불안정해지는 이유는 무엇입니까?

DDIM 반전은 작은 오류를 축적하며 좋은 편집에 필요한 강력한 지침은 이러한 드리프트를 확대하여 재구성을 저하시킵니다.

실제 이미지를 편집하기 전에 반전시키는 주요 목표는 무엇입니까?

편집에는 원본을 재구성하는 노이즈 시드와 궤적이 필요하므로 즉각적인 변경은 의도한 내용만 변경합니다.

널 텍스트 반전은 확산 프로세스 전반에 걸쳐 최적화를 대략 어떻게 처리합니까?

고유한 널 텍스트 임베딩은 시간 단계별로 조정되므로 안내 경로가 미리 계산된 반전 궤적을 밀접하게 추적합니다.

Null 텍스트 반전은 어떤 종류의 편집 접근 방식과 가장 일반적으로 결합됩니까?

실제 이미지가 충실하게 반전되면 프롬프트 간 방식과 같은 프롬프트 기반 방법을 통해 목표에 맞게 현지화된 변경을 수행할 수 있습니다.