DreamFusion 및 점수 증류 샘플링
DreamFusion은 2D 이미지 확산 모델을 비평가로 사용하여 텍스트에서 3D 개체를 생성하며 3D 데이터에 대해 교육하지 않습니다.
개요
Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.
심층 분석
2022년 Google의 DreamFusion은 다음과 같이 질문했습니다. 2D 텍스트-이미지 모델이 3D 장면이 모든 각도에서 올바르게 보이도록 가르칠 수 있습니까? NeRF(Neural Radiance Field)를 최적화하여 임의의 카메라 시점에서 렌더링할 때 노이즈가 발생하고 고정 확산 모델(Imagen)에 표시될 때 텍스트 프롬프트에 대해 그럴듯한 이미지로 점수를 매깁니다. 결정적으로 3D 훈련 데이터를 사용하지 않습니다. 획기적인 발전은 SDS(Score Distillation Sampling)입니다. 확산 모델의 값비싼 U-Net을 통해 역전파하는 대신 SDS는 모델의 예측 노이즈를 렌더링된 픽셀에서 직접 그래디언트 신호로 사용합니다. 수천 개의 관점에서 이를 반복하면 단일 문장으로 형상 및 뷰 종속 모양을 갖춘 일관된 3D 자산이 조각됩니다.
기술적 통찰력
SDS는 확산 모델을 고정 점수 함수로 처리합니다. NeRF를 렌더링하고, 노이즈를 추가하고, 확산 U-Net에 해당 노이즈를 예측하도록 요청하고, (예측된 노이즈에서 추가된 노이즈를 뺀 값) 렌더링된 이미지에 다시 밀려서 NeRF 가중치를 적용하여 기울기를 계산합니다. U-Net Jacobian을 건너뛰면 다루기 쉬워집니다. 선명한 결과를 얻으려면 높은 분류자 없는 안내(약 100개)가 필요하며 이로 인해 과포화되고 때로는 흐릿한 'DreamFusion 모양'이 발생합니다.
전략적 영향
속도와 규모
Visual AI는 대규모 검사, 감지 및 태그 지정 작업을 자동화할 수 있습니다.
빌드 선택
크리에이티브 팀은 수동 수정 횟수를 줄여 컨셉의 프로토타입을 더 빠르게 제작할 수 있습니다.
팀과 워크플로우
이전에는 처리하기 어려웠던 이미지 및 비디오 신호를 작업에 사용할 수 있습니다.
DreamFusion 및 점수 증류 샘플링의 미래
SDS는 해상도와 속도를 위한 Magic3D, 더 선명하고 다양한 출력을 위한 ProlificDreamer의 Variational Score Distillation, 'Janus' 다면 인공물을 공격하는 방법 등 약점을 수정하는 풍부한 작업 라인을 탄생시켰습니다. 이 분야에서는 SDS를 다중 뷰 확산 사전 및 Gaussian Splatting과 같은 빠른 3D 표현과 점점 더 결합하고 있습니다. 텍스트-3D 변환이 더욱 빠르고 기하학적으로 충실해지면서 손으로 모델링한 자산과의 격차가 줄어들 것으로 기대됩니다.
실제 구현
텍스트만으로 '작은 모자를 쓴 다람쥐의 DSLR 사진' 3D 모델 생성
수동 3D 조형 없이 초안 게임 및 AR 자산 제작
아티스트가 처음부터 만드는 대신 다듬을 수 있는 내보낼 수 있는 메시 생성
SDS에 대한 새로운 텍스트-3D 방법을 평가하기 위한 연구 기준선
위험 및 가드레일
출처가 불분명할 경우 이미지 권리 및 동의는 법적 위험이 될 수 있습니다.
모델 성능은 조명, 인구통계, 환경에 따라 달라질 수 있습니다.
신뢰도 임계값을 모니터링하지 않으면 거짓양성이 발견되지 않을 수 있습니다.
구현 로드맵
정밀도, 재현율, 오류 비용에 대한 허용 기준을 정의합니다.
실제 생산 조건과 일치하는 데이터로 테스트합니다.
신뢰도가 낮거나 영향력이 큰 예측에 대해 인적 검토를 추가합니다.
모델 드리프트를 추적하고 카메라 또는 데이터 세트가 변경된 후 재검증합니다.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamFusion and Score Distillation Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
다음 가이드
점수 기반 생성 모델
자주 묻는 질문
What is DreamFusion and Score Distillation Sampling?
DreamFusion은 2D 이미지 확산 모델을 비평가로 사용하여 텍스트에서 3D 개체를 생성하며 3D 데이터에 대해 교육하지 않습니다. 핵심 발명품인 Score Distillation Sampling은 전체 텍스트-3D 분야의 기본 레시피가 되었습니다.
DreamFusion은 어떤 3D 표현을 최적화합니까?
DreamFusion은 렌더링된 뷰가 텍스트 프롬프트에 대한 2D 확산 모델의 판단을 충족하도록 NeRF를 최적화합니다.
DreamFusion에는 얼마나 많은 3D 교육 데이터가 필요합니까?
DreamFusion은 고정된 2D 텍스트-이미지 확산 모델을 유일한 감독으로 사용하므로 3D 교육 데이터가 필요하지 않습니다.
Score Distillation Sampling의 주요 계산 지름길은 무엇입니까?
SDS는 예측된 마이너스 추가 노이즈를 렌더링된 픽셀의 직접 그라데이션으로 사용하여 비용이 많이 드는 U-Net 야코비안을 방지합니다.
DreamFusion이 매우 높은 분류자 없는 지침(~100)을 사용하는 이유는 무엇입니까?
SDS 그라데이션은 잡음이 많고 약하므로 과포화를 유발하더라도 선명하고 즉각적인 형상을 위해서는 비정상적으로 높은 유도가 필요합니다.
원래 DreamFusion은 어떤 2D 모델을 동결된 이전 버전으로 사용했습니까?
DreamFusion은 고정 채점 기능으로 Google의 Imagen 텍스트-이미지 확산 모델을 기반으로 구축되었습니다.