PANDUAN AI Visual

Pengambilan Sampel Distilasi DreamFusion dan Skor

DreamFusion menghasilkan objek 3D dari teks dengan menggunakan model difusi gambar 2D sebagai kritik, tidak pernah melatih data 3D apa pun.

2 min readTerakhir diperbarui

Ikhtisar

Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.

Menyelam Lebih Dalam

DreamFusion, dari Google pada tahun 2022, bertanya: dapatkah model teks-ke-gambar 2D mengajarkan adegan 3D agar terlihat langsung dari segala sudut? Ini mengoptimalkan NeRF (Neural Radiance Field) sehingga rendering dari sudut pandang kamera acak, ketika diberi noise dan ditampilkan ke model difusi beku (Imagen), mendapat skor sebagai gambar yang masuk akal untuk prompt teks. Yang terpenting, ini tidak menggunakan data pelatihan 3D. Terobosannya adalah Score Distillation Sampling (SDS): alih-alih melakukan propagasi mundur melalui U-Net model difusi yang mahal, SDS menggunakan prediksi noise model sebagai sinyal gradien langsung pada piksel yang dirender. Mengulanginya di ribuan sudut pandang akan menghasilkan aset 3D yang koheren, lengkap dengan geometri dan tampilan yang bergantung pada tampilan, dari satu kalimat.

Wawasan Teknis

SDS memperlakukan model difusi sebagai fungsi penilaian beku. Ini merender NeRF, menambahkan noise, meminta difusi U-Net untuk memprediksi noise tersebut, dan menghitung gradien sebagai (prediksi noise dikurangi noise tambahan) yang didorong kembali ke gambar yang dirender dan dengan demikian memberikan bobot NeRF. Melewatkan U-Net Jacobian membuatnya mudah diatur. Panduan tinggi bebas pengklasifikasi (sekitar 100) diperlukan untuk hasil yang tajam, yang menyebabkan karakteristik 'tampilan DreamFusion' terlalu jenuh dan terkadang buram.

Dampak Strategis

Kecepatan dan skala

Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.

Build choices

Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.

Team and workflow

Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.

Masa Depan Pengambilan Sampel Distilasi DreamFusion dan Skor

SDS melahirkan banyak pekerjaan yang memperbaiki kelemahannya: Magic3D untuk resolusi dan kecepatan, Distilasi Skor Variasi ProlificDreamer untuk keluaran yang lebih tajam dan beragam, dan metode menyerang artefak multi-wajah 'Janus'. Bidang ini semakin banyak memasangkan SDS dengan difusi multi-tampilan sebelumnya dan representasi 3D cepat seperti Gaussian Splatting. Harapkan teks ke 3D tumbuh lebih cepat dan lebih sesuai secara geometris, sehingga mempersempit kesenjangan dengan aset model tangan.

Implementasi Dunia Nyata

Menghasilkan model 3D 'foto DSLR seekor tupai yang memakai topi kecil' hanya dari teks

Membuat draf game dan aset AR tanpa pemahatan 3D manual

Memproduksi jaring yang dapat diekspor yang disempurnakan oleh seniman, bukan dibuat dari awal

Penelitian dasar untuk mengevaluasi metode text-to-3D yang lebih baru terhadap SDS

Risiko & Pagar Pembatas

Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.

Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.

Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.

Peta Jalan Implementasi

1

Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.

2

Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.

3

Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.

4

Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DreamFusion and Score Distillation Sampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Model Generatif Berbasis Skor

Pertanyaan yang sering diajukan

What is DreamFusion and Score Distillation Sampling?

DreamFusion menghasilkan objek 3D dari teks dengan menggunakan model difusi gambar 2D sebagai kritik, tidak pernah melatih data 3D apa pun. Penemuan intinya, Score Distillation Sampling, menjadi resep dasar untuk seluruh bidang teks-ke-3D.

Representasi 3D apa yang dioptimalkan DreamFusion?

DreamFusion mengoptimalkan NeRF sehingga tampilan yang diberikan memenuhi penilaian model difusi 2D terhadap perintah teks.

Berapa banyak data pelatihan 3D yang dibutuhkan DreamFusion?

DreamFusion menggunakan model difusi teks-ke-gambar 2D yang dibekukan sebagai satu-satunya pengawasan, tidak memerlukan data pelatihan 3D.

Apa pintasan komputasi utama dalam Pengambilan Sampel Distilasi Skor?

SDS menggunakan noise yang diprediksi-minus-tambahan sebagai gradien langsung pada piksel yang dirender, menghindari U-Net Jacobian yang mahal.

Mengapa DreamFusion menggunakan panduan bebas pengklasifikasi yang sangat tinggi (~100)?

Gradien SDS berisik dan lemah, sehingga diperlukan panduan yang sangat tinggi untuk mendapatkan geometri yang tajam dan cepat, meskipun hal ini menyebabkan saturasi berlebih.

Model 2D manakah yang digunakan DreamFusion asli sebagai model beku sebelumnya?

DreamFusion dibuat berdasarkan model difusi teks-ke-gambar Imagen Google sebagai fungsi penilaian beku.