PANDUAN AI Visual

DreamFusion dan Pensampelan Penyulingan Skor

DreamFusion menjana objek 3D daripada teks dengan menggunakan model resapan imej 2D sebagai pengkritik, tidak pernah melatih mana-mana data 3D.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.

Menyelam dalam

DreamFusion, daripada Google pada tahun 2022, bertanya: bolehkah model teks-ke-imej 2D mengajar pemandangan 3D untuk kelihatan betul-betul dari setiap sudut? Ia mengoptimumkan NeRF (Neural Radiance Field) supaya pemaparan daripada sudut pandangan kamera rawak, apabila dibunyikan dan ditunjukkan kepada model resapan beku (Imagen), mendapat skor sebagai imej yang munasabah untuk gesaan teks. Yang penting ia tidak menggunakan data latihan 3D. Kejayaan itu ialah Pensampelan Penyulingan Skor (SDS): daripada merambat balik melalui U-Net mahal model resapan, SDS menggunakan bunyi ramalan model sebagai isyarat kecerunan terus pada piksel yang diberikan. Mengulang perkara ini merentasi beribu-ribu sudut pandangan mengukir aset 3D yang koheren, lengkap dengan geometri dan penampilan bergantung kepada paparan, daripada satu ayat.

Wawasan Teknikal

SDS menganggap model resapan sebagai fungsi pemarkahan beku. Ia menjadikan NeRF, menambah hingar, meminta resapan U-Net untuk meramalkan hingar itu, dan mengira kecerunan sebagai (bunyi yang diramalkan tolak hingar tambahan) ditolak semula ke imej yang diberikan dan dengan itu berat NeRF. Melangkau U-Net Jacobian menjadikannya mudah dikendalikan. Panduan bebas pengelas tinggi (sekitar 100) diperlukan untuk hasil yang tajam, yang menyebabkan ciri 'rupa DreamFusion' yang terlalu tepu, kadangkala kabur.

Kesan Strategik

Kelajuan dan skala

Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.

Pilihan binaan

Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.

Pasukan dan aliran kerja

Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.

Masa Depan DreamFusion dan Pensampelan Penyulingan Skor

SDS menghasilkan barisan kerja yang kaya untuk memperbaiki kelemahannya: Magic3D untuk resolusi dan kelajuan, Penyulingan Skor Variasi ProlificDreamer untuk output yang lebih tajam, lebih pelbagai dan kaedah menyerang artifak berbilang muka 'Janus'. Medan ini semakin menggandingkan SDS dengan pendahuluan resapan berbilang paparan dan perwakilan 3D pantas seperti Gaussian Splatting. Jangkakan teks-ke-3D berkembang lebih pantas dan lebih setia dari segi geometri, merapatkan jurang dengan aset model tangan.

Pelaksanaan Dunia Sebenar

Menjana model 3D 'foto DSLR tupai memakai topi kecil' daripada teks sahaja

Mencipta permainan draf dan aset AR tanpa ukiran 3D manual

Menghasilkan jerat boleh eksport yang diperhalusi oleh artis dan bukannya membina dari awal

Penyelidikan garis dasar untuk menilai kaedah teks-ke-3D yang lebih baharu terhadap SDS

Risiko & Pengawal

Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.

Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.

Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.

Hala Tuju Pelaksanaan

1

Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.

2

Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.

3

Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.

4

Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DreamFusion and Score Distillation Sampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Model Generatif Berasaskan Skor

Soalan lazim

What is DreamFusion and Score Distillation Sampling?

DreamFusion menjana objek 3D daripada teks dengan menggunakan model resapan imej 2D sebagai pengkritik, tidak pernah melatih mana-mana data 3D. Ciptaan terasnya, Pensampelan Penyulingan Skor, menjadi resipi asas untuk keseluruhan medan teks-ke-3D.

Apakah perwakilan 3D yang dioptimumkan oleh DreamFusion?

DreamFusion mengoptimumkan NeRF supaya paparan yang diberikan memenuhi pertimbangan model penyebaran 2D terhadap gesaan teks.

Berapa banyak data latihan 3D yang diperlukan oleh DreamFusion?

DreamFusion menggunakan model resapan teks-ke-imej 2D beku sebagai satu-satunya pengawasannya, tidak memerlukan data latihan 3D.

Apakah pintasan pengiraan utama dalam Pensampelan Penyulingan Skor?

SDS menggunakan ramalan-tolak-tambah hingar sebagai kecerunan langsung pada piksel yang diberikan, mengelakkan U-Net Jacobian yang mahal.

Mengapakah DreamFusion menggunakan panduan tanpa pengelas yang sangat tinggi (~100)?

Kecerunan SDS adalah bising dan lemah, jadi bimbingan tinggi yang luar biasa diperlukan untuk geometri yang jelas dan segera, walaupun ia menyebabkan ketepuan berlebihan.

Model 2D manakah yang DreamFusion asal gunakan sebagai model beku sebelumnya?

DreamFusion dibina pada model resapan teks-ke-imej Imagen Google sebagai fungsi pemarkahan beku.