PANDUAN AI Visual

Model Resapan Terpendam

Model resapan terpendam menjana imej dengan menjalankan proses resapan dalam ruang terpendam termampat dan bukannya piksel mentah, mengurangkan kos pengiraan.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

They are the engine behind Stable Diffusion and most modern open-source image generators.

Menyelam dalam

Model resapan standard belajar untuk membalikkan proses hingar: ia bermula daripada hingar tulen dan secara beransur-ansur denoise menjadi imej. Melakukan ini secara langsung pada piksel adalah mahal kerana imej 512x512 mempunyai ratusan ribu nilai. Penyebaran terpendam, yang diperkenalkan oleh Rombach dan rakan sekerja pada 2022, mula-mula menggunakan pengekod auto variasi pralatihan (VAE) untuk memampatkan imej ke dalam grid terpendam kecil (selalunya 64x64x4, lebih kurang 48x lebih kecil). Penyebaran U-Net kemudiannya belajar untuk mendenoise di dalam ruang terpendam padat itu, dipandu oleh teks melalui perhatian silang. Akhirnya penyahkod VAE membina semula piksel resolusi penuh. Mampatan persepsi ini mengekalkan maklumat yang bermakna secara semantik sambil membuang butiran yang tidak dapat dilihat, menjadikan penjanaan berkualiti tinggi boleh dilaksanakan pada GPU pengguna.

Wawasan Teknikal

Helah utama ialah memisahkan mampatan persepsi daripada pemodelan generatif. VAE mengendalikan butiran piksel frekuensi tinggi sekali, dan U-Net hanya memodelkan taburan terpendam berdimensi rendah. Pelaziman teks disuntik melalui lapisan perhatian silang, di mana ciri spatial U-Net menangani pembenaman token daripada pengekod teks seperti CLIP. Oleh kerana laten adalah kira-kira 48 kali lebih kecil daripada piksel, setiap langkah denoising adalah secara mendadak lebih murah dalam kedua-dua memori dan FLOP.

Kesan Strategik

Kelajuan dan skala

Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.

Pilihan binaan

Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.

Pasukan dan aliran kerja

Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.

Masa Depan Model Resapan Terpendam

Resapan terpendam berkembang melangkaui imej ke dalam video (Resapan Video Stabil), aset 3D dan spektrogram audio, semuanya menggunakan resipi mampat-kemudian-denoise yang sama. Penyelidikan sedang mendorong ke arah langkah pensampelan yang lebih sedikit melalui model penyulingan dan ketekalan, VAE yang lebih baik yang mengekalkan teks dan muka halus, dan formulasi aliran diperbetulkan seperti yang terdapat dalam Resapan Stabil 3 yang meluruskan trajektori penjanaan untuk mendapatkan hasil yang lebih pantas dan lebih tajam.

Pelaksanaan Dunia Sebenar

Resapan Stabil menjana karya seni dan reka bentuk konsep daripada gesaan teks pada GPU pengguna tunggal

Adobe dan Canva menjanakan ciri teks-ke-imej dan isian generatif yang dibina pada tulang belakang penyebaran terpendam

Studio permainan menghasilkan peta tekstur, sprite dan seni konsep persekitaran untuk mempercepatkan pra-pengeluaran

Pasukan imej saham dan pemasaran mencipta mockup produk atas jenama dan visual iklan tanpa sesi pemotretan

Risiko & Pengawal

Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.

Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.

Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.

Hala Tuju Pelaksanaan

1

Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.

2

Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.

3

Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.

4

Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Model Penyebaran Video

Soalan lazim

What is Latent Diffusion Models?

Model resapan terpendam menjana imej dengan menjalankan proses resapan dalam ruang terpendam termampat dan bukannya piksel mentah, mengurangkan kos pengiraan. Mereka adalah enjin di sebalik Stable Diffusion dan kebanyakan penjana imej sumber terbuka moden.

Apakah inovasi utama model resapan terpendam berbanding resapan ruang piksel?

Resapan terpendam memampatkan imej ke dalam ruang terpendam yang lebih kecil menggunakan VAE, jadi denoising mahal berlaku pada nilai yang jauh lebih sedikit daripada piksel penuh.

Komponen manakah yang memampatkan imej ke dalam ruang terpendam dan membina semula selepas itu?

VAE yang telah dilatih mengekod imej ke dalam grid terpendam padat dan penyahkodnya membina semula piksel resolusi penuh pada penghujungnya.

Bagaimanakah teks biasanya disuntik ke dalam U-Net denoising dalam resapan terpendam?

Pembenaman token daripada pengekod teks dimasukkan ke dalam lapisan perhatian silang, membenarkan ciri spatial mengikuti gesaan.

Mengapakah operasi dalam ruang terpendam mengurangkan kos pengiraan?

Tunggu — sebab yang betul ialah grid terpendam jauh lebih kecil (selalunya ~48x) daripada imej piksel, jadi setiap langkah menafikan memerlukan FLOP dan memori yang jauh lebih sedikit.

Model sumber terbuka yang digunakan secara meluas yang mempopularkan penyebaran terpendam?

Stable Diffusion, yang dikeluarkan pada 2022, membawa resapan terpendam kepada perkakasan pengguna dan penggunaan besar-besaran.