Model Resapan Terpendam
Model resapan terpendam menjana imej dengan menjalankan proses resapan dalam ruang terpendam termampat dan bukannya piksel mentah, mengurangkan kos pengiraan.
Gambaran keseluruhan
They are the engine behind Stable Diffusion and most modern open-source image generators.
Menyelam dalam
Model resapan standard belajar untuk membalikkan proses hingar: ia bermula daripada hingar tulen dan secara beransur-ansur denoise menjadi imej. Melakukan ini secara langsung pada piksel adalah mahal kerana imej 512x512 mempunyai ratusan ribu nilai. Penyebaran terpendam, yang diperkenalkan oleh Rombach dan rakan sekerja pada 2022, mula-mula menggunakan pengekod auto variasi pralatihan (VAE) untuk memampatkan imej ke dalam grid terpendam kecil (selalunya 64x64x4, lebih kurang 48x lebih kecil). Penyebaran U-Net kemudiannya belajar untuk mendenoise di dalam ruang terpendam padat itu, dipandu oleh teks melalui perhatian silang. Akhirnya penyahkod VAE membina semula piksel resolusi penuh. Mampatan persepsi ini mengekalkan maklumat yang bermakna secara semantik sambil membuang butiran yang tidak dapat dilihat, menjadikan penjanaan berkualiti tinggi boleh dilaksanakan pada GPU pengguna.
Wawasan Teknikal
Helah utama ialah memisahkan mampatan persepsi daripada pemodelan generatif. VAE mengendalikan butiran piksel frekuensi tinggi sekali, dan U-Net hanya memodelkan taburan terpendam berdimensi rendah. Pelaziman teks disuntik melalui lapisan perhatian silang, di mana ciri spatial U-Net menangani pembenaman token daripada pengekod teks seperti CLIP. Oleh kerana laten adalah kira-kira 48 kali lebih kecil daripada piksel, setiap langkah denoising adalah secara mendadak lebih murah dalam kedua-dua memori dan FLOP.
Kesan Strategik
Kelajuan dan skala
Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.
Pilihan binaan
Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.
Pasukan dan aliran kerja
Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.
Masa Depan Model Resapan Terpendam
Resapan terpendam berkembang melangkaui imej ke dalam video (Resapan Video Stabil), aset 3D dan spektrogram audio, semuanya menggunakan resipi mampat-kemudian-denoise yang sama. Penyelidikan sedang mendorong ke arah langkah pensampelan yang lebih sedikit melalui model penyulingan dan ketekalan, VAE yang lebih baik yang mengekalkan teks dan muka halus, dan formulasi aliran diperbetulkan seperti yang terdapat dalam Resapan Stabil 3 yang meluruskan trajektori penjanaan untuk mendapatkan hasil yang lebih pantas dan lebih tajam.
Pelaksanaan Dunia Sebenar
Resapan Stabil menjana karya seni dan reka bentuk konsep daripada gesaan teks pada GPU pengguna tunggal
Adobe dan Canva menjanakan ciri teks-ke-imej dan isian generatif yang dibina pada tulang belakang penyebaran terpendam
Studio permainan menghasilkan peta tekstur, sprite dan seni konsep persekitaran untuk mempercepatkan pra-pengeluaran
Pasukan imej saham dan pemasaran mencipta mockup produk atas jenama dan visual iklan tanpa sesi pemotretan
Risiko & Pengawal
Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.
Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.
Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.
Hala Tuju Pelaksanaan
Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.
Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.
Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.
Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Model Penyebaran Video
Soalan lazim
What is Latent Diffusion Models?
Model resapan terpendam menjana imej dengan menjalankan proses resapan dalam ruang terpendam termampat dan bukannya piksel mentah, mengurangkan kos pengiraan. Mereka adalah enjin di sebalik Stable Diffusion dan kebanyakan penjana imej sumber terbuka moden.
Apakah inovasi utama model resapan terpendam berbanding resapan ruang piksel?
Resapan terpendam memampatkan imej ke dalam ruang terpendam yang lebih kecil menggunakan VAE, jadi denoising mahal berlaku pada nilai yang jauh lebih sedikit daripada piksel penuh.
Komponen manakah yang memampatkan imej ke dalam ruang terpendam dan membina semula selepas itu?
VAE yang telah dilatih mengekod imej ke dalam grid terpendam padat dan penyahkodnya membina semula piksel resolusi penuh pada penghujungnya.
Bagaimanakah teks biasanya disuntik ke dalam U-Net denoising dalam resapan terpendam?
Pembenaman token daripada pengekod teks dimasukkan ke dalam lapisan perhatian silang, membenarkan ciri spatial mengikuti gesaan.
Mengapakah operasi dalam ruang terpendam mengurangkan kos pengiraan?
Tunggu — sebab yang betul ialah grid terpendam jauh lebih kecil (selalunya ~48x) daripada imej piksel, jadi setiap langkah menafikan memerlukan FLOP dan memori yang jauh lebih sedikit.
Model sumber terbuka yang digunakan secara meluas yang mempopularkan penyebaran terpendam?
Stable Diffusion, yang dikeluarkan pada 2022, membawa resapan terpendam kepada perkakasan pengguna dan penggunaan besar-besaran.