Model Difusi Laten
Model difusi laten menghasilkan gambar dengan menjalankan proses difusi dalam ruang laten terkompresi, bukan piksel mentah, sehingga mengurangi biaya komputasi.
Ikhtisar
They are the engine behind Stable Diffusion and most modern open-source image generators.
Menyelam Lebih Dalam
Model difusi standar belajar membalikkan proses derau: dimulai dari derau murni dan secara bertahap menghilangkan derau menjadi sebuah gambar. Melakukan hal ini secara langsung pada piksel membutuhkan biaya yang mahal karena gambar berukuran 512x512 memiliki ratusan ribu nilai. Difusi laten, yang diperkenalkan oleh Rombach dan rekannya pada tahun 2022, pertama kali menggunakan autoencoder variasional terlatih (VAE) untuk mengompresi gambar menjadi grid laten kecil (seringkali berukuran 64x64x4, kira-kira 48x lebih kecil). U-Net difusi kemudian belajar untuk menyangkal kebisingan di dalam ruang laten yang padat itu, dipandu oleh teks melalui perhatian silang. Terakhir, dekoder VAE merekonstruksi piksel resolusi penuh. Kompresi persepsi ini menjaga informasi yang bermakna secara semantik sekaligus membuang detail yang tidak terlihat, sehingga menghasilkan generasi berkualitas tinggi yang dapat dilakukan pada GPU konsumen.
Wawasan Teknis
Trik kuncinya adalah memisahkan kompresi persepsi dari pemodelan generatif. VAE menangani detail piksel frekuensi tinggi satu kali, dan U-Net hanya memodelkan distribusi laten dimensi rendah. Pengondisian teks dimasukkan melalui lapisan perhatian silang, di mana fitur spasial U-Net menangani penyematan token dari pembuat enkode teks seperti CLIP. Karena laten kira-kira 48 kali lebih kecil dari piksel, setiap langkah denoising jauh lebih murah baik di memori maupun FLOP.
Dampak Strategis
Kecepatan dan skala
Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.
Build choices
Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.
Team and workflow
Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.
Masa Depan Model Difusi Laten
Difusi laten berkembang melampaui gambar menjadi video (Difusi Video Stabil), aset 3D, dan spektogram audio, semuanya menggunakan resep kompres-lalu-denoise yang sama. Penelitian mendorong langkah pengambilan sampel yang lebih sedikit melalui model distilasi dan konsistensi, VAE yang lebih baik yang mempertahankan teks dan wajah yang halus, dan formulasi aliran yang diperbaiki seperti yang ada di Difusi Stabil 3 yang meluruskan lintasan pembangkitan untuk hasil yang lebih cepat dan tajam.
Implementasi Dunia Nyata
Difusi Stabil menghasilkan karya seni dan desain konsep dari perintah teks pada satu GPU konsumen
Adobe dan Canva mendukung fitur teks-ke-gambar dan pengisian generatif yang dibangun di atas tulang punggung difusi laten
Studio game memproduksi peta tekstur, sprite, dan seni konsep lingkungan untuk mempercepat praproduksi
Tim gambar stok dan pemasaran membuat maket produk merek dan visual iklan tanpa pemotretan
Risiko & Pagar Pembatas
Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.
Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.
Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.
Peta Jalan Implementasi
Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.
Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.
Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.
Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Model Difusi Video
Pertanyaan yang sering diajukan
What is Latent Diffusion Models?
Model difusi laten menghasilkan gambar dengan menjalankan proses difusi dalam ruang laten terkompresi, bukan piksel mentah, sehingga mengurangi biaya komputasi. Mereka adalah mesin di balik Difusi Stabil dan sebagian besar generator gambar sumber terbuka modern.
Apa inovasi utama model difusi laten dibandingkan dengan difusi ruang piksel?
Difusi laten memampatkan gambar ke dalam ruang laten yang lebih kecil menggunakan VAE, sehingga denoising yang mahal terjadi pada nilai yang jauh lebih kecil dibandingkan piksel penuh.
Komponen manakah yang memampatkan gambar ke dalam ruang laten dan merekonstruksinya setelahnya?
VAE yang telah dilatih sebelumnya mengkodekan gambar ke dalam kisi laten yang ringkas dan dekodernya merekonstruksi piksel resolusi penuh di bagian akhir.
Bagaimana teks biasanya dimasukkan ke dalam U-Net yang mencela dalam difusi laten?
Penyematan token dari pembuat enkode teks dimasukkan ke dalam lapisan perhatian silang, sehingga fitur spasial dapat menangani perintah tersebut.
Mengapa pengoperasian di ruang laten mengurangi biaya komputasi?
Tunggu — alasan yang benar adalah bahwa grid laten jauh lebih kecil (seringkali ~48x) dibandingkan gambar piksel, sehingga setiap langkah denoising memerlukan FLOP dan memori yang jauh lebih sedikit.
Model sumber terbuka manakah yang mempopulerkan difusi laten?
Difusi Stabil, yang dirilis pada tahun 2022, membawa difusi laten ke perangkat keras konsumen dan adopsi massal.