Model Difusi
Model difusi menghasilkan gambar dengan belajar membalikkan proses gangguan, mengubah gambar statis acak menjadi gambar detail langkah demi langkah.
Ikhtisar
They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.
Menyelam Lebih Dalam
Model difusi dilatih dalam dua arah. Dalam proses selanjutnya, gambar yang bersih secara bertahap dirusak dengan menambahkan sejumlah kecil noise acak hingga menjadi gambar statis murni. Model tersebut kemudian mempelajari hal sebaliknya: mulai dari noise, model tersebut memprediksi dan menghilangkan sedikit noise di setiap langkah, mengulanginya puluhan atau ratusan kali hingga muncul gambar yang tajam. Agar hal ini dapat dikontrol, perintah teks memandu setiap langkah penolakan, sehingga "seorang astronot menunggang kuda" mengarahkan statis ke arah gambar tersebut. Sistem modern seperti Difusi Stabil menjalankan proses ini dalam ruang laten terkompresi, bukan dalam piksel mentah, sehingga jauh lebih cepat. Dibandingkan dengan GAN, model difusi dilatih lebih stabil dan menghasilkan keragaman yang lebih besar, itulah sebabnya model ini mengambil alih GAN sebagai pendekatan dominan dalam menghasilkan gambar berkualitas tinggi pada tahun 2022.
Wawasan Teknis
Trik utamanya adalah jaringan tidak perlu menghasilkan gambar dalam satu pengambilan; ia hanya belajar memprediksi kebisingan yang ditambahkan pada langkah tertentu. Selama pelatihan, sejumlah noise yang diketahui ditambahkan ke gambar nyata dan model diminta untuk memperkirakan noise tersebut; perbedaannya adalah kesalahan pelatihan. Pada saat pembangkitan, model berulang kali mengurangi kebisingan yang diprediksi, sehingga secara bertahap memperlihatkan strukturnya. Pengkondisian teks dimasukkan melalui perhatian silang, dan panduan bebas pengklasifikasi memperkuat seberapa kuat perintah mengarahkan keluaran.
Dampak Strategis
Clearer decisions
Ini membantu Anda memisahkan klaim teknis yang jelas dari bahasa pemasaran.
Cost and budget
Anda dapat mengajukan pertanyaan implementasi yang lebih baik sebelum mengeluarkan uang atau waktu.
Team and workflow
Tim dengan pemahaman bersama membuat keputusan produk, kebijakan, dan pembelajaran yang lebih baik.
Masa Depan Model Difusi
Difusi adalah teknologi terkini dalam pembuatan gambar, dan semakin banyak video dan audio, dengan alat seperti Sora yang memperluasnya ke gerakan. Dorongan terbesarnya adalah kecepatan: teknik seperti model distilasi dan konsistensi bertujuan untuk mengurangi ratusan langkah denoising menjadi beberapa atau bahkan satu, sehingga memungkinkan pembuatan secara real-time. Harapkan difusi akan meluas ke aset 3D, desain ilmiah seperti molekul dan protein, dan pengeditan yang dapat dikontrol dengan ketat, sekaligus menjadi cukup murah untuk dijalankan di ponsel.
Implementasi Dunia Nyata
Membuat karya seni dan gambar asli dari petunjuk teks di Stable Diffusion, DALL-E, dan Midjourney
Inpainting dan outpainting, mengisi atau memperluas bagian foto dengan mulus
Menghasilkan video dari teks dengan alat seperti Sora milik OpenAI
Merancang molekul baru dan struktur protein untuk penelitian penemuan obat
Risiko & Pagar Pembatas
Tim yang berbeda mungkin menggunakan istilah yang sama secara berbeda, jadi tentukan cakupannya sejak dini.
Tolok ukur dapat terlihat kuat sementara kinerja di dunia nyata tidak merata.
Mengabaikan kualitas data dan rencana evaluasi sering kali menimbulkan hasil yang rapuh.
Peta Jalan Implementasi
Mulailah dengan definisi bahasa sederhana tentang hasil yang Anda butuhkan.
Pilih satu metrik keberhasilan dan satu kondisi kegagalan sebelum pengujian.
Jalankan uji coba kecil dengan data yang representatif, bukan kumpulan demo yang disempurnakan.
Dokumentasikan di mana Model Difusi membantu dan di mana metode yang lebih sederhana lebih baik.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Model Difusi GLIDE
Pertanyaan yang sering diajukan
What is Diffusion Models?
Model difusi menghasilkan gambar dengan belajar membalikkan proses gangguan, mengubah gambar statis acak menjadi gambar detail langkah demi langkah. Mereka mendukung alat teks-ke-gambar terkemuka saat ini seperti Difusi Stabil, DALL-E, dan Midjourney.
Apa ide inti di balik cara model difusi menghasilkan gambar?
Model difusi belajar membalikkan proses noise, mulai dari noise murni dan denoising langkah demi langkah hingga muncul gambar yang jelas.
Selama pelatihan, model apa yang sebenarnya dipelajari untuk diprediksi di setiap langkah?
Model diberi gambar dengan noise dan belajar memperkirakan noise yang ditambahkan, sehingga nantinya dapat mengurangi noise selama pembangkitan.
Bagaimana perintah teks memengaruhi gambar yang dihasilkan?
Pengondisian teks (melalui perhatian silang dan bimbingan) mendorong setiap langkah penolakan sehingga gambar yang muncul sesuai dengan perintahnya.
Mengapa Difusi Stabil menjalankan proses dalam 'ruang laten'?
Beroperasi dalam ruang laten terkompresi, bukan piksel resolusi penuh, secara dramatis mengurangi komputasi sekaligus menjaga kualitas.
Apa salah satu keunggulan utama model difusi dibandingkan GAN?
Model difusi menghindari permainan permusuhan yang tidak stabil dan keruntuhan mode GAN, sehingga menghasilkan pelatihan yang lebih andal dan variasi keluaran yang lebih besar.