PANDUAN Dasar

Model Difusi

Model difusi menghasilkan gambar dengan belajar membalikkan proses gangguan, mengubah gambar statis acak menjadi gambar detail langkah demi langkah.

2 min readTerakhir diperbarui

Ikhtisar

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

Menyelam Lebih Dalam

Model difusi dilatih dalam dua arah. Dalam proses selanjutnya, gambar yang bersih secara bertahap dirusak dengan menambahkan sejumlah kecil noise acak hingga menjadi gambar statis murni. Model tersebut kemudian mempelajari hal sebaliknya: mulai dari noise, model tersebut memprediksi dan menghilangkan sedikit noise di setiap langkah, mengulanginya puluhan atau ratusan kali hingga muncul gambar yang tajam. Agar hal ini dapat dikontrol, perintah teks memandu setiap langkah penolakan, sehingga "seorang astronot menunggang kuda" mengarahkan statis ke arah gambar tersebut. Sistem modern seperti Difusi Stabil menjalankan proses ini dalam ruang laten terkompresi, bukan dalam piksel mentah, sehingga jauh lebih cepat. Dibandingkan dengan GAN, model difusi dilatih lebih stabil dan menghasilkan keragaman yang lebih besar, itulah sebabnya model ini mengambil alih GAN sebagai pendekatan dominan dalam menghasilkan gambar berkualitas tinggi pada tahun 2022.

Wawasan Teknis

Trik utamanya adalah jaringan tidak perlu menghasilkan gambar dalam satu pengambilan; ia hanya belajar memprediksi kebisingan yang ditambahkan pada langkah tertentu. Selama pelatihan, sejumlah noise yang diketahui ditambahkan ke gambar nyata dan model diminta untuk memperkirakan noise tersebut; perbedaannya adalah kesalahan pelatihan. Pada saat pembangkitan, model berulang kali mengurangi kebisingan yang diprediksi, sehingga secara bertahap memperlihatkan strukturnya. Pengkondisian teks dimasukkan melalui perhatian silang, dan panduan bebas pengklasifikasi memperkuat seberapa kuat perintah mengarahkan keluaran.

Dampak Strategis

Clearer decisions

Ini membantu Anda memisahkan klaim teknis yang jelas dari bahasa pemasaran.

Cost and budget

Anda dapat mengajukan pertanyaan implementasi yang lebih baik sebelum mengeluarkan uang atau waktu.

Team and workflow

Tim dengan pemahaman bersama membuat keputusan produk, kebijakan, dan pembelajaran yang lebih baik.

Masa Depan Model Difusi

Difusi adalah teknologi terkini dalam pembuatan gambar, dan semakin banyak video dan audio, dengan alat seperti Sora yang memperluasnya ke gerakan. Dorongan terbesarnya adalah kecepatan: teknik seperti model distilasi dan konsistensi bertujuan untuk mengurangi ratusan langkah denoising menjadi beberapa atau bahkan satu, sehingga memungkinkan pembuatan secara real-time. Harapkan difusi akan meluas ke aset 3D, desain ilmiah seperti molekul dan protein, dan pengeditan yang dapat dikontrol dengan ketat, sekaligus menjadi cukup murah untuk dijalankan di ponsel.

Implementasi Dunia Nyata

Membuat karya seni dan gambar asli dari petunjuk teks di Stable Diffusion, DALL-E, dan Midjourney

Inpainting dan outpainting, mengisi atau memperluas bagian foto dengan mulus

Menghasilkan video dari teks dengan alat seperti Sora milik OpenAI

Merancang molekul baru dan struktur protein untuk penelitian penemuan obat

Risiko & Pagar Pembatas

Tim yang berbeda mungkin menggunakan istilah yang sama secara berbeda, jadi tentukan cakupannya sejak dini.

Tolok ukur dapat terlihat kuat sementara kinerja di dunia nyata tidak merata.

Mengabaikan kualitas data dan rencana evaluasi sering kali menimbulkan hasil yang rapuh.

Peta Jalan Implementasi

1

Mulailah dengan definisi bahasa sederhana tentang hasil yang Anda butuhkan.

2

Pilih satu metrik keberhasilan dan satu kondisi kegagalan sebelum pengujian.

3

Jalankan uji coba kecil dengan data yang representatif, bukan kumpulan demo yang disempurnakan.

4

Dokumentasikan di mana Model Difusi membantu dan di mana metode yang lebih sederhana lebih baik.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Model Difusi GLIDE

Pertanyaan yang sering diajukan

What is Diffusion Models?

Model difusi menghasilkan gambar dengan belajar membalikkan proses gangguan, mengubah gambar statis acak menjadi gambar detail langkah demi langkah. Mereka mendukung alat teks-ke-gambar terkemuka saat ini seperti Difusi Stabil, DALL-E, dan Midjourney.

Apa ide inti di balik cara model difusi menghasilkan gambar?

Model difusi belajar membalikkan proses noise, mulai dari noise murni dan denoising langkah demi langkah hingga muncul gambar yang jelas.

Selama pelatihan, model apa yang sebenarnya dipelajari untuk diprediksi di setiap langkah?

Model diberi gambar dengan noise dan belajar memperkirakan noise yang ditambahkan, sehingga nantinya dapat mengurangi noise selama pembangkitan.

Bagaimana perintah teks memengaruhi gambar yang dihasilkan?

Pengondisian teks (melalui perhatian silang dan bimbingan) mendorong setiap langkah penolakan sehingga gambar yang muncul sesuai dengan perintahnya.

Mengapa Difusi Stabil menjalankan proses dalam 'ruang laten'?

Beroperasi dalam ruang laten terkompresi, bukan piksel resolusi penuh, secara dramatis mengurangi komputasi sekaligus menjaga kualitas.

Apa salah satu keunggulan utama model difusi dibandingkan GAN?

Model difusi menghindari permainan permusuhan yang tidak stabil dan keruntuhan mode GAN, sehingga menghasilkan pelatihan yang lebih andal dan variasi keluaran yang lebih besar.