Transformer Resapan
Diffusion Transformers (DiTs) menukar U-Net konvolusi di tengah-tengah penjana imej dan video untuk tulang belakang Transformer.
Gambaran keseluruhan
This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.
Menyelam dalam
Model resapan menjana imej dengan bermula daripada hingar tulen dan secara berulang-ulang mengubahnya menjadi gambar yang koheren. Selama bertahun-tahun rangkaian yang melakukan denoising itu adalah U-Net, seni bina konvolusi. Diffusion Transformer, yang diperkenalkan oleh Peebles dan Xie pada 2022, menggantikan U-Net dengan Transformer. Imej itu mula-mula dimampatkan ke dalam ruang terpendam, dipecahkan kepada tompok kecil, dan setiap tampalan menjadi token, sama seperti perkataan dalam model bahasa. Transformer kemudian memproses token ini dengan perhatian diri pada setiap langkah denoising. Penemuan utama ialah prestasi DiT bertambah baik secara dijangka apabila anda meningkatkan saiz model dan mengurangkan saiz tampalan, mengikut undang-undang penskalaan yang bersih. Kebolehskalaan inilah sebabnya sistem teks-ke-video dan teks-ke-imej canggih telah sebahagian besarnya berhijrah ke tulang belakang Transformer.
Wawasan Teknikal
Inovasi teras ialah cara DiT menyuntik pelaziman seperti langkah masa dan gesaan teks. Daripada penggabungan mudah, mereka menggunakan normalisasi lapisan penyesuaian (adaLN), di mana rangkaian meramalkan skala dan parameter anjakan untuk lapisan normalisasi daripada isyarat penyaman. Varian adaLN-sifar memulakan ini supaya setiap blok bermula sebagai fungsi identiti, menstabilkan latihan. Tampalan diratakan menjadi token, diproses oleh blok Transformer standard dengan perhatian sendiri, kemudian dipasang semula dan dinyahkod semula menjadi piksel.
Kesan Strategik
Kelajuan dan skala
Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.
Pilihan binaan
Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.
Pasukan dan aliran kerja
Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.
Masa Depan Pengubah Resapan
Diffusion Transformers menjadi tulang belakang lalai untuk media generatif. Reka bentuk berasaskan token mereka menjadikannya semula jadi untuk menyatukan imej, video, dan juga penjanaan pelbagai mod di bawah satu seni bina berskala. Penyelidikan sedang mendorong ke arah video yang lebih panjang, resolusi yang lebih tinggi dan perhatian yang lebih cekap untuk menjinakkan kos kuadratik banyak token. Jangkakan penumpuan antara model bahasa dan visi, di mana resipi dan infrastruktur penskalaan Transformer yang serupa menyediakan kedua-duanya, mempercepatkan kemajuan dalam model dunia dan video interaktif.
Pelaksanaan Dunia Sebenar
Sora OpenAI menggunakan tulang belakang Transformer melalui tampalan ruang masa untuk menjana video berdurasi minit, ketepatan tinggi daripada gesaan teks.
Stable Diffusion 3 mengguna pakai Multimodal Diffusion Transformer (MMDiT) untuk menjajarkan imej yang dijana dengan lebih baik dengan penerangan teks terperinci.
Penyelidik menskalakan DiT kepada berbilion-bilion parameter dan memerhatikan kualiti imej bertambah baik secara dijangka, membimbing keputusan pengiraan belanjawan.
Sebuah studio menggunakan model berasaskan DiT untuk memanjangkan klip pendek, menganggap bingkai video tambahan sebagai token tampalan tambahan untuk dibunyikan.
Risiko & Pengawal
Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.
Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.
Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.
Hala Tuju Pelaksanaan
Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.
Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.
Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.
Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Rangkaian Transformer Spatial
Soalan lazim
What is Diffusion Transformers?
Diffusion Transformers (DiTs) menukar U-Net konvolusi di tengah-tengah penjana imej dan video untuk tulang belakang Transformer. Seni bina ini memperkasakan sistem terkemuka seperti Stable Diffusion 3 dan OpenAI's Sora, dan ia berskala dengan sangat baik semasa anda menambah pengiraan.
Apakah komponen yang digantikan oleh Transformer Resapan berbanding model resapan tradisional?
DiT menggantikan U-Net, rangkaian konvolusi yang melakukan denoising, dengan tulang belakang Transformer.
Bagaimanakah DiT mengubah imej menjadi sesuatu yang boleh diproses oleh Transformer?
Imej terpendam dibahagikan kepada tompok kecil, dan setiap tampalan menjadi token, analog dengan perkataan dalam model bahasa.
Apakah yang ditemui oleh kertas DiT asal tentang penskalaan?
Kualiti DiT bertambah baik dengan cara yang bersih dan boleh diramal apabila anda meningkatkan pengiraan model dan menggunakan tampalan yang lebih kecil, mengikut undang-undang penskalaan.
Bagaimanakah DiT biasanya menyuntik pelaziman seperti langkah masa dan gesaan teks?
DiT menggunakan normalisasi lapisan penyesuaian untuk meramal skala dan parameter anjakan untuk lapisan normalisasi daripada isyarat penyaman.
Apakah yang dicapai oleh permulaan 'adaLN-sifar'?
adaLN-zero memulakan modulasi supaya setiap blok pada mulanya bertindak sebagai identiti, yang menstabilkan dan menambah baik latihan.