PANDUAN AI Visual

Transformer Resapan

Diffusion Transformers (DiTs) menukar U-Net konvolusi di tengah-tengah penjana imej dan video untuk tulang belakang Transformer.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.

Menyelam dalam

Model resapan menjana imej dengan bermula daripada hingar tulen dan secara berulang-ulang mengubahnya menjadi gambar yang koheren. Selama bertahun-tahun rangkaian yang melakukan denoising itu adalah U-Net, seni bina konvolusi. Diffusion Transformer, yang diperkenalkan oleh Peebles dan Xie pada 2022, menggantikan U-Net dengan Transformer. Imej itu mula-mula dimampatkan ke dalam ruang terpendam, dipecahkan kepada tompok kecil, dan setiap tampalan menjadi token, sama seperti perkataan dalam model bahasa. Transformer kemudian memproses token ini dengan perhatian diri pada setiap langkah denoising. Penemuan utama ialah prestasi DiT bertambah baik secara dijangka apabila anda meningkatkan saiz model dan mengurangkan saiz tampalan, mengikut undang-undang penskalaan yang bersih. Kebolehskalaan inilah sebabnya sistem teks-ke-video dan teks-ke-imej canggih telah sebahagian besarnya berhijrah ke tulang belakang Transformer.

Wawasan Teknikal

Inovasi teras ialah cara DiT menyuntik pelaziman seperti langkah masa dan gesaan teks. Daripada penggabungan mudah, mereka menggunakan normalisasi lapisan penyesuaian (adaLN), di mana rangkaian meramalkan skala dan parameter anjakan untuk lapisan normalisasi daripada isyarat penyaman. Varian adaLN-sifar memulakan ini supaya setiap blok bermula sebagai fungsi identiti, menstabilkan latihan. Tampalan diratakan menjadi token, diproses oleh blok Transformer standard dengan perhatian sendiri, kemudian dipasang semula dan dinyahkod semula menjadi piksel.

Kesan Strategik

Kelajuan dan skala

Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.

Pilihan binaan

Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.

Pasukan dan aliran kerja

Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.

Masa Depan Pengubah Resapan

Diffusion Transformers menjadi tulang belakang lalai untuk media generatif. Reka bentuk berasaskan token mereka menjadikannya semula jadi untuk menyatukan imej, video, dan juga penjanaan pelbagai mod di bawah satu seni bina berskala. Penyelidikan sedang mendorong ke arah video yang lebih panjang, resolusi yang lebih tinggi dan perhatian yang lebih cekap untuk menjinakkan kos kuadratik banyak token. Jangkakan penumpuan antara model bahasa dan visi, di mana resipi dan infrastruktur penskalaan Transformer yang serupa menyediakan kedua-duanya, mempercepatkan kemajuan dalam model dunia dan video interaktif.

Pelaksanaan Dunia Sebenar

Sora OpenAI menggunakan tulang belakang Transformer melalui tampalan ruang masa untuk menjana video berdurasi minit, ketepatan tinggi daripada gesaan teks.

Stable Diffusion 3 mengguna pakai Multimodal Diffusion Transformer (MMDiT) untuk menjajarkan imej yang dijana dengan lebih baik dengan penerangan teks terperinci.

Penyelidik menskalakan DiT kepada berbilion-bilion parameter dan memerhatikan kualiti imej bertambah baik secara dijangka, membimbing keputusan pengiraan belanjawan.

Sebuah studio menggunakan model berasaskan DiT untuk memanjangkan klip pendek, menganggap bingkai video tambahan sebagai token tampalan tambahan untuk dibunyikan.

Risiko & Pengawal

Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.

Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.

Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.

Hala Tuju Pelaksanaan

1

Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.

2

Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.

3

Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.

4

Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Rangkaian Transformer Spatial

Soalan lazim

What is Diffusion Transformers?

Diffusion Transformers (DiTs) menukar U-Net konvolusi di tengah-tengah penjana imej dan video untuk tulang belakang Transformer. Seni bina ini memperkasakan sistem terkemuka seperti Stable Diffusion 3 dan OpenAI's Sora, dan ia berskala dengan sangat baik semasa anda menambah pengiraan.

Apakah komponen yang digantikan oleh Transformer Resapan berbanding model resapan tradisional?

DiT menggantikan U-Net, rangkaian konvolusi yang melakukan denoising, dengan tulang belakang Transformer.

Bagaimanakah DiT mengubah imej menjadi sesuatu yang boleh diproses oleh Transformer?

Imej terpendam dibahagikan kepada tompok kecil, dan setiap tampalan menjadi token, analog dengan perkataan dalam model bahasa.

Apakah yang ditemui oleh kertas DiT asal tentang penskalaan?

Kualiti DiT bertambah baik dengan cara yang bersih dan boleh diramal apabila anda meningkatkan pengiraan model dan menggunakan tampalan yang lebih kecil, mengikut undang-undang penskalaan.

Bagaimanakah DiT biasanya menyuntik pelaziman seperti langkah masa dan gesaan teks?

DiT menggunakan normalisasi lapisan penyesuaian untuk meramal skala dan parameter anjakan untuk lapisan normalisasi daripada isyarat penyaman.

Apakah yang dicapai oleh permulaan 'adaLN-sifar'?

adaLN-zero memulakan modulasi supaya setiap blok pada mulanya bertindak sebagai identiti, yang menstabilkan dan menambah baik latihan.