PANDUAN AI Visual

Penyongsangan Teks

Penyongsangan Tekstual mengajar penjana imej konsep baharu—seperti kucing, gaya seni atau produk tertentu—dengan mempelajari satu perkataan baharu untuknya, tanpa mengubah model itu sendiri.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It lets you put your own subject into AI art using just 3-5 example photos.

Menyelam dalam

Penyongsangan Tekstual, yang diperkenalkan oleh penyelidik pada 2022, menyelesaikan masalah pemperibadian: bagaimana anda memberitahu model seperti Stable Diffusion untuk melukis *anjing* anda, apabila 'anjing' sahaja tidak akan menangkapnya? Daripada melatih semula rangkaian saraf gergasi, ia membekukan keseluruhan model dan mempelajari satu perkara: pembenaman 'pseudo-perkataan' baharu—vektor tunggal dalam perbendaharaan kata pengekod teks, selalunya ditulis sebagai S*. Anda memberinya 3-5 imej konsep dan pengoptimuman mendorong satu vektor itu sehingga model menghasilkan semula subjek dengan pasti apabila anda menaip perkataan baharu. Kerana hanya vektor (beberapa kilobait) dipelajari, keputusan adalah kecil dan boleh dikongsi. Anda kemudian boleh menulis gesaan seperti 'S* menunggang papan selaju, lukisan minyak' dan konsep itu muncul dalam konteks baharu.

Wawasan Teknikal

Caranya ialah model teks-ke-imej menukar setiap perkataan menjadi vektor benam sebelum dijana. Penyongsangan Tekstual menambah vektor baharu pada jadual pembenaman itu dan mengoptimumkannya sahaja, menggunakan resapan yang sama mengurangkan kehilangan pada imej contoh anda. Kecerunan mengalir kembali ke pembenaman sementara semua berat model kekal beku. Hasilnya ialah vektor padat (beberapa KB) yang tinggal dalam ruang perbendaharaan kata sedia ada model—tiada pemberat berubah, jadi model asas menyimpan semua pengetahuan terdahulunya.

Kesan Strategik

Kelajuan dan skala

Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.

Pilihan binaan

Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.

Pasukan dan aliran kerja

Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.

Masa Depan Penyongsangan Teks

Penyongsangan Tekstual kekal popular kerana saiz failnya yang kecil dan kebolehkongsiannya, dan komuniti sumber terbuka memperdagangkan beribu-ribu pembenaman ini. Arah masa hadapan menggabungkannya dengan kaedah lain—menyusun berbilang perkataan yang dipelajari untuk adegan yang lebih kaya, menggabungkannya dengan LoRA atau DreamBooth untuk kesetiaan yang lebih tajam dan memanjangkan idea kepada penjana video dan 3D. Jangkakan 'perpustakaan konsep' di mana pengguna mencampur dan memadankan token yang dipelajari, serta penyongsangan hampir serta-merta yang lebih pantas supaya pemperibadian berlaku dalam beberapa saat dan bukannya beberapa minit.

Pelaksanaan Dunia Sebenar

Seorang artis mempelajari token untuk gaya ilustrasi tandatangan mereka, kemudian menggesanya ke berdozen adegan baharu untuk portfolio yang konsisten.

Seorang pemilik haiwan peliharaan memuat naik lima gambar anjing mereka untuk menjananya sebagai angkasawan, lukisan Renaissance atau kartun.

Jenama e-dagang kecil mempelajari perkataan untuk produknya supaya ia boleh memaparkannya dalam banyak latar belakang pemasaran tanpa pemotretan.

Studio permainan menangkap rupa watak yang berulang sebagai token yang boleh diguna semula untuk memastikan seni konsep konsisten di seluruh pasukan.

Risiko & Pengawal

Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.

Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.

Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.

Hala Tuju Pelaksanaan

1

Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.

2

Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.

3

Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.

4

Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Textual Inversion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Penyongsangan Null-Teks

Soalan lazim

What is Textual Inversion?

Penyongsangan Tekstual mengajar penjana imej konsep baharu—seperti kucing, gaya seni atau produk tertentu—dengan mempelajari satu perkataan baharu untuknya, tanpa mengubah model itu sendiri. Ia membolehkan anda meletakkan subjek anda sendiri ke dalam seni AI menggunakan hanya 3-5 contoh foto.

Apakah sebenarnya yang dipelajari oleh Penyongsangan Tekstual semasa latihan?

Ia mengoptimumkan hanya satu vektor pembenaman pseudo-perkataan baharu sambil mengekalkan keseluruhan model beku.

Kira-kira berapa banyak contoh imej yang biasanya diperlukan oleh Penyongsangan Teks?

Sebilangan kecil, biasanya 3-5 imej konsep, sudah cukup untuk mempelajari token yang boleh digunakan.

Mengapakah fail Penyongsangan Tekstual sangat kecil (selalunya beberapa kilobait)?

Hanya satu vektor benam disimpan, jadi fail itu kecil dan mudah untuk dikongsi.

Apakah yang kekal tidak berubah semasa latihan Penyongsangan Teks?

Model asas dibekukan; hanya pembenaman baharu yang dikemas kini, jadi pengetahuan terdahulu dikekalkan.

Bagaimanakah anda menggunakan konsep yang dipelajari selepas Penyongsangan Teks?

Anda hanya memasukkan token baharu (seperti S*) dalam gesaan teks biasa untuk memanggil konsep.