Inversi Tekstual
Inversi Tekstual mengajarkan pembuat gambar konsep baru—seperti kucing, gaya seni, atau produk tertentu—dengan mempelajari satu kata baru untuk gambar tersebut, tanpa mengubah model itu sendiri.
Ikhtisar
It lets you put your own subject into AI art using just 3-5 example photos.
Menyelam Lebih Dalam
Inversi Tekstual, yang diperkenalkan oleh para peneliti pada tahun 2022, memecahkan masalah personalisasi: bagaimana Anda memberi tahu model seperti Difusi Stabil untuk menggambar anjing *Anda*, padahal 'anjing' saja tidak dapat menangkapnya? Alih-alih melatih kembali jaringan saraf raksasa, jaringan ini membekukan seluruh model dan mempelajari satu hal: penyematan 'kata semu' baru—sebuah vektor tunggal dalam kosakata pembuat enkode teks, sering kali ditulis sebagai S*. Anda memberinya 3-5 gambar konsep, dan pengoptimalan mendorong satu vektor tersebut hingga model mereproduksi subjek dengan andal saat Anda mengetik kata baru. Karena hanya satu vektor (beberapa kilobyte) yang dipelajari, hasilnya sangat kecil dan dapat dibagikan. Anda kemudian dapat menulis perintah seperti 'S* mengendarai skateboard, melukis cat minyak' dan konsep tersebut muncul dalam konteks baru.
Wawasan Teknis
Triknya adalah model teks-ke-gambar mengubah setiap kata menjadi vektor penyematan sebelum dibuat. Inversi Tekstual menambahkan vektor baru ke tabel penyematan tersebut dan hanya mengoptimalkannya, menggunakan difusi yang sama untuk menghilangkan kerugian pada gambar contoh Anda. Gradien mengalir kembali ke penyematan sementara semua bobot model tetap beku. Hasilnya adalah vektor kompak (beberapa KB) yang berada dalam ruang kosakata model yang ada—tidak ada perubahan bobot, sehingga model dasar mempertahankan semua pengetahuan sebelumnya.
Dampak Strategis
Kecepatan dan skala
Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.
Build choices
Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.
Team and workflow
Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.
Masa Depan Inversi Tekstual
Inversi Tekstual tetap populer karena ukuran filenya yang kecil dan kemudahan berbagi, dan komunitas sumber terbuka memperdagangkan ribuan penyematan ini. Arahan masa depan memadukannya dengan metode lain—menumpuk beberapa kata yang dipelajari untuk adegan yang lebih kaya, menggabungkannya dengan LoRA atau DreamBooth untuk fidelitas yang lebih tajam, dan memperluas ide ke generator video dan 3D. Harapkan 'perpustakaan konsep' di mana pengguna mencampur dan mencocokkan token yang dipelajari, ditambah inversi yang lebih cepat dan hampir instan sehingga personalisasi terjadi dalam hitungan detik, bukan menit.
Implementasi Dunia Nyata
Seorang seniman mempelajari sebuah token untuk gaya ilustrasi khasnya, lalu memasukkannya ke dalam lusinan adegan baru untuk portofolio yang konsisten.
Seorang pemilik hewan peliharaan mengunggah lima foto anjingnya untuk dijadikan astronot, lukisan Renaisans, atau kartun.
Sebuah merek e-niaga kecil mempelajari sebuah kata untuk produknya sehingga dapat menampilkannya di banyak latar belakang pemasaran tanpa pemotretan.
Sebuah studio game menangkap tampilan karakter yang berulang sebagai token yang dapat digunakan kembali untuk menjaga konsep seni tetap konsisten di seluruh tim.
Risiko & Pagar Pembatas
Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.
Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.
Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.
Peta Jalan Implementasi
Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.
Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.
Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.
Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Textual Inversion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Inversi Null-Teks
Pertanyaan yang sering diajukan
What is Textual Inversion?
Inversi Tekstual mengajarkan pembuat gambar konsep baru—seperti kucing, gaya seni, atau produk tertentu—dengan mempelajari satu kata baru untuk gambar tersebut, tanpa mengubah model itu sendiri. Ini memungkinkan Anda memasukkan subjek Anda sendiri ke dalam seni AI hanya dengan menggunakan 3-5 contoh foto.
Apa sebenarnya yang dipelajari Inversi Tekstual selama pelatihan?
Ini hanya mengoptimalkan satu vektor penyematan kata semu baru sambil menjaga seluruh model tetap beku.
Kira-kira berapa banyak contoh gambar yang biasanya dibutuhkan oleh Inversi Tekstual?
Sejumlah kecil, biasanya 3-5 gambar konsep, sudah cukup untuk mempelajari token yang dapat digunakan.
Mengapa file Inversi Tekstual sangat kecil (seringkali hanya beberapa kilobyte)?
Hanya satu vektor penyematan yang disimpan, sehingga file berukuran kecil dan mudah dibagikan.
Apa yang tetap tidak berubah selama pelatihan Inversi Tekstual?
Model dasar dibekukan; hanya penyematan baru yang diperbarui, sehingga pengetahuan sebelumnya dipertahankan.
Bagaimana Anda menggunakan konsep yang dipelajari setelah Inversi Tekstual?
Anda cukup memasukkan token baru (seperti S*) dalam prompt teks normal untuk memanggil konsep.