PANDUAN AI Visual

Gambar Teks-ke-Gambar

Imagen adalah sistem teks-ke-gambar Google yang mengubah deskripsi tertulis menjadi gambar fotorealistik.

2 min readTerakhir diperbarui

Ikhtisar

Its headline finding was that a large frozen language model, not a bigger image network, was the biggest driver of quality.

Menyelam Lebih Dalam

Diumumkan oleh Google Penelitian pada tahun 2022, Imagen menunjukkan bahwa memahami perintah secara mendalam sama pentingnya dengan menggambarnya dengan baik. Alih-alih encoder teks bergaya CLIP, Imagen menggunakan encoder teks besar yang telah dilatih sebelumnya (T5-XXL) yang dibekukan, lalu memasukkan penyematan bahasa yang kaya tersebut ke dalam model difusi. Ini menghasilkan gambar kecil berukuran 64x64 dan menggunakan dua tahap difusi resolusi super untuk meningkatkannya ke 1024x1024. Tim juga memperkenalkan 'pengukuran dinamis' untuk menjaga warna tetap stabil pada panduan tinggi, dan membangun DrawBench, sebuah tolok ukur penghitungan pengujian prompt yang rumit, hubungan spasial, dan kombinasi langka. Versi selanjutnya, Imagen 2 dan Imagen 3, mempertajam detail, rendering teks, dan fidelitas cepat, dan kini mendukung alat gambar Google.

Wawasan Teknis

Pilihan menonjol Imagen adalah menskalakan encoder teks daripada generator gambar. T5-XXL, yang hanya dilatih pada teks, menghasilkan penyematan yang menangkap nuansa bahasa, dan para peneliti menemukan bahwa memperbesarnya meningkatkan keselarasan gambar-teks lebih dari memperbesar model difusi. Pembuatannya dilakukan secara bertingkat: model difusi dasar membuat gambar beresolusi rendah, kemudian model difusi resolusi super secara bertahap meningkatkannya, dengan ambang batas dinamis yang menjepit nilai piksel untuk menghindari hasil yang hilang di bawah panduan yang kuat.

Dampak Strategis

Kecepatan dan skala

Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.

Build choices

Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.

Team and workflow

Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.

Masa Depan Imagen Text-to-Image

Silsilah Imagen bergerak menuju rendering teks yang lebih baik di dalam gambar, tindak lanjut yang lebih ketat untuk adegan yang kompleks, dan pengambilan sampel yang lebih cepat. Harapkan perpaduan yang lebih dalam dengan model bahasa sehingga sistem 'beralasan' tentang permintaan sebelum menggambar, ditambah tanda air yang lebih kuat seperti SynthID untuk asal usulnya. Saat teknologi ini terintegrasi dengan seluruh produk Google dan ekosistem Gemini, fokusnya beralih ke generasi yang andal, aman, dan terkendali, bukan hal baru.

Implementasi Dunia Nyata

Menghasilkan visual pemasaran fotorealistik dari ringkasan tertulis tanpa pemotretan

Membuat ilustrasi konsep untuk buku cerita atau anak dari kalimat deskriptif

Memproduksi maket produk dan variasi adegan untuk daftar e-commerce

Memvisualisasikan ide-ide ilmiah atau pendidikan, seperti terjemahan seniman yang dijelaskan dalam bahasa sederhana

Risiko & Pagar Pembatas

Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.

Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.

Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.

Peta Jalan Implementasi

1

Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.

2

Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.

3

Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.

4

Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Imagen Text-to-Image quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Gambar 2 dan Difusi yang Diselaraskan dengan Hadiah

Pertanyaan yang sering diajukan

What is Imagen Text-to-Image?

Imagen adalah sistem teks-ke-gambar Google yang mengubah deskripsi tertulis menjadi gambar fotorealistik. Temuan utamanya adalah model bahasa beku yang besar, bukan jaringan gambar yang lebih besar, yang menjadi pendorong kualitas terbesar.

Apa temuan Imagen yang paling berpengaruh?

Imagen menunjukkan bahwa penskalaan pemahaman bahasa melalui T5-XXL meningkatkan hasil lebih dari penskalaan model difusi.

Encoder teks mana yang diandalkan Imagen?

Imagen menggunakan encoder T5-XXL berukuran besar yang telah dilatih sebelumnya hanya berupa teks, dan tetap dibekukan selama pelatihan.

Bagaimana Imagen mencapai resolusi tinggi?

Ini menghasilkan gambar 64x64 kemudian ditingkatkan melalui model difusi resolusi super menjadi 1024x1024.

Untuk apa 'thresholding dinamis' digunakan di Imagen?

Pengambangan batas dinamis membatasi nilai piksel sehingga panduan yang tinggi tidak menghasilkan gambar yang pudar.

Apa itu DrawBench?

DrawBench adalah tolok ukur Google yang diperkenalkan dengan Imagen untuk menguji penghitungan, hubungan spasial, dan perintah langka.