PANDUAN AI Visual

DALL-E

DALL-E adalah rangkaian model teks-ke-gambar OpenAI yang mengubah deskripsi tertulis menjadi gambar asli.

2 min readTerakhir diperbarui

Ikhtisar

It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.

Menyelam Lebih Dalam

DALL-E diluncurkan pada Januari 2021, menghasilkan gambar dari teks dengan memprediksi token gambar satu per satu, seperti model bahasa untuk piksel. DALL-E 2 (2022) beralih ke pendekatan difusi yang dipandu oleh penyematan CLIP, menghasilkan hasil yang lebih tajam dan fotorealistik. DALL-E 3 (Oktober 2023) memperketat tindak lanjut perintah dan dibangun ke dalam ChatGPT, sehingga chatbot dapat menulis ulang permintaan kasar Anda menjadi perintah yang sangat detail sebelum dibuat. Peningkatan yang menonjol adalah menampilkan teks yang dapat dibaca di dalam gambar, seperti tanda dan label, yang pada model sebelumnya kacau. DALL-E juga mendukung inpainting (mengedit bagian gambar) dan outpainting (memperluasnya melampaui batas aslinya). Ini menghasilkan banyak variasi dari satu perintah, membantu pengguna menjelajahi opsi kreatif dengan cepat.

Wawasan Teknis

DALL-E 3 adalah model difusi: dimulai dari noise acak dan menghilangkannya langkah demi langkah, diarahkan pada setiap langkah dengan pengkodean prompt teks Anda, hingga gambar yang koheren muncul. Ini melatih kumpulan besar pasangan keterangan gambar, mempelajari bagaimana kata-kata dipetakan ke fitur visual, pengaturan spasial, dan gaya. Trik utamanya adalah peningkatan teks selama pelatihan ditambah model bahasa yang memperluas perintah singkat Anda menjadi lebih detail, itulah sebabnya DALL-E 3 mengikuti instruksi jauh lebih setia dibandingkan pendahulunya.

Dampak Strategis

Kecepatan dan skala

Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.

Build choices

Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.

Team and workflow

Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.

Masa Depan DALL-E

Garis keturunan DALL-E berkembang menjadi sistem multimodal yang lebih luas di mana satu model menangani teks, gambar, dan pengeditan secara bersamaan, bukan sebagai alat terpisah. Harapkan pengeditan percakapan yang lebih ketat ("buat langit menjadi oranye, pertahankan yang lainnya"), rendering teks yang lebih baik, dan resolusi yang lebih tinggi. Sinyal asal seperti metadata C2PA dan watermarking akan menjadi standar untuk menandai gambar yang dihasilkan AI. Persaingan dari model Midjourney, Difusi Stabil, dan Google mendorong peningkatan kualitas yang cepat, sementara perdebatan mengenai data pelatihan, persetujuan artis, dan hak cipta akan terus menentukan pembelajaran yang dapat diambil dari sistem ini.

Implementasi Dunia Nyata

Seorang blogger membuat ilustrasi header khusus untuk sebuah artikel alih-alih mencari perpustakaan stok foto

Seorang guru membuat diagram sederhana dengan teks untuk menjelaskan konsep sains kepada siswa muda

Sebuah usaha kecil membuat beberapa konsep logo dan kemasan sebelum menyewa seorang desainer untuk menyempurnakannya

Seorang desainer game dengan cepat menghasilkan seni konsep untuk karakter dan lingkungan untuk menyampaikan ide

Risiko & Pagar Pembatas

Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.

Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.

Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.

Peta Jalan Implementasi

1

Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.

2

Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.

3

Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.

4

Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DALL-E quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Bidang Cahaya Neural

Pertanyaan yang sering diajukan

What is DALL-E?

DALL-E adalah rangkaian model teks-ke-gambar OpenAI yang mengubah deskripsi tertulis menjadi gambar asli. Hal ini menjadikan "ketik kalimat, ambil gambar" sebagai ide utama dan mendorong pembuatan gambar dari demo penelitian ke dalam alat sehari-hari.

Apa fungsi utama DALL-E 3?

DALL-E adalah sistem teks-ke-gambar: Anda mendeskripsikan suatu adegan dengan kata-kata dan menghasilkan gambar baru yang cocok dengan deskripsi tersebut.

Teknik dasar apa yang digunakan DALL-E 3 untuk membuat gambar?

DALL-E 3 adalah model difusi yang dimulai dari noise acak dan menyempurnakannya selangkah demi selangkah, diarahkan oleh perintah Anda, menjadi gambar yang koheren.

Mengapa DALL-E 3 mengikuti petunjuk dengan lebih baik saat digunakan di dalam ChatGPT?

Di ChatGPT, model bahasa menulis ulang permintaan singkat menjadi perintah yang lebih kaya dan spesifik, sehingga meningkatkan kesesuaian gambar dengan apa yang Anda inginkan.

Apa peningkatan penting yang dilakukan DALL-E 3 dibandingkan versi sebelumnya?

Model sebelumnya mengacaukan teks dalam gambar, namun DALL-E 3 dapat membuat kata-kata yang terbaca pada tanda, label, dan poster jauh lebih andal.

Apa yang bisa Anda lakukan dengan 'inpainting' dengan gambar DALL-E?

Inpainting mengedit bagian gambar yang dipilih (misalnya, menukar objek) sambil membiarkan area sekitarnya tetap utuh.