PANDUAN AI Visual

DALL-E

DALL-E ialah keluarga model teks-ke-imej OpenAI yang menukar penerangan bertulis kepada gambar asal.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.

Menyelam dalam

DALL-E dilancarkan pada Januari 2021, menjana imej daripada teks dengan meramalkan token imej satu demi satu, seperti model bahasa untuk piksel. DALL-E 2 (2022) bertukar kepada pendekatan resapan berpandukan pembenaman CLIP, menghasilkan hasil yang lebih tajam dan lebih fotorealistik. DALL-E 3 (Oktober 2023) mengetatkan mengikuti segera dan terbina dalam ChatGPT, jadi chatbot boleh menulis semula permintaan kasar anda ke dalam gesaan yang sangat terperinci sebelum menjana. Penambahbaikan yang menyerlah ialah memaparkan teks yang boleh dibaca di dalam imej, seperti tanda dan label, yang model sebelum ini bercelaru. DALL-E juga menyokong inpainting (mengedit sebahagian daripada imej) dan outpainting (memanjangkannya melepasi sempadan asalnya). Ia menghasilkan berbilang variasi daripada satu gesaan, membantu pengguna meneroka pilihan kreatif dengan cepat.

Wawasan Teknikal

DALL-E 3 ialah model resapan: ia bermula daripada hingar rawak dan mengalihkannya langkah demi langkah, dipandu pada setiap langkah dengan pengekodan gesaan teks anda, sehingga imej yang koheren muncul. Ia melatih set besar pasangan kapsyen imej, mempelajari cara perkataan memetakan kepada ciri visual, susunan ruang dan gaya. Helah utama ialah kapsyen yang dipertingkatkan semasa latihan serta model bahasa yang mengembangkan gesaan ringkas anda kepada yang terperinci, itulah sebabnya DALL-E 3 mengikut arahan dengan lebih setia berbanding pendahulunya.

Kesan Strategik

Kelajuan dan skala

Visual AI boleh mengautomasikan tugas pemeriksaan, pengesanan dan penandaan pada skala.

Pilihan binaan

Pasukan kreatif boleh membuat prototaip konsep dengan lebih pantas dengan lebih sedikit semakan manual.

Pasukan dan aliran kerja

Operasi boleh menggunakan isyarat imej dan video yang sebelum ini sukar diproses.

Masa Depan DALL-E

Keturunan DALL-E berubah menjadi sistem multimodal yang lebih luas di mana satu model mengendalikan teks, imej dan suntingan bersama dan bukannya sebagai alat yang berasingan. Jangkakan pengeditan perbualan yang lebih ketat ("jadikan langit jingga, kekalkan segala-galanya"), pemaparan teks yang lebih baik dan peleraian yang lebih tinggi. Isyarat asal seperti metadata C2PA dan tera air akan menjadi standard untuk membenderakan imej yang dijana AI. Persaingan daripada model Midjourney, Stable Diffusion dan Google memacu peningkatan kualiti yang pesat, manakala perdebatan mengenai data latihan, persetujuan artis dan hak cipta akan terus membentuk apa yang sistem ini dibenarkan untuk dipelajari.

Pelaksanaan Dunia Sebenar

Seorang blogger menghasilkan ilustrasi pengepala tersuai untuk artikel dan bukannya mencari perpustakaan stok foto

Seorang guru mencipta gambar rajah ringkas dengan kapsyen untuk menerangkan konsep sains kepada pelajar muda

Sebuah perniagaan kecil mengejek beberapa logo dan konsep pembungkusan sebelum mengupah seorang pereka untuk memperbaikinya

Pereka permainan dengan pantas menghasilkan seni konsep untuk watak dan persekitaran untuk melontarkan idea

Risiko & Pengawal

Hak imej dan persetujuan boleh menjadi risiko undang-undang jika asalnya tidak jelas.

Prestasi model boleh berbeza mengikut pencahayaan, demografi dan persekitaran.

Positif palsu mungkin tidak disedari melainkan ambang keyakinan dipantau.

Hala Tuju Pelaksanaan

1

Tentukan kriteria penerimaan untuk ketepatan, ingatan semula dan kos ralat.

2

Uji dengan data yang sepadan dengan keadaan pengeluaran sebenar.

3

Tambahkan semakan manusia untuk ramalan keyakinan rendah atau berimpak tinggi.

4

Jejaki hanyut model dan sahkan semula selepas perubahan kamera atau set data.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DALL-E quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Medan Sinaran Neural

Soalan lazim

What is DALL-E?

DALL-E ialah keluarga model teks-ke-imej OpenAI yang menukar penerangan bertulis kepada gambar asal. Ia menjadikan "taip ayat, dapatkan imej" idea arus perdana dan mendorong penjanaan imej daripada demo penyelidikan ke dalam alatan harian.

Apakah yang dilakukan oleh DALL-E 3?

DALL-E ialah sistem teks-ke-imej: anda menerangkan pemandangan dalam perkataan dan ia menghasilkan gambar baharu yang sepadan dengan perihalan tersebut.

Apakah teknik asas yang DALL-E 3 gunakan untuk mencipta imej?

DALL-E 3 ialah model resapan yang bermula daripada hingar rawak dan memperhalusinya langkah demi langkah, dipandu oleh gesaan anda, menjadi imej yang koheren.

Mengapakah DALL-E 3 mengikut gesaan dengan lebih baik apabila digunakan di dalam ChatGPT?

Dalam ChatGPT, model bahasa menulis semula permintaan ringkas ke dalam gesaan yang lebih kaya dan lebih spesifik, mempertingkatkan sejauh mana imej itu sepadan dengan apa yang anda inginkan.

Apakah peningkatan ketara DALL-E 3 yang dibuat berbanding versi terdahulu?

Model terdahulu merosakkan teks dalam imej, tetapi DALL-E 3 boleh memaparkan perkataan yang boleh dibaca pada tanda, label dan poster dengan lebih dipercayai.

Apakah 'inpainting' membolehkan anda lakukan dengan imej DALL-E?

Melukis menyunting bahagian yang dipilih pada imej (contohnya, menukar objek) sambil membiarkan kawasan sekeliling tetap utuh.