DALL-E
DALL-E คือกลุ่มโมเดลข้อความเป็นรูปภาพในตระกูล OpenAI ที่เปลี่ยนคำอธิบายที่เป็นลายลักษณ์อักษรให้กลายเป็นรูปภาพต้นฉบับ
ภาพรวม
It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.
เจาะลึก
DALL-E เปิดตัวในเดือนมกราคม 2021 โดยสร้างรูปภาพจากข้อความโดยการทำนายโทเค็นรูปภาพทีละรายการ เช่นเดียวกับโมเดลภาษาสำหรับพิกเซล DALL-E 2 (2022) เปลี่ยนมาใช้แนวทางการแพร่กระจายตามคำแนะนำของการฝัง CLIP ทำให้เกิดผลลัพธ์ที่คมชัดและสมจริงยิ่งขึ้น DALL-E 3 (ตุลาคม 2023) เพิ่มความเข้มงวดในการติดตามพร้อมท์และสร้างไว้ใน ChatGPT ดังนั้นแชทบอทจึงสามารถเขียนคำขอคร่าวๆ ของคุณใหม่เป็นพร้อมท์ที่มีรายละเอียดครบถ้วนก่อนสร้าง การปรับปรุงที่โดดเด่นคือการเรนเดอร์ข้อความที่อ่านได้ภายในรูปภาพ เช่น ป้ายและป้ายกำกับ ซึ่งรุ่นก่อนหน้านี้อ่านไม่ออก DALL-E ยังรองรับการวาดภาพใน (การแก้ไขส่วนหนึ่งของภาพ) และการวาดภาพภายนอก (ขยายเกินขอบเขตดั้งเดิม) สร้างรูปแบบได้หลายรูปแบบจากข้อความแจ้งเดียว ช่วยให้ผู้ใช้สำรวจตัวเลือกที่สร้างสรรค์ได้อย่างรวดเร็ว
ข้อมูลเชิงลึกทางเทคนิค
DALL-E 3 เป็นโมเดลการแพร่กระจาย โดยเริ่มต้นจากสัญญาณรบกวนแบบสุ่มและกำจัดออกไปทีละขั้นตอน และควบคุมในแต่ละขั้นตอนด้วยการเข้ารหัสข้อความแจ้งของคุณ จนกระทั่งได้ภาพที่สอดคล้องกันปรากฏขึ้น โดยจะฝึกคู่คู่คำบรรยายภาพจำนวนมาก เรียนรู้ว่าคำต่างๆ เชื่อมโยงกับลักษณะภาพ การจัดเรียงเชิงพื้นที่ และสไตล์อย่างไร เคล็ดลับสำคัญคือการปรับปรุงคำบรรยายระหว่างการฝึกอบรม บวกกับโมเดลภาษาที่ขยายข้อความแจ้งสั้นๆ ของคุณให้เป็นคำอธิบายโดยละเอียด ซึ่งเป็นสาเหตุที่ DALL-E 3 ปฏิบัติตามคำสั่งอย่างซื่อสัตย์มากกว่ารุ่นก่อนมาก
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของ DALL-E
สายเลือดของ DALL-E ถูกพับเป็นระบบหลายรูปแบบที่กว้างขึ้น โดยที่โมเดลหนึ่งจัดการข้อความ รูปภาพ และการแก้ไขร่วมกัน แทนที่จะเป็นเครื่องมือที่แยกจากกัน คาดว่าจะมีการแก้ไขบทสนทนาที่เข้มงวดมากขึ้น ("ทำให้ท้องฟ้าเป็นสีส้ม เก็บทุกอย่างไว้") การแสดงข้อความที่ดีขึ้น และความละเอียดสูงขึ้น สัญญาณแหล่งที่มา เช่น ข้อมูลเมตา C2PA และลายน้ำจะกลายเป็นมาตรฐานในการทำเครื่องหมายรูปภาพที่สร้างโดย AI การแข่งขันจากโมเดล Midjourney, Stable Diffusion และ Google กำลังผลักดันคุณภาพที่เพิ่มขึ้นอย่างรวดเร็ว ในขณะที่การถกเถียงเรื่องข้อมูลการฝึกอบรม ความยินยอมของศิลปิน และลิขสิทธิ์จะคอยกำหนดว่าระบบเหล่านี้ได้รับอนุญาตให้เรียนรู้จากอะไร
การใช้งานจริงในโลกแห่งความเป็นจริง
บล็อกเกอร์สร้างภาพประกอบส่วนหัวแบบกำหนดเองสำหรับบทความ แทนที่จะค้นหาคลังภาพสต็อก
ครูสร้างไดอะแกรมแบบมีคำบรรยายที่เรียบง่ายเพื่ออธิบายแนวคิดทางวิทยาศาสตร์ให้นักเรียนรุ่นเยาว์
ธุรกิจขนาดเล็กจำลองแนวคิดเกี่ยวกับโลโก้และบรรจุภัณฑ์หลายอย่างก่อนที่จะจ้างนักออกแบบเพื่อปรับแต่ง
นักออกแบบเกมสร้างคอนเซ็ปต์อาร์ตสำหรับตัวละครและสภาพแวดล้อมอย่างรวดเร็วเพื่อนำเสนอแนวคิด
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DALL-E quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
สนามรังสีประสาท
คำถามที่พบบ่อย
What is DALL-E?
DALL-E คือกลุ่มโมเดลข้อความเป็นรูปภาพในตระกูล OpenAI ที่เปลี่ยนคำอธิบายที่เป็นลายลักษณ์อักษรให้กลายเป็นรูปภาพต้นฉบับ โดยทำให้ "พิมพ์ประโยค รับรูปภาพ" เป็นแนวคิดกระแสหลัก และผลักดันการสร้างรูปภาพจากการสาธิตการวิจัยมาสู่เครื่องมือในชีวิตประจำวัน
DALL-E 3 ทำหน้าที่อะไรเป็นหลัก?
DALL-E เป็นระบบแปลงข้อความเป็นรูปภาพ: คุณอธิบายฉากด้วยคำพูด จากนั้นระบบจะสร้างภาพใหม่ที่ตรงกับคำอธิบายนั้น
DALL-E 3 ใช้เทคนิคพื้นฐานอะไรในการสร้างภาพ
DALL-E 3 เป็นโมเดลการแพร่กระจายที่เริ่มต้นจากสัญญาณรบกวนแบบสุ่ม และปรับแต่งทีละขั้นตอน ตามคำแนะนำของคุณ ให้เป็นภาพที่สอดคล้องกัน
เหตุใด DALL-E 3 จึงปฏิบัติตามคำแนะนำได้ดีขึ้นเมื่อใช้ภายใน ChatGPT
ใน ChatGPT โมเดลภาษาจะเขียนคำขอสั้นๆ ใหม่ให้มีข้อความที่สมบูรณ์และเฉพาะเจาะจงมากขึ้น ปรับปรุงความเที่ยงตรงของรูปภาพที่ตรงกับสิ่งที่คุณต้องการ
อะไรคือการปรับปรุงที่โดดเด่นของ DALL-E 3 ที่เกิดขึ้นจากเวอร์ชันก่อนหน้า?
รุ่นก่อนหน้านี้อ่านไม่ออกข้อความในภาพ แต่ DALL-E 3 สามารถแสดงคำที่อ่านง่ายบนป้าย ฉลาก และโปสเตอร์ได้อย่างน่าเชื่อถือมากขึ้น
'การวาดภาพ' ช่วยให้คุณทำอะไรกับรูปภาพ DALL-E ได้
Inpainting เป็นการแก้ไขส่วนที่เลือกของรูปภาพ (เช่น การสลับวัตถุ) โดยที่พื้นที่โดยรอบไม่เสียหาย