หม้อแปลงกระจาย
Diffusion Transformers (DiTs) สลับ Convolutional U-Net ที่เป็นหัวใจสำคัญของตัวสร้างภาพและวิดีโอสำหรับแกนหลักของ Transformer
ภาพรวม
This architecture powers leading systems like Stable Diffusion 3 and OpenAI's Sora, and it scales remarkably well as you add compute.
เจาะลึก
แบบจำลองการแพร่กระจายจะสร้างภาพโดยเริ่มจากสัญญาณรบกวนบริสุทธิ์ และค่อยๆ ลดสัญญาณรบกวนให้เป็นภาพที่เชื่อมโยงกัน เป็นเวลาหลายปีที่เครือข่ายที่ทำการลดสัญญาณรบกวนนั้นเป็น U-Net ซึ่งเป็นสถาปัตยกรรมแบบบิดเบี้ยว Diffusion Transformer เปิดตัวโดย Peebles และ Xie ในปี 2022 แทนที่ U-Net ด้วย Transformer ขั้นแรกรูปภาพจะถูกบีบอัดลงในพื้นที่แฝง โดยแบ่งออกเป็นแพตช์เล็กๆ และแต่ละแพตช์จะกลายเป็นโทเค็น เหมือนกับคำในแบบจำลองภาษา จากนั้น Transformer จะประมวลผลโทเค็นเหล่านี้ด้วยความสนใจในตัวเองในแต่ละขั้นตอนการลดสัญญาณรบกวน การค้นพบที่สำคัญคือประสิทธิภาพของ DiT ดีขึ้นอย่างคาดการณ์ได้เมื่อคุณเพิ่มขนาดโมเดลและลดขนาดแพตช์ ตามกฎหมายการปรับขนาดที่สะอาด ความสามารถในการปรับขนาดนี้คือสาเหตุที่ระบบแปลงข้อความเป็นวิดีโอและระบบแปลงข้อความเป็นรูปภาพระดับไฮเอนด์ได้ย้ายไปยังแบ็คโบนของ Transformer เป็นส่วนใหญ่
ข้อมูลเชิงลึกทางเทคนิค
นวัตกรรมหลักคือวิธีที่ DiT ใส่เงื่อนไข เช่น การบอกเวลาและข้อความแจ้ง แทนที่จะใช้การต่อข้อมูลแบบธรรมดา พวกเขาใช้การปรับเลเยอร์การทำให้เป็นมาตรฐาน (adaLN) โดยที่เครือข่ายคาดการณ์พารามิเตอร์ขนาดและการเปลี่ยนแปลงสำหรับเลเยอร์การทำให้เป็นมาตรฐานจากสัญญาณการปรับสภาพ ตัวแปร adaLN-zero จะเริ่มต้นสิ่งเหล่านี้ ดังนั้นแต่ละบล็อกจึงเริ่มต้นเป็นฟังก์ชันการระบุตัวตน ซึ่งทำให้การฝึกมีความเสถียร แพตช์จะถูกทำให้แบนเป็นโทเค็น ประมวลผลโดยบล็อก Transformer มาตรฐานโดยต้องใส่ใจในตัวเอง จากนั้นจึงประกอบกลับเข้าไปใหม่และถอดรหัสกลับเป็นพิกเซล
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของหม้อแปลงไฟฟ้าแบบกระจาย
หม้อแปลงกระจายกำลังกลายเป็นแกนหลักเริ่มต้นสำหรับสื่อกำเนิด การออกแบบที่ใช้โทเค็นทำให้เป็นธรรมชาติสำหรับการรวมรูปภาพ วิดีโอ และแม้กระทั่งการสร้างหลายรูปแบบภายใต้สถาปัตยกรรมที่ปรับขนาดได้เพียงแห่งเดียว การวิจัยกำลังผลักดันไปสู่วิดีโอที่ยาวขึ้น ความละเอียดที่สูงขึ้น และความสนใจที่มีประสิทธิภาพมากขึ้นในการควบคุมต้นทุนกำลังสองของโทเค็นจำนวนมาก คาดหวังการบรรจบกันระหว่างโมเดลภาษาและการมองเห็น โดยที่สูตรการปรับขนาดและโครงสร้างพื้นฐานของ Transformer ที่คล้ายกันให้บริการทั้งสองอย่าง ช่วยเร่งความก้าวหน้าในโมเดลโลกและวิดีโอเชิงโต้ตอบ
การใช้งานจริงในโลกแห่งความเป็นจริง
Sora ของ OpenAI ใช้แกนหลักของ Transformer บนแพตช์กาลอวกาศเพื่อสร้างวิดีโอที่มีความแม่นยำสูงความยาวหนึ่งนาทีจากข้อความแจ้ง
Stable Diffusion 3 ใช้ Multimodal Diffusion Transformer (MMDiT) เพื่อจัดแนวรูปภาพที่สร้างขึ้นด้วยคำอธิบายข้อความโดยละเอียดได้ดียิ่งขึ้น
นักวิจัยปรับขนาด DiT เป็นพารามิเตอร์นับพันล้านและสังเกตคุณภาพของภาพที่ดีขึ้นอย่างคาดการณ์ได้ ซึ่งเป็นแนวทางในการตัดสินใจเรื่องงบประมาณการประมวลผล
สตูดิโอใช้โมเดลที่ใช้ DiT เพื่อขยายคลิปสั้น โดยถือว่าเฟรมวิดีโอพิเศษเป็นโทเค็นแพตช์เพิ่มเติมที่จะลดทอน
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
เครือข่ายหม้อแปลงเชิงพื้นที่
คำถามที่พบบ่อย
What is Diffusion Transformers?
Diffusion Transformers (DiTs) สลับ Convolutional U-Net ที่เป็นหัวใจสำคัญของตัวสร้างภาพและวิดีโอสำหรับแกนหลักของ Transformer สถาปัตยกรรมนี้ขับเคลื่อนระบบชั้นนำ เช่น Stable Diffusion 3 และ OpenAI ของ Sora และจะปรับขนาดได้อย่างน่าทึ่งเมื่อคุณเพิ่มการประมวลผล
Diffusion Transformer แทนที่ส่วนประกอบใดเมื่อเปรียบเทียบกับรุ่น Diffusion แบบเดิม
DiT จะเข้ามาแทนที่ U-Net ซึ่งเป็นเครือข่ายแบบหมุนวนที่ทำการลดสัญญาณรบกวนด้วยแกนหลักของ Transformer
DiT เปลี่ยนรูปภาพเป็นสิ่งที่ Transformer สามารถประมวลผลได้อย่างไร
รูปภาพแฝงจะถูกแบ่งออกเป็นแพตช์เล็กๆ และแต่ละแพตช์จะกลายเป็นโทเค็น คล้ายคลึงกับคำในแบบจำลองภาษา
เอกสาร DiT ต้นฉบับค้นพบอะไรเกี่ยวกับการปรับขนาด
คุณภาพของ DiT จะปรับปรุงด้วยวิธีที่สะอาดและคาดเดาได้ เมื่อคุณเพิ่มการประมวลผลโมเดลและใช้แพตช์ที่เล็กลง ตามกฎหมายการปรับขนาด
โดยทั่วไปแล้ว DiT จะใส่เงื่อนไขเช่นการบอกเวลาและข้อความแจ้งอย่างไร
DiT ใช้การปรับเลเยอร์การทำให้เป็นมาตรฐานเพื่อคาดการณ์พารามิเตอร์มาตราส่วนและการเปลี่ยนแปลงสำหรับเลเยอร์การทำให้เป็นมาตรฐานจากสัญญาณการปรับสภาพ
การเริ่มต้น 'adaLN-zero' สำเร็จอะไร
adaLN-zero เริ่มต้นการมอดูเลต ดังนั้นแต่ละบล็อกจะทำหน้าที่เป็นตัวตนในขั้นต้น ซึ่งจะทำให้การฝึกอบรมมีความเสถียรและปรับปรุง