คู่มือ AI แบบเห็นภาพ

การสร้างวิดีโอ Lumiere Space-Time

Lumiere คือโมเดลการแพร่กระจายข้อความเป็นวิดีโอจาก Google การวิจัยที่สร้างคลิปวิดีโอทั้งหมดพร้อมกันโดยใช้ Space-Time U-Net

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it tackles temporal consistency at the architecture level, producing smoother, more coherent motion than pipelines that stitch keyframes together.

เจาะลึก

Lumiere เปิดตัวในต้นปี 2024 ท้าทายการออกแบบ "คีย์เฟรมแล้วเติม" ทั่วไปที่ใช้โดยโปรแกรมสร้างวิดีโอจำนวนมาก วิธีการแบบเรียงซ้อนเหล่านั้นจะสร้างคีย์เฟรมที่อยู่ห่างไกลสองสามอันก่อนแล้วจึงสอดแทรก ซึ่งสามารถสร้างการเคลื่อนไหวที่กระตุกหรือไม่สอดคล้องกัน เนื่องจากไม่มีเครือข่ายใดเคยเห็นไทม์ไลน์แบบเต็ม Lumiere จะสร้างระยะเวลาชั่วคราวทั้งหมดของคลิปในการส่งผ่านครั้งเดียวด้วย Space-Time U-Net (STUNet) เครือข่ายลดขนาดลงทั้งในพื้นที่และเวลา โดยประมวลผลการนำเสนอวิดีโอทั้งหมดที่มีขนาดกะทัดรัดร่วมกัน ดังนั้นการเคลื่อนไหวจึงสอดคล้องกันทั่วโลก การออกแบบนี้ยังช่วยให้สามารถแก้ไขงานต่างๆ ได้ เช่น ภาพสู่วิดีโอ การวาดภาพ การสร้างสไตไลซ์ และ 'ภาพยนตร์' ที่สร้างภาพเคลื่อนไหวเฉพาะบริเวณที่เลือกของภาพนิ่ง

ข้อมูลเชิงลึกทางเทคนิค

แนวคิดหลักคือ U-Net ในอวกาศ-เวลา รูปภาพมาตรฐาน U-Net downsamples และ upsamples ในความกว้างและความสูง STUNet เพิ่มแกนเวลา การสุ่มตัวอย่างในอวกาศและเวลาร่วมกัน ด้วยการบีบอัดมิติชั่วคราว เครือข่ายสามารถเก็บคลิปทั้งหมดไว้ในหน่วยความจำ และใช้ทั้งการโน้มน้าวใจและความสนใจในทุกเฟรมพร้อมกัน เนื่องจากสร้างทุกเฟรมในการส่งผ่านที่สอดคล้องกันเพียงครั้งเดียว แทนที่จะสอดแทรกระหว่างคีย์เฟรมแบบกระจัดกระจาย การเคลื่อนไหวที่ได้จึงมีความสอดคล้องกันทั่วโลกมากกว่ามาก

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของการสร้างวิดีโออวกาศ-เวลา Lumiere

ปรัชญาการส่งผ่านครั้งเดียวแบบเต็มระยะเวลาของ Lumiere มีอิทธิพลต่อวิธีคิดของภาคสนามเกี่ยวกับการเชื่อมโยงกันของเวลา แม้ว่าความละเอียดและความยาวของคลิปจะไต่สูงขึ้นเรื่อยๆ ในระบบที่แข่งขันกันก็ตาม โมเดลวิดีโอในอนาคตมีแนวโน้มที่จะผสมผสานสถาปัตยกรรมอวกาศ-เวลาเข้ากับการบีบอัดที่ชาญฉลาดยิ่งขึ้นเพื่อผลักดันไปสู่คลิปที่ยาวขึ้น มีความละเอียดสูงกว่า และควบคุมได้ คาดหวังความคืบหน้าอย่างต่อเนื่องในการควบคุมการแก้ไข แอนิเมชั่นเฉพาะภูมิภาค และฟิสิกส์ที่สมจริง ควบคู่ไปกับความสนใจที่เพิ่มขึ้นในแหล่งที่มาและลายน้ำ เนื่องจากเครื่องมือดังกล่าวทำให้การผลิตวิดีโอสังเคราะห์ที่น่าเชื่อถือง่ายขึ้น

การใช้งานจริงในโลกแห่งความเป็นจริง

เปลี่ยนข้อความแจ้งให้เป็นคลิปเคลื่อนไหวไม่กี่วินาทีที่เชื่อมโยงกันโดยตรง

การสร้างภาพยนตร์ที่เคลื่อนไหวเฉพาะน้ำหรือเส้นผมในภาพนิ่ง

การใช้รูปลักษณ์ที่มีสไตล์ เช่น งานกระดาษหรือสีน้ำ ทั่วทั้งวิดีโอที่สร้างขึ้นอย่างสม่ำเสมอ

การลงสีวิดีโอเพื่อแทรกหรือลบวัตถุที่เคลื่อนไหวโดยที่ยังคงให้การเคลื่อนไหวราบรื่น

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Lumiere Space-Time Video Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ปรับแต่งวิดีโอด้วยการตัดต่อภาพเดียว

คำถามที่พบบ่อย

What is Lumiere Space-Time Video Generation?

Lumiere คือโมเดลการแพร่กระจายข้อความเป็นวิดีโอจาก Google การวิจัยที่สร้างคลิปวิดีโอทั้งหมดพร้อมกันโดยใช้ Space-Time U-Net สิ่งสำคัญคือต้องจัดการกับความสอดคล้องชั่วคราวในระดับสถาปัตยกรรม ทำให้เกิดการเคลื่อนไหวที่ราบรื่นและสอดคล้องกันมากกว่าไปป์ไลน์ที่ต่อคีย์เฟรมเข้าด้วยกัน

คุณสมบัติทางสถาปัตยกรรมที่กำหนดของ Lumiere คืออะไร?

Space-Time U-Net (STUNet) ของ Lumiere จะดาวน์แซมเพิลทั้งในพื้นที่และเวลาเพื่อสร้างระยะเวลาทางโลกแบบเต็มในการส่งผ่านครั้งเดียว

Lumiere แตกต่างจากรุ่นวิดีโอแบบเรียงซ้อนทั่วไปอย่างไร

แทนที่จะสร้างคีย์เฟรมที่อยู่ห่างไกลและเติมเต็มช่องว่าง Lumiere จะสร้างไทม์ไลน์ทั้งหมดในการส่งผ่านที่สอดคล้องกันเพียงครั้งเดียว

การออกแบบ single-pass ของ Lumiere ปรับปรุงโดยตรงปัญหาใดมากที่สุด?

ด้วยการให้เครือข่ายเดียวเห็นไทม์ไลน์ทั้งหมด Lumiere จึงสามารถบรรลุการเคลื่อนไหวที่สอดคล้องกันทั่วโลกมากขึ้น และกระตุกน้อยลง

ตัวอย่างดาวน์ Space-Time U-Net ในมิติใด

STUNet ลดขนาดตัวอย่างข้ามอวกาศและเวลาเข้าด้วยกัน โดยบีบอัดคลิปเพื่อให้วิดีโอทั้งหมดพอดีและเฟรมได้รับการประมวลผลร่วมกัน

Lumiere รองรับเอฟเฟกต์สร้างสรรค์ใดบ้างที่สร้างภาพเคลื่อนไหวเพียงส่วนหนึ่งของภาพนิ่ง

Lumiere สามารถสร้างภาพยนตร์ซึ่งสร้างภาพเคลื่อนไหวในบริเวณที่เลือกของภาพนิ่งได้