คู่มือ AI แบบเห็นภาพ

ความลึก ความลึกของตาข้างเดียว

DepthAnything เป็นโมเดลพื้นฐานที่ประมาณว่าแต่ละพิกเซลอยู่ห่างจากภาพถ่ายปกติเพียงภาพเดียว โดยไม่ต้องใช้ฮาร์ดแวร์พิเศษ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It made robust, general-purpose depth sensing cheap and accessible for anything from phones to robots.

เจาะลึก

DepthAnything (2024 เผยแพร่โดยนักวิจัยรวมถึง TikTok/ByteDance และ HKU) จัดการกับการประมาณความลึกแบบตาข้างเดียว: การทำนายแผนที่ความลึกจากภาพ RGB หนึ่งภาพ ความก้าวหน้านั้นอยู่ที่ขนาด แทนที่จะอาศัยเฉพาะข้อมูลเชิงลึกที่มีป้ายกำกับที่จำกัด ทีมได้สร้างเครื่องมือที่ติดป้ายกำกับอัตโนมัติให้กับรูปภาพที่ไม่มีป้ายกำกับประมาณ 62 ล้านรูปโดยใช้แบบจำลองของครู จากนั้นจึงฝึกนักเรียนเกี่ยวกับคลังข้อมูลขนาดใหญ่นี้ ซึ่งให้ภาพรวมที่ชัดเจนเป็นศูนย์ทั้งในฉากในร่ม กลางแจ้ง และฉากที่ไม่ธรรมดา ต้นฉบับจะแสดงความลึกสัมพัทธ์ (ซึ่งพิกเซลอยู่ใกล้หรือไกลกว่า ไม่ใช่หน่วยเมตรที่แน่นอน) DepthAnything V2 (กลางปี ​​2024) เพิ่มความคมชัดให้กับรายละเอียดโดยการฝึกอบรมครูเกี่ยวกับข้อมูลสังเคราะห์ด้วยความจริงจากพื้นดินที่สมบูรณ์แบบ จากนั้นกลั่นให้เป็นภาพจริง แก้ไขขอบที่พร่ามัวและข้อผิดพลาดของวัตถุโปร่งใส

ข้อมูลเชิงลึกทางเทคนิค

ใช้ตัวเข้ารหัสตัวแปลงการมองเห็น DINOv2 ที่ป้อนหัวทำนายแบบหนาแน่นแบบ DPT เคล็ดลับสำคัญคือการกลั่นแบบกึ่งมีผู้ดูแล: ครูที่ได้รับการฝึกอบรมเกี่ยวกับข้อมูลที่ติดป้ายกำกับ จะใช้ป้ายกำกับปลอมหลายล้านรูปภาพที่ไม่มีป้ายกำกับ และนักเรียนจะเรียนรู้จากทั้งสองอย่าง V2 สลับป้ายกำกับจริงที่มีสัญญาณรบกวนสำหรับข้อมูลสังเคราะห์ที่มีความลึกที่สมบูรณ์แบบของพิกเซล จากนั้นกลั่นกลับเป็นภาพถ่ายจริง หลีกเลี่ยงความขาดแคลนและสัญญาณรบกวนของคำอธิบายประกอบเชิงลึกจริง ขณะเดียวกันก็รักษาขอบเขตที่คมชัด

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตแห่งความลึก ความลึกแบบตาข้างเดียว

คาดว่าจะมีการผสานรวมเข้ากับแว่นตา AR, กล้องสมาร์ทโฟน และหุ่นยนต์อย่างใกล้ชิดยิ่งขึ้น โดยที่ LiDAR เฉพาะนั้นมีราคาแพงหรือเทอะทะเกินไป ตัวแปรหน่วยเมตริกที่ให้เอาท์พุตมิเตอร์จริง รวมถึงโมเดลวิดีโอที่มีความลึกคงที่ชั่วคราว (ไม่มีการสั่นไหวระหว่างเฟรม) กำลังก้าวหน้าไปอย่างรวดเร็ว เนื่องจากโมเดลเหล่านี้ย่อขนาดให้ทำงานบนอุปกรณ์แบบเรียลไทม์ การรับรู้ 3 มิติด้วยกล้องเดี่ยวจะกลายเป็นความสามารถเริ่มต้น โดยป้อนการประมวลผลเชิงพื้นที่ การนำทางอัตโนมัติ และการสร้างฉาก 3 มิติขึ้นมาใหม่

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างแผนที่เชิงลึกเพื่อขับเคลื่อนพื้นหลังเบลอที่สมจริง (โบเก้) ในภาพถ่ายบุคคลบนสมาร์ทโฟนเลนส์เดียว

ให้การรับรู้สิ่งกีดขวาง 3 มิติสำหรับโดรนและหุ่นยนต์ราคาประหยัดที่ไม่มี LiDAR หรือกล้องสเตอริโอ

การสร้างแผนที่ปรับความลึกสำหรับ ControlNet เพื่อให้โปรแกรมสร้างภาพรักษาเรขาคณิตของฉากไว้

การแปลงภาพถ่ายและภาพยนตร์ 2D ให้เป็นเอฟเฟกต์ 3D หรือพารัลแลกซ์สำหรับจอแสดงผล VR และสามมิติ

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DepthAnything Monocular Depth quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การประมาณความลึกตาข้างเดียว

คำถามที่พบบ่อย

What is DepthAnything Monocular Depth?

DepthAnything เป็นโมเดลพื้นฐานที่ประมาณว่าแต่ละพิกเซลอยู่ห่างจากภาพถ่ายปกติเพียงภาพเดียว โดยไม่ต้องใช้ฮาร์ดแวร์พิเศษ ทำให้การตรวจจับความลึกวัตถุประสงค์ทั่วไปที่แข็งแกร่งมีราคาถูกและเข้าถึงได้ทุกอย่างตั้งแต่โทรศัพท์ไปจนถึงหุ่นยนต์

การประมาณความลึก 'ตาข้างเดียว' หมายถึงอะไร

ตาข้างเดียวหมายถึงความลึกอนุมานจากภาพจากกล้องตัวเดียว (โมโน) โดยไม่มีคู่สเตอริโอหรือเซ็นเซอร์ที่ทำงานอยู่

กลยุทธ์หลักของ DepthAnything เพื่อให้บรรลุถึงลักษณะทั่วไปที่แข็งแกร่งคืออะไร

ทีมงานได้สร้างกลไกข้อมูลที่ติดป้ายกำกับรูปภาพที่ไม่มีป้ายกำกับจำนวนหลายสิบล้านภาพ ซึ่งขยายขนาดการฝึกอบรมได้อย่างมาก

DepthAnything สร้างตัวเข้ารหัสแบ็คโบนแบบใด

DepthAnything ใช้ตัวเข้ารหัส DINOv2 ViT จับคู่กับหัวทำนายความหนาแน่นแบบ DPT

DepthAnything ดั้งเดิมจะให้ความลึกแบบใดเป็นหลัก

แบบจำลองพื้นฐานคาดการณ์การจัดลำดับความลึกสัมพัทธ์มากกว่าระยะทางเมตริกแบบสัมบูรณ์

DepthAnything V2 ปรับปรุงรายละเอียดและขอบอย่างละเอียดได้อย่างไร

V2 ฝึกครูเกี่ยวกับภาพสังเคราะห์ที่มีความลึกที่แน่นอน จากนั้นกลั่นเป็นภาพถ่ายจริงเพื่อให้มีขอบเขตที่คมชัดยิ่งขึ้น