คู่มือ AI แบบเห็นภาพ

สถาปัตยกรรมยูเน็ต

U-Net เป็นเครือข่ายประสาทเทียมที่มีรูปร่างคล้ายตัว 'U' ที่มีความเป็นเลิศในการผลิตเอาต์พุตที่มีพิกเซลแม่นยำ ซึ่งเดิมใช้สำหรับการแบ่งส่วนภาพทางชีวการแพทย์

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

การออกแบบเอนโค้ดเดอร์-ดีโค้ดเดอร์ที่มีการเชื่อมต่อแบบข้ามทําให้เป็นแกนหลักของโมเดลการแพร่ภาพสมัยใหม่

เจาะลึก

U-Net เปิดตัวโดย Ronneberger, Fischer และ Brox ในปี 2558 สำหรับการแบ่งส่วนทางชีวการแพทย์ โดยมีเส้นทางการหดตัว (ตัวเข้ารหัส) ที่จะลดขนาดภาพลงในคุณสมบัติระดับสูงที่มีขนาดกะทัดรัด และเส้นทางการขยายแบบสมมาตร (ตัวถอดรหัส) ที่จะอัปตัวอย่างกลับไปเป็นความละเอียดเต็ม คุณลักษณะเฉพาะของมันคือการเชื่อมต่อแบบข้าม: การแมปคุณลักษณะจากระดับตัวเข้ารหัสแต่ละระดับจะถูกต่อเข้าด้วยกันเป็นระดับตัวถอดรหัสที่ตรงกัน ซึ่งช่วยให้ตัวถอดรหัสนำรายละเอียดเชิงพื้นที่อย่างละเอียดกลับมาใช้ใหม่ได้ (ขอบ ตำแหน่งที่แน่นอน) ซึ่งการสุ่มตัวอย่างอาจสูญเสียไป ดังนั้นเอาต์พุตจึงมีทั้งความหมายที่สมบูรณ์และแม่นยำเชิงพื้นที่ U-Net ได้รับการฝึกฝนอย่างดีจากรูปภาพที่มีคำอธิบายประกอบน้อยมากโดยใช้การเสริมหนัก ปัจจุบันนี้สนับสนุน Stable Diffusion และโมเดลที่คล้ายกัน โดยที่ U-Net คาดการณ์ว่าสัญญาณรบกวนจะถูกลบออกในแต่ละขั้นตอนการลดสัญญาณรบกวน ซึ่งมักจะเสริมด้วยการปรับความสนใจและการกำหนดจังหวะเวลา

ข้อมูลเชิงลึกทางเทคนิค

ความมหัศจรรย์อยู่ในการเชื่อมต่อแบบข้าม ในขณะที่ตัวเข้ารหัสลดขนาดลง ตัวเข้ารหัสจะสรุปว่า 'อะไร' มีอยู่ แต่จะเบลอว่า 'อยู่ที่ไหน' ตัวถอดรหัสจะอัปแซมเพิลเพื่อกู้คืนความละเอียด แต่ไม่มีรายละเอียดที่คมชัด ด้วยการต่อแผนผังคุณสมบัติตัวเข้ารหัสแต่ละตัวเข้ากับตัวถอดรหัสในระดับเดียวกัน U-Net จะส่งข้อมูลเชิงพื้นที่ที่แม่นยำผ่านคอขวดโดยตรง ทำให้คุณสมบัติความหมายเชิงลึกและการแปลเป็นภาษาท้องถิ่นอย่างละเอียดรวมกัน นี่คือสาเหตุที่มาสก์การแบ่งส่วนจัดชิดกับขอบเขตของวัตถุอย่างแน่นหนา

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของสถาปัตยกรรม U-Net

U-Net ยังคงเป็นม้าทำงานแต่กำลังพัฒนาอยู่ ในการสร้างภาพ แกนหลักการแพร่กระจายที่ใช้หม้อแปลงไฟฟ้า (DiTs) กำลังท้าทาย U-Net แบบม้วนในขนาดใหญ่ ในขณะที่ลูกผสมเพิ่มชั้นความสนใจภายใน U-Net ในการแบ่งส่วน ตัวเข้ารหัสหม้อแปลงและโมเดลพื้นฐาน เช่น SAM สร้างขึ้นจากแนวคิด U-Net คาดว่าหลักการข้ามการเชื่อมต่อของ U-Net จะยังคงมีอยู่ แม้ว่า Building Block จะเปลี่ยนจากการโน้มน้าวใจล้วนๆ ไปสู่สถาปัตยกรรมที่เน้นความสนใจและแบบไฮบริด

การใช้งานจริงในโลกแห่งความเป็นจริง

การแบ่งส่วนเนื้องอก เซลล์ หรืออวัยวะใน MRI และภาพด้วยกล้องจุลทรรศน์ การใช้งานดั้งเดิมของ U-Net และยังคงพบเห็นได้ทั่วไป

ทำหน้าที่เป็นเครือข่ายลดสัญญาณรบกวนใน Stable Diffusion โดยคาดการณ์สัญญาณรบกวนที่จะลบออกในแต่ละขั้นตอนของการสร้างภาพ

การวิเคราะห์ภาพถ่ายดาวเทียมและภาพถ่ายทางอากาศ เช่น การทำแผนที่ถนน อาคาร หรือการตัดไม้ทำลายป่าแบบพิกเซลต่อพิกเซล

งานแบบภาพต่อภาพ เช่น การลบพื้นหลัง การลงสี และความละเอียดสูงพิเศษ โดยที่เอาต์พุตจะต้องสอดคล้องกับพิกเซลอินพุต

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the U-Net Architecture quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

สถาปัตยกรรม U-Net คืออะไร?

U-Net เป็นเครือข่ายประสาทเทียมที่มีรูปร่างคล้ายตัว 'U' ที่มีความเป็นเลิศในการผลิตเอาต์พุตที่มีพิกเซลแม่นยำ ซึ่งเดิมใช้สำหรับการแบ่งส่วนภาพทางชีวการแพทย์ การออกแบบตัวเข้ารหัส-ตัวถอดรหัสพร้อมการเชื่อมต่อแบบข้ามทำให้เป็นแกนหลักของโมเดลการแพร่กระจายภาพสมัยใหม่

อะไรทำให้ U-Net มีรูปร่างเป็น 'U'

ตัวเข้ารหัสแบบหดตัวและตัวถอดรหัสส่วนขยายแบบสมมาตรจะสร้างแขนทั้งสองของ 'U'

จุดประสงค์ของการเชื่อมต่อแบบข้ามของ U-Net คืออะไร?

ข้ามการเชื่อมต่อโดยเชื่อมแผนผังคุณลักษณะของตัวเข้ารหัสเข้ากับตัวถอดรหัส เพื่อเรียกคืนรายละเอียดเชิงพื้นที่ที่แม่นยำที่สูญเสียไประหว่างการสุ่มตัวอย่าง

U-Net เดิมออกแบบมาเพื่ออะไร

Ronneberger และเพื่อนร่วมงานเปิดตัว U-Net ในปี 2558 สำหรับการแบ่งส่วนภาพทางชีวการแพทย์ ซึ่งทำงานได้ดีกับภาพที่ติดป้ายกำกับเพียงไม่กี่ภาพ

ใน Stable Diffusion U-Net ทำนายอะไรในแต่ละขั้นตอน

U-Net การแพร่กระจายได้รับการฝึกฝนให้คาดการณ์สัญญาณรบกวนที่เพิ่มเข้าไปในค่าแฝง เพื่อให้สามารถลบออกได้ และค่อยๆ ลดสัญญาณรบกวนไปทางภาพ

จะเกิดอะไรขึ้นกับข้อมูลเชิงพื้นที่เมื่อดาวน์สุ่มตัวอย่างตัวเข้ารหัส

การสุ่มตัวอย่างต่ำจะสร้างคุณลักษณะเชิงความหมายระดับสูงในขณะที่เบลอการแปลเชิงพื้นที่ที่แน่นอน ซึ่งจะข้ามการเชื่อมต่อในภายหลังเพื่อช่วยในการกู้คืน