คู่มือ AI แบบเห็นภาพ

เครือข่ายที่เหลือ

Residual Networks (ResNets) คือโครงข่ายประสาทเชิงลึกที่เพิ่ม 'ข้ามการเชื่อมต่อ' เพื่อให้เลเยอร์เรียนรู้การปรับเปลี่ยนเล็กๆ น้อยๆ แทนที่จะแปลงแบบเต็ม

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

This simple trick made it possible to train networks hundreds of layers deep, sparking a leap in image recognition accuracy.

เจาะลึก

ก่อน ResNets การซ้อนกันหลายเลเยอร์ทำให้เครือข่ายทำงานได้แย่ลง แม้แต่ในข้อมูลการฝึกอบรม ปัญหาที่เรียกว่าการย่อยสลาย ในปี 2015 นักวิจัย Microsoft Kaiming He และเพื่อนร่วมงานได้แนะนำบล็อกที่เหลือ: แทนที่จะขอให้สแต็กของเลเยอร์สร้างเอาท์พุต H(x) โดยตรง พวกเขาปล่อยให้มันเรียนรู้ส่วนที่เหลือ F(x) = H(x) - x จากนั้นเพิ่มอินพุตดั้งเดิม x กลับผ่านทางลัด หากเลเยอร์นั้นไม่จำเป็น ก็สามารถเรียนรู้ที่จะไม่ทำอะไรเลย (F(x) = 0) ResNet-152 ชนะการแข่งขัน ImageNet ประจำปี 2558 โดยมีข้อผิดพลาด 5 อันดับแรกที่ประมาณ 3.6 เปอร์เซ็นต์ ซึ่งสูงกว่าการคาดการณ์ระดับมนุษย์ และสถาปัตยกรรมของกล้องก็กลายเป็นกระดูกสันหลังหลักสำหรับการตรวจจับ การแบ่งส่วน และการถ่ายภาพทางการแพทย์

ข้อมูลเชิงลึกทางเทคนิค

การเชื่อมต่อแบบข้ามจะเปลี่ยนงานของแต่ละบล็อกเป็น y = F(x) + x ในระหว่างการขยายพันธุ์กลับ การไล่ระดับสีจะไหลผ่านทางทางลัดข้อมูลประจำตัวโดยไม่มีการเปลี่ยนแปลง ดังนั้นจึงไม่สามารถหายไปจนใกล้ศูนย์ได้แม้จะข้ามหลายร้อยเลเยอร์ก็ตาม สิ่งนี้ทำให้สามารถฝึกสแต็คลึกได้ ทางลัดการระบุตัวตนไม่ได้เพิ่มพารามิเตอร์เพิ่มเติม เฉพาะเมื่อขนาดอินพุตและเอาต์พุตแตกต่างกันเท่านั้น การฉายภาพขนาดเล็ก (การบิด 1x1) จะปรับขนาดก่อนที่จะเพิ่ม

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ

สร้างทางเลือก

ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง

ทีมงานและขั้นตอนการทำงาน

การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก

อนาคตของเครือข่ายที่เหลือ

การเชื่อมต่อที่เหลือตอนนี้เกือบจะเป็นสากลแล้ว: Transformers, Diffusion Models และ Large Language Models ล้วนใช้สิ่งเหล่านี้เพื่อทำให้การฝึกสแต็คที่ลึกมากมีความเสถียร การวิจัยยังคงดำเนินต่อไปเกี่ยวกับตัวแปรต่างๆ เช่น ResNets ก่อนการเปิดใช้งาน เส้นทางที่จัดกลุ่มของ ResNeXt และการรวมแนวคิดที่เหลือเข้ากับการฝึกอบรมที่ไม่ต้องทำให้เป็นมาตรฐาน คาดหวังว่าหลักการเชื่อมต่อแบบข้ามหลักจะยังคงเป็นบล็อคเริ่มต้น แม้ว่าสถาปัตยกรรมโดยรอบจะเปลี่ยนจากการโน้มน้าวใจไปสู่ความสนใจและการออกแบบแบบไฮบริดก็ตาม

การใช้งานจริงในโลกแห่งความเป็นจริง

แบ็กโบนการจัดหมวดหมู่ ImageNet (ResNet-50, ResNet-101) ที่ใช้เป็นตัวแยกคุณสมบัติที่ได้รับการฝึกอบรมล่วงหน้าสำหรับการถ่ายโอนการเรียนรู้

การตรวจหาเนื้องอกและรอยโรคในภาพรังสีวิทยาและพยาธิวิทยาโดยใช้ตัวเข้ารหัสที่ใช้ ResNet

การตรวจจับวัตถุและเฟรมเวิร์กการแบ่งส่วนอินสแตนซ์ เช่น Faster R-CNN และ Mask R-CNN ที่ใช้แบ็คโบน ResNet

ท่อรับรู้การขับขี่ด้วยตนเองที่แยกประเภทคนเดินเท้า ยานพาหนะ และป้ายจากกรอบกล้อง

ความเสี่ยงและรั้ว

สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน

ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม

ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น

แผนงานการดำเนินงาน

1

กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด

2

ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง

3

เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง

4

ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Residual Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

นำเสนอเครือข่ายพีระมิด

คำถามที่พบบ่อย

What is Residual Networks?

Residual Networks (ResNets) คือโครงข่ายประสาทเชิงลึกที่เพิ่ม 'ข้ามการเชื่อมต่อ' เพื่อให้เลเยอร์เรียนรู้การปรับเปลี่ยนเล็กๆ น้อยๆ แทนที่จะแปลงแบบเต็ม เคล็ดลับง่ายๆ นี้ทำให้สามารถฝึกอบรมเครือข่ายหลายร้อยชั้นได้ลึก ซึ่งทำให้เกิดความแม่นยำในการจดจำภาพแบบก้าวกระโดด

การเชื่อมต่อที่เหลือช่วยแก้ปัญหาอะไรโดยเฉพาะ?

ก่อน ResNets การเพิ่มเลเยอร์มากขึ้นทำให้ความแม่นยำลดลงแม้กระทั่งข้อมูลการฝึกก็ตาม ข้ามการเชื่อมต่อเพื่อแก้ไขปัญหานี้ด้วยการทำให้เลเยอร์ปรับแต่งได้ง่าย

บล็อกที่เหลือคำนวณเป็นเอาต์พุตจริง ๆ แล้วคืออะไร

บล็อกที่เหลือจะส่งออกเอาต์พุต y = F(x) + x โดยบวกส่วนที่เหลือที่เรียนรู้ไปยังอินพุตผ่านการเชื่อมต่อแบบข้าม

เหตุใดการเชื่อมต่อแบบข้ามจึงช่วยไล่ระดับสีระหว่างการฝึกซ้อม

ทางลัดการระบุตัวตนให้เส้นทางโดยตรงสำหรับการไล่ระดับสีไหลย้อนกลับโดยไม่มีการเปลี่ยนแปลง ช่วยป้องกันปัญหาการไล่ระดับสีแบบหายไปในสแต็กที่ลึกมาก

รุ่น ResNet ที่ชนะในปี 2558 มีเลเยอร์ประมาณกี่ชั้น

ResNet-152 ซึ่งมี 152 เลเยอร์ ชนะการแข่งขัน ImageNet ประจำปี 2558 ซึ่งแสดงให้เห็นว่าขณะนี้สามารถฝึกอบรมเครือข่ายที่มีความลึกมากได้สำเร็จ

หากชั้นของบล็อกที่เหลือเรียนรู้ F(x) = 0 บล็อกนั้นทำหน้าที่อะไร

เมื่อ F(x) = 0 ผลลัพธ์จะเป็นเพียงแค่ x ดังนั้นบล็อกจึงกลายเป็นการจับคู่เอกลักษณ์ ซึ่งจะทำให้ชั้นพิเศษไม่เป็นอันตรายหากไม่จำเป็น