คู่มือทางเทคนิค

การไล่ระดับสีที่หายไปและการระเบิด

เมื่อฝึกเครือข่ายระดับลึก สัญญาณข้อผิดพลาดจะหดตัวลงสู่ศูนย์หรือขยายไปสู่ระยะอนันต์ในขณะที่สัญญาณเหล่านั้นเดินทางย้อนกลับผ่านหลายชั้น

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

This makes deep and recurrent models painfully slow or impossible to train without specific fixes.

เจาะลึก

โครงข่ายประสาทเทียมเรียนรู้ผ่านการแพร่กระจายกลับ ซึ่งจะคูณการไล่ระดับสีทีละชั้นโดยใช้กฎลูกโซ่ เมื่อคุณซ้อนหลายเลเยอร์ ตัวประกอบต่อเลเยอร์เหล่านั้นจะถูกคูณเข้าด้วยกัน หากแต่ละปัจจัยมีค่าน้อยกว่า 1 อย่างสม่ำเสมอ ผลิตภัณฑ์จะหดตัวลงแบบทวีคูณและเลเยอร์แรกๆ แทบจะไม่ได้รับการอัปเดต — ปัญหาการไล่ระดับสีที่หายไป หากแต่ละปัจจัยมากกว่า 1 ผลิตภัณฑ์จะระเบิด ทำให้เกิดการอัพเดตที่ไม่เสถียรจำนวนมากหรือค่า NaN การกระตุ้นแบบอิ่มตัว เช่น sigmoid และ tanh ซึ่งมีอนุพันธ์สูงสุดที่ 0.25 และ 1 เป็นตัวการคลาสสิก ปัญหานี้รุนแรงที่สุดในเครือข่าย deep feedforward และในเครือข่ายที่เกิดซ้ำ (RNN) ที่ประมวลผลลำดับยาว โดยที่เมทริกซ์น้ำหนักเดียวกันจะถูกนำไปใช้ใหม่ทุกครั้ง ทำให้เกิดผลกระทบที่ทวีคูณขึ้นอย่างมาก

ข้อมูลเชิงลึกทางเทคนิค

ในการขยายพันธุ์กลับ การไล่ระดับสีที่ชั้นแรกเป็นผลจากเงื่อนไขจาโคเบียนและน้ำหนักหลายข้อ โดยคร่าวๆ สัญญาณจะปรับขนาดเหมือนกับปัจจัยต่อเลเยอร์ที่เพิ่มขึ้นจนถึงระดับความลึก ค่าที่ต่ำกว่า 1 จะลดลงไปสู่ศูนย์ ค่าที่มากกว่า 1 จะเติบโตอย่างไม่มีขอบเขต สำหรับ RNN ที่คลี่ออกเหนือขั้น T คำที่เด่นจะทำงานเหมือนกับค่าลักษณะเฉพาะที่ใหญ่ที่สุดของน้ำหนักที่เกิดซ้ำกับกำลัง T ดังนั้นแม้แต่การเบี่ยงเบนเล็กน้อยจาก 1 ก็หายไปหรือระเบิดในลำดับที่ยาว

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการไล่ระดับสีที่หายไปและระเบิด

การบรรเทาผลกระทบหลัก — การเชื่อมต่อที่เหลือ (ข้าม) การทำให้เป็นมาตรฐาน เกตติ้ง และการเริ่มต้นอย่างระมัดระวัง — กลายเป็นมาตรฐานแล้ว ดังนั้นการไล่ระดับสีที่หายไปจึงไม่ค่อยขัดขวางการฝึกอบรมสถาปัตยกรรมสมัยใหม่ หม้อแปลงไฟฟ้าหลีกเลี่ยงการประนอมที่เกิดซ้ำทั้งหมดโดยใช้ความสนใจเหนือลำดับแทนที่จะใช้ซ้ำเมทริกซ์ตัวเดียว การวิจัยยังคงดำเนินต่อไปเกี่ยวกับเครือข่ายการฝึกอบรมที่ลึกหลายพันชั้น บนแบบจำลองบริบทที่มีความเสถียรและยาวมาก และในเครื่องมือทางทฤษฎี เช่น เคอร์เนลแทนเจนต์ประสาทที่คาดการณ์การแพร่กระจายของสัญญาณก่อนที่จะดำเนินการขั้นตอนการฝึกอบรมขั้นตอนเดียว

การใช้งานจริงในโลกแห่งความเป็นจริง

โมเดลภาษา RNN ยุคแรกๆ พยายามเชื่อมต่อคำต่างๆ ในประโยคยาวๆ เนื่องจากการไล่ระดับสีหายไปในช่วงเวลาต่างๆ มากมาย ซึ่งกระตุ้นให้เกิด LSTM และ GRU

ResNet เปิดใช้งานการฝึกอบรมตัวแยกประเภทรูปภาพ 100+ เลเยอร์โดยการเพิ่มการเชื่อมต่อแบบข้ามที่ให้การไล่ระดับสีเป็นเส้นทางย้อนกลับโดยตรงและไม่มีการเจือปน

นักพัฒนาพบว่าการสูญเสียการฝึกกลายเป็น NaN ทันที ซึ่งเป็นสัญญาณของการไล่ระดับสีที่ระเบิด และเพิ่มการไล่ระดับสีเพื่อทำให้เสถียร

เครื่องมือตรวจสอบใน PyTorch หรือ TensorFlow พล็อตบรรทัดฐานการไล่ระดับสีต่อเลเยอร์ เพื่อให้วิศวกรสามารถมองเห็นเลเยอร์ที่มีการไล่ระดับสียุบลงจนใกล้ศูนย์

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vanishing and Exploding Gradients quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

จุดตรวจไล่ระดับ

คำถามที่พบบ่อย

What is Vanishing and Exploding Gradients?

เมื่อฝึกเครือข่ายระดับลึก สัญญาณข้อผิดพลาดจะหดตัวลงสู่ศูนย์หรือขยายไปสู่ระยะอนันต์ในขณะที่สัญญาณเหล่านั้นเดินทางย้อนกลับผ่านหลายชั้น สิ่งนี้ทำให้โมเดลเชิงลึกและเกิดซ้ำช้าลงอย่างเจ็บปวดหรือเป็นไปไม่ได้ในการฝึกหากไม่มีการแก้ไขเฉพาะ

การดำเนินการทางคณิตศาสตร์ใดในการขยายพันธุ์แบบย้อนกลับเป็นสาเหตุหลักของการไล่ระดับสีที่หายไปและการระเบิด

Backpropagation ใช้กฎลูกโซ่ โดยคูณปัจจัยต่อเลเยอร์หลายตัวเข้าด้วยกัน สินค้าที่มีมูลค่าต่ำกว่า 1 จะหายไป และผลิตภัณฑ์มากกว่า 1 จะระเบิด

เหตุใดการเปิดใช้งาน sigmoid และ tanh จึงมีแนวโน้มที่จะหายไปจากการไล่ระดับสีโดยเฉพาะ

จุดสูงสุดของอนุพันธ์ของ Sigmoid ที่ 0.25 และ tanh's ที่ 1; ในบริเวณที่อิ่มตัวทั้งคู่จะเข้าใกล้ศูนย์ ดังนั้นการซ้อนพวกมันจะช่วยผลักดันการไล่ระดับสีไปทางศูนย์

สถาปัตยกรรมใดได้รับผลกระทบอย่างรุนแรงที่สุดจากปัญหาการไล่ระดับสีในลำดับที่ยาว

RNN จะนำเมทริกซ์น้ำหนักที่เกิดซ้ำเดิมมาใช้ใหม่ทุกครั้ง ดังนั้นในลำดับที่ยาวนาน สารประกอบเอฟเฟกต์ เช่น ค่าลักษณะเฉพาะของเมทริกซ์นั้นจะเพิ่มขึ้นตามความยาวของลำดับ

การเห็นการสูญเสียการฝึกกะทันหันกลายเป็น NaN น่าจะบ่งบอกถึงปัญหาใด

การไล่ระดับสีแบบระเบิดทำให้เกิดการอัปเดตจำนวนมหาศาลที่ล้นไปจนถึงค่าอนันต์หรือ NaN การไล่ระดับสีที่หายไปกลับทำให้เกิดการสูญเสียจนหยุดนิ่ง

การเชื่อมต่อที่เหลือ (ข้าม) ช่วยเรื่องการไล่ระดับสีที่หายไปได้อย่างไร

การเชื่อมต่อแบบข้ามจะเพิ่มเส้นทางเอกลักษณ์เพื่อให้การไล่ระดับสีสามารถไหลย้อนกลับได้โดยไม่ต้องลดทอนลงซ้ำๆ ด้วยเลเยอร์กลาง