การออกกลางคันและการทำให้เป็นมาตรฐานแบบสุ่ม
การออกกลางคันเป็นเคล็ดลับการทำให้เป็นมาตรฐานซึ่งจะสุ่มปิดเศษส่วนของเซลล์ประสาทในระหว่างแต่ละขั้นตอนการฝึกอบรม บังคับให้เครือข่ายสร้างการเป็นตัวแทนที่ซ้ำซ้อนและมีประสิทธิภาพ
ภาพรวม
มันกลายเป็นหนึ่งในเทคนิคที่มีอิทธิพลมากที่สุดในการต่อสู้กับการฟิตเกินในดีปเลิร์นนิง
เจาะลึก
เปิดตัวโดยกลุ่มของ Hinton ประมาณปี 2012 การออกจากกลางคันกล่าวถึงจุดอ่อนที่สำคัญของเครือข่ายขนาดใหญ่: เซลล์ประสาทสามารถปรับตัวร่วมกันได้ เรียนรู้ที่จะแก้ไขข้อผิดพลาดของกันและกันในรูปแบบที่ใช้กับข้อมูลการฝึกอบรมเท่านั้น ทุกครั้งที่ส่งต่อระหว่างการฝึก การออกกลางคันจะสุ่มตั้งค่าเอาท์พุตของเซลล์ประสาทแต่ละตัวให้เป็นศูนย์ โดยมีความน่าจะเป็น p (มักจะ 0.5 ในชั้นหนาแน่น) เนื่องจากเซลล์ประสาทใดๆ อาจหายไป เครือข่ายจึงไม่สามารถอาศัยความร่วมมือที่เปราะบางได้ และต้องกระจายข้อมูลที่เป็นประโยชน์ไปยังหลายหน่วย สิ่งนี้ทำหน้าที่เหมือนกับการฝึกเครือข่ายขนาดใหญ่ที่บางลงซึ่งแบ่งน้ำหนักกัน เมื่อเวลาทดสอบถูกปิด และใช้เครือข่ายทั้งหมด โดยมีการปรับขนาดการเปิดใช้งานเพื่อให้ผลลัพธ์ที่คาดหวังตรงกับการฝึก โดยทั่วไปแล้วผลลัพธ์ที่ได้จะเป็นลักษณะทั่วไปที่ดีกว่าโดยเสียค่าใช้จ่ายในการฝึกอบรมที่นานขึ้นเล็กน้อย
ข้อมูลเชิงลึกทางเทคนิค
ในระหว่างการฝึกอบรม แต่ละหน่วยจะถูกเก็บไว้ด้วยความน่าจะเป็น (1 ลบ p) ผ่านการสุ่มไบนารีมาสก์ ดังนั้นจึงมีการสุ่มตัวอย่างเครือข่ายย่อยที่แตกต่างกันทุกชุด เฟรมเวิร์กสมัยใหม่ใช้การออกกลางคันแบบกลับหัว: การเปิดใช้งานที่เหลือจะถูกหารด้วย (1 ลบ p) ในเวลารถไฟ ดังนั้นจึงไม่จำเป็นต้องปรับขนาดในการอนุมาน การสุ่มนี้ส่งเสียงรบกวนที่ไม่สนับสนุนการปรับตัวร่วมและประมาณค่าเฉลี่ยของเครือข่ายย่อยที่มีน้ำหนักร่วมแบบเอกซ์โปเนนเชียล ซึ่งเป็นรูปแบบการรวมกลุ่มราคาถูก
ผลกระทบเชิงกลยุทธ์
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้
ต้นทุนและงบประมาณ
คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา
ทีมงานและขั้นตอนการทำงาน
ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น
อนาคตของการออกกลางคันและการทำให้เป็นมาตรฐานแบบสุ่ม
ในเครือข่ายการมองเห็นแบบหมุนวน การทำให้เป็นมาตรฐานแบบแบทช์ได้เข้ามาแทนที่การเลื่อนมาตรฐานไปเป็นส่วนใหญ่ แต่ตัวแปรต่างๆ เติบโตได้ดีในที่อื่น: หม้อแปลงใช้การเลื่อนออกไปยังเลเยอร์ความสนใจและฟีดไปข้างหน้า และ DropPath (ความลึกสุ่ม) จะปล่อยบล็อกที่เหลือทั้งหมด การออกกลางคันแบบมอนติคาร์โล ซึ่งทำให้การออกกลางคันยังคงใช้งานอยู่ที่การอนุมาน ใช้เพื่อประมาณความไม่แน่นอนของแบบจำลอง คาดว่าการทำให้เป็นมาตรฐานแบบสุ่มจะยังคงเป็นชุดเครื่องมือที่ยืดหยุ่น ซึ่งปรับเปลี่ยนตามสถาปัตยกรรม แทนที่จะเป็นสูตรตายตัวเดียว
การใช้งานจริงในโลกแห่งความเป็นจริง
การเพิ่มเลเยอร์ Dropout ด้วย p ประมาณ 0.5 ระหว่างเลเยอร์หนาแน่นของรูปภาพหรือตัวแยกประเภทข้อความใน PyTorch หรือ Keras
โมเดลหม้อแปลงไฟฟ้าที่ใช้การดร็อปเอาท์กับตุ้มน้ำหนักความสนใจและการเปิดใช้งานฟีดไปข้างหน้าระหว่างการฝึกล่วงหน้า
การออกจากกลางคันแบบมอนติคาร์โล โดยที่การออกจากกลางคันยังคงอยู่ที่อนุมานเพื่อสร้างการประมาณการความไม่แน่นอนสำหรับการคาดการณ์ทางการแพทย์หรือความปลอดภัยที่สำคัญ
ความลึกของสุ่ม (DropPath) สุ่มข้ามบล็อกที่เหลือเพื่อทำให้เครือข่ายที่มีความลึกมากเป็นปกติ เช่น ResNets และตัวแปลงการมองเห็น
ความเสี่ยงและรั้ว
แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ
เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน
การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง
แผนงานการดำเนินงาน
เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ
เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ
ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม
เอกสารที่ซึ่ง Dropout และ Stochastic Regularization ช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Dropout and Stochastic Regularization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
โคตรลาดสุ่มพร้อมโมเมนตัม
คำถามที่พบบ่อย
การออกสายและการสม่ําเสมอแบบสุ่มคืออะไร?
การออกกลางคันเป็นเคล็ดลับการทำให้เป็นมาตรฐานซึ่งจะสุ่มปิดเศษส่วนของเซลล์ประสาทในระหว่างแต่ละขั้นตอนการฝึกอบรม บังคับให้เครือข่ายสร้างการเป็นตัวแทนที่ซ้ำซ้อนและมีประสิทธิภาพ มันกลายเป็นหนึ่งในเทคนิคที่มีอิทธิพลมากที่สุดในการต่อสู้กับการเรียนรู้เชิงลึกมากเกินไป
การออกกลางคันทำอะไรระหว่างการฝึก?
การออกกลางคันจะสุ่มศูนย์แต่ละเซลล์ประสาทด้วยความน่าจะเป็น p ในระหว่างการฝึก ดังนั้นจึงใช้เครือข่ายย่อยแบบบางที่แตกต่างกันในแต่ละขั้นตอน
เหตุใดการออกกลางคันจึงปรับปรุงลักษณะทั่วไป
ด้วยการสุ่มลบยูนิตออก การออกกลางคันจะหยุดเซลล์ประสาทจากการสร้างพันธมิตรที่เปราะบาง ซึ่งจะทำงานเฉพาะกับข้อมูลการฝึกอบรม และปรับปรุงความทนทาน
จะเกิดอะไรขึ้นกับการออกจากระบบ ณ เวลาทดสอบ (การอนุมาน)
เมื่ออนุมาน เครือข่ายทั้งหมดจะทำงานโดยปิดใช้งานการออกกลางคัน และการเปิดใช้งานจะถูกปรับขนาด ดังนั้นเอาต์พุตที่คาดหวังจึงตรงกับการกระจายการฝึก
อัตราการออกกลางคันของ p = 0.5 ในเลเยอร์หมายถึงอะไรโดยประมาณระหว่างการฝึก
โดยที่ p = 0.5 เซลล์ประสาทแต่ละเซลล์มีโอกาส 50 เปอร์เซ็นต์ที่จะเป็นศูนย์ ดังนั้นโดยเฉลี่ยแล้วประมาณครึ่งหนึ่งจะลดลงต่อการส่งต่อแต่ละครั้ง
การออกกลางคันมักอธิบายว่าเป็นการประมาณอะไร
การสุ่มตัวอย่างเครือข่ายย่อยที่แตกต่างกันในแต่ละขั้นตอนจะประมาณค่าเฉลี่ยของเครือข่ายน้ำหนักร่วมแบบเอกซ์โพเนนเชียล ซึ่งเป็นรูปแบบหนึ่งของการรวมกลุ่มราคาถูก