คู่มือพื้นฐาน

สมมติฐานตั๋วลอตเตอรี

สมมติฐานตั๋วลอตเตอรีกล่าวว่าภายในเครือข่ายประสาทเทียมขนาดใหญ่ที่เริ่มต้นแบบสุ่มจะซ่อนเครือข่ายย่อยขนาดเล็กที่เรียกว่า 'ตั๋วที่ชนะ' ซึ่งได้รับการฝึกฝนเพียงอย่างเดียวจากน้ำหนักเริ่มต้นเดียวกัน สามารถจับคู่ความแม่นยำของเครือข่ายทั้งหมดได้

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it suggests we are training far more parameters than we actually need.

เจาะลึก

เสนอโดย Jonathan Frankle และ Michael Carbin ที่ MIT ในปี 2018 สมมติฐานนี้เกิดขึ้นจากการวิจัยการตัดแต่งกิ่ง โดยปกติคุณสามารถตัดเครือข่ายที่ได้รับการฝึกอบรมให้เหลือ 10-20% ของน้ำหนักได้โดยไม่สูญเสียความแม่นยำ แต่การฝึกอบรมเครือข่ายขนาดเล็กตั้งแต่เริ่มต้นนั้นล้มเหลว Frankle และ Carbin พบเคล็ดลับ: รักษาน้ำหนักเริ่มต้นดั้งเดิมของการเชื่อมต่อที่ยังมีชีวิตอยู่ เครือข่ายย่อยที่กระจัดกระจายนั้น — ตั๋วที่ชนะ — จากนั้นจะฝึกฝนให้มีความแม่นยำสูงสุดโดยแยกออกจากกัน ซึ่งบางครั้งก็เร็วกว่าเครือข่ายเดิมที่มีความหนาแน่นสูง พวกเขาระบุตั๋วผ่าน 'การตัดขนาดซ้ำ': ฝึก ตัดน้ำหนักขนาดที่เล็กที่สุด กรอกลับส่วนที่เหลือเป็นค่าเริ่มต้น แล้วทำซ้ำ ผลลัพธ์ที่ได้บอกเป็นนัยว่าการกำหนดพารามิเตอร์มากเกินไปที่มีความหนาแน่นส่วนใหญ่ช่วยให้การปรับให้เหมาะสมค้นหาโครงสร้างที่กระจัดกระจายที่ดี ไม่ใช่ว่าน้ำหนักทั้งหมดเหล่านั้นจำเป็นแยกกัน

ข้อมูลเชิงลึกทางเทคนิค

ขั้นตอนหลักคือการตัดขนาดซ้ำด้วยการกรอกลับน้ำหนัก: หลังการฝึก ให้นำตุ้มน้ำหนักที่มีขนาดต่ำสุดออก รีเซ็ตตุ้มน้ำหนักที่เหลือเป็นค่าเริ่มต้น (หรือจุดตรวจสอบการฝึกขั้นต้น หรือการปรับแต่งที่เรียกว่า 'การกรอกลับ') จากนั้นจึงฝึกใหม่ การรวมกันของมาสก์แบบกระจัดกระจายเฉพาะและการกำหนดค่าเริ่มต้นที่ตรงกันคือสิ่งที่ทำให้ตั๋ว 'ชนะ' - การเริ่มต้นมาสก์เดิมซ้ำแบบสุ่มจะทำลายเอฟเฟกต์

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตของสมมติฐานตั๋วลอตเตอรี

ตั๋วลอตเตอรีกระตุ้นให้เกิดการวิจัยเกี่ยวกับการฝึกอบรมเครือข่ายกระจัดกระจายตั้งแต่เริ่มต้นเพื่อประหยัดการประมวลผลและพลังงาน และดูว่าตั๋วมีการถ่ายโอนข้ามชุดข้อมูลและงานหรือไม่ การปรับขนาดการตัดซ้ำเป็นแบบจำลองพารามิเตอร์พันล้านยังคงมีราคาแพง ดังนั้นงานยังคงดำเนินต่อไปในการค้นหาตั๋วราคาถูกหรือพิสูจน์ว่ามีอยู่จริง (สมมติฐานตั๋วลอตเตอรีที่ 'แข็งแกร่ง' บอกว่าตั๋วมีอยู่ตั้งแต่เริ่มต้นโดยไม่มีการฝึกอบรมเลย) คาดหวังการเชื่อมโยงกับรุ่นอุปกรณ์ที่มีประสิทธิภาพและ AI สีเขียว

การใช้งานจริงในโลกแห่งความเป็นจริง

บีบอัดตัวแยกประเภทรูปภาพขนาดใหญ่ให้เหลือน้อยกว่า 20% ของน้ำหนักเพื่อปรับใช้บนโทรศัพท์โดยยังคงความแม่นยำไว้

เร่งการฝึกอบรมโดยการระบุและฝึกอบรมเฉพาะเครือข่ายย่อยที่ชนะอย่างกระจัดกระจาย

การศึกษาความสามารถในการถ่ายโอนน้ำหนักโดยการนำตั๋วที่พบในชุดข้อมูลหนึ่งกลับมาใช้ใหม่เพื่อเริ่มต้นการฝึกอบรมในชุดที่เกี่ยวข้อง

ลดพลังงานการอนุมานและหน่วยความจำในอุปกรณ์เอดจ์โดยจัดส่งตั๋วที่ชนะการตัดออกแทนโมเดลที่มีความหนาแน่นสูง

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่ซึ่งสมมติฐานเกี่ยวกับสลากลอตเตอรี่ช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Lottery Ticket Hypothesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การฝึกอบรมเพื่อประสิทธิภาพการประมวลผลของ Chinchilla

คำถามที่พบบ่อย

What is Lottery Ticket Hypothesis?

สมมติฐานตั๋วลอตเตอรีกล่าวว่าภายในเครือข่ายประสาทเทียมขนาดใหญ่ที่เริ่มต้นแบบสุ่มจะซ่อนเครือข่ายย่อยขนาดเล็กที่เรียกว่า 'ตั๋วที่ชนะ' ซึ่งได้รับการฝึกฝนเพียงอย่างเดียวจากน้ำหนักเริ่มต้นเดียวกัน สามารถจับคู่ความแม่นยำของเครือข่ายทั้งหมดได้ มันสำคัญเพราะมันบ่งบอกว่าเรากำลังฝึกพารามิเตอร์มากกว่าที่เราต้องการจริงๆ

'ตั๋วที่ชนะ' ในสมมติฐานนี้คืออะไร

ตั๋วที่ชนะคือเครือข่ายย่อยขนาดเล็กซึ่งเมื่อฝึกแยกจากน้ำหนักเริ่มต้นเดียวกัน จะได้ความแม่นยำที่เทียบได้กับเครือข่ายหนาแน่น

เหตุใดการฝึกอบรมเครือข่ายย่อยที่ถูกตัดแต่งจึงมักจะล้มเหลว เว้นแต่ว่าคุณจะทำอะไรพิเศษ

ข้อมูลเชิงลึกที่สำคัญคือมาสก์แบบกระจายจะทำงานเมื่อจับคู่กับการกำหนดค่าเริ่มต้นที่ตรงกันเท่านั้น การเริ่มต้นใหม่แบบสุ่มจะทำลายมัน

ใครเป็นผู้เสนอสมมติฐานตั๋วลอตเตอรี?

Jonathan Frankle และ Michael Carbin แนะนำสมมติฐานในรายงานของ MIT ปี 2018

ใช้เทคนิคอะไรในการหาตั๋วที่ชนะ?

การตัดขนาดซ้ำๆ จะฝึกซ้ำๆ ลบตุ้มน้ำหนักที่มีขนาดน้อยที่สุด และกรอกลับส่วนที่เหลือกลับเป็นค่าเริ่มต้น

สมมติฐานนี้แนะนำอะไรเกี่ยวกับเครือข่ายที่มีพารามิเตอร์เกินขนาดใหญ่

การค้นพบนี้บอกเป็นนัยถึงการกำหนดพารามิเตอร์มากเกินไปช่วยในการค้นหาเครือข่ายย่อยแบบกระจัดกระจายที่สามารถฝึกได้ แทนที่จะต้องมีน้ำหนักทุกอย่างที่จำเป็น