คู่มือทางเทคนิค

การจัดตารางอัตราการเรียนรู้

ตารางอัตราการเรียนรู้จะเปลี่ยนขนาดขั้นตอนระหว่างการฝึกแทนที่จะคงไว้ตายตัว

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Getting it right is often the single biggest lever for whether a model converges quickly and reaches high accuracy.

เจาะลึก

อัตราการเรียนรู้จะควบคุมว่าเครื่องมือเพิ่มประสิทธิภาพจะใช้ขั้นตอนใหญ่เพียงใดในการอัปเดตแต่ละครั้ง สูงเกินไปและการฝึกฝนแตกต่าง ต่ำเกินไปและคลานหรือติดขัด การกำหนดเวลาจะปรับค่านี้เมื่อเวลาผ่านไป สูตรสมัยใหม่ทั่วไปคือการอุ่นเครื่องตามด้วยการสลายตัว โดยเริ่มจากใกล้ศูนย์และเพิ่มขึ้นในช่วงสองสามร้อยหรือพันก้าวแรก (ดังนั้นในช่วงแรก การไล่ระดับสีที่มีเสียงดังจะไม่ทำให้น้ำหนักที่ไม่เสถียรระเบิด) จากนั้นจึงค่อยๆ ลดลง รูปร่างการสลายที่ได้รับความนิยม ได้แก่ การสลายแบบขั้น (ลดลงตามปัจจัยในยุคที่กำหนด) การสลายแบบเอกซ์โปเนนเชียล และการหลอมโคไซน์ ซึ่งเคลื่อนตามเส้นโค้งครึ่งโคไซน์ได้อย่างราบรื่นจนถึงใกล้ศูนย์ ขณะนี้ตารางโคไซน์ที่มีการวอร์มอัพเชิงเส้นเป็นมาตรฐานสำหรับการฝึกโมเดลภาษาขนาดใหญ่ ในขณะที่นโยบายแบบวนรอบและรอบเดียวสามารถเร่งการฝึกโมเดลขนาดเล็กได้

ข้อมูลเชิงลึกทางเทคนิค

การอุ่นเครื่องมีความสำคัญเนื่องจากเครื่องมือเพิ่มประสิทธิภาพแบบปรับได้เช่น Adam มีการประมาณค่าช่วงวินาทีที่สองที่ไม่น่าเชื่อถือในขั้นตอนแรก อัตราการเรียนรู้เพียงเล็กน้อยจะหลีกเลี่ยงการทำให้น้ำหนักไม่เสถียรก่อนที่สถิติเหล่านั้นจะยุติลง ชุดการหลอมโคไซน์ lr = lr_min + 0.5 * (lr_max - lr_min) * (1 + cos(pi * t / T)) ให้ความคืบหน้าอย่างรวดเร็วตั้งแต่เนิ่นๆ และขั้นตอนเล็กๆ ที่ปรับแต่งอย่างละเอียดใกล้ถึงจุดสิ้นสุด ตารางบางรายการเพิ่มการรีสตาร์ทอย่างอบอุ่น โดยกระโดดอัตรากลับขึ้นไปเพื่อหลีกหนีจากจุดต่ำสุดที่คมชัด

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการจัดตารางอัตราการเรียนรู้

ในขณะที่การฝึกซ้อมมีราคาแพงขึ้น กำหนดการก็ได้รับการออกแบบร่วมกับเครื่องมือเพิ่มประสิทธิภาพและขนาดชุดงาน และนักวิจัยก็ศึกษากฎการปรับขนาดเพื่อคาดการณ์อัตราสูงสุดที่ดีที่สุดก่อนการฝึก เครื่องมือเพิ่มประสิทธิภาพแบบไม่มีกำหนดการซึ่งขจัดความจำเป็นในการเลือกเส้นโค้งที่ลดลงล่วงหน้ากำลังได้รับแรงผลักดัน และกำหนดการที่ขับเคลื่อนด้วยข้อเสนอแนะที่ปรับเปลี่ยนได้ซึ่งตอบสนองต่อกราฟการสูญเสียที่เกิดขึ้นจริงอาจลดการลองผิดลองถูกที่ยังคงครอบงำการฝึกอบรมขนาดใหญ่

การใช้งานจริงในโลกแห่งความเป็นจริง

การวอร์มอัพเชิงเส้นบวกกับการสลายตัวของโคไซน์ ใช้ในการฝึกโมเดลภาษาของหม้อแปลงล่วงหน้า

การสลายขั้นตอนที่ลดอัตราการเรียนรู้ 10 เท่าในยุค 30, 60 และ 90 เมื่อฝึกตัวแยกประเภทรูปภาพบน ImageNet

นโยบายรอบเดียวใน fast.ai เพื่อฝึกโมเดลให้มีความแม่นยำที่ดีในยุคน้อยมาก

การหลอมโคไซน์ด้วยการรีสตาร์ทอย่างอบอุ่นเพื่อหลีกเลี่ยงการสูญเสียขั้นต่ำอย่างรวดเร็วและปรับปรุงลักษณะทั่วไป

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Learning Rate Scheduling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

อัตราการเรียนรู้แบบวัฏจักร

คำถามที่พบบ่อย

What is Learning Rate Scheduling?

ตารางอัตราการเรียนรู้จะเปลี่ยนขนาดขั้นตอนระหว่างการฝึกแทนที่จะคงไว้ตายตัว การทำให้ถูกต้องมักเป็นปัจจัยสำคัญที่สุดเพียงอย่างเดียวในการพิจารณาว่าแบบจำลองจะรวมตัวกันอย่างรวดเร็วและมีความแม่นยำสูงหรือไม่

จุดประสงค์ของระยะ 'วอร์มอัพ' ในตารางอัตราการเรียนรู้คืออะไร

การวอร์มอัพเริ่มต้นใกล้ศูนย์และเพิ่มอัตราเพื่อให้การอัปเดตล่วงหน้าที่ไม่เสถียรไม่ทำให้โมเดลไม่เสถียรก่อนที่สถิติของเครื่องมือเพิ่มประสิทธิภาพจะได้รับการแก้ไข

กำหนดการใดที่เป็นไปตามเส้นโค้งครึ่งโคไซน์ได้อย่างราบรื่นจนถึงอัตราขั้นต่ำ

การหลอมโคไซน์จะสลายอัตราการเรียนรู้ตามรูปร่างครึ่งโคไซน์ ทำให้มีขั้นตอนใหญ่ในช่วงต้นและขั้นตอนเล็ก ๆ ใกล้ถึงจุดสิ้นสุด

จะเกิดอะไรขึ้นหากอัตราการเรียนรู้ตั้งไว้สูงเกินไป

อัตราที่สูงเกินไปทำให้เกิดการโอเวอร์ชูต ดังนั้นการขาดทุนอาจเด้งกลับหรือระเบิดขึ้นแทนที่จะยุติลง

การสลายตัวของขั้นตอนทำอะไรกับอัตราการเรียนรู้?

การสลายตัวของขั้นจะคูณอัตราด้วยปัจจัย (เช่น 0.1) ที่เหตุการณ์สำคัญที่เลือก ทำให้เกิดรูปแบบบันได

เหตุใดบางครั้งจึงมีการเพิ่ม 'การรีสตาร์ทแบบวอร์ม' ลงในกำหนดการ

การรีสตาร์ทแบบวอร์มจะเพิ่มอัตราการเรียนรู้สำรองตามช่วงเวลา ช่วยให้เครื่องมือเพิ่มประสิทธิภาพเคลื่อนออกจากจุดต่ำสุดที่แคบและสำรวจโซลูชันที่ดีกว่า