คู่มือทางเทคนิค

ตารางการอุ่นเครื่องและการหลอมโคไซน์

การอุ่นเครื่องค่อยๆ เพิ่มอัตราการเรียนรู้จากใกล้ศูนย์ก่อนการฝึก จากนั้นการอบอ่อนโคไซน์จะสลายกลับลงมาอย่างราบรื่นตามเส้นโค้งโคไซน์

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

ทั้งสองสิ่งนี้ช่วยเสถียรการฝึกในช่วงแรกและได้ความแม่นยําสุดท้ายที่ดีกว่า ซึ่งเป็นเหตุผลว่าทําไมหม้อแปลงสมัยใหม่เกือบทุกตัวจึงถูกฝึกแบบนี้

เจาะลึก

เมื่อการฝึกเริ่มต้น น้ำหนักของโมเดลจะเป็นแบบสุ่มและการไล่ระดับสีอาจมีขนาดใหญ่ ดังนั้นการกระโดดตรงไปยังอัตราการเรียนรู้ที่สูงมักจะทำให้เกิดการสูญเสียที่เพิ่มขึ้นหรือความแตกต่าง โดยเฉพาะอย่างยิ่งกับเครื่องมือเพิ่มประสิทธิภาพแบบปรับตัว เช่น Adam ซึ่งการประมาณค่าความแปรปรวนไม่น่าเชื่อถือในขั้นตอนแรก การอุ่นเครื่องแก้ไขปัญหานี้โดยการเพิ่มอัตราเชิงเส้นเป็นเส้นตรงตั้งแต่สองสามร้อยก้าวไปจนถึงสองสามพันก้าว เมื่อแบบจำลองอยู่บนฐานที่มั่นคง การอบอ่อนด้วยโคไซน์จะเข้ามาแทนที่ โดยจะมีอัตราการสลายเป็น 0.5 * (1 + cos(pi * t / T)) ของจุดสูงสุด รูปร่างโคไซน์จะรักษาอัตราให้สูงตั้งแต่เนิ่นๆ เพื่อความก้าวหน้าที่รวดเร็ว จากนั้นค่อยๆ ลดลงเพื่อให้เครื่องมือเพิ่มประสิทธิภาพสามารถตั้งค่าให้อยู่ในระดับต่ำสุดที่ดีแทนที่จะเด้งไปรอบๆ

ข้อมูลเชิงลึกทางเทคนิค

การหลอมโคไซน์จะปรับอัตราการเรียนรู้ 0.5 * (1 + cos(pi * t / T)) โดยที่ t คือขั้นตอนปัจจุบัน และ T คือผลรวม สิ่งนี้ใช้เวลานานใกล้กับอัตราสูงสุด สลายตัวเร็วที่สุดตรงกลาง จากนั้นแบนลงใกล้ศูนย์ในตอนท้าย ไม่เหมือนการสลายเชิงเส้นตรง โดยทั่วไปการวอร์มอัพจะเป็นเส้นตรงและสั้น เส้นโค้งที่รวมกันดูเหมือนเนินเขาเรียบ: ขึ้นไปที่ราบสูง จากนั้นร่อนอย่างนุ่มนวลจนเกือบเป็นศูนย์

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการวอร์มอัพและการหลอมโคไซน์

Warmup-plus-cosine ยังคงเป็นสูตรเริ่มต้นสำหรับโมเดลภาษาขนาดใหญ่ แต่รูปแบบต่างๆ กำลังแพร่กระจาย Warmup-stable-decay (WSD) จะรักษาอัตราคงที่ จากนั้นจะลดลงอย่างรวดเร็วในตอนท้าย ทำให้ง่ายต่อการขยายการวิ่งโดยไม่ต้องกำหนดความยาวคงที่อีกครั้ง นักวิจัยยังกำลังศึกษาว่าเหตุใดการวอร์มอัพจึงได้ผล โดยเชื่อมโยงกับสัญญาณรบกวนแบบไล่ระดับและความโค้งที่สูญเสียไปของแนวนอน และเครื่องมือต่างๆ จะปรับความยาวการวอร์มอัพและอัตราสูงสุดโดยอัตโนมัติมากขึ้น ซึ่งช่วยลดการลองผิดลองถูกแบบแมนนวลซึ่งครอบงำอยู่ในปัจจุบัน

การใช้งานจริงในโลกแห่งความเป็นจริง

โมเดลภาษาสไตล์ GPT และสไตล์ BERT ใช้การวอร์มอัพเชิงเส้นในช่วง ~1-2% แรกของขั้นตอนแรก ตามด้วยการสลายตัวของโคไซน์จนใกล้ศูนย์

Vision Transformers (ViT) ฝึกฝนด้วยการหลอมโคไซน์และการวอร์มอัพระยะสั้นเพื่อหลีกเลี่ยงความแตกต่างตั้งแต่เนิ่นๆ บน ImageNet

Hugging Face Transformers เสนอ `get_cosine_schedule_with_warmup` เป็นตัวกำหนดเวลาบรรทัดเดียวสำหรับการปรับแต่งงานอย่างละเอียด

การกระจายที่เสถียรและแบบจำลองการแพร่กระจายอื่นๆ ปรับแต่งอย่างละเอียดด้วยการวอร์มอัพ เพื่อป้องกันการระเบิดแบบเกรเดียนต์ เมื่อปรับตุ้มน้ำหนักที่ฝึกไว้ล่วงหน้า

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Warmup and Cosine Annealing Schedules quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การลดการรับรู้ความคมชัด

คำถามที่พบบ่อย

ตารางการอุ่นเครื่องและการอบคลอนโคไซน์คืออะไร?

การอุ่นเครื่องค่อยๆ เพิ่มอัตราการเรียนรู้จากใกล้ศูนย์ก่อนการฝึก จากนั้นการอบอ่อนโคไซน์จะสลายกลับลงมาอย่างราบรื่นตามเส้นโค้งโคไซน์ ทั้งสองอย่างนี้ช่วยรักษาเสถียรภาพของการฝึกอบรมตั้งแต่เนิ่นๆ และลดความแม่นยำขั้นสุดท้ายให้ดีขึ้น ซึ่งเป็นเหตุผลว่าทำไมหม้อแปลงสมัยใหม่เกือบทุกตัวจึงได้รับการฝึกฝนในลักษณะนี้

จุดประสงค์หลักของขั้นตอนการวอร์มอัพเมื่อเริ่มต้นการฝึกซ้อมคืออะไร?

การเริ่มต้นที่อัตราการเรียนรู้ที่สูงบนตุ้มน้ำหนักสุ่มอาจทำให้เกิดการสูญเสียที่เพิ่มขึ้นหรือความแตกต่างได้ ดังนั้นการอุ่นเครื่องจะเพิ่มอัตราขึ้นอย่างนุ่มนวลเพื่อให้ก้าวแรกๆ มีความเสถียร

การหลอมโคไซน์ทำให้อัตราการเรียนรู้ลดลงตามรูปร่างใด

อัตราจะถูกปรับขนาดเป็น 0.5 * (1 + cos(pi * t / T)) ทำให้เกิดเนินเรียบที่คงอยู่สูงตั้งแต่เนิ่นๆ และร่อนจนใกล้ศูนย์ในตอนท้าย

เครื่องมือเพิ่มประสิทธิภาพใดที่ได้รับประโยชน์เป็นพิเศษจากการอุ่นเครื่องเนื่องจากการประมาณค่าความแปรปรวนไม่น่าเชื่อถือตั้งแต่เนิ่นๆ

การประมาณค่าความแปรปรวนรันของอดัมขึ้นอยู่กับตัวอย่างเพียงไม่กี่ตัวอย่างในขั้นตอนแรก ซึ่งทำให้ขนาดขั้นตอนที่มีประสิทธิผลไม่แน่นอน การอุ่นเครื่องจะช่วยบรรเทาปัญหานี้

ในสูตรโคไซน์ T แทนค่าอะไร

T คือเส้นขอบฟ้าที่อัตราลดลงจากจุดสูงสุดจนถึงใกล้ศูนย์ t คือขั้นตอนปัจจุบันภายในขอบฟ้านั้น

ข้อดีอย่างหนึ่งของตัวแปร warmup-stable-decay (WSD) เหนือโคไซน์ที่มีความยาวคงที่คืออะไร

WSD คงอัตราคงที่แล้วค่อย ๆ ลดลงอย่างรวดเร็วในตอนท้าย ดังนั้นคุณจึงสามารถรักษาระยะคงที่ให้นานขึ้นและตัดสินใจเลือกจุดหยุดได้ในภายหลัง