RMSNorm และการทำให้เป็นมาตรฐานก่อนเลเยอร์
RMSNorm เป็นเลเยอร์การทำให้เป็นมาตรฐานแบบน้ำหนักเบาซึ่งจะปรับขนาดการเปิดใช้งานใหม่ตามกำลังสองเฉลี่ยของราก และการทำให้เป็นมาตรฐานในชั้นก่อนจะวางขั้นตอนนั้นไว้ก่อนหน้าแต่ละชั้นย่อยแทนที่จะเป็นหลัง
ภาพรวม
Together they make deep transformers train stably without warmup tricks.
เจาะลึก
Standard LayerNorm ลบค่าเฉลี่ยแล้วหารด้วยค่าเบี่ยงเบนมาตรฐานทั่วเวกเตอร์คุณลักษณะ จากนั้นใช้สเกลและการเปลี่ยนแปลงที่เรียนรู้ RMSNorm ซึ่งแนะนำโดย Zhang และ Sennrich ในปี 2019 ลดการเฉลี่ยเป็นศูนย์กลางและอคติทั้งหมด: เพียงหารเวกเตอร์แต่ละตัวด้วยรากกำลังสองเฉลี่ยขององค์ประกอบ และคูณด้วยการเรียนรู้ที่เพิ่มขึ้นต่อคุณสมบัติ การดำเนินการนี้จะลบสถิติหนึ่งรายการและการดำเนินการหลายอย่างออก โดยตัดการประมวลผลประมาณ 10-50% ในเลเยอร์ปกติในขณะที่มีความแม่นยำตรงกัน การวางตำแหน่ง 'Pre-LN' แยกจากกัน (บรรทัดฐานก่อนความสนใจ/MLP โดยมีเส้นทางที่เหลือสะอาดรอบๆ) จะรักษาขนาดการไล่ระดับสีไว้ที่ขอบเขตการเริ่มต้น ดังนั้นโมเดลต่างๆ เช่น GPT-3, LLaMA และ PaLM ฝึกฝนโดยไม่ต้องแฮ็กการวอร์มอัพอัตราการเรียนรู้ที่ต้องใช้หม้อแปลง Post-LN ดั้งเดิม
ข้อมูลเชิงลึกทางเทคนิค
สำหรับเวกเตอร์ x ของมิติ d นั้น RMSNorm จะคำนวณ x_i * g_i / sqrt((1/d) * sum(x_j^2) + epsilon) โดยที่ g คือเวกเตอร์เกนที่เรียนรู้ ไม่มีการลบค่าเฉลี่ยและไม่มีอคติ เนื่องจากกระแสที่ตกค้างในบล็อก Pre-LN ข้ามการทำให้เป็นมาตรฐาน เส้นทางข้อมูลประจำตัวจึงยังคงไม่ถูกแตะต้อง และการไล่ระดับสีจะไหลโดยตรงจากเอาต์พุตไปยังอินพุต ซึ่งเป็นเหตุผลว่าทำไมสแต็กที่ลึกมากมาบรรจบกัน
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของ RMSNorm และการปรับให้เป็นมาตรฐานแบบพรีเลเยอร์
ขณะนี้ RMSNorm เป็นค่าเริ่มต้นใน LLM แบบเปิดส่วนใหญ่ (LLaMA, Mistral, Qwen, Gemma) ดังนั้นคาดว่าจะยังคงเป็นมาตรฐาน การวิจัยกำลังปรับปรุงสูตร: QK-norm ใช้ RMSNorm กับข้อความค้นหาและคีย์เพื่อควบคุมการเติบโตของ Logit และแล็บบางแห่งรวมก่อนและหลังบรรทัดฐาน ('แซนวิช' หรือ 'peri-LN') เพื่อความเสถียรเป็นพิเศษในระดับล้านล้านพารามิเตอร์ เคอร์เนลของฮาร์ดแวร์จะหลอมรวมการทำงานเพื่อความรวดเร็ว
การใช้งานจริงในโลกแห่งความเป็นจริง
LLaMA, Mistral และ Qwen ล้วนแทนที่ LayerNorm ด้วย RMSNorm เพื่อลดการหน่วงเวลาของการอนุมานในทุกโทเค็น
Pre-LN ช่วยให้โมเดลสไตล์ GPT สามารถฝึกฝนได้โดยไม่ต้องวอร์มอัพอัตราการเรียนรู้ที่จำเป็นต้องใช้หม้อแปลง Post-LN ปี 2017
การทำให้เป็นมาตรฐานของ QK ใช้ RMSNorm ในการสืบค้นและคีย์เพื่อหยุดการบันทึกไม่ให้ระเบิดในโมเดลขนาดใหญ่
หม้อแปลงเคลื่อนที่และเอดจ์ใช้ RMSNorm เนื่องจากการลดค่าเฉลี่ยและความลำเอียงจะช่วยลดการรับส่งข้อมูลหน่วยความจำ
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the RMSNorm and Pre-Layer Normalization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การทำให้เป็นมาตรฐานของเลเยอร์
คำถามที่พบบ่อย
What is RMSNorm and Pre-Layer Normalization?
RMSNorm เป็นเลเยอร์การทำให้เป็นมาตรฐานแบบน้ำหนักเบาซึ่งจะปรับขนาดการเปิดใช้งานใหม่ตามกำลังสองเฉลี่ยของราก และการทำให้เป็นมาตรฐานในชั้นก่อนจะวางขั้นตอนนั้นไว้ก่อนหน้าแต่ละชั้นย่อยแทนที่จะเป็นหลัง พวกเขาช่วยกันทำให้หม้อแปลงไฟฟ้าลึกฝึกฝนได้อย่างเสถียรโดยไม่ต้องวอร์มอัพ
RMSNorm ละเว้นอะไรเมื่อเปรียบเทียบกับ LayerNorm มาตรฐาน
RMSNorm ข้ามการคำนวณและลบค่าเฉลี่ย โดยทำให้เป็นมาตรฐานด้วยกำลังสองเฉลี่ยรากของการเปิดใช้งานเท่านั้น
RMSNorm หารเวกเตอร์การเปิดใช้งานแต่ละรายการด้วยปริมาณเท่าใด
RMSNorm หารด้วย sqrt ของค่าเฉลี่ยขององค์ประกอบกำลังสอง เช่น ค่าเฉลี่ยรากกำลังสอง จากนั้นนำกำไรที่เรียนรู้ไปใช้
ประโยชน์หลักของการทำให้เป็นมาตรฐานก่อนเลเยอร์มากกว่าการทำให้เป็นมาตรฐานหลังเลเยอร์คืออะไร?
การวางบรรทัดฐานก่อนแต่ละเลเยอร์ย่อยด้วยเส้นทางที่เหลือที่สะอาดจะขอบเขตขนาดการไล่ระดับสี ทำให้ไม่จำเป็นต้องวอร์มอัพอัตราการเรียนรู้
ในบล็อก Pre-LN เส้นทางใดที่เลเยอร์การทำให้เป็นมาตรฐานจงใจปล่อยให้ไม่ถูกแตะต้อง?
Pre-LN ทำให้อินพุตเป็นเลเยอร์ย่อยเป็นมาตรฐาน แต่ทางลัดที่เหลือจะข้ามมันไป โดยรักษาทางหลวงลาดที่สะอาด
ตระกูลโมเดล open-weight สมัยใหม่ใดบ้างที่ใช้ RMSNorm เป็นค่าเริ่มต้น
RMSNorm กลายเป็นมาตรฐานใน LLaMA, Mistral, Qwen, Gemma และ LLM ล่าสุด