การปรับขนาดหน้าต่างบริบท YaRN
YaRN (ยังมีส่วนขยาย RoPE อีกอันหนึ่ง) เป็นเทคนิคที่ขยายหน้าต่างบริบทที่ใช้งานได้ของหม้อแปลงให้ยาวเกินกว่าที่ได้รับการฝึกฝน โดยมีการปรับแต่งเพียงเล็กน้อย
ภาพรวม
It matters because it lets existing models handle much longer documents without retraining from scratch.
เจาะลึก
LLM สมัยใหม่ส่วนใหญ่เข้ารหัสตำแหน่งคำโดยใช้ Rotary Position Embeddings (RoPE) ซึ่งทำงานได้ดีตามความยาวที่แบบจำลองเห็นระหว่างการฝึกเท่านั้น ป้อนในลำดับที่ยาวขึ้นและแบบจำลองจะเสื่อมคุณภาพลงอย่างมาก YaRN แก้ปัญหานี้ด้วยการลดขนาดความถี่การหมุนของ RoPE ในลักษณะที่คำนึงถึงความถี่: ขนาดความถี่สูง (ซึ่งจับความสัมพันธ์ในท้องถิ่นและใกล้เคียง) ส่วนใหญ่ไม่ถูกแตะต้อง ในขณะที่ขนาดความถี่ต่ำ (ซึ่งจับตำแหน่งระยะไกล) จะถูกสอดแทรก นอกจากนี้ยังเพิ่มการปรับอุณหภูมิเพื่อดูแลให้ Logit มีพฤติกรรมที่ดีในระยะยาว ผลลัพธ์ที่ได้แสดงให้เห็นในโมเดล LLaMA ขยายบริบทจากโทเค็น 4K เป็น 64K-128K โดยใช้ข้อมูลการฝึกอบรมดั้งเดิมเพียงประมาณ 0.1% และขั้นตอนการปรับแต่งเพียงไม่กี่ร้อยขั้นตอน
ข้อมูลเชิงลึกทางเทคนิค
RoPE หมุนคิวรีและเวกเตอร์คีย์ตามมุมที่แปรผันตามตำแหน่งและความถี่ต่อมิติ การแก้ไขเชิงเส้นแบบไร้เดียงสา (การแก้ไขตำแหน่ง) จะบีบอัดความถี่ทั้งหมดเท่าๆ กัน ซึ่งส่งผลเสียต่อรายละเอียดในพื้นที่ YaRN จะใช้ 'NTK-by-parts' แทน: โดยจะประมาณค่าเฉพาะมิติความถี่ต่ำ (ความยาวคลื่นยาว) ปล่อยความถี่สูงไว้ตามลำพัง และลาดระหว่างมิติเหล่านั้น การปรับขนาดของอุณหภูมิความสนใจจะชดเชยการเปลี่ยนแปลงเอนโทรปี โดยคงความแม่นยำไว้ในระยะยาว
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของการปรับขนาดหน้าต่างบริบท YaRN
ส่วนขยายการรับรู้ความถี่แบบ YaRN ได้กลายเป็นองค์ประกอบเริ่มต้นสำหรับการจัดส่งโมเดลบริบทแบบยาว ตัวแปรและผู้สืบทอดยังคงปรากฏอยู่ในขณะที่ห้องแล็บผลักดันไปสู่หน้าต่างล้านโทเค็น คาดหวังการผสานรวมที่เข้มงวดยิ่งขึ้นพร้อมความสนใจที่มีประสิทธิภาพ การบีบอัดแคช KV และการปรับขนาดแบบไดนามิกที่ปรับเปลี่ยนได้ทันทีตามคำขอ แนวโน้มที่กว้างขึ้นคือการแยก 'ระยะเวลาในการฝึกแบบจำลอง' ออกจาก 'ระยะเวลาในการอ่านอย่างมีประโยชน์' ซึ่งทำให้บริบทที่ยาวเป็นคุณลักษณะหลังการฝึกอบรมที่ราคาถูก แทนที่จะเป็นความมุ่งมั่นทางสถาปัตยกรรมที่มีราคาแพง
การใช้งานจริงในโลกแห่งความเป็นจริง
การขยายโมเดล LLaMA แบบเปิดจากโทเค็น 4K เป็น 128K เพื่อให้สามารถนำเข้าโค้ดเบสทั้งหมดหรือสัญญาระยะยาวได้ในครั้งเดียว
ปล่อยให้แชทบอทเก็บประวัติการสนทนาที่ยาวมากโดยไม่ตัดทอนรอบก่อนหน้า
การสรุปเอกสารที่มีความยาวตามหนังสือหรือการถอดเสียงหลายชั่วโมงที่เกินหน้าต่างดั้งเดิมของโมเดลพื้นฐาน
การปรับโมเดลที่ได้รับการฝึกล่วงหน้าในราคาประหยัดสำหรับงานดึงข้อมูลบริบทแบบยาวโดยใช้การปรับแต่งแบบละเอียดเพียงเล็กน้อย
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
หน้าต่างบริบท
คำถามที่พบบ่อย
What is YaRN Context Window Scaling?
YaRN (ยังมีส่วนขยาย RoPE อีกอันหนึ่ง) เป็นเทคนิคที่ขยายหน้าต่างบริบทที่ใช้งานได้ของหม้อแปลงให้ยาวเกินกว่าที่ได้รับการฝึกฝน โดยมีการปรับแต่งเพียงเล็กน้อย สิ่งสำคัญคือช่วยให้โมเดลที่มีอยู่จัดการเอกสารได้นานขึ้นโดยไม่ต้องฝึกอบรมใหม่ตั้งแต่ต้น
YaRN ปรับเปลี่ยนรูปแบบการเข้ารหัสตำแหน่งใดเพื่อขยายความยาวบริบท
YaRN ย่อมาจาก 'Yet another RoPE extensioN' และทำงานโดยการลดขนาดความถี่การหมุนที่ใช้ในการฝังตำแหน่งแบบหมุน
YaRN จัดการกับมิติ RoPE ความถี่สูงและความถี่ต่ำอย่างไร
วิธีการ 'NTK-by-parts' ของ YaRN จะรักษามิติความถี่สูง (เฉพาะที่) ขณะเดียวกันก็สอดแทรกความถี่ต่ำ (ระยะไกล) เพื่อหลีกเลี่ยงไม่ให้รายละเอียดในพื้นที่เสียหาย
อะไรคือข้อได้เปรียบด้านประสิทธิภาพที่สำคัญของ YaRN เหนือการฝึกฝนโมเดลบริบทแบบยาวตั้งแต่เริ่มต้น?
YaRN สามารถขยายบริบทโดยใช้ข้อมูลการฝึกอบรมดั้งเดิมประมาณ 0.1% และขั้นตอนการปรับแต่งจำนวนเล็กน้อย ซึ่งถูกกว่าการฝึกอบรมซ้ำมาก
นอกจากการลดขนาดความถี่แล้ว YaRN ยังปรับใช้การปรับพิเศษอะไรบ้างเพื่อรักษาความสนใจในระยะยาวให้คงที่
YaRN ปรับเปลี่ยนอุณหภูมิความสนใจเพื่อชดเชยการเปลี่ยนแปลงเอนโทรปี/โลจิทที่เกิดขึ้นเมื่อลำดับใช้เวลานานกว่ามาก
จะเกิดปัญหาอะไรขึ้นหากคุณป้อนลำดับโมเดล RoPE นานกว่าการฝึกโดยไม่มีการปรับขนาดใดๆ
RoPE โดยทั่วไปตำแหน่งยาวไม่ดีหรือมองไม่เห็น ดังนั้นคุณภาพจึงลดลงเว้นแต่ความถี่จะถูกปรับสเกลใหม่