การแก้ไขตำแหน่งสำหรับการขยายบริบท
การแก้ไขตำแหน่ง (PI) เป็นเทคนิคที่ขยายหน้าต่างบริบทที่ใช้งานได้ของโมเดลภาษาให้ยาวเกินกว่าระยะเวลาการฝึก โดยปรับขนาดดัชนีตำแหน่งใหม่แทนที่จะคาดการณ์
ภาพรวม
It lets a model trained on, say, 2K or 4K tokens handle 32K or more with only light fine-tuning.
เจาะลึก
LLM สมัยใหม่ส่วนใหญ่ใช้การฝังตำแหน่งแบบหมุน (RoPE) ซึ่งเข้ารหัสตำแหน่งเป็นมุมการหมุนที่ใช้กับการสืบค้นและเวกเตอร์คีย์ หากคุณป้อนลำดับที่นานขึ้น โมเดลจะเห็นตำแหน่งและมุมการหมุนที่ไม่เคยฝึกมาก่อน และประสิทธิภาพจะลดลงเนื่องจากความสนใจคาดการณ์ได้ไม่ดีถึงความถี่ที่อยู่นอกช่วง การประมาณค่าตำแหน่งจะหลีกเลี่ยงการประมาณค่า: เพื่อขยายจากความยาว L ไปเป็นความยาว L' โดยจะแบ่งดัชนีตำแหน่งทั้งหมดด้วยตัวประกอบ L'/L โดยบีบช่วงใหม่กลับเข้าไปในช่วงเวลาที่ฝึก ขณะนี้โมเดลมองเห็นเฉพาะมุมในการกระจาย โดยเว้นระยะห่างให้หนาแน่นมากขึ้น การปรับแต่งสั้นๆ อย่างละเอียด (โดยปกติจะใช้เวลาสองสามร้อยถึงหนึ่งพันก้าว) ช่วยให้สามารถปรับให้เข้ากับระยะห่างที่ละเอียดยิ่งขึ้น ส่งผลให้มีพฤติกรรมบริบทแบบยาวที่มั่นคงโดยมีค่าใช้จ่ายเพียงเล็กน้อยในการฝึกล่วงหน้า
ข้อมูลเชิงลึกทางเทคนิค
RoPE หมุนคู่ขนาดที่ความถี่ที่ขยายละเอียดไปจนถึงหยาบ PI ปรับสเกลตำแหน่ง m เป็น m/s โดยที่ s = L'/L ดังนั้นมุมการหมุนจึงอยู่ภายในช่วงที่ฝึกแทนที่จะประมาณค่า รูปแบบการรับรู้ความถี่ เช่น NTK-aware scaling และ YaRN ก้าวไปอีกขั้น: โดยจะปรับขนาดความถี่ต่ำให้น้อยลงและความถี่สูงมากขึ้น (หรือประมาณค่าตามความยาวคลื่น) โดยคงรายละเอียดเฉพาะจุดความถี่สูงไว้ในขณะที่ขยายการเข้าถึงระยะไกลด้วยความถี่ต่ำ
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของการแก้ไขตำแหน่งสำหรับการขยายบริบท
ส่วนขยายบริบทกำลังดำเนินไปอย่างรวดเร็ว วิธีการต่างๆ เช่น การปรับสเกล RoPE ที่รับรู้ NTK, YaRN และ Dynamic/Long-RoPE ในขณะนี้ผลักดันหน้าต่างไปยังโทเค็นนับแสนหรือหลายล้านโทเค็น ซึ่งบางครั้งอาจมีการปรับแต่งเพียงเล็กน้อยหรือไม่มีเลย คาดว่าเทคนิคการปรับขนาดเหล่านี้จะถูกรวมเข้ากับความสนใจที่มีประสิทธิภาพและการบีบอัดแคช KV และจะกลายเป็นปุ่มมาตรฐานในการกำหนดค่าโมเดล การวิจัยยังคงรักษาความถูกต้องแม่นยำให้สูงตลอดทั้งหน้าต่าง ดังนั้นบริบทที่ยาวจึงสามารถใช้งานได้จริง ไม่ใช่แค่ได้รับการสนับสนุนในนามเท่านั้น
การใช้งานจริงในโลกแห่งความเป็นจริง
การขยายโมเดล LLaMA ที่ผ่านการฝึกอบรม 4K ไปเป็นบริบท 32K เพื่อสรุปเอกสารขนาดยาวหลังจากการปรับแต่งแบบละเอียดสั้นๆ
การโหลดโค้ดเบสทั้งหมดหรือสัญญาทางกฎหมายขนาดใหญ่ลงในพร้อมต์เดียวสำหรับการตอบคำถามแบบข้ามไฟล์
การใช้ NTK-aware หรือ YaRN มาตราส่วนเพื่อขยายบริบทด้วยการฝึกอบรมเพิ่มเติมเพียงเล็กน้อยหรือไม่มีเลย
ให้บริการประวัติการแชทที่ยาวนานโดยไม่มีการตัดทอนโดยปรับขนาดตำแหน่ง RoPE ในเวลาอนุมาน
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Position Interpolation for Context Extension quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
YaRN และการขยายความยาวบริบท
คำถามที่พบบ่อย
What is Position Interpolation for Context Extension?
การแก้ไขตำแหน่ง (PI) เป็นเทคนิคที่ขยายหน้าต่างบริบทที่ใช้งานได้ของโมเดลภาษาให้ยาวเกินกว่าระยะเวลาการฝึก โดยปรับขนาดดัชนีตำแหน่งใหม่แทนที่จะคาดการณ์ โดยปล่อยให้โมเดลที่ได้รับการฝึก เช่น โทเค็น 2K หรือ 4K จัดการได้ 32K ขึ้นไปด้วยการปรับแบบละเอียดเพียงเล็กน้อยเท่านั้น
แนวคิดหลักของการแก้ไขตำแหน่งคืออะไร
PI แบ่งดัชนีตำแหน่งตามปัจจัยส่วนขยาย โดยจับคู่ลำดับที่ยาวกว่ากลับลงในช่วงการกระจายที่แบบจำลองได้เรียนรู้ไปแล้ว
รูปแบบการเข้ารหัสตำแหน่งใดที่การแก้ไขตำแหน่งมีความเกี่ยวข้องมากที่สุด
PI ได้รับความนิยมสำหรับโมเดลที่ใช้ RoPE โดยปรับขนาดมุมการหมุนใหม่เพื่อให้คงอยู่ภายในความถี่ที่ได้รับการฝึก
เหตุใดการประมาณค่าแบบไร้เดียงสากับบริบทที่ยาวกว่าจึงมีแนวโน้มที่จะล้มเหลว
การป้อนลำดับที่นานขึ้นจะทำให้แบบจำลองอยู่ในมุมที่อยู่นอกระยะที่ยังไม่เคยฝึกมาก่อน ส่งผลให้ความสนใจและประสิทธิภาพลดลงอย่างรวดเร็ว
หากขยายความยาวบริบทจาก L เป็น L' PI พื้นฐานจะมีผลกับตำแหน่ง m อย่างไร
PI จับคู่ m ถึง m หารด้วยปัจจัย s = L'/L โดยบีบอัดช่วงที่ยาวกว่าให้เป็นช่วงการฝึกดั้งเดิม
การปรับขนาดที่รับรู้ NTK และ YaRN จะปรับปรุงในการแก้ไขตำแหน่งแบบธรรมดาได้อย่างไร
วิธีการเหล่านี้จะปรับขนาดความถี่ต่ำและความถี่สูงแตกต่างกัน โดยยังคงรักษารายละเอียดตำแหน่งท้องถิ่นที่ละเอียดในขณะที่ยังคงเข้าถึงบริบทที่ยาวขึ้น