คู่มือทางเทคนิค

การแก้ไขตำแหน่งสำหรับบริบทแบบยาว

การแก้ไขตำแหน่ง (PI) เป็นเทคนิคง่ายๆ ที่มีอิทธิพลซึ่งจะขยายหน้าต่างบริบทของ Transformer โดยการบีบดัชนีตำแหน่งใหม่ให้อยู่ในช่วงที่โมเดลทราบอยู่แล้ว

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Instead of extrapolating to unseen positions, it interpolates within trained ones, requiring only brief fine-tuning.

เจาะลึก

เปิดตัวโดยนักวิจัย Meta (Chen และคณะ) ในปี 2023 การแก้ไขตำแหน่งจะจัดการกับความจริงที่ว่าโมเดลที่มี RoPE ล้มเหลวอย่างหายนะเมื่อคาดการณ์ไปยังตำแหน่งที่อยู่นอกเหนือการฝึกอบรม ข้อมูลเชิงลึกนั้นขัดกับสัญชาตญาณ: แทนที่จะขอให้โมเดลจัดการค่าตำแหน่งที่มากขึ้นซึ่งไม่เคยเห็นมาก่อน PI จะแบ่งดัชนีตำแหน่งที่เข้ามาตามสเกลแฟคเตอร์ ดังนั้นความยาวเป้าหมาย เช่น แผนที่ 8K กลับไปสู่ช่วง 2K ดั้งเดิม เนื่องจากโมเดลได้รับการฝึกฝนในช่วงนั้น การหมุนเวียนจึงอยู่ในการกระจาย หลังจากปรับแต่งอย่างละเอียดเพียง 1,000 ขั้นตอน โมเดล LLaMA ก็ขยายออกไปในลักษณะนี้ โดยสามารถจัดการบริบทได้สูงสุดถึง 32K บทความวิจัยนี้แสดงให้เห็นว่าการประมาณค่าสามารถเพิ่มคะแนนความสนใจเป็นค่ามหาศาลได้ ในขณะที่การประมาณค่าจะทำให้ค่าเหล่านี้มีขอบเขตและมีเสถียรภาพ ซึ่งเป็นสาเหตุที่การประมาณค่าทำงานได้ดีกว่าการประมาณค่าอย่างมาก

ข้อมูลเชิงลึกทางเทคนิค

PI ปรับสเกลตำแหน่ง m เป็น m/s โดยที่ s คือปัจจัยส่วนขยาย (เช่น ความยาวใหม่หารด้วยความยาวเดิม) สำหรับ RoPE สิ่งนี้จะลดขั้นตอนการหมุนระหว่างตำแหน่งที่อยู่ติดกันอย่างมีประสิทธิภาพ และบรรจุตำแหน่งเพิ่มเติมไว้ในช่วงเชิงมุมที่ได้รับการฝึก ขอบเขตทางทฤษฎีในบทความนี้แสดงให้เห็นว่าคะแนนความสนใจที่สอดแทรกยังคงมีการควบคุมอย่างดี ในขณะที่การคาดการณ์แบบไร้เดียงสาสามารถสร้างลำดับความสำคัญของคะแนนที่ใหญ่กว่าสิ่งใดๆ ที่เห็นในการฝึกอบรม ซึ่งทำให้ softmax ไม่เสถียร

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการแก้ไขตำแหน่งสำหรับบริบทที่ยาว

การแก้ไขตำแหน่งกลายเป็นรากฐานสำหรับการติดตามผลจำนวนมาก รวมถึงการปรับขนาดที่รับรู้ NTK และ YaRN ซึ่งสอดแทรกอย่างคัดเลือกมากขึ้นเพื่อรักษารายละเอียดในท้องถิ่น วิถีโคจรมุ่งสู่วิธีการที่ต้องมีการปรับแต่งเพียงเล็กน้อยหรือไม่มีเลย และมุ่งสู่การอบการจัดการที่มีบริบทยาวนานเข้าสู่การฝึกล่วงหน้า PI ยังคงเป็นพื้นฐานที่มีคุณค่า และมักจะรวมกับรูปแบบการรับรู้ความถี่ที่ใหม่กว่าเพื่อเข้าถึงหน้าต่างบริบทมากกว่า 128,000 รายการอย่างมีประสิทธิภาพ

การใช้งานจริงในโลกแห่งความเป็นจริง

การขยายโมเดล LLaMA บริบท 2K เพื่อรองรับโทเค็น 8K-32K ด้วยขั้นตอนการปรับแต่งอย่างละเอียดประมาณ 1,000 ขั้นตอน

การปรับรูปแบบการแชทที่มีอยู่เพื่อการสรุปเอกสารขนาดยาวโดยไม่ต้องฝึกอบรมใหม่ตั้งแต่ต้น

ทำหน้าที่เป็นพื้นฐานทางแนวคิดที่การปรับขนาดที่รับรู้โดย NTK และ YaRN ได้รับการปรับปรุง

การเปิดใช้งานโค้ดบริบทแบบยาวหรือการวิเคราะห์เอกสารทางกฎหมายในโมเดลที่เดิมฝึกด้วยหน้าต่างแบบสั้น

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Positional Interpolation for Long Context quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การแก้ไขตำแหน่งสำหรับการขยายบริบท

คำถามที่พบบ่อย

What is Positional Interpolation for Long Context?

การแก้ไขตำแหน่ง (PI) เป็นเทคนิคง่ายๆ ที่มีอิทธิพลซึ่งจะขยายหน้าต่างบริบทของ Transformer โดยการบีบดัชนีตำแหน่งใหม่ให้อยู่ในช่วงที่โมเดลทราบอยู่แล้ว แทนที่จะคาดการณ์ไปยังตำแหน่งที่มองไม่เห็น มันจะสอดแทรกภายในตำแหน่งที่ได้รับการฝึก โดยต้องการการปรับแต่งแบบละเอียดเพียงช่วงสั้นๆ เท่านั้น

แนวคิดหลักเบื้องหลังการแก้ไขตำแหน่งคืออะไร

PI แบ่งดัชนีตำแหน่งด้วยสเกลแฟกเตอร์ ดังนั้นลำดับที่ยาวขึ้นจะแมปกลับไปสู่ช่วงตำแหน่งที่ได้รับการฝึก โดยรักษาการหมุนเวียนในการกระจาย

เหตุใดการคาดการณ์แบบไร้เดียงสาไปยังตำแหน่งที่ยาวกว่าจึงล้มเหลว

เอกสาร PI แสดงให้เห็นว่าตำแหน่งขนาดใหญ่ที่มองไม่เห็นสามารถสร้างลำดับความสำคัญของคะแนนความสนใจที่ใหญ่กว่าการฝึก ซึ่งทำให้ softmax ไม่เสถียร

PI ดั้งเดิมต้องมีการปรับแต่งอย่างละเอียดมากน้อยเพียงใดเพื่อขยาย LLaMA เป็น 32K

เอกสารรายงานว่าขั้นตอนการปรับแต่งประมาณ 1,000 ขั้นตอนก็เพียงพอที่จะขยายบริบทได้มากถึง 32,000 โทเค็น

หากคุณขยายบริบทด้วยปัจจัย s แล้ว PI จะแปลงตำแหน่ง m อย่างไร

PI จะปรับขนาดตำแหน่งจาก m เป็น m/s โดยบีบอัดช่วงที่ใหญ่ขึ้นใหม่ให้เหลือช่วงที่ฝึกดั้งเดิม

PI มีอิทธิพลต่อวิธีการในภายหลังเช่น YaRN อย่างไร

PI กำหนดการแก้ไขเป็นแนวทางที่ปลอดภัย การปรับขนาดที่รับรู้ NTK และ YaRN ปรับปรุงโดยการแก้ไขความถี่โดยเลือกสรรมากขึ้น