คู่มือ AI ภาษา

การสร้างแบบจำลองบริบทแบบยาว

การสร้างแบบจำลองบริบทแบบยาวช่วยให้โมเดลภาษาสามารถอ่านและให้เหตุผลกับอินพุตจำนวนมากได้ในคราวเดียว ตั้งแต่หลายร้อยหน้าไปจนถึงโค้ดเบสทั้งหมด

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

สิ่งสำคัญคือเนื่องจากหน้าต่างบริบทที่ใหญ่ขึ้นจะเปลี่ยนสิ่งที่เป็นไปได้โดยไม่ต้องเรียกค้น ปรับแต่ง หรือแยกเอกสาร

เจาะลึก

หน้าต่างบริบทของโมเดลคือจำนวนโทเค็นสูงสุดที่สามารถเข้าร่วมได้ในการส่งผ่านครั้งเดียว รุ่นแรกๆ จัดการโทเค็นได้ไม่กี่พันอัน ระบบสมัยใหม่เข้าถึงหลายแสนหรือหลายล้านคน อุปสรรคสำคัญคือต้นทุนการเอาใจใส่ตนเองแบบมาตรฐานจะเพิ่มขึ้นเป็นสองเท่าตามความยาวของลำดับ ดังนั้นการเพิ่มอินพุตเป็นสองเท่าจะทำให้งานเพิ่มขึ้นเป็นสี่เท่า วิศวกรต่อสู้กับสิ่งนี้ด้วยการเข้ารหัสตำแหน่งที่ชาญฉลาดกว่า เช่น RoPE และเทคนิคการปรับขนาด ตัวแปรความสนใจ เช่น หน้าต่างบานเลื่อนและ FlashAttention และการจัดการหน่วยความจำที่ชาญฉลาด แต่หน้าต่างที่ยาวขึ้นไม่ได้ดีกว่าโดยอัตโนมัติ ปัญหา 'หลงทางตรงกลาง' แสดงให้เห็นว่าแบบจำลองมักจะเรียกคืนข้อมูลที่จุดเริ่มต้นและจุดสิ้นสุดของอินพุตแบบยาวได้อย่างน่าเชื่อถือมากกว่าข้อเท็จจริงที่ฝังไว้ตรงกลาง ดังนั้นความยาวดิบจะต้องจับคู่กับการเรียกคืนที่ใช้งานได้จริง

ข้อมูลเชิงลึกทางเทคนิค

การเอาใจใส่ในตนเองจะเปรียบเทียบทุกโทเค็นกับโทเค็นอื่นๆ โดยให้การคำนวณและหน่วยความจำ O(n กำลังสอง) ในลำดับความยาว n การปรับขนาดกำลังสองนั้นเป็นเหตุให้บริบทที่ยาวจึงมีราคาแพง FlashAttention ช่วยลดปัญหาคอขวดของหน่วยความจำด้วยการคำนวณแบบเรียงต่อกันที่รับรู้ IO ซึ่งหลีกเลี่ยงการเขียนเมทริกซ์ความสนใจแบบเต็มไปยังหน่วยความจำ ในขณะที่ความสนใจของหน้าต่างแบบเลื่อนจะจำกัดโทเค็นแต่ละรายการให้อยู่ในละแวกท้องถิ่น การฝังตำแหน่งแบบหมุน (RoPE) ซึ่งมักจะมีการประมาณค่า ทำให้แบบจำลองสามารถสรุปความยาวลำดับที่ยาวเกินกว่าที่ฝึกไว้ได้

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการสร้างแบบจำลองบริบทยาว

หน้าต่างบริบทจะเพิ่มขึ้นเรื่อยๆ แต่ขอบเขตกำลังเปลี่ยนจากความยาวที่แท้จริงไปสู่การใช้งานอย่างมีประสิทธิภาพ: การเรียกคืนบริบทกลางที่ดีขึ้น ต้นทุนต่อโทเค็นที่ลดลง และการให้เหตุผลที่เชื่อถือได้ทั่วทั้งหน้าต่าง คาดหวังการผสานรวมที่เข้มงวดยิ่งขึ้นกับการดึงข้อมูล ดังนั้นโมเดลจะดึงเฉพาะสิ่งที่สำคัญ บวกกับการแคชพร้อมท์ที่นำบริบทคงที่แบบยาวมาใช้ซ้ำในแบบสอบถามจำนวนมากในราคาถูก สถาปัตยกรรมที่ผสมผสานความสนใจเข้ากับโมเดลพื้นที่รัฐ เช่น Mamba มุ่งหวังที่จะจัดการกับลำดับที่ยาวมากด้วยการปรับขนาดแบบเกือบเชิงเส้น

การใช้งานจริงในโลกแห่งความเป็นจริง

วางสัญญาทั้ง 100 หน้าไว้ในพรอมต์เดียว และขอให้โมเดลแฟล็กทุกข้อที่ขัดแย้งกับนโยบายที่กำหนด

กำลังโหลดโค้ดเบสทั้งหมดหรือโมดูลขนาดใหญ่เพื่อให้โมเดลสามารถติดตามจุดบกพร่องในไฟล์จำนวนมากโดยไม่ต้องดึงข้อมูลทีละไฟล์ด้วยตนเอง

สรุปหนังสือทั้งเล่มหรือบันทึกการประชุมแบบยาวได้ในคราวเดียวโดยยังคงรักษาข้อมูลอ้างอิงให้สอดคล้องกันตลอด

ป้อนตั๋วสนับสนุนที่ผ่านมาหลายรายการในคราวเดียว เพื่อให้โมเดลตอบตั๋วใหม่พร้อมประวัติทั้งหมด

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Long-Context Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การแก้ไขตำแหน่งสำหรับบริบทแบบยาว

คำถามที่พบบ่อย

การสร้างแบบจำลองบริบทแบบยาวคืออะไร

การสร้างแบบจำลองบริบทแบบยาวช่วยให้โมเดลภาษาสามารถอ่านและให้เหตุผลกับอินพุตจำนวนมากได้ในคราวเดียว ตั้งแต่หลายร้อยหน้าไปจนถึงโค้ดเบสทั้งหมด สิ่งสำคัญคือเนื่องจากหน้าต่างบริบทที่ใหญ่ขึ้นจะเปลี่ยนสิ่งที่เป็นไปได้โดยไม่ต้องเรียกค้น ปรับแต่ง หรือแยกเอกสาร

'หน้าต่างบริบท' ของโมเดลหมายถึงอะไร

หน้าต่างบริบทคืองบประมาณโทเค็นที่โมเดลสามารถอ่านและเหตุผลพร้อมกันในการส่งต่อเพียงครั้งเดียว

เหตุใดการเอาใจใส่ตนเองแบบมาตรฐานจึงมีราคาแพงหากป้อนข้อมูลเป็นเวลานาน

การใส่ใจในตนเองจะเปรียบเทียบทุกโทเค็นกับโทเค็นอื่นๆ ดังนั้นต้นทุนจะปรับขนาดเป็น O(n กำลังสอง) ในความยาวลำดับ n

ปัญหา 'หลงทางกลาง' คืออะไร?

การศึกษาพบว่าความแม่นยำในการดึงข้อมูลเนื้อหาที่อยู่ตรงกลางบริบทที่ยาวลดลง ดังนั้นความยาวเพียงอย่างเดียวจึงไม่รับประกันว่าจะเรียกคืนได้

FlashAttention ปรับปรุงอะไรเป็นหลัก?

FlashAttention คำนวณความสนใจในไทล์โดยไม่สร้างเมทริกซ์ความสนใจแบบเต็มในหน่วยความจำ ซึ่งช่วยลดต้นทุนหน่วยความจำสำหรับลำดับที่ยาว

การฝังตำแหน่งแบบหมุน (RoPE) มีบทบาทอย่างไรในโมเดลที่มีบริบทยาว

RoPE เข้ารหัสข้อมูลตำแหน่งสัมพัทธ์และสามารถสอดแทรกได้ เพื่อให้โมเดลจัดการลำดับที่ยาวกว่าระยะเวลาการฝึก