หน้าต่างบานเลื่อนความสนใจ
ความสนใจของหน้าต่างบานเลื่อนจะจำกัดโทเค็นแต่ละรายการให้เข้าร่วมเฉพาะโทเค็นใกล้เคียงที่มีขนาดคงที่ แทนที่จะเป็นลำดับทั้งหมด
ภาพรวม
This cuts the quadratic cost of standard attention down to linear, making long-context models far cheaper to run.
เจาะลึก
การเอาใจใส่ตนเองแบบมาตรฐานจะเปรียบเทียบทุกโทเค็นกับโทเค็นอื่นๆ ดังนั้นลำดับความยาว N จึงต้องการเปรียบเทียบแบบ N-squared อย่างคร่าว ๆ ความสนใจของหน้าต่างบานเลื่อนจะแก้ไขปัญหานี้โดยให้แต่ละโทเค็นมีหน้าต่างขนาด W (เช่น 4,096 โทเค็น) และดูแลเฉพาะเพื่อนบ้านภายในหน้าต่างนั้นเท่านั้น ต้นทุนเพิ่มขึ้นเป็น N คูณ W แทนที่จะเป็น N-squared สิ่งสำคัญที่สุดคือ การวางซ้อนเลเยอร์ที่มีหน้าต่างจำนวนมากจะขยายฟิลด์รับที่มีประสิทธิภาพ: หลังจากเลเยอร์ L แล้ว ข้อมูลสามารถแพร่กระจายผ่านโทเค็น L คูณ W ประมาณได้ เช่นเดียวกับฟิลด์เปิดรับที่เพิ่มขึ้นของ CNN Mistral 7B ทำให้สิ่งนี้เป็นที่นิยมด้วยหน้าต่างโทเค็น 4,096 โทเค็นใน 32 เลเยอร์ ซึ่งถึงช่วงโทเค็นทางทฤษฎีที่ 131,000 โทเค็น โมเดลมักจะผสมเลเยอร์ที่มีหน้าต่างกับเลเยอร์ที่มีความสนใจเต็มรูปแบบเป็นครั้งคราว เพื่อรักษาลิงก์ระยะไกล
ข้อมูลเชิงลึกทางเทคนิค
ในหน้าต่างความสนใจ การสืบค้นที่ตำแหน่ง i ได้รับอนุญาตให้ดูเฉพาะคีย์จากตำแหน่ง i ลบ W บวก 1 ถึง i (ตัวพิมพ์เชิงสาเหตุ) มาสก์แบบกระจัดกระจายนี้หมายความว่าแคช KV ต้องการเพียงโทเค็น W สุดท้ายต่อเลเยอร์ ซึ่งจะทำให้หน่วยความจำเสียหายระหว่างการสร้าง เนื่องจากหน้าต่างจะเปลี่ยนไปตามโทเค็นใหม่แต่ละรายการ จึงจับคู่กับแคชบัฟเฟอร์แบบต่อเนื่องซึ่งจะเขียนทับรายการที่เก่าที่สุดแทนที่จะเติบโตตลอดไป
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของความสนใจหน้าต่างบานเลื่อน
การออกแบบแบบไฮบริดในขณะนี้แทรกเลเยอร์ระดับโลกหรือเลเยอร์ที่ให้ความสนใจเต็มรูปแบบสองสามชั้นเข้ากับเลเยอร์หน้าต่างบานเลื่อนหลายชั้น ทำให้ประสิทธิภาพสมดุลกับการให้เหตุผลระยะยาวที่แท้จริง Gemma 2 และบล็อกอื่น ๆ สลับบล็อกระดับท้องถิ่นและระดับโลก คาดว่าความสนใจของหน้าต่างจะรวมกับโมเดลพื้นที่สถานะ อ่างล้างจาน และการบีบอัดแคช KV เพื่อให้โมเดลชายแดนจัดการบริบทล้านโทเค็นโดยไม่มีหน่วยความจำที่ควบคุมไม่ได้ มันกำลังกลายเป็นองค์ประกอบเริ่มต้นแทนที่จะเป็นการปรับให้เหมาะสมที่แปลกใหม่
การใช้งานจริงในโลกแห่งความเป็นจริง
Mistral 7B ใช้หน้าต่างเลื่อน 4,096 โทเค็นข้ามเลเยอร์เพื่อจัดการกับคำสั่งที่ยาวในราคาถูกบน GPU สำหรับผู้บริโภค
Longformer ใช้ Windowed Attention บวกกับโทเค็นส่วนกลางบางส่วนเพื่อจัดประเภทและสรุปเอกสารที่มีหลายหน้า
Gemma 2 สลับเลเยอร์หน้าต่างบานเลื่อนในพื้นที่กับเลเยอร์ที่ดึงดูดความสนใจทั่วโลกเพื่อสร้างสมดุลระหว่างความเร็วและการเรียกคืนระยะไกล
แคช KV แบบโรลลิ่งบัฟเฟอร์ในผู้ช่วยแชทจะเก็บเฉพาะหน้าต่างโทเค็นล่าสุดเท่านั้น โดยจำกัดหน่วยความจำในระหว่างการสนทนาที่ยาวนาน
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Sliding Window Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ความสนใจแบบสอบถามแบบกลุ่ม
คำถามที่พบบ่อย
What is Sliding Window Attention?
ความสนใจของหน้าต่างบานเลื่อนจะจำกัดโทเค็นแต่ละรายการให้เข้าร่วมเฉพาะโทเค็นใกล้เคียงที่มีขนาดคงที่ แทนที่จะเป็นลำดับทั้งหมด วิธีนี้จะลดต้นทุนกำลังสองของความสนใจมาตรฐานลงเหลือเพียงเชิงเส้น ทำให้โมเดลที่มีบริบทยาวถูกกว่ามากในการรัน
อะไรคือประโยชน์หลักของการคำนวณความสนใจของหน้าต่างแบบเลื่อนมากกว่าการเอาใจใส่ตนเองแบบมาตรฐาน?
ด้วยการจำกัดแต่ละโทเค็นไว้ที่หน้าต่างคงที่ของเพื่อนบ้าน W ราคาจะเพิ่มขึ้นเป็น N คูณ W (เส้นตรงใน N) แทนที่จะเป็น N-squared
ในการออกแบบของ Mistral 7B ข้อมูลสามารถเดินทางได้ไกลเกินกว่าหน้าต่างโทเค็น 4,096 โทเค็นเพียงหน้าต่างเดียวได้อย่างไร
เช่นเดียวกับ CNN แต่ละเลเยอร์จะผลักข้อมูลออกไปอีกหนึ่งหน้าต่าง ดังนั้นเลเยอร์ L จึงมีช่วงที่มีประสิทธิภาพประมาณ L คูณ W โทเค็น
เหตุใดความสนใจของหน้าต่างบานเลื่อนจึงลดหน่วยความจำระหว่างการสร้างข้อความ
เนื่องจากโทเค็นจะเข้าร่วมเฉพาะหน้าต่างล่าสุดเท่านั้น รายการคีย์/ค่าที่เก่ากว่าจึงสามารถละทิ้งได้ โดยมักจะผ่านแคชบัฟเฟอร์แบบกลิ้ง
โมเดลอย่าง Gemma 2 มีตัวเลือกการออกแบบแบบใดร่วมกับหน้าต่างบานเลื่อนเพื่อให้เหตุผลในระยะยาว
การผสมเลเยอร์ระดับโลก/การเอาใจใส่เต็มรูปแบบเป็นครั้งคราวระหว่างเลเยอร์ในท้องถิ่นจะรักษาการเชื่อมต่อระยะไกลที่แท้จริงซึ่งหน้าต่างที่แท้จริงจะอ่อนลง
สำหรับหน้าต่างบานเลื่อนสาเหตุขนาด W คีย์ใดที่สามารถสอบถามในตำแหน่งที่ฉันเข้าร่วมได้
ในกรณีที่เป็นสาเหตุ แบบสอบถามมองเห็นตัวเองและโทเค็น W ลบ 1 ทันทีก่อนหน้านั้น จะไม่มีโทเค็นในอนาคต