คู่มือ AI ภาษา

รูปแบบความสนใจเบาบาง

ความสนใจที่เบาบางทำให้ Transformers ราคาถูกลงโดยปล่อยให้แต่ละโทเค็นเข้าร่วมกับชุดย่อยของโทเค็นอื่น ๆ ที่เลือกสรรมาอย่างดีเท่านั้น แทนที่จะสนใจทั้งหมด

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

This trades a little global reach for big savings in memory and compute on long sequences.

เจาะลึก

การเอาใจใส่ในตนเองอย่างเต็มที่จะเปรียบเทียบทุกโทเค็นกับโทเค็นอื่นๆ ดังนั้นต้นทุนจึงเพิ่มขึ้นตามความยาวลำดับกำลังสอง ซึ่งจะกลายเป็นปัญหาสำหรับเอกสารขนาดยาว ความสนใจที่เบาบางจะเข้ามาแทนที่รูปแบบที่หนาแน่นด้วยรูปแบบที่มีโครงสร้าง การออกแบบทั่วไปรวมถึงหน้าต่างบานเลื่อน (ท้องถิ่น) โดยที่แต่ละโทเค็นจะเห็นเฉพาะเพื่อนบ้านใกล้เคียง รูปแบบการก้าวหรือขยายที่ข้ามไปข้างหน้าเพื่อเข้าถึงบริบทที่ห่างไกลในราคาถูก และโทเค็นระดับโลก ตำแหน่งพิเศษสองสามตำแหน่งที่ดูแลทุกสิ่งและทุกสิ่งสนใจ โดยทำหน้าที่เป็นศูนย์กลางข้อมูล โมเดลต่างๆ เช่น Longformer, BigBird และ Sparse Transformer รวมสิ่งเหล่านี้เข้าด้วยกัน ดังนั้นจำนวนการเชื่อมต่อทั้งหมดจะเพิ่มขึ้นเป็นเส้นตรงแทนที่จะเป็นแบบกำลังสอง ทำให้มีบริบทตั้งแต่หลายพันถึงหมื่นโทเค็น

ข้อมูลเชิงลึกทางเทคนิค

แทนที่จะเป็นเมทริกซ์ความสนใจแบบ N-by-N แบบเต็ม ความสนใจแบบกระจัดกระจายจะคำนวณเฉพาะรายการที่เลือก ซึ่งมักจะเป็นการรวมกันของหน้าต่างในเครื่องและแถวและคอลัมน์ส่วนกลางจำนวนหนึ่ง BigBird พิสูจน์ให้เห็นแล้วว่าการรวมการเชื่อมต่อแบบสุ่ม หน้าต่าง และระดับโลกเข้าด้วยกัน ช่วยรักษาความหมายทางทฤษฎีของความสนใจอย่างเต็มที่ ในขณะเดียวกันก็ลดความซับซ้อนจาก O(N กำลังสอง) ไปสู่ ​​O(N) เคอร์เนลที่มีประสิทธิภาพจะข้ามรายการที่ปกปิดไว้ทั้งหมด แทนที่จะคำนวณแล้วทำให้เป็นศูนย์

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของรูปแบบความสนใจแบบกระจัดกระจาย

ความสนใจแบบกระจายยังคงเป็นศูนย์กลางของการสร้างแบบจำลองบริบทแบบยาว โดยจับคู่กับเคอร์เนลที่ได้รับการปรับปรุงประสิทธิภาพมากขึ้น เช่น FlashAttention และกับความกระจัดกระจายแบบเรียนรู้หรือไดนามิกที่จะเลือกโทเค็นที่จะดูแลต่ออินพุต เมื่อหน้าต่างบริบทขยายออกไปสู่โทเค็นนับล้าน สแต็กแบบไฮบริดจะผสมเลเยอร์ที่กระจัดกระจาย หนาแน่น และสถานะพื้นที่เข้าด้วยกัน คาดว่าจะมีเคอร์เนลกระจัดกระจายที่รับรู้ถึงฮาร์ดแวร์และความสนใจตามการกำหนดเส้นทางเพื่อลดค่าใช้จ่ายในการอ่านอินพุตที่ยาวมาก

การใช้งานจริงในโลกแห่งความเป็นจริง

Longformer ประมวลผลเอกสารทางวิทยาศาสตร์หรือเอกสารทางกฎหมายทั้งหมดในการผ่านครั้งเดียวโดยใช้หน้าต่างบานเลื่อนที่ได้รับความสนใจจากทั่วโลก

BigBird จัดการการตอบคำถามเอกสารยาวและลำดับจีโนมพร้อมความสนใจแบบปรับขนาดเชิงเส้น

การสรุปข้อความขนาดหนังสือโดยที่ความสนใจอย่างเต็มที่จะทำให้หน่วยความจำ GPU หมด

ระบบแชทแบบดึงข้อมูลและบริบทแบบยาวที่ใช้โทเค็นฮับส่วนกลางเพื่อกำหนดเส้นทางข้อมูลสำคัญไปยังโทเค็นนับพัน

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sparse Attention Patterns quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

Block-Sparse และ Native Sparse Attention

คำถามที่พบบ่อย

What is Sparse Attention Patterns?

ความสนใจที่เบาบางทำให้ Transformers ราคาถูกลงโดยปล่อยให้แต่ละโทเค็นเข้าร่วมกับชุดย่อยของโทเค็นอื่น ๆ ที่เลือกสรรมาอย่างดีเท่านั้น แทนที่จะสนใจทั้งหมด นี่เป็นการแลกเปลี่ยนการเข้าถึงทั่วโลกเพียงเล็กน้อยเพื่อการประหยัดหน่วยความจำได้มาก และการคำนวณในลำดับที่ยาว

เหตุใดการเอาใจใส่ตนเองอย่างเต็มที่จึงมีราคาแพงในลำดับที่ยาว?

ความสนใจอย่างเต็มที่จะเปรียบเทียบทุกโทเค็นกับโทเค็นอื่นๆ ทำให้ O(N กำลังสอง) มีค่าใช้จ่ายในด้านเวลาและหน่วยความจำ

ความสนใจของหน้าต่างบานเลื่อน (ท้องถิ่น) คืออะไร?

ความสนใจในท้องถิ่นจะจำกัดมุมมองของโทเค็นแต่ละรายการให้เหลือเพียงหน้าต่างคงที่ของโทเค็นโดยรอบ ซึ่งช่วยลดต้นทุนได้อย่างมาก

จุดประสงค์ของ 'โทเค็นระดับโลก' ในความสนใจกระจัดกระจายคืออะไร?

โทเค็นส่วนกลางบางส่วนเชื่อมต่อกับทุกตำแหน่ง ทำให้ข้อมูลไหลผ่านลำดับทั้งหมดได้ในราคาถูก

โมเดลใดพิสูจน์ให้เห็นว่าการรวมความสนใจแบบสุ่ม หน้าต่าง และระดับโลกเข้าด้วยกันช่วยให้แสดงความสนใจอย่างเต็มที่ได้

BigBird แสดงให้เห็นว่ารูปแบบกระจัดกระจายของมันเป็นตัวประมาณสากลของฟังก์ชันลำดับในขณะที่ปรับขนาดเป็นเส้นตรง

จำนวนการเชื่อมต่อมีขนาดประมาณเท่าใดในความสนใจแบบกระจัดกระจายที่ออกแบบมาอย่างดี

ด้วยการจำกัดการเชื่อมต่อไปยังหน้าต่างภายในเครื่องบวกกับลิงก์ร่วมบางส่วน การเชื่อมต่อทั้งหมดจะเพิ่มขึ้นเป็นเส้นตรง