คู่มือทางเทคนิค

Block-Sparse และ Native Sparse Attention

ความสนใจแบบกระจายแบบบล็อกและแบบกระจายดั้งเดิมช่วยให้หม้อแปลงสามารถดูแลเฉพาะส่วนที่เกี่ยวข้องมากที่สุดของลำดับแบบยาว แทนที่จะเป็นโทเค็นทุกตัว ซึ่งช่วยลดต้นทุนกำลังสองของความสนใจแบบมาตรฐาน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

นี่คือสิ่งที่ทําให้โมเดลบริบทยาวที่มีประสิทธิภาพใช้งานได้จริงบนฮาร์ดแวร์จริง

เจาะลึก

การใส่ใจในตนเองแบบมาตรฐานจะเปรียบเทียบทุกโทเค็นกับโทเค็นอื่นๆ ดังนั้นต้นทุนจึงเพิ่มขึ้นแบบกำลังสองตามความยาวของลำดับ กลายเป็นสิ่งต้องห้ามสำหรับเอกสารที่ยาวมาก ความสนใจที่กระจัดกระจายจะจำกัดแต่ละโทเค็นให้อยู่เพียงชุดย่อยของโทเค็นอื่นๆ วิธีการบล็อกแบบกระจายจะแบ่งลำดับออกเป็นบล็อกและคำนวณความสนใจเฉพาะสำหรับคู่บล็อกที่เลือก ซึ่งจะแมปบนเทนเซอร์คอร์ของ GPU อย่างมีประสิทธิภาพ Native Sparse Attention (NSA) จาก DeepSeek ก้าวไปอีกขั้น: สามารถฝึกได้ตั้งแต่ต้นทางถึงปลายทางและปรับด้วยฮาร์ดแวร์ โดยรวมสามสาขา การบีบอัดโทเค็นแบบหยาบ การเลือกบล็อกที่สำคัญที่สุดอย่างละเอียด และหน้าต่างแบบเลื่อนสำหรับบริบทเฉพาะที่ เนื่องจากมีการเรียนรู้รูปแบบความกระจัดกระจายระหว่างการฝึกล่วงหน้า แทนที่จะยึดติดในภายหลัง NSA จึงรักษาความแม่นยำในขณะเดียวกันก็ทำการเร่งความเร็วจำนวนมากในลำดับที่ยาว

ข้อมูลเชิงลึกทางเทคนิค

NSA ประมวลผลคีย์และค่าผ่านเส้นทางคู่ขนานสามเส้นทาง จากนั้นผสานเข้ากับประตูที่เรียนรู้ การบีบอัดจะรวมบล็อกของโทเค็นไว้เป็นการแสดงข้อมูลสรุป บล็อกคะแนนการคัดเลือกและเก็บเฉพาะอันดับสูงสุดเพื่อความสนใจอย่างเต็มที่ หน้าต่างบานเลื่อนครอบคลุมโทเค็นที่อยู่ใกล้เคียง การดำเนินการระดับบล็อกสอดคล้องกับการเข้าถึงหน่วยความจำ GPU และทรูพุตเทนเซอร์คอร์ ดังนั้นการประหยัด FLOP ตามทฤษฎีจะแปลงเป็นการเร่งความเร็วนาฬิกาแขวนจริงในระหว่างการฝึกอบรมและการอนุมาน โดยเฉพาะอย่างยิ่งสำหรับขั้นตอนการถอดรหัสที่ผูกกับหน่วยความจำ

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของความสนใจแบบเบาบางแบบบล็อกและแบบพื้นเมือง

ความกระจัดกระจายที่รับรู้ถึงฮาร์ดแวร์ที่สามารถฝึกอบรมได้กำลังกลายเป็นเส้นทางสู่บริบทล้านโทเค็นโดยไม่ต้องเสียค่าใช้จ่ายมากนัก คาดหวังว่าความสนใจเพียงเล็กน้อยจะได้รับการออกแบบร่วมกับเคอร์เนลและตัวเร่งความเร็ว ผสมผสานกับแนวคิดความสนใจเชิงเส้นและอวกาศของรัฐ และนำมาใช้ในแบบจำลองบริบทและการใช้เหตุผลแบบชายแดน เมื่อรูปแบบสามารถเรียนรู้ได้และเป็นแบบไดนามิก โมเดลจะจัดสรรงบประมาณความสนใจตามการสืบค้น และเกณฑ์มาตรฐานจะวัดปริมาณงานการถอดรหัสในลำดับที่ยาวมากขึ้น ไม่ใช่แค่คุณภาพดิบเท่านั้น

การใช้งานจริงในโลกแห่งความเป็นจริง

การรันโมเดลบนโค้ดเบสทั้งหมดหรือสัญญาทางกฎหมายระยะยาวซึ่งการเอาใจใส่อย่างเต็มที่จะทำให้หน่วยความจำ GPU หมดลง

NSA ของ DeepSeek เร่งทั้งการฝึกล่วงหน้าและการอนุมานบริบทแบบยาว ขณะเดียวกันก็จับคู่หรือเอาชนะความแม่นยำในการตั้งใจฟังเต็มที่

สรุปเอกสารขนาดเท่าหนังสือโดยเข้าร่วมสรุปบล็อกที่บีบอัดพร้อมข้อความที่เกี่ยวข้องในท้องถิ่น

เร่งความเร็วผู้ช่วยแชทในบริบทยาวที่มีขั้นตอนการถอดรหัสถูกผูกไว้กับหน่วยความจำโดยการจำกัดโทเค็นแต่ละรายการไว้ที่บล็อกที่มีอันดับสูงสุด

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Block-Sparse and Native Sparse Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

รูปแบบความสนใจเบาบาง

คำถามที่พบบ่อย

Block-Sparse และ Native Sparse Attention คืออะไร?

ความสนใจแบบกระจายแบบบล็อกและแบบกระจายดั้งเดิมช่วยให้หม้อแปลงสามารถดูแลเฉพาะส่วนที่เกี่ยวข้องมากที่สุดของลำดับแบบยาว แทนที่จะเป็นโทเค็นทุกตัว ซึ่งช่วยลดต้นทุนกำลังสองของความสนใจแบบมาตรฐาน นี่คือสิ่งที่ทำให้โมเดลบริบทแบบยาวที่มีประสิทธิภาพใช้งานได้จริงกับฮาร์ดแวร์จริง

เหตุใดการเอาใจใส่ตนเองแบบมาตรฐานจึงมีราคาแพงสำหรับลำดับที่ยาวนาน

โทเค็นทุกอันเชื่อมโยงกับโทเค็นอื่น ๆ ดังนั้นให้คำนวณและปรับขนาดหน่วยความจำด้วยกำลังสองของความยาวของลำดับ

แนวคิดหลักของความสนใจแบบบล็อกกระจัดกระจายคืออะไร?

ลำดับจะถูกแบ่งออกเป็นบล็อกต่างๆ และความสนใจจะถูกคำนวณสำหรับคู่บล็อกที่เลือกเท่านั้น ซึ่งแม็ปกับเทนเซอร์คอร์ของ GPU ได้ดีเช่นกัน

อะไรทำให้ Native Sparse Attention (NSA) แตกต่างจากวิธีการกระจัดกระจายก่อนหน้านี้หลายวิธี

NSA เรียนรู้รูปแบบความกระจัดกระจายในระหว่างการฝึกล่วงหน้า และได้รับการออกแบบให้สอดคล้องกับฮาร์ดแวร์ ดังนั้นจึงรักษาความแม่นยำในขณะวิ่งอย่างรวดเร็ว

NSA สามสาขาใดรวมกันเป็นคีย์และค่าของมัน

NSA ผสานการบีบอัดโทเค็นแบบหยาบ การเลือกบล็อกแบบละเอียด และหน้าต่างเลื่อนภายในโดยใช้เกทที่เรียนรู้

เหตุใด NSA จึงใช้การดำเนินการระดับบล็อกมากกว่าการกระจายระดับโทเค็นโดยพลการ

รูปแบบการเข้าถึงระดับบล็อกเหมาะกับฮาร์ดแวร์ GPU ดังนั้นการประหยัด FLOP ตามทฤษฎีจึงกลายเป็นการเร่งความเร็วนาฬิกาแขวนได้จริง