คู่มือทางเทคนิค

ความสนใจเชิงเส้นและเคอร์เนลของนักแสดง

ความสนใจเชิงเส้นจะแทนที่ความสนใจซอฟต์แม็กซ์กำลังสองใน Transformers ด้วยเคล็ดลับทางคณิตศาสตร์ที่ปรับขนาดเชิงเส้นตามความยาวของลำดับ

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Performer is a landmark method that approximates softmax using random feature kernels, making very long sequences computationally affordable.

เจาะลึก

ความสนใจของ Transformer มาตรฐานจะคำนวณคะแนนระหว่างโทเค็นทุกคู่ การเสียเวลาและหน่วยความจำที่เพิ่มขึ้นตามกำลังสองของความยาวของลำดับ (O(n^2)) ความสนใจเชิงเส้นจะเขียนการคำนวณใหม่ ดังนั้นต้นทุนจึงเพิ่มขึ้นเชิงเส้นเท่านั้น (O(n)) แนวคิดหลัก: ความสนใจของ softmax คือ softmax(QK^T)V แต่ถ้าคุณแทนที่ softmax ด้วย map phi คุณลักษณะเคอร์เนล คุณจะได้ phi(Q)(phi(K)^T V) เนื่องจากการคูณเมทริกซ์เป็นแบบเชื่อมโยง คุณจึงคำนวณ phi(K)^T V ก่อน (เมทริกซ์ขนาด d-by-d ขนาดเล็ก) โดยหลีกเลี่ยงเมทริกซ์คะแนนขนาดยักษ์ n-by-n ทั้งหมด นักแสดงจาก Google ในปี 2020 ทำให้นี่เป็นการประมาณค่าซอฟต์แม็กซ์ที่แท้จริงอย่างเที่ยงตรงโดยใช้ FAVOR+ (ความสนใจอย่างรวดเร็วผ่านฟีเจอร์สุ่มมุมฉากเชิงบวก) วาดเส้นโครงแบบสุ่มที่ทำให้เคอร์เนลประมาณการไม่ลำเอียงและเสถียร

ข้อมูลเชิงลึกทางเทคนิค

FAVOR+ ของนักแสดงจะประมาณค่าเคอร์เนล softmax exp(q.k) โดยใช้คุณสมบัติสุ่มเชิงบวก โดยจะแมปข้อความค้นหาและคีย์ผ่านการฉายภาพแบบเกาส์เซียนแบบสุ่มที่ห่อด้วยเอ็กซ์โพเนนเชียล รับประกันน้ำหนักความสนใจที่ไม่เป็นลบ และหลีกเลี่ยงความไม่เสถียรเชิงตัวเลขของตัวประมาณค่ารุ่นก่อนๆ การใช้คุณลักษณะสุ่มมุมฉากจะช่วยลดความแปรปรวน สิ่งสำคัญที่สุดคือเมทริกซ์ความสนใจแบบ n-by-n ไม่เคยเกิดขึ้นจริง ดังนั้นหน่วยความจำจึงลดลงจากกำลังสองเป็นเชิงเส้น ทำให้เกิดลำดับโทเค็นนับหมื่น

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของความสนใจเชิงเส้นและเคอร์เนลของนักแสดง

ความสนใจเชิงเส้นตรงมักจะติดตามคุณภาพแบบ softmax ดังนั้นสาขานี้จึงมาบรรจบกันที่แบบผสม: แบบจำลองพื้นที่รัฐ (Mamba) ความสนใจเชิงเส้นแบบมีรั้วรอบขอบชิด และสถาปัตยกรรมที่ผสมเลเยอร์ความสนใจเต็มรูปแบบสองสามเลเยอร์เข้ากับเลเยอร์เชิงเส้นจำนวนมาก เนื่องจากหน้าต่างบริบทผลักดันไปยังโทเค็นนับล้าน กลไกเชิงเส้นและกำลังสองย่อยจึงน่าดึงดูดใจมากขึ้นในด้านต้นทุน และความสนใจเชิงเส้นแบบที่เกิดซ้ำกำลังได้รับการทบทวนอีกครั้งเพื่อการอนุมานสตรีมมิ่งที่มีประสิทธิภาพและโมเดลบนอุปกรณ์

การใช้งานจริงในโลกแห่งความเป็นจริง

การประมวลผลลำดับจีโนมหรือโปรตีนขนาดยาวโดยที่ความสนใจในกำลังสองเต็มจะทำให้หน่วยความจำ GPU หมดลง

การสรุประดับเอกสารในรายงานที่ยาวมากโดยไม่ทำให้เป็นก้อน โดยใช้แกนหลักสไตล์นักแสดง

การสร้างแบบจำลองเสียงหรืออนุกรมเวลาแบบยาวที่มีประสิทธิภาพ โดยที่ลำดับต่างๆ ครอบคลุมขั้นตอนนับหมื่นขั้นตอน

ลดต้นทุนการอนุมานในโมเดลการแชทที่มีบริบทยาวโดยการแทนที่เลเยอร์ softmax บางส่วนด้วยรูปแบบการเอาใจใส่เชิงเส้น

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Linear Attention and Performer Kernels quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

RWKV ความสนใจเชิงเส้น

คำถามที่พบบ่อย

What is Linear Attention and Performer Kernels?

ความสนใจเชิงเส้นจะแทนที่ความสนใจซอฟต์แม็กซ์กำลังสองใน Transformers ด้วยเคล็ดลับทางคณิตศาสตร์ที่ปรับขนาดเชิงเส้นตามความยาวของลำดับ นักแสดงเป็นวิธีการหลักที่ประมาณซอฟต์แม็กซ์โดยใช้เคอร์เนลฟีเจอร์แบบสุ่ม ซึ่งทำให้ลำดับที่ยาวมากมีราคาไม่แพงในการคำนวณ

เหตุใดระดับความสนใจของ softmax มาตรฐานจึงไม่ดีตามความยาวของลำดับ

Softmax Attention จะเปรียบเทียบโทเค็นทุกคู่ โดยสร้างเมทริกซ์คะแนนแบบ n-by-n ดังนั้นต้นทุนจึงเพิ่มขึ้นเมื่อ O(n^2)

คุณสมบัติทางคณิตศาสตร์ข้อใดที่ทำให้ความสนใจเชิงเส้นหลีกเลี่ยงเมทริกซ์ขนาด n-by-n ได้

เนื่องจากการคูณเมทริกซ์เป็นแบบเชื่อมโยง คุณจึงสามารถคำนวณ phi(K)^T V ก่อน ซึ่งเป็นเมทริกซ์ขนาด d คูณ d แทนที่จะเป็น phi(Q)phi(K)^T

กลไก FAVOR+ ของนักแสดงประมาณค่าอะไร

FAVOR+ ใช้คุณลักษณะสุ่มมุมฉากเชิงบวกเพื่อประมาณเคอร์เนล softmax เอ็กซ์โพเนนเชียล โดยไม่สร้างเมทริกซ์ความสนใจแบบเต็ม

เหตุใดนักแสดงจึงใช้คุณสมบัติสุ่มเชิงบวกมากกว่าคุณสมบัติตรีโกณมิติก่อนหน้า

คุณสมบัติเชิงบวกทำให้การประมาณค่าเคอร์เนลไม่เป็นลบ หลีกเลี่ยงความไม่เสถียรและค่าลบที่รบกวนแผนที่ฟีเจอร์ sin/cos ก่อนหน้านี้

ความซับซ้อนโดยประมาณของความสนใจเชิงเส้นแบบนักแสดงในความยาวลำดับ n คืออะไร?

ด้วยการเรียงลำดับการคำนวณใหม่และไม่สร้างเมทริกซ์แบบ n-by-n ต้นทุนจะปรับขนาดเป็นเส้นตรงตามความยาวของลำดับ