คู่มือ AI ภาษา

ความสนใจแบบหลายแบบสอบถาม

Multi-Query Attention (MQA) เป็นการประหยัดหน่วยความจำในความสนใจของหม้อแปลงที่ใช้ชุดคีย์และค่าร่วมกันในส่วนหัวของความสนใจทั้งหมด

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It dramatically speeds up text generation by shrinking the memory the model must shuffle around.

เจาะลึก

ความสนใจแบบหลายหัวแบบมาตรฐานจะทำให้ทุกหัวมีการสืบค้น คีย์ และมูลค่าของตัวเอง ในระหว่างการสร้าง คีย์และค่าสำหรับโทเค็นที่ผ่านมาทั้งหมดจะต้องแคชและโหลดซ้ำในแต่ละขั้นตอน - แคช KV นี้กลายเป็นคอขวดหลัก เนื่องจากการอ่านจากหน่วยความจำจะช้ากว่าคณิตศาสตร์เอง Multi-Query Attention เสนอโดย Noam Shazeer ในปี 2019 เก็บการคาดการณ์คิวรีแยกกันต่อหัว แต่จะยุบคีย์และค่าลงในหัวที่ใช้ร่วมกันเพียงหัวเดียว วิธีนี้จะย่อแคช KV ลงตามปัจจัยที่เท่ากับจำนวนหัว ซึ่งบางครั้งอาจเล็กกว่า 8x ถึง 64x ผลลัพธ์ที่ได้คือการถอดรหัสแบบ autoregressive ที่เร็วขึ้นมาก และใช้พื้นที่หน่วยความจำน้อยลง โดยมีคุณภาพลดลงเพียงเล็กน้อยเท่านั้น ประเด็นตรงกลางคือ Grouped-Query Attention จะช่วยรักษาสมดุลระหว่างการแลกเปลี่ยน

ข้อมูลเชิงลึกทางเทคนิค

ใน MQA น้ำหนักการสืบค้นยังคงสร้างเวกเตอร์การสืบค้นแบบ H แยกต่างหาก แต่การฉายคีย์เดียวและการฉายภาพค่าเดียวจะแชร์กันในทุกส่วนหัว แต่ละหัวจะคำนวณความสนใจโดยใช้คำค้นหาของตัวเองกับคีย์และค่าเดียวกัน เนื่องจากเทนเซอร์ K และ V ที่แคชไว้ไม่ปรับขนาดตามจำนวนหัวอีกต่อไป แบนด์วิดท์หน่วยความจำในระหว่างการถอดรหัสจึงลดลงอย่างรวดเร็ว และแบนด์วิดท์ซึ่งไม่ใช่การคำนวณ คือสิ่งที่เพิ่มความเร็วในการสร้างเกตบนตัวเร่งความเร็วสมัยใหม่

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของความสนใจแบบหลายแบบสอบถาม

MQA กำหนดไว้ว่าคุณสามารถตัดส่วนหัวของคีย์/ค่าที่ซ้ำซ้อนได้โดยไม่เกิดอันตรายใดๆ เลย และขณะนี้ข้อมูลเชิงลึกดังกล่าวได้กำหนดรูปแบบ LLM การอนุมานอย่างรวดเร็วเกือบทุกตัว ฟิลด์นี้ส่วนใหญ่มาบรรจบกันที่ Grouped-Query Attention (GQA) ซึ่งใช้ใน Llama 2/3 และอื่นๆ อีกมากมาย ซึ่งใช้กลุ่ม KV สองสามกลุ่มแทนที่จะเป็นกลุ่มเดียวในการกู้คืนคุณภาพในขณะที่ยังคงรักษาการเร่งความเร็วส่วนใหญ่เอาไว้ งานในอนาคตผสมผสานแนวคิดเหล่านี้เข้ากับการบีบอัดแคช KV การหาปริมาณ และความสนใจแบบแฝงหลายตัวเพื่อผลักดันบริบทที่ยาวขึ้นและการให้บริการที่ถูกกว่า

การใช้งานจริงในโลกแห่งความเป็นจริง

เร่งความเร็วในการสร้างโทเค็นต่อโทเค็นในตัวช่วยแชท โดยที่แคช KV ไม่ใช่การประมวลผลดิบ จะจำกัดปริมาณงาน

PaLM ของ Google ซึ่งใช้ Multi-Query Attention เพื่อเปิดใช้งานการอนุมานขนาดใหญ่อย่างมีประสิทธิภาพ

ให้บริการผู้ใช้พร้อมกันจำนวนมากบน GPU ตัวเดียวโดยการลดขนาดหน่วยความจำแคช KV ตามคำขอ

ความสนใจในการสืบค้นแบบกลุ่มใน Llama 2 70B และ Llama 3 ซึ่งเป็นผู้สืบทอดโดยตรงที่สร้างสมดุลระหว่างความเร็วของ MQA กับคุณภาพการเอาใจใส่เต็มรูปแบบ

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ความสนใจแบบสอบถามแบบกลุ่ม

คำถามที่พบบ่อย

What is Multi-Query Attention?

Multi-Query Attention (MQA) เป็นการประหยัดหน่วยความจำในความสนใจของหม้อแปลงที่ใช้ชุดคีย์และค่าร่วมกันในส่วนหัวของความสนใจทั้งหมด มันเพิ่มความเร็วในการสร้างข้อความได้อย่างมากด้วยการลดขนาดหน่วยความจำที่โมเดลต้องสับเปลี่ยน

Multi-Query Attention แบ่งส่วนความสนใจทั้งหมดอย่างไร

MQA แยกคำค้นหาต่อหัว แต่ใช้การฉายภาพหลัก 1 รายการและการฉายภาพค่า 1 รายการในทุกหัว

คอขวดหลักที่ MQA ระบุระหว่างการสร้างการถดถอยอัตโนมัติคืออะไร

การรีโหลดแคช KV ขนาดใหญ่แต่ละขั้นตอนจะถูกจำกัดด้วยแบนด์วิดท์ MQA ย่อขนาดแคชนั้นเพื่อเร่งการถอดรหัส

MQA ลดขนาดแคช KV ประมาณกี่ปัจจัย

เนื่องจากคีย์และค่ายุบจากส่วนหัว H ไปเป็นหนึ่ง แคชจึงย่อขนาดลงตามจำนวนส่วนหัวโดยประมาณ

ข้อเสียหลักๆ ของการใช้ MQA คืออะไร

การแชร์คีย์และค่าจะลดความสามารถในการแสดงข้อมูลลงเล็กน้อย ส่งผลให้คุณภาพลดลงเล็กน้อยเพื่อแลกกับความเร็วที่เพิ่มขึ้นอย่างมาก

ตัวแปรใดอยู่ระหว่างความสนใจแบบหลายหัวแบบมาตรฐานกับ MQA

Grouped-Query Attention (GQA) ใช้กลุ่ม KV หลายกลุ่มแทนที่จะเป็นกลุ่มเดียว เพื่อรักษาสมดุลระหว่างคุณภาพและความเร็ว