คู่มือ AI ภาษา

ความสนใจแบบสอบถามแบบกลุ่ม

Grouped-Query Attention (GQA) เป็นวิธีย่อหน่วยความจำที่จำเป็นระหว่างการสร้างข้อความโดยปล่อยให้ส่วนหัวของแบบสอบถามหลายรายการใช้คีย์และส่วนหัวของค่าเดียวกันร่วมกัน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

มันทําให้โมเดลขนาดใหญ่ให้บริการได้เร็วขึ้นมากโดยแทบไม่มีการสูญเสียคุณภาพ

เจาะลึก

ในเลเยอร์ความสนใจแบบหลายหัวมาตรฐาน ทุกหัวจะมีการสืบค้น คีย์ และค่าของตัวเอง ในระหว่างการสร้าง คีย์และค่าสำหรับโทเค็นก่อนหน้าทั้งหมดจะถูกแคชไว้ ("แคช KV") ดังนั้นโมเดลจึงไม่คำนวณใหม่ ด้วยหัวข้อมูลจำนวนมากและบริบทที่ยาว แคชนี้จึงมีมหาศาลและครอบงำแบนด์วิดท์หน่วยความจำ ณ เวลาอนุมาน GQA เปิดตัวโดยนักวิจัย Google ในปี 2023 จัดกลุ่มส่วนหัวของข้อความค้นหาและให้แต่ละกลุ่มมีชุดคีย์และส่วนหัวของค่าที่ใช้ร่วมกันเพียงชุดเดียว หากคุณมีหัวแบบสอบถาม 32 หัว แต่มีกลุ่ม KV เพียง 8 กลุ่ม แคช KV จะลดลงประมาณสี่เท่า สิ่งนี้อยู่ระหว่างความสนใจแบบหลายหัวเต็มรูปแบบ (ทุกหัวแยกจากกัน) และความสนใจแบบหลายคำค้นหา (1 KV ที่ใช้ร่วมกันสำหรับหัวทั้งหมด) ซึ่งจับความเร็วส่วนใหญ่ของ MQA ขณะเดียวกันก็รักษาคุณภาพให้ใกล้เคียงกับความสนใจเต็มที่ Llama 2 70B และรุ่นต่อๆ มานำมาใช้

ข้อมูลเชิงลึกทางเทคนิค

คุณภาพความสนใจขึ้นอยู่กับการมีทิศทางการสืบค้นที่แตกต่างกันอย่างมาก แต่ก็ยอมให้มีการแบ่งปันคีย์และค่าได้ GQA ใช้ประโยชน์จากความไม่สมดุลนี้ โดยจะเก็บส่วนหัวของคำค้นหาทั้งหมดไว้ แต่จะจำลองส่วนหัวของ KV ที่ใช้ร่วมกันแต่ละรายการข้ามคำค้นหาในกลุ่ม การประหยัดเกิดขึ้นเมื่ออนุมาน โดยที่แคช KV เป็นตัวใช้หลักของแบนด์วิธหน่วยความจำ หัว KV ที่น้อยลงหมายถึงข้อมูลที่อ่านน้อยลงต่อโทเค็นที่สร้างขึ้น โมเดลมักจะได้รับการ "ฝึกฝน" เป็นเวลาสั้นๆ เพื่อแปลงจุดตรวจสอบแบบหลายหัวที่มีอยู่ให้เป็น GQA

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของความสนใจแบบกลุ่มแบบสอบถาม

ขณะนี้ GQA เป็นค่าเริ่มต้นมาตรฐานในโมเดล Open Weight เนื่องจากมีการแลกเปลี่ยนต้นทุนคุณภาพเพียงเล็กน้อยเพื่อชัยชนะในการให้บริการครั้งใหญ่ คาดว่ามันจะรวมเข้ากับเทคนิคด้านประสิทธิภาพอื่นๆ ได้มากขึ้น เช่น FlashAttention, การหาปริมาณแคช KV และรูปแบบที่ใหม่กว่า เช่น ความสนใจแฝงแบบหลายหัวที่บีบอัดแคชให้ดียิ่งขึ้นไปอีก เมื่อหน้าต่างบริบทขยายใหญ่ขึ้น การควบคุมขนาดแคช KV จะยังคงเป็นปัญหาการออกแบบที่สำคัญ และการแบ่งปันส่วนหัวแบบ GQA จะยังคงเป็นกุญแจสำคัญ

การใช้งานจริงในโลกแห่งความเป็นจริง

Llama 2 70B และ Llama 3 ใช้ GQA เพื่อให้บริการบริบทแบบยาวด้วยแคช KV ที่เล็กกว่า

การลดหน่วยความจำ GPU เพื่อให้รูปแบบการแชทขนาดใหญ่เหมาะกับตัวเร่งความเร็วน้อยลงหรือถูกกว่า

เร่งความเร็วในการสร้างโทเค็นต่อโทเค็นใน API ที่ใช้งานจริงซึ่งแบนด์วิดท์แคช KV เป็นจุดคอขวด

เปิดใช้งานขนาดแบตช์ที่ใหญ่ขึ้นเพื่อให้บริการผู้ใช้จำนวนมากพร้อมกันโดยไม่ต้องใช้หน่วยความจำจนหมด

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ความสนใจแบบหลายแบบสอบถาม

คำถามที่พบบ่อย

Grouped-Query Attention คืออะไร?

Grouped-Query Attention (GQA) เป็นวิธีย่อหน่วยความจำที่จำเป็นระหว่างการสร้างข้อความโดยปล่อยให้ส่วนหัวของแบบสอบถามหลายรายการใช้คีย์และส่วนหัวของค่าเดียวกันร่วมกัน ทำให้โมเดลขนาดใหญ่ให้บริการได้เร็วขึ้นมากโดยแทบไม่สูญเสียคุณภาพเลย

ใน Grouped-Query Attention อะไรถูกใช้ร่วมกันระหว่างกลุ่มของส่วนหัวของเคียวรี

GQA เก็บส่วนหัวของแบบสอบถามแยกกัน แต่ให้แต่ละกลุ่มแชร์ส่วนหัวของคีย์และค่าหนึ่งชุด เพื่อลดขนาดแคช KV

GQA อธิบายได้ดีที่สุดว่าเป็นจุดกึ่งกลางระหว่างความสุดขั้วสองข้อใด

หลายหัวทำให้ทุกหัวมี KV เป็นของตัวเอง แบบสอบถามหลายรายการแบ่งปันหนึ่ง KV สำหรับทุกหัว GQA อยู่ระหว่างกลุ่ม KV สองสามกลุ่ม

GQA มีส่วนใดของการอนุมานที่ทำให้ราคาถูกลงเป็นหลัก

การประหยัดจะแสดงในเวลาที่สร้าง โดยที่การอ่านแคช KV ถือเป็นต้นทุนแบนด์วิธหน่วยความจำหลัก

หากโมเดลมีหัวแบบสอบถาม 32 หัวและกลุ่ม 8 KV แคช KV จะลดลงตามปัจจัยประมาณใด

หัวสืบค้น 32 หัวหารด้วยกลุ่ม KV ที่ใช้ร่วมกัน 8 กลุ่ม ช่วยลดคีย์และค่าที่แคชไว้ประมาณสี่เท่า

เหตุใด GQA จึงสามารถรักษาคุณภาพของโมเดลส่วนใหญ่ได้แม้จะใช้หัว KV ร่วมกันก็ตาม

ความสนใจสามารถทนต่อการแชร์คีย์และค่าได้ดีกว่าการทนต่อการสูญเสียทิศทางการสืบค้นที่แตกต่างกัน ดังนั้น GQA จึงรักษาคุณภาพให้อยู่ในระดับสูง