ความสนใจแฝงแบบหลายหัว
Multi-Head Latent Attention (MLA) เป็นกลไกความสนใจที่นำมาใช้ใน DeepSeek-V2 ซึ่งบีบอัดแคชคีย์-ค่าที่ต้องใช้หน่วยความจำมากให้เป็นเวกเตอร์แฝงขนาดเล็กที่ใช้ร่วมกัน
ภาพรวม
It lets large language models run with far less GPU memory while keeping quality close to standard attention.
เจาะลึก
เมื่อหม้อแปลงสร้างข้อความ มันจะจัดเก็บคีย์และเวกเตอร์ค่าสำหรับโทเค็นที่ผ่านมาทุกรายการใน 'แคช KV' แคชนั้นขยายตามความยาวของบริบทและครอบงำการใช้หน่วยความจำในระหว่างการอนุมาน MLA แทนที่เวกเตอร์คีย์/ค่าขนาดเต็มจำนวนมากด้วยเวกเตอร์แฝงอันดับต่ำต่อโทเค็น จากนั้นโปรเจ็กต์ที่แฝงสำรองลงในคีย์และค่าต่อหัวได้ทันที เนื่องจากมีการแคชเฉพาะค่าแฝงขนาดกะทัดรัด DeepSeek-V2 จึงรายงานว่าลดหน่วยความจำแคช KV ได้มากกว่า 90% เมื่อเทียบกับความสนใจแบบหลายหัวแบบมาตรฐาน ช่วยให้บริบทยาวขึ้นและขนาดแบทช์ใหญ่ขึ้น สิ่งสำคัญที่สุดคือ เมทริกซ์การฉายภาพด้านบนสามารถพับเป็นน้ำหนักอื่นๆ ได้ ดังนั้น MLA จึงบรรลุการบีบอัดนี้โดยสูญเสียคุณภาพการสร้างแบบจำลองเพียงเล็กน้อยหรือไม่สามารถวัดได้เลย
ข้อมูลเชิงลึกทางเทคนิค
MLA ทำการบีบอัดข้อต่อระดับต่ำ: สถานะที่ซ่อนอยู่ของโทเค็นแต่ละรายการจะถูกฉายลงไปที่เวกเตอร์แฝงขนาดเล็ก และเมทริกซ์การฉายภาพด้านบนที่แยกจากกันจะสร้างคีย์และค่าต่อหัวขึ้นมาใหม่ เคล็ดลับที่ชาญฉลาดคือการ 'ดูดซับ' น้ำหนักการฉายภาพที่เพิ่มขึ้นลงในแบบสอบถามและการฉายภาพผลลัพธ์ ดังนั้นแบบจำลองจะไม่ทำให้คีย์/ค่าทั้งหมดเกิดขึ้นจริงในระหว่างการอนุมาน การฝังตำแหน่งแบบหมุนจะได้รับการจัดการโดยใช้เส้นทางคีย์แบบแยกส่วน เนื่องจากการหมุนไม่สามารถดูดซับในลักษณะเดียวกันได้ โดยจะรักษาข้อมูลตำแหน่งไว้
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของความสนใจแฝงแบบหลายหัว
MLA ช่วยทำให้ DeepSeek-V2 และ V3 ประหยัดในการให้บริการในวงกว้าง และเทคนิคดังกล่าวก็แพร่กระจายไปในขณะที่ทีมต่างๆ ไล่ตามการอนุมานบริบทยาวที่ถูกกว่า คาดว่าการบีบอัดแฝงแบบ MLA จะรวมกับเลเยอร์ Mixture-of-Experts แบบกระจัดกระจาย แคชเชิงปริมาณ และการถอดรหัสเชิงคาดเดาในโมเดลเปิดในอนาคต นักวิจัยยังกำลังสำรวจว่ามิติที่ซ่อนเร้นสามารถหดตัวลงได้มากเพียงใดก่อนที่คุณภาพจะลดลง และแนวคิดระดับต่ำแบบเดียวกันนี้สามารถดึงความสนใจระหว่างการฝึกอบรมได้หรือไม่ ไม่ใช่แค่การอนุมานเท่านั้น
การใช้งานจริงในโลกแห่งความเป็นจริง
ให้บริการโมเดลแชท DeepSeek-V2/V3 ด้วยพื้นที่หน่วยความจำ GPU ที่เล็กลงอย่างมากต่อคำขอ
การรันคำถามเกี่ยวกับเอกสารขนาดยาวเพื่อตอบคำถามว่าแคช KV ขนาดใหญ่อาจทำให้ VRAM หมดไปได้อย่างไร
การเพิ่มขนาดแบตช์การอนุมานบน GPU คงที่ เนื่องจากแต่ละลำดับจะเก็บเฉพาะเวกเตอร์แฝงเล็กๆ เท่านั้น
เปิดใช้งานหน้าต่างบริบทที่ยาวขึ้นบนฮาร์ดแวร์สินค้าโภคภัณฑ์สำหรับผู้ช่วยที่ดึงข้อมูลเสริม
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
ความสนใจแบบหลายแบบสอบถาม
คำถามที่พบบ่อย
What is Multi-Head Latent Attention?
Multi-Head Latent Attention (MLA) เป็นกลไกความสนใจที่นำมาใช้ใน DeepSeek-V2 ซึ่งบีบอัดแคชคีย์-ค่าที่ต้องใช้หน่วยความจำมากให้เป็นเวกเตอร์แฝงขนาดเล็กที่ใช้ร่วมกัน ช่วยให้โมเดลภาษาขนาดใหญ่ทำงานได้โดยใช้หน่วยความจำ GPU น้อยกว่ามาก ในขณะที่ยังคงรักษาคุณภาพให้ใกล้เคียงกับความสนใจมาตรฐาน
ปัญหาหลักที่ Multi-Head Latent Attention ได้รับการออกแบบมาเพื่อลดคืออะไร?
MLA กำหนดเป้าหมายไปที่แคช KV ซึ่งจะขยายตามความยาวของบริบทและครอบงำหน่วยความจำระหว่างการสร้างข้อความ
MLA ย่อขนาดแคช KV อย่างไร
MLA แคชเวกเตอร์แฝงขนาดกะทัดรัดหนึ่งตัวต่อโทเค็น และสร้างคีย์และค่าใหม่จากเวกเตอร์นั้นผ่านการฉายภาพขึ้น
รุ่นใดที่เปิดตัวระบบ Multi-Head Latent Attention เป็นครั้งแรก
MLA เปิดตัวโดย DeepSeek ในรุ่น DeepSeek-V2 และส่งต่อไปยัง DeepSeek-V3
เหตุใด MLA จึงต้องมีเส้นทาง 'แยกส่วน' แยกต่างหากสำหรับการฝังตำแหน่งแบบหมุน
การแปลงแบบหมุนไม่สามารถดูดซับลงในเมทริกซ์น้ำหนักอื่นๆ ได้ ดังนั้น MLA จึงเก็บส่วนประกอบหลักที่แยกส่วนขนาดเล็กไว้เพื่อส่งข้อมูลตำแหน่ง
DeepSeek-V2 รายงานการลดหน่วยความจำแคช KV ประมาณเท่าใดจาก MLA เทียบกับความสนใจแบบหลายหัวแบบมาตรฐาน
DeepSeek-V2 รายงานว่าสามารถตัดหน่วยความจำแคช KV ได้มากกว่า 90% ทำให้สามารถใช้งานบริบทที่ยาวขึ้นและแบทช์ที่ใหญ่ขึ้น