รุ่น Jamba Hybrid Transformer-Mamba
Jamba เป็นโมเดลภาษาขนาดใหญ่จาก AI21 Labs ที่แทรกเลเยอร์ความสนใจของ Transformer เข้ากับเลเยอร์พื้นที่รัฐของ Mamba (รวมถึงผู้เชี่ยวชาญที่ผสมผสานกัน) เพื่อให้ได้ประสิทธิภาพบริบทแบบยาวโดยไม่สูญเสียคุณภาพของ Transformer
ภาพรวม
It matters because it shows hybrid architectures can beat pure Transformers on memory and throughput at long sequence lengths.
เจาะลึก
Pure Transformers ให้ความสำคัญกับต้นทุนกำลังสองเมื่อบริบทเพิ่มขึ้น และบอลลูนแคชคีย์-ค่าพร้อมความยาวของลำดับ โมเดลพื้นที่รัฐล้วนๆ เช่น Mamba ปรับขนาดเป็นเส้นตรงและรักษาสถานะเกิดซ้ำในขนาดคงที่ แต่กลับล่าช้าในบางงานในอดีต Jamba ผสมผสานทั้งสองอย่าง: มันซ้อนบล็อกโดยที่เลเยอร์ส่วนใหญ่เป็น Mamba (ราคาถูก เป็นเส้นตรง เหมาะสำหรับลำดับที่ยาว) และจำนวนที่น้อยกว่าถือเป็นความสนใจมาตรฐาน (แข็งแกร่งในการเรียกคืนที่แม่นยำและการใช้เหตุผลในบริบท) นอกจากนี้ยังเพิ่มเลเยอร์ผสมของผู้เชี่ยวชาญ (MoE) เพื่อเพิ่มขีดความสามารถในขณะที่รักษาพารามิเตอร์ที่ใช้งานอยู่ให้พอประมาณ Jamba ตัวแรกที่เปิดตัวพร้อมหน้าต่างบริบทโทเค็น 256K และสามารถปรับให้เข้ากับบริบทบน GPU ตัวเดียวได้มากกว่า Transformers ที่เทียบเคียงได้ เนื่องจากแคช KV ที่เล็กกว่าอย่างมาก
ข้อมูลเชิงลึกทางเทคนิค
Mamba เป็นโมเดลพื้นที่รัฐแบบเลือกสรร: แทนที่จะเข้าร่วมทุกโทเค็นที่ผ่านมา Mamba จะรักษาสถานะการเกิดซ้ำที่ถูกบีบอัดที่อัปเดตเชิงเส้นตรงตามลำดับ โดยมี gating ที่ขึ้นกับอินพุตที่จะตัดสินใจว่าจะเก็บหรือลืมอะไร Jamba กระจายเลเยอร์ความสนใจเต็มรูปแบบสองสามเลเยอร์ระหว่างเลเยอร์ Mamba จำนวนมาก ดังนั้นโมเดลยังคงรักษาการค้นหาระยะไกลที่แน่นอนของความสนใจ ในขณะที่การประมวลผลและหน่วยความจำส่วนใหญ่ยังคงเป็นเส้นตรง และการกำหนดเส้นทาง MoE จะเปิดใช้งานเฉพาะชุดย่อยของผู้เชี่ยวชาญต่อโทเค็น
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของโมเดล Jamba Hybrid Transformer-Mamba
ความสนใจแบบผสมผสานบวกกับการออกแบบพื้นที่ของรัฐกำลังกลายเป็นสูตรหลักสำหรับแบบจำลองบริบทยาวที่มีประสิทธิภาพ และ Jamba ช่วยทำให้รูปแบบนี้เป็นที่นิยม คาดว่าจะมีโมเดลที่เปิดกว้างและล้ำหน้ามากขึ้นเพื่อใช้สแต็กแบบผสม ปรับแต่งอัตราส่วนความสนใจต่อ SSM และรวมเข้ากับเทคนิค MoE และ KV-cache เนื่องจากความต้องการบริบทเพิ่มขึ้นไปสู่โทเค็นนับล้าน ข้อได้เปรียบของหน่วยความจำเชิงเส้นของเลเยอร์พื้นที่สถานะทำให้ไฮบริดมีความน่าสนใจเป็นพิเศษสำหรับการปรับใช้บนอุปกรณ์และคำนึงถึงต้นทุน
การใช้งานจริงในโลกแห่งความเป็นจริง
การประมวลผลอินพุตโทเค็น 256K เช่น การยื่นทางกฎหมายแบบยาวหรือที่เก็บโค้ดขนาดใหญ่บน GPU ตัวเดียวที่ไม่สามารถรองรับแคช KV ของ Transformer ที่เทียบเคียงได้
ให้บริการแชทบริบทยาวที่มีปริมาณงานสูง โดยที่สถานะคงที่ของ Mamba จะรักษาหน่วยความจำให้คงที่เมื่อการสนทนาเติบโตขึ้น
การวิเคราะห์เอกสารและการสร้างการดึงข้อมูลเพิ่มเติมบนฐานความรู้ขนาดใหญ่มากที่อัดแน่นอยู่ในบริบทโดยตรง
ใช้งาน LLM บริบทแบบยาวแบบน้ำหนักเปิด (Jamba เปิดตัวพร้อมน้ำหนักแบบเปิด) เพื่อการวิจัยเกี่ยวกับสถาปัตยกรรมไฮบริด
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jamba Hybrid Transformer-Mamba Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
แบบจำลองอวกาศของรัฐและ Mamba
คำถามที่พบบ่อย
What is Jamba Hybrid Transformer-Mamba Models?
Jamba เป็นโมเดลภาษาขนาดใหญ่จาก AI21 Labs ที่แทรกเลเยอร์ความสนใจของ Transformer เข้ากับเลเยอร์พื้นที่รัฐของ Mamba (รวมถึงผู้เชี่ยวชาญที่ผสมผสานกัน) เพื่อให้ได้ประสิทธิภาพบริบทแบบยาวโดยไม่สูญเสียคุณภาพของ Transformer เป็นเรื่องสำคัญเนื่องจากแสดงให้เห็นว่าสถาปัตยกรรมไฮบริดสามารถเอาชนะ Transformers เพียงอย่างเดียวในหน่วยความจำและปริมาณงานในลำดับความยาวที่ยาว
Jamba แทรกแซงเลเยอร์หลักสองประเภทใด
คุณสมบัติที่กำหนดของ Jamba คือการซ้อนเลเยอร์พื้นที่รัฐของ Mamba เข้ากับเลเยอร์ความสนใจของ Transformer จำนวนน้อยกว่า
Jamba ใช้เทคนิคเพิ่มเติมอะไรเพื่อเพิ่มความจุในขณะที่รักษาพารามิเตอร์ที่ใช้งานให้ต่ำ
Jamba เพิ่มเลเยอร์ MoE เพื่อให้มีเพียงผู้เชี่ยวชาญบางส่วนเท่านั้นที่ทำงานต่อโทเค็น ทำให้ความจุรวมเพิ่มขึ้นโดยไม่ต้องเพิ่มการคำนวณตามสัดส่วน
เหตุใด Mamba จึงขยายขนาดได้ดีกว่าความสนใจสำหรับลำดับที่ยาว
Mamba จะรักษาสถานะที่ถูกบีบอัดและขนาดคงที่ให้อัปเดตเป็นเส้นตรง หลีกเลี่ยงค่าใช้จ่ายด้านความสนใจกำลังสองและแคชคีย์-ค่าที่เพิ่มขึ้นเรื่อยๆ
Jamba รุ่นแรกรองรับหน้าต่างบริบทใด
Jamba เปิดตัวด้วยหน้าต่างบริบทโทเค็น 256,000 เปิดใช้งานโดยส่วนใหญ่ด้วย KV-cache ขนาดเล็ก
เหตุใด Jamba จึงให้ความสนใจเป็นชั้นๆ แทนที่จะไปเล่น Mamba ล้วนๆ
เลเยอร์ที่ใส่ใจอย่างเต็มที่บางส่วนยังคงรักษาการค้นหาและความสามารถในบริบทที่แน่นอน ซึ่งโมเดลพื้นที่สถานะล้วนๆ อาจล่าช้าได้