LoRA และการปรับแต่งพารามิเตอร์อย่างมีประสิทธิภาพ
LoRA ให้คุณปรับแต่งโมเดลฝึกหัดขนาดยักษ์โดยฝึกตุ้มน้ำหนักใหม่ชุดเล็กๆ เท่านั้น แทนที่จะฝึกตุ้มน้ำหนักนับพันล้านทั้งหมด
ภาพรวม
It is the trick that makes fine-tuning affordable on a single GPU and lets one base model serve dozens of specialized tasks.
เจาะลึก
การปรับแต่งแบบละเอียดเต็มรูปแบบจะอัปเดตทุกน้ำหนักในโมเดล ซึ่งสำหรับเครือข่ายหลายพันล้านพารามิเตอร์นั้นต้องการหน่วยความจำและพื้นที่เก็บข้อมูลจำนวนมหาศาลสำหรับงานใหม่แต่ละงาน LoRA (การปรับตัวระดับต่ำ) ใช้เส้นทางที่ชาญฉลาดกว่า: โดยจะตรึงตุ้มน้ำหนักเดิมทั้งหมด และแทรกเมทริกซ์ 'อะแดปเตอร์' ขนาดเล็กที่ฝึกได้ไว้ข้างๆ สิ่งสำคัญคือการเปลี่ยนแปลงที่จำเป็นเพื่อทำให้โมเดลเฉพาะทางนั้นมีอันดับต่ำ โดยสามารถจับได้โดยเมทริกซ์ผอมสองตัวซึ่งมีผลิตภัณฑ์ซึ่งมีรูปร่างเหมือนกับเมทริกซ์น้ำหนักมาก แต่มีตัวเลขให้เรียนรู้น้อยกว่ามาก บ่อยครั้งที่คุณฝึกน้อยกว่า 1% ของพารามิเตอร์ ผลลัพธ์ที่ได้คือไฟล์อะแดปเตอร์ขนาดเล็ก (บางครั้งอาจเป็นสองสามเมกะไบต์) ที่คุณสามารถสลับเข้าและออกได้ QLoRA ก้าวไปอีกขั้นด้วยการวัดปริมาณฐานแช่แข็งเป็น 4 บิต ทำให้ผู้คนสามารถปรับแต่งโมเดลขนาดใหญ่บนฮาร์ดแวร์ของผู้บริโภคได้
ข้อมูลเชิงลึกทางเทคนิค
สำหรับเมทริกซ์น้ำหนัก W นั้น LoRA แสดงถึงการอัพเดตเป็นผลคูณของเมทริกซ์ระดับต่ำสองตัว คือ B คูณ A โดยที่ A และ B มีมิติภายในเล็ก r (อันดับ ซึ่งมักเป็น 8 หรือ 16) ในระหว่างการฝึกจะเรียนรู้เฉพาะ A และ B เท่านั้น W ยังคงเป็นน้ำแข็ง เมื่ออนุมาน เอาต์พุตของอะแดปเตอร์จะถูกเพิ่มไปยังเอาต์พุตของเลเยอร์ดั้งเดิม และตัวประกอบสเกล (อัลฟา) จะควบคุมอิทธิพลของมัน เนื่องจาก B คูณ A สามารถรวมกลับเข้าไปใน W ได้หลังการฝึก LoRA จึงเพิ่มเวลาแฝงเป็นศูนย์เมื่อรวมเข้ากับโมเดลที่ใช้งานแล้ว
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของ LoRA และการปรับแต่งพารามิเตอร์อย่างมีประสิทธิภาพ
การปรับพารามิเตอร์อย่างมีประสิทธิภาพกลายเป็นวิธีเริ่มต้นที่องค์กรปรับใช้โมเดลแบบเปิด และนั่นจะเจาะลึกยิ่งขึ้น คาดว่าจะมีระบบนิเวศของอะแดปเตอร์ที่ LoRA หลายร้อยตัวถูกสับเปลี่ยนทันทีหรือประกอบบนฐานที่ใช้ร่วมกันเพียงฐานเดียว พร้อมด้วยระบบการกำหนดเส้นทางที่เลือกอะแดปเตอร์ที่เหมาะสมต่อคำขอ การปรับแต่งเชิงปริมาณสไตล์ QLoRA ช่วยผลักดันขนาดของโมเดลที่มือสมัครเล่นสามารถปรับแต่งได้ที่บ้าน การวิจัยยังคงดำเนินต่อไปเกี่ยวกับการเริ่มต้นที่ดีขึ้น การเลือกอันดับแบบไดนามิก และการให้บริการอะแดปเตอร์จำนวนมากในคราวเดียวอย่างมีประสิทธิภาพ ทำให้โมเดลพื้นฐานระดับแนวหน้าหนึ่งเป็นรากฐานสำหรับตัวแปรเฉพาะทางราคาถูกจำนวนมากอย่างไม่มีที่สิ้นสุด
การใช้งานจริงในโลกแห่งความเป็นจริง
ปรับแต่งโมเดลแบบเปิดอย่าง Llama บนบันทึกทางคลินิกของโรงพยาบาลโดยใช้ GPU ตัวเดียวแทนที่จะเป็นคลัสเตอร์แบบเต็ม
จัดส่งอะแดปเตอร์ LoRA ขนาด 10 MB ที่เปลี่ยนแชทบอตทั่วไปให้กลายเป็นผู้ช่วยด้านเอกสารทางกฎหมายโดยไม่ต้องแจกจ่ายโมเดลทั้งหมดอีกครั้ง
การใช้ QLoRA เพื่อปรับแต่งโมเดลขนาดใหญ่บนกราฟิกการ์ดสำหรับผู้บริโภคโดยการวัดปริมาณน้ำหนักฐานที่แช่แข็งเป็น 4 บิต
การโฮสต์โมเดลพื้นฐานหนึ่งโมเดลและอะแดปเตอร์ LoRA ที่แตกต่างกันแบบ hot-swap ต่อลูกค้าหนึ่งราย เพื่อให้บริการผู้ช่วยเฉพาะทางจำนวนมากในราคาถูก
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the LoRA and Parameter-Efficient Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การปรับแต่งคำสั่ง
คำถามที่พบบ่อย
What is LoRA and Parameter-Efficient Tuning?
LoRA ให้คุณปรับแต่งโมเดลฝึกหัดขนาดยักษ์โดยฝึกตุ้มน้ำหนักใหม่ชุดเล็กๆ เท่านั้น แทนที่จะฝึกตุ้มน้ำหนักนับพันล้านทั้งหมด เป็นเคล็ดลับที่ทำให้การปรับแต่งแบบละเอียดมีราคาไม่แพงบน GPU ตัวเดียว และช่วยให้โมเดลพื้นฐานหนึ่งตัวรองรับงานเฉพาะทางได้มากมาย
แนวคิดหลักเบื้องหลังการปรับแต่ง LoRA คืออะไร
LoRA เก็บตุ้มน้ำหนักที่ฝึกไว้ไว้และเรียนรู้เมทริกซ์ระดับต่ำขนาดเล็กที่เพิ่มเข้ามาข้างๆ โดยฝึกพารามิเตอร์เพียงส่วนเล็กๆ เท่านั้น
เหตุใด LoRA จึงลดต้นทุนการปรับแต่งแบบละเอียดได้อย่างมาก
เนื่องจากมีเพียงเมทริกซ์อะแดปเตอร์ขนาดเล็กเท่านั้นที่สามารถฝึกได้ ความต้องการหน่วยความจำและพื้นที่เก็บข้อมูลจึงลดลงอย่างรวดเร็วเมื่อเทียบกับการอัปเดตน้ำหนักนับพันล้านรายการ
อันดับ 'r' ในการควบคุมอะแดปเตอร์ LoRA คืออะไร
อันดับ r คือมิติภายในขนาดเล็กที่ใช้ร่วมกันโดยเมทริกซ์ A และ B; ค่า r ที่สูงกว่าจะทำให้อะแดปเตอร์มีความจุมากขึ้น แต่มีพารามิเตอร์ในการฝึกเพิ่มมากขึ้น
QLoRA ขยายแนวทาง LoRA พื้นฐานอย่างไร
QLoRA จัดเก็บตุ้มน้ำหนักพื้นฐานแบบแช่แข็งด้วยความแม่นยำ 4 บิต ซึ่งตัดหน่วยความจำลงอย่างมาก เพื่อให้สามารถปรับแต่งโมเดลขนาดใหญ่มากได้อย่างละเอียดบน GPU สำหรับผู้บริโภคเพียงตัวเดียว
เหตุใดอะแดปเตอร์ LoRA ที่รวมเข้าด้วยกันจึงไม่เพิ่มเวลาแฝงในการอนุมานเพิ่มเติม
อะแดปเตอร์อัปเดต B คูณ A มีรูปร่างเหมือนกับน้ำหนักเดิม ดังนั้นจึงสามารถพับเป็น W ได้โดยตรง โดยปล่อยให้โมเดลที่ใช้งานมีขนาดและความเร็วเท่ากัน