การหาปริมาณ
การหาปริมาณจะย่อขนาดโมเดล AI โดยการจัดเก็บตัวเลขด้วยความแม่นยำที่ต่ำกว่า ดังนั้นบางครั้งโมเดลที่ต้องใช้ GPU สำหรับศูนย์ข้อมูลจึงสามารถทำงานบนแล็ปท็อปหรือโทรศัพท์ได้
ภาพรวม
It is the main trick that makes large language models cheap and fast enough to deploy widely.
เจาะลึก
โครงข่ายประสาทเทียมส่วนใหญ่เป็นกองตัวเลขขนาดยักษ์ที่เรียกว่าน้ำหนัก ซึ่งปกติจะจัดเก็บเป็นค่าจุดลอยตัว 16 หรือ 32 บิต การหาปริมาณจะจัดเก็บน้ำหนักเหล่านั้นอีกครั้งโดยใช้บิตน้อยลง โดยทั่วไปจะเป็น 8 บิต (INT8) หรือแม้แต่จำนวนเต็ม 4 บิต การเปลี่ยนจาก 16 บิตไปเป็น 4 บิตจะตัดหน่วยความจำประมาณสี่เท่า ดังนั้นโมเดลที่มีพารามิเตอร์ 7 หมื่นล้านพารามิเตอร์ที่ต้องการพื้นที่ประมาณ 140GB ที่ 16 บิตสามารถมีขนาดประมาณ 35GB ที่ 4 บิตได้ จำนวนที่น้อยกว่ายังเคลื่อนผ่านหน่วยความจำได้เร็วกว่า ซึ่งโดยปกติแล้วจะทำให้การสร้างเร็วขึ้น การจับมีความแม่นยำ: การบีบค่าช่วงกว้างๆ ออกเป็น 2-3 ระดับจะทำให้เกิดข้อผิดพลาดในการปัดเศษ วิธีการที่ดีจะช่วยลดการสูญเสียนั้นได้โดยการเลือกปัจจัยการปรับขนาดอย่างระมัดระวังและปกป้องตุ้มน้ำหนักที่ละเอียดอ่อนที่สุด ดังนั้นแบบจำลองจึงมีพฤติกรรมเกือบจะเหมือนกันในขณะที่ใช้ทรัพยากรเพียงเล็กน้อย
ข้อมูลเชิงลึกทางเทคนิค
ตุ้มน้ำหนักแต่ละกลุ่มจะได้รับตัวคูณมาตราส่วนที่จับคู่ค่าจริงกับจำนวนเต็มชุดเล็กๆ การคูณกลับด้วยมาตราส่วนโดยประมาณจะสร้างตัวเลขเดิมขึ้นมาใหม่ วิธีการวัดปริมาณหลังการฝึกอบรม เช่น GPTQ และ AWQ จะวิเคราะห์ชุดข้อมูลการสอบเทียบขนาดเล็กเพื่อตัดสินใจว่าตุ้มน้ำหนักใดมีความสำคัญมากที่สุด และกำหนดมาตราส่วนเพื่อลดข้อผิดพลาดของเอาท์พุตให้เหลือน้อยที่สุด แทนที่จะปัดเศษทุกอย่างแบบสุ่มสี่สุ่มห้า การเปิดใช้งานมักจะถูกเก็บไว้ที่ความแม่นยำสูงกว่า เนื่องจากจะแตกต่างกันไปที่รันไทม์ ผลลัพธ์คือแบบจำลองที่เก็บจำนวนเต็ม 4 บิต แต่คำนวณผลลัพธ์ใกล้เคียงกับเวอร์ชันที่มีความแม่นยำเต็มรูปแบบอย่างมาก
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของการหาปริมาณ
คาดว่าการกำหนดปริมาณจะกลายเป็นค่าเริ่มต้น แทนที่จะเป็นการปรับให้เหมาะสม ผู้จำหน่ายฮาร์ดแวร์กำลังเพิ่มการรองรับแบบเนทิฟแบบ 4 บิตหรือแบบบิตต่ำกว่า และเทคนิคต่างๆ เช่น การฝึกความทนทานต่อการอบแบบการรับรู้เชิงปริมาณเพื่อความแม่นยำต่ำในแบบจำลองตั้งแต่เริ่มต้น ช่วยลดการสูญเสียความแม่นยำเพิ่มเติม การวิจัยเกี่ยวกับการเป็นตัวแทนแบบ 2 บิตและ 1 บิต (ไบนารี) กำลังทำงานอยู่ โดยมีเป้าหมายเพื่อใช้งานโมเดลที่มีความสามารถบนโทรศัพท์และชิปแบบฝัง เมื่อ AI บนอุปกรณ์และส่วนตัวเติบโตขึ้น โมเดลเชิงปริมาณที่มีประสิทธิภาพจะเป็นศูนย์กลางในการเรียกใช้ผู้ช่วยในพื้นที่โดยไม่ต้องส่งข้อมูลไปยังคลาวด์
การใช้งานจริงในโลกแห่งความเป็นจริง
ใช้งานโมเดลการแชท เช่น Llama ภายในเครื่องบน GPU สำหรับผู้บริโภค โดยใช้ไฟล์ GGUF หรือ GPTQ 4 บิต แทนที่จะต้องใช้การ์ดศูนย์ข้อมูลหลายใบ
ตัวช่วยในอุปกรณ์บนโทรศัพท์ โดยที่รุ่น 8 บิตหรือ 4 บิตทำให้ฟีเจอร์คำพูดและข้อความทำงานได้โดยไม่ต้องเชื่อมต่อเครือข่าย
ลดต้นทุนการอนุมานบนคลาวด์สำหรับบอทสนับสนุนลูกค้าโดยให้บริการโมเดล INT8 และปรับคำขอเพิ่มเติมให้กับ GPU แต่ละตัว
อุปกรณ์ Edge เช่น กล้องอัจฉริยะหรือเซ็นเซอร์ IoT ที่ใช้โมเดลภาษาวิชั่นเชิงปริมาณขนาดกะทัดรัดภายในขีดจำกัดหน่วยความจำที่จำกัด
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การหาปริมาณเวกเตอร์ตกค้าง
คำถามที่พบบ่อย
What is Quantization?
การหาปริมาณจะย่อขนาดโมเดล AI โดยการจัดเก็บตัวเลขด้วยความแม่นยำที่ต่ำกว่า ดังนั้นบางครั้งโมเดลที่ต้องใช้ GPU สำหรับศูนย์ข้อมูลจึงสามารถทำงานบนแล็ปท็อปหรือโทรศัพท์ได้ เป็นเคล็ดลับหลักที่ทำให้โมเดลภาษาขนาดใหญ่ราคาถูกและเร็วพอที่จะปรับใช้ในวงกว้าง
การหาปริมาณเปลี่ยนแปลงอะไรเกี่ยวกับโครงข่ายประสาทเทียมเป็นหลัก?
การหาปริมาณจะจัดเก็บน้ำหนักของโมเดลอีกครั้งด้วยความแม่นยำเชิงตัวเลขที่ต่ำกว่า เช่น จำนวนเต็ม 8 บิตหรือ 4 บิต แทนที่จะเป็นจำนวนทศนิยม 16 หรือ 32 บิต
หน่วยความจำจะประหยัดได้ประมาณเท่าใดโดยการย้ายน้ำหนักจาก 16 บิตเป็น 4 บิต
4 บิตคือหนึ่งในสี่ของ 16 บิต ดังนั้นการจัดเก็บน้ำหนักจึงลดลงเหลือประมาณหนึ่งในสี่ หรือลดลงประมาณ 4 เท่า
ข้อเสียเปรียบหลักของการหาปริมาณเชิงรุกคืออะไร?
การแสดงค่าที่มีระดับน้อยกว่าจะทำให้เกิดข้อผิดพลาดในการปัดเศษ ซึ่งอาจทำให้คุณภาพเอาต์พุตลดลงได้หากไม่ได้รับการจัดการอย่างระมัดระวัง
วิธีการต่างๆ เช่น GPTQ และ AWQ ใช้ชุดข้อมูลการสอบเทียบขนาดเล็กเพื่ออะไร
วิธีหลังการฝึกอบรมเหล่านี้จะวิเคราะห์อินพุตตัวอย่างบางส่วนเพื่อกำหนดปัจจัยการปรับขนาดและปกป้องตุ้มน้ำหนักที่ละเอียดอ่อน เพื่อรักษาเอาต์พุตให้ใกล้เคียงกับต้นฉบับ
เหตุใดการหาปริมาณจึงมักทำให้โมเดลเร็วขึ้น ไม่ใช่แค่เล็กลงเท่านั้น
ค่าที่มีความแม่นยำต่ำกว่าจะใช้แบนด์วิดท์หน่วยความจำน้อยลงในการโหลดและย้าย ซึ่งมักจะเป็นปัญหาคอขวดในระหว่างการสร้าง ดังนั้นการอนุมานจึงเร็วขึ้น