การหาปริมาณแบบจำลอง
การหาปริมาณโมเดลจะลดขนาดโครงข่ายประสาทเทียมโดยการจัดเก็บตัวเลขไว้ในบิตที่น้อยลง ดังนั้นโมเดลเดียวกันจึงทำงานได้เร็วขึ้นและบนฮาร์ดแวร์ที่เล็กกว่า
ภาพรวม
นี่คือเหตุผลหลักที่โมเดลขนาดใหญ่สามารถใส่ GPU แล็ปท็อป หรือแม้แต่โทรศัพท์ได้
เจาะลึก
โดยปกติโมเดลที่ผ่านการฝึกอบรมจะจัดเก็บน้ำหนักแต่ละรายการเป็นตัวเลขทศนิยม 32 บิตหรือ 16 บิต การหาปริมาณจะแทนที่รูปแบบที่มีความแม่นยำต่ำกว่า เช่น จำนวนเต็ม 8 บิต (INT8) หรือค่า 4 บิต (INT4) ซึ่งตัดหน่วยความจำประมาณ 4x ถึง 8x โมเดลที่มีพารามิเตอร์ 7 หมื่นล้านพารามิเตอร์ที่ต้องการพื้นที่ประมาณ 140GB ใน 16 บิตสามารถลดลงได้เกือบ 35GB ที่ 4 บิต ซึ่งเหมาะสมกับ GPU สำหรับผู้บริโภคเพียงตัวเดียว การจับมีความแม่นยำ: การบีบค่าที่หลากหลายลงในที่เก็บข้อมูล 256 หรือ 16 จะสูญเสียรายละเอียด วิธีการสมัยใหม่ เช่น GPTQ, AWQ และรูปแบบ NF4 ที่ใช้ใน QLoRA จะเลือกปัจจัยการปรับขนาดอัจฉริยะและปกป้องน้ำหนักที่ละเอียดอ่อนที่สุด ดังนั้น การสูญเสียคุณภาพจึงมักจะเพียงเล็กน้อย การหาปริมาณคือสาเหตุที่เครื่องมืออย่าง llama.cpp และ Ollama สามารถเรียกใช้โมเดลที่มีความสามารถภายในเครื่องได้โดยไม่ต้องใช้ศูนย์ข้อมูล
ข้อมูลเชิงลึกทางเทคนิค
การหาปริมาณจะจับคู่ค่าจริงกับตารางจำนวนเต็มขนาดเล็กโดยใช้มาตราส่วนและจุดศูนย์: store_int = round(value / scale) + zero_point การเลือกขนาดบ่อถือเป็นเกมทั้งหมด มาตราส่วนต่อช่องหรือต่อกลุ่มจะแยกมาตราส่วนสำหรับเมทริกซ์น้ำหนักเป็นชิ้นๆ โดยรักษาความแม่นยำในส่วนที่สำคัญ การวัดปริมาณหลังการฝึกอบรมเพียงแปลงแบบจำลองที่เสร็จสมบูรณ์ ในขณะที่การฝึกอบรมที่คำนึงถึงปริมาณจะจำลองการปัดเศษระหว่างการฝึกอบรม เพื่อให้เครือข่ายเรียนรู้ที่จะยอมรับมัน ซึ่งมักจะให้ความแม่นยำบิตต่ำที่ดีกว่า
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของการหาปริมาณแบบจำลอง
คาดว่าความแม่นยำที่ลดลงจะกลายเป็นปกติ การวิจัยกำลังผลักดันน้ำหนักแบบ 4 บิต 2 บิต และแม้กระทั่งไบนารี่ที่เชื่อถือได้ รวมถึงโครงร่างที่มีความแม่นยำแบบผสมที่ทำให้เลเยอร์ที่ละเอียดอ่อนสูงขึ้น ฮาร์ดแวร์มีดังต่อไปนี้: ขณะนี้ GPU และชิปโทรศัพท์มีหน่วยคณิตศาสตร์ INT8, INT4 และ FP8 ดั้งเดิมแล้ว รูปแบบเช่น FP8 และ MXFP4 มุ่งหมายที่จะรวมช่วงจำนวนทศนิยมเข้ากับขนาดของจำนวนเต็ม เมื่อรวมกับเทคนิคอย่าง QLoRA แล้ว การหาปริมาณจะทำให้โมเดลระดับแนวหน้ามีราคาถูกกว่าในการใช้งานและปรับแต่งบนอุปกรณ์ในชีวิตประจำวัน
การใช้งานจริงในโลกแห่งความเป็นจริง
ใช้งานรุ่น Llama 7B หรือ 13B บนแล็ปท็อปที่มี llama.cpp หรือ Ollama โดยใช้ไฟล์ GGUF 4 บิต
QLoRA ปรับแต่งโมเดลขนาดใหญ่บน GPU ตัวเดียวโดยคงน้ำหนักพื้นฐานไว้ใน NF4 4 บิต
การปรับใช้รุ่น INT8 บนโทรศัพท์ที่มีรันไทม์บนอุปกรณ์ เพื่อให้ผู้ช่วยทำงานแบบออฟไลน์และเป็นส่วนตัว
ให้บริการตำแหน่งข้อมูล API ที่ราคาถูกกว่า โดยการหาปริมาณ INT8/FP8 จะเพิ่มปริมาณงานเป็นสองเท่าโดยประมาณ และลดต้นทุนหน่วยความจำ
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การลงทะเบียนโมเดล
คำถามที่พบบ่อย
Model Quantization คืออะไร?
การหาปริมาณโมเดลจะลดขนาดโครงข่ายประสาทเทียมโดยการจัดเก็บตัวเลขไว้ในบิตที่น้อยลง ดังนั้นโมเดลเดียวกันจึงทำงานได้เร็วขึ้นและบนฮาร์ดแวร์ที่เล็กกว่า นี่คือเหตุผลหลักที่โมเดลขนาดใหญ่สามารถใส่ GPU แล็ปท็อป หรือแม้แต่โทรศัพท์ได้
การหาปริมาณแบบจำลองเปลี่ยนแปลงอะไรเกี่ยวกับโครงข่ายประสาทเทียมเป็นหลัก
การหาปริมาณจะจัดเก็บพารามิเตอร์เดียวกันโดยใช้บิตน้อยลง (เช่น INT8 หรือ INT4 แทนที่จะเป็นโฟลต 16 หรือ 32 บิต) ลดหน่วยความจำและเร่งคณิตศาสตร์ให้เร็วขึ้น
หน่วยความจำประมาณเท่าใดที่สามารถแปลงโมเดลจาก 16 บิตเป็น 4 บิตได้
การเปลี่ยนจาก 16 บิตต่อน้ำหนักเป็น 4 บิตจะลดพื้นที่จัดเก็บลงประมาณสี่เท่า ซึ่งเป็นเหตุผลว่าทำไมโมเดลขนาดใหญ่จึงสามารถใส่ GPU ตัวเดียวได้
ข้อเสียเปรียบหลักของการหาปริมาณบิตต่ำเชิงรุกคืออะไร?
การแมปค่าต่างๆ ลงบนระดับที่แยกจากกันเพียงไม่กี่ระดับจะสูญเสียรายละเอียด ซึ่งอาจลดคุณภาพได้ เว้นแต่การปรับขนาดอัจฉริยะจะปกป้องน้ำหนักที่ละเอียดอ่อน
การฝึกอบรมที่คำนึงถึงเชิงปริมาณแตกต่างจากการวัดปริมาณหลังการฝึกอบรมอย่างไร
การฝึกอบรมที่คำนึงถึงเชิงปริมาณจะสร้างข้อผิดพลาดในการปัดเศษในลูปการฝึกอบรม ดังนั้นเครือข่ายจึงปรับเปลี่ยนและมักจะรักษาความแม่นยำมากขึ้นที่ความกว้างบิตต่ำ
เทคนิคใดที่ใช้การวัดปริมาณ 4 บิตเพื่อปรับแต่งโมเดลขนาดใหญ่อย่างละเอียดในราคาประหยัดด้วย GPU ตัวเดียว
QLoRA เก็บโมเดลพื้นฐานไว้ในรูปแบบ NF4 4 บิต และฝึกน้ำหนักของอะแดปเตอร์ขนาดเล็ก ทำให้โมเดลขนาดใหญ่สามารถปรับแต่งได้อย่างละเอียดบนฮาร์ดแวร์ขนาดเล็ก