คู่มือทางเทคนิค

การกำหนดปริมาณหลังการฝึกอบรม GPTQ และ AWQ

GPTQ และ AWQ เป็นสองวิธีชั้นนำในการลดขนาดโมเดลภาษาที่ได้รับการฝึกมาแล้วให้มีความแม่นยำ 4 บิต เพื่อให้ทำงานบนฮาร์ดแวร์ที่มีราคาถูกลงและมีขนาดเล็กลง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.

เจาะลึก

การวัดปริมาณหลังการฝึก (PTQ) บีบอัดแบบจำลองที่เสร็จแล้วโดยไม่ต้องฝึกซ้ำ โดยจับคู่น้ำหนักที่มีความแม่นยำสูงลงไปที่ 4 บิตเพื่อแบ่งส่วนหน่วยความจำโดยประมาณ ความท้าทายคือการทำเช่นนี้โดยไม่ทำลายความแม่นยำ GPTQ (การปรับแต่ง OBQ) จะคำนวณปริมาณน้ำหนักทีละชั้น โดยใช้ข้อมูลลำดับที่สองจากชุดข้อมูลการสอบเทียบขนาดเล็ก เพื่อปรับน้ำหนักที่เหลือและชดเชยข้อผิดพลาดในการปัดเศษแต่ละครั้ง AWQ (การหาปริมาณน้ำหนักที่รับรู้การเปิดใช้งาน) มีมุมมองที่แตกต่างออกไป: โดยสังเกตว่าส่วนเล็กๆ ของช่องน้ำหนักมีความสำคัญอย่างไม่เป็นสัดส่วน โดยระบุโดยการดูขนาดการเปิดใช้งาน และปกป้องช่องทางหลักเหล่านั้นด้วยการปรับขนาดแทนที่จะหาปริมาณอย่างจริงจัง ทั้งสองรุ่นปล่อยให้โมเดลอย่าง Llama ทำงานแบบ 4 บิต และเครื่องมืออย่าง vLLM, llama.cpp และ AutoGPTQ ทำให้โมเดลเหล่านี้เป็นกระแสหลักสำหรับการอนุมานในท้องถิ่นและคุ้มค่า

ข้อมูลเชิงลึกทางเทคนิค

GPTQ ใช้การประมาณ Hessian (ความโค้งของการสูญเสีย) เพื่อตัดสินใจว่าการปัดเศษน้ำหนักหนึ่งควรสะกิดน้ำหนักอื่นๆ อย่างไร เพื่อลดข้อผิดพลาดที่เกิดขึ้น AWQ ข้าม Hessians ไปโดยสิ้นเชิง โดยคำนวณปัจจัยการปรับขนาดต่อช่องสัญญาณ เพื่อให้ช่องน้ำหนักที่สำคัญรักษาความแม่นยำที่มีประสิทธิภาพ จากนั้นจึงหาปริมาณอย่างสม่ำเสมอ ทั้งสองเก็บการเปิดใช้งานด้วยความแม่นยำสูงกว่าและบีบอัดตุ้มน้ำหนักเท่านั้น เนื่องจากตุ้มน้ำหนักมีอิทธิพลเหนือหน่วยความจำ ในขณะที่การหาปริมาณการเปิดใช้งานมีแนวโน้มที่จะส่งผลเสียต่อความแม่นยำมากกว่า

ผลกระทบเชิงกลยุทธ์

ต้นทุนและงบประมาณ

การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี

การตัดสินใจที่ชัดเจนยิ่งขึ้น

การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด

การควบคุมคุณภาพ

ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต

อนาคตของการกำหนดปริมาณหลังการฝึกอบรม GPTQ และ AWQ

การหาปริมาณกำลังผลักดันให้ต่ำกว่า 4 บิตไปสู่รูปแบบ 3 บิต, 2 บิต และแบบผสมที่มีความแม่นยำ ซึ่งมักจะรวมกับความกระจัดกระจาย คาดว่าจะมีการเชื่อมต่อกับเอ็นจิ้นที่ให้บริการอย่างใกล้ชิดยิ่งขึ้น ดังนั้นการหาปริมาณ การบีบอัดแคช KV และการถอดรหัสแบบเก็งกำไรจึงทำงานร่วมกันได้ การสนับสนุนฮาร์ดแวร์สำหรับรูปแบบบิตต่ำ เช่น NVFP4 และ MXFP4 กำลังเติบโตเต็มที่ และเครื่องมืออัตโนมัติจะเลือกความกว้างบิตต่อเลเยอร์เพิ่มมากขึ้น เป้าหมายกว้างๆ คือ 4 บิต (และต่ำกว่า) ที่ไม่มีการสูญเสียเกือบเป็นค่าเริ่มต้น ทำให้โมเดลที่แข็งแกร่งมีราคาถูกและใช้งานได้ทุกที่

การใช้งานจริงในโลกแห่งความเป็นจริง

ใช้งานโมเดล Llama ที่มีพารามิเตอร์ 70 พันล้านพารามิเตอร์บน GPU สำหรับผู้ใช้ทั่วไปขนาด 24 GB ตัวเดียว โดยใช้ตุ้มน้ำหนัก GPTQ 4 บิต

โมเดลเชิงปริมาณ AWQ ให้บริการที่ปริมาณงานสูงใน vLLM สำหรับ API การผลิตที่คุ้มต้นทุน

llama.cpp ใช้น้ำหนัก GGUF เชิงปริมาณเพื่อรันโมเดลภาษาภายในเครื่องบน CPU ของแล็ปท็อป

ไลบรารี AutoGPTQ และ AutoAWQ ของ Hugging Face ช่วยให้นักพัฒนาระบุจำนวนโมเดลที่ดาวน์โหลดโดยใช้โค้ดเพียงไม่กี่บรรทัด

ความเสี่ยงและรั้ว

การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้

ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป

ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น

แผนงานการดำเนินงาน

1

กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน

2

เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง

3

การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้

4

เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPTQ and AWQ Post-Training Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ฟังก์ชันที่มีอิทธิพลต่อการระบุแหล่งที่มาของข้อมูลการฝึกอบรม

คำถามที่พบบ่อย

What is GPTQ and AWQ Post-Training Quantization?

GPTQ และ AWQ เป็นสองวิธีชั้นนำในการลดขนาดโมเดลภาษาที่ได้รับการฝึกมาแล้วให้มีความแม่นยำ 4 บิต เพื่อให้ทำงานบนฮาร์ดแวร์ที่มีราคาถูกลงและมีขนาดเล็กลง นี่คือเหตุผลว่าทำไมคุณจึงสามารถใช้งานโมเดลที่มีความสามารถบน GPU สำหรับผู้บริโภคเพียงตัวเดียว แทนที่จะเป็นแร็คศูนย์ข้อมูล

'การวัดปริมาณหลังการฝึกอบรม' หมายความว่าอย่างไร

การกำหนดปริมาณหลังการฝึกจะลดความแม่นยำของน้ำหนักของแบบจำลองที่เสร็จแล้ว (เช่น เหลือ 4 บิต) โดยไม่ต้องฝึกใหม่ตั้งแต่ต้น

GPTQ ใช้ข้อมูลใดเพื่อชดเชยข้อผิดพลาดในการปัดเศษเมื่อหาปริมาณ

GPTQ ใช้ Hessian โดยประมาณเพื่อทำความเข้าใจว่าการหาปริมาณน้ำหนักหนึ่งส่งผลต่อการสูญเสียอย่างไร จากนั้นจึงปรับน้ำหนักที่เหลือเพื่อชดเชย

ข้อมูลเชิงลึกที่สำคัญประการใดที่ขับเคลื่อน AWQ (ปริมาณน้ำหนักที่รับรู้ถึงการเปิดใช้งาน)

AWQ ระบุช่องทางน้ำหนักหลักโดยใช้ขนาดการเปิดใช้งาน และปกป้องช่องทางเหล่านั้นผ่านการปรับขนาด เนื่องจากมีช่องทางไม่กี่ช่องทางที่มีความสำคัญอย่างไม่สมส่วน

การหาปริมาณหน่วยความจำแบบ 4 บิตประหยัดได้ประมาณเท่าใดเมื่อเทียบกับน้ำหนักแบบ 16 บิต

การเปลี่ยนจาก 16 บิตเป็น 4 บิตต่อน้ำหนักจะลดหน่วยความจำน้ำหนักลงเหลือประมาณหนึ่งในสี่ หรือลดลงประมาณ 4 เท่า

เหตุใดทั้ง GPTQ และ AWQ จึงมักหาปริมาณน้ำหนักแต่ให้การเปิดใช้งานที่มีความแม่นยำสูงกว่า

น้ำหนักคือต้นทุนหน่วยความจำหลัก ในขณะที่การเปิดใช้งานมีความอ่อนไหวต่อการสูญเสียความแม่นยำมากกว่า ดังนั้น การหาปริมาณเฉพาะน้ำหนักจึงเป็นจุดสนใจทั่วไป