HƯỚNG DẪN KỸ THUẬT

Lượng tử hóa sau đào tạo GPTQ và AWQ

GPTQ và AWQ là hai phương pháp hàng đầu để thu nhỏ các mô hình ngôn ngữ đã được đào tạo xuống độ chính xác 4 bit để chúng chạy trên phần cứng nhỏ hơn, rẻ hơn.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Đó là lý do tại sao bạn có thể chạy một mô hình có khả năng trên một GPU tiêu dùng thay vì giá đỡ trung tâm dữ liệu.

Lặn sâu

Lượng tử hóa sau đào tạo (PTQ) nén một mô hình đã hoàn thiện mà không cần đào tạo lại nó, ánh xạ các trọng số có độ chính xác cao xuống còn 4 bit để tạo thành một phần tư bộ nhớ. Thách thức là thực hiện việc này mà không làm giảm độ chính xác. GPTQ (một bản sàng lọc của OBQ) định lượng các trọng số theo từng lớp, sử dụng thông tin bậc hai từ một tập dữ liệu hiệu chuẩn nhỏ để điều chỉnh các trọng số còn lại và bù cho từng lỗi làm tròn. AWQ (Lượng tử hóa trọng lượng nhận biết kích hoạt) có một góc độ khác: nó nhận thấy rằng một phần nhỏ các kênh trọng lượng có tầm quan trọng không tương xứng, được xác định bằng cách xem xét cường độ kích hoạt và bảo vệ các kênh nổi bật đó bằng cách mở rộng quy mô thay vì lượng tử hóa chúng một cách mạnh mẽ. Cả hai đều cho phép các mô hình như Llama chạy trong 4 bit và các công cụ như vLLM, llama.cpp và AutoGPTQ đã khiến chúng trở thành xu hướng chủ đạo cho suy luận cục bộ và tiết kiệm chi phí.

Hiểu biết kỹ thuật

GPTQ sử dụng giá trị gần đúng của Hessian (độ cong của tổn thất) để quyết định cách làm tròn một trọng số sẽ tác động lên các trọng số khác như thế nào, giảm thiểu sai số được đưa ra. AWQ bỏ qua hoàn toàn Hessian: nó tính toán hệ số tỷ lệ trên mỗi kênh để các kênh trọng số quan trọng giữ được độ chính xác hiệu quả, sau đó lượng tử hóa một cách đồng nhất. Cả hai đều giữ cho kích hoạt ở độ chính xác cao hơn và chỉ nén trọng số, vì trọng số chiếm ưu thế trong bộ nhớ trong khi lượng tử hóa kích hoạt có xu hướng làm giảm độ chính xác hơn.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của lượng tử hóa sau đào tạo GPTQ và AWQ

Lượng tử hóa đang đẩy dưới 4 bit sang các sơ đồ 3 bit, 2 bit và có độ chính xác hỗn hợp, thường được kết hợp với độ thưa thớt. Mong đợi sự kết hợp chặt chẽ hơn với các công cụ phục vụ để lượng tử hóa, nén bộ nhớ đệm KV và giải mã suy đoán hoạt động cùng nhau. Hỗ trợ phần cứng cho các định dạng bit thấp như NVFP4 và MXFP4 đang hoàn thiện và các công cụ tự động sẽ ngày càng chọn độ rộng bit trên mỗi lớp. Mục tiêu rộng rãi là mặc định là 4-bit gần như không mất dữ liệu (và thấp hơn), giúp các mô hình mạnh có giá thành rẻ để phục vụ ở mọi nơi.

Triển khai trong thế giới thực

Chạy mô hình Llama 70 tỷ tham số trên một GPU tiêu dùng 24 GB sử dụng trọng số GPTQ 4 bit.

Các mô hình lượng tử hóa AWQ cung cấp thông lượng cao trong vLLM cho các API sản xuất tiết kiệm chi phí.

llama.cpp sử dụng trọng số GGUF được lượng tử hóa để chạy các mô hình ngôn ngữ cục bộ trên CPU máy tính xách tay.

Thư viện AutoGPTQ và AutoAWQ của Hugging Face cho phép các nhà phát triển định lượng mô hình đã tải xuống chỉ bằng một vài dòng mã.

Rủi ro & lan can

Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

1

Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

2

Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

3

Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

4

Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPTQ and AWQ Post-Training Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Hàm ảnh hưởng để phân bổ dữ liệu đào tạo

Câu hỏi thường gặp

Lượng tử hóa sau đào tạo GPTQ và AWQ là gì?

GPTQ và AWQ là hai phương pháp hàng đầu để thu nhỏ các mô hình ngôn ngữ đã được đào tạo xuống độ chính xác 4 bit để chúng chạy trên phần cứng nhỏ hơn, rẻ hơn. Đó là lý do tại sao bạn có thể chạy một mô hình có khả năng hoạt động trên một GPU tiêu dùng thay vì giá đỡ trung tâm dữ liệu.

'Lượng tử hóa sau đào tạo' nghĩa là gì?

Lượng tử hóa sau đào tạo làm giảm độ chính xác của trọng số của mô hình đã hoàn thiện (ví dụ: xuống còn 4 bit) mà không cần đào tạo lại từ đầu.

GPTQ sử dụng thông tin gì để bù cho lỗi làm tròn khi lượng tử hóa?

GPTQ sử dụng Hessian gần đúng để hiểu mức độ ảnh hưởng của việc lượng tử hóa một trọng số đến tổn thất, sau đó điều chỉnh các trọng số còn lại để bù đắp.

Thông tin chi tiết quan trọng nào thúc đẩy AWQ (Lượng tử hóa trọng lượng nhận biết kích hoạt)?

AWQ xác định các kênh trọng số nổi bật bằng cách sử dụng cường độ kích hoạt và bảo vệ chúng thông qua việc chia tỷ lệ vì một số kênh có tầm quan trọng không tương xứng.

Lượng tử hóa 4 bit tiết kiệm được khoảng bao nhiêu bộ nhớ so với trọng lượng 16 bit?

Việc tăng từ 16 bit lên 4 bit cho mỗi trọng lượng sẽ làm giảm trọng lượng bộ nhớ xuống còn khoảng một phần tư, giảm gần gấp 4 lần.

Tại sao cả GPTQ và AWQ thường lượng tử hóa trọng số nhưng vẫn duy trì kích hoạt ở độ chính xác cao hơn?

Trọng lượng là chi phí bộ nhớ chính, trong khi kích hoạt nhạy cảm hơn với việc mất độ chính xác, do đó, lượng tử hóa chỉ theo trọng lượng là điểm hấp dẫn phổ biến.