HƯỚNG DẪN KỸ THUẬT

SmoothQuant và Lượng tử hóa kích hoạt

SmoothQuant là một kỹ thuật giúp nén các mô hình ngôn ngữ lớn xuống số nguyên 8 bit cho cả trọng số và kích hoạt mà không cần đào tạo lại.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.

Lặn sâu

Khi bạn thu nhỏ một mô hình từ số float 16 bit thành số nguyên 8 bit, trọng số sẽ dễ dàng bị nén nhưng việc kích hoạt lại gặp khó khăn: một số kênh nhất định mang giá trị lớn hơn 10 đến 100 lần so với các số còn lại và buộc chúng vào một lưới số nguyên thô sẽ làm mất đi độ chính xác. SmoothQuant, được giới thiệu bởi Xiao và cộng sự. vào năm 2022, nhận thấy rằng trọng số trơn tru và dễ định lượng trong khi số lần kích hoạt tăng đột biến. Vì vậy, nó giải quyết khó khăn một cách toán học: nó chia các kênh kích hoạt theo thang đo trên mỗi kênh và nhân trọng số tương ứng với cùng một thang đo. Hai thao tác này bị hủy, khiến đầu ra của mô hình không thay đổi, nhưng giờ đây cả hai tensor đều nằm trong phạm vi phù hợp. Kết quả là suy luận W8A8 (trọng lượng và kích hoạt 8 bit) với mức độ mất độ chính xác gần như bằng 0 và tăng tốc khoảng 2 lần cũng như tiết kiệm bộ nhớ.

Hiểu biết kỹ thuật

Bí quyết cốt lõi là hệ số làm mịn trên mỗi kênh được tính là s = ​​max(|X|)^alpha / max(|W|)^(1-alpha). Kích hoạt được chia tỷ lệ theo 1/s và trọng số theo s, do đó tích ma trận XW được giữ nguyên. Bởi vì việc chia tỷ lệ được hấp thụ ngoại tuyến vào trọng số của lớp trước hoặc hoạt động hợp nhất nên nó sẽ tăng thêm chi phí thời gian chạy bằng 0. Siêu tham số alpha (thường là 0,5) kiểm soát mức độ thay đổi gánh nặng ngoại lệ từ kích hoạt sang trọng số.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của SmoothQuant và Lượng tử hóa kích hoạt

SmoothQuant đã xác định rằng các ngoại lệ kích hoạt có thể di chuyển được thay vì không thể tránh khỏi và ý tưởng đó hiện đang củng cố việc phân phát INT8 và FP8 sản xuất. Mong đợi việc làm mịn sẽ được kết hợp với các sơ đồ chi tiết hơn như lượng tử hóa theo nhóm, chia tỷ lệ đã học và nghiên cứu kích hoạt 4 bit (ví dụ: các phương pháp nhận biết ngoại lệ). Khi phần cứng FP8 (Hopper, Blackwell) trưởng thành, việc cân bằng kiểu làm mịn sẽ tiếp tục được đưa vào các đường dẫn của trình biên dịch và công cụ suy luận để quá trình lượng tử hóa gần như không bị ảnh hưởng.

Triển khai trong thế giới thực

Cung cấp LLM tham số 70B ở W8A8 trên ít GPU hơn bằng cách giảm một nửa cả chi phí bộ nhớ và nhân ma trận

Kích hoạt suy luận INT8 trên lõi tensor NVIDIA Hopper/Blackwell giúp tăng tốc toán học số nguyên 8 bit

Triển khai các mô hình trò chuyện trên các điểm cuối đám mây có chi phí hạn chế, trong đó việc tăng gấp đôi thông lượng sẽ trực tiếp cắt giảm hóa đơn cho mỗi mã thông báo

Nén bộ mã hóa biến áp để dịch hoặc nói trên thiết bị trong đó hạt nhân 8 bit chạy nhanh hơn và mát hơn

Rủi ro & lan can

Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

1

Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

2

Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

3

Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

4

Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SmoothQuant and Activation Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Kỹ thuật đại diện và chỉ đạo kích hoạt

Câu hỏi thường gặp

What is SmoothQuant and Activation Quantization?

SmoothQuant là một kỹ thuật giúp nén các mô hình ngôn ngữ lớn xuống số nguyên 8 bit cho cả trọng số và kích hoạt mà không cần đào tạo lại. Điều này quan trọng vì các kích hoạt trong các mô hình lớn chứa các ngoại lệ cực đoan thường phá hỏng phép toán có độ chính xác thấp và SmoothQuant đã chế ngự chúng.

SmoothQuant giải quyết cụ thể vấn đề gì trong suy luận có độ chính xác thấp?

SmoothQuant nhắm mục tiêu các giá trị ngoại lệ lớn xuất hiện trong các kênh kích hoạt nhất định, nếu không sẽ phá hủy độ chính xác khi kích hoạt được lượng tử hóa thành 8 bit.

SmoothQuant giúp định lượng kích hoạt dễ dàng hơn như thế nào?

Nó chia các kênh kích hoạt theo thang đo trên mỗi kênh và nhân trọng số phù hợp với thang đo đó, do đó sản phẩm không thay đổi nhưng cả hai tensor trở nên dễ lượng tử hóa hơn.

Ký hiệu W8A8 có nghĩa là gì?

W8A8 biểu thị lượng tử hóa 8 bit cho cả trọng số (W) và kích hoạt (A), chế độ SmoothQuant cho phép giảm độ chính xác ở mức tối thiểu.

Tại sao việc mở rộng quy mô của SmoothQuant về cơ bản không tăng thêm chi phí thời gian chạy?

Các thang đo làm mịn được xếp vào trọng số của lớp trước hoặc một op hợp nhất trước thời hạn, do đó không có tính toán bổ sung nào xảy ra khi suy luận.

Siêu tham số alpha đóng vai trò gì trong SmoothQuant?

Alpha (thường là 0,5) cân bằng hệ số làm mịn, quyết định mức độ khó lượng tử hóa được chuyển ra khỏi kích hoạt và chuyển sang trọng số.