Chắt lọc kiến thức
Chắt lọc kiến thức rèn luyện một mô hình “học sinh” nhỏ bắt chước một mô hình “giáo viên” lớn, chính xác.
Tổng quan
It matters because it shrinks powerful models so they run cheaply on phones and servers while keeping much of the accuracy.
Lặn sâu
Các mô hình lớn tuy chính xác nhưng triển khai chậm và tốn kém. Chắt lọc kiến thức chuyển khả năng của họ thành một mô hình nhỏ gọn bằng cách cho học sinh học từ kết quả đầu ra của giáo viên thay vì chỉ từ những nhãn cứng. Cái nhìn sâu sắc quan trọng, từ Hinton và các đồng nghiệp, là phân bố xác suất đầy đủ của giáo viên mang theo “kiến thức đen tối”: ngay cả khi nó dự đoán “con chó”, xác suất tương đối giữa “sói” và “ô tô” tiết lộ cách giáo viên nhìn thấy những điểm tương đồng. Việc làm mềm các xác suất này bằng nhiệt độ sẽ làm lộ ra cấu trúc đó và học sinh được huấn luyện để đối sánh với nó, thường là cùng với các nhãn thực sự. Kết quả là một mô hình nhỏ hơn, nhanh hơn, khái quát hóa tốt hơn mô hình chỉ được đào tạo trên nhãn. DistilBERT và TinyBERT là những mô hình ngôn ngữ chắt lọc nổi tiếng.
Hiểu biết kỹ thuật
Sự mất mát cổ điển kết hợp một thuật ngữ chưng cất (phân kỳ KL giữa xác suất giảm nhẹ của học sinh và giáo viên) với entropy chéo tiêu chuẩn trên các nhãn thực. Làm mềm sử dụng nhiệt độ T trong softmax: T cao hơn sẽ làm phẳng phân bố để những điểm tương đồng nhỏ giữa các lớp trở thành tín hiệu có thể học được; gradient chưng cất thường được chia tỷ lệ theo bình phương T. Các biến thể vượt xa kết quả đầu ra: quá trình chắt lọc dựa trên tính năng khớp với các lớp ẩn trung gian và quá trình chắt lọc dựa trên mối quan hệ khớp với mối quan hệ giữa các ví dụ.
Tác động chiến lược
Chi phí và ngân sách
Các quyết định về kiến trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.
Quyết định rõ ràng hơn
Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.
Kiểm soát chất lượng
Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.
Tương lai của chắt lọc kiến thức
Chưng cất hiện nay là một bước tiêu chuẩn trong việc vận chuyển các mô hình hiệu quả và là trọng tâm của làn sóng các mô hình mở nhỏ, có khả năng hoạt động ngày nay. Xu hướng phát triển nhanh chóng là sự chắt lọc ở cấp độ trình tự từ các mô hình ngôn ngữ lớn, trong đó một mô hình mạnh tạo ra dữ liệu huấn luyện hoặc dấu vết lý luận (bao gồm cả chuỗi suy nghĩ) để dạy cho học sinh nhỏ hơn, làm mờ ranh giới của dữ liệu tổng hợp. Mong đợi sự kết hợp chặt chẽ hơn với lượng tử hóa và cắt bớt, triển khai trên thiết bị nhiều hơn cũng như tranh luận đang diễn ra về cấp phép và chất lượng khi chắt lọc từ các mô hình độc quyền có đầu ra trở thành tín hiệu đào tạo của đối thủ cạnh tranh.
Triển khai trong thế giới thực
DistilBERT nén BERT xuống ít tham số hơn khoảng 40% trong khi vẫn giữ được phần lớn khả năng hiểu ngôn ngữ để suy luận nhanh hơn.
Thu nhỏ mô hình tầm nhìn lớn để bộ phân loại hình ảnh có thể chạy trong thời gian thực trên ứng dụng máy ảnh trên điện thoại thông minh.
Chắt lọc lý luận chuỗi suy nghĩ của một mô hình lớn thành một mô hình nhỏ hơn để giúp nó trả lời các câu hỏi toán học hoặc mã hóa với chi phí rẻ hơn.
Nén một tập hợp các mô hình vào một học sinh duy nhất để giảm chi phí phục vụ sản xuất và độ trễ mà không làm giảm nhiều độ chính xác.
Rủi ro & lan can
Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.
Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.
Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.
Lộ trình thực hiện
Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.
Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.
Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.
Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Knowledge Distillation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Quản lý tri thức AI
Câu hỏi thường gặp
What is Knowledge Distillation?
Chắt lọc kiến thức rèn luyện một mô hình “học sinh” nhỏ bắt chước một mô hình “giáo viên” lớn, chính xác. Điều này quan trọng vì nó thu nhỏ các mô hình mạnh mẽ để chúng chạy với giá rẻ trên điện thoại và máy chủ trong khi vẫn giữ được độ chính xác cao.
Mục tiêu của việc chắt lọc kiến thức là gì?
Chưng cất chuyển khả năng của một giáo viên lớn thành một mô hình học sinh nhỏ gọn, nhanh hơn.
'Kiến thức đen tối' của giáo viên nghĩa là gì?
Kiến thức tối là cấu trúc trong phân bố xác suất đầy đủ của giáo viên, giống như 'sói' và 'chó' giống nhau đến mức nào chứ không chỉ là đáp án đứng đầu.
Nhiệt độ (T) đóng vai trò gì trong quá trình chưng cất?
Nhiệt độ cao hơn làm phẳng phân bố xác suất, bộc lộ những điểm tương đồng tương đối mà học sinh nên học.
Quá trình chưng cất cổ điển kết hợp hai thành phần nào?
Học sinh khớp với phân phối được làm mềm của giáo viên (thuật ngữ KL) đồng thời khớp với các nhãn chân lý cơ bản (entropy chéo).
Đâu là ví dụ về mô hình ngôn ngữ chắt lọc?
DistilBERT là mẫu nổi tiếng được chắt lọc từ BERT, duy trì hiệu suất cao nhất với ít thông số hơn.