Làm mịn nhãn
Làm mịn nhãn là một thủ thuật chính quy hóa đơn giản giúp làm mềm các mục tiêu huấn luyện khó nhất, cho mô hình biết câu trả lời đúng là rất có thể nhưng không chắc chắn 100%.
Tổng quan
It improves calibration and generalization across image and language models with almost no extra cost.
Lặn sâu
Thông thường, một bộ phân loại được huấn luyện trên các nhãn một điểm nóng: lớp thực sự đạt mục tiêu 1.0 và mọi thứ khác là 0.0. Kết hợp với entropy chéo và softmax, điều này thúc đẩy mô hình tạo ra logit chính xác lớn hơn nhiều so với phần còn lại, khuyến khích sự tự tin thái quá và khớp quá mức. Làm mịn nhãn thay thế mục tiêu bằng (1 - epsilon) cho lớp thực và epsilon/(K-1) trải rộng trên các lớp K khác, trong đó epsilon nhỏ (thường là 0,1). Mô hình hiện hướng tới sự phân phối tự tin nhưng không tuyệt đối. Được giới thiệu trong tác phẩm Inception-v3 năm 2016 và sau đó được nhóm của Hinton phân tích, nó đã cải thiện độ chính xác của ImageNet và là tiêu chuẩn trong Transformers, trong đó giấy Chú ý là tất cả những gì bạn cần ban đầu sử dụng epsilon 0,1.
Hiểu biết kỹ thuật
Với các nhãn cứng, việc giảm thiểu entropy chéo sẽ đưa logit chính xác về phía dương vô cực so với các nhãn khác, điều này là không thể đạt được và đẩy trọng số lên mức cực đoan. Việc làm mịn đặt ra một khoảng cách tối ưu hữu hạn giữa logit chính xác và phần còn lại, do đó các logit vẫn bị giới hạn và mô hình không còn có độ tin cậy tối đa. Các nghiên cứu cho thấy điều này thắt chặt các cụm cùng loại và tạo ra xác suất được hiệu chỉnh tốt hơn, độ tin cậy được dự đoán phù hợp với độ chính xác thực tế. Sự đánh đổi: nó có thể xóa thông tin chi tiết về sự tương đồng giữa các lớp, điều này đôi khi làm ảnh hưởng đến quá trình chắt lọc kiến thức ở những nơi mà những mối quan hệ mềm mại đó đóng vai trò quan trọng.
Tác động chiến lược
Quyết định rõ ràng hơn
Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.
Chi phí và ngân sách
Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.
Nhóm và quy trình làm việc
Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.
Tương lai của việc làm mịn nhãn
Làm mịn nhãn vẫn là mặc định trong đào tạo quy mô lớn, nhưng nghiên cứu đang hướng tới làm mịn thích ứng và học được để điều chỉnh epsilon trên mỗi ví dụ hoặc lớp thay vì sử dụng một giá trị cố định. Các phương pháp tập trung vào hiệu chuẩn như mất tiêu cự và chia tỷ lệ nhiệt độ thường được cân nhắc hoặc kết hợp với nó. Khi các mô hình phát triển và các ước tính độ không đảm bảo đáng tin cậy trở nên quan trọng về mặt an toàn, hãy kỳ vọng việc làm mịn sẽ là một trong nhiều công cụ để tạo ra điểm tin cậy đáng tin cậy, với sự chú ý cẩn thận đến xung đột đã biết của nó với quá trình chưng cất.
Triển khai trong thế giới thực
Phân loại ImageNet: Inception-v3 đã sử dụng tính năng làm mịn nhãn (epsilon 0,1) để tăng độ chính xác top 1 và giảm sự tự tin thái quá.
Dịch máy: Transformer ban đầu áp dụng độ mịn nhãn là 0,1, giao dịch một chút bối rối để có điểm BLEU cao hơn.
Nhận dạng giọng nói: các mục tiêu được làm mịn sẽ giảm khả năng nhận dạng sai quá tự tin và cải thiện hiệu chỉnh đối với âm thanh ồn.
Các mô hình hình ảnh y tế: việc làm mịn mang lại xác suất được hiệu chỉnh tốt hơn, điều này rất quan trọng khi điểm tin cậy giúp đưa ra các quyết định lâm sàng.
Rủi ro & lan can
Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.
Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.
Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.
Lộ trình thực hiện
Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.
Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.
Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.
Tài liệu giúp làm mịn nhãn và nơi các phương pháp đơn giản hơn sẽ tốt hơn.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Label Smoothing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Phân cụm K-Means
Câu hỏi thường gặp
What is Label Smoothing?
Làm mịn nhãn là một thủ thuật chính quy hóa đơn giản giúp làm mềm các mục tiêu huấn luyện khó nhất, cho mô hình biết câu trả lời đúng là rất có thể nhưng không chắc chắn 100%. Nó cải thiện hiệu chuẩn và khái quát hóa trên các mô hình hình ảnh và ngôn ngữ mà hầu như không mất thêm chi phí.
Làm mịn nhãn thay đổi gì về mục tiêu đào tạo?
Thay vì mục tiêu cố định 1,0/0,0, việc làm mịn nhãn sẽ gán (1 - epsilon) cho lớp thực và trải rộng epsilon sang các lớp khác.
Vấn đề gì xảy ra với nhãn cứng một nóng khi làm mịn?
Việc giảm thiểu entropy chéo trên các mục tiêu một mục tiêu sẽ thúc đẩy logit chính xác về phía vô cực so với các mục tiêu khác, khuyến khích sự tự tin thái quá và trang bị quá mức.
Những kiến trúc mang tính bước ngoặt nào đã giúp phổ biến việc làm mịn nhãn?
Làm mịn nhãn đã được giới thiệu trong bài báo Inception-v3 năm 2016 và được Transformer (Chú ý là tất cả những gì bạn cần) với epsilon 0.1.
Ngoài độ chính xác, việc làm mịn nhãn còn có lợi ích gì?
Làm mịn cải thiện hiệu chuẩn, độ tin cậy được dự đoán sẽ phù hợp chặt chẽ hơn với khả năng chính xác thực sự.
Nhược điểm được ghi lại của việc làm mịn nhãn là gì?
Bằng cách thắt chặt các cụm và làm phẳng các mối quan hệ mềm giữa các lớp, việc làm mịn có thể loại bỏ thông tin mà quá trình chắt lọc kiến thức dựa vào.