Phương pháp tập hợp và tăng cường độ dốc
Phương pháp tập hợp kết hợp nhiều mô hình đơn giản nên nhóm đưa ra dự đoán tốt hơn bất kỳ mô hình đơn lẻ nào.
Tổng quan
Gradient boosting is the most powerful of these — it builds trees one at a time, each correcting the errors of the last, and dominates real-world tabular machine learning.
Lặn sâu
Nhóm học tập dựa trên một ý tưởng đơn giản: nhiều học viên yếu kết hợp lại có thể tạo thành một học viên mạnh. Hai gia đình dẫn đầu. Đóng bao (ví dụ: Rừng ngẫu nhiên) đào tạo song song nhiều cây trên các mẫu ngẫu nhiên và tính trung bình cho chúng, điều này chủ yếu làm giảm phương sai. Tăng cường các mô hình đào tạo một cách tuần tự, mỗi mô hình tập trung vào những sai lầm mà mô hình trước đã mắc phải, điều này chủ yếu làm giảm sai lệch. Tăng cường độ dốc đóng khung mỗi cây mới dưới dạng một bước phù hợp với độ dốc âm - các lỗi còn lại - của hàm mất mát cho đến nay. Các thư viện như XGBoost, LightGBM và CatBoost bổ sung thêm các thủ thuật chính quy hóa, phân chia thông minh và tốc độ. Trên dữ liệu có cấu trúc/dạng bảng — phát hiện gian lận, định giá, xếp hạng — các phương pháp này thường xuyên đánh bại deep learning và giành chiến thắng trong phần lớn các cuộc thi Kaggle.
Hiểu biết kỹ thuật
Trong quá trình tăng cường độ dốc, bạn bắt đầu với một dự đoán thô và liên tục thêm một cây nhỏ phù hợp vào phần dư - độ dốc của tổn thất so với các dự đoán hiện tại. Đóng góp của mỗi cây được tính theo tỷ lệ học tập (độ co rút), do đó mô hình sẽ cải thiện theo từng bước nhỏ. Bởi vì các lỗi sẽ tăng lên nếu bạn khớp quá mức, nên việc chính quy hóa (giới hạn độ sâu của cây, các hàng và tính năng lấy mẫu con, hình phạt L1/L2 đối với trọng số của lá) là điều cần thiết để giữ cho tập hợp không bị ghi nhớ tiếng ồn.
Tác động chiến lược
Quyết định rõ ràng hơn
Nó giúp bạn tách biệt các tuyên bố kỹ thuật rõ ràng khỏi ngôn ngữ tiếp thị.
Chi phí và ngân sách
Bạn có thể đặt các câu hỏi triển khai tốt hơn trước khi chi tiền hoặc thời gian.
Nhóm và quy trình làm việc
Các nhóm có sự hiểu biết chung sẽ đưa ra các quyết định về sản phẩm, chính sách và học tập tốt hơn.
Tương lai của các phương pháp Ensemble và tăng cường độ dốc
Cây được tăng cường độ dốc vẫn là mặc định cho dữ liệu dạng bảng và không có dấu hiệu bị hạ bệ ở đó, ngay cả khi học sâu tiến bộ ở những nơi khác. Mong đợi sự gia tăng liên tục về tốc độ và khả năng tăng tốc GPU, khả năng xử lý gốc tốt hơn đối với dữ liệu được phân loại và dữ liệu bị thiếu cũng như tích hợp chặt chẽ hơn với các quy trình máy học tự động (AutoML). Nghiên cứu kết hợp việc tăng cường với mạng lưới thần kinh và các biến thể nhanh hơn, dễ hiểu hơn đang được thực hiện. Đối với những người thực hành, việc tăng cường thư viện sẽ vẫn là lựa chọn hàng đầu đáng tin cậy, có độ chính xác cao cho các bài toán dạng bảng tính.
Triển khai trong thế giới thực
Các ngân hàng và bộ xử lý thanh toán sử dụng XGBoost để gắn cờ các giao dịch gian lận từ các tính năng dạng bảng như số tiền, địa điểm và thời gian.
Công cụ tìm kiếm và cửa hàng trực tuyến xếp hạng kết quả bằng mô hình 'học để xếp hạng' được tăng cường độ dốc.
Các công ty bảo hiểm và cho vay dự đoán rủi ro và định giá từ dữ liệu khách hàng có cấu trúc.
Các đối thủ của Kaggle giành chiến thắng trong các cuộc thi dữ liệu dạng bảng bằng cách xếp chồng các mô hình LightGBM và CatBoost lại với nhau.
Rủi ro & lan can
Các nhóm khác nhau có thể sử dụng cùng một thuật ngữ một cách khác nhau, vì vậy hãy sớm xác định phạm vi.
Điểm chuẩn có thể trông mạnh mẽ trong khi hiệu suất trong thế giới thực không đồng đều.
Việc bỏ qua các kế hoạch đánh giá và chất lượng dữ liệu thường tạo ra những kết quả mong manh.
Lộ trình thực hiện
Bắt đầu với một định nghĩa đơn giản về kết quả bạn cần.
Chọn một số liệu thành công và một điều kiện thất bại trước khi thử nghiệm.
Chạy một thử nghiệm nhỏ với dữ liệu đại diện chứ không phải một bản demo bóng bẩy.
Tài liệu nơi các Phương thức tập hợp và Tăng cường độ dốc giúp ích và nơi các phương pháp đơn giản hơn sẽ tốt hơn.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Ensemble Methods and Gradient Boosting quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Giảm dần độ dốc ngẫu nhiên với động lượng
Câu hỏi thường gặp
What is Ensemble Methods and Gradient Boosting?
Phương pháp tập hợp kết hợp nhiều mô hình đơn giản nên nhóm đưa ra dự đoán tốt hơn bất kỳ mô hình đơn lẻ nào. Tăng cường độ dốc là tính năng mạnh mẽ nhất trong số này — nó xây dựng từng cây một, mỗi cây sửa lỗi của cây cuối cùng và chiếm ưu thế trong việc học máy dạng bảng trong thế giới thực.
Ý tưởng cốt lõi đằng sau các phương pháp tập hợp là gì?
Các nhóm tổng hợp các dự đoán của nhiều mô hình, do đó kết quả đầu ra kết hợp của chúng chính xác và mạnh mẽ hơn các thành viên riêng lẻ.
Tăng cường độ dốc khác với đóng bao (ví dụ: Rừng ngẫu nhiên) như thế nào?
Đóng bao xây dựng song song các mô hình độc lập và tính trung bình cho chúng (giảm phương sai), đồng thời tăng cường xây dựng các mô hình lần lượt, mỗi mô hình sẽ sửa các lỗi cuối cùng (giảm sai lệch).
Trong quá trình tăng cường độ dốc, mỗi cây mới phù hợp với giá trị gần đúng là gì?
Mỗi cây phù hợp với độ dốc âm của sự mất mát - về cơ bản là các lỗi còn sót lại - vì vậy việc thêm nó sẽ thúc đẩy các dự đoán về các giá trị chính xác.
Mục đích của tốc độ học tập (co rút) trong việc tăng cường là gì?
Tốc độ học tập nhỏ sẽ thu nhỏ thông tin cập nhật của mỗi cây, giúp cải thiện khả năng khái quát hóa nhưng lại phải trả giá bằng việc cần nhiều cây hơn.
Loại dữ liệu nào được cây tăng cường độ dốc đặc biệt chiếm ưu thế?
Các thư viện như XGBoost và LightGBM luôn xuất sắc về dữ liệu dạng bảng và giành chiến thắng trong hầu hết các cuộc thi dạng bảng Kaggle.