คู่มือพื้นฐาน

วิธีการทั้งมวลและการเพิ่มการไล่ระดับสี

วิธีการทั้งมวลรวมแบบจำลองง่ายๆ หลายแบบเข้าด้วยกัน ดังนั้นกลุ่มจึงสามารถคาดการณ์ได้ดีกว่าแบบจำลองเดียว

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

Gradient boosting is the most powerful of these — it builds trees one at a time, each correcting the errors of the last, and dominates real-world tabular machine learning.

เจาะลึก

วงดนตรีวางอยู่บนแนวคิดที่เรียบง่าย: ผู้เรียนที่อ่อนแอจำนวนมากเมื่อรวมกันแล้วจะสามารถสร้างผู้เรียนที่เข้มแข็งได้ สองครอบครัวเป็นผู้นำ การบรรจุถุง (เช่น ป่าสุ่ม) จะฝึกต้นไม้หลายต้นขนานกันกับตัวอย่างแบบสุ่มและหาค่าเฉลี่ย ซึ่งส่วนใหญ่จะช่วยลดความแปรปรวน การส่งเสริมโมเดลรถไฟตามลำดับ โดยแต่ละโมเดลมุ่งเน้นไปที่ข้อผิดพลาดของโมเดลก่อนหน้านี้ ซึ่งช่วยลดอคติเป็นหลัก การเพิ่มความไล่ระดับสีจะกำหนดกรอบต้นไม้ใหม่แต่ละต้นเป็นขั้นตอนที่เหมาะกับการไล่ระดับสีเชิงลบ — ข้อผิดพลาดที่เหลือ — ของฟังก์ชันการสูญเสียจนถึงตอนนี้ ไลบรารีเช่น XGBoost, LightGBM และ CatBoost เพิ่มการทำให้เป็นมาตรฐาน การแยกไฟล์อย่างชาญฉลาด และลูกเล่นความเร็ว สำหรับข้อมูลที่มีโครงสร้าง/ตาราง — การตรวจจับการฉ้อโกง การกำหนดราคา และการจัดอันดับ — วิธีการเหล่านี้เอาชนะการเรียนรู้เชิงลึกเป็นประจำและชนะการแข่งขัน Kaggle ส่วนใหญ่

ข้อมูลเชิงลึกทางเทคนิค

ในการเพิ่มระดับการไล่ระดับสี คุณจะเริ่มต้นด้วยการทำนายแบบคร่าวๆ และเพิ่มต้นไม้เล็กๆ ที่เหมาะกับส่วนที่เหลือซ้ำๆ — การไล่ระดับสีของการสูญเสียที่เกี่ยวข้องกับการคาดการณ์ในปัจจุบัน การมีส่วนร่วมของต้นไม้แต่ละต้นจะปรับขนาดตามอัตราการเรียนรู้ (การหดตัว) ดังนั้นแบบจำลองจึงได้รับการปรับปรุงในขั้นตอนเล็กๆ เนื่องจากข้อผิดพลาดจะเพิ่มมากขึ้นหากคุณปรับแต่งมากเกินไป การทำให้เป็นมาตรฐาน (ขีดจำกัดความลึกของต้นไม้ แถวและคุณสมบัติการสุ่มตัวอย่างย่อย บทลงโทษ L1/L2 บนน้ำหนักลีฟ) จึงเป็นสิ่งสำคัญในการป้องกันไม่ให้วงดนตรีจดจำสัญญาณรบกวน

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตของวิธีการทั้งมวลและการเพิ่มระดับการไล่ระดับสี

ต้นไม้ที่มีการไล่ระดับสียังคงเป็นค่าเริ่มต้นสำหรับข้อมูลแบบตาราง และไม่แสดงสัญญาณของการถูกถอดออกจากตำแหน่งดังกล่าว แม้ว่าการเรียนรู้เชิงลึกจะก้าวหน้าไปในที่อื่นก็ตาม คาดหวังความเร็วและการเร่งความเร็วของ GPU ที่เพิ่มขึ้นอย่างต่อเนื่อง การจัดการข้อมูลที่เป็นหมวดหมู่และข้อมูลที่ขาดหายไปแบบดั้งเดิมที่ดีขึ้น และการผสานรวมกับไปป์ไลน์การเรียนรู้ของเครื่องอัตโนมัติ (AutoML) ที่เข้มงวดยิ่งขึ้น การวิจัยเกี่ยวกับการรวมการเพิ่มประสิทธิภาพด้วยโครงข่ายประสาทเทียม และตัวแปรที่เร็วขึ้นและตีความได้มากขึ้นนั้นกำลังดำเนินการอยู่ สำหรับผู้ปฏิบัติงาน การเพิ่มไลบรารีจะยังคงเป็นตัวเลือกแรกที่เชื่อถือได้และมีความแม่นยำสูงสำหรับปัญหาในรูปแบบสเปรดชีต

การใช้งานจริงในโลกแห่งความเป็นจริง

ธนาคารและผู้ประมวลผลการชำระเงินใช้ XGBoost เพื่อแจ้งธุรกรรมที่ฉ้อโกงจากฟีเจอร์แบบตาราง เช่น จำนวนเงิน สถานที่ และเวลา

เครื่องมือค้นหาและร้านค้าออนไลน์จัดอันดับผลลัพธ์ด้วยโมเดล 'การเรียนรู้เพื่อจัดอันดับ' ที่เสริมด้วยการไล่ระดับสี

บริษัทประกันภัยและให้กู้ยืมคาดการณ์ความเสี่ยงและกำหนดราคาจากข้อมูลลูกค้าที่มีโครงสร้าง

ผู้แข่งขัน Kaggle ชนะการแข่งขันข้อมูลแบบตารางโดยการซ้อนโมเดล LightGBM และ CatBoost เข้าด้วยกัน

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่ซึ่งวิธีการทั้งมวลและการเร่งการไล่ระดับสีช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Ensemble Methods and Gradient Boosting quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

โคตรลาดสุ่มพร้อมโมเมนตัม

คำถามที่พบบ่อย

What is Ensemble Methods and Gradient Boosting?

วิธีการทั้งมวลรวมแบบจำลองง่ายๆ หลายแบบเข้าด้วยกัน ดังนั้นกลุ่มจึงสามารถคาดการณ์ได้ดีกว่าแบบจำลองเดียว การเพิ่มระดับการไล่สีมีประสิทธิภาพมากที่สุด โดยจะสร้างแผนผังทีละรายการ โดยแต่ละแผนผังจะแก้ไขข้อผิดพลาดของลำดับสุดท้าย และครอบงำการเรียนรู้ของเครื่องแบบตารางในโลกแห่งความเป็นจริง

แนวคิดหลักเบื้องหลังวิธีการทั้งมวลคืออะไร?

วงดนตรีจะรวมการคาดการณ์ของแบบจำลองหลายแบบ ดังนั้นผลลัพธ์ที่รวมกันจึงมีความแม่นยำและแข็งแกร่งมากกว่าสมาชิกแต่ละคน

การเพิ่มความไล่ระดับสีแตกต่างจากการบรรจุถุง (เช่น ป่าสุ่ม) อย่างไร

Bagging สร้างโมเดลอิสระขนานกันและหาค่าเฉลี่ย (ลดความแปรปรวน) ในขณะที่การเพิ่มโมเดลทีละโมเดล แต่ละโมเดลจะแก้ไขข้อผิดพลาดสุดท้าย (ลดอคติ)

ในการเพิ่มความไล่ระดับสี ต้นไม้ใหม่แต่ละต้นจะพอดีประมาณเท่าใด

ต้นไม้แต่ละต้นเหมาะสมกับการไล่ระดับสีเชิงลบของการสูญเสีย — โดยพื้นฐานแล้วคือข้อผิดพลาดที่เหลือ — ดังนั้นการเพิ่มต้นไม้ดังกล่าวจะสะกิดการคาดการณ์ไปสู่ค่าที่ถูกต้อง

จุดประสงค์ของอัตราการเรียนรู้ (หดตัว) ในการส่งเสริมคืออะไร?

อัตราการเรียนรู้เพียงเล็กน้อยจะลดขนาดการอัปเดตของต้นไม้แต่ละต้น ซึ่งช่วยปรับปรุงลักษณะทั่วไปโดยต้องแลกกับความต้องการต้นไม้เพิ่ม

ข้อมูลประเภทใดที่ต้นไม้ที่มีการไล่ระดับสีมีความโดดเด่นเป็นพิเศษ

ไลบรารีเช่น XGBoost และ LightGBM มีประสิทธิภาพเป็นเลิศในด้านข้อมูลแบบตารางและชนะการแข่งขันแบบตารางส่วนใหญ่ของ Kaggle