คู่มือพื้นฐาน

ต้นไม้การตัดสินใจและป่าสุ่ม

แผนผังการตัดสินใจทำนายโดยการถามคำถามง่ายๆ แบบใช่/ไม่ใช่ เช่น ผังงาน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

A random forest combines hundreds of such trees and lets them vote, which is far more accurate and robust.

เจาะลึก

แผนผังการตัดสินใจจะแบ่งข้อมูลทีละขั้นตอน โดยในแต่ละโหนดจะเลือกคุณลักษณะและเกณฑ์ที่แยกผลลัพธ์ได้ดีที่สุด จากนั้นแยกย่อยจนกว่าจะถึงการคาดการณ์ทีละขั้นตอน ต้นไม้เป็นที่นิยมเพราะอ่านง่าย คุณสามารถติดตามได้อย่างชัดเจนว่าเหตุใดจึงตัดสินใจ จุดอ่อนของพวกเขาคือการติดตั้งมากเกินไป โดยที่ต้นไม้ลึกจะจดจำสัญญาณรบกวนและคาดการณ์ข้อมูลใหม่ได้ไม่ดี ฟอเรสต์แบบสุ่มแก้ไขปัญหานี้โดยการฝึกต้นไม้จำนวนมากเกี่ยวกับชุดย่อยแบบสุ่มของข้อมูล (เทคนิคที่เรียกว่าการบรรจุถุง) และชุดย่อยแบบสุ่มของคุณลักษณะในแต่ละการแยก ต้นไม้ทำผิดพลาดต่างกัน ดังนั้นการเฉลี่ยคะแนนเสียงของพวกเขาจะยกเลิกข้อผิดพลาดแต่ละรายการ ผลลัพธ์ที่ได้คือหนึ่งในอัลกอริธึมที่มีการปรับแต่งต่ำและน่าเชื่อถือที่สุดสำหรับข้อมูลแบบตาราง ซึ่งใช้กันอย่างแพร่หลายก่อนที่จะเข้าถึงการเรียนรู้เชิงลึก

ข้อมูลเชิงลึกทางเทคนิค

การแยกแต่ละครั้งจะถูกเลือกเพื่อเพิ่ม 'ความบริสุทธิ์' ให้สูงสุด ต้นไม้จำแนกประเภทลดสิ่งเจือปนหรือเอนโทรปีของ Gini ต้นไม้การถดถอยลดความแปรปรวนให้เหลือน้อยที่สุด (ข้อผิดพลาดกำลังสอง) ฟอเรสต์สุ่มเพิ่มแหล่งที่มาของการสุ่มสองแหล่ง: การสุ่มตัวอย่างบูตสแตรป (ต้นไม้แต่ละต้นจะเห็นตัวอย่างสุ่มที่วาดพร้อมการแทนที่) และการเลือกคุณลักษณะแบบสุ่มในทุกการแยก สิ่งนี้จะสัมพันธ์กับต้นไม้ ดังนั้นการทำนายโดยเฉลี่ยจึงมีความแปรปรวนต่ำกว่าต้นไม้ต้นใดๆ มาก โดยไม่เพิ่มอคติมากนัก ตัวอย่างที่ออกจากถุงซึ่งเหลืออยู่ใน Bootstrap ของต้นไม้แต่ละต้นจะให้ค่าประมาณการตรวจสอบความถูกต้องในตัว

ผลกระทบเชิงกลยุทธ์

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ช่วยให้คุณแยกคำกล่าวอ้างทางเทคนิคที่ชัดเจนออกจากภาษาทางการตลาดได้

ต้นทุนและงบประมาณ

คุณสามารถถามคำถามการใช้งานที่ดีขึ้นก่อนที่จะใช้เงินหรือเวลา

ทีมงานและขั้นตอนการทำงาน

ทีมที่มีความเข้าใจร่วมกันจะตัดสินใจเกี่ยวกับผลิตภัณฑ์ นโยบาย และการเรียนรู้ได้ดีขึ้น

อนาคตของแผนผังการตัดสินใจและป่าสุ่ม

ป่าสุ่มธรรมดายังคงเป็นจุดเริ่มต้น แต่สปอตไลท์ได้เปลี่ยนไปใช้ต้นไม้ที่มีการไล่ระดับสีอย่าง XGBoost, LightGBM และ CatBoost ซึ่งสร้างต้นไม้ตามลำดับเพื่อแก้ไขข้อผิดพลาดก่อนหน้านี้ และบ่อยครั้งมีการแข่งขันข้อมูลแบบตารางอันดับต้นๆ เครือข่ายแบบต้นไม้เหล่านี้ยังคงมีประสิทธิภาพเหนือกว่าโครงข่ายประสาทเทียมบนชุดข้อมูลที่มีโครงสร้างจำนวนมาก คาดหวังการทำงานอย่างต่อเนื่องในด้านความเร็ว การฝึกอบรม GPU และโดยเฉพาะอย่างยิ่งเครื่องมืออธิบาย เช่น SHAP เนื่องจากความสามารถในการตีความเป็นเหตุผลสำคัญที่อุตสาหกรรมที่ได้รับการควบคุมยังคงเลือกแบบจำลองแบบต้นไม้มากกว่าการเรียนรู้เชิงลึกแบบกล่องดำ

การใช้งานจริงในโลกแห่งความเป็นจริง

การให้คะแนนเครดิตและการอนุมัติสินเชื่อ โดยที่ธนาคารให้ความสำคัญกับเส้นทางการตัดสินใจที่ชัดเจนและตรวจสอบได้

การคาดการณ์ความเสี่ยงทางการแพทย์จะระบุว่าปัจจัยของผู้ป่วยรายใดที่ทำให้เกิดการวินิจฉัยหรือการแจ้งเตือน

การคาดการณ์การเลิกใช้งานของลูกค้าจากบัญชีแบบตารางและข้อมูลการใช้งาน

การวิเคราะห์ความสำคัญของคุณลักษณะเพื่อจัดอันดับตัวแปรที่สำคัญที่สุดในชุดข้อมูล

ความเสี่ยงและรั้ว

แต่ละทีมอาจใช้คำเดียวกันต่างกัน ดังนั้นควรกำหนดขอบเขตตั้งแต่เนิ่นๆ

เกณฑ์มาตรฐานอาจดูแข็งแกร่งในขณะที่ประสิทธิภาพในโลกแห่งความเป็นจริงไม่เท่ากัน

การเพิกเฉยต่อคุณภาพข้อมูลและแผนการประเมินมักสร้างผลลัพธ์ที่เปราะบาง

แผนงานการดำเนินงาน

1

เริ่มต้นด้วยคำจำกัดความภาษาธรรมดาของผลลัพธ์ที่คุณต้องการ

2

เลือกเมตริกวัดความสำเร็จหนึ่งรายการและเงื่อนไขความล้มเหลวหนึ่งรายการก่อนการทดสอบ

3

ดำเนินการนำร่องขนาดเล็กด้วยข้อมูลตัวแทน ไม่ใช่ชุดสาธิตที่สวยงาม

4

เอกสารที่แผนผังการตัดสินใจและป่าสุ่มช่วยได้ และวิธีที่ง่ายกว่าจะดีกว่า

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Decision Trees and Random Forests quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การตัดสินใจของ AI

คำถามที่พบบ่อย

What is Decision Trees and Random Forests?

แผนผังการตัดสินใจคาดการณ์โดยการถามคำถามง่ายๆ แบบใช่/ไม่ใช่ เช่น ผังงาน ป่าสุ่มจะรวมต้นไม้หลายร้อยต้นเข้าด้วยกันและปล่อยให้พวกมันลงคะแนน ซึ่งมีความแม่นยำและแข็งแกร่งกว่ามาก

แผนผังการตัดสินใจทำนายได้อย่างไร?

แผนผังการตัดสินใจจะกำหนดเส้นทางอินพุตผ่านคำถามแบบแยกย่อยเกี่ยวกับคุณลักษณะต่างๆ จนกว่าจะถึงส่วนที่ให้คำทำนาย

อะไรคือจุดอ่อนหลักของแผนผังการตัดสินใจเชิงลึกเพียงแผนผังเดียว?

ต้นไม้ลึกสามารถใส่ข้อมูลการฝึกไว้ใกล้เกินไป ดักจับสัญญาณรบกวนและสรุปตัวอย่างใหม่ๆ ได้ไม่ดี

ป่าสุ่มจะปรับปรุงบนต้นไม้ต้นเดียวได้อย่างไร?

ด้วยการฝึกต้นไม้ที่เกี่ยวข้องกับการตกแต่งจำนวนมาก และการหาค่าเฉลี่ยหรือการลงคะแนนเสียง ฟอเรสต์จะยกเลิกข้อผิดพลาดของต้นไม้แต่ละต้น และลดการติดตั้งมากเกินไป

'การบรรจุถุง' หมายถึงอะไรในป่าสุ่ม

การบรรจุถุง (การรวม Bootstrap) จะทำให้ต้นไม้แต่ละต้นสุ่มตัวอย่างโดยมีการแทนที่ ดังนั้นต้นไม้จะแตกต่างกันและค่าเฉลี่ยของต้นไม้จะมีเสถียรภาพมากขึ้น

ต้นไม้จำแนกประเภทมักใช้หน่วยเมตริกใดในการเลือกการแยก

แผนผังการจำแนกประเภทจะเลือกการแบ่งแยกที่ลดการเจือปนหรือเอนโทรปีของ Gini มากที่สุด ซึ่งเป็นการวัดว่าคลาสต่างๆ ผสมกันที่โหนดอย่างไร