기본 가이드

의사결정 트리 및 랜덤 포레스트

의사결정 트리는 순서도와 같이 일련의 간단한 예/아니요 질문을 통해 예측을 수행합니다.

2분 읽기마지막 업데이트

개요

A random forest combines hundreds of such trees and lets them vote, which is far more accurate and robust.

심층 분석

의사결정 트리는 데이터를 단계별로 분할합니다. 각 노드에서 결과를 가장 잘 분리하는 기능과 임계값을 선택한 다음 리프에서 예측에 도달할 때까지 분기됩니다. 나무는 읽기 쉽기 때문에 인기가 있습니다. 결정이 내려진 이유를 정확히 추적할 수 있습니다. 이들의 약점은 과적합입니다. 즉, 깊은 트리는 노이즈를 기억하고 새 데이터에 대해 제대로 예측하지 못합니다. 랜덤 포레스트는 데이터의 무작위 하위 집합(배깅이라는 기술)과 각 분할에서 기능의 무작위 하위 집합에 대해 많은 트리를 훈련하여 이 문제를 해결합니다. 나무는 서로 다른 실수를 하기 때문에 투표를 평균하면 개별 오류가 상쇄됩니다. 그 결과, 딥 러닝을 시작하기 전에 널리 사용되는 표 형식 데이터에 대한 가장 안정적이고 조정이 적은 알고리즘 중 하나가 탄생했습니다.

기술적 통찰력

각 분할은 '순수함'을 극대화하도록 선택됩니다. 분류 트리는 지니 불순물 또는 엔트로피를 최소화합니다. 회귀 트리는 분산(제곱 오차)을 최소화합니다. 랜덤 포레스트는 부트스트랩 샘플링(각 트리에서 교체를 통해 추출된 무작위 샘플을 확인)과 모든 분할에서 무작위 기능 선택이라는 두 가지 무작위성 소스를 추가합니다. 이는 트리의 상관 관계를 해제하여 평균 예측이 편향을 크게 높이지 않고도 단일 트리보다 훨씬 낮은 분산을 갖도록 합니다. 각 트리의 부트스트랩에서 제외된 Out-of-bag 샘플은 내장된 검증 추정치를 제공합니다.

전략적 영향

더 명확한 결정들

이는 명확한 기술적 주장과 마케팅 언어를 구분하는 데 도움이 됩니다.

비용 및 예산

돈이나 시간을 들이기 전에 더 나은 구현 질문을 할 수 있습니다.

팀과 워크플로우

이해를 공유한 팀은 더 나은 제품, 정책 및 학습 결정을 내립니다.

의사결정 트리와 랜덤 포레스트의 미래

일반 랜덤 포레스트는 여전히 기본으로 남아 있지만 XGBoost, LightGBM 및 CatBoost와 같은 그래디언트 부스트 트리로 스포트라이트가 전환되었습니다. XGBoost, LightGBM 및 CatBoost는 초기 오류를 수정하고 종종 최고의 표 형식 데이터 경쟁을 위해 트리를 순차적으로 구축합니다. 이러한 트리 앙상블은 많은 구조화된 데이터 세트에서 신경망보다 계속해서 성능이 뛰어납니다. 속도, GPU 교육, 특히 SHAP와 같은 설명 도구에 대한 지속적인 작업을 기대하세요. 해석 가능성은 규제 대상 산업이 블랙박스 딥 러닝 대신 트리 기반 모델을 계속 선택하는 주요 이유이기 때문입니다.

실제 구현

은행이 명확하고 감사 가능한 결정 경로를 중요하게 생각하는 신용 ​​평가 및 대출 승인.

어떤 환자 요인이 진단 또는 경고를 유발했는지 표시하는 의료 위험 예측.

테이블 형식 계정 및 사용량 데이터를 통해 고객 이탈을 예측합니다.

데이터세트에서 어떤 변수가 가장 중요한지 순위를 매기는 기능 중요도 분석입니다.

위험 및 가드레일

팀마다 동일한 용어를 다르게 사용할 수 있으므로 범위를 조기에 정의하세요.

벤치마크는 강력해 보이지만 실제 성능은 고르지 않을 수 있습니다.

데이터 품질 및 평가 계획을 무시하면 취약한 결과가 발생하는 경우가 많습니다.

구현 로드맵

1

필요한 결과에 대한 일반 언어 정의부터 시작하세요.

2

테스트하기 전에 하나의 성공 지표와 하나의 실패 조건을 선택하세요.

3

세련된 데모 세트가 아닌 대표 데이터를 사용하여 소규모 파일럿을 실행하세요.

4

의사결정 트리와 랜덤 포레스트가 도움이 되는 부분과 더 간단한 방법이 더 나은 부분을 문서화하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Decision Trees and Random Forests quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

자주 묻는 질문

What is Decision Trees and Random Forests?

의사결정 트리는 순서도와 같이 일련의 간단한 예/아니요 질문을 통해 예측을 수행합니다. 랜덤 포레스트는 수백 개의 그러한 트리를 결합하여 투표할 수 있게 하며, 이는 훨씬 더 정확하고 강력합니다.

의사결정나무는 어떻게 예측을 합니까?

의사결정 트리는 예측을 제공하는 리프에 도달할 때까지 해당 기능에 대한 분기 질문을 통해 입력을 라우팅합니다.

단일 심층 의사결정 트리의 주요 약점은 무엇입니까?

딥 트리는 훈련 데이터에 너무 가깝게 적합할 수 있으며, 노이즈를 포착하고 새로운 예제에 제대로 일반화되지 않습니다.

단일 트리에서 랜덤 포레스트가 어떻게 개선되나요?

많은 장식된 트리를 훈련하고 평균화 또는 투표를 통해 포리스트는 개별 트리의 오류를 제거하고 과적합을 줄입니다.

랜덤 포레스트에서 '배깅'은 무엇을 의미합니까?

배깅(부트스트랩 집계)은 각 트리에 교체를 통해 추출된 무작위 샘플을 제공하므로 트리가 다르고 평균이 더 안정적입니다.

분류 트리는 분할을 선택하기 위해 일반적으로 어떤 측정항목을 사용합니까?

분류 트리는 클래스가 노드에 얼마나 혼합되어 있는지 측정하는 지니 불순도 또는 엔트로피를 가장 많이 줄이는 분할을 선택합니다.