基本ガイド

デシジョン ツリーとランダム フォレスト

デシジョン ツリーは、フローチャートのように、一連の単純な「はい/いいえ」の質問をすることによって予測を行います。

2分の読書最終更新日

概要

A random forest combines hundreds of such trees and lets them vote, which is far more accurate and robust.

ディープダイブ

デシジョン ツリーはデータを段階的に分割します。各ノードで、結果を最もよく分離する特徴としきい値が選択され、リーフでの予測に到達するまで分岐します。ツリーは読みやすいため人気があります。決定がなされた理由を正確に追跡できます。彼らの弱点は過剰適合であり、深いツリーがノイズを記憶し、新しいデータを適切に予測しません。ランダム フォレストは、データのランダムなサブセット (バギングと呼ばれる手法) と各分割での特徴のランダムなサブセットで多くのツリーをトレーニングすることで、この問題を解決します。ツリーはさまざまな間違いを犯すため、投票を平均することで個々の間違いが相殺されます。その結果、表形式データに対して最も信頼性が高く、低調整のアルゴリズムの 1 つが得られ、深層学習に到達する前に広く使用されていました。

技術的な洞察

それぞれの分割は「純度」を最大化するように選択されます。分類ツリーは、Gini 不純物またはエントロピーを最小限に抑えます。回帰ツリーは分散 (二乗誤差) を最小限に抑えます。ランダム フォレストは、ブートストラップ サンプリング (各ツリーは置換によって抽出されたランダム サンプルを参照します) と分割ごとのランダムな特徴選択という 2 つのランダム性のソースを追加します。これによりツリーの相関が解除されるため、バイアスをあまり高めることなく、平均化された予測の分散が単一のツリーよりもはるかに小さくなります。各ツリーのブートストラップから取り残されたバッグ外サンプルは、組み込みの検証推定値を提供します。

戦略的影響

より明確な判決

これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。

費用と予算

お金や時間を費やす前に、実装に関するより良い質問をすることができます。

チームとワークフロー

共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。

デシジョン ツリーとランダム フォレストの将来

プレーンなランダム フォレストは引き続き頼りになるベースラインですが、注目は XGBoost、LightGBM、CatBoost などの勾配ブースト ツリーに移っています。これらのツリーは、以前のエラーを修正するためにツリーを順次構築し、表形式データの競合で上位に入ることがよくあります。これらのツリー アンサンブルは、多くの構造化データセットでニューラル ネットワークよりも優れたパフォーマンスを維持し続けています。規制対象業界がブラックボックスディープラーニングではなくツリーベースのモデルを選択し続ける主な理由は解釈可能性であるため、速度、GPU トレーニング、特に SHAP などの説明可能ツールに関する継続的な取り組みが期待されます。

現実世界の実装

信用スコアリングと融資の承認。銀行は明確で監査可能な意思決定経路を重視します。

どの患者要因が診断または警告を引き起こしたかを示す医療リスク予測。

表形式のアカウントと使用状況データからの顧客離れの予測。

データセット内でどの変数が最も重要であるかをランク付けするための特徴重要度分析。

リスクとガードレール

チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。

ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。

データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。

実装ロードマップ

1

必要な結果を平易な言葉で定義することから始めます。

2

テストする前に、成功指標と失敗条件を 1 つ選択します。

3

洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。

4

デシジョン ツリーとランダム フォレストが役立つ場合と、よりシンプルな方法の方が優れている場合を文書化します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Decision Trees and Random Forests quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

AI による意思決定

よくある質問

What is Decision Trees and Random Forests?

デシジョン ツリーは、フローチャートのように、一連の単純な「はい/いいえ」の質問をすることによって予測を行います。ランダム フォレストは、そのようなツリーを数百本組み合わせて投票させます。これは、はるかに正確で堅牢です。

デシジョン ツリーはどのように予測を行うのでしょうか?

デシジョン ツリーは、予測を与えるリーフに到達するまで、その特徴に関する分岐質問を通じて入力をルーティングします。

単一の深いデシジョン ツリーの主な弱点は何ですか?

深いツリーはトレーニング データに近づきすぎるため、ノイズが捕捉され、新しい例への一般化が不十分になる可能性があります。

単一のツリー上でランダム フォレストはどのように改善されるのでしょうか?

多くの非相関ツリーをトレーニングし、平均化または投票することにより、フォレストは個々のツリーのエラーを打ち消し、過剰適合を軽減します。

ランダム フォレストにおける「バギング」とは何を指しますか?

バギング (ブートストラップ集計) では、各ツリーに置換で抽出されたランダムなサンプルが与えられるため、ツリーは異なり、平均がより安定します。

分類ツリーは分割を選択するために一般的にどのようなメトリックを使用しますか?

分類ツリーは、ノードにおけるクラスの混合度の尺度であるジニ不純物またはエントロピーを最も低減する分割を選択します。