『質問を繰り返して答えにたどり着く』シンプルなのに強力なアルゴリズムが『決定木』です。20の質問ゲームに似た発想で、仕組みと強み・弱みを掴みましょう。ここから具体的なアルゴリズムが登場します。
決定木…? えへへ、森にあるお話の木ですか〜?
植物ではないわよ、ましろちゃん。
『決定』をする『木』、つまり条件分岐の図が木の形をしているからその名前なの。
それ、『20の質問ゲーム』と同じじゃん! はい/いいえで絞り込むやつ。
まさに。
決定木は『この特徴量は◯◯以上?』みたいな質問を繰り返してデータを分けていくアルゴリズムよ。
例えば医療診断なら『体温37.5度以上?
→咳がある?
→喉が赤い?』と進んでいくイメージ。
各分岐点(ノード)で、できるだけデータがきれいに分かれる条件を選んで木を作ります。
代表的な分割基準にジニ不純度やエントロピーがあります。
木を逆さまにして、上から質問が流れていく感じですか〜?
その通り、最上部が『根』、末端が『葉』で、葉に到達した時点で『この入力はクラスA』のように判定されるわ。
メリットってなんなの?
最大の強みは解釈性の高さです。
判断理由が『体温+咳』のように自然言語で説明できるため、医療や金融の意思決定に使いやすい。
医療や金融は『なぜAIがそう判断したか』を説明する義務がある分野だから、決定木の解釈性の高さが重宝されるのね。
規制対応の面でも強みになるわ。
ただし弱点もあるわ。
木を深くしすぎると訓練データに過剰に合わせてしまい、過学習が起きやすいの。
深さを制限したり、後述のランダムフォレストで改善するのが定番よ。
木が育ちすぎるとダメって、自然界みたいですね〜。
深さ制限、剪定(せんてい)みたいじゃん。
植木屋さんの仕事だね。
実際『剪定(pruning)』と呼びます。
枝を刈って汎化性能を上げる手法ですね。
事前剪定(成長前に制約)と事後剪定(作った後に刈る)の2種類があります。
もうひとつの弱点は、小さなデータの変動に敏感なこと。
1〜2点違うデータが入るだけで、木の構造が大きく変わってしまうことがあるのよ。
この不安定さを解消するのが、次回学ぶランダムフォレストなの。
次回が楽しみです〜!
決定木って、AIの入り口としてはすごく直感的じゃん。
バドミントンの戦術決定も、試合の状況を順に質問して戦法を選ぶから似てるかも。
いい観察です。
決定木は意思決定の自動化にも使われるため、業務フローの可視化にも応用されます。
木の形で表せるって、絵としてもわかりやすくて良いですね〜!
プログラミングの if/else を視覚化した感じだね。
エンジニアじゃなくても読めそう。
実は分類だけでなく回帰にも使えます。
葉ノードで連続値の平均を予測する『回帰木』の仕組みで、住宅価格予測などに応用されます。
試験では『決定木=条件分岐の繰り返し』『高い解釈性』『深いと過学習しやすい』の3点がよく問われるわ。
確認クイズ
決定木の特徴として正しいものはどれか?
- ブラックボックスで解釈が難しい
- 条件分岐の繰り返しで分類し、解釈性が高い
- 常に最も高い精度を出せる
- 教師なし学習にのみ使える
こたえを見る
正解: 2. 条件分岐の繰り返しで分類し、解釈性が高い
決定木は木構造で条件分岐を辿るため、なぜその判定になったかを説明しやすいのが最大の特徴です。教師あり学習(分類・回帰の両方)に使え、深層学習に比べ解釈性が高いのが強みです。