深層学習と従来の機械学習の違いを整理します。どちらが優れているかではなく、どう使い分けるかがプロの判断基準です。万能な技術はないことを理解しましょう。
深層学習ってめっちゃすごいんだから、全部深層学習でやればよくね? 一択じゃん。
実はそうとも限らないのよ。
従来の機械学習 (決定木、ランダムフォレスト、SVMなど) の方が適している場面も多いの。
つまり、表形式データの分析では、勾配ブースティング (XGBoostなど) の方が深層学習より高い性能を出すことが多いのよね。
ほんとに? 深層学習が負けることあるんだ。
めっちゃ意外。
違いを整理しましょう。
深層学習は大量のデータと計算資源が必要だけど、画像・音声・テキストといった非構造化データに強いの。
従来手法は少量データでも動きやすく、解釈がしやすく、表形式データに強いわ。
さらに、従来手法は数式ベースで判断根拠を説明しやすいので、金融や医療のような説明責任が重い分野では今も主力です。
えへへ、適材適所ですぅ! どっちが偉いとかじゃないんですね。
まさにそのとおり。
問題の性質、データの量と種類、計算リソース、解釈性の要求度、応答速度、これらを天秤にかけて選ぶのが実務のセンスよ。
データサイエンスのコンペティションサイトKaggleでも、表データはXGBoost/LightGBM、画像・自然言語は深層学習が優勢というのが経験則です。
要は、敵を見て武器を選ぶってこと? バドミントンの試合と同じじゃん!
ジャスミンちゃん、さすがのたとえね。
最新のトレンドでは、表データでも深層学習で勝つTabNetのような研究もあるから、境界線は今後も動くわ。
新しい技術がどんどん出てきますぅ。
勉強、追いつくの大変そうですぅ……。
だからこそ、基礎をしっかり押さえておくのが大事なのよ。
今の知識があれば、新しい技術が出ても『ああ、あの発展形ね』と分かるから。
生成AIパスポート試験では『表形式データは勾配ブースティングが強い』という定番パターンが出題されるので押さえておきましょう。
すご〜い、深層学習が万能じゃないって知れただけでも、今日は収穫だね。
技術同士も『チームプレー』が大事なのよ。
すごい技術にも限界があって、だからこそ他の仲間と組む。
ジャスミンちゃんの得意なバドミントンと一緒ね。
確認クイズ
表形式のデータ分析で深層学習よりも高い性能を出すことが多い手法はどれか?
- CNN
- RNN
- 勾配ブースティング (XGBoostなど)
- GAN
こたえを見る
正解: 3. 勾配ブースティング (XGBoostなど)
表形式データの分析では、XGBoostやLightGBMなどの勾配ブースティング手法が深層学習より高い性能を出すことが多いです。Kaggleの表データコンペでも上位は勾配ブースティング系が大半を占めます。