ましろ実家の和菓子屋では『あん』の仕込みが味を決めると言います。機械学習でも、モデルに渡す前の下ごしらえ『特徴量エンジニアリング』が精度を決める要(かなめ)です。AIの世界の『仕込み』を覗いてみましょう。
ふぇぇ〜、実家のお店でお母さんが『あんは仕込みでほとんど決まる』って言ってたんですけど、機械学習もそうなんですか〜?
ふふ、和菓子屋さんの娘らしい質問ね。
まさにその通りよ。
特徴量エンジニアリングは、生データを学習しやすい形に整える『仕込み』なの。
モデル精度を左右する一番の要よ。
補足すると、モデルに入力する1つ1つの情報項目を特徴量(feature)と呼びます。
たとえば日付データから『曜日』『月』『連休か否か』を抽出するのが特徴量作成ですね。
日付そのまま渡しちゃダメなの? 日付のままでいいじゃん、ってあたしなら思っちゃうけど。
渡してもいいけれど、AIにとっては『2026-04-20』という文字列よりも『曜日=月曜』『連休明けか』などの数値情報の方が活用しやすいの。
前処理も含めて意味のある信号に変換するのね。
お肉も、包丁で切ってから炒めるからおいしいですもんね〜。
いい例えですね。
具体的にはテキストデータならベクトル化、カテゴリ変数ならone-hot encoding、数値なら正規化、欠損値なら平均で埋める、など様々な前処理があります。
one-hot encodingって何? あたし初めて聞いたんだけど。
たとえば『色=赤・青・緑』のような3つのカテゴリを、『赤=(1,0,0)』『青=(0,1,0)』『緑=(0,0,1)』のように1つだけ1が立つベクトルに変換する方法です。
カテゴリを数値化する定番の手順ですね。
機械学習には『Garbage in, garbage out(ゴミを入れればゴミが出る)』という格言があるわ。
いくら高級なモデルを使っても、入力の質が悪ければ結果も悪い。
だから特徴量エンジニアリングがとっても重要なの。
うっ、図星…!
あたし、野菜切るの適当だから料理がうまくいかないのと同じ原理だね。
深層学習の時代には、特徴量を自動で学ぶ技術(表現学習)も発達していますが、従来型の機械学習では今もこの工程が中心です。
生成AI分野でも、前処理の巧拙がモデル品質を左右します。
仕込みをていねいにすれば、AIも美味しく育つんですね〜。
特徴量エンジニアリングは『ドメイン知識』が力を発揮する場面でもあるわ。
金融データなら金融の専門家、医療データなら医師の知見が優れた特徴量を生むの。
なるほど、AIって結局、人間の知識と組み合わせてこそ強いんだね。
その通りです。
近年は自動で特徴量を探索するAutoML技術も発達していますが、最終的な品質は人間の理解があってこそです。
試験では『特徴量エンジニアリング=生データを学習向きの特徴量に変換』『データ品質が精度を大きく左右する』『正規化・標準化・欠損値処理などが含まれる』をセットで覚えてね。
確認クイズ
特徴量エンジニアリングの説明として正しいものはどれか?
- モデルのアルゴリズムを選ぶ作業
- 生データをAIが扱いやすい形に変換する作業
- 学習済みモデルを本番環境に配置する作業
- テストデータで精度を検証する作業
こたえを見る
正解: 2. 生データをAIが扱いやすい形に変換する作業
特徴量エンジニアリングは、生データから意味のある特徴量を作り出し、モデルが学習しやすい形に整える工程です。アルゴリズム選択はモデリング、配置はデプロイ、検証は評価で、別フェーズになります。