AIに渡す前にデータを「掃除」する工程、それが前処理です。この重要ステップを学びましょう。
データ集めたらそのままAIにドーンと入れれば終わりじゃん?
なんでわざわざ下処理が要るの?
そこが落とし穴なの。
現実のデータは汚れだらけで、前処理なしでは精度が出ないのよ。
汚れ…ってどんな汚れですかぁ?
たとえば「東京都」と「東京」と「Tokyo」が混在、電話番号のハイフン有り無し、同じ顧客の重複登録、欠損値、文字化け、日付形式のばらつき…。
本当に多種多様なの。
マジで? 会社のデータってそんなに汚いんだ…。
そう。
前処理の代表作業は(1)欠損値の補完(2)重複除去(3)正規化(4)形式統一(5)外れ値の除去 などね。
さらに、テキストデータなら分かち書きやストップワード(「は」「が」など)除去、画像ならリサイズやノイズ除去も必要ね。
データもお風呂に入れてきれいにしてからAIに会わせるんですねぇ…優しい工程ですぅ。
ましろ、表現が優しい(笑)。
で、前処理ってどれくらいの労力なの?
AI開発の作業時間の実に70〜80%が前処理と言われているのよ。
モデル開発はむしろマイナーな作業、と揶揄されるほどね。
めっちゃ地味じゃん…でも、そこで手を抜くとGIGOになるわけか。
そう、まさにGIGOの予防が前処理。
地味だけれど、ここが精度の決め手。
じゃあ、データサイエンティストさんは日々お掃除のプロでもあるんですねぇ♪
いい視点ね。
近年は データ拡張(Data Augmentation)といって、既存データを回転や反転させて水増しする技法も前処理の一環として重要視されているわ。
なるほど。
データを『増やす』のも前処理なんだ?
奥が深いね。
試験では「前処理の工数割合=約80%」「欠損値・重複・正規化・外れ値」といった代表作業名が問われるので覚えてね。
さらに付け加えると、ラベル付け(アノテーション)も前処理の重要工程。
教師あり学習では正解ラベルの質が精度を左右するわ。
お料理で言うと、材料を切って、下味つけて、計量して…って工程全部ですねぇ。
料理とAI、なんか似てるね。
下ごしらえ雑だと味がまずいってやつじゃん。
いい例え。
前処理の質がAIの味(=精度)を決めるの。
料理も機械学習も、下ごしらえが命よ。
確認クイズ
データの前処理に含まれる作業として最も適切なものはどれか。
- AIモデルのアーキテクチャを設計すること
- 欠損値の補完やフォーマットの統一
- 学習後の精度評価
- AIサービスの運用監視
こたえを見る
正解: 2. 欠損値の補完やフォーマットの統一
前処理には欠損値の補完やフォーマットの統一などのデータ整形作業が含まれます。モデル設計・精度評価・運用監視はそれぞれ独立した別工程です。