データの前処理 - 汚れたデータをきれいにする

AI開発の80%を占める前処理。欠損値の補完やフォーマット統一の重要性を解説します。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針

AIに渡す前にデータを「掃除」する工程、それが前処理です。この重要ステップを学びましょう。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

データ集めたらそのままAIにドーンと入れれば終わりじゃん?
なんでわざわざ下処理が要るの?

香月 リサ 先生(普段) 香月 リサ 先生

そこが落とし穴なの。
現実のデータは汚れだらけで、前処理なしでは精度が出ないのよ。

雪村 ましろ(普段) 雪村 ましろ

汚れ…ってどんな汚れですかぁ?

深見 つむぎ(普段) 深見 つむぎ

たとえば「東京都」と「東京」と「Tokyo」が混在、電話番号のハイフン有り無し、同じ顧客の重複登録、欠損値、文字化け、日付形式のばらつき…。
本当に多種多様なの。

戸倉 ジャスミン(びっくり) 戸倉 ジャスミン

マジで? 会社のデータってそんなに汚いんだ…。

香月 リサ 先生(普段) 香月 リサ 先生

そう。
前処理の代表作業は(1)欠損値の補完(2)重複除去(3)正規化(4)形式統一(5)外れ値の除去 などね。

深見 つむぎ(普段) 深見 つむぎ

さらに、テキストデータなら分かち書きやストップワード(「は」「が」など)除去、画像ならリサイズやノイズ除去も必要ね。

雪村 ましろ(笑顔) 雪村 ましろ

データもお風呂に入れてきれいにしてからAIに会わせるんですねぇ…優しい工程ですぅ。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

ましろ、表現が優しい(笑)。
で、前処理ってどれくらいの労力なの?

香月 リサ 先生(普段) 香月 リサ 先生

AI開発の作業時間の実に70〜80%が前処理と言われているのよ。
モデル開発はむしろマイナーな作業、と揶揄されるほどね。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

めっちゃ地味じゃん…でも、そこで手を抜くとGIGOになるわけか。

深見 つむぎ(普段) 深見 つむぎ

そう、まさにGIGOの予防が前処理。
地味だけれど、ここが精度の決め手。

雪村 ましろ(笑顔) 雪村 ましろ

じゃあ、データサイエンティストさんは日々お掃除のプロでもあるんですねぇ♪

香月 リサ 先生(普段) 香月 リサ 先生

いい視点ね。
近年は データ拡張(Data Augmentation)といって、既存データを回転や反転させて水増しする技法も前処理の一環として重要視されているわ。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

なるほど。
データを『増やす』のも前処理なんだ?
奥が深いね。

香月 リサ 先生(笑顔) 香月 リサ 先生

試験では「前処理の工数割合=約80%」「欠損値・重複・正規化・外れ値」といった代表作業名が問われるので覚えてね。

深見 つむぎ(普段) 深見 つむぎ

さらに付け加えると、ラベル付け(アノテーション)も前処理の重要工程。
教師あり学習では正解ラベルの質が精度を左右するわ。

雪村 ましろ(普段) 雪村 ましろ

お料理で言うと、材料を切って、下味つけて、計量して…って工程全部ですねぇ。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

料理とAI、なんか似てるね。
下ごしらえ雑だと味がまずいってやつじゃん。

香月 リサ 先生(笑顔) 香月 リサ 先生

いい例え。
前処理の質がAIの味(=精度)を決めるの。
料理も機械学習も、下ごしらえが命よ。

確認クイズ

データの前処理に含まれる作業として最も適切なものはどれか。

  1. AIモデルのアーキテクチャを設計すること
  2. 欠損値の補完やフォーマットの統一
  3. 学習後の精度評価
  4. AIサービスの運用監視
こたえを見る

正解: 2. 欠損値の補完やフォーマットの統一

前処理には欠損値の補完やフォーマットの統一などのデータ整形作業が含まれます。モデル設計・精度評価・運用監視はそれぞれ独立した別工程です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。