『教師あり学習』という言葉の響きから、ちょっとした誤解が生まれます。今日はジャスミンちゃんの勘違いを入り口に、正解ラベルで学ぶ仕組みと2つの代表タスクを整理しましょう。雑談気味の導入から本題へと、のんびり進めていきます。
教師あり学習って、画面の向こうで先生がAIに説教する感じですか? うちの部活のコーチみたいに『そこ、もっとダッシュ!』みたいなやつ。
あらあら、それは違うわよ、ジャスミンちゃん。
ここで言う『教師』は人間の先生ではなく、データに付いている『正解ラベル』のことなの。
ラベルが正解を教えてくれるから『教師あり』というわけ。
うそっ!?
人じゃなくて正解タグが先生役ってことか! 部活の例えは外したけど、めっちゃ納得した!
補足すると、教師あり学習では入力データとそれに対応する正解ラベルをペアにして大量に与えます。
AIはそのペアから『入力→正解』の対応関係を推定していくんです。
うまく言えたわね、つむぎさん。
たとえば犬と猫の写真1000枚に『犬』『猫』のラベルを付けて渡す。
AIは『こんな模様なら犬、こんな耳の形なら猫』と統計的に特徴を掴んでいくわ。
漢字ドリルで言うなら、問題と答えがセットになってるページを延々と解くイメージか?
まさにそれ。
丸バツを見ながら少しずつ正解に寄せていく、これが教師あり学習の直感的なイメージよ。
ましろの勉強法で言うと、漢字ドリルで答え合わせしながら覚える感じ〜? 間違えたらもう一回やり直す、みたいな〜。
まさにそれね、ましろちゃん。
人間の学習と共通している部分が多いから、イメージしやすい学習方式なの。
主なタスクは『分類』と『回帰』の2種類に大別されます。
迷惑メールか否か、のようにカテゴリを当てるのが分類、気温や売上の数値を当てるのが回帰です。
すご〜い、2種類だけなら覚えられるじゃん。
あたしでもいけそう。
犬猫の判別は分類、家の値段を予測するのは回帰、ってことか〜!
正解。
教師あり学習の応用はとても広く、スパム判定・医療画像診断・故障予測・需要予測など、身近なAIサービスの多くはこの枠組みで動いているの。
ただし弱点もあるわ。
正解ラベルを人間が一つひとつ付けるのに、膨大な時間とコストがかかるのよ。
医療画像だと専門医が見る必要があるから、数万枚のラベル付けには何ヶ月もかかることがあるの。
正解を用意する人、大変そう〜。
お医者さん、休む暇がなくなっちゃいそう…。
だからこそ、ラベルの質を高く保つ工程(アノテーションと呼びます)の設計が、モデル精度を左右するポイントになりますね。
複数の専門家で相互チェックする運用もよく見ます。
ほんとそれ! 答えが間違ってたら、AIも間違えて覚えちゃうもんね。
試験では『教師あり学習=入力+正解ラベル』『分類と回帰が代表タスク』『ラベル作成コストが課題』の3点をセットで覚えてね。
ここは選択肢問題でよく出るわ。
確認クイズ
教師あり学習に必要なデータとして正しいものはどれか?
- 入力データのみ
- 入力データと正解ラベルのペア
- 報酬信号のみ
- ラベルなしデータのみ
こたえを見る
正解: 2. 入力データと正解ラベルのペア
教師あり学習は入力と正解ラベルのセットで学習します。ラベルなしデータのみで学ぶのは教師なし学習、報酬で学ぶのは強化学習で、それぞれ別の枠組みです。ラベルが『先生役』を務めるので教師あり学習と呼ばれます。