前回、生成AIと識別AIに触れたわね。
今日はそれをもう一歩深めて、生成モデルと識別モデルという言い方で整理しましょう。
識別モデル(Discriminative Model)は、入力がどのカテゴリに属するかを判定するモデルですよね。
ここで質問——「モデル」と「AI」は同じ意味で使っていいですか?
いい質問ね。
ここでのモデルは、学習を経てパターンを内に持ったAIの中身、と捉えてね。
ふふ、つむぎさんの丁寧さは生徒会書記らしいわ。
で、識別モデルって具体的に何してるの?
メールの振り分けとか?
そうそう、メールが「スパムか、正常か」を見分けたり、写真が「犬か猫か」を当てたりするのが識別モデルね。
入力 X に対して、ラベル Y の確率P(Y|X)を計算しているの。
なるほど、条件付き確率で答えを絞り込んでいるわけですね。
では生成モデルは?
生成モデルはデータ全体の確率分布を学ぶの。
犬の写真なら「どんな色・形・ポーズが自然か」の分布ね。
そこからサンプリングして新しい犬画像を描ける。
分布を覚えちゃえば、新しい犬も描けちゃうんだぁ!
えへへ、AIって絵の具セットを持ってる画家さんみたい。
識別モデルは門番さんで、生成モデルは画家さん、って感じ?
ましろちゃん、いい比喩よ。
門番と画家、覚えやすいわね。
それならイメージしやすいね!
でもさ、生成モデルの方が万能なら、識別モデルっていらなくない?
いいえ、役割が違うのよ。
医療画像で「がんか否か」を判定するような現場では、今も高精度の識別モデルが主役。
生成モデルは創造、識別モデルは判定——住み分けが大事ということね。
生成AIブームでも識別AIは健在、と覚えておきます。
補足ですが、生成 AI も内部で識別器を使うことがあり、GANは生成器と識別器を競わせて学習するんですよね。
つまり生成と識別は完全に分離した概念ではなく、相互作用することもある、と。
いい補足。
GAN では識別器が生成器の出す偽物を見破ろうとし、生成器はそれを騙そうと成長する——二人三脚で品質が上がるのよ。
他の代表例は、文章ならLLM、画像なら拡散モデルや GAN、画像を圧縮して復元するのにVAE、音声ならTTSやSTT、マルチモーダルなら Gemini や GPT-4o。
これらを Phase 4 でひとつずつ扱うわよ。
ちなみに「半教師あり学習」とか「自己教師あり学習」って、このどっちに入るのぉ?
いい質問。
半教師ありは「ラベル有+無データを併用」、自己教師ありは「データ自身からラベルを作る」方式で、どちらも学習手順の話。
生成/識別は目的(何を学ぶか)の軸だから、混ぜないことね。
たとえば LLM は自己教師あり学習で生成モデルを作る組み合わせよ。
整理すると、「何を学ぶか(生成/識別)」と「どう学ぶか(教師有無)」を分けて押さえるのが、用語を混同しないコツということですね。
試験でも、設問で出てくる観点がどちらの軸なのかを意識して読む、と迷わずに答えられます。
確認クイズ
生成モデルが学習する対象として最も適切なものはどれか。
- 入力データのラベル
- データの確率分布
- ルールベースの条件式
- 固定されたテンプレート
こたえを見る
正解: 2. データの確率分布
生成モデルはデータXそのものの確率分布 P(X) を学習し、そこからサンプリングで新しいデータを生成できます。ラベル学習は識別モデル、条件式やテンプレートは学習型ではない古典手法です。