生成モデルと識別モデルの違い

AIモデルは大きく「生成モデル」と「識別モデル」に分かれます。それぞれの仕組みと得意分野を比較しながら学びましょう。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
香月 リサ 先生(笑顔) 香月 リサ 先生

前回、生成AIと識別AIに触れたわね。
今日はそれをもう一歩深めて、生成モデルと識別モデルという言い方で整理しましょう。

深見 つむぎ(普段) 深見 つむぎ

識別モデル(Discriminative Model)は、入力がどのカテゴリに属するかを判定するモデルですよね。
ここで質問——「モデル」と「AI」は同じ意味で使っていいですか?

香月 リサ 先生(笑顔) 香月 リサ 先生

いい質問ね。
ここでのモデルは、学習を経てパターンを内に持ったAIの中身、と捉えてね。
ふふ、つむぎさんの丁寧さは生徒会書記らしいわ。

戸倉 ジャスミン(あせる) 戸倉 ジャスミン

で、識別モデルって具体的に何してるの?
メールの振り分けとか?

香月 リサ 先生(普段) 香月 リサ 先生

そうそう、メールが「スパムか、正常か」を見分けたり、写真が「犬か猫か」を当てたりするのが識別モデルね。
入力 X に対して、ラベル Y の確率P(Y|X)を計算しているの。

深見 つむぎ(普段) 深見 つむぎ

なるほど、条件付き確率で答えを絞り込んでいるわけですね。
では生成モデルは?

香月 リサ 先生(普段) 香月 リサ 先生

生成モデルはデータ全体の確率分布を学ぶの。
犬の写真なら「どんな色・形・ポーズが自然か」の分布ね。
そこからサンプリングして新しい犬画像を描ける。

雪村 ましろ(笑顔) 雪村 ましろ

分布を覚えちゃえば、新しい犬も描けちゃうんだぁ!
えへへ、AIって絵の具セットを持ってる画家さんみたい。
識別モデルは門番さんで、生成モデルは画家さん、って感じ?

香月 リサ 先生(普段) 香月 リサ 先生

ましろちゃん、いい比喩よ。
門番と画家、覚えやすいわね。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

それならイメージしやすいね!
でもさ、生成モデルの方が万能なら、識別モデルっていらなくない?

香月 リサ 先生(普段) 香月 リサ 先生

いいえ、役割が違うのよ。
医療画像で「がんか否か」を判定するような現場では、今も高精度の識別モデルが主役。
生成モデルは創造、識別モデルは判定——住み分けが大事ということね。

深見 つむぎ(普段) 深見 つむぎ

生成AIブームでも識別AIは健在、と覚えておきます。
補足ですが、生成 AI も内部で識別器を使うことがあり、GANは生成器と識別器を競わせて学習するんですよね。
つまり生成と識別は完全に分離した概念ではなく、相互作用することもある、と。

香月 リサ 先生(普段) 香月 リサ 先生

いい補足。
GAN では識別器が生成器の出す偽物を見破ろうとし、生成器はそれを騙そうと成長する——二人三脚で品質が上がるのよ。
他の代表例は、文章ならLLM、画像なら拡散モデルや GAN、画像を圧縮して復元するのにVAE、音声ならTTSやSTT、マルチモーダルなら Gemini や GPT-4o。
これらを Phase 4 でひとつずつ扱うわよ。

雪村 ましろ(普段) 雪村 ましろ

ちなみに「半教師あり学習」とか「自己教師あり学習」って、このどっちに入るのぉ?

香月 リサ 先生(普段) 香月 リサ 先生

いい質問。
半教師ありは「ラベル有+無データを併用」、自己教師ありは「データ自身からラベルを作る」方式で、どちらも学習手順の話。
生成/識別は目的(何を学ぶか)の軸だから、混ぜないことね。
たとえば LLM は自己教師あり学習で生成モデルを作る組み合わせよ。

深見 つむぎ(普段) 深見 つむぎ

整理すると、「何を学ぶか(生成/識別)」と「どう学ぶか(教師有無)」を分けて押さえるのが、用語を混同しないコツということですね。
試験でも、設問で出てくる観点がどちらの軸なのかを意識して読む、と迷わずに答えられます。

確認クイズ

生成モデルが学習する対象として最も適切なものはどれか。

  1. 入力データのラベル
  2. データの確率分布
  3. ルールベースの条件式
  4. 固定されたテンプレート
こたえを見る

正解: 2. データの確率分布

生成モデルはデータXそのものの確率分布 P(X) を学習し、そこからサンプリングで新しいデータを生成できます。ラベル学習は識別モデル、条件式やテンプレートは学習型ではない古典手法です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。