損失関数 - AIの間違いを数値化する

損失関数の基本を解説。MSEと交差エントロピーを理解しよう。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針

今日はテスト返却後の教室からスタート。『何点減点された?』という話題が、実は『損失関数』の本質そのもの。会話から機械学習の最重要概念を掴みます。

戸倉 ジャスミン(しょんぼり) 戸倉 ジャスミン

数学のテスト返ってきたんだけどさ、85点だった〜。
15点も減点されちゃってきつい…。

深見 つむぎ(普段) 深見 つむぎ

つまり、減点が少ないほど実力に近いという理解で合っていますか?

雪村 ましろ(あせる) 雪村 ましろ

先生〜、AIもテストみたいに点数で評価されてるんですかぁ?

香月 リサ 先生(笑顔) 香月 リサ 先生

ふふ、いいきっかけね。
AIも『正解からどれだけズレたか』を数値化しているの。
それが損失関数(Loss Function)よ。
小さいほど優秀。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

じゃあ要は、あたしのテストの減点15点が損失に相当するってこと? なんかおもしろいじゃん!

深見 つむぎ(普段) 深見 つむぎ

まさに。
そして学習の目的は、この損失を最小化するパラメータを探すことです。
前回の勾配降下法は、損失関数という『山』を下る手法でしたね。

香月 リサ 先生(普段) 香月 リサ 先生

代表的な損失関数を2つ覚えておきましょう。
回帰では平均二乗誤差(MSE)、分類では交差エントロピー。

雪村 ましろ(あせる) 雪村 ましろ

平均二乗誤差って、どんな式なのぉ?

香月 リサ 先生(普段) 香月 リサ 先生

予測値と正解の差を2乗して、全データで平均するの。
2乗する理由はマイナスの誤差もプラスで評価するため。
そして大きく外した時のペナルティが強くなる。

深見 つむぎ(普段) 深見 つむぎ

分類の交差エントロピーは『確率が正解にどれだけ近いか』を対数で測る指標です。
確信をもって間違えるほど大きなペナルティになる特徴があります。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

要は『自信満々で外したら大減点』ってこと? 厳しいじゃん…

香月 リサ 先生(笑顔) 香月 リサ 先生

ふふ、そうね。
逆に『自信がなくて合った』時もあまり褒められないわ。

雪村 ましろ(笑顔) 雪村 ましろ

勉強でいう『ヤマ勘で当たった』みたいな感じなのぉ〜?

香月 リサ 先生(普段) 香月 リサ 先生

損失関数のバリエーションは目的に応じて豊富よ。
外れ値に強いHuber損失、不均衡データ向けのFocal損失、ランキング問題向けの損失など、問題に合わせて選ぶの。

深見 つむぎ(普段) 深見 つむぎ

生成AIでも損失関数の設計は重要で、たとえばGPTは次トークンの予測誤差を交差エントロピーで測っています。
画像生成のStable Diffusionも独自の損失設計があります。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

よっしゃ、どんなAIも結局『どれだけ間違えたか』を数値で測ってるんだね。
本質は一緒じゃん!

香月 リサ 先生(普段) 香月 リサ 先生

まとめると、機械学習の学習プロセスは『損失関数の値を小さくするパラメータを探す最適化問題』なのよ。
この視点があればどんなモデルも同じ土俵で考えられるわ。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

テストの点を上げたいって発想と一緒じゃん! 急に親近感わいた。
勾配降下法も損失関数を小さくする作戦なんだよね。

雪村 ましろ(笑顔) 雪村 ましろ

損失関数を理解したら、AIの勉強が急に身近になった気がします〜!

香月 リサ 先生(笑顔) 香月 リサ 先生

そうね、学習の中心にある考え方だから、ここを押さえると他の話も繋がって見えるようになるわ。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

あたしも損失関数、しっかり仲良くなっておくじゃん。
勾配降下法と合わせて覚えれば鬼に金棒だね。

深見 つむぎ(普段) 深見 つむぎ

ちなみに生成AIの学習では、出力の品質を人が評価したデータを報酬モデルに変換し、それを損失関数に組み込むRLHFという手法も使われています。
損失設計の工夫は最先端でも重要テーマです。

深見 つむぎ(普段) 深見 つむぎ

試験では『損失関数=予測と正解のズレを数値化』『MSEは回帰、交差エントロピーは分類で使う』を押さえましょう。

確認クイズ

損失関数の値が小さいほど何を意味するか?

  1. モデルの複雑さが高い
  2. 学習データが不足している
  3. モデルの予測精度が高い
  4. 特徴量の数が多い
こたえを見る

正解: 3. モデルの予測精度が高い

損失関数は予測と正解のズレを表す指標なので、値が小さいほど予測が正解に近い=精度が高いことを意味します。学習の目的はこの損失を最小化することです。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。