ハルシネーションの原因と種類

ハルシネーションには内在的・外在的の2種類がある。データ・メカニズム・運用の3系統に整理して原因を押さえよう。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
戸倉 ジャスミン(笑い) 戸倉 ジャスミン

よーし、今日はあたしが主役って気分だよ! 先生、ハルシネーションの原因、全部教えて!

香月 リサ 先生(笑顔) 香月 リサ 先生

(ふふ)やる気ね。
じゃあ一気に行きましょう。
原因は大きく3系統あるの。
『データ起因』『生成メカニズム起因』『運用起因』——この枠組みが試験でも使える整理よ。

深見 つむぎ(普段) 深見 つむぎ

データ起因というと、学習データ自体に誤りや偏りがあるケースですね。

香月 リサ 先生(普段) 香月 リサ 先生

そう。
ここを内在的ハルシネーションと呼ぶこともあるわ。
一方、学習データに存在しない情報を『それっぽく』でっち上げるのが外在的ハルシネーション。
この2分類は押さえておきたいわね。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

バドミントンでいうと、データ起因は『コーチの教え方がそもそも間違ってた』、外在的は『教わってない戦術を試合中に即興で作っちゃう』みたいな感じか。

香月 リサ 先生(笑顔) 香月 リサ 先生

いい例え! まさにそんなイメージよ。

雪村 ましろ(笑顔) 雪村 ましろ

ジャスミンちゃん、今日冴えてるっ!

深見 つむぎ(普段) 深見 つむぎ

生成メカニズム起因というのは、Transformerの確率的サンプリング自体に由来する部分ですよね。
サンプリング温度や top-p などのハイパーパラメータでも結果が揺れます。

香月 リサ 先生(普段) 香月 リサ 先生

その通り。
そして運用起因は、曖昧なプロンプト、長すぎる会話で文脈が薄れる、などの使い方の問題。
ここは次の対策編で詳しくやるわね。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

つまり、原因は『素材・料理法・出し方』の3段階にあるってことか〜!
あたし、料理下手だけどこれなら分かるね。

雪村 ましろ(笑顔) 雪村 ましろ

ジャスミンちゃん、料理に例えるの上手!

香月 リサ 先生(普段) 香月 リサ 先生

ちなみに2024年以降、RLHF(人間のフィードバックによる強化学習)でハルシネーションは以前より減ったけど、ゼロにはなっていないの。
これは技術の限界として受け入れる必要があるわ。

深見 つむぎ(普段) 深見 つむぎ

つまり根絶は難しく、『前提として付き合う』姿勢が必要、ということですね。

戸倉 ジャスミン(笑顔) 戸倉 ジャスミン

次の対策編、楽しみにしてるね!

深見 つむぎ(普段) 深見 つむぎ

検出側の研究として、不確実性推定という分野も進展していて、モデル自身が自信度を示すことでハルシネーションを検知しようとしています。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

AIが『自分でも自信ないかも』って言ってくれたら、あたしたちも警戒できるもんね。

香月 リサ 先生(普段) 香月 リサ 先生

特に『外在的ハルシネーション』は、ユーザー側で識別しづらいのが厄介。
自信満々に語られる未知情報ほど要注意、というパラドックスね。

深見 つむぎ(普段) 深見 つむぎ

自信の強度と正確性が逆相関する場合もある、というのが実証研究でも報告されています (Yin et al. 2023)。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

3系統の整理、ほんとに助かる〜! これ、テスト前に見返そっと!

深見 つむぎ(笑顔) 深見 つむぎ

フレームワーク化すると暗記が圧倒的に楽になりますね。
『データ・メカニズム・運用』の3ワードだけ覚えれば、そこから派生で細目を思い出せます。

雪村 ましろ(笑顔) 雪村 ましろ

ましろも、レシピみたいに『材料・作り方・配り方』って思い出すことにするっ!

香月 リサ 先生(笑顔) 香月 リサ 先生

ましろちゃんの言い換え、素晴らしい。
自分の言葉で覚え直すのが一番深い理解に繋がるのよ。

深見 つむぎ(普段) 深見 つむぎ

『内在的 / 外在的』の2分類も整理できたら、次はこの記事の続きで対策編に進みましょう。
原因が分かれば打ち手も明快になります。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

原因別に対処法を変えるって、お医者さんの診断みたいだね!

香月 リサ 先生(笑顔) 香月 リサ 先生

ジャスミンちゃん、AIリスク対応の本質を突いてるわね。
『症状名→原因→処方』の流れは、医療もAIも同じ構造なのよ。

確認クイズ

学習データ内部の誤りや欠損に起因するハルシネーションを何と呼ぶ?

  1. 外在的ハルシネーション
  2. 内在的ハルシネーション
  3. 確率的ハルシネーション
  4. 運用的ハルシネーション
こたえを見る

正解: 2. 内在的ハルシネーション

『内在的』はデータ内部の誤り起因、『外在的』は学習データにない情報をでっち上げるタイプ。2分類の使い分けが試験頻出です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。