事前学習データ - LLMは何を読んで育つ?

LLMが学習する膨大なデータはどこから来るのか。事前学習データの中身と課題を解説します。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
戸倉 ジャスミン(普段) 戸倉 ジャスミン

ねえ先生、あたしたちは定期テストの前に教科書読み込むけどさ、LLM って何を教科書にしてるの?

深見 つむぎ(普段) 深見 つむぎ

確かに気になります。
補足すると、学習データの出自は LLM の性能や偏りを大きく左右しますよね。

香月 リサ 先生(笑顔) 香月 リサ 先生

いい質問と補足ね。
今日のテーマは LLM の「教科書」——事前学習データよ。

雪村 ましろ(びっくり) 雪村 ましろ

ネットの文章ぜんぶ読んでるイメージあるけど、ほんとに全部なのぉ?

香月 リサ 先生(普段) 香月 リサ 先生

イメージとしては近いわ。
代表的なのがCommon Crawlというインターネット上の膨大なウェブページを集めたデータセット、Wikipedia 全文、書籍(Books)、論文(arXiv など)、ソースコード(GitHub)、対話データなどの組み合わせよ。

深見 つむぎ(普段) 深見 つむぎ

つまり、LLM はネット全体の図書館 + 専門書 + コードを一気に読んでいるわけですね。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

すご〜い、図書館まるごと?!
そりゃ賢くなるわけだね!

香月 リサ 先生(普段) 香月 リサ 先生

ただしそのまま使うとノイズや重複、低品質な文章、有害コンテンツが混ざっているの。
そこでデータクリーニングがとても大事なのよ。
代表的な前処理として「重複除去」「言語フィルタ」「品質スコアによる絞り込み」「有害コンテンツフィルタ」などがあるわ。
面白いことに、重複除去だけでもモデル性能が大きく向上するの。

雪村 ましろ(しょんぼり) 雪村 ましろ

じゃあ、学習データに嘘が混じってたら…AI も嘘を覚えちゃうの?

香月 リサ 先生(普段) 香月 リサ 先生

鋭い!
そこが大きな課題。
学習データのバイアスや不正確さはモデルの出力にそのまま反映されるリスクがあるの。
これは後のAI倫理や公平性の記事で詳しく扱うわ。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

「ゴミを入れたらゴミが出てくる」って言うもんね。
要は、データの質が AI の質を決めるってこと?

深見 つむぎ(普段) 深見 つむぎ

俗に GIGO(Garbage In, Garbage Out)の原則ですね。
これはデータベース時代から言われていますが、LLM では規模が大きいぶん影響も大きい。

香月 リサ 先生(普段) 香月 リサ 先生

さらに最近は、データの著作権問題も議論に上がっているの。
ウェブから無断で学習に使っていいのか?
という点ね。
日本では著作権法第30条の4で学習目的は原則合法とされているけど、国によって扱いが違うし、判例も形成途中なの。
最近は「高品質データの確保」そのものが各社の競争優位性になっているのよ。

雪村 ましろ(笑顔) 雪村 ましろ

お菓子作りで言うと、材料の産地とか鮮度とか配合とか、ぜんぶ大事って話だねぇ。
ぽわわ〜、食と AI、似てるところあるんだぁ…。

香月 リサ 先生(普段) 香月 リサ 先生

ふふ、ましろちゃんの比喩は秀逸ね。
LLM は食品と違って賞味期限はないけれど、知識カットオフ——学習データがいつまでかという時点——はあるわ。
最新情報が必要な場面では RAG と組み合わせるのが鉄則よ。
試験では「主要データソース」「データクリーニングの重要性」「バイアスリスク」の3点を押さえて。
ビジネスで LLM を使うときも、学習データの出自を意識することで思わぬ落とし穴を避けられるの。

確認クイズ

LLM の事前学習データに関する説明として最も適切なものはどれか。

  1. 高品質データのみ使われるためバイアスの心配はない
  2. 学習データのバイアスはモデル出力に影響しうる
  3. 学習データは手動で一文ずつ入力される
  4. 学習データの量は精度に影響しない
こたえを見る

正解: 2. 学習データのバイアスはモデル出力に影響しうる

学習データに含まれるバイアスや不正確さはモデルの出力にそのまま反映されるリスクがあるため、データの品質管理は極めて重要です。手動一文ずつは現実的でなく、量は精度に直結します。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。