今日は LLM がどう学習するかを、根本から見ていきましょう。
大きく事前学習とファインチューニング(微調整)の2段階があるの。
今日は事前学習編ね。
事前学習は Self-Supervised Learning(自己教師あり学習)でしたね。
詳しく説明すると、テキスト w₁…wₙ があったとき、ある位置の単語 wₜ を予測するのに前の文脈 w₁…wₜ₋₁ を使う対数尤度最大化で——というのが数式的な定式化で——
あー、またつむぎが数式モードに入ろうとしてる!
つむぎちゃん、落ち着いて〜?
ふふっ。
あらあら、つむぎさん、深掘りしたい気持ちはよく分かるけど、まずは直感から行きましょうか?
ざっくり言うとね、事前学習では「インターネット上の膨大なテキストを読ませて、次の単語を当てさせる」ことを何兆回も繰り返しているだけなのよ。
…ご、ごめんなさい、つい癖で。
えっ、ほんとにそれだけ?
シンプルじゃん。
それで何で賢くなるの?
不思議でしょ?
でも、「次の単語を当てる」には文法・語彙・常識・推論・世界知識が必要になるの。
「水の沸点は100度です。
なぜなら——」の次を当てるには物理知識が要るでしょ?
単純な予測タスクの副産物として、様々な知識が自然に獲得される——これを創発的能力の源泉と見る研究者もいるわ。
つまり、人間がラベルを付ける必要がないから、ネット上のテキストをそのまま教材にできるのが自己教師あり学習の強み——これが LLM を大規模化できた理由ですね。
でも、学習するにはすっごくお金がかかるって聞いたけど…
鋭いわね。
何千台もの GPU を何週間も動かすから、電気代とハード代だけで数億〜数十億円かかると言われているわ。
GPT-4 の学習費用は1億ドル以上とも推定されているの。
だからこそ、事前学習は大企業や巨大研究機関が行って、私たちは API やオープンソースモデル経由、あるいは後述のLoRAなどで微調整する形が主流よ。
えっ、ほんと?
個人じゃ絶対無理じゃん!
失敗したらウン億円飛ぶってこと?!
うわぁ、プレッシャーやばすぎ!
補足ですが、事前学習のコストは「計算量 × データ量 × モデル規模」の積で決まり、これを最適に配分する経験則がChinchilla則として知られています。
ゆえに事前学習のノウハウ自体が各社の競争優位の源泉なんですね。
学習スケジュール・データ混合比・学習率カーブなど、細かいレシピは公開されないことが多いです。
その通り。
その中で、Meta の LLaMA や Mistral がオープンに重みを公開してくれたのは、学術・実務の両面でとても大きな恩恵だったわ。
試験では「事前学習=次単語予測による自己教師あり学習」「規模と計算量の比例関係」「ファインチューニングと2段階」を押さえて。
1回の ChatGPT 応答の裏には、数か月の学習と億単位の投資が結晶している、と思うと AI に対する見方も変わるでしょ?
確認クイズ
LLM の事前学習の手法として最も適切なものはどれか。
- 教師あり学習で正解ラベルを使う
- 自己教師あり学習で次の単語を予測する
- 強化学習で報酬を最大化する
- 教師なし学習でクラスタリングする
こたえを見る
正解: 2. 自己教師あり学習で次の単語を予測する
LLM の事前学習は、テキストデータ自体を教師信号として「次の単語を予測する」自己教師あり学習で行われます。正解ラベル不要、強化学習やクラスタリングとは別手法です。