今日は生成AIの土台、言語モデルよ。
ChatGPT も Claude も、心臓部はこれなの。
言語モデルは「ある文脈が与えられたとき、次に出る単語の確率分布を計算するモデル」——という理解で合っていますか?
私の定義としては、n-gram モデルから始まってニューラル言語モデル、そして Transformer ベースの LLM へと発展し、結局のところ全ては条件付き確率 P(wₜ | w₁…wₜ₋₁) を如何に精密に推定するかに尽きる、と…
つむぎ、急にスイッチ入っちゃったね?!
えっ、ちょっと待ってぇ、つむぎちゃんの専門家モードすごいよぉ…!
あらあら、つむぎさん、張り切ってくれて嬉しいけど、みんなが置いてけぼりよ?
ふふ。
戻しましょう。
言語モデルはね、「今日は天気が」と入力されたら、次に「良い」が来る確率・「悪い」が来る確率・「崩れそう」が来る確率…と、候補ごとに数値を計算するの。
その中から選ぶ、の繰り返しで文章が続いていくわ。
…す、すみません、つい本を読んだばかりで。
あ、それスマホの予測変換と同じじゃん!
規模がでかくなっただけ?
その通り。
スマホの変換は直前の数語しか見ないけど、LLM はコンテキストウィンドウの範囲——たとえば数万〜数十万トークン——を踏まえて予測できるの。
ぽわわ〜、すっごく長い記憶力なんだぁ…!
じゃあ毎回同じ返事になっちゃうの?
いい疑問。
最も確率の高い単語だけを選べば同じになるけど、少しランダム性を入れると毎回違う返事になるの。
この調整をtemperatureと呼ぶわ。
温度が高いほど多様、低いほど固定的。
他にもtop-p(核サンプリング)や top-k のように、候補の幅を制御する方法もあるんですよね。
温度0 なら毎回コピペみたいな返事で、1 超えだと自由詩みたいな返事になるってこと?
要は文章作るとき、毎回サイコロ振ってる感じ?
当たり!
厳密にはサイコロの目の偏りを学習で操る感じ。
「今日は天気が」の次は「良い」60%、「悪い」20%、「崩れそう」10%——みたいな偏ったサイコロを、文脈ごとに作り直している、と考えると近いわ。
そして大事なのは、この次単語予測だけを何兆回も繰り返すことで、結果的に文法・常識・推論力まで身につく、という点ですよね。
そう、これを自己教師あり学習と呼ぶわ。
正解ラベルを人が付けなくても、テキストの次の単語そのものが正解になる、という仕掛けね。
この仕組みが LLM の魔法の正体よ。
えへへ、ましろのスマホも、毎日育てたら賢くなるのかなぁ?
原理は同じで、規模が違うだけなんだぁ。
ぽわわ〜、言葉を予測するだけで、ここまで賢くなれるって不思議…スマホの予測変換から ChatGPT までは地続きなんだねぇ。
確認クイズ
言語モデルの基本的な動作原理として最も適切なものはどれか。
- 画像を認識する
- 次に来る単語の確率を予測する
- データベースを検索する
- ルールに従って回答する
こたえを見る
正解: 2. 次に来る単語の確率を予測する
言語モデルの基本は、与えられた文脈に対して次に来る単語の確率分布を計算することです。画像認識はCNNなど別分野、DB検索は従来型IR、ルールベースは生成AI以前の手法です。