事前学習だけの LLM って、意外と使いにくいの。
今日はその理由と対策、インストラクションチューニングを見ましょう。
事前学習しただけじゃダメなの?
例を挙げるわね。
事前学習だけのモデルに「日本の首都は?」と入力すると、「日本の首都は?
…と多くの外国人観光客に聞かれます。
その答えは——」みたいに、質問の続きの文章を書いちゃうことがあるの。
次単語予測しかしないから「質問は答えられるべき」という対話のマナーを知らないのよ。
ふぇぇ…AI さんがとんちんかんな会話してる感じなのぉ?
つまり、「質問に答える」という行動パターンを追加で学習させる必要がある、という理解で合っていますか?
その通り。
人間が作った指示と模範回答のペアを大量に用意して、そのデータで追加学習するの。
「要約して」→模範要約、「翻訳して」→模範翻訳、「コードを書いて」→模範コード、というように。
先生が生徒に「この問題はこう解くんだよ」ってお手本を見せるみたい!
代表的なモデルってあるの?
Google のFLANや OpenAI のInstructGPTが初期の代表例ね。
InstructGPT が後の ChatGPT の原型になったと言われているわ。
補足: 最近は Alpaca、Vicuna、Dolly など、オープンソースのインストラクションチューニング済みモデルも多数公開されていて、個人でも Fine-tune 可能になっています。
研究者コミュニティの貢献も大きくて、オープンソース LLM の使いやすさが飛躍的に向上したんですね。
ChatGPT が使いやすいのって、このチューニングのおかげだったんだ!
そう、でもそれだけじゃ完璧じゃないの。
インストラクションチューニングはマナーを教える。
次に、RLHFで「人間好みの回答」に仕上げる——これがセットで「使いやすい AI」になる仕組みよ。
教育的比喩だと、①事前学習=大量の読書で基礎体力、②インストラクションチューニング=課題の解き方指導、③RLHF=面接対策で社会適応——という感じ。
つまり3段階ですね。
①事前学習で知識を獲得 → ②インストラクションチューニングで指示追従を獲得 → ③RLHF で人間の好みを反映。
AI の育成って、人間の教育と似てるんだねぇ…えへへ、なんだか愛おしいなぁ。
試験では、3段階のうち「インストラクションチューニング=指示追従の獲得」をピンポイントで押さえればOK。
混同しやすいのが RLHF だけど、RLHF は『選好学習』なので役割が違う、と区別してね。
補足: インストラクションチューニング用のデータセット自体を、他の LLM に自動生成させるSelf-Instructという手法もあり、コスト削減に貢献しています。
現在、Stanford Alpaca、Vicuna、Hugging Face の多数のモデルがこの手法で作られ、個人が数万円の GPU で競技レベルの LLM チューニングを試せる時代になっています。
確認クイズ
インストラクションチューニングの目的として最も適切なものはどれか。
- モデルのパラメータ数を増やす
- LLM が人間の指示に適切に従えるようにする
- 事前学習のデータ量を増やす
- モデルの推論速度を上げる
こたえを見る
正解: 2. LLM が人間の指示に適切に従えるようにする
インストラクションチューニングは、「指示と模範回答」のペアで追加学習することで、LLM が人間の指示に適切に従えるようにする手法です。パラメータ数・データ量・推論速度は直接の目的ではありません。