今日は大規模言語モデル、つまりLLMを総復習するわよ。
生成AIの主役、試験でも技術系の中核ね。
ChatGPTもClaudeもGeminiも、全部LLMなんだよね! こないだ妹に説明したよ、ドヤ顔でね!
補足すると、LLMはLarge Language Modelの略で、Transformerベースの巨大な言語モデルを指すの。
パラメータ数の桁がまるで違うわ。
らーじ…おっきいモデルさんってことだねぇ! おっきいほど賢いのぉ?
ましろちゃん、おおむねそうよ。
ただし、ただ大きければいいわけではなく、データの質・学習方法も重要なの。
そっか、量だけじゃ賢くならないんだね。
人間と同じで、学習の質も大事ってことか〜!
LLMの学習は2段階…というより、実質3段階の構成でしたよね。
復習を兼ねて整理したいです。
その通り。
第1段階は事前学習 (Pre-training) で、ウェブ・書籍などの大量テキストから次のトークンを予測する練習を繰り返すの。
第2段階はファインチューニングやRLHFで、人間が「望ましい」とする応答スタイルに調整する段階ね。
第1段階が「言葉の統計を学ぶ」基礎段階、第2段階が「人間と対話するマナーを学ぶ」応用段階、というイメージよ。
人間がAIにお作法を教えるみたいな感じなのぉ?
ましろちゃん、まさにその通り! しつけのような段階が第2段階ね。
Eテレで育った子どもと、誰からも教わらず育った子どもの違いに近いわ。
お作法か…家庭教師みたいだね。
LLMにも先生がついてたんだって思うと、ちょっと面白いじゃん!
トークンって…文字と同じなのぉ?
ましろちゃん、ほんの少し違うの。
英語では1単語が1トークンに近いけど、日本語では漢字1文字が1〜3トークンに分割されることが多いわ。
API利用時はトークン数が課金や制限の単位になるから、実務でも重要な概念よ。
なるほどね。
長文ほどお金かかるってことか! 節約大事じゃん!
ビジネス利用ではトークンの最適化も大事なテーマね。
プロンプトを短くしつつ精度を保つ技術が求められるわ。
言葉も経済なんだねぇ〜
うまい表現ね、ましろちゃん。
「言葉の経済」かぁ、これからはそんな視点も必要ということね。
確認クイズ
LLMの学習過程で、人間の評価をもとに出力を改善する手法はどれか?
- 事前学習 (Pre-training)
- 転移学習 (Transfer Learning)
- RLHF (Reinforcement Learning from Human Feedback)
- データ拡張 (Data Augmentation)
こたえを見る
正解: 3. RLHF (Reinforcement Learning from Human Feedback)
RLHFは人間のフィードバックを報酬信号として強化学習を行う手法で、ChatGPTやClaudeの「対話として自然な応答」を実現する要となっています。事前学習は大規模データによる自己教師あり学習の段階で、別の概念です。