総復習 - 大規模言語モデル(LLM)

LLMの仕組み・学習方法・主要キーワードを確認しましょう。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
香月 リサ 先生(笑顔) 香月 リサ 先生

今日は大規模言語モデル、つまりLLMを総復習するわよ。
生成AIの主役、試験でも技術系の中核ね。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

ChatGPTもClaudeもGeminiも、全部LLMなんだよね! こないだ妹に説明したよ、ドヤ顔でね!

深見 つむぎ(笑顔) 深見 つむぎ

補足すると、LLMはLarge Language Modelの略で、Transformerベースの巨大な言語モデルを指すの。
パラメータ数の桁がまるで違うわ。

雪村 ましろ(笑顔) 雪村 ましろ

らーじ…おっきいモデルさんってことだねぇ! おっきいほど賢いのぉ?

香月 リサ 先生(笑顔) 香月 リサ 先生

ましろちゃん、おおむねそうよ。
ただし、ただ大きければいいわけではなく、データの質・学習方法も重要なの。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

そっか、量だけじゃ賢くならないんだね。
人間と同じで、学習の質も大事ってことか〜!

深見 つむぎ(普段) 深見 つむぎ

LLMの学習は2段階…というより、実質3段階の構成でしたよね。
復習を兼ねて整理したいです。

香月 リサ 先生(普段) 香月 リサ 先生

その通り。
第1段階は事前学習 (Pre-training) で、ウェブ・書籍などの大量テキストから次のトークンを予測する練習を繰り返すの。

第2段階はファインチューニングやRLHFで、人間が「望ましい」とする応答スタイルに調整する段階ね。

第1段階が「言葉の統計を学ぶ」基礎段階、第2段階が「人間と対話するマナーを学ぶ」応用段階、というイメージよ。

雪村 ましろ(普段) 雪村 ましろ

人間がAIにお作法を教えるみたいな感じなのぉ?

香月 リサ 先生(笑顔) 香月 リサ 先生

ましろちゃん、まさにその通り! しつけのような段階が第2段階ね。
Eテレで育った子どもと、誰からも教わらず育った子どもの違いに近いわ。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

お作法か…家庭教師みたいだね。
LLMにも先生がついてたんだって思うと、ちょっと面白いじゃん!

雪村 ましろ(あせる) 雪村 ましろ

トークンって…文字と同じなのぉ?

香月 リサ 先生(笑顔) 香月 リサ 先生

ましろちゃん、ほんの少し違うの。
英語では1単語が1トークンに近いけど、日本語では漢字1文字が1〜3トークンに分割されることが多いわ。

API利用時はトークン数が課金や制限の単位になるから、実務でも重要な概念よ。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

なるほどね。
長文ほどお金かかるってことか! 節約大事じゃん!

深見 つむぎ(普段) 深見 つむぎ

ビジネス利用ではトークンの最適化も大事なテーマね。
プロンプトを短くしつつ精度を保つ技術が求められるわ。

雪村 ましろ(びっくり) 雪村 ましろ

言葉も経済なんだねぇ〜

香月 リサ 先生(笑顔) 香月 リサ 先生

うまい表現ね、ましろちゃん。
「言葉の経済」かぁ、これからはそんな視点も必要ということね。

確認クイズ

LLMの学習過程で、人間の評価をもとに出力を改善する手法はどれか?

  1. 事前学習 (Pre-training)
  2. 転移学習 (Transfer Learning)
  3. RLHF (Reinforcement Learning from Human Feedback)
  4. データ拡張 (Data Augmentation)
こたえを見る

正解: 3. RLHF (Reinforcement Learning from Human Feedback)

RLHFは人間のフィードバックを報酬信号として強化学習を行う手法で、ChatGPTやClaudeの「対話として自然な応答」を実現する要となっています。事前学習は大規模データによる自己教師あり学習の段階で、別の概念です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。