Phase 4 の最終回。
ここまで40記事、生成AIの技術をみっちり見てきたわね。
総復習しましょう。
まず土台として、2017年のTransformer登場が全ての起点でしたね。
Self-Attention による並列処理で、学習効率と長期依存の扱いが劇的に改善された。
その上にLLMが構築されて、GPT・BERT・Claude・Gemini・LLaMA など代表モデルが生まれた。
事前学習 → インストラクションチューニング → RLHF の3段階で「使える AI」に仕上がる、という流れが標準になったわ。
スケーリング則で大きくすれば賢くなるし、ある規模を超えると創発的能力まで出てくる——しかもそれが経済的にも予測可能って、すごい話だったよね。
補足すると、最近はスケーリング一辺倒から、推論時計算量を重視する o1 系、推論モード付き Claude などが台頭し、多様化が進んでいます。
画像生成の章では拡散モデルがノイズから画像を段階的に生成する仕組み、Stable Diffusionが潜在空間で効率化、そしてCLIPがテキスト→画像のガイドを担っている、と学んだわ。
さらに音声生成(TTS)、音声認識(STT)、動画生成(Sora)、音楽生成、コード生成(Copilot)と、幅広いモダリティに生成AIが広がっている。
音声に動画に音楽に、コードまで——生成AIって本当にいろんなものが作れるんだなぁって実感できたよぉ。
ぽわわ〜、ましろ、世界が広がったかもぉ。
そしてマルチモーダル化の潮流。
GPT-4o や Gemini のように、一つのモデルで複数モダリティを扱えるようになって、人間の感覚に近づいているの。
応用面ではRAGで外部知識活用、ファインチューニングやLoRAでカスタマイズ、量子化やエッジAIで効率化——と、技術の幅が広がりました。
40記事を振り返ると、概念の積み重ねが一本の物語になってるんだよね。
Self-Attention が Transformer を生んで、Transformer が LLM を生んで、LLM がマルチモーダルや RAG、量子化、エッジへと広がった。
ジャスミンちゃん、いいまとめね!
技術史って偶然の積み重ねじゃなくて、前の発見が次の発見を呼ぶ連鎖なのよ。
あらあら、みんな立派になったわねぇ。
ふふっ。
ましろ、和菓子で言うとぉ、あんこ作りの技術が団子に応用されて、団子から大福が生まれて、大福から最中ができた…みたいな感じ?
ましろちゃんのたとえ、毎回冴えてるね。
補足すると、次のPhase 5ではプロンプトエンジニアリングを扱うので、今回学んだ技術を「どう使いこなすか」という実践編に入ることになります。
試験対策としては、各技術の「何ができるか」「どういう仕組みか」「どんな課題があるか」の3点を押さえるのが大事ね。
用語表を丸暗記するんじゃなくて、関係性で覚えるとブレにくいのよ。
みんな本当によく頑張ったわね。
この知識を土台に、実際に生成AIを触って体験しながら理解を深めていってちょうだいね。
あたしたちが学んだ40記事の知識があれば、Phase 4の試験範囲なんて怖くないでしょ!
Phase 5も楽しみ!
よっしゃ、次行くよ〜!
確認クイズ
LLM を人間の指示に従えるように調整する手法として正しい順序はどれか。
- RLHF → 事前学習 → インストラクションチューニング
- 事前学習 → インストラクションチューニング → RLHF
- インストラクションチューニング → 事前学習 → RLHF
- 事前学習 → RLHF → インストラクションチューニング
こたえを見る
正解: 2. 事前学習 → インストラクションチューニング → RLHF
LLM は①大量テキストで事前学習 → ②指示と模範回答でインストラクションチューニング(IT) → ③人間のフィードバックで RLHF、の順で調整されます。事前学習は必ず最初、RLHF は最後、が鉄則です。