先生が今日はオンラインの研修で、午前中はいないのよね。
じゃあ私が進行役で、3人でスケーリング則の予習をしておきましょう。
了解、つむぎリーダー!
で、スケーリングってどういうこと?
2020年に OpenAI が発表した研究で、モデルサイズ(パラメータ数)・データ量・計算量を増やすと、性能が予測可能な形で向上する——という経験則です。
これをScaling Lawsと呼びます。
大きくすれば賢くなる…って当たり前みたいだけど、予測できるってすごいねぇ。
具体的にはどういうことなのぉ?
例えば、モデルを10倍にすると誤差がどれくらい減るか、ほぼ式で当たるんです。
だから大企業は「次の世代に何億ドル投資すれば、どれだけ性能が伸びるか」を計算してから意思決定できる。
Google や Meta、OpenAI が数千億〜数兆円規模の GPU インフラに投資している背景には、このスケーリング則への信頼があります。
3つのバランスが大事らしいって聞いたよ。
モデルだけデカくしても意味ないって。
そう、2022年の DeepMind のChinchilla研究で、「モデルサイズだけでなくデータ量も同程度に増やすべき」と判明しました。
当時の LLM は「大きすぎてデータが追いついていない」状態だった、と指摘されたんです。
モデルとデータ、バランスよく育てないとダメなんだぁ。
ましろ、ちょっと短歌できたかも——『大きさと データの均衡 保ちつつ 計算積みて 言葉花咲く』えへへ。
ましろ、ほんとに短歌作ったの?!
やばい、国語の才能あるじゃん!
文芸部恐るべし…じゃなくて、話を戻すと。
計算コストは指数的に増えるから、無限にスケールできるわけではないんです。
結局お金の問題もあります。
結局金の問題か…ほんと世知辛いね。
最近は少ない計算で高性能を目指す研究もあるって聞いたけど?
はい、MoE(Mixture of Experts)、LoRA、量子化など効率化の研究も活発です。
全パラメータを動員するんじゃなくて、必要な部分だけ使う工夫もあります。
ましろのおばあちゃん、「餅米と小豆と水の量、比が決まってるから失敗しないの」って言ってた。
ちょっと似てる、かも?
ましろの例え、すごく分かりやすいですね。
最後にまとめると、スケーリング則の恩恵で「データとお金があれば性能が読める」時代になった一方、「規模だけでは到達できない能力」もあるとされ、これが次の創発的能力の議論に繋がります。
なるほど、次の記事に繋がるんだね!
つむぎリーダー、進行上手じゃん!
ふふ、慣れてきたからね。
先生が戻ったら、ましろの短歌ぜひ披露しましょう。
試験では「スケーリング則の3要素(モデルサイズ・データ量・計算量)」「Chinchilla則でデータ量の重要性再認識」の2点を押さえれば十分ですよ。
そして最近は推論時計算量の重視や MoE など、単純スケール以外の方向性も出てきているので、試験後も業界動向を追うと面白いかも。
確認クイズ
スケーリング則(Scaling Laws)で性能向上に関係する3つの要素の組み合わせとして正しいものはどれか。
- 精度・再現率・F値
- モデルサイズ・データ量・計算量
- 入力・出力・隠れ層
- 学習率・バッチサイズ・エポック数
こたえを見る
正解: 2. モデルサイズ・データ量・計算量
スケーリング則では、モデルサイズ・データ量・計算量の3つを増やすと性能がべき乗則に従って向上することが示されています。精度系指標や学習ハイパーパラメータは直接の3要素ではありません。