モデルの量子化 - 軽くして速くする

LLMを軽量化して高速動作させる量子化技術。仕組みと実用的なメリットを解説します。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
戸倉 ジャスミン(あせる) 戸倉 ジャスミン

先生、あたしのノートPCで LLaMA 動かしたいんだけど、GPU メモリ全然足りなくてさ。
なんとかなんないかな?

香月 リサ 先生(笑顔) 香月 リサ 先生

ジャスミンちゃん、まさに今日のテーマ!
量子化(Quantization)という技術で解決できるかもしれないわ。

深見 つむぎ(普段) 深見 つむぎ

量子化は、モデルのパラメータのビット数を減らしてメモリ使用量と計算量を削減する技法ですね。

香月 リサ 先生(普段) 香月 リサ 先生

具体的に言うと、モデルのパラメータは通常32ビット(FP32)または16ビット(FP16)の浮動小数点数で保存されているの。
量子化はこれを8ビット整数(INT8)や4ビット(INT4)に変換してメモリ使用量を大幅に削減するわ。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

要は16ビットから4ビットにすれば、メモリ使用量は4分の1になるってこと?

香月 リサ 先生(普段) 香月 リサ 先生

その計算で合ってるわ。
70B(700億パラメータ)級の LLM が、FP16 なら約140GB のメモリが必要だけど、INT4 量子化すれば約35GB まで減らせるの。
コンシューマ GPU でも動くラインになるわ。

雪村 ましろ(しょんぼり) 雪村 ましろ

わぁ、でも数字をざっくりにしちゃって、AIの性能って落ちないのぉ?

香月 リサ 先生(普段) 香月 リサ 先生

鋭い質問。
多少の精度低下はあるけれど、最近の量子化技術は非常に優秀で、ほとんど性能を落とさずに大幅な軽量化を実現できるの。
代表的な量子化形式としてGPTQやGGUFがあるわ。

深見 つむぎ(普段) 深見 つむぎ

補足すると、量子化には大きく2種類あります。
①学習後量子化(PTQ)=学習済みモデルを事後的に量子化(簡単だが精度低下あり)、②量子化対応訓練(QAT)=学習時点で量子化を考慮(精度は保ちやすい)。
GPTQ は前者の代表例です。
そして量子化のさらなる工夫として、LoRA と組み合わせたQLoRAなども登場していて、16GB GPU で数百億パラメータ LLM を FT できるまでになっています。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

よっしゃ、あたしのPCでもいけそうじゃん!

雪村 ましろ(普段) 雪村 ましろ

軽くなると何がいいの?

香月 リサ 先生(普段) 香月 リサ 先生

①GPU メモリ削減で大型モデルを手元で動かせる、②推論速度が向上する(CPU 推論も現実的に)、③電力消費を削減できる、④エッジデバイス(スマホ・IoT)への展開が可能、と実用面のメリットが大きいの。

深見 つむぎ(普段) 深見 つむぎ

補足: Meta の Llama 3、Microsoft の Phi、Google の Gemma など、最近のオープンソース LLM は量子化版を公式提供するのが標準になってきています。
量子化・蒸留・プルーニングの3手法は効率化の3本柱とされ、現代の LLM デプロイでは併用されることが多いですね。

香月 リサ 先生(普段) 香月 リサ 先生

つむぎさんの整理が綺麗ね。
試験では「量子化=ビット幅削減でメモリ・計算コスト削減」「GPTQ/GGUF が代表形式」「性能低下は最小限」の3点を覚えて。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

それってめちゃくちゃ大事じゃん!
個人開発者には必須技術だね!
あたしのノートPCでLLaMA動かす夢、叶いそう!
よーし、今夜試してみる!

確認クイズ

モデルの量子化の効果として最も適切なものはどれか。

  1. パラメータ数が増える
  2. 学習速度が向上する
  3. メモリ使用量が大幅に削減される
  4. 学習データの量が減る
こたえを見る

正解: 3. メモリ使用量が大幅に削減される

量子化はパラメータを低ビット化してメモリ使用量を大幅に削減する技術です。パラメータ数自体は変わらず、学習速度や学習データ量とも直接関係ありません。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。