MoE(Mixture of Experts) - 専門家AIの寄せ集め

複数の専門家モデルを切り替えて使うことで、大規模化しつつ計算効率を保つ仕組みです。GPT-4やMixtralで採用。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
香月 リサ 先生(笑顔) 香月 リサ 先生

今日は最近のLLM業界でよく名前の挙がるMoEのお話よ。
Mixture of Expertsの略で、日本語だと「専門家混合」とも訳すわ。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

専門家混合? 専門家のMIXって、なんかカクテルの名前みたいじゃん?

深見 つむぎ(普段) 深見 つむぎ

つまり、複数の専門家ネットワークを用意して、入力に応じて使うものを切り替える仕組みですね。
GPT-4やLLaMA系、Mistral AIのMixtralなどで採用されていると報じられています。

雪村 ましろ(普段) 雪村 ましろ

複数の専門家…ってことは、お医者さんが内科・外科・小児科って分かれてるみたいに、AIの中でも分業してるってこと?

香月 リサ 先生(普段) 香月 リサ 先生

ましろちゃん、まさにそのイメージ。
質問の内容を見て、受付が適切な専門医のところへ案内するように、モデル内部でも「ルーター」と呼ばれる部品が、入力ごとに使う専門家を選ぶのよ。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

なるほど! 全員でいっせいに働くんじゃなくて、必要な人だけ呼び出すんだ。
あたし、そのほうが電気代も安くなりそうな気がするんだけど、合ってる?

香月 リサ 先生(笑顔) 香月 リサ 先生

ジャスミンさん、核心を突いているわ。
これがMoEの狙いなの。
総パラメータ数は大きく保ちつつ、1回の推論で動くのは一部の専門家だけ。
結果として推論時の計算コストが軽くなるの。

深見 つむぎ(普段) 深見 つむぎ

補足すると、GPT-4は総パラメータ1兆を超えると推測されていますが、実際には入力あたり数千億パラメータ分のみが活性化していると言われています。
これにより、品質と速度の両立が可能になるわけです。

雪村 ましろ(普段) 雪村 ましろ

わ〜、賢い作りなんだね。
でも逆に、複数の専門家を用意するぶん、学習は難しくなったりしないの?

香月 リサ 先生(普段) 香月 リサ 先生

いい疑問ね。
実際、MoEには課題もあるわ。
ルーターの判断が偏って一部の専門家ばかり使われる負荷不均衡や、専門家を分散学習させる際の通信コストなど、実装はかなり繊細なの。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

部活で言うと、エースばっかり試合に出して補欠が練習しなくなっちゃう、みたいなことじゃん? それはチーム全体で見ると損だよね。

深見 つむぎ(普段) 深見 つむぎ

ジャスミンさんの例え、分かりやすいですね。
だから補助的な損失関数を入れて、専門家の使用が均等になるよう設計されるのが一般的です。

香月 リサ 先生(笑顔) 香月 リサ 先生

試験対策としては、「MoEは総パラメータを大きく保ちつつ1回あたりの計算量を抑える手法」という理解が本質ね。
スケーリング則を別角度から活かす設計として押さえておきましょう。

雪村 ましろ(普段) 雪村 ましろ

一人で全部こなすAIよりも、得意分野ごとに分けたチーム型AIのほうが効率的ってことなんだね〜。
チームワークって大事だねぇ。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

あたし、部活で学んだ感覚とつながって、ストンと腑に落ちたよ! 試合でもさ、レシーブ得意なメンバーとスマッシュ得意なメンバーを局面で使い分けるじゃん? それと同じ発想だね。

深見 つむぎ(普段) 深見 つむぎ

ジャスミンさんの例えで思い出しましたが、MoEはDense(全パラメータを常に使う)モデルと対比されます。
試験では「Denseに対してSparseな活性化を行う」という言い方も出ることがあります。

香月 リサ 先生(笑顔) 香月 リサ 先生

いい補足ね。
Dense対Sparse、そしてMoEの狙いは「大きさを増やしても推論が速い」という両立。
この構図を覚えておけば、選択肢に惑わされないわ。

確認クイズ

MoE(Mixture of Experts)の特徴として最も適切なものはどれか。

  1. 全パラメータを常に使うため計算量が膨大になる
  2. 複数の専門家のうち入力に応じて一部を選んで使う
  3. 単一の小型モデルで全タスクをこなす
  4. 学習データを減らして軽量化する手法
こたえを見る

正解: 2. 複数の専門家のうち入力に応じて一部を選んで使う

MoEは入力ごとにルーターが適切な専門家ネットワークを選択し、一部のパラメータだけを活性化させる方式です。総パラメータは巨大でも推論時の計算量を抑えられる点が利点で、全パラメータ常時使用や単一小型モデル、データ削減などの説明はすべて誤りです。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。