総復習 - マルチモーダルAI

複数のモダリティを統合するマルチモーダルAIの要点を復習します。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
香月 リサ 先生(笑顔) 香月 リサ 先生

今日はマルチモーダルAIを復習しましょう。
近年急速に進化している分野、フロンティアモデルの代名詞になりつつあるわね。

深見 つむぎ(笑顔) 深見 つむぎ

つまり複数種類のデータを統合的に扱えるAI、ですね。
単一モダリティAIからの大きな進化です。

戸倉 ジャスミン(あせる) 戸倉 ジャスミン

モーダルって何語? フランス語っぽい響きじゃん。

雪村 ましろ(笑顔) 雪村 ましろ

なんだかかっこいい響き〜! ぽわわ?

香月 リサ 先生(笑顔) 香月 リサ 先生

ふふ、「モダリティ」は英語で『情報の様式・形式』を意味するの。
触覚、視覚、聴覚のような感覚チャンネルのイメージね。

戸倉 ジャスミン(笑顔) 戸倉 ジャスミン

感覚チャンネルか、なるほどね! AIに感覚器を増やしてるってことじゃん! 目とか耳を増設するみたいだね!

深見 つむぎ(笑顔) 深見 つむぎ

ジャスミンちゃんの喩え、ピタッとくる時があるわね。
人間の感覚統合に近づけている、と。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

つまり、文章も画像も音声も全部理解できるAIってこと? めっちゃすごいじゃん! あたしの頭より有能じゃん!

香月 リサ 先生(笑顔) 香月 リサ 先生

その通りよ。
従来のAIはテキストならテキスト専用、画像なら画像専用だったけど、マルチモーダルAIは複数の情報を横断して理解・生成できるわ。

人間も目と耳と言葉を組み合わせて世界を理解するでしょう? それに近づこうとしている段階ね。

深見 つむぎ(普段) 深見 つむぎ

つまり感覚器を増やしたAI、というイメージが近そうですね。
より人間的な知覚へ近づく方向性、と。

雪村 ましろ(びっくり) 雪村 ましろ

人間みたいなAI…すごい時代だなぁ〜。
ちょっとこわい気もするけど、便利そう!

香月 リサ 先生(普段) 香月 リサ 先生

便利さと恐れは、新技術にはつきものね。
だからこそ正しい知識が大事、ということよ。

雪村 ましろ(しょんぼり) 雪村 ましろ

便利そう〜! でも…いろんなデータを扱えるぶん、リスクも増えるのかなぁ?

香月 リサ 先生(普段) 香月 リサ 先生

ましろちゃん、鋭いわ。
マルチモーダルAIでは各モダリティ固有のリスク (画像なら偽画像、音声なら声帯模倣など) に加えて、

モダリティ間の整合性の問題 (画像は犬なのに説明文は猫) やハルシネーションにも注意が必要ね。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

情報が増えると、間違いも増えるってことか…リスク管理大事だね。
対応すべきリスクも多チャンネルになるってことじゃん。

深見 つむぎ(普段) 深見 つむぎ

生成AIパスポート試験でも、マルチモーダル特有のリスクは出題されやすいテーマね。
ディープフェイク対応なども関連分野よ。

香月 リサ 先生(笑顔) 香月 リサ 先生

便利さとリスクはセット、という視点を忘れないようにしましょうね。
技術の成長と対策の発展は、常に同時進行よ。

雪村 ましろ(普段) 雪村 ましろ

リスクも一緒に学んで、賢く使えるようになりたいなぁ!

確認クイズ

テキストと画像など、異なる情報形式を一つのモデルで扱うAIを何と説明するか?

  1. テキストのみを高精度に処理するAI
  2. テキスト・画像・音声など複数の情報形式を統合的に扱えるAI
  3. 画像生成専用のAI
  4. 音声認識だけを高速化したAI
こたえを見る

正解: 2. テキスト・画像・音声など複数の情報形式を統合的に扱えるAI

マルチモーダルAIは、テキスト・画像・音声・動画など複数のモダリティ (情報形式) を統合的に扱えるAIです。単一モダリティ専用ではない点がポイントで、GPT-4V/4o、Gemini、Claude 3/4などが代表例です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。