視覚言語モデル - 画像を理解するLLM

画像を入力として受け取り、テキストで回答できる視覚言語モデル(VLM)の仕組みを解説します。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
深見 つむぎ(普段) 深見 つむぎ

先生は今日、生成AIカンファレンスに出張中。
最近話題のVLM(Vision-Language Model)を3人で予習しましょう。
画像を入力として理解し、テキストで回答できるモデルを視覚言語モデルと呼びます。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

VLM って、GPT-4V とかのことだよね。
写真アップして質問すると答えてくれるやつ!

深見 つむぎ(普段) 深見 つむぎ

そうです。
概ね2段構成で、①画像をビジョンエンコーダで特徴ベクトルに変換 → ②そのベクトルを LLM の入力に接続 → LLM が「画像の意味+ユーザーの質問」を統合して回答を生成、という流れですね。

戸倉 ジャスミン(あせる) 戸倉 ジャスミン

ビジョンエンコーダって何使ってるの?

深見 つむぎ(普段) 深見 つむぎ

多くの場合ViT(Vision Transformer)、または CLIP の画像エンコーダが使われます。
ViT は画像を小さなパッチ(16×16画素など)に分割し、それぞれをトークンとして Transformer で処理するんです。

雪村 ましろ(笑顔) 雪村 ましろ

画像もトークンに変換しちゃうんだ…言葉みたいに AI が読む、って面白いねぇ。
文字の LLM と同じ仕組みで画像も見てるってことなのぉ?
すごいなぁ…

深見 つむぎ(普段) 深見 つむぎ

そう。
具体的にどんなことができるかというと——①画像の内容説明(キャプション生成)、②画像に関する質問応答(VQA)、③グラフやチャートの読み取り、④写真内の文字認識(OCR)、⑤UI スクリーンショットの解釈、など多岐にわたります。
PDFをスキャンしてVLMに要約させる、というワークフローが広まっていますね。

雪村 ましろ(笑顔) 雪村 ましろ

ふぇぇ、VLM って賢すぎて可愛い…学校のお便り写真送れば読んでくれそう。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

最近だとどんなVLMがあるの?

深見 つむぎ(普段) 深見 つむぎ

2024〜2025年の動向として、OpenAI の GPT-4V/4o、Anthropic の Claude 3/3.5 Vision、Google の Gemini、Meta の Llama 3.2 Vision、そしてオープンソースの LLaVA、Qwen-VL、InternVL などがありますね。

雪村 ましろ(普段) 雪村 ましろ

ましろのスマホで動くやつもあるのかな?

深見 つむぎ(普段) 深見 つむぎ

後で扱う「エッジAI」「量子化」の話とつながりますが、軽量化した VLM をスマホで動かす動きは活発です。
Apple Intelligence や Google Gemini Nano が代表例ですね。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

ただし注意点もあるんだよね?

深見 つむぎ(普段) 深見 つむぎ

はい、VLM もハルシネーション(幻覚)を起こします。
画像に映っていないものを「見えた」と誤認したり、判読を間違えたり。
業務で使う場合は必ず人間のレビューを挟む運用が必要です。
便利だけど、過信は禁物、ですね。

雪村 ましろ(普段) 雪村 ましろ

便利なだけに、人間のチェック、大切だね。

深見 つむぎ(普段) 深見 つむぎ

試験では「VLM=画像入力+テキスト出力」「ビジョンエンコーダ(ViT)+LLM の連結構造」「ハルシネーション有り」の3点を押さえましょう。
実務で VLM を使う時は、必ずこの性質を頭に入れて運用設計することが重要です。

確認クイズ

視覚言語モデル(VLM)で画像を特徴ベクトルに変換する役割を担うのはどれか。

  1. デコーダ
  2. ビジョンエンコーダ
  3. トークナイザ
  4. 報酬モデル
こたえを見る

正解: 2. ビジョンエンコーダ

ビジョンエンコーダ(ViTやCLIP画像エンコーダなど)が画像を特徴ベクトルに変換し、LLMが理解できる形式にします。デコーダは出力生成、トークナイザはテキスト分割、報酬モデルは RLHF の要素です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。