先生は今日、生成AIカンファレンスに出張中。
最近話題のVLM(Vision-Language Model)を3人で予習しましょう。
画像を入力として理解し、テキストで回答できるモデルを視覚言語モデルと呼びます。
VLM って、GPT-4V とかのことだよね。
写真アップして質問すると答えてくれるやつ!
そうです。
概ね2段構成で、①画像をビジョンエンコーダで特徴ベクトルに変換 → ②そのベクトルを LLM の入力に接続 → LLM が「画像の意味+ユーザーの質問」を統合して回答を生成、という流れですね。
ビジョンエンコーダって何使ってるの?
多くの場合ViT(Vision Transformer)、または CLIP の画像エンコーダが使われます。
ViT は画像を小さなパッチ(16×16画素など)に分割し、それぞれをトークンとして Transformer で処理するんです。
画像もトークンに変換しちゃうんだ…言葉みたいに AI が読む、って面白いねぇ。
文字の LLM と同じ仕組みで画像も見てるってことなのぉ?
すごいなぁ…
そう。
具体的にどんなことができるかというと——①画像の内容説明(キャプション生成)、②画像に関する質問応答(VQA)、③グラフやチャートの読み取り、④写真内の文字認識(OCR)、⑤UI スクリーンショットの解釈、など多岐にわたります。
PDFをスキャンしてVLMに要約させる、というワークフローが広まっていますね。
ふぇぇ、VLM って賢すぎて可愛い…学校のお便り写真送れば読んでくれそう。
最近だとどんなVLMがあるの?
2024〜2025年の動向として、OpenAI の GPT-4V/4o、Anthropic の Claude 3/3.5 Vision、Google の Gemini、Meta の Llama 3.2 Vision、そしてオープンソースの LLaVA、Qwen-VL、InternVL などがありますね。
ましろのスマホで動くやつもあるのかな?
後で扱う「エッジAI」「量子化」の話とつながりますが、軽量化した VLM をスマホで動かす動きは活発です。
Apple Intelligence や Google Gemini Nano が代表例ですね。
ただし注意点もあるんだよね?
はい、VLM もハルシネーション(幻覚)を起こします。
画像に映っていないものを「見えた」と誤認したり、判読を間違えたり。
業務で使う場合は必ず人間のレビューを挟む運用が必要です。
便利だけど、過信は禁物、ですね。
便利なだけに、人間のチェック、大切だね。
試験では「VLM=画像入力+テキスト出力」「ビジョンエンコーダ(ViT)+LLM の連結構造」「ハルシネーション有り」の3点を押さえましょう。
実務で VLM を使う時は、必ずこの性質を頭に入れて運用設計することが重要です。
確認クイズ
視覚言語モデル(VLM)で画像を特徴ベクトルに変換する役割を担うのはどれか。
- デコーダ
- ビジョンエンコーダ
- トークナイザ
- 報酬モデル
こたえを見る
正解: 2. ビジョンエンコーダ
ビジョンエンコーダ(ViTやCLIP画像エンコーダなど)が画像を特徴ベクトルに変換し、LLMが理解できる形式にします。デコーダは出力生成、トークナイザはテキスト分割、報酬モデルは RLHF の要素です。