単語の埋め込み表現(Word Embedding)

コンピュータが言葉の意味を理解するには、単語を数値(ベクトル)に変換する必要があります。その仕組みを学びましょう。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
戸倉 ジャスミン(普段) 戸倉 ジャスミン

先生、コンピュータって「犬」って文字、そのまま読んで意味わかるもんじゃないの?

香月 リサ 先生(普段) 香月 リサ 先生

ジャスミンちゃん、そこは意外と違うのよ。
コンピュータにとって文字は単なる記号の列。
「犬」と「木」の意味的な近さは、そのままでは計算できないの。
だから単語を数値の列——ベクトル——に変換する必要があるわ。
これがエンベディング、日本語では埋め込みと呼ぶの。

戸倉 ジャスミン(びっくり) 戸倉 ジャスミン

うそっ!?
あたしずっとそのまま意味わかってると思ってた…

雪村 ましろ(あせる) 雪村 ましろ

うわぁ、数学の矢印みたいなやつ?

香月 リサ 先生(普段) 香月 リサ 先生

イメージは近いわ。
たとえば「犬」を [0.2, 0.8, -0.1, 0.4, ...] のような100〜数千次元の数字の列で表すの。
人間の目には無意味な数字だけど、計算機は距離が測れる。

深見 つむぎ(普段) 深見 つむぎ

意味が近い単語は、ベクトル空間でも近くに配置される——というのが分散表現の利点ですよね。
「犬」と「猫」は近くて、「犬」と「自動車」は遠い。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

あ、有名なやつあるじゃん。
「王様 - 男 + 女 = 女王」ってやつ!
ベクトルで足し引きできるの、正直めっちゃすごくない?

香月 リサ 先生(笑顔) 香月 リサ 先生

それはWord2Vecで有名になった例ね。
単語の意味関係がベクトルの足し引きで表現できる、と示したの。
ふふ、ジャスミンちゃんよく覚えてたわね。

深見 つむぎ(普段) 深見 つむぎ

現代のLLMでも、テキスト入力はまずトークンに分けられ、その後で埋め込みベクトルに変換されてから Transformer に入力されますよね。

香月 リサ 先生(普段) 香月 リサ 先生

そう、埋め込みはLLMの入り口であり、ベクトルDBやセマンティック検索の基礎でもあるの。
「車のトラブル」で検索したら「自動車の故障」もヒットする、という検索方式を支えているのよ。

雪村 ましろ(笑顔) 雪村 ましろ

うぅ〜ん…言葉を数字に変えれば、コンピュータも意味を計算できる…!
えへへ、なんだかロマンチック。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

ましろの詩人モード入ったじゃん。
でも確かに、数字だけで「似てる」「違う」が測れるって、シンプルだけど凄くない?
先生、あたしまでロマンチストモードになっちゃったよ。

香月 リサ 先生(笑顔) 香月 リサ 先生

あらあら、ジャスミンちゃんも同調しちゃうのね。
埋め込みは地味だけど、LLM・画像生成・推薦システム・RAG まで幅広く支える基盤技術よ。

深見 つむぎ(普段) 深見 つむぎ

補足すると、Word2Vec から派生して GloVe、fastText、そして文脈依存の BERT 埋め込みへと進化してきました。
単語単位から文・段落単位の埋め込みへ広がっていて、OpenAI の text-embedding-3、Cohere Embed、Google の gemini-embedding など商用 API も充実しています。
試験的には「エンベディング=単語/文をベクトル化」「意味の近さが距離で測れる」「Word2Vec が先駆け」の3点を押さえれば十分よ。

確認クイズ

Word Embedding の説明として最も適切なものはどれか。

  1. 単語を画像に変換する技術
  2. 単語を数値ベクトルに変換する技術
  3. 文章を要約する技術
  4. 単語の出現回数を数える技術
こたえを見る

正解: 2. 単語を数値ベクトルに変換する技術

Word Embedding は単語を数値ベクトルに変換する技術で、意味的な関係をベクトル空間上の距離や方向で扱えるようにします。出現回数を数えるのは Bag-of-Words など別の古典手法です。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。