BERTの概要 - 双方向で文脈を理解

BERTはGoogleが開発した双方向Transformerモデルです。GPTとの違いや特徴を会話で学びましょう。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
香月 リサ 先生(笑顔) 香月 リサ 先生

前回 GPT を扱ったから、今日は同じく2018年に登場した双方向モデル——BERTを見ていきましょう。
Bidirectional Encoder Representations from Transformersの略よ。
ポイントは「Bidirectional(双方向)」と「Encoder(エンコーダ)」の2語ね。

深見 つむぎ(普段) 深見 つむぎ

GPT がデコーダ型で左から右に読むのに対して、BERT はエンコーダ型で双方向に文脈を理解する——という対比でよろしいですね。

香月 リサ 先生(普段) 香月 リサ 先生

その通り。
BERT の学習は面白くて、文中の単語をランダムにマスクして(15%程度)、前後の文脈から隠された単語を当てる訓練をするの。
これをMasked Language Model(MLM)と呼ぶわ。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

穴埋め問題をひたすらやらされるAIってこと?
なんか気の毒だね〜。

香月 リサ 先生(笑顔) 香月 リサ 先生

あらあら、そんな言い方しないであげて。
ふふっ。
でもね、この「穴埋め特訓」で文の意味を深く理解できるようになるのが、BERTの特長なのよ。

深見 つむぎ(普段) 深見 つむぎ

補足すると、BERT ではもう一つNext Sentence Prediction(次文予測)という補助タスクもありました(後継モデルでは不要説もありますが)。

香月 リサ 先生(普段) 香月 リサ 先生

つむぎさん、細かい補足ありがとう。
BERTは感情分析・質問応答・自然言語推論などの理解系タスクで大活躍。
特に Google 検索のランキング改善に採用されて、検索精度を向上させたのは有名な話ね。

雪村 ましろ(笑顔) 雪村 ましろ

GPTは文を書くのが得意、BERTは文を読むのが得意——って覚えればいいのぉ?
ましろ、この対比すごく分かりやすいっ!

香月 リサ 先生(普段) 香月 リサ 先生

ましろちゃん、完璧なまとめよ!

戸倉 ジャスミン(普段) 戸倉 ジャスミン

今は生成AIブームだから、BERTってもう古いのかな?
ChatGPTみたいな使い方ができないのはなんで?

香月 リサ 先生(普段) 香月 リサ 先生

生成はしないからChatGPTみたいな使い方には向かないけど、検索・分類・埋め込み生成といった裏方では今も現役なのよ。
RoBERTaやDeBERTa、日本語BERTなど、いろんな派生モデルが実装されているの。

深見 つむぎ(普段) 深見 つむぎ

補足として、Sentence-BERT のように文単位の埋め込みを作るモデルも BERT 系から派生していて、セマンティック検索やベクトルDBの埋め込み元として使われています。
つまり RAG システムや類似文書検索でも BERT 系は今もフル稼働。

香月 リサ 先生(普段) 香月 リサ 先生

「昔のモデル」ではなく「理解専門の現役モデル」と覚えてね。
BERT は事前学習+ファインチューニングのパラダイムを NLP 全体に広げた功労者でもあるわ。

雪村 ましろ(笑顔) 雪村 ましろ

BERTって、現代NLPのお祖父ちゃんみたいな存在なんだぁ。
ましろの実家の和菓子屋も、今の味はお祖父ちゃんの代のレシピが土台になってるから、なんだか親近感わくなぁ。

香月 リサ 先生(普段) 香月 リサ 先生

ましろちゃんの比喩がいいわね。
試験では「BERT=双方向エンコーダ型」「MLM+NSP で学習」「理解系タスクで現役」の3点を確実に押さえて。

確認クイズ

BERT の学習方法として最も適切なものはどれか。

  1. 次の単語を予測する
  2. 文中のマスクされた単語を予測する
  3. 画像のラベルを予測する
  4. 文を要約する
こたえを見る

正解: 2. 文中のマスクされた単語を予測する

BERT は Masked Language Model として、文中のマスクされた単語を前後の文脈から予測する学習を行います。次単語予測は GPT 系の学習方式、画像ラベル予測・要約は BERT の学習目的ではありません。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。