Seq2Seq - 翻訳を可能にしたモデル

入力系列を出力系列に変換するSeq2Seqのエンコーダ・デコーダ構造を解説します。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針

ジャスミンちゃんが今日の本題を『誤解』してしまうところから始まります。Seq2Seqはエンコーダとデコーダの2つで構成されるモデル。翻訳や要約の基礎になった重要アーキテクチャで、Transformerの直接の祖先です。

雪村 ましろ(笑顔) 雪村 ましろ

先生、Seq2Seqって、AIがシーケンスをシーケンスに変換するんですよねぇ? なんだかピコピコゲームみたいで可愛い名前ですぅ。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

Seq2Seqってあれでしょ、シーケンスからシーケンスを作るやつ……。
要は、エンコーダで全部覚えて、デコーダが丸暗記したのを垂れ流すやつじゃん?

香月 リサ 先生(あせる) 香月 リサ 先生

うーん、『丸暗記して垂れ流す』は違うわね。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

いや先生、ちょっと待って。
『丸暗記』って言い方は確かに雑だったけどさ、もう一つ気になることがあるんだよね。
前に先生、『エンコーダが固定長ベクトルに圧縮する』って言ってたじゃん? でもあたしが調べたら、Attention付きSeq2Seqだと、固定長ベクトルじゃなくて各時刻の隠れ状態を全部使うらしいよ?

香月 リサ 先生(照れる) 香月 リサ 先生

あらあら、ジャスミンちゃん、よく調べたわね。
確かにそこは正確に言うべきだったわ。
初期のSeq2Seq (2014年 Sutskeverら) は固定長ベクトルに圧縮していたけれど、2015年のBahdanauらのAttention付きSeq2Seqで、デコーダが各時刻のエンコーダ隠れ状態を参照できるようになったのよ。
訂正ありがとう、ジャスミンちゃん。

深見 つむぎ(びっくり) 深見 つむぎ

ジャスミンちゃん、冴えてるじゃない……。
つまりSeq2Seqは時代ごとに進化していて、現代のTransformerはその発展形と位置づけられる、という理解で合っていますか?

香月 リサ 先生(普段) 香月 リサ 先生

しっかり整理しましょう。
Seq2Seqは入力系列を理解するエンコーダと、そこから別の系列を生成するデコーダの2つで構成されるモデル。
英語を聞いて理解し (エンコーダ)、日本語で話す (デコーダ) 通訳のイメージね。

雪村 ましろ(笑顔) 雪村 ましろ

わぁ、すごいですぅ! 翻訳だけじゃなくて、文章要約や対話にも使えるんですよねぇ? 入力と出力の長さが違ってもいいなんて、おもしろそうっ!

香月 リサ 先生(笑顔) 香月 リサ 先生

そう、チャットボット、文章要約、音声認識、画像キャプション生成など、系列から系列への変換が必要なタスク全般で使われたの。
2017年に登場したTransformerの先駆けになった重要な考え方ね。

深見 つむぎ(普段) 深見 つむぎ

つまりAttention機構はSeq2Seqの弱点を補う形で生まれ、やがて『Attentionだけで十分』というTransformerへ発展したということですね。
Google翻訳が2016年にSeq2Seqベースのニューラル機械翻訳に切り替わって、一気に翻訳品質が改善したというニュースも有名です。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

へぇ〜、翻訳サービスの裏側、急に身近に感じてきた! あたしが先生を訂正できる日が来るとはねぇ。

香月 リサ 先生(笑顔) 香月 リサ 先生

ジャスミンちゃんの指摘があったから、この説明はより正確になったのよ。
ありがとうね。

確認クイズ

Seq2Seqモデルを構成する2つの主要部分は何か?

  1. 入力層と出力層
  2. CNNとRNN
  3. エンコーダとデコーダ
  4. 教師モデルと生徒モデル
こたえを見る

正解: 3. エンコーダとデコーダ

Seq2Seqはエンコーダ (入力系列を内部表現に変換) とデコーダ (内部表現から出力系列を生成) の2つで構成されます。Attention機構の追加により長文翻訳の精度が大きく向上しました。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。