音声認識AI - 声をテキストに変える

音声をテキストに変換する音声認識AI(STT/ASR)の仕組みと代表例を解説します。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
戸倉 ジャスミン(笑い) 戸倉 ジャスミン

先生!
あたし、この前ミーティングで話したやつの議事録作るのに AI 使ったら、10分で終わったんですよ!

香月 リサ 先生(笑顔) 香月 リサ 先生

ジャスミンちゃん、今日の主役は君ね。
ふふ。
まさに今日のテーマ——STT(Speech-to-Text)、またはASR(Automatic Speech Recognition、自動音声認識)よ。

雪村 ましろ(普段) 雪村 ましろ

ジャスミンちゃんが使った AI って何?

戸倉 ジャスミン(普段) 戸倉 ジャスミン

えーと、OpenAI のWhisperってやつ使ったんだけど。

香月 リサ 先生(普段) 香月 リサ 先生

それが大正解。
2022年に OpenAI が発表した Whisper は音声認識に革命を起こしたの。
つむぎさん、技術的な補足お願いできる?

深見 つむぎ(普段) 深見 つむぎ

補足すると、Whisper は Transformer ベースのエンコーダ・デコーダモデルで、68万時間もの音声データで学習されました。
しかもオープンソースで公開されている——これが決定的でした。
1年=8,760時間ですから、68万時間は約78年分の音声データで、人間が一生かかっても聞けない量です。

戸倉 ジャスミン(びっくり) 戸倉 ジャスミン

ほんとなの? 人間の一生を超える量の音声を学ぶなんて、めっちゃすごい話じゃん!

香月 リサ 先生(普段) 香月 リサ 先生

Whisper は99言語に対応、日本語も精度が高くて、しかもノイズに強い。
さらにオープンソースだから、自分のサーバで動かせるのが実務的に大きな利点よ。
会議音声や医療の問診音声など、クラウドに送れない機密情報を扱える。
API 経由だとデータが外部に出るから、機密情報系では自社サーバ運用が重宝されているわ。

深見 つむぎ(普段) 深見 つむぎ

補足: 応用は広く、議事録作成、字幕生成、リアルタイム通訳、コールセンター分析、講義アーカイブのテキスト化など、多岐にわたります。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

あたしの議事録作成もそれです!
ほんとに時短になったんすよ!
えへへ、部活と勉強の両立もできそうな感じになってきた!

香月 リサ 先生(笑顔) 香月 リサ 先生

あらあら、ジャスミンちゃん、部活の合間に生産性上げてるじゃない。
ふふ、優秀。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

あとね、STT + LLM + TTS をつなげれば「音声で AI と対話」もできちゃうんですよね。

香月 リサ 先生(普段) 香月 リサ 先生

そう、まさにジャスミンちゃんの指摘通り。
ChatGPT の音声モードや Siri/Alexa の本体が、この3段 pipeline をリアルタイムで回してるのよ。
最近は GPT-4o のように3段を1モデルで統合する流れもあるわ。

深見 つむぎ(普段) 深見 つむぎ

補足: 日本語音声認識の老舗には NTT の DNN ベースシステム、Amazon Transcribe、Google Speech-to-Text、そして国産だと ReazonSpeech など、多様な選択肢があります。

雪村 ましろ(笑顔) 雪村 ましろ

声をテキストにするだけで、色んなサービスに繋げられるんだね。
ぽわわ〜、音声の世界も楽しい!

香月 リサ 先生(普段) 香月 リサ 先生

試験では「STT=音声→テキスト」「Whisper の存在」「99言語対応」を覚えておいて。
STT+LLM+TTS の3段構成も応用問題で問われやすいわ。

確認クイズ

OpenAI が開発した多言語対応の音声認識モデルの名称はどれか。

  1. WaveNet
  2. DALL-E
  3. Whisper
  4. CLIP
こたえを見る

正解: 3. Whisper

Whisper は OpenAI が開発した Transformer ベースの音声認識モデルで、99言語に対応。WaveNet は音声合成、DALL-E は画像生成、CLIP はテキスト・画像のマッピングで役割が異なります。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。