先生!
あたし、この前ミーティングで話したやつの議事録作るのに AI 使ったら、10分で終わったんですよ!
ジャスミンちゃん、今日の主役は君ね。
ふふ。
まさに今日のテーマ——STT(Speech-to-Text)、またはASR(Automatic Speech Recognition、自動音声認識)よ。
ジャスミンちゃんが使った AI って何?
えーと、OpenAI のWhisperってやつ使ったんだけど。
それが大正解。
2022年に OpenAI が発表した Whisper は音声認識に革命を起こしたの。
つむぎさん、技術的な補足お願いできる?
補足すると、Whisper は Transformer ベースのエンコーダ・デコーダモデルで、68万時間もの音声データで学習されました。
しかもオープンソースで公開されている——これが決定的でした。
1年=8,760時間ですから、68万時間は約78年分の音声データで、人間が一生かかっても聞けない量です。
ほんとなの? 人間の一生を超える量の音声を学ぶなんて、めっちゃすごい話じゃん!
Whisper は99言語に対応、日本語も精度が高くて、しかもノイズに強い。
さらにオープンソースだから、自分のサーバで動かせるのが実務的に大きな利点よ。
会議音声や医療の問診音声など、クラウドに送れない機密情報を扱える。
API 経由だとデータが外部に出るから、機密情報系では自社サーバ運用が重宝されているわ。
補足: 応用は広く、議事録作成、字幕生成、リアルタイム通訳、コールセンター分析、講義アーカイブのテキスト化など、多岐にわたります。
あたしの議事録作成もそれです!
ほんとに時短になったんすよ!
えへへ、部活と勉強の両立もできそうな感じになってきた!
あらあら、ジャスミンちゃん、部活の合間に生産性上げてるじゃない。
ふふ、優秀。
あとね、STT + LLM + TTS をつなげれば「音声で AI と対話」もできちゃうんですよね。
そう、まさにジャスミンちゃんの指摘通り。
ChatGPT の音声モードや Siri/Alexa の本体が、この3段 pipeline をリアルタイムで回してるのよ。
最近は GPT-4o のように3段を1モデルで統合する流れもあるわ。
補足: 日本語音声認識の老舗には NTT の DNN ベースシステム、Amazon Transcribe、Google Speech-to-Text、そして国産だと ReazonSpeech など、多様な選択肢があります。
声をテキストにするだけで、色んなサービスに繋げられるんだね。
ぽわわ〜、音声の世界も楽しい!
試験では「STT=音声→テキスト」「Whisper の存在」「99言語対応」を覚えておいて。
STT+LLM+TTS の3段構成も応用問題で問われやすいわ。
確認クイズ
OpenAI が開発した多言語対応の音声認識モデルの名称はどれか。
- WaveNet
- DALL-E
- Whisper
- CLIP
こたえを見る
正解: 3. Whisper
Whisper は OpenAI が開発した Transformer ベースの音声認識モデルで、99言語に対応。WaveNet は音声合成、DALL-E は画像生成、CLIP はテキスト・画像のマッピングで役割が異なります。