ましろ、実家の和菓子屋さんのナレーション動画でAIの声が使われてるのを見て、お店の人に聞いたら「最近のAIってほんとに人間そっくりなんだよ〜」って言われたのぉ。
ましろちゃん、いい題材ね!
今日はテキストから声を作る技術——TTS(Text-to-Speech、音声合成)を見ましょう。
カーナビとかスマートスピーカーで使われてるやつだよね!
ほんと最近のAIの声、人間と区別つかないもん!
そう。
昔のTTSは「ウッ、ウウッ、コン、ニ、チ、ワ」みたいに区切り区切りでロボット的だったの。
深層学習の登場で激変したわ。
転換点は2016年に DeepMind が発表したWaveNetよ。
それ以前の「音素を組み合わせて発声」じゃなく、音声波形そのものを深層学習で直接生成する、というアプローチで自然さが飛躍的に向上したの。
補足すると、WaveNet はすべての音声サンプル(秒間16,000点など)を自己回帰的に予測するモデルで、当初は計算コストが大きかったものの、その後派生手法で高速化されました。
派生として Tacotron、FastSpeech、VITS、NaturalSpeech、最近は大規模TTS(VALL-E、XTTS)などが登場して、抑揚・感情・発話スタイルまで制御できるようになっています。
感情まで!
嬉しそうな声とか、寂しそうな声とか?
そう。
プロンプトで指定したり、お手本音声を与えて真似させたり。
そしてもう一つ注目技術がボイスクローニングよ。
数秒の音声サンプルだけで、特定の人の声を再現できる技術。
OpenAI の Voice Engine や Microsoft の VALL-E などね。
うそっ!?
数秒で真似できちゃうの!?
それちょっと怖くない?
その通り。
便利な反面、ディープフェイクや詐欺に悪用されるリスクも大きいの。
実際、世界で被害報告が増えていて、各国でディープフェイク対策の法整備が進んでいるわ。
うわ、そりゃ怖いね…詐欺電話で家族の声そっくりに騙される事件があるってやつでしょ?
便利だけど、危険とセットってことか〜。
便利だけど、悪用もできちゃうんだぁ…使い方のルール、大事だねぇ。
試験では「TTS=テキスト→音声」「WaveNet が深層学習 TTS の先駆け(2016/DeepMind)」「ボイスクローニングとディープフェイクリスク」の3点で覚えて。
補足: 日本語 TTS も、VOICEVOX、CoeFont、にじボイスなど、個人クリエイターが扱えるサービスが増えています。
動画クリエイターやポッドキャスト配信者が、ナレーションをAIに任せるのも定番になってきました。
商用利用する場合は音声の著作権や声優の権利に関わる規約の確認が大前提です。
技術は誰でも使える時代になったからこそ、運用の知識がますます重要になっている、というのが最近の生成AIの潮流ね。
確認クイズ
深層学習を用いた音声合成で転換点となったモデルはどれか。
- BERT
- WaveNet
- ResNet
- DALL-E
こたえを見る
正解: 2. WaveNet
DeepMind の WaveNet は音声波形を直接生成する深層学習モデルで、自然な音声合成を実現した転換点です。BERT はNLP、ResNet は画像、DALL-E は画像生成の代表で、音声合成とは別領域です。