動画生成AI - SoraとGen-2

テキストから動画を生成するAI技術。OpenAIのSoraやRunway Gen-2など最前線の技術を紹介します。

編集・検証: AIパスポートスタディ編集部 公式情報: GUGA 生成AIパスポート公式ページ 制作・検証方針
香月 リサ 先生(笑顔) 香月 リサ 先生

最近、OpenAI が公開したSoraという動画生成 AI のデモ、みんな見た?
フォトリアルな1分動画が作れると話題になったの。

戸倉 ジャスミン(笑い) 戸倉 ジャスミン

見た見た!
あれヤバすぎだよね、もう実写と区別つかない映画作れちゃいそう!

深見 つむぎ(普段) 深見 つむぎ

動画生成 AI は、テキストから短い動画を生成する技術の総称ですね。
画像生成の自然な延長線上にあると言えます。

香月 リサ 先生(普段) 香月 リサ 先生

2023年に Runway のGen-2が短い動画(数秒)を生成できるようになって、2024年には OpenAI の Sora が1分クラスの高品質動画を公開。
Google の Veo、Meta の Make-A-Video、中国の Kling、Pika Labs など各社しのぎを削っているわ。

雪村 ましろ(しょんぼり) 雪村 ましろ

すごいけど…動画って画像より何倍も難しそうだよぉ。
だって何十枚もフレームを作らなきゃいけないんでしょう?

香月 リサ 先生(普段) 香月 リサ 先生

鋭いわね。
動画生成の最大の難関は時間的一貫性よ。
フレームが切り替わってもキャラクターの顔が変わらない、服が急に色替えしない、など人間の自然な動作を保つ必要があるの。

深見 つむぎ(普段) 深見 つむぎ

補足すると、Sora は拡散Transformer(DiT)というアーキテクチャを採用していて、動画を時空間のパッチ(時間軸付きトークン)として扱うことで、一貫性を保ちやすくしているそうです。
画像が2次元、動画は2次元+時間軸の3次元。
これを「時空間パッチ」という形で細かく分割し、拡散モデルで一貫性を保ちつつ生成していく仕組みですね。

戸倉 ジャスミン(普段) 戸倉 ジャスミン

時間も含めて、大きな立体として扱ってるってこと?

雪村 ましろ(笑顔) 雪村 ましろ

ふぇぇ、動画を立体的な粘土みたいに扱って、少しずつ磨いていく感じ…なんだかSFみたいだねぇ。

香月 リサ 先生(普段) 香月 リサ 先生

ましろちゃん、いい比喩!
そしてこの流れで、物理法則の理解(ボールが跳ねる・水が流れる・布がなびく)も少しずつ再現できるようになっているの。
正確には「物理を理解している」わけじゃなく、大量の動画データからそれっぽく見える動きを再現しているだけ。
でも結果として物理的にもっともらしい映像が出るようになってきたの。

深見 つむぎ(普段) 深見 つむぎ

補足: 課題としては、①計算コストが膨大(動画生成は画像の数十倍の計算量)、②学習データの著作権問題、③ディープフェイクへの悪用リスク——など、画像生成以上に慎重な扱いが求められています。

香月 リサ 先生(普段) 香月 リサ 先生

時事ネタとして、2024年末〜2025年に入って、TikTok や YouTube Shorts 向けの超短尺動画に AI 生成クリップが普通に混ざるようになっているの。
技術の進歩スピードは加速しているわ。

戸倉 ジャスミン(びっくり) 戸倉 ジャスミン

ほんとに来年にはもっとすごいの出てきそう…映画業界も変わっちゃいそうだね。
あたしがついていけないくらい進化が速いよ!

香月 リサ 先生(普段) 香月 リサ 先生

試験対策としては「Sora=OpenAI、2024年、拡散Transformer」「時間的一貫性が最大の課題」の2点を押さえればOKよ。

確認クイズ

動画生成AIにおける最大の技術的課題はどれか。

  1. 画像の解像度を上げること
  2. フレーム間の時間的一貫性を維持すること
  3. テキスト入力を受け付けること
  4. 音声を同時に生成すること
こたえを見る

正解: 2. フレーム間の時間的一貫性を維持すること

動画生成ではフレーム間の時間的一貫性(キャラクターの見た目や物理法則の維持)が最大の技術的課題です。解像度・テキスト入力・音声同時生成は個別課題であって本質ではありません。

🔖 この記事の関連書籍

Amazonアソシエイトリンクを含みます。他分野は おすすめ書籍ページ へ。