AI動画生成の現在地:できることと限界
AI動画生成は、静止画生成の技術を時間軸へ拡張したものだと考えると理解しやすい。拡散モデルが一枚の絵を作る工程に、フレーム間の動きを推定して整合させる処理を組み合わせることで、数秒単位のクリップを生成する。かつては数フレームの揺れる映像しか作れなかったが、現在は物理的な挙動、被写体の動き、カメラの移動までをまとめて指示できるようになった。
できることの代表例は次のとおりだ。実写風の人物カット、商品の回転ショット、自然風景の空撮風カット、アニメ調のキャラクター演技、話者の口の動きに合わせたリップシンク、既存映像のスタイル変換。絵コンテ代わりのラフ検討から、SNS用の縦動画、eラーニングの挿入カットまで、用途は急速に広がっている。
一方で、苦手な領域もはっきりしている。長尺になるほど一貫性は崩れやすい。手の指、細かい文字、鏡像、複数人物の絡み、液体や布の複雑な挙動は破綻しやすい。画面内に正確な文字を出したい場合も、生成に任せるより編集ソフトで載せたほうが確実だ。カメラ指示も「ゆっくり寄る」程度なら追従するが、複数の動きを同時に指定すると混線しやすい。
この特性から導かれる基本方針は「長い一本を作るのではなく、短いショットを積み上げる」ことだ。3秒から8秒のカットを単位として考え、つなぎは編集で処理する。映画的な長回しを狙うよりも、ショットの集合として構成を設計したほうが、結果的に完成度は高くなる。
生成の失敗は大きく二種類に分かれる。指示が曖昧で意図と違う絵が出る「解釈のズレ」と、モデルが構造を保てず崩れる「破綻」だ。前者はプロンプト設計で、後者は尺・解像度・入力モードの調整で対処する。この切り分けを意識するだけで、修正の方向が定まり、試行回数を減らせる。
企画とプロンプト設計:生成前に決めること
生成を始める前に決めるべきことは意外に多い。ここを飛ばすと、後工程で何度もやり直すことになる。
目的から逆算する
最初に決めるのは、完成尺、公開先、縦横比、音声の有無、トーンだ。縦型のショート動画なら被写体を中央に置き、テンポを速くする。横型のプレゼン用なら情報を画面の左右に分ける。用途が決まれば必要なショット数が決まり、ショット数が決まれば生成の試行回数の見当もつく。
プロンプトの基本構造
動画生成のプロンプトは、文章として自然であることよりも、要素が漏れなく並んでいることが重要になる。基本の並びは「被写体」「動作」「環境」「時間帯と光」「カメラ」「スタイル」「除外したい要素」だ。たとえば「白いシャツの女性が路地を歩く。夕方の柔らかい逆光。カメラは左から右へゆっくり並走。35mm相当、浅い被写界深度。落ち着いた色味」といった具合に、要素を順に埋めていく。
形容詞を増やすより、具体的な名詞と動詞を増やすほうが効く。「美しい」「すごい」は解釈の幅を広げるだけで、出力は安定しない。「濡れたアスファルト」「手前を横切る自転車」のように、画面に存在する物を書く。
否定形の指示はモデルによって効き方が違う。「文字なし」「ロゴなし」のような除外は、別の除外欄が用意されている場合はそちらを使い、本文では避けたい要素を書かないほうが安全だ。
台本をショットリストに分解する
台本がある場合は、意味の切れ目ではなく画の切れ目で分割する。1文を1カットにするのではなく、動作の変化点、話者の切り替わり、場所の移動で切る。ショットリストには、カット番号、尺、ショットサイズ、被写体、動作、カメラ、音、メモの列を用意しておくと、生成後の差し替えが楽になる。
モデル選定の判断基準:評価軸の作り方
利用できるモデルが増えた結果、「どれが一番良いか」という問いには意味がなくなった。正しい問いは「この用途にどのモデルが合うか」である。
評価軸を決める
判断に使う軸は、写実性、指示追従性、モーションの自然さ、一貫性、生成速度、最大尺と解像度、入力モードの対応、ライセンスと商用利用の条件、自動化やAPIの扱いやすさ、の九つに整理できる。すべてを高水準で満たすモデルは存在しないため、自分の用途で上位三つを決めて比較する。
用途別の優先順位
広告の商品カットでは写実性と質感再現が最優先になる。SNSの縦動画は速度と指示追従性が重要で、多少の粗さはテンポでカバーできる。アニメ調の演出では線の安定とスタイルの再現性が効く。教育コンテンツでは、話者の顔と口元の自然さ、字幕の載せやすさが優先される。
実際の比較では、Flux系は静止画的な質感と写実表現に強く、Runway系はカメラワークの指示追従と編集機能の統合に優れる。Sora系は物理挙動と時間的一貫性の面で安定しやすい。Kling系やMiniMax Hailuo系は人物の動きとアジア的な画作りに特徴があり、Pika、Luma Ray、Viduといった軽量系は速度と試行回数を稼ぐ用途に向く。優劣ではなく、担当範囲の違いとして捉えると選びやすい。
小さく比較検証する
新しい用途に入る前は、同一プロンプトを三つから五つのモデルに投げて比較する。評価は主観で構わないが、観点を固定する。指示通りか、破綻がないか、色が破綻していないか、そのまま使えるか。所要時間も記録しておくと、量産時の計画が立てやすくなる。
入力モードの使い分け:テキスト・画像・動画
同じモデルでも、入力を変えると結果は大きく変わる。どのモードを起点にするかは、狙いの確度によって決める。
テキストから動画
自由度が最も高い反面、再現性は最も低い。新規のアイデア出し、雰囲気の探索、絵コンテの代替に向く。同じプロンプトでも出力が変わるため、気に入った結果が出たら、その時点でパラメータを記録して固定する。
画像から動画
構図を先に決められるため、実務では最も使いやすい。キーフレームとなる静止画を用意し、そこから動かす。商品写真、ロケハン写真、デザイン案をそのまま起点にできる。動きの量を抑えるほど破綻しにくく、静止画に近いほど安定する。
動画から動画
既存素材のスタイル変換、モーションの移植、解像度の引き上げに使う。実写で撮った動きをそのまま活かせるため、動きの説得力は最も高い。一方で元映像の質が結果を左右するので、撮影段階でブレを抑えておくことが前提になる。
参照画像で被写体を固定する
同じ人物や商品を複数カットに登場させる場合は、参照画像を複数枚用意し、顔、服装、体格を別々の画像で示す。正面だけでなく斜めや横の角度を含めると、別カットでの再現度が上がる。
ショット設計とカメラワーク指示の実践
映像の説得力は、ショットの設計でおおむね決まる。生成技術よりも、どこをどう見せるかの設計が効く。
ショットサイズとアングル
ロングショットは場所と状況を示し、ミディアムショットは人物と動作を示し、クローズアップは感情と質感を示す。同じ被写体でも、サイズを変えて三種類用意しておくと、編集でリズムを作りやすい。アングルは目線の高さを基準に、ローアングルで力強さ、ハイアングルで俯瞰の整理感を出す。
動きの語彙を持つ
カメラの動きは、寄る、引く、並走する、回り込む、上下に振る、水平に振る、手持ち風に揺らす、の七つを覚えておけば大半は表現できる。加えて、レンズの焦点距離、被写界深度、フレームレートを指定すると雰囲気が揃う。
一度に一つの動き
最も多い失敗は、被写体の動きとカメラの動きを同時に複数指定することだ。「歩きながら振り返り、カメラが回り込みながら寄る」といった指示は混線しやすい。まず被写体の動作を一つ、カメラの動きを一つに絞る。物足りなければカットを分ける。
尺を先に決める
生成前に尺を決めておくと、編集の計画が崩れない。動きの始まりと終わりが明確なカットは長めに、つなぎ用のカットは短めに作る。尺を後から伸ばす作業は破綻を招きやすい。
キャラクターとスタイルの一貫性を保つ
シリーズものや連作では、一貫性の管理が品質を左右する。技術的な工夫と運用の工夫を組み合わせる。
参照とシードを固定する
同一人物を出す場合は参照画像を固定し、生成パラメータの乱数値も可能な限り固定する。服装は色と素材まで言葉で指定し、変化させる場合はカット単位で管理する。
スタイルは数値と言葉の両方で持つ
色温度、彩度、コントラスト、粒子感、レンズの性格を言語化してテンプレート化する。「暖色寄り、彩度は低め、粒状感あり、逆光気味」のように共通の言い回しを決めておけば、担当者が変わっても画の印象が揃う。
台帳で管理する
カット番号、使用モデル、プロンプト、参照画像、生成日、採用可否を一覧にする。手間はかかるが、後から別カットを追加するときに同じ条件を再現できる。命名規則も統一し、素材のフォルダ構成を先に決めておく。
一貫性チェックの観点
確認する項目は、顔の骨格、髪型、肌の色、服装、体型、小物、そして背景の質感だ。加えて、画面全体の色味と光の方向が前後のカットでつながっているかを確認する。
音声・音楽・リップシンクの統合
映像単体では伝わりにくい情報も、音を載せると一気に理解が進む。音声は後付けではなく、企画段階から設計に含める。
ナレーションと声の設計
話速、抑揚、間の取り方を決めてから収録または合成する。同じ話者を複数本で使う場合は、声質と話速を固定し、固有名詞の読みを事前に登録しておく。数字と専門用語は読み間違いが起きやすいため、表記を確認する。
効果音と音楽
効果音は動きの強調に、音楽はテンポと感情の誘導に使う。切り替え点はカットの切り替えと揃えると自然になる。音量はナレーションを基準に決め、音楽はその下に置く。
リップシンクの実務
口の動きを合わせる場合、元の音声の長さを先に確定させる。尺が変わると口の動きも作り直しになる。正面の顔、明るい照明、口元が隠れない構図の三条件を満たすと精度が上がる。
編集・仕上げ・書き出し
生成したカットは素材であり、作品ではない。編集で初めて一本になる。
つなぎの設計
カットの切り替えは、動作の途中で切ると流れが良くなる。会話や動作の始点で切ると不自然に見えやすい。テンポを出すなら短く、余韻を残すなら長く。同じような構図が続く場合は、間に別サイズのカットを挟む。
カラーと質感の統一
生成カットは色味がばらつくため、グレーディングで寄せる。基準となるカットを決め、そこに他のカットを合わせる。粒子やシャープネスも揃える。解像度を上げる処理とフレーム補間は、やりすぎると不自然になるため、必要なカットだけに絞る。
書き出し設定
公開先の仕様に合わせて縦横比、解像度、ビットレートを決める。縦型は1080×1920、横型は1920×1080が基本になる。字幕は生成映像に焼き込まず、編集で載せたほうが修正しやすい。
チーム運用と自動化パイプライン
個人制作から複数人の分業に切り替わるタイミングで、必要な仕組みが変わる。
役割分担とレビュー
企画、プロンプト設計、生成、選定、編集、校正に分ける。生成と選定を別の担当にすると、客観的な判断が入りやすい。レビューは三点に絞る。指示通りか、破綻がないか、前後のカットとつながるか。
テンプレート化
よく使う構図、照明、色味をテンプレートとして保存し、プロンプトの骨格を使い回す。ゼロから毎回書くより、修正する運用のほうが速く、品質も安定する。
生成コストと計算資源の管理
試行回数がそのまま費用と時間に跳ね返る。無駄を減らす方法は三つだ。低解像度で構図を確認してから本番を回す。同じプロンプトをまとめて処理する。採用しなかったカットも保管して、後で流用する。
自動化の考え方
入力、生成、保存、変換を一つの流れにまとめると、手作業が減る。ただし、完全自動化は品質のばらつきを招きやすい。人の判断を入れる地点を一つ決めておくのが現実的だ。
よくある失敗とFAQ
よくある失敗
意図と違う絵が出る場合は、プロンプトの要素を一つずつ削って原因を特定する。破綻する場合は、尺を短くし、動きの量を減らし、解像度を上げる。色が濁る場合は照明の記述を増やし、スタイル指定を減らす。同じ顔にならない場合は参照画像の枚数と角度を増やす。動きが遅い場合は速度を言葉で指定し、フレームレートを見直す。
どのモデルから始めればよいか
まずは画像から動画に対応し、操作が簡単なものを一つ選ぶ。比較用に別のモデルを一つ用意し、同じプロンプトで結果を見比べる。二つを使い分けられれば、大半の用途はこなせる。
商用利用で気をつけることは
モデルごとに利用条件が異なる。生成物の権利、学習データの扱い、再配布の可否を確認する。クライアント案件では、使用したモデルと条件を記録として残しておくと安心だ。
生成した映像に文字を入れたい
画面内の文字は編集ソフトで載せるのが基本だ。生成に任せると綴りが崩れる。どうしても生成内に文字を出したい場合は、短い単語に絞り、複数回試して採用する。
長い動画を作るには
長尺はショットの集合として作る。30秒なら5から8カット、3分なら30カット前後が目安になる。各カットの尺と構図を先に決め、順番に生成して編集でつなぐ。
人物の動きが不自然なときは
動きの量を減らし、参照画像を増やし、動作を一つに絞る。それでも改善しない場合は、動画から動画のモードに切り替え、実際の動きをベースにする。
画質が足りないと感じたら
生成解像度を上げる前に、構図と露出を整える。アップスケールは最後の手段として使い、やりすぎない。編集段階でシャープネスを弱くかけるほうが自然に仕上がる。
チームで品質を揃えるには
プロンプトのテンプレート、参照画像、色の基準、レビュー観点の四点を共有する。加えて、採用したカットと没にしたカットの理由を記録する。判断の基準が言語化されていれば、担当が変わっても仕上がりはぶれにくい。

