AI動画制作の現在地——ボトルネックは「生成」から「設計」へ
動画生成モデルの画質は急速に向上し、数秒から十数秒のクリップであれば実写と見分けがつきにくい映像も珍しくなくなりました。しかし制作の現場で本当に時間を消耗するのは、もはや「1カットをきれいに出す」ことではありません。むしろ、物語として成立させること、そしてカット割りを設計することが新しいボトルネックになっています。
理由は単純です。生成のハードルが下がった結果、1本の動画に含まれるカット数は増え、リテイクの回数も増えました。10カットの作品なら、1カットの破綻は全体の1割の損失で済みます。しかし60カットの作品では、1カットの失敗が前後の文脈を壊し、視聴者は物語から離脱します。生成の成功率が上がるほど、設計の質が完成度を決める比重は大きくなるのです。
さらに、生成モデルは「1カットの中身」には強い一方で、「カットとカットの関係」には関与しません。視線のつながり、動作の連続性、時間の経過、感情の起伏——これらは人間が設計する領域です。AI動画が「なんとなくすごい映像」で止まりがちなのは、この接続部分を設計していないからです。
この記事では、AI動画制作を「企画 → 物語設計 → ショットデザイン → プロンプト → 一貫性管理 → 編集 → 仕上げ」という一連のワークフローとして整理します。特定のツールに依存しない形で、判断基準と手順を順に解説します。
ワークフロー全体像——8つの工程と成果物
まず全体像を把握しましょう。AI動画は「思いつきで生成する作業」ではなく、「設計図を描いてから生成する作業」です。次の8工程を上から順に進めます。
| 工程 | やること | 主な成果物 |
|---|---|---|
| 1 | コンセプト設計 | 一行コンセプト、ターゲット、尺 |
| 2 | ログラインとプロット | ログライン、あらすじ、トーン指示 |
| 3 | 物語構造の分解 | ビートシート、シーンリスト |
| 4 | ショットデザイン | ショットリスト、簡易絵コンテ |
| 5 | プロンプト設計 | プロンプト集、使用モデルの割り当て |
| 6 | 生成と選別 | 採用テイク、没テイクの記録 |
| 7 | 編集と音響 | 粗編集、BGM、効果音、ナレーション |
| 8 | 仕上げ | カラー調整、書き出し、確認 |
重要なのは、前半4工程が「画面の外」の作業、後半4工程が「画面の中」の作業だという点です。手戻りのコストは工程が進むほど跳ね上がります。編集段階で「このシーンは要らない」と気づけば、そのシーンの生成に使った時間はすべて無駄になります。逆に言えば、上流の30分の検討が下流の数時間を節約します。
目安として、初心者は工程1〜4に全体の4割、工程5〜6に4割、工程7〜8に2割の時間を配分するとバランスが取れます。慣れてくると生成が速くなるため、設計の比率はさらに上がっていきます。
工程1〜2:コンセプトとログラインを固める
一行コンセプトを先に決める
最初に決めるべきは、映像の目的です。広告なのか、ショート動画のエンタメなのか、商品紹介なのか、教育コンテンツなのか。目的によって、尺、カット数、テンポ、必要な情報密度がすべて変わります。ここを曖昧にしたまま生成を始めると、後から「思っていたのと違う」という修正が延々と続きます。
一行コンセプトは次の形式で書くと整理しやすくなります。
- 誰に(ターゲット)
- 何を(核となるメッセージ)
- どんな感情で(トーン)
- どのくらいの長さで(尺)
例:「地方で一人暮らしを始める20代向けに、新しい生活の高揚感を、静かで温かいトーンで、30秒で伝える」。
ログラインの3要素
ログラインは、物語を1〜2文に圧縮したものです。含めるべき要素は3つあります。
- 主人公と状況(誰が、どこにいるか)
- 変化を起こす出来事(何が起きるか)
- 結末の方向性(どう変わるか)
「締切に追われる編集者が、壊れたパソコンの代わりに古いノートを手に取り、手書きで映像の構成を組み直す——その過程で、道具ではなく設計の重要性に気づく」。この程度の粒度で十分です。AIに渡すプロンプトの土台にもなります。
尺からカット数を逆算する
尺が決まったら、カット数を逆算します。目安は次のとおりです。
- 15秒:5〜8カット
- 30秒:10〜15カット
- 60秒:20〜30カット
- 3分:60〜100カット
1カットあたりの平均尺は1.5〜3秒が基本です。ただし、感情の山場では1カットを長く取り、情報を畳みかける場面では短く切ります。この緩急が「設計されている感」を生みます。
工程3:物語構造をビートに分解する
三幕構成をAI時代に再解釈する
三幕構成(発端・対立・解決)は古臭い方法論ではありません。むしろ、短尺のAI動画でこそ有効です。視聴者が無意識に期待する「導入 → 変化 → 着地」のリズムを外すと、どんなに画が美しくても落ち着かない映像になります。
- 第一幕(全体の25%):状況提示と問いの提示
- 第二幕(全体の50%):障害、試行錯誤、転換点
- 第三幕(全体の25%):解決、余韻、メッセージの定着
30秒の動画なら、最初の7〜8秒で状況と問い、次の15秒で変化、最後の7秒で着地という配分になります。
感情曲線を数値で管理する
ビートシートを作るときは、各ビートの感情の強度を1〜5で数値化しておきます。これは主観的な作業ですが、数値にすることで「中盤が平坦」「山場が2回あって冗長」といった問題が見えます。生成段階でも、「このカットは感情値4だから寄り(クローズアップ)で、動きは少なめ」という判断ができるようになります。
ビートシートの実例
30秒の商品紹介動画を例にします。
- ビート1(0〜5秒):日常の不便。感情値2。ミディアムショット、手ぶれ感のある揺れで不安を表現
- ビート2(5〜12秒):商品との出会い。感情値3。寄り、ゆっくりしたプッシュイン
- ビート3(12〜22秒):使用シーンと変化。感情値4。カット数を増やしてテンポを上げる
- ビート4(22〜27秒):結果と笑顔。感情値5。固定のクローズアップ、光量を上げる
- ビート5(27〜30秒):ロゴとメッセージ。感情値3。静かな引きの画
この段階でカットの目的が言語化されていれば、プロンプト作成は機械的な作業になります。
工程4:ショットデザイン——カメラ・構図・レンズの設計
ショットサイズの語彙を揃える
チームで制作する場合、ショットサイズの呼び方を統一しておくと事故が減ります。よく使うのは次の6つです。
- ロングショット(人物が小さく、環境が主役)
- フルショット(頭から足まで)
- ミディアムショット(腰から上)
- バストショット(胸から上)
- クローズアップ(顔)
- エクストリームクローズアップ(目や手など部分)
AI生成では「寄りすぎると顔が崩れやすい」「引きすぎると被写体が小さくてディテールが失われる」という特性があります。1カットの中ではサイズを欲張らず、変化はカット割りでつけるのが安全です。
カメラワークは「動機」で選ぶ
カメラを動かす理由を必ず持たせます。代表的な動きと用途は次のとおりです。
- プッシュイン:関心の高まり、発見
- プルバック:孤立、全体像の提示、結末
- パン/ティルト:空間の説明、視線誘導
- トラッキング:同行感、没入
- 手ぶれ:不安、ドキュメンタリー感
- 固定:安定、静けさ、威圧
AI生成では、複雑な動きを1カットに詰め込むと破綻しやすくなります。1カット1モーションを原則にしましょう。
構図と視線誘導
構図は「どこを見せるか」の設計です。三分割法、対角線、フレーム内フレーム、前ボケの活用など、基本を押さえるだけで生成結果の説得力が変わります。特に意識したいのは次の3点です。
- 被写体の視線の先に空間を残す(ノーズルーム)
- 動きの向きに余白を取る(リードルーム)
- 前後のカットで構図のベクトルを反転させない
3点目は編集段階で修正しにくいため、ショットリストの時点で確認します。
ショットリストのフォーマット例
| No | 尺 | サイズ | カメラ | 内容 | 感情値 |
|---|---|---|---|---|---|
| 1 | 2.5s | ミディアム | 固定 | 主人公が机に向かう | 2 |
| 2 | 1.5s | クローズアップ | プッシュイン | 手元のノート | 3 |
| 3 | 3.0s | バスト | 手ぶれ | 考え込む表情 | 3 |
| 4 | 1.0s | インサート | 固定 | 時計 | 4 |
この表があれば、生成すべきクリップの一覧が確定します。
工程5:プロンプト設計とモデル選択の判断基準
プロンプトの5層構造
映像生成のプロンプトは、思いつきで単語を並べるより、層を意識して組み立てたほうが再現性が上がります。
- 被写体:誰が、何が、服装、表情
- 動作:何をしているか、動きの大きさと速さ
- 環境:場所、時間帯、天候、背景の要素
- カメラ:ショットサイズ、アングル、レンズ、動き
- スタイル:光の質、色調、フィルムルック、質感
たとえば「30代の女性、白いシャツ、窓辺でノートに書き込む、ゆっくりした手の動き、午後の自然光、中景、35mm相当、浅い被写界深度、柔らかい暖色のフィルムルック」という形になります。修飾語は増やしすぎず、各層に2〜3要素が目安です。
モデルを選ぶ4つの軸
モデルは日々更新されるため、名前を覚えるより選び方を持つほうが実務的です。判断軸は次の4つです。
- 指示忠実度:プロンプトの要素をどれだけ拾うか
- モーション品質:動きの自然さ、破綻の少なさ
- 一貫性:同一人物・同一場所を保てるか
- 制約:生成できる尺、解像度、縦横比、入力形式
「人物が歩く長回し」を得意とするモデルと「静物の質感」を得意とするモデルは異なります。カットごとに最適なモデルを割り当てるのが現実的です。
パラメータとシード管理
同じプロンプトでも、乱数シードが変われば結果は別物になります。採用したカットは必ずシード値、モデル名、プロンプト、解像度をセットで記録してください。これは「再現できる資産」を作る作業です。モーション量のパラメータは、上げるほど迫力が出ますが破綻率も上がるため、まず低めで確認し、必要なら上げる順序が安全です。
リテイクを減らす反復ループ
1カットにつき次の順序で進めます。
- 低解像度・短尺で構図と動きを確認(3〜4回)
- 方向性が決まったら解像度を上げて本生成(2〜3回)
- 破綻がなければ採用、あれば動作かカメラを1要素だけ変えて再試行
一度に複数の要素を変えると、何が効いたのか分からなくなります。1回の変更は1要素に限定しましょう。
工程6:一貫性を維持する技術
キャラクターシートと参照画像
同一人物を複数カットに登場させる場合、正面・斜め・横・背面の参照画像を用意します。服装、髪型、アクセサリーを固定し、参照画像そのものもカットごとに使い回します。テキストだけで人物を説明すると、カットごとに別人が生まれます。
場所・小道具・衣装の連続性
連続性が壊れる典型は、小道具の位置と衣装のディテールです。カットをまたぐときは、前のカットの最終フレームを参照画像として使うと、色調と配置が引き継がれます。ロケーションも同様に、複数のアングルから見た参照画像を用意しておくと安定します。
色調とライティングの統一
生成されたカットは、モデルごとに色温度やコントラストが微妙に異なります。編集段階でまとめて補正する前提で、生成時から「光源の方向」と「色温度」をカットリストに書き込んでおくと、後の工程が楽になります。逆光、窓明かり、室内照明など、光源の種類を絞るだけでも統一感は大きく向上します。
工程7:編集・音響・仕上げ
カットのリズムとテンポ
編集では、まず音を入れずに映像だけをつないでみます。テンポが悪いと感じたら、原因は多くの場合「同じサイズのカットが続いている」ことです。ミディアム→クローズアップ→インサート→ロングのように、サイズとアングルを交互に変えると、単調さが解消されます。
音が8割——BGMと効果音
視聴者が「映像の質」だと感じているものの多くは、実は音の設計です。BGMは感情曲線に合わせて選び、盛り上げる場面では音量ではなく楽器の密度を上げます。効果音は画面上の動きに合わせて置くと、生成映像のわずかな不自然さが目立ちにくくなります。ナレーションを入れる場合は、先に音声を録ってから、その長さに合わせてカット尺を調整するほうが破綻が少なくなります。
色調整と書き出し
最後に、全カットに共通のカラープリセットを適用し、露出とホワイトバランスを揃えます。書き出しは配信先に合わせて、縦型なら1080×1920、横型なら1920×1080を基本に、ビットレートは配信プラットフォームの推奨値に合わせます。字幕は必ず実機で確認しましょう。
よくある失敗とトラブルシューティング
| 症状 | 主な原因 | 対処 |
|---|---|---|
| 顔が毎回変わる | 参照画像が不足、テキスト依存 | キャラクターシートを作成し参照を固定 |
| 動きが不自然 | 1カットに複数モーション | 1カット1モーションに分割 |
| 色がバラバラ | 光源と色温度の未指定 | カットリストに光源情報を記入 |
| 尺が足りない | 尺から逆算していない | カット数と秒数を先に確定 |
| テンポが悪い | 同サイズのカットが連続 | ショットサイズを交互に配置 |
| 何度やってもイメージと違う | プロンプトの層が混在 | 5層構造で書き直す |
| 途中で物語が分からなくなる | ビートシート不足 | 感情値を数値化して再分解 |
失敗の多くは生成技術ではなく、上流工程の曖昧さに起因します。うまくいかないときは、モデルを変える前に設計図に戻りましょう。
FAQ——AI動画制作の実務的な疑問
Q1. 1本の動画に何カットが適切ですか?
尺とテンポで決まります。15秒なら5〜8カット、30秒なら10〜15カット、60秒なら20〜30カットが目安です。ただし、感情の山場ではカットを長く取り、情報量の多い場面では短く切るなど、平均値にとらわれないことが重要です。
Q2. 生成クリップの尺が足りないときは?
同じカットを複数回生成して、使える部分だけを切り出す方法が現実的です。また、動作の途中でカットを切り、次のカットで続きを見せる「アクション切り」を使えば、1本のクリップが短くても連続性を保てます。
Q3. キャラクターの顔が安定しません。どうすればよいですか?
参照画像を用意し、構図・照明・服装をできるだけ揃えて生成します。それでも揺れる場合は、顔が大きく映るカットを減らし、後ろ姿や手元、シルエットで見せる演出に切り替えるのも有効な判断です。
Q4. 動きが破綻するときの対処は?
動きの大きさを下げ、カメラを固定し、被写体の移動距離を短くします。それでも破綻する場合は、アクションそのものを分割して2カットにします。生成モデルは「小さく確実な動き」のほうが安定します。
Q5. 権利や商用利用で確認すべき点は?
使用するモデルや素材ごとに利用条件が異なるため、配信先の規約と併せて必ず確認します。特に、実在の人物に似た生成、商標やロゴの写り込み、既存作品に酷似したスタイルの再現には注意が必要です。判断に迷う場合は法務や専門家に相談してください。
Q6. モデル選びの優先順位が分かりません。
まず「指示忠実度」で絞り、次に「モーション品質」、最後に「一貫性」で選ぶと失敗が少なくなります。ただし作品の性質によって優先順位は変わります。人物ドラマなら一貫性、商品紹介なら質感の再現性を優先しましょう。
Q7. 音声やリップシンクはどう組み合わせますか?
先に音声(ナレーションやセリフ)を確定させ、その波形に合わせてカット尺を決めるのが最も破綻の少ない順序です。リップシンクを使う場合は、顔のアップを短く使い、口元が隠れるアングルを併用すると自然に見えます。
Q8. 上達のために記録すべきことは?
採用したカットのプロンプト、モデル、シード、解像度、そして「なぜ採用したか」の一言コメントを残します。失敗したカットも原因とともに残すと、同じ失敗を繰り返さなくなります。数本作るだけで、自分専用の判断基準ができあがります。
AI動画制作の成否を分けるのは、最新モデルをどれだけ早く試すかではなく、物語とショットをどれだけ丁寧に設計するかです。生成は何度でもやり直せますが、視聴者の時間はやり直せません。まずログラインとビートシートを1枚書き、そこからカットを積み上げていく。この順序を習慣にすることが、映像の質を安定させる最も確実な方法です。


