AI動画制作の全体像:最初に押さえるべき三つの論点
AIを使って動画を作るという作業は、撮影機材やスタジオを用意する代わりに、設計図を書く工程、指示を言語化する工程、出力を選別する工程の三つに置き換わっている。この構造を理解しないままツールを触り始めると、どれほど高性能な生成モデルを選んでも、つなぎ目の目立つ断片的なクリップが量産されるだけになりやすい。
第一の論点は、動画は静止画の延長ではないという点だ。一枚の画像を美しく仕上げる技術と、複数のショットを時間軸に沿って破綻なく並べる技術は別物である。動画では、照明の向き、髪型、小物の位置、レンズの焦点距離がショットをまたいで維持されなければならない。初心者ほどこの時間方向の整合性を軽視し、各カット単体の見栄えだけを追ってしまう。
第二の論点は、生成は再現装置ではなく確率操作だという点である。同じ指示を入れても毎回同じ結果が返るわけではない。したがって制作とは、当たりを引くまで回す作業ではなく、外れの幅を狭める作業になる。参照画像、構図指定、動きの指定、避けたい要素の指定を積み上げるほど、出力のばらつきは小さくなり、やり直しのコストが下がる。
第三の論点は、完成度の大半は生成後の工程で決まるという点だ。生成されたクリップは素材であり、作品ではない。カットの選別、尺の調整、音の設計、色の統一、テロップの配置を経て初めて、視聴者が最後まで見る動画になる。逆に言えば、生成が多少粗くても編集で救える余地は大きい。
全体の流れはこうなる。企画と目的の定義、絵コンテとショットリストの作成、スタイルガイドの確定、モデルと設定の選定、プロンプトと参照素材の準備、生成と選別、編集と音の設計、書き出しと公開、そして計測と改善である。以下の章では、この流れを順に掘り下げる。作業時間の目安としては、30秒の動画であれば企画と設計に1〜2時間、生成と選別に2〜3時間、編集と音に1〜2時間、書き出しと確認に30分程度を想定しておくと、途中で焦って判断を誤りにくい。
制作前の設計:企画・絵コンテ・スタイルガイド
目的と公開先を先に固定する
どのプラットフォームに出すかで、縦横比、尺、テンポ、テロップの大きさは変わる。縦型のショート動画は9:16で、最初の2〜3秒に情報を集中させる。横型は16:9で、余白と構図の安定を優先する。正方形はフィード表示との相性がよいが、没入感は縦型に劣る。
目的も先に決める。認知を広げたいのか、再生数を伸ばしたいのか、商品を理解させたいのか、問い合わせにつなげたいのか。認知目的なら冒頭のフックとテンポを重視し、理解目的なら図解とテロップの情報量を増やす。目的が曖昧なまま撮ると、どの指標も中途半端に終わる。
絵コンテとショットリストを作る
絵コンテは上手に描く必要はない。三〜五行のラフに、各カットの情報を書き添えれば十分である。書くべき項目は、誰が、どこで、何をするか、カメラはどう動くか、そのカットの尺は何秒か、の五つだ。
ショットリストは表形式にすると扱いやすい。列はカット番号、内容、尺、必要な素材、生成方法、優先度の六つで足りる。優先度を付けておくと、時間が足りなくなったときに削るカットを迷わず決められる。30秒の動画ならカット数は8〜14本が目安で、平均2〜4秒で切り替えるとテンポが保てる。
スタイルガイドを十五行で書く
スタイルガイドは、色温度、主要色、光の方向、レンズ感、被写界深度、動きの速さ、テロップのフォントと太さ、余白の取り方、トランジションの種類を箇条書きにしたものだ。十五行程度で十分に機能する。
ここで決めた内容は、プロンプトの語彙としても、編集時の判断基準としても使う。たとえば「暖色寄りの柔らかい光」「35mm相当の浅い被写界深度」「フィルム粒子をわずかに残す」と決めておけば、生成時に毎回迷わず、編集時にも色調整の方向がぶれない。
生成モデルの選び方:用途別の判断基準
実写風・シネマティックな画づくり
実写風の映像では、肌の質感、髪の毛のディテール、影の落ち方、レンズの歪みが説得力を左右する。人物が画面の中心にいる場合は、顔のパーツが時間経過で崩れないかを最優先で確認する。背景が大きく動くシーンでは、奥行きの整合性が保たれているかを見る。
シネマティックな表現を狙うなら、カメラワークは「ゆっくり寄る」「横に流す」程度に抑えるのが定石である。激しい動きは破綻を招きやすく、修正コストが跳ね上がる。光は単一の主要光源を意識し、逆光か半逆光にすると立体感が出る。
アニメ・イラスト調の映像
アニメ調では、線の太さと色のパレットがショット間で揃っているかが重要になる。線が太いカットと細いカットが混在すると、別作品のように見えてしまう。動きの指定は、口パク、まばたき、髪の揺れ、歩行の四つに分けて考えると整理しやすい。
イラスト調の場合は、背景と人物でレイヤー感を分けると破綻しにくい。人物だけを生成して背景を別工程で作る、あるいは静止画の背景を用意して人物だけ動かすという分割も有効である。
モーション素材・ループ映像
背景映像やループ素材は、派手さより継ぎ目のなさが価値になる。ループの終点と始点が滑らかにつながるか、明滅やちらつきが出ていないかを確認する。テロップや図解の下に敷く場合は、彩度を落とし、コントラストを弱めておくと文字が読みやすい。
モデル選定チェックリスト
- 目的の画風に近い作例が実際に出力されているか
- 生成時間と試行回数のバランスが現実的か
- 参照画像や構図指定に対応しているか
- 縦型と横型の両方を無理なく出力できるか
- 短い尺と長い尺のどちらが得意か
- 出力形式と解像度が編集環境に合うか
- 同じ設定で再現性がどの程度あるか
一つのモデルで全部をまかなおうとしないことも重要である。人物の寄りはA、風景の引きはB、ループ素材はC、というように役割を分けたほうが、結果的に短時間で安定する。
プロンプト設計:テキストから映像への翻訳
構図とカメラワークの語彙を持つ
プロンプトは思いつきで書くより、語彙を部品として持つほうが強い。構図なら、クローズアップ、ミディアムショット、ロングショット、俯瞰、ローアングル、肩越し。カメラなら、固定、ゆっくりしたパン、ドリーイン、ドリーアウト、手持ち風の揺れ。これらを組み合わせて指定するだけで、出力の安定度は大きく変わる。
書き方の基本は、主語、動作、場所、構図、光、質感、動きの順である。たとえば「女性が窓辺で本を閉じる、ミディアムショット、室内、午後の斜光、柔らかい影、ゆっくりしたドリーイン」という順序になる。要素を詰め込みすぎると、どれも中途半端になるため、一つのカットにつき強調したい要素は二つまでに絞る。
光と質感の指定
光は映像の印象を最も大きく左右する要素である。指定の候補は、自然光、逆光、半逆光、リムライト、柔らかい拡散光、硬い直射光、ネオン、ろうそくの灯り、曇天の均一光など。質感は、フィルム粒子、わずかなボケ、肌のきめ、布の織り目、金属の反射といった語彙で調整する。
同じシーンでも、光の方向を変えるだけで意味が変わる。室内で人物が窓を背にしていれば、心情は内向的に見える。逆に窓から光を受けて正面を向いていれば、前向きな印象になる。こうした演出意図を先に決めてから光を指定すると、カットの意図がぶれない。
失敗を減らす制約の書き方
避けたい要素を明示することも有効である。手指の崩れ、文字の混入、余計な人物の追加、ロゴの出現、急な色変化などは、あらかじめ避けたい対象として伝えておく。ただし制約を増やしすぎると表現の自由度が落ちるため、実際に問題が出た種類だけを追加していく運用が現実的だ。
もう一つの定石は、一度に大きく変えないことだ。構図、光、動きを同時に変えると、どの変更が効いたのか分からなくなる。変更は一度に一つ、比較は同じ条件で三回、を基本にすると、再現性のある設定にたどり着きやすい。
一貫性を保つ技術:キャラクター・小物・背景
参照画像とキーフレーム
一貫性の土台は参照素材である。人物であれば正面、斜め、横の三方向を用意し、表情は無表情の中立なものを基準にする。服装はカットごとに変えない。小物は色と形を固定し、必要なら単体の画像も用意する。
キーフレームを使える環境では、カットの始点と終点を静止画で指定する方法が最も安定する。動きの中間は生成に任せ、始点と終点だけを人間が握る。これにより、前後のカットとのつながりが保たれ、編集時の微調整も容易になる。
ショット間のつなぎ方
つなぎで意識すべきは、視線の連続性、進行方向の一致、光源の一致である。人物が右から左へ歩いたなら、次のカットでも同じ方向に進ませる。逆にすると視聴者は無意識に混乱する。光源も、前のカットが左からの光なら次も左からにする。
ジャンプカットを避けたい場合は、同じ人物でもサイズを変える、あるいは間につなぎのカットを挟む。手元のアップ、風景、小物のカットを用意しておくと、編集段階でリズムを整えやすい。
よくある破綻と対処
顔が途中で別人になる場合は、参照画像の枚数を増やし、動きの指定を弱める。背景が別の場所に変わる場合は、背景の説明を短く固定し、カメラの移動量を減らす。色がカットごとに変わる場合は、編集側でカラー調整を統一するか、生成時に色温度を明示する。
破綻はゼロにはならない。重要なのは、破綻しても隠せる撮り方を最初から選ぶことだ。動きの速いカットは尺を短くし、細部が見えにくい構図にする。これだけで完成度の印象はかなり変わる。
編集ワークフロー:素材を作品に変える
カット選定と尺の設計
生成したクリップは、すべて使う必要はない。同じカットを三回生成したなら、最も良い一本だけを採用し、残りは別の用途に回すか破棄する。判断基準は、表情の自然さ、動きの滑らかさ、構図の安定、前後とのつながりである。
尺は音から決めると整いやすい。ナレーションがある場合は、読み上げの区切りにカットを合わせる。BGMだけの場合は、四拍、八拍といった音楽の区切りに切り替えを置く。切り替えの位置が音と一致しているだけで、素人っぽさは大きく減る。
音の設計
音は三層で考える。ナレーションまたは会話、BGM、効果音である。ナレーションは聞き取りやすさが最優先で、BGMはその下に潜らせる。目安として、BGMの音量はナレーションより十二〜十八デシベル程度下げると会話が埋もれない。
効果音は、カットの切り替え、動作の開始、画面内の出来事に合わせて置く。すべての動きに音を付けると煩くなるため、動画全体で五〜八箇所に絞ると効果的である。無音の間を一つ入れると、逆に集中が戻る。
色調整とテロップ
色調整は、カット間の色温度と明るさを揃える作業から始める。次に全体のトーンを決め、最後にコントラストを整える。フィルム風にするなら、ハイライトをわずかに暖色、シャドウをわずかに寒色に寄せると自然になる。
テロップは、フォントを二種類まで、サイズを三段階までに制限する。位置は画面の下三分の一か、中央の上下どちらかに固定する。動きのあるテロップは、情報を強調したい一箇所だけに使うと締まる。縦型では左右の余白を広めに取り、端末のUIに重ならないよう上下にも余白を残す。
書き出しと公開:プラットフォーム別の最適化
縦型と横型の設計差
縦型は被写体を画面の中央から少し上に置き、顔の周囲に余白を残す。横型は左右に情報を広げられる代わりに、中央の構図が弱くなりやすい。同じ素材を使う場合でも、縦型は寄りを多用し、横型は引きと横移動を活かす。
同じ動画を複数の比率で出す場合は、最初から余白を多めに設計しておく。後から切り抜くと、重要な要素が切れてしまう。撮影前に安全領域を決めておくのが最も確実である。
サムネイルと冒頭の数秒
サムネイルは、被写体、文字、余白の三点で構成する。文字は五〜九文字程度に抑え、被写体の顔や手元が見える構図にする。冒頭の数秒は、結論か意外な映像のどちらかで始めると離脱が減る。
最初の一秒で動きを入れる、二秒目で文字を出す、三秒目で内容を提示する、という順序は汎用性が高い。逆に、ロゴやあいさつから始める構成は、短尺では不利になりやすい。
公開後の計測
公開したら、再生維持率、平均視聴時間、離脱位置、保存数、コメントの内容を確認する。離脱が特定の秒に集中しているなら、その前後のテンポか音量を見直す。保存が多いのに再生が伸びない場合は、内容は刺さっているが冒頭の訴求が弱い可能性がある。
改善は一度に一つにする。冒頭を変える、尺を変える、テロップを減らす、BGMを変える。同時に複数を変えると、何が効いたのか分からなくなる。
よくある失敗とトラブルシューティング
動きが速すぎて崩れる
原因は、カメラ移動と被写体動作を同時に大きく指定していることにある。対処は、どちらかを固定すること。まずカメラを固定し、被写体だけ動かす。それで安定するなら、次にカメラをゆっくり動かす。
カットごとに人物の印象が変わる
参照素材の不足か、服装と髪型の指定が曖昧なことが原因である。三方向の参照画像を用意し、服装と髪型を具体的に固定する。それでも揺れる場合は、人物の登場カットを減らし、手元や後ろ姿で構成する。
全体が単調に見える
ショットサイズが一定であることが原因になりやすい。寄り、引き、ミディアムを意識的に混ぜ、三カットに一回はサイズを変える。加えて、明るさの差を作ると単調さが消える。
音がこもる、聞き取りにくい
ナレーションの帯域とBGMの帯域がぶつかっている。ナレーションの中心帯域を少し持ち上げ、BGMの同じ帯域を下げる。加えて、BGMの音量を下げるだけで改善する場合も多い。
書き出しで色が変わる
色空間とガンマの設定不一致が原因である。編集環境と書き出し設定、公開先の推奨設定を確認し、可能なら一度テスト書き出しをして見比べる。
継続運用:テンプレート化とシリーズ設計
再利用できる部品を決める
毎回ゼロから作ると続かない。冒頭の構成、テロップのデザイン、BGMの候補、CTAの言い回し、色のパレットをテンプレート化しておく。生成の段階でも、プロンプトの雛形と参照素材のセットを保存しておけば、新しい企画の初速が上がる。
シリーズとして設計する
同じ題材を一度で終わらせず、三本から五本のシリーズとして設計する。視聴者は同一性のある映像を繰り返し見ることで記憶する。シリーズごとに一つの疑問を立て、各回で一部分ずつ答える構成にすると、離脱が減り、次回への誘導も自然になる。
制作の記録も資産になる。使用したモデル、設定、うまくいったプロンプト、失敗した条件を簡単な表に残しておくと、次回の判断が速くなる。
よくある質問
Q. 機材や撮影経験がなくてもプロ品質に近づけますか
近づけますが、近づく方法は撮影技術ではなく設計力です。絵コンテ、スタイルガイド、参照素材、音の設計を丁寧に作れば、生成の粗さは編集で吸収できます。逆にこの設計を飛ばすと、高性能なツールを使っても印象は散らばります。
Q. どのモデルを最初に試すべきですか
目的から逆算してください。人物の寄りを中心にするなら実写風、世界観を見せるならアニメ調、背景やループ素材なら軽量なモーション特化型が向いています。まず短い尺で比較し、破綻の少ないものを軸に決めるのが現実的です。
Q. 一つのカットに何回まで生成を試すべきですか
三回を目安にしてください。三回で使えるものがなければ、プロンプトか参照素材の側に問題があります。回数を増やすより、条件を変えるほうが効率的です。
Q. 生成に時間をかけるべきか、編集に時間をかけるべきか
編集に厚みを持たせるほうが費用対効果は高くなります。映像の粗さは音とテンポと尺で大きく補えますが、音とテンポの乱れは映像では補えません。
Q. 長い尺の動画にも向いていますか
向いていますが、作り方が変わります。長尺では一つのカットを長く見せる必要があるため、動きの設計と音の変化で間を持たせます。短尺の寄せ集めでは、途中で単調になります。
Q. 商用利用で気をつけることはありますか
利用するモデルや素材ごとに条件が異なるため、使用前に各サービスの規約を確認してください。人物に似せた表現、既存の作品やロゴに似た要素、第三者の音源の扱いには特に注意が必要です。判断に迷う要素は使わないのが安全です。
Q. チームで制作する場合の分担はどうするべきですか
企画と設計、生成と選別、編集と音、公開と計測の四工程に分けます。設計を担当する人が最初にスタイルガイドを固定し、他の担当がそこから外れないようにすると、分担しても仕上がりが揃います。
まとめ:初心者が最短で品質を上げる順序
品質を上げる順序は決まっている。まず目的と公開先を決め、次に絵コンテとスタイルガイドを作る。参照素材を揃え、モデルは役割ごとに選び、プロンプトは変更を一度に一つに絞る。生成したら選別し、音とテンポを整え、最後に色とテロップを統一する。公開後は離脱位置を見て、一度に一要素だけ改善する。
この順序を三本から五本のシリーズで回すと、使える設定と使えない設定の境目が体で分かるようになる。特別な機材も大規模なチームも必要ない。必要なのは、毎回同じ手順を丁寧に繰り返すことである。


