動画制作コストの正体:生成回数よりも「やり直し」が高い
AIを使った動画制作のコストは、一般に「生成1回あたりの費用 × 生成回数 + 編集工数 + 確認と修正の工数」という式で捉えられる。ところが実際に予算と納期を圧迫するのは、最初の項ではない。編集と修正、つまり「狙った素材が取れずにやり直す時間」である。
たとえば5秒のカットを10本作る動画を想定しよう。1本あたり平均3回の生成で採用できる素材が取れるなら生成は30回、平均8回かかるなら80回になる。差は50回分だが、体感される負荷はそれだけでは済まない。使える素材が取れないたびに、制作者は構図を考え直し、参照画像を探し、指示文を書き換え、結果を確認する。1回のやり直しに5分かかるとすれば、50回の差は約4時間。これが毎週の定例制作なら、月に16時間、年間で200時間近い差になる。
つまりコスト最適化とは、生成単価を少し下げる努力ではなく、「1回で採用できる確率」を上げる努力である。そしてこの確率を最も大きく左右する変数が、プロンプトの設計品質だ。プロンプトは注文票ではなく仕様書であり、曖昧な仕様書は必ず手戻りを生む。
手戻りが発生する4つの典型パターン
現場で観察される失敗は、おおむね次の4つに分類できる。
- 構図違い:被写体は合っているが、アングルや余白の取り方が意図と違う。
- スタイル違い:描写の方向性(写実・イラスト・質感)が毎回ぶれる。
- 要素違い:小物、衣装、背景のディテールが指示と噛み合わない。
- 破綻:手指、文字、目線、パースなどが崩れ、そのままでは使えない。
このうち1と2は「書き方」でほぼ解決できる。3は参照画像の設計で改善できる。4はモデル特性の理解と後処理の分担で対応する。つまり4分の3は、生成を重ねる前に潰せる問題なのだ。
「1テイク採用率」を指標にする
制作チームに導入して効果が大きいのが、1テイク採用率(生成本数のうち、そのまま編集工程に進めた割合)を記録する運用だ。10カット作って採用が2本なら採用率20%。ここを50%に上げるだけで、同じ納品物に対する生成回数は半分近くになる。
重要なのは、この数字を個人の腕前評価に使わないこと。採用率が低い原因は、指示の曖昧さ、参照素材の不足、レビュー基準の不一致など、仕組み側にあることが多い。数字は仕組みを直すために使う。
低コスト化の核心:4層構造でプロンプトを組み立てる
プロンプトを「キーワードの羅列」として扱うと、結果は運任せになる。採用率を安定させるには、指示を4つの層に分けて書く。
第1層:意図(何を伝えるカットか)
最初に書くべきは、見た目の指定ではなく目的である。「新商品の清潔感を伝える」「キャラクターの孤独を表現する」「操作手順の1工程を示す」。この一文があるだけで、後続の語句選択に一貫した基準が生まれる。逆にこれを省略すると、作り手の気分で語句が足し引きされ、カット間のトーンが崩れる。
第2層:被写体と構図
次に、誰が・何が・どこに・どのくらいの大きさで写るかを指定する。
- 被写体:人物なら年齢感、服装、表情、姿勢。物なら素材、色、状態。
- ショットサイズ:顔のアップ、上半身、全身、引きのロングショット。
- アングル:目線の高さ、やや見下ろし、真上から、ローアングル。
- 配置:中央、三分割の右、左寄せで右に余白。
- レンズ感:広角の歪み、中望遠の圧縮、被界深度の浅さ。
この層を数値や相対表現で具体化すると、構図違いによる作り直しが激減する。
第3層:スタイルと質感
描写の方向性を固定する層である。写実的な写真なのか、フラットなベクター風か、フィルムグレインのある質感か。加えて、光源の種類(柔らかい窓光、逆光、室内の蛍光灯)、色温度、彩度の傾向、仕上げの質感(マット、光沢、粒子感)を指定する。
ここで有効なのが、抽象語を具体語に翻訳する作業だ。
- 「おしゃれ」→「余白の広いミニマル構成、モノトーン基調に1色のアクセント」
- 「かっこいい」→「低いアングル、硬い光源、高いコントラスト、深い影」
- 「かわいい」→「丸みのある形状、パステル配色、柔らかい拡散光」
- 「高級感」→「暗めの背景、金属の反射、浅い被界深度、抑制された彩度」
抽象語は受け手によって解釈が変わる。解釈の幅は、そのまま生成結果のばらつきになる。
第4層:技術的制約と禁止事項
最後に、縦横比、解像度の想定、余白の位置、そして「避けたい表現」を明記する。動画化を前提とするなら、次の制約を最初から入れておくと後工程が楽になる。
- 動かす予定のある被写体は、画面の端に寄せない。
- テロップを重ねる領域には、細かい模様や情報を置かない。
- 手前と奥の要素を分けておくと、パンやズームの指示が効きやすい。
- 文字を画像内に入れない(文字は編集工程で載せる)。
画像内に文字を生成させると、崩れが発生しやすく、修正も困難だ。タイトルや数字は編集ソフトで載せる方が、結果的に速くて安い。
すぐ使える実践テンプレート集
ここからは、そのまま穴埋めして使えるテンプレートを紹介する。{} の部分を置き換えるだけで運用できる。
人物ポートレート用テンプレート
{目的}。{年齢感}の人物、{服装}、{表情}、{姿勢}。
ショット:{上半身/全身}、{アングル}、{配置}。
光:{光源の種類}、{方向}、{色温度}。
スタイル:{写実/イラスト}、{レンズ感}、{仕上げの質感}。
避ける:{手指の崩れ/余分な人物/文字}。
人物は「表情」と「姿勢」を必ずセットで書く。表情だけ指定すると、体の向きが毎回変わり、シリーズ化したときに並べられない素材が生まれる。
商品・物撮り用テンプレート
{目的}。{商品名}を{配置}に置く。
表面:{素材感}、{反射の強さ}、{汚れや傷の有無}。
背景:{色}、{素材}、{奥行きの表現}。
光:{メイン光源}+{補助光}、{影の硬さ}。
視点:{真上/斜め45度/水平}、{レンズ感}。
避ける:{ロゴの歪み/余計な小物/文字}。
物撮りは「反射」と「影」の指定が品質を決める。ここを省くと、素材の質感が伝わらない平板な画像になり、動画化しても魅力が伸びない。
背景・風景用テンプレート
{目的}。{場所}の{時間帯}。
天候:{晴れ/曇り/雨上がり}、{霧の有無}。
構図:{前景/中景/遠景}の3層、{消失点の位置}。
色:{基調色}+{アクセント色}。
スタイル:{写真/絵画的}、{粒子感}。
避ける:{過密なディテール/人物/文字}。
背景は3層構造で書くと、動画化したときのパンやズームに耐える奥行きが出る。平坦な背景は動かすと途端に安っぽく見える。
図解・サムネイル用テンプレート
{目的}。{主題}を表すシンプルな図解。
要素:{アイコン数}個、{配置}、{矢印の有無}。
配色:{背景色}、{主線色}、{強調色1色}。
スタイル:フラット、太い輪郭、大きな余白。
避ける:文字、細かい線、グラデーションの多用。
サムネイルや図解は、文字を後から載せる前提で「文字が入る場所」を空けておくのが鉄則だ。
パラメータ設計:品質とコストの分岐点
同じプロンプトでも、設定次第で結果とコストは大きく変わる。ここでは判断基準を整理する。
解像度とアスペクト比を先に決める
動画の納品先が決まっているなら、出力比率は最初に固定する。横長16:9は一般動画、縦長9:16はショート動画、1:1はSNS投稿、21:9は cinematic な演出に向く。ここを後から変更すると、構図の作り直しが発生する。
解像度は「最終的に必要になる大きさ」から逆算する。動画の中でズームやパンを行うなら、表示サイズより大きめに生成しておくと、拡大時の甘さを避けられる。逆に動きのない固定カットなら、表示サイズ相当で十分だ。
ステップ数は「収穫逓減」を意識する
ステップ数を増やすとディテールは向上するが、ある地点から差はほとんど分からなくなる。判断基準はシンプルで、等倍で見て違いが分かるかどうか。動画内で一瞬しか映らないカットに、最高設定を費やすのは効率が悪い。
カットを3段階に分類すると管理しやすい。
- 主役カット(長く映る、寄りで見せる):高設定。
- 標準カット(数秒、中景):中設定。
- つなぎカット(一瞬、背景的):低設定で割り切る。
全カットを同じ設定で作る運用は、平均点は出るが総コストが高い。
バリエーション生成の使い方
複数案を同時に出す機能は、迷っているときに使うものではない。判断基準が決まっているときに、その基準を満たす案を拾うために使う。基準が曖昧なまま大量生成すると、選べずに結局やり直す。
おすすめの手順は次の通り。
- まず低設定で4〜6案を出し、構図だけを比較する。
- 構図が決まったら、その構図を固定してディテールを詰める。
- 最終候補2案だけを高設定で仕上げる。
シード固定と再現性
気に入った1枚が出たら、その設定値を記録しておく。同じ構図で表情だけ変えたい、衣装だけ変えたいという場面で、それ以外の要素を固定できる。シリーズ物の制作では、この記録が資産になる。
記録すべきは、プロンプト全文、比率、設定値、使用モデル、そして日付。テキストファイル1枚で構わないが、チームで共有できる場所に置くこと。
画像から動画へ:動画化ワークフローの全体像
静止画ができたら、次は動画化だ。ここでの失敗の多くは、動画生成の段階ではなく、素材準備の段階で既に決まっている。
事前準備チェックリスト
- カットごとの用途(導入・説明・締め)が決まっている
- 各カットの尺(3秒・5秒・8秒)が決まっている
- 動かす要素と止める要素が分かれている
- 縦横比と解像度が全カットで統一されている
- テロップ領域が空いている
- 参照用の画像(キャラクター、商品、ロゴ)が揃っている
特に4番目は重要で、比率が混在すると編集時に黒帯やトリミングが発生し、作業時間が一気に増える。
ショットリストを先に書く
動画化は「1枚を動かす作業」ではなく「カットを並べる作業」だ。先にショットリストを書き、各カットに次の情報を紐づける。
| 項目 | 記入例 |
|---|---|
| カット番号 | 03 |
| 尺 | 5秒 |
| 内容 | 商品を手に取る |
| 動き | 被写体は手元、カメラはゆっくり寄る |
| 音 | 環境音のみ |
| テロップ | 右下に機能名 |
この表があると、動画生成に渡す指示が短くても意図が伝わる。表を作らずに作業を始めると、後半で「このカット何秒だっけ」という確認が繰り返し発生する。
モーション指示の書き方
動画生成に渡す指示は、3種類に分けて書くと整理しやすい。
- 被写体の動き:手を上げる、振り向く、歩き出す、湯気が立つ、髪が揺れる。
- カメラの動き:固定、ゆっくり寄る、引く、横に流す、わずかに回り込む。
- 環境の動き:光が揺れる、カーテンがなびく、雨が降る、埃が舞う。
このうち、最初に指定すべきはカメラの動きだ。カメラが安定しているだけで、映像の印象は大きく変わる。逆に、被写体とカメラの両方を大きく動かすと、破綻が起きやすく、修正も難しい。
尺は短く刻む
動画生成は、長い尺になるほど破綻リスクが上がる。5秒前後で刻み、編集でつなぐ方が結果的に速い。長回しが必要な場面でも、いったん短いカットで素材を揃え、編集でテンポを作る方が制御しやすい。
音の設計を忘れない
映像だけを作って後から音を足すと、動きと音が噛み合わず、違和感が残る。ショットリストの段階で「このカットは静か」「ここで音が切り替わる」と決めておくと、編集が滑らかになる。
一貫性を保つ:キャラクター・スタイル・色の統一
シリーズ物や複数カットの動画では、一貫性が品質の大部分を占める。バラバラの絵は、どれだけ1枚ずつが美しくても作品として成立しない。
キャラクターシートを作る
同一人物を複数カットに登場させるなら、最初に「設定資料」を作る。正面、斜め、横、後ろの4方向を用意し、服装・髪型・体型・年齢感を固定する。以後の生成では、この資料を参照として渡す。
口で説明するより、1枚の参照画像の方が情報量が多い。文章で「20代前半、黒髪ショート、白いシャツ」と書くより、その通りの画像を1枚添える方が、結果のばらつきは確実に小さくなる。
スタイル記述をテンプレート化する
スタイルに関する語句は、毎回書き直さずに固定テンプレートとして保存する。たとえば次のような1行だ。
柔らかい窓光、彩度は控えめ、フィルム粒子をわずかに、浅い被界深度、落ち着いた色温度。
この行を全カットの末尾に貼るだけで、トーンが揃う。逆に、カットごとに雰囲気を変えたい場合は、この行だけを差し替える。可変部分と固定部分を分離するのが、一貫性運用の基本だ。
カラーパレットを決めて言葉にする
色の統一は、感覚ではなく言葉で指定する。基調色1色、補助色2色、アクセント1色の計4色を決め、各カットの指示に含める。
- 基調色:画面の6割を占める色
- 補助色:影や背景に使う2色
- アクセント:視線を誘導する1色
これを決めておくと、カット間の色の転びが減り、編集でカラー調整にかける時間も短くなる。
小物と衣装の固定
一貫性が崩れる最大の原因は、小物と衣装だ。メガネの有無、時計の位置、靴の色、カバンの形。これらは指示文の末尾にまとめて列挙し、毎回同じ文言を使う。
レビューと承認:手戻りを構造的に減らす
どれだけ良いプロンプトを書いても、確認の仕組みが弱いと手戻りは減らない。
3段階で承認する
- 第1段階:構図承認。低設定のラフで、構図と方向性だけを確認する。
- 第2段階:ディテール承認。動かすカットだけを高設定で仕上げて確認する。
- 第3段階:動画承認。つないだ状態で、テンポと音を確認する。
一度に全部を見せると、レビュー側は「なんとなく違う」という曖昧な指摘しかできない。段階を分けると、指摘が具体的になる。
修正指示は「差分」で書く
「もう少し明るく」ではなく、「背景の右側の影を弱く、全体の露出はそのまま」と書く。差分で指示すると、良い部分を壊さずに修正できる。
版管理を簡素に
ファイル名に連番を入れるだけで十分だ。cut03_v01、cut03_v02。上書き保存をやめるだけで、後戻りできる回数が増え、結果的に作業が速くなる。
よくある失敗と対処法
手指が崩れる
手を画面の主役にしない。手前に物を持つ、袖で隠す、構図を少し上げて手を切るなど、見せない工夫の方が速い。どうしても必要なら、編集で別素材を合成する。
文字が崩れる
画像内に文字を生成させない。テロップは編集ソフトで載せる。ロゴが必要なら、生成後に合成する。
構図が毎回変わる
ショットサイズ、アングル、配置の3つを必ず数値か相対表現で指定する。これだけで安定する。
色が転ぶ
カラーパレットを言葉で固定し、スタイル記述を全カットで共通化する。編集段階でのカラー調整は、最後の微調整に留める。
動画にすると顔が崩れる
動きの大きい指示を減らす。顔を大きく動かすより、髪や光を動かす方が自然に見える。また、顔のアップは尺を短くする。
モーションが過剰
カメラの動きを「わずかに」と明記する。強い動きが必要な場面は、1本の動画に1箇所までと決めておくと、全体の印象が散らからない。
比率の事故
案件ごとに比率を決め、生成前に設定を確認する。テンプレートの先頭に比率を書いておくのも有効だ。
FAQ
Q. プロンプトは長い方が良いのですか。
長さそのものは品質と関係しない。関係するのは、曖昧さの少なさだ。短くても具体的なら強い。長くても抽象語だらけなら弱い。
Q. 参照画像は何枚必要ですか。
人物なら4方向、商品なら3アングル、背景なら1枚が目安。増やしすぎると指示が衝突する。
Q. 生成のやり直しは何回まで許容すべきですか。
同じプロンプトで3回試して改善しないなら、プロンプトを疑う。5回試して駄目なら、構図そのものを変える。
Q. 高設定と低設定の使い分けは。
画面に長く映るカットは高設定、一瞬のつなぎは低設定。判断は尺と画面占有率で行う。
Q. チームで運用するときに最初に決めるべきことは。
比率、解像度、スタイル記述テンプレート、カラーパレットの4つ。この4つが揃うと、担当者が変わっても出力のトーンが保たれる。
Q. 動画の尺はどのくらいが目安ですか。
1カット3〜5秒、全体で30〜60秒が扱いやすい。短い尺を並べる方が、テンポも制御しやすい。
Q. 編集ソフトは何を使えば良いですか。
無料帯なら CapCut や DaVinci Resolve、業務帯なら Premiere Pro や After Effects。画像生成と動画生成のツールは、書き出し形式が編集ソフトと噛み合うものを選ぶ。
Q. 品質が安定しないときの最初の見直し先は。
参照画像の有無、比率の統一、スタイル記述の共通化の3点を確認する。多くの場合、このどれかが抜けている。
運用チェックリストとまとめ
最後に、制作の各段階で確認すべき項目をまとめる。
企画段階
- カットごとの目的が一文で書かれている
- 尺と比率が決まっている
- テロップの位置が決まっている
生成段階
- 4層構造(意図・被写体と構図・スタイル・制約)が書かれている
- 抽象語を具体語に翻訳した
- 参照画像を用意した
- スタイル記述テンプレートを末尾に貼った
動画化段階
- カメラの動きを1カット1つに絞った
- 尺を5秒前後で刻んだ
- 動かす要素を限定した
仕上げ段階
- 発生した失敗を記録した
- 採用できたプロンプトを保存した
- 次回使うテンプレートを更新した
コスト効率の良いAI動画制作は、特別な裏技ではなく、この地道な設計と記録の積み重ねで成り立つ。プロンプトを仕様書として扱い、1テイク採用率を測り、失敗を記録して再利用する。このサイクルを回したチームだけが、品質を落とさずに制作量を増やせる。逆に言えば、生成単価の安さだけを追いかけても、手戻りが増えれば総コストは上がる。まずは直近のカット1本で、4層構造のプロンプトを書いてみるところから始めるとよい。



