直感ワークフローの全体像:短い指示で成立する理由
AI動画生成の性能が上がるにつれて、制作のボトルネックは「モデルの性能」から「人間側の指示設計」へと移りました。少し前までは、モデルごとの癖を覚え、呪文のように長いプロンプトを書き、失敗するたびに語句を入れ替えて再生成するのが当たり前でした。現在のモデルは短い指示から文脈を補完する力が高く、むしろ情報を詰め込みすぎた指示のほうが破綻しやすくなっています。それでも結果が安定しないのは、語彙力の問題ではなく、撮影前に何を決めておくかという設計工程が抜けているからです。
この記事で扱うのは、ショート動画、商品紹介、SNS広告、音楽ビデオのカット制作など、数秒から数十秒の映像です。長編を丸ごと生成する話ではなく、使えるカットを短時間で揃え、編集でつなげる前提のワークフローだと考えてください。
長文プロンプトが失敗しやすい3つの理由
第一に、指示の衝突です。「シネマティック」「明るくポップ」「逆光」「人物がくっきり」といった条件を同時に並べると、モデルはどれを優先すべきか判断できず、平均的な無難な絵に落ち着きます。第二に、抽象語の多さです。「美しい」「迫力のある」「高品質」はモデルにとって方向性の情報を持ちません。第三に、モデルごとの解釈差です。同じ文章でも、写実系のモデルとアニメ系のモデルでは重み付けが異なり、片方では機能し、もう片方では無視されます。
つまり、長文を書くこと自体が目的化すると再現性が下がります。目指すべきは、短く、優先順位が明確で、視覚的な手がかりが添えられた指示です。
意図の設計と文章の設計を分離する
おすすめは、指示を3層に分けて考える方法です。上位層は目的で、誰に何を伝える映像なのかを決めます。中位層は演出で、トーン、構図、光、動きの方向を決めます。下位層は技術仕様で、比率、解像度、尺、フレームレートを決めます。
多くの失敗は、この3層を一つの文章に混ぜてしまうことから生じます。上位層はプロンプトではなく台本やメモに書き、中位層だけを生成時の指示に落とし、下位層は設定項目として扱う。この分離だけで試行回数はかなり減ります。とくに効くのは、上位層を文章から外すことです。「誰に向けた何の映像か」は、生成モデルに伝えても直接には反映されません。それは編集と構成で解決する情報だからです。
始める前に用意するもの
- 目的を1行で書いたメモ
- トーンを決める参照画像を3〜5枚
- 被写体の参照画像(正面・斜め・横)
- ショットリスト(カット番号、尺、内容、カメラ)
- 編集ソフトと音声素材
ここまで揃っていれば、生成時に悩む時間はほとんどありません。逆に、参照画像もショットリストもなしに生成を始めると、1カットごとに方向性がぶれ、結果として何十回も再生成することになります。
撮影前に決める7つの設計項目
生成を始める前に、次の7項目を埋めてください。すべてを厳密に決める必要はありませんが、空白を残すとモデルが勝手に補完し、それが意図とのズレになります。
目的と公開先
縦型か横型か、音声前提か無音前提か、ループ再生されるか単発再生かを最初に決めます。音声前提ならセリフやナレーションの尺が先に確定し、映像はそれに合わせて作ります。逆に無音のフィード広告なら、最初の1秒で何を見せるかが最重要になります。
尺と比率
1カットは3秒、5秒、8秒の単位で考えます。8秒を超えると動きの破綻リスクが上がり、被写体の形状が崩れる確率も高くなります。長い動きが必要なら、8秒のカットを2つ作り、編集でつなぐほうが安全です。比率は9:16、16:9、1:1の3つを使い分ければ実務上はほぼ足ります。
トーンと言葉の対応表
「静か」「温かい」「冷たい」「切迫」といった抽象語は、そのままでは機能しません。光と色に変換して渡します。静かなら柔らかい拡散光と低彩度、温かいなら琥珀色の逆光、冷たいなら青みの強いサイド光、切迫なら高コントラストと手持ちの揺れ。この対応表を自分用に持っておくと、指示の語数が半分になります。
被写体の定義
人物なら年齢感、髪型、服装、小物、表情の初期状態を決めます。商品なら形状、素材感、ラベルの有無を決めます。曖昧なまま生成すると、カットごとに別人・別商品になります。
舞台と時間帯
屋内か屋外か、朝・昼・夕・夜のどれか、天候は何か。この3つを固定するだけで、複数カットの色温度が揃います。
カメラの位置と動き
固定、パン、ドリー、手持ち、俯瞰、ローアングル。1カットにつき動きは1つまでに絞ります。「ドリーしながらパンしてズームもする」といった複合指示は、ほぼ確実に破綻します。
音の設計
BGMのテンポ、効果音を置く位置、ナレーションの有無を決めます。音を後から足す前提でも、カットの長さは音のリズムに合わせておくべきです。
リファレンス画像を起点にすると結果が安定する
言葉で説明するより、1枚の画像を見せたほうが早く正確です。これはモデルの性能が上がった今でも変わりません。むしろ性能が上がったことで、参照画像の影響力は以前より強くなっています。
画像から動画へ進む順番が効く理由
静止画を先に作り、それを動かす順番には明確な利点があります。構図、光、色、被写体のディテールを画像の段階で確定できるため、動画生成では「動き」だけに集中できます。いきなり動画を生成すると、構図と動きを同時に調整することになり、変数を2つ同時に動かすことになります。
実務では、ラフな構図決めに画像生成を使い、決定版を画像編集ソフトで整え、それを動画モデルに渡す流れが最も安定します。
参照画像の作り方と避けたい要素
参照画像に求める条件は次のとおりです。
- 被写体が画面の30〜60パーセントを占めている
- 光源の方向が1つに読める
- 背景がシンプルで、主役と競合していない
- 文字やロゴが入っていない
- 極端なボケやフィルターがかかっていない
逆に避けたいのは、複数の光源が混在する画像、被写体が小さすぎる画像、他人の著作物が明確に写っている画像です。参照が複雑だと、モデルはノイズまで再現しようとします。
被写体参照とスタイル参照を分ける
参照画像は用途別に分けて渡すと精度が上がります。被写体参照は「誰・何を」固定するための画像で、顔や形状の一貫性に効きます。スタイル参照は「どんな絵柄・色調か」を固定するための画像で、質感やライティングに効きます。この2つを1枚で兼ねようとすると、どちらかが犠牲になります。人物の一貫性を重視するなら顔の参照を、世界観の統一を重視するならスタイル参照を、それぞれ別に用意してください。
ショットリストとカメラワークを短い言葉に変換する
プロンプトを短くするコツは、業界の共通語彙を使うことです。モデルは映画や映像制作の用語である程度学習されているため、説明的な日本語を並べるより、短い専門語のほうが意図が通りやすい場面があります。
カメラ語彙の最小セット
| 用途 | 短い指示 | 補足 |
|---|---|---|
| 被写体を強調 | クローズアップ | 表情や質感を見せたいとき |
| 場面を示す | ワイドショット | 環境と人物の関係を見せたいとき |
| 距離感を出す | ミディアムショット | 会話や動作の基準 |
| 視点を動かす | スローパン | 1カット1モーション |
| 近づく | ゆっくりドリーイン | 感情の高まりに使う |
| 離れる | ドリーアウト | 余韻や結末に使う |
| 臨場感 | 手持ち | 揺れは弱めに指定する |
| 俯瞰 | 真上からのショット | 配置説明に強い |
この表の8語を使い分けるだけで、カメラワークの指示はほぼ足ります。装飾的な形容詞を足すより、この語彙を正確に使うほうが結果が安定します。
モーション量と物理的な整合性
動きの強さは「弱・中・強」の3段階で指定するのが実用的です。強い動きは見栄えがしますが、破綻も増えます。とくに手や髪、液体、布、煙は崩れやすい要素です。これらが主役のカットでは動きを弱に落とし、代わりにライティングや構図で情報量を足すと失敗が減ります。
物理的な整合性を保つコツは、同時に起こる出来事を1つに絞ることです。「走りながら振り返って扉を閉める」は3つの動作です。カットを分ければ、それぞれは簡単に成立します。
モデル選択の判断基準
モデルは毎月のように更新され、名前を追いかけても実務の役には立ちません。大切なのは、表現の系統と、尺・解像度・生成時間のトレードオフを理解しておくことです。
表現スタイル別の使い分け
写実系は商品、人物ポートレート、風景、ドキュメンタリー調に向きます。質感は強い一方で、顔の一貫性は参照画像の質に大きく依存します。アニメ系はキャラクターの再現性が高く、シリーズ展開やエピソード制作に向きます。シネマティック系は色調とライティングが美しく、広告やタイトル映像に向きますが、動きの自由度は低めです。3D系やスタイライズ系は、実写では難しい非現実的なカメラワークを得意とします。
最初に決めるべきは「どの系統で作るか」であり、どのモデルかではありません。系統が決まれば、その系統で実績のあるモデルを1つ選び、慣れるまで乗り換えないほうが上達は早いです。
尺・解像度・生成時間のトレードオフ
一般に、尺が長く、解像度が高く、動きが大きいほど、待ち時間と失敗率は増えます。短い尺で試作し、構図と動きが決まってから長尺・高解像度で本番生成する二段構えが効率的です。試作は解像度を落として構わありません。構図とリズムの確認が目的だからです。
モデルを切り替えるタイミング
乗り換えを検討すべきなのは、同じ指示で3回連続して同じ種類の破綻が出たときです。具体的には、手の崩れ、顔の変化、背景の溶け、不自然な加減速のいずれかが繰り返し出る場合は、指示の工夫では解決しにくく、系統の相性の問題であることが多いです。逆に、破綻の種類が毎回違うなら、原因は指示か参照画像にあります。モデルを変える前に、そちらを見直してください。
キャラクターとスタイルの一貫性を保つ方法
複数カットをつなぐとき、最も評価を落とすのは一貫性の崩れです。視聴者は「顔が違う」「服が違う」という違和感に敏感で、内容が良くても別物に見えてしまいます。
参照セットの作り方
人物の場合、最低でも次の4点を用意します。正面のバストアップ、斜め45度、横顔、代表的な表情。衣装は色と素材が読み取れること、髪型は輪郭がはっきりしていることが条件です。可能なら同じ照明条件で揃えます。照明が違う参照を混ぜると、モデルはどの光を再現すべきか迷います。
スタイル側は、色調、コントラスト、粒子感、レンズの質感が共通した画像を3枚ほど選びます。同じ撮影者、同じレンズ、同じ時間帯の写真が理想です。
破綻したときのリカバリー手順
一貫性が崩れたときは、次の順番で対処します。
- 参照画像を1枚に絞る(複数参照は混線の原因になる)
- カメラの動きを弱める(強い動きは形状を崩す)
- 尺を短くする(4秒以下で試す)
- 背景を単純化する(要素が多いと注意力が分散する)
- 構図を変える(正面のアップは最も崩れやすい)
- それでも直らなければ別系統のモデルで試す
多くの場合、1と2で解決します。参照を増やせば安定するという直感は、実際には逆に働くことが多いです。
音声・BGM・編集で仕上げる
生成したカットは素材です。作品になるのは編集の段階です。ここを軽視すると、生成品質が高くても「AIっぽい短い動画の寄せ集め」で終わります。
ナレーションとリップシンク
セリフがある場合は、音声を先に作ることを強くすすめます。音声の波形に合わせてカットの長さと口の動きを合わせるほうが、映像に合わせて音声を切るより自然です。音声合成でナレーションを作る場合も、感情の起伏がはっきりした素材を選ぶと、映像のカット割りにリズムが生まれます。
リップシンクは正面のバストアップで最も精度が出ます。横顔や手で口が隠れる構図は避けるか、口元が映らないカットとして割り切ります。
編集でのリズム設計
編集ソフトでは、まず音を置き、次にカットを並べ、最後に色を整える順番が組みやすいです。カットの切り替えは音の立ち上がりに合わせると、生成映像の粗さが目立ちにくくなります。逆に、静かな区間で長回しにすると、わずかな破綻が目立ちます。
色調整は全カットに共通のルックをかけるだけで十分です。カットごとに個別調整すると、かえって色がばらつきます。共通のLUTやカーブを1つ決め、全カットに適用してください。
書き出しと圧縮の設定
縦型ショートなら1080×1920、30fps、ビットレートは8〜12Mbps程度が扱いやすいです。高ビットレートで書き出しても、配信側で再圧縮されるため差が出にくい場面があります。まずは配信先の推奨設定に合わせ、必要なら部分ごとにビットレートを変えるほうが現実的です。
よくある失敗と対処法
構図が意図と違う
原因は、参照画像の構図が指示と食い違っているか、構図を言葉だけで指定していることです。対処は、参照画像を目的の構図に近いものへ差し替えること。言葉で「引きの構図」と書くより、引きの参照を1枚渡すほうが確実です。
動きが不自然になる
加減速が機械的に見える場合は、動きの強さを1段階下げ、尺を1〜2秒短くします。等速の動きしか出ない場合は、始点と終点が明確な指示に変えます。「歩き出す」ではなく「右から左へ歩き、中央で止まる」のように、開始と終了を書きます。
顔・衣装・小物が変わる
参照画像の枚数を減らし、解像度の高い1枚に統一します。衣装の模様が細かすぎる場合、モデルは模様を再現しきれず形が崩れます。無地に近い衣装に変えるだけで安定することがあります。
尺が足りない、長すぎる
指定した尺と実際の尺がずれるのは、モデルの仕様によるものが多く、指示では直りません。対処は編集側です。短いカットを速度調整で伸ばすと動きが不自然になるため、余韻はBGMや暗転で補うほうが自然です。長すぎる場合は、動きの終わりぎわを切って次カットにつなぐとテンポが出ます。
音と映像がずれる
生成時に音声を同時生成すると、後から差し替えたときにズレが生じます。映像は無音で作り、音は編集で重ねる運用に統一すると、この問題はほぼ消えます。
実践:30秒のショート動画を作る手順
具体的な流れを、30秒・縦型・ナレーションありの構成で整理します。
- 目的を1行で書く(例:新作ドリンクの世界観を伝える)
- ショットリストを作る(6カット、各5秒)
- トーン参照を3枚集める(色調と光の共通点を確認)
- 被写体参照を用意する(商品の正面・斜め・接写)
- ナレーション原稿を書き、音声を先に作る(約28秒)
- 各カットの構図を静止画で決める(画像生成で試作)
- 決定した静止画を動画モデルに渡し、5秒ずつ生成
- 動きが弱いカットだけ動きを強めて再生成
- 編集ソフトで音に合わせてカットを配置
- 共通ルックで色を整え、テロップを載せて書き出し
この手順のポイントは、6と7の間で必ず止まることです。いきなり動画を生成すると、構図の選択と動きの調整を同時に行うことになり、修正コストが跳ね上がります。
FAQ:直感ワークフローに関する疑問
プロンプトは本当に短くてよいのですか
短くて構いません。ただし短さの意味は「情報を減らす」ことではなく「優先順位を絞る」ことです。1カットにつき、被写体、場所、光、動きの4要素だけを書き、残りは参照画像に任せます。
参照画像がない場合はどうすればよいですか
先に画像生成で作ります。構図とライティングを決めた静止画を1枚作り、それを動画の参照にする流れです。ゼロから動画を狙うより、はるかに安定します。
生成結果が毎回違うのは仕様ですか
同じ指示でも毎回異なるのは仕様です。完全な再現を求めるのではなく、許容範囲を決めるほうが現実的です。「この3カットの中で最も自然なものを採用する」という選び方に切り替えてください。
どのくらいの試行回数が目安ですか
参照画像と構図が決まっていれば、1カットあたり2〜3回で採用可能なものが得られることが多いです。5回を超えて同じ破綻が続くなら、指示ではなく系統か参照を見直す段階です。
長い尺の映像を作るには
8秒以下のカットを複数作り、編集でつなぐ方式が現実的です。長尺を1回で生成するより、短尺をつなぐほうが品質も編集の自由度も高くなります。
音声は先に作るべきですか
セリフやナレーションがある場合は先に作ることをすすめます。音の長さとリズムが決まれば、カットの尺と切り替え位置が自動的に決まり、構成の迷いがなくなります。
まとめ:迷いを減らすことが最大の品質改善
直感的なAI動画制作の本質は、プロンプトの技術ではなく、迷いを減らす工程設計にあります。目的を1行で書き、参照画像を整え、ショットリストを埋め、1カット1モーションで生成し、音を先に作って編集で仕上げる。この順番を守るだけで、試行回数は減り、品質は安定します。
最初から完璧を狙う必要はありません。まずは3カット、15秒の映像を同じ手順で作ってみてください。手順を体で覚えれば、モデルが入れ替わっても、表現の系統が変わっても、同じやり方で対応できるようになります。



