はじめに:静止画から映像へ移るプロンプト設計
画像生成AIの進化は、一枚の絵を美しく仕上げる段階から、複数のカットをつなぎ、時間の流れを持つ映像を組み立てる段階へと移っています。以前は「どんな絵が出るか」を楽しむことが中心でしたが、現在は「同じ人物を別のシーンでも再現できるか」「カメラが自然に動くか」「照明がカットごとに矛盾しないか」が重視されます。つまり、プロンプトは単なる呪文ではなく、映像演出の設計図へと変わったのです。
この変化は、画像生成だけを学んできた人にとって大きな転換点です。静止画では一枚の完成度がゴールでしたが、動画では前後のカットとのつながりがゴールになります。キャラクターの服装、髪型、年齢感、背景の色温度、小物の位置まで、複数ショットで保つ必要があります。そのため、プロンプトの書き方も「単語を並べる技術」から「時間軸と空間軸を設計する技術」へと進化しました。
本記事では、画像生成と動画生成の両方に使える実践的なプロンプト設計を、初心者にもわかりやすく整理します。特定のサービスに依存せず、Midjourney、Stable Diffusion、Flux、Runway、Sora、Kling、Pika、ComfyUI などの一般的なツール名を例にしながら、どの現場でも応用できる考え方を紹介します。
次世代AI生成で重視される三つの軸
一貫性
一貫性とは、同じキャラクターや世界観がショットをまたいでも崩れないことです。静止画生成では、多少顔が変わっても別の作品として楽しめました。しかし動画では、カットが変わるたびに主人公の顔が変わると、視聴者はすぐに違和感を覚えます。一貫性を保つには、参照画像、シード値、キャラクター記述、服装メモを固定し、毎回同じ条件をプロンプトに含めることが基本です。
制御性
制御性とは、構図、ポーズ、カメラアングル、動きの方向を意図どおりに操れることです。AIに任せるだけの生成は、ときに驚くほど美しい結果を生みますが、商業制作では再現性が必要です。ポーズ指定、深度マップ、線画、マスク、モーション指定などを使い、どこまでAIに任せ、どこから人間が決めるかを明確にします。
物語性
物語性とは、一連のショットが感情の流れや出来事の変化を伝えることです。美しい映像でも、ショットの順番に意味がなければ単なる風景集になります。プロンプト設計では、各カットに「何を伝えるか」を一行で書き、その一行を映像表現に翻訳します。遠景で状況を示し、中景で人物関係を描き、寄りで感情を強調するという古典的な考え方が、AI映像でも有効です。
プロンプトを構造化する基本フレーム
被写体・スタイル・構図・動き・カメラ
プロンプトを書くときは、五つの層に分けると整理しやすくなります。第一層は被写体で、誰が何をしているかを具体的に書きます。第二層はスタイルで、写真風、アニメ風、水彩、フィルムルックなどを指定します。第三層は構図で、ローアングル、クローズアップ、俯瞰、三分割法などを指定します。第四層は動きで、歩く、振り向く、髪がなびくなどを書きます。第五層はカメラで、パン、ティルト、ドリー、ズームなどを指定します。
この五層を毎回同じ順番で書くと、プロンプトの抜け漏れが減ります。たとえば「赤いコートの女性が雨の交差点を歩く。シネマティックな写真風。ローアングルの中景。ゆっくり前進。カメラはわずかに右へパン」という具合です。文章として自然にしつつ、層ごとの情報を落とさないことが重要です。
時間軸の指示を入れる
動画生成では、時間軸の指示が欠かせません。最初のフレームで何が見え、途中で何が起こり、最後にどうなるかを書きます。たとえば「最初は人物の背中から始まり、途中で振り向き、最後は顔のアップで止まる」と指定します。時間の長さも重要で、三秒、五秒、十秒では必要な情報量が変わります。短いほど一つの動作に絞り、長いほどカット割りを細かくします。
時間軸を書かないと、AIはフレームごとに別々の解釈をしがちです。とくに人物の向きや手の位置が途中で入れ替わることがあります。動作を「始まり・中間・終わり」に分けて書き、必要なら開始フレームと終了フレームを別途用意します。
参照画像とマルチモーダル入力
参照画像は、言葉では伝えにくいニュアンスを伝える強力な手段です。顔、衣装、小物、色、ライティング、画角などを参照として渡すと、プロンプトの抽象度を下げられます。ただし参照画像が多すぎると、AIがどの要素を優先すべきか混乱します。人物用、衣装用、背景用、スタイル用と役割を分け、それぞれ一枚から二枚に絞るのが現実的です。
マルチモーダル入力では、テキスト、画像、動画、音声、深度情報などを組み合わせます。テキストだけでは伝わらない動きを、短い参照動画で示す方法は特に有効です。ただし参照動画に寄りすぎると、元の人物の個性が失われることがあります。テキストで補正しながら、少しずつ重みを調整します。
キャラクターとスタイルの一貫性を保つ方法
参照画像の選び方
キャラクターの一貫性を保つには、参照画像の品質が鍵になります。正面、斜め、横、表情違い、全身、バストアップなど、複数角度の画像を用意できると理想です。ただし最初から完璧な資料を作るのは難しいため、まずは正面のバストアップと全身を一枚ずつ用意し、必要に応じて追加します。背景が単純で、照明が均一な画像の方が、特徴を抽出しやすくなります。
参照画像に強い影や極端な色被りがあると、その癖が別ショットにも移ることがあります。色補正をしてから渡す、背景を分離する、解像度を揃えるといった前処理が効果的です。また、参照画像の人物と生成したい人物が似すぎていると、著作権や肖像権の問題が生まれることがあります。権利処理が済んだ素材だけを使うようにしましょう。
シード・埋め込み・追加学習の考え方
シード値は、同じプロンプトから近い結果を得るための手がかりです。完全に同じ絵にはなりませんが、構図や色の傾向を揃えやすくなります。埋め込みや追加学習は、特定のキャラクターや画風をモデルに覚えさせる方法です。少量の画像で傾向を学習させ、プロンプトで呼び出します。ただし学習データの偏りが結果に影響するため、定期的にテスト生成して崩れを確認します。
これらは魔法のボタンではありません。参照画像、プロンプト、シード、モデル、解像度、サンプラーなどの条件を記録し、一つの条件だけを変えて比較するのが上達の近道です。再現できた条件をテンプレート化し、次のプロジェクトでも使えるようにします。
シーン間の連続性チェック
ショットを生成したら、並べて比較します。顔の形、髪の長さ、服のしわ、小物の位置、背景の光の向きを確認します。気づいた違いはメモし、次の生成プロンプトに反映します。動画編集ソフトで仮編集し、実際の流れで見ると、静止画では気づかなかった不自然さが見つかります。
連続性チェックでは、完璧を目指しすぎないことも大切です。すべてのカットを完全に一致させると、かえって不自然になることがあります。視聴者が気づくレベルかどうかを基準にし、必要ならカットを短くする、別角度にする、影で隠すなどの演出で解決します。
動画生成のためのプロンプト設計
ショットリストを作る
動画生成の前に、ショットリストを作ります。各ショットに番号、長さ、目的、被写体、アクション、カメラ、照明、備考を書きます。目的を書くことで、不要なショットを削れます。たとえば「主人公が部屋に入る」という目的なら、ドアノブのアップは不要かもしれません。逆に緊張感を出したいなら、足音や手の動きを追加します。
ショットリストは、AIに一度に全部を任せるためではなく、人間が演出を整理するためにあります。生成結果が意図と違ったとき、どの要素を修正すべきかが明確になります。ショットリストなしで生成を始めると、後から素材が足りず、撮り直しのような追加生成が増えてしまいます。
カメラワークの語彙
カメラワークを指示する語彙を増やしましょう。パンは横振り、ティルトは縦振り、ドリーは前後移動、トラックは横移動、ズームは画角変更、オービットは被写体の周囲を回ります。ハンドヘルドは手ぶれ、ステディカムは滑らかな移動、クレーンは高所からの移動です。これらを組み合わせると、単調な映像に動きのリズムが生まれます。
ただし、AI動画では物理的に不可能なカメラワークを指定すると破綻しやすいです。壁を突き抜ける、瞬間移動する、レンズが急に切り替わるといった指示は避け、一ショット一動作を基本にします。カメラワークは編集でつなぐ前提で、短い単位に分ける方が成功しやすくなります。
物理的整合性とライティング
物理的整合性とは、物の重さ、慣性、衝突、液体の流れ、布の動きなどが不自然でないことです。AIはまだ完全に物理を理解しているわけではないため、プロンプトで「ゆっくり」「重そうに」「水しぶきが跳ねる」「布が風に流される」などと補足します。参照動画を渡すことも有効です。
ライティングは、カット間のつながりを左右します。同じシーンなら、光源の方向、色温度、影の柔らかさを揃えます。逆に時間経過を表すなら、朝の青い光から夕方のオレンジへ変えるなど、意図的に変化させます。プロンプトには「左からの柔らかい窓光」「夕方の逆光」「ネオンが反射する濡れた路面」のように、光源と質感をセットで書きます。
制御モデルとワークフロー
ポーズや深度を使った制御
ポーズ指定や深度マップを使うと、人物の姿勢や空間の奥行きをかなり正確に制御できます。棒人間のようなポーズ画像を用意し、それに合わせてキャラクターを生成します。深度マップは、前景と背景の距離をAIに伝えるため、背景の崩れを減らせます。線画を使えば、建物や小物の輪郭を保ちやすくなります。
これらを組み合わせる順番も重要です。まず構図とポーズを制御し、次にキャラクターの一貫性を参照画像で補い、最後にスタイルを調整します。一度にすべてを指定すると、どれかの重みが強くなりすぎて別の要素が崩れます。段階的に生成し、各段階で確認します。
インペイントとアウトペイント
インペイントは、画像の一部だけを描き直す技術です。手や顔、小物、背景の一部を修正したいときに使います。アウトペイントは、画像の外側を拡張する技術で、画角を広げたり、別のショット用に背景を追加したりできます。動画では、フレームの端が切れている場合や、パンした先の景色が必要な場合に役立ちます。
インペイントでは、マスクの範囲を広げすぎないことがコツです。必要最小限の範囲を指定し、元の画像の光や質感をプロンプトで補足します。アウトペイントでは、元画像の消失点やライティングを維持するように指示します。継ぎ目が目立つ場合は、境界をぼかしてから再生成します。
アップスケールとフレーム補間
生成した動画は、そのままでは解像度が足りないことがあります。アップスケールを使って高解像度化し、ディテールを補います。ただし過度なアップスケールは、不自然な質感や偽のディテールを生むことがあります。元の解像度、用途、配信先に合わせて、適切な倍率を選びます。
フレーム補間は、フレーム数を増やして動きを滑らかにする技術です。しかし元の動きが不自然な場合、補間しても違和感は消えません。まず生成段階で動きを改善し、補間は最後の仕上げとして使います。補間の強さを上げすぎると、動きがヌルヌルしすぎて、映像のリズムが失われることがあります。
モデル選択の判断基準
静止画向けモデル
静止画向けモデルは、ディテール、質感、画風の再現に優れています。Midjourney は芸術的なルック、Stable Diffusion は細かな制御、Flux はプロンプト追従と文字表現に強みがあります。用途に応じて、ラフ出し、本番用、背景用、小物用と使い分けます。
選ぶときは、プロンプトの長さ、参照画像の扱い、ライセンス、料金、生成速度を比較します。高品質なモデルが常に正解とは限りません。試作段階では速いモデル、最終段階では高品質なモデルを使うなど、工程ごとに切り替えると効率的です。
動画向けモデル
動画向けモデルは、一貫性、動きの自然さ、カメラ制御、長さの対応範囲が異なります。Runway はカメラ制御と編集機能、Sora は長尺の物理表現、Kling は人物の動き、Pika は短尺のスタイル表現に特徴があります。ただし機能は頻繁に更新されるため、固定観念で選ばず、実際のテスト生成で比較します。
比較するときは、同じプロンプト、同じ参照画像、同じ長さで試します。見るべき点は、顔の安定、手の形、背景の連続性、カメラの滑らかさ、テキストの再現、生成時間です。結果を表にまとめ、プロジェクトごとの優先順位に合わせて選びます。
スタイル特化モデル
スタイル特化モデルは、アニメ、線画、水彩、油絵、3D、商品写真など、特定の表現に強みがあります。汎用モデルでスタイルを指定するよりも、特化モデルを使った方が安定することがあります。ただし特化モデルは、他のスタイルに切り替えにくい場合があります。
複数のモデルを混在させると、世界観が崩れることがあります。同じプロジェクトでは二つから三つまでに絞り、色、線、光の質感を揃えます。どうしても混ぜる場合は、スタイル参照画像を使い、共通のトーンを指定します。
実践ワークフロー:短編映像を作る
企画と絵コンテ
まず三十秒から六十秒の短編を想定し、一行のログラインを書きます。次に、三幕構成で始まり、展開、結末を整理します。絵コンテは簡単な棒人間で構いません。各コマに、誰が、どこで、何をし、カメラがどう動くかを書きます。この段階で、AIに任せる部分と人間が決める部分を分けます。
絵コンテがあると、プロンプトの粒度が揃います。カットごとに目的が明確になり、生成結果を評価しやすくなります。また、後からショットを追加するときも、全体の流れに合っているかを判断できます。
アセット生成
主人公、脇役、背景、小物、衣装、色パレットを先に生成します。キャラクターは複数角度、背景は複数方向、小物はアップと全体を用意します。これらをアセットライブラリとして整理し、ファイル名に役割とバージョンを付けます。
アセット生成の段階で、ライティングと色温度を決めておきます。昼、夕方、夜、室内、屋外など、シーンごとのプリセットを作ります。後からショット生成するときに、このプリセットをプロンプトに含めることで、カット間の統一感が増します。
ショット生成
ショットリストに沿って、一通りのカットを生成します。最初から完璧を目指さず、ラフを大量に出し、使えるものを選びます。選んだカットは、解像度、長さ、動きの方向、前後のつながりを確認します。必要なら、開始フレームや終了フレームを別途生成し、動画生成の条件に渡します。
生成中は、同じプロンプトでも毎回結果が変わることを前提にします。良かった結果の条件を記録し、似た条件で再生成します。一つのカットに時間をかけすぎず、全体のバランスを見ながら進めます。
編集と仕上げ
動画編集ソフトでカットをつなぎ、テンポを調整します。不要なフレームを削り、トランジションをかけ、音楽と効果音を追加します。色調整では、カット間のホワイトバランスとコントラストを揃えます。必要なら、ノイズ除去、手ぶれ補正、フレーム補間、アップスケールを行います。
仕上げでは、視聴環境を変えて確認します。スマートフォン、パソコン、ヘッドホン、スピーカーで見ると、問題点が変わります。字幕やテロップを入れる場合は、安全領域を意識し、読みやすさを優先します。
よくある失敗とトラブルシューティング
キャラクターが変わる
キャラクターが変わる原因は、参照画像の不足、プロンプトの記述揺れ、モデルの切り替え、シードの変更などです。対策として、キャラクター記述テンプレートを作り、毎回同じ語順で使い、参照画像を固定し、モデルとシードを記録します。それでも崩れる場合は、カットを短くするか、顔が見えない構図に変更します。
動きが不自然
動きが不自然になる原因は、動作指示が多すぎる、時間が長すぎる、物理条件が曖昧、参照動画が不適切などです。対策として、一ショット一動作に絞り、動作を開始、中間、終了に分け、速度や重さを言葉で補います。必要なら、参照動画を短くし、動きの方向を明確にします。
スタイルが崩れる
スタイルが崩れる原因は、スタイル記述の混在、参照画像のトーン不一致、モデル間の画風差です。対策として、色パレット、光の質、線の太さ、質感を言語化し、共通のスタイル参照画像を使います。複数モデルを使う場合は、ポストプロセスで色とコントラストを揃えます。
コストと時間が膨らむ
生成を繰り返すと、時間と料金が膨らみます。対策として、低解像度で構図を決め、採用したカットだけ高解像度化します。プロンプトのテンプレート化、アセットの再利用、ショットリストの事前整理も有効です。失敗した生成から学び、条件を記録して無駄な試行を減らします。
FAQ
プロンプトは長い方が良い?
長ければ良いわけではありません。重要なのは、被写体、スタイル、構図、動き、カメラ、照明の情報が抜けずに整理されていることです。長すぎるプロンプトは、AIが優先順位を誤ることがあります。まずは短く書き、足りない情報を追加する方が安定します。
参照画像は何枚必要?
用途によりますが、キャラクターなら正面と全身の二枚から始め、必要に応じて横顔や表情を追加します。背景なら一枚から二枚、スタイルなら一枚で十分なことが多いです。枚数を増やすより、役割を分けて整理する方が効果的です。
画像生成AIと動画生成AIは同じプロンプト?
基本構造は似ていますが、動画では時間軸、動き、カメラワークの指定が加わります。静止画用のプロンプトをそのまま使うと、動きが足りないことがあります。逆に動画用の長い指示を静止画に使うと、構図が散らかることがあります。用途に応じて調整しましょう。
無料ツールだけでもできる?
無料ツールでも短いカットや静止画は作れます。ただし、商用利用の条件、生成回数の制限、解像度、透かしの有無を確認する必要があります。有料ツールと組み合わせる場合は、どの工程を有料にするかを決め、費用対効果を測ります。
著作権や商用利用は?
生成物の権利は、ツールの利用規約、学習データ、入力画像の権利によって変わります。商用利用する場合は、規約を確認し、必要なら専門家に相談します。実在人物、ブランド、キャラクターに似せた生成は、法的リスクがあるため避けましょう。
まとめ:プロンプトは演出設計である
次世代のAI生成では、プロンプトは単なる言葉遊びではなく、映像演出の設計図です。一貫性、制御性、物語性を意識し、被写体、スタイル、構図、動き、カメラ、照明を構造化して書くことで、静止画から動画まで安定した結果を得やすくなります。
大切なのは、ツールの名前を覚えることではなく、仕事の流れを組み立てることです。企画、絵コンテ、アセット生成、ショット生成、編集、仕上げという工程を分け、各工程で何を決め、何をAIに任せるかを明確にします。失敗を記録し、条件をテンプレート化し、少しずつ自分の表現に近づけていきましょう。
プロンプト設計は、一度覚えれば画像生成にも動画生成にも応用できます。目の前の一枚を美しくするだけでなく、その先の物語まで見据えて、プロンプトを書いてみてください。



