Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI動画生成プロンプト設計ガイド:構図・動き・一貫性を言語化して品質を上げる

Oct 5, 2026

AI動画生成でプロンプトが成果を分ける理由

生成AIによる動画制作は、実験的なデモの段階を越え、広告、SNS、教育、社内コミュニケーションといった実務の現場に入り込んでいます。短尺のクリップ、縦型のSNS動画、商品紹介、研修素材など、用途は急速に広がりました。ところが、同じツールを使っているのに、出力される映像の完成度には大きな差が出ます。その差を生む最大の要因が、プロンプトの設計力です。

プロンプトは単なる注文書ではありません。モデルに対して、何を主題にし、どの瞬間を切り取り、どんな光で照らし、どのレンズで捉えるかを伝える設計図です。曖昧な指示は、判断をモデルに丸投げする行為に近くなります。モデルは学習データの平均的な解を返すため、結果は「悪くはないが記憶に残らない映像」に落ち着きがちです。

逆に、構図、動き、光、質感、時間の流れを具体的に言語化できれば、出力は制作者の意図に近づきます。ただし、長く書けば良いわけではありません。要素を整理し、優先順位をつけ、モデルが解釈しやすい順序で並べる必要があります。

もう一つ覚えておきたいのは、プロンプト設計は一発で完成しないという前提です。映像生成は確率的な処理であり、同じ入力でも結果が完全には一致しません。したがって、最初の一本で判断を下すのではなく、条件を少しずつ変えながら、狙った表現に近づけていく反復の設計が重要になります。本記事では、初めて本格的に取り組む人でも再現できるように、考え方から検証の回し方、具体的なワークフローまでを順を追って解説します。

モデルの特性を理解して使い分ける

プロンプトを書く前に、使うモデルの性格を把握しておくことが近道です。どのモデルも得意不得意がはっきりしており、苦手な領域を無理に押し込むと、どれだけ指示を丁寧に書いても破綻します。

入力方式の違いを把握する

現在の動画生成は、大きく四つの入力方式に分かれます。テキストだけで生成する方式、一枚の画像を起点に動かす方式、既存の動画を変換する方式、そして参照画像とテキストを組み合わせる方式です。テキストのみの生成は自由度が高い一方で、構図の制御は緩くなります。画像を起点にすると構図や人物の見た目を固定しやすく、シリーズ制作では圧倒的に有利です。

実務では、最初と最後のフレームを指定できる方式が重宝します。カットのつなぎを設計しやすく、編集工程での違和感を減らせるからです。

得意分野の違いを見極める

モデルごとの差が最も出るのは、質感の再現力と動きの自然さです。フォトリアルな肌、布の織り目、金属の反射といったディテールに強いモデルは、静的な美しさを求めるカットに向いています。一方、歩行、振り向き、手の動きといった身体の動きや、カメラの移動を正確に再現するモデルは、アクションや移動を伴うカットに適しています。

液体の挙動、煙、布のはためきといった物理表現は、モデルによって得意不得意が大きく分かれます。商品の注ぎ口から液体が落ちるカットを何度も破綻させた経験があるなら、それはプロンプトの問題ではなく、モデル選択の問題かもしれません。

制約条件を先に確認する

見落としがちなのが、尺、解像度、フレームレート、プロンプトの文字数上限、参照画像の枚数制限といった仕様です。たとえば十秒を超える長回しを一枚のプロンプトで指示すると、後半で被写体が変質しやすくなります。こうした場合は、短いカットに分割し、つなぎ合わせる前提で設計したほうが結果が安定します。制約は制限ではなく、設計の前提条件として扱いましょう。

高品質プロンプトを支える構成要素

良いプロンプトには共通する骨格があります。ここでは七つの要素に分けて整理します。すべてを毎回書く必要はありませんが、どれを省略したのかを自覚することが重要です。

主題とアクション

最初に決めるのは、誰が、何をしているかです。主題は具体的な名詞で指定します。アクションは一つの動詞に絞り、進行形で書くと動きが伝わりやすくなります。複数の動作を詰め込むと、モデルはどれかを省略したり、不自然に混ぜ合わせたりします。

環境と時間帯

場所、天候、時間帯、季節、周囲の要素を指定します。屋内なのか屋外なのか、混雑しているのか無人なのかで、映像の印象は大きく変わります。時間帯は光の色 temperature に直結するため、省略すると意図しない雰囲気になりがちです。

ライティング

光源の種類と方向を書きます。窓からの自然光、逆光のリムライト、柔らかいソフトボックス、夜のネオン、朝もやの中の拡散光など、光の設計は感情の設計でもあります。硬い光は緊張感を、柔らかい光は安心感を生みます。

カメラとレンズ

カメラの動き、アングル、レンズの焦点距離、被写界深度を指定します。これについては次の章で詳しく扱いますが、動きの指示は一つに絞るのが原則です。

スタイルと質感

フィルムルック、ドキュメンタリー風、アニメ調、ミニチュア風など、映像全体のトーンを決めます。色調、コントラスト、粒子感、シャープネスもこの項目に含まれます。

構図のヒント

三分割法、対称構図、ローアングル、俯瞰、前景にボケた要素を置くなど、画面の組み立て方を指示します。モデルは構図の用語をある程度理解するため、短い語句でも効果があります。

除外指定

避けたい要素を明示します。余計な人物、文字の混入、指の本数の破綻、過剰なスローモーション、彩度の高すぎる色などです。除外指定は万能ではありませんが、書いておくことで破綻の頻度を下げられます。

構造化プロンプトの実践テンプレート

要素を頭の中で組み立てるのが苦手な場合は、テンプレート化してしまうのが最も確実です。以下は、筆者が日常的に使っている並び順です。

主題:一人のバリスタが手元に集中している
アクション:湯を細く注ぎながら、ゆっくり円を描いている
環境:朝の静かなカフェ、窓際のカウンター、湯気が立っている
光:窓から差し込む低い自然光、逆光気味のリムライト
カメラ:固定、被写体の手元をとらえる、わずかに上方から
レンズ:八十五ミリ相当、浅い被写界深度
スタイル:フィルムルック、落ち着いた色調、微細な粒子感
除外:文字、ロゴ、余計な人物、急なカメラ移動

この順序には理由があります。まず主題と動作でモデルの注意を固定し、環境と光で空間を成立させ、最後にカメラとスタイルで演出を整えます。除外指定は末尾に置くと、他の要素の解釈を邪魔しにくくなります。

悪い例と良い例を並べると差が明確になります。「カフェでコーヒーを淹れている様子をかっこよく」という指示は、かっこよさの定義をモデルに委ねています。一方、上記のテンプレートは、かっこよさを構成する具体的な要素に分解されています。プロンプト設計とは、抽象語を具体語に翻訳する作業だと言い換えられます。

テンプレートはあくまで出発点です。慣れてきたら、要素の順序を入れ替えて反応を観察すると、そのモデル固有の癖が見えてきます。

カメラワークとシネマティック表現の書き方

映像の説得力を左右するのがカメラの扱いです。用語を正確に使えるようになると、出力の安定度が一段上がります。

基本のカメラムーブメント

固定は最も安定し、商品や人物の表情を見せたいときに向きます。パンは水平方向の振り、チルトは垂直方向の振りです。ドリーはカメラ自体が前後に移動する動きで、ズームとは意味が異なります。ズームは画角が変わり、ドリーは被写体との距離感が変わります。この違いを混同すると、意図した臨場感が得られません。

トラッキングは被写体を追従する動き、オービットは被写体の周囲を回る動き、クレーンは上下に大きく移動する動きです。ハンドヘルドは手持ちの揺れを加え、緊張感やドキュメンタリー的な生々しさを出します。

一度に一つの動きだけを指示する

複雑な動きを一文に詰め込むと、モデルは動きを平均化してしまいます。「ゆっくりと前進しながら左に回り込み、途中で被写体にピントを合わせる」といった指示は、多くの場合どれも中途半端になります。カットを分けて設計するほうが、結果的に編集で自然につながります。

レンズと被写界深度の使い分け

焦点距離は画面の印象を決めます。広角は空間の広がりと大胆なパースを生み、標準域は自然な見え方になります。中望遠は人物を美しく圧縮し、背景を整理します。被写界深度を浅くすると主題が際立ち、深くすると周囲の情報量が増えます。商品の質感を見せたいなら浅く、空間全体を見せたいなら深くするのが定石です。

光と時間を演出に組み込む

ゴールデンアワーの低い光、曇天の柔らかい拡散光、夜のネオンと反射、逆光のシルエット。光の記述は、そのまま感情の記述になります。また、スローモーションやタイムラプスは時間の質を変える演出です。スローモーションは一瞬を強調し、タイムラプスは変化の過程を圧縮します。どちらも乱用すると単調になるため、見せ場に絞って使いましょう。

キャラクターとシーンの一貫性を保つ設計

複数カットで構成される動画では、一貫性が最大の課題になります。顔立ち、髪型、衣装、小物、体格、年齢感がカットごとに変わると、視聴者は無意識に違和感を覚え、物語への没入が途切れます。

キャラクターシートを作る

最初にやるべきは、確定させる属性のリスト化です。髪の長さと色、瞳の色、肌のトーン、衣装の素材と色、アクセサリーの位置、体格、年齢感、表情の癖。これらを文章として固定し、すべてのカットのプロンプトに同じ表現で貼り付けます。表現を言い換えると、モデルは別の人物として解釈することがあります。

参照画像を起点にする

テキストだけでは人物の同一性を維持しにくいため、参照画像の活用が有効です。正面、斜め、横、後ろの四方向を用意し、表情のバリエーションも数枚あると安心です。参照画像は枚数が増えれば良いというものではなく、解像度、明るさ、背景の統一感が重要です。背景がばらばらだと、モデルが背景まで引き継いでしまうことがあります。

カット間のつなぎを設計する

一貫性は映像の内部だけでなく、カットのつなぎ方でも生まれます。同一のシーンでは、同じ光の方向、同じ色調、同じ時間帯を維持します。逆に、場所や時間が変わるカットでは、意図的に色や構図を変えて切り替えを明示すると、視聴者は混乱しません。

具体的には、ショットリストを作成し、各カットの目的、尺、カメラ、光、登場人物の状態を表にまとめます。撮影用語で言えば、絵コンテと撮影台本を兼ねたものです。この表があると、生成の順序を入れ替えても一貫性を保ちやすくなります。

抽象的アイデアを映像化する具体化テクニック

企画書に書かれた「信頼感」「不安」「希望」といった言葉は、そのままでは映像になりません。これらを身体の動き、光、構図、小道具に翻訳する作業が必要です。

感情を身体表現に置き換える

不安は、速足の歩調、絶え間なく動く指先、落ち着かない視線、肩の上がった姿勢として表せます。自信は、まっすぐな背筋、ゆっくりした歩調、カメラをまっすぐ見る視線、安定したフレーミングで表現できます。喜びは、弾むような動作、開いた肩、上向きの視線、明るい色調が組み合わさります。

つまり、感情語を書くのではなく、その感情が現れる身体のサインを書くのです。これは演技指導の言語に近い考え方です。

雰囲気を光と色に置き換える

懐かしさは、暖色寄りの低コントラスト、柔らかい粒子感、わずかなハレーションで表せます。緊張感は、硬い光源、強いコントラスト、彩度を抑えた寒色、浅い被写界深度が効果的です。静けさは、均質な拡散光、広い空間、動きの少ない固定カメラで表現できます。

テーマを象徴するオブジェクトを探す

抽象的なテーマは、モチーフとなる物体に託すと伝わりやすくなります。成長なら芽や登る階段、別れなら閉じる扉や去っていく背中、継続なら同じ動作の反復です。象徴を詰め込みすぎると説明的になるため、一本の動画につき一つか二つに絞るのが上品です。

曖昧な比喩表現は避けましょう。「時間が溶けていくような」といった言葉は、モデルにとって解釈不能です。「時計の針がゆっくり回り、背景の光が朝から夕方へ移り変わる」と書けば、意図が映像として成立します。

出力品質を評価し改善する反復サイクル

生成した映像を眺めて「なんとなく違う」と感じたとき、その感覚を言語化できるかどうかが上達の分かれ目です。評価軸をあらかじめ決めておくと、修正の方向が見えます。

五つの評価軸

第一に構図。主題が目立っているか、余計な要素が入っていないか。第二に動き。人体や物体の動きが自然か、破綻していないか。第三に一貫性。前後のカットと人物や色がつながっているか。第四に質感。解像感、ノイズ、不自然なディテールがないか。第五にタイミング。動作の開始と終了が尺に収まっているか。

この五軸で採点すると、修正すべき箇所が明確になります。たとえば構図は良好だが動きが破綻しているなら、カメラの指示を増やすのではなく、動作を単純化する方向で修正します。

一度に一つの変数だけを変える

改善の基本は、比較の条件を揃えることです。光の表現とカメラの動きを同時に変えると、どちらが効いたのか分からなくなります。一つの要素だけを変え、他は固定して生成し、差分を観察します。

記録を残す

プロンプト、使用したモデル、参照画像の有無、生成回数、結果の評価を簡単に記録します。文章にして残すと、次に似た案件が来たときに再利用できます。記録がないと、同じ試行錯誤を繰り返すことになります。

失敗を分類する

破綻のパターンは、おおむね数種類に集約されます。人物の変質、指や手足の異常、急なカメラ移動、彩度の暴走、テキストの混入、動作の途中停止。それぞれに対処法が異なります。人物の変質なら参照画像の追加、カメラの暴走なら動きの指示の削減、テキスト混入なら除外指定の追加といった具合です。失敗を分類しておけば、次回の初動が速くなります。

実践ワークフロー:十五秒の商品紹介動画を作る

ここまでの要素を、一本の短い動画制作に落とし込みます。題材は、素材にこだわった木製の文房具ブランドの紹介動画とします。

ステップ一:目的と尺を決める

最初に決めるのは、誰に何を伝え、どこで見せるかです。SNSの縦型フィードなら冒頭一秒で引きつける必要があり、最初のカットで商品の質感を見せるのが定石です。十五秒であれば、四から五カットが適量です。

ステップ二:ショットリストを作る

一、暗い机の上に置かれた木のペン、ゆっくり光が差す。二、手がペンを取る、指先のアップ。三、ペン先が紙に触れ、線が引かれる。四、書き終えた手元と、窓の外の木々。五、商品名と素材のテロップを載せた静止カット。この程度の粗さで構いません。

ステップ三:キーフレームを作る

各カットの代表的な静止画を先に生成します。ここで構図、光、色を確定させます。静止画の段階で納得いくまで調整すれば、動画生成の試行回数を大幅に減らせます。

ステップ四:動画化する

キーフレームを起点に、最小限の動きを与えます。カット一は光の移動のみ、カット二は指のわずかな動き、カット三はペン先の線が伸びる動きです。動きを一つに絞ると、破綻が減り、編集でのつなぎも滑らかになります。

ステップ五:つなぎと編集

生成したカットを並べ、テンポを調整します。カットの切り替えは、動作の勢いに乗せると自然に見えます。色調は全体で統一し、必要なら軽いグレーディングを施します。

ステップ六:音と字幕

無音の映像は情報量が半分になります。環境音、軽いBGM、ペンが紙に触れる音を重ねるだけで、説得力が大きく変わります。字幕は視線の流れを妨げない位置に置き、画面の三分の一以内に収めます。

よくある質問

プロンプトは長いほど良いのでしょうか

必ずしもそうではありません。重要なのは長さではなく、要素の網羅性と順序です。冗長な修飾語は解釈のノイズになります。まず七つの要素を簡潔に書き、結果を見て必要な情報を足す順序が効率的です。

同じプロンプトでも結果が変わるのはなぜですか

映像生成は確率的な処理であり、乱数の影響を受けます。完全な再現は難しく、複数回生成して良い結果を選ぶ運用が現実的です。ただし条件を細かく指定するほど、結果のばらつきは小さくなります。

人物の顔が毎回変わってしまいます

参照画像の追加が最も効果的です。あわせて、髪型、瞳の色、衣装、年齢感の記述を短い定型文として固定し、すべてのカットで同一の表現を使います。参照画像は背景が統一されているものを選びましょう。

カメラが勝手に動いてしまいます

動きの指示が複数入っている可能性があります。固定にしたいカットでは、動きの記述を削除し、固定という語を明示します。また、動作の指示が激しいとカメラも追随して動くため、動作自体を落ち着かせるのも有効です。

文字やロゴが勝手に入ります

除外指定に文字、ロゴ、ウォーターマークを加えます。それでも消えない場合は、構図を変えて看板やポスターが映り込まないアングルにします。

静止画から動画にする場合と、テキストだけで生成する場合、どちらが良いですか

構図と人物を固定したいなら静止画起点が有利です。一方、思いつきのアイデアを素早く試したいならテキストのみが向いています。実務では、探索はテキスト、本番は静止画起点という使い分けが現実的です。

どのくらいの回数を生成すれば良いですか

尺や複雑さによりますが、一カットにつき三から六回を目安にし、その中から最良を選ぶ運用が一般的です。評価軸を決めずに大量生成すると、選定に時間を取られ、かえって効率が落ちます。

チームで制作するときの注意点は何ですか

プロンプトの表記ゆれが最大の敵です。用語集とキャラクターシートを共有し、表現を統一します。あわせて、生成物の命名規則と保管場所を決めておくと、後工程での混乱を防げます。

まとめ

AI動画生成の品質は、ツールの性能だけで決まるものではありません。主題と動作を明確にし、環境と光を設計し、カメラとレンズを一つに絞り、スタイルと除外指定で輪郭を整える。この基本の積み重ねが、印象に残る映像を生みます。

そして、一貫性の設計と反復検証の仕組みを用意することが、単発の成功を継続的な制作力に変える鍵です。プロンプトは毎回ゼロから書くものではなく、資産として育てていくものです。記録を残し、失敗を分類し、テンプレートを更新し続ければ、同じ労力でも成果は着実に上がっていきます。まずは十五秒の短い動画から、この流れを一通り試してみてください。

Alexander

Alexander