AIによる動画生成は、ここ数年で爆発的に進化しました。かつては静止画が中心だった生成AIの世界に、OpenAIのSoraシリーズやKlingシリーズといったモデルが登場し、テキストから高品質で物語性のある動画を直接作り出せる時代になりました。しかし、ツールが高性能になるほど、その能力を引き出す「プロンプト」の質が結果を大きく左右します。同じツールを使っても、出力される動画の質が人によってまったく違うのは、プロンプトの書き方の違いです。本記事では、動画生成のためのプロンプトエンジニアリングを基礎から解説し、すぐに使える実践テクニックを紹介します。
動画生成モデルの特性を理解する
魅せる動画を作る第一歩は、使うモデルの特性と限界を深く理解することです。現在の市場には、写真のようにリアルな映像を得意とするFluxシリーズ、アニメやマルチモーダル表現に強いVidu Q1、長尺で物語性のある映像を得意とするOpenAI Soraなど、さまざまなタイプのモデルが存在します。さらにRunway Genシリーズは写実的なモーションと映画的なライティングに定評があり、Klingはキャラクターの表情や指示への忠実さで知られています。
モデルごとに得意分野が違うため、「何を作りたいか」に合わせてモデルを選ぶのが基本です。リアルな人物が必要なら顔の描写に強いモデル、アクションシーンなら動きの安定性に優れたモデル、アニメ調ならそのスタイルで学習されたモデルを選びます。多くのプラットフォームではモデルごとのギャラリーが用意されているので、プロンプトを書く前に作例を見て期待値を合わせるのがおすすめです。プロンプト以前にモデル選択を間違えると、どれだけ丁寧に書いても望む結果は得られません。
構造化プロンプトの基本
魅せる動画の生成は、曖昧な指示では実現しません。プロンプトエンジニアリングの中核は「構造化プロンプティング」です。これは、映像の要素を明確なセクションに分け、AIへの指示を論理的かつ階層的に整理する手法です。具体的には、主要な被写体、背景設定、感情や雰囲気、そして技術的指示を区別して記述します。
たとえば「夕暮れの街を歩く人物」という一文だけでは、モデルは時間帯、カメラの位置、動きの速さ、画角などをすべて自分で決めてしまいます。結果は運任せになります。一方で「被写体: 黄色いレインコートを着た老灯台守。動作: 崖沿いをゆっくり歩き、海の彼方を眺めて立ち止まる。環境: 夕暮れの石畳の小道、湿った路面が暖かい窓明かりを反射。照明: 背光、金色の時間帯。カメラ: ローアングルの追従ショット、浅い被写界深度。スタイル: ノワール調、アンバーとスレートのパレット」のように構造化すると、モデルは指示に従いやすくなり、結果の再現性も高まります。
映画制作の専門用語を使いこなす
魅せる動画は、映画制作の専門用語をプロンプトに組み込むことでクオリティが飛躍的に向上します。カメラワークでは「ローアングル」「ダッチアングル」「クローズアップ」「トラッキングショット」、照明では「レンブラントライティング」「リムライト」「自然光」「キャンドルライト」、レンズ効果では「ボケ味」「アナモルフィックレンズ」「広角の歪み」といった用語が、AIに対する最も具体的で強力な指示になります。
これらの用語は、モデルの学習データに大量に含まれているため、比喩的な表現よりも正確に伝わります。「神秘的で暗い雰囲気」と書くよりも「窓から差し込む一筋の光の中に埃が舞う」と書く方が、モデルは具体的な映像を構築しやすいのです。動画の場合は特に、動きそのものを描写する必要があります。「ゆっくりとした、意図的な歩み」と「慌てた、よろめく歩き」では、生成される演技がまったく異なります。風に揺れる髪、ブーツが蹴り上げる砂埃、はためくコートといった二次的な動きも忘れずに記述しましょう。
カメラワークと時間軸の指定
動画と静止画の最大の違いは、時間とカメラの動きです。優れた動画プロンプトは、ショットの種類とカメラの動き、そして時間の経過を明示します。カメラが静止しているのか、ハンドヘルドでわずかに揺れているのか、ドリーでゆっくり前進するのか、これらの選択は観客の感情を左右します。
時間軸の指定も重要です。シーンをフェーズに分けて記述すると、モデルは順序を追いやすくなります。「まず人物が部屋に入り、次にカメラが玉座を一周し、最後に光が消えて火の明かりだけが残る」のように「まず…次に…最後に…」という構造を使うと、長いシーケンスでも一貫性を保ちやすくなります。モデルの時間理解能力が高いほど、時間の変化を記述することの効果は大きくなります。
照明と雰囲気の作り込み
映像の雰囲気を決める最大の要素は照明です。照明の方向、質感、色を指定することで、同じ被写体でもまったく違う印象になります。夕日、ネオン、ろうそくの灯り、曇天の柔らかな光、ハードな影、これらはすべて具体的な視覚結果に直結します。
パレットの指定も効果的です。「彩度を抑えたブルーとグリーン、錆色のアクセント」「モノクロのセピアに血のような赤のディテール」のように、具体的な色の範囲を示すと、シーン間の一貫性が保たれます。ダークファンタジーのような特定のジャンルでは、明るすぎる出力を避けるため、「深い影」「選択的な光源」「地面近くの濃い霧」といった記述を積極的に加えましょう。
キャラクターの一貫性を保つ
AI動画の最大の技術的課題は、キャラクターの一貫性です。ショットごとに顔や服装が変わってしまうと、物語として成立しません。最も効果的な方法は、キャラクターを「説明文」ではなく「制作アセット」として扱うことです。
まずキャラクターのポートレート画像を1枚生成し、顔、服装、照明を固定します。その画像を参照用として以降の生成に渡し、テキストによる詳細な説明と組み合わせます。多くのプラットフォームは画像から動画への変換や、複数の参照画像を融合する機能をサポートしており、これを使うとシーン全体にわたってキャラクターを安定させられます。さらに「キャラクターシート」と呼ぶ固定の説明文を一度作成し、すべてのショットで同じ文言を使い回します。言葉を少し変えるだけでモデルの解釈が変わることがあるため、記憶で書き直すのではなく必ずコピー&ペーストするのがコツです。
マルチステップ生成とプロンプト連携
複雑な映像を作る場合は、1本のプロンプトで全部を生成しようとせず、複数ステップに分けるのが賢明です。まず静止画で構図とキャラクターを確定し、次にそれを動画化し、最後に細部を調整する。このアプローチは、1ステップあたりの指示がシンプルになるため、失敗が減り、修正も容易になります。
プロジェクト全体で同じスタイルを維持するには、スタイルロックを設定しましょう。色のパレット、照明の言語、レンズの選択を文書化し、すべての生成に同じ制約を適用します。シーンが複数ある場合は、ショットリストを先に作成し、各ショットの被写体、フレーミング、カメラの動き、照明、尺を定義します。この計画を先に立てることで、生成結果が寄せ集めのクリップではなく、意図的に編集された映像作品になります。
実践テンプレート集
すぐに使える基本テンプレートを紹介します。各項目に自分のアイデアを入れるだけです。
- 被写体: 特徴的な外見を持つ人物や物
- 動作: どのように動くか、動きの質感
- 環境: 場所、時間帯、天候
- 照明: 光の方向、質感、色
- カメラ: ショットサイズ、角度、動き、レンズ感
- スタイル: ジャンル、パレット、作風の参照
- 時間: シーンの始まりから終わりまでの変化
- 否定的指示: 避けたい要素
記入例:「被写体: ヴィンテージ自転車の配達員、ワックスキャンバスのジャケットに革のサッチェル。動作: 交通の中を一定のペースで走り、時折後ろを振り返る。環境: 雨に濡れた夕暮れの街路、ショップの灯りがともり始める。照明: 暖かなナトリウム灯と冷たい藍色の夕暮れ。カメラ: ローアングルのトラッキングショット、やや広角、浅い被写界深度。スタイル: ムーディーなヨーロピアンノワール、アンバーとスレートのパレット。時間: カメラが自転車のペースを保ち、角を曲がるにつれてゆっくりと減速する。否定的指示: 文字なし、ウォーターマークなし、現代の車なし」。
よくある失敗と改善策
最初の失敗は曖昧さです。「きれいな映像を作って」ではモデルに何も伝わりません。価値判断を具体的な描写に置き換えましょう。きれいとは、具体的にどのような光、どのような色、どのような構図なのか。
二つ目の失敗はプロンプトの過負荷です。複数の競合する指示を1本に詰め込むと、モデルは混乱します。複雑なシーンはショットごとに分割し、1回の生成につき1つのアイデアに集中させます。
三つ目の失敗は否定的指示の欠如です。「文字なし」「ウォーターマークなし」「手の崩れなし」といった否定的指示を活用すると、よくあるアーティファクトを防げます。
四つ目の失敗は、一度の失敗でプロンプトを放棄することです。プロンプトは反復です。一度に1つの変数だけを変更し、試した内容をログに残し、結果を並べて比較しましょう。プロとアマチュアの違いは、才能よりも体系的な改善プロセスにあることがほとんどです。
FAQ
プロンプトはどのくらいの長さが適切ですか? 必要な要素をカバーしつつ、一貫性を保てる長さが理想です。多くの場合、2〜5文が適切で、それ以上長くするとモデルが指示の一部を無視することがあります。
常に最新のモデルを使うべきですか? いいえ。最新モデルがすべてのタスクに最適とは限りません。ショットの要求に合わせてモデルを選びましょう。
キャラクターがショットごとに変わってしまうのはなぜですか? 説明が一貫していないか、参照画像がないことが原因です。キャラクターシートを固定し、参照フレームを使い、文言を統一しましょう。
画像用プロンプトと動画用プロンプトの違いは何ですか? 動画では動き、カメラの移動、時間の変化の記述が必須です。優れた画像プロンプトは優れた動画プロンプトの半分にすぎません。
上達の近道はありますか? すべての生成を実験として扱い、プロンプトログを付け、何が機能したかを記録しましょう。意図的な反復を重ねると、スキルは急速に蓄積されます。
プロンプトエンジニアリングは特別な才能ではなく、学べる技術です。基本構造を理解し、モデルの特性を把握し、一貫性を保つ仕組みを作れば、AI動画生成は偶然に頼る作業から、意図を正確に映像化する制作プロセスへと変わります。まずは1本のテンプレートから始めて、少しずつ自分の言葉と経験を積み重ねていきましょう。




