Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

プロンプトエンジニアリング入門:AI画像・動画生成で理想の結果を引き出す記述設計の実践ガイドと応用テクニック

Sep 21, 2026

プロンプトは「命令」ではなく「質問」である

AI画像生成やAI動画生成に取り組むとき、最初にぶつかる壁は「思った通りの映像が出ない」という問題です。同じモデルを同じ題材で使っているのに、隣の人の出力だけが妙に完成度が高い。その差の多くは、モデルの性能差ではなく、入力するテキストの設計品質から生まれます。プロンプトエンジニアリングとは、特別な呪文を覚えることではなく、自分の意図をモデルが解釈できる形に翻訳する作業です。

モデルは人間のように行間を読んでくれません。入力された単語同士の統計的な関係から、もっとも確からしい映像を組み立てているだけです。「美しい風景」と書けば、学習データに含まれる無数の風景の平均値のような絵が返ってきます。平均は安全ですが、印象には残りません。だからこそ、何を固定し、どこを自由にしてよいのかを明示する必要があります。

ここで有効になるのが「質問術」という考え方です。優れたインタビュアーは、相手が答えやすいように問いを小さく分解します。同じようにプロンプトも、「被写体は何か」「どこにいるのか」「どんな光か」「どの瞬間か」と問いを分けて書いていくと、モデルは迷わずに答えを返せるようになります。逆に、願望を詰め込んだ長い一文を投げ込むと、モデルは複数の解釈の間で揺れ、破綻した結果を出します。

この記事では、静止画と動画の両方を対象に、設計の基本原則から動画特有の時間設計、マルチモーダル入力の扱い、モデル選択の判断基準、失敗時の原因切り分け、チームでの運用までを順に整理します。読み終えるころには、勘と運に頼るのではなく、再現性のある手順として生成を進められるようになっているはずです。

基本原則:曖昧さを消し、具体性を最大化する

プロンプト設計の土台はシンプルです。曖昧な語を減らし、具体名詞を増やし、モデルが判断に迷う箇所をなくすこと。ここでは実際に手を動かすときに見直したい四つの原則を整理します。

主語と被写体を最初に固定する

文章の冒頭で「何を描くのか」を確定させます。ここが曖昧なままだと、後続の修飾語がすべて無駄になります。たとえば「雨上がりの路地に立つ、赤い傘を持った人物」と書き出せば、モデルは被写体・場所・小道具・天候を一気に把握できます。逆に「雰囲気のある雨の街」とだけ書くと、人物が入るかどうかすらモデルの気分次第になります。

被写体を固定したら、次に「状態」を足します。立ち姿なのか、歩いているのか、振り返っているのか。表情は笑っているのか、無表情なのか。状態を書くことで、静止画でも動画でも一貫した解釈が得られます。

形容詞より名詞と動詞で書く

「かっこいい」「エモい」「おしゃれ」は評価語であり、視覚情報ではありません。モデルは評価語を、学習データ上の流行表現に置き換えて処理します。結果として、どこかで見たような無難な絵が出てきます。

置き換えの基本は、形容詞を物理的な記述に変換することです。「かっこいい車」ではなく「低くワイドな車高、光沢のある黒い塗装、逆光で輪郭が光るクーペ」。「エモい夕暮れ」ではなく「雲の隙間から差し込む橙色の光、逆光のシルエット、人物は画面右三分の一」。「おしゃれな室内」ではなく「白い漆喰の壁、オーク材の床、大きな窓から入る午前の柔らかい光」。この変換を習慣にすると、出力の再現性が一段上がります。

数値で指定できるものは数値にする

「少し離れて」「かなり寄って」は解釈が揺れます。しかし「焦点距離85mm」「被写体まで2メートル」「画角の三分の二を占める」といった数値は、モデルにとって安定した手がかりになります。背景のぼけ量、光の角度、人物の位置、画面内の要素数も、可能な限り数字で表現しましょう。

数値指定は動画で特に効きます。「ゆっくり前進」よりも「2秒かけてゆっくり前進し、被写体の顔で停止」と書くほうが、意図した尺と動きに近づきます。

否定形ではなく肯定形で書く

「木が生えていない」「人が写っていない」という否定は、モデルが該当する要素を想起しやすくなるため、かえって意図しない要素を呼び込みます。砂漠を描きたいなら「乾いた砂礫の地面、影の少ない強い日差し」と肯定で書きましょう。否定を扱う欄が別途用意されているモデルでは、そちらにまとめて記述するのが安全です。

静止画プロンプトの設計手順

静止画は動画よりも検証が速く、プロンプト設計の練習台として最適です。ここでは構図、ライティング、レンズ、質感、そして改善の回し方を順に見ていきます。

構図を先に決める

構図は「どこに何を置くか」の設計です。最初に決めるべきはフレーミングです。全身、膝上、バストアップ、顔のアップ。次に画面内の配置で、被写体を中央に置くのか、三分割の交点に置くのか、あるいは端に寄せて余白を活かすのかを指定します。

見下ろし(ハイアングル)、見上げ(ローアングル)、水平(アイレベル)の選択も印象を大きく変えます。見上げは被写体を強く見せ、見下ろしは弱さや孤独感を出し、アイレベルは中立で親密な印象になります。

ライティングを具体的に書く

光は映像の感情を決めます。光源の種類(自然光、窓明かり、ネオン、ストロボ)、方向(逆光、斜光、真上から、正面から)、質(硬い、柔らかい、拡散)、色温度(暖色、寒色、混合)の四つを意識して書くと、意図が伝わりやすくなります。

たとえば「窓から差し込む午前の柔らかい自然光、被写体の右側を照らし、左側に薄い影を落とす」と書けば、人物の立体感が安定します。逆に「明るく」だけでは、モデルは平面的な正面光を選びがちです。

レンズとフィルム表現を活用する

焦点距離の指定は、遠近感と圧縮効果をコントロールします。広角(24mm前後)は空間を広く見せ、被写体の周囲の環境を強調します。標準(50mm前後)は自然な見え方で、ドキュメンタリー的な説得力があります。中望遠(85mmから135mm)は背景を圧縮してぼかし、人物を際立たせます。

フィルム表現も有効です。粒子感の強いモノクロ、色収差の少ないクリアなデジタル、浅い被写界深度による玉ぼけ。これらはスタイルの一貫性を保つための共通言語になります。

素材と質感を名指しする

「布」ではなく「洗いざらしのリネン」、「金属」ではなく「ヘアライン加工のステンレス」。素材を名指しすると、モデルは表面の反射や細部の描写を切り替えます。肌、髪、ガラス、水、土、紙など、画面に登場する主要な素材を二つから三つ書き出しておくと、全体の質感が揃います。

反復改善は一度に一要素だけ変える

生成結果が意図と違うとき、プロンプトを丸ごと書き換えたくなりますが、それは原因の切り分けを難しくします。まずは構図だけを変える、次に光だけを変える、というように一度に一要素だけ動かし、変更前後を並べて比較します。この手順を守るだけで、自分のプロンプトのどの語が効いているのかが把握できるようになります。

動画プロンプトの設計手順:時間軸を書く

動画生成は、静止画の設計に「時間」という軸を足したものです。ここが最も難しく、最も差がつく領域です。

テンポラル・コヒーレンス(時間的連続性)を確保する

動画モデルが苦手とするのは、フレーム間で被写体の形や色が少しずつ変化してしまう現象です。これを抑えるには、変化してよい要素と変わってはいけない要素を明示します。「人物の服装と髪型は全編を通して一定」といった制約を書き添えると、安定しやすくなります。

また、動きの量を増やしすぎると破綻が増えます。短い尺で一つの動作に絞るほうが、長い尺で複数の動作を詰め込むよりも成功率が高くなります。

カメラワークの語彙を使い分ける

カメラの動きは、感情の設計でもあります。

  • 固定(フィックス):落ち着き、観察、緊張感
  • パン(左右の首振り):空間の広がり、状況説明
  • ティルト(上下):被写体の全容、威圧感や畏怖
  • ドリー(前後の移動):没入、接近、距離の変化
  • トラッキング(並走):速度感、同行している感覚
  • オービット(周回):被写体の全周、英雄的な見せ方
  • ハンドヘルド(手持ち風):臨場感、ドキュメンタリー性

これらを組み合わせるときも、一度に二つまでに留めると破綻しにくくなります。

モーション量と尺の関係を意識する

尺が短いほど、一つの動作に集中できます。動きの開始と終了を明確に書くと、モデルは中間フレームを補間しやすくなります。「歩き始めから、二歩進んで立ち止まるまで」のように、始点と終点を具体的に指定しましょう。

逆に、長い尺で自然な動きを求める場合は、被写体の動きを小さくし、環境の動き(木々の揺れ、水面の反射、煙の流れ)で画面に生命感を足す方法が有効です。

シーンを分割してから繋ぐ

一つのプロンプトで長い物語を語ろうとすると、たいてい破綻します。カットごとに分け、それぞれに「被写体」「動作」「カメラ」「光」を書きます。そのうえで、前後のカットで色温度やレンズ感を揃えると、つなげたときに自然な連続性が生まれます。

マルチモーダル入力の組み合わせ方

テキストだけでなく、画像や音声を入力に使えるモデルが増えました。組み合わせ方の設計も、プロンプト設計の一部です。

画像から動画へ

一枚の静止画を起点にする場合、モデルはその画像の構図と色を引き継ぎます。したがって、元画像の品質がそのまま動画の品質になります。解像度、被写体の輪郭、背景の分離がはっきりしている画像を選びましょう。

テキスト側では「何を動かすか」を書き、動かさない部分は明示的に固定します。「人物は緩やかにまばたきし、髪と衣服の裾だけが風で揺れる。カメラは固定」といった書き方が安定します。

参照画像でスタイルを固定する

キャラクターや画風の一貫性を保ちたいときは、参照画像を使うのが最も確実です。参照は「同一の人物の別角度」など、同じ条件で揃えた画像を複数用意すると効果が高まります。テキスト側では、参照から引き継ぎたい要素(顔立ち、髪色、衣装のディテール)と、変えたい要素(ポーズ、背景、光)を分けて書きます。

音声・字幕・編集との接続

生成した映像は、そのまま完成品になることはほとんどありません。編集工程で音声を載せ、字幕を入れ、カットを調整します。このとき、生成時点で尺と動きの余白を確保しておくと、編集で詰めやすくなります。

たとえば、ナレーションの尺が決まっているなら、それに合わせてカットの長さを先に決め、その範囲で動きが完結するようにプロンプトを設計します。字幕が入る位置を想定し、画面下部に重要な要素を置かない構図を選ぶのも実務的です。

モデル選択の判断基準

モデルは用途によって得意分野が異なります。ここでは系統ごとの特徴と、選び方の基準を整理します。

静止画向けモデルの型

ディテール重視のモデルは、質感や細部の描写に強く、物撮りやポートレートに向きます。一方で、指示に対する解釈が固く、抽象的な表現や破天荒な構図は苦手な傾向があります。反対に、芸術的な解釈をしてくれるモデルは、曖昧な指示から意外な表現を返しますが、再現性は低くなります。

用途が商用の素材であれば、ディテール重視のモデルで丁寧に作り込む。コンセプトの探索であれば、解釈の自由度が高いモデルで数を出す。この使い分けが基本です。

動画向けモデルの型

動画モデルは、大きく三つの型に分かれます。

  1. 短尺クリップ型:数秒の映像を高品質で生成する。広告のカットやSNS向けに向く。
  2. ストーリー型:やや長い尺で一貫した場面を生成する。ナラティブな表現に向く。
  3. 制御特化型:カメラワークや動きの指定に強い。実写合成やVFXの素材作りに向く。

自分の制作物がどの型に向くかを見極めてから、モデルを選ぶと無駄が減ります。

モデル間の移植と癖の把握

同じプロンプトでもモデルによって結果が変わります。そのため、特定のモデルに合わせて過剰にチューニングすると、他のモデルに移したときに使い物にならなくなります。基本構造(被写体・構図・光・動作・カメラ)を共通に保ち、モデル固有の調整は末尾のパラメータや修飾語に留めるのが賢いやり方です。

また、各モデルには特有の癖があります。人物の手指が崩れやすい、暗部が潰れやすい、カメラワークの解釈が独特、などです。癖は短い検証を何度か回せば把握できます。モデルごとに「不得意リスト」をメモしておくと、後の判断が速くなります。

実践テンプレート集

ここまでの原則を、そのまま使えるテンプレートにまとめます。

静止画用テンプレート

[被写体と状態] + [場所と時間帯] + [構図とアングル] + [光の種類・方向・質] + [レンズと被写界深度] + [素材と質感] + [色の方向性]

記入例:赤い傘を差して立ち止まる人物、濡れた石畳の路地、夕暮れ、バストアップ、三分割の右側、逆光で輪郭が光る、85mm、浅い被写界深度、リネンのコートと革のブーツ、寒色寄りの青と橙の対比。

動画用テンプレート

[被写体と初期状態] + [動作の開始と終了] + [カメラワークと尺] + [環境の動き] + [固定すべき要素] + [光と色] + [禁止事項]

記入例:白いシャツの人物が窓辺に立っている、二歩前に進み窓の外を見る、カメラは固定で3秒、カーテンと髪だけが緩やかに揺れる、顔立ちと服装は全編で一定、午後の柔らかい自然光、暖色寄り、急なカメラ移動は禁止。

否定プロンプトの設計

否定欄が使える場合は、次のように整理すると管理しやすくなります。

  • 構造の破綻:余分な手足、歪んだ指、融合した物体
  • 品質の低下:ぼけ、ノイズ、低解像度、圧縮の破綻
  • 不要な要素:透かし、文字、ロゴ、枠線、署名
  • スタイルの逸脱:過度な彩度、プラスチックのような肌、油絵風の質感

否定欄はあくまで補助です。肯定文で意図を固めるのが先で、否定は仕上げの調整に使います。

よくある失敗と原因の切り分け

生成がうまくいかないとき、原因を特定する順番を決めておくと無駄な試行が減ります。

手足や小物が崩れる

原因の多くは、被写体が小さく写りすぎているか、要素を詰め込みすぎていることです。まず被写体を大きく写す構図に変え、次に画面内の要素を減らします。それでも改善しない場合は、そのモデルが苦手なポーズ(手を顔の前に出す、指を組むなど)を避けるのが現実的です。

動きが意図と違う

動作の記述が抽象的すぎるか、複数の動きを同時に指定しているのが原因です。動作を一つに絞り、開始と終了を明示します。また、動きの主体を明確にしましょう。「物が揺れる」ではなく「風でカーテンが揺れる」と書くと、モデルは何を動かすべきか迷いません。

キャラクターの一貫性が保てない

テキストだけで同一人物を保つのは困難です。参照画像を使う、髪型・衣装・年齢・体格などの特徴を毎回同じ語順で書く、といった工夫が必要です。特徴の記述順を固定するだけでも、ばらつきは小さくなります。

文字やロゴが崩れる

多くのモデルは文字の描画が苦手です。文字が必要な場合は、生成後に編集ソフトで載せるほうが確実で、修正も容易です。どうしても生成したい場合は、短い単語に限定し、大きく明瞭に配置する構図を指定します。

色が破綻する

光の指定が矛盾していると、色が濁ったり極端に彩度が上がったりします。暖色と寒色を同時に指定する場合は、どちらを主にするかを決め、割合を書き添えましょう。また、参照画像の色味が強すぎる場合は、参照の影響度を下げる設定を試します。

制作フローに組み込む運用設計

個人の趣味なら試行錯誤で済みますが、仕事として続けるなら運用の設計が必要です。

プロンプトライブラリを作る

うまくいったプロンプトは、そのまま保存して再利用できる形にします。保存するときは、プロンプト本文だけでなく、使用モデル、設定値、生成日、結果の評価、そして「何が効いたか」のメモを添えます。後から見返したときに、なぜ良い結果が出たのかが分かることが重要です。

分類は、用途(人物、風景、商品、抽象)、トーン(温かい、冷たい、無機質)、そして失敗例の三つで分けると探しやすくなります。失敗例こそ資産です。

バージョン管理と比較を行う

プロンプトは少しずつ変わっていくものです。変更履歴を残し、どの変更が結果を改善したのかを追えるようにします。同じ条件で複数案を並べて比較する作業を定期的に入れると、感覚ではなく根拠で判断できるようになります。

比較のときは、評価軸を先に決めます。たとえば「構図の安定」「被写体の再現度」「色の一貫性」「破綻の少なさ」の四項目を五段階で採点します。主観で選ぶより、後から振り返りやすくなります。

チームレビューの回し方

複数人で制作する場合、プロンプトの書き方の統一が品質を左右します。用語集を作り、「逆光」「アイレベル」「浅い被写界深度」といった語の意味を揃えましょう。レビューでは、好みの議論に入る前に、要件(尺、アスペクト比、色調、禁止事項)を確認します。

また、生成の担当と編集の担当が分かれる場合は、前半工程で動きの余白を残しておくなど、後工程が困らない配慮をプロンプトに埋め込みます。

よくある質問と上達のための練習メニュー

プロンプトは長ければ長いほど良いのでしょうか

いいえ。重要なのは長さではなく、情報の重複がないことです。同じ意味の修飾語を重ねると、モデルは強調として解釈し、結果が極端になります。まず必要な情報だけを書き、結果を見て足りない要素を加える順序が安全です。

英語と日本語、どちらで書くべきですか

扱いたいモデルが学習データの大半を英語で持っている場合、英語のほうが安定することがあります。ただし日本語でも十分な結果が得られるモデルは増えています。判断の基準は、同じ内容を両方で書いて比較し、破綻の少ないほうを選ぶことです。用語の精度が上がるなら、英語をベースにしつつ固有名詞だけ日本語で補う方法も有効です。

シード値を固定すべきでしょうか

比較検証の段階では固定すると、変更の影響を正確に把握できます。一方、最終的な採用案を探す段階では複数のシードを試し、偶然の良さに頼らない結果を選ぶほうが安心です。目的によって使い分けましょう。

生成した映像は商用利用できますか

利用条件はモデルやサービスの規約によって異なります。人物の肖像、商標、既存作品に似た表現など、権利に関わる要素は特に注意が必要です。制作前に規約を確認し、必要に応じて法務の確認を取る習慣をつけましょう。

上達が早い人の共通点はありますか

共通しているのは、記録を取っていることです。何を書いて、何が出て、何を変えたら改善したのか。この三つを残している人は、数十回の試行で大きな差をつけます。逆に、毎回ゼロから書き直す人は、同じ失敗を繰り返します。

おすすめの練習メニューを教えてください

まず、一つの題材を決めて、構図だけを十通りに変えて生成します。次に、光だけを十通りに変えます。最後に、同じ題材を別のモデルで生成し、癖の違いを記録します。この三周で、自分の判断基準がはっきりしてきます。

動画の練習では、3秒のカットを一つ作り、それを四つのカットに分割して、つなげたときに違和感が出ないかを確認します。色温度とレンズ感を揃える練習は、実務でそのまま役立ちます。

最後に、他人のプロンプトを読む習慣も効果的です。公開されている作例には、どの語が効いているのかを観察しながら読むと、自分の語彙が増えていきます。

プロンプトエンジニアリングは、才能ではなく手順です。質問を分解し、一度に一要素だけを変え、記録を残す。この三つを続けるだけで、AI画像とAI動画の品質は着実に上がっていきます。

Alexander

Alexander