テキストと画像から動画を生成する仕組み
生成AIによる動画制作は、もはや研究機関や大手スタジオだけのものではありません。短いテキストを入力すれば数秒から十数秒のクリップが出力され、静止画を1枚用意すればその被写体が自然に動き出す。こうした体験が一般のクリエイターにも届くようになった背景には、拡散モデルによる画像生成技術と、フレーム間の時間的なつながりを扱う時系列モデリングの組み合わせがあります。
拡散モデルが動画に拡張された意味
画像生成の拡散モデルは、ノイズから少しずつ像を立ち上げる過程を学習します。動画生成ではここに時間軸が加わり、各フレームを独立に生成するのではなく、前後のフレームとの整合性を同時に評価しながらノイズを取り除いていきます。この設計によって、被写体の形が途中で崩れたり、背景が突然入れ替わったりする現象が大幅に減りました。結果として、単なる画像の連続ではなく、動きと時間の流れを内包したクリップが作れるようになっています。
テキスト条件付けと画像条件付けの違い
テキストからの生成は自由度が高い反面、構図や被写体の細部を細かく指定するのは苦手です。一方、画像からの生成は最初の1フレームが固定されるため、構図・色・質感を思い通りにコントロールしやすくなります。実務では「画像で見た目を固定し、テキストで動きを指示する」という併用がもっとも再現性の高い方法です。テキストだけで始めると毎回キャラクターの顔が変わる、という悩みも、起点となる画像を用意するだけでほぼ解消します。
生成AIが得意なことと苦手なこと
得意なのは、光の変化、自然な髪や布の揺れ、水面や煙のような流体表現、ゆっくりしたカメラの押し引きです。苦手なのは、手指の細部、文字の描画、複数人の会話のように相互作用が複雑な場面、そして長時間にわたって同じ人物を維持するケースです。この前提を押さえておくと、後戻りの少ない企画を立てられます。
プロンプトを5層に分けて組み立てる
動画生成のプロンプトは、思いついた順に単語を並べるだけでは結果が安定しません。被写体、動作、カメラ、照明、雰囲気という5つの層に分けて書くと、何を変えれば何が変わるのかが明確になり、反復改善がはかどります。
5層それぞれの役割
第一層は被写体です。誰が、何が、どこにいるのかを具体的に書きます。「女性」ではなく「赤いニット帽をかぶった20代の女性が、窓辺に座っている」まで落とし込むと安定します。第二層は動作で、動詞を一つに絞るのがコツです。「歩きながらコーヒーを飲む」ではなく、まずは「ゆっくり歩く」だけにします。第三層はカメラで、固定、パン、ティルト、ドリー、ズームといった語彙を使います。第四層は照明で、逆光、曇天の拡散光、夜のネオン、朝の低い日差しなど。第五層は雰囲気やジャンルで、シネマティック、ドキュメンタリー調、アニメ調といった質感を指定します。
悪い例と改善例
悪い例は「かっこいい未来的な街をかっこよく動かす動画」です。形容詞が重複し、カメラも動作も指定されていないため、モデルは毎回違う解釈を返します。改善例は「雨上がりの夜、濡れた路面に映るネオンを反射させる。カメラは低い位置からゆっくり前進。被写体は遠くを歩く人物一人のみ。シネマティックな質感」です。要素が層ごとに分かれ、動詞も一つに絞られています。
長さと優先順位の付け方
プロンプトは長ければ良いわけではありません。目安として、テキストのみの生成なら40〜80語、画像起点なら20〜40語程度に収め、動きと照明に情報量を集中させます。要素が衝突するときは、被写体と動作を優先し、背景の細部は思い切って捨てます。
画像を起点にする:キーフレームの準備
画像から動画を作る場合、品質の大半は入力画像で決まります。生成モデルは与えられた1枚を忠実に伸ばそうとするため、画像の欠陥はそのまま動画の欠陥になります。
解像度とアスペクト比
縦型のショート動画なら9:16、横型なら16:9を最初から選びます。横長の画像を縦型に切り抜くと被写体が切れるため、生成前に構図を組み直すほうが結果が良くなります。解像度は長辺1280〜1920ピクセル程度が扱いやすく、過度に大きい画像はかえって処理が不安定になります。
構図と余白の設計
被写体を中央に置きすぎると、カメラが動いたときに画面外へ出やすくなります。進行方向に余白を残し、動かしたい方向へ空間を確保しておくと、パンやドリーの指示が効きやすくなります。背景と被写体の明度差をつけておくのも、輪郭の破綻を防ぐ有効な手段です。
前処理でやっておくべきこと
不要な文字やロゴは消しておきます。生成モデルは文字を正しく再現できないことが多く、動画内で崩れた文字は強い違和感を生みます。また、被写体の輪郭が背景と同化している場合は、軽くコントラストを上げて分離しておきます。肌の質感は過度に平滑化せず、自然な粒状感を残したほうが動画にしたとき馴染みます。
参照画像の枚数と役割分担
複数枚を使える場合は、顔用、衣装用、背景用のように役割を分けます。同じ人物の別角度を2〜3枚用意すると、横を向いたときの破綻が減ります。逆に似た画像を何枚も投入すると、モデルが平均化して特徴が薄まるため注意が必要です。
ツールとモデルの選び方
動画生成ツールは乱立しているように見えますが、判断軸はそれほど多くありません。次の4点を確認すれば、自分の用途に合うものを絞り込めます。
判断軸1:テキスト主導か画像主導か
アイデア出しの段階ではテキスト主導のツールが向いています。一方、商品撮影や既存素材の活用など、見た目を厳密に管理したい場合は画像主導のツールを選びます。両方の機能を持つサービスでも、得意な方向は必ずどちらかに偏っています。実際に10回ほど生成して、意図に近い結果が出る回数を数えるのが最も確実な見極め方です。
判断軸2:クリップの尺とカメラ制御
4〜5秒のクリップを多数つないで構成するのか、10秒以上の長回しを狙うのかで選択が変わります。長尺を扱えるモデルは一般的に、短尺モデルより1回あたりの生成時間が長く、失敗時の損失も大きくなります。カメラワークをテキストで指示できるかどうかも重要な差です。ドリーやパンを明示できるツールは、編集工程を大幅に短縮できます。
判断軸3:一貫性の担保手段
同じキャラクターを複数カットで登場させるなら、参照機能やキャラクター固定の仕組みがあるかを確認します。これがない場合、カットごとに顔が変わり、視聴者は話についていけなくなります。
判断軸4:試行回数とコスト感覚
生成AIの動画制作は、1回で決める仕事ではなく、複数回試して選ぶ仕事です。したがって「1本あたりの単価」ではなく「合格カットを1本得るまでに何回生成が必要か」で考えます。無料枠で試作し、勝ちパターンが固まった本番カットだけ有料枠で回す、という二段構えが現実的です。
ショット設計とカメラワークの言語化
動画が単調に見える最大の原因は、カメラが止まっていることではなく、ショットの目的が決まっていないことです。各カットに「何を見せたいのか」を一言で決めてから生成に入ります。
使えるカメラ語彙
固定ショットは被写体の表情や細かな動きを見せます。パンは横方向の空間の広がり、ティルトは上下の情報量を見せます。ドリーインは感情の高まりや情報の絞り込み、ドリーアウトは状況の提示や余韻に使います。手持ち風の揺れは臨場感、クレーン的な上昇は場面転換の合図として機能します。これらを1カット1モーションに限定すると、生成結果が破綻しにくくなります。
カットの長さとつなぎ方
生成できるクリップは数秒単位なので、1カットは3〜5秒を基本にします。同じ動作を別アングルで2本用意しておくと、編集時にテンポを作れます。アクションの途中でカットを切り替えるマッチカットは、フレームの破綻を隠すのにも有効です。
モンタージュの組み立て
15秒の動画なら、導入のワイド1本、中盤のミディアム2本、締めのクローズアップ1本という構成が扱いやすい型です。ワイドで場所を示し、ミディアムで行為を見せ、クローズアップで感情を置く。この順序を守るだけで、短い尺でも物語として成立します。
実践ワークフロー:15秒の縦型動画を完成させる
ここからは、実際に1本の短尺動画を作る流れを通しで確認します。テーマは「朝のカフェでノートを開く人物」とします。
ステップ1:目的と制約の確認
最初に決めるのは、公開先、縦横比、尺、音の有無、そして締め切りです。公開先が縦型のフィードなら9:16、尺は15秒、音は後乗せと決まれば、必要なカット数は4本前後と自動的に決まります。制約を先に固定することで、後半の迷いが減ります。
ステップ2:絵コンテとキーフレームの作成
各カットの代表フレームを画像として用意します。画像生成ツールで4枚作り、構図と光を確認します。同じ人物が4枚に登場する場合は、顔の特徴をメモし、参照画像として使い回せるようにします。この段階で色調を揃えておくと、後の動画化が格段に楽になります。
ステップ3:動画化とカメラ指示
キーフレームを動画生成ツールに投入し、動きだけをテキストで指示します。「湯気がゆっくり立ち上る、カメラは固定」のように、動きとカメラを短く指定します。1カットにつき3〜5回生成し、動きの自然さと顔の安定を基準に選びます。全部を採用する必要はなく、1本でも使えるカットがあれば次へ進みます。
ステップ4:選別と編集
採用カットをタイムラインに並べ、不要な頭と尻を切ります。生成クリップは冒頭に静止に近いフレームが入ることが多いため、思い切って0.3〜0.5秒を捨てると動きが生き生きします。カット間の色調を合わせ、必要なら軽いカラー調整を加えます。
ステップ5:音と字幕
環境音を薄く敷き、要所に効果音を置きます。ナレーションを入れる場合は、生成した動きに合わせるのではなく、音声を先に決めてからカット尺を調整するほうが自然に仕上がります。字幕は縦型で読みやすい位置と行数に整えます。
ステップ6:書き出しとバリエーション
完成版を書き出したら、冒頭の1カットだけを差し替えた別バージョンを作ります。同じ素材で複数の冒頭を試せるため、反応の比較が短時間で行えます。
一貫性を保つための実務テクニック
複数カットをまたいで同じ人物や空間を見せるとき、一貫性はもっとも大きな課題になります。
キャラクターの固定
参照画像を使う、プロンプトの人物記述を一字一句変えない、といった基本を徹底します。衣装の色は特に変わりやすく、カットごとに色味がずれると別の人物に見えます。HEX値に近い具体的な色名や、素材の質感まで書き添えると安定します。
照明と時間帯の統一
同じ場面なら、光の方向と色温度を固定します。「左からの窓明かり」「暖色の室内灯」など、光源を一言で定義してすべてのプロンプトに含めます。時間帯が変わる演出を入れない限り、この指定は省略しないほうが安全です。
小物と背景の連続性
カップの位置、ノートの開き具合、壁の絵など、画面内の小物はカット間で矛盾しやすい箇所です。カットをまたぐ小物は減らすか、動かさない前提で設計します。どうしても必要な場合は、編集でフレームを切り出して次のカットの参照画像にします。
よくある失敗とその対処法
被写体が溶ける、形が崩れる
動きが大きすぎるか、被写体が小さすぎるのが原因です。動作を遅く、被写体を画面に対して大きくし、カメラを固定して再生成します。それでも崩れる場合は、生成時間を短くし、カットを分割します。
顔が別人になる
参照画像の解像度不足か、参照が弱く効いている状態です。顔がはっきり写った画像を1枚追加し、プロンプトの人物記述を短くして他の要素に埋もれないようにします。
画面全体がぼやける、ディテールが消える
解像度を上げすぎたか、動きの指示が多すぎる場合に起こります。解像度を標準に戻し、モーションの記述を一つに絞ります。シャープさが足りない場合は編集で軽く輪郭を整えます。
カメラが勝手に動く、揺れが激しい
カメラ指示が曖昧なまま、動きの形容詞だけが並んでいると起こります。「固定」と明示するか、モーション指定を削除します。手持ち風の揺れを指定した場合は、意図より強く出ることを前提に、編集でスタビライズを検討します。
カットをつなぐと別の作品に見える
色調と光の方向がカットごとに違うことが原因です。全カットに共通の照明記述を入れ、編集で同じルックに寄せます。書き出し後に全体を並べて確認する工程を必ず挟みます。
公開前の品質チェックリスト
最後に、書き出し前に確認したい項目をまとめます。
- 冒頭1秒で何の動画かが伝わるか
- カット尺が3〜5秒に収まり、テンポが一定か
- 同じ人物・空間の一貫性が保たれているか
- 手指、文字、歯など破綻しやすい箇所が画面に残っていないか
- 音声と動きのタイミングがずれていないか
- 縦型なら字幕がセーフエリア内に収まっているか
- 書き出し形式とビットレートが公開先の要件を満たしているか
- 素材や人物の利用条件に問題がないか
このチェックを通過したカットだけを本番に使い、残りは次回の参照素材として保管します。生成の試行錯誤そのものが、次回の制作時間を短縮する資産になります。
よくある質問
テキストだけでも実用的な動画は作れますか
作れますが、用途は限定されます。風景、抽象的な情景、雰囲気重視のカットはテキストだけで十分実用的です。一方、人物が話す場面や商品を見せる場面は、画像を起点にしたほうが意図に近い結果が得られます。
1本の動画に何回くらい生成が必要ですか
15秒で4カットの構成なら、各カット3〜5回として15〜20回程度が目安です。慣れてくると、最初の数回で使えるかどうかを判断できるようになり、無駄な生成が減ります。
無料で試せる範囲では何をすべきですか
本番カットの生成より、プロンプトの検証とキーフレームの作成に使うのが効果的です。どの書き方が安定するかを無料枠で見極め、勝ちパターンが固まった段階で本番の生成に進むと、全体の手戻りが少なくなります。
生成したクリップはそのまま使えますか
編集前提で考えるのが現実的です。冒頭と末尾の不要部分を切り、色調を揃え、音を載せる工程を経て初めて公開品質になります。生成は素材作り、編集は仕上げという役割分担を意識します。
長い動画を作るにはどうすればよいですか
1回の生成で長尺を作ろうとせず、短いクリップをつなぐ方式に切り替えます。各カットの目的を決め、共通の照明と色調で統一すれば、数分の動画でも破綻なく構成できます。
動きの指示はどの言語で書くべきですか
モデルが学習している言語で書くのが基本です。英語のほうが反応が素直なモデルも多いため、まず英語で動作とカメラを指定し、固まった表現を自分のテンプレートとして保存しておくのが効率的です。
まとめ:生成は素材作り、編集は仕上げ
テキストと画像から動画を生成する作業は、魔法のボタンを押す工程ではなく、素材を作って選ぶ工程です。入力の質を上げ、プロンプトを層で整理し、カメラと動きを一つに絞る。この3点を守るだけで、出力の安定度は大きく変わります。
そして、生成したクリップをそのまま並べるのではなく、切り、揃え、音を載せる編集工程を必ず挟むこと。生成AIが担うのは素材の供給であり、作品としての完成度を決めるのは編集と構成です。この役割分担を意識すれば、短時間で試作を回しながら、公開に耐える品質へと近づけていけます。




