テキストから動画生成AIの現在地
テキストで指示を書くと、数十秒から数分で映像が出てくる。数年前まで研究デモの域を出なかったこの技術は、いまや広告制作、ECの商品紹介、教育コンテンツ、SNSショート、ゲームのプリビズなど、実務の現場で当たり前に使われるようになった。背景にあるのは拡散モデルとトランスフォーマー系アーキテクチャの進化、そしてクラウドGPU推論環境の整備だ。手元に高性能マシンがなくても、ブラウザから高品質な映像を生成できる時代になっている。
一方で、現場からよく聞こえてくるのは「思った映像が出ない」「毎回キャラクターの顔が変わる」「尺が足りずに結局つなぎ直した」「編集段階で破綻に気づいて全部やり直しになった」という声だ。つまりボトルネックは、生成そのものから「狙った絵を安定して再現する運用設計」へと移っている。ツールを触るだけでは成果は出ない。企画、設計、生成、選別、編集、書き出しという流れを、AIのクセを前提に組み直す必要がある。
本記事では、テキストから動画を生成するAIを使って、短尺から中尺の映像を一貫して仕上げるための実践ワークフローを整理する。特定のサービスに依存しない形で、モデル選定の判断基準、プロンプトの組み立て方、カット間の一貫性の保ち方、音声と字幕の統合、つまずきやすいポイントの対処、チームでのレビュー運用までを順に扱う。読み終わったあとに、自分の案件へ当てはめて「型」として再利用できる状態を目指す。
実務フロー全体像:企画から書き出しまでの6ステップ
生成AIの映像制作は、いきなりプロンプトを書き始めるとほぼ失敗する。先に全体の設計図を決め、生成はその設計図を埋める作業として位置づけると、手戻りが劇的に減る。以下は、15秒から90秒程度の映像を想定した基本の6ステップだ。
ステップ1:目的・尺・配信先を先に決める
最初に決めるのは、映像の目的と、最終的な尺、そして配信先だ。縦型のショート動画なのか、横型のウェブ埋め込みなのか、あるいはサイネージ用のループ映像なのか。アスペクト比と尺が決まれば、生成するカット数と1カットあたりの秒数が逆算できる。たとえば30秒の縦型動画なら、1カット3秒前後で8〜10カット、うち2カットは余裕を持たせて長めに生成しておく、という具合だ。
この段階で「動かしたい被写体」「伝えたい一言」「避けたい表現」の3点をテキストで書き出しておく。これは後のプロンプト設計とレビューの基準になる。
ステップ2:絵コンテとプロンプト台本を作る
絵コンテは手描きでなくてよい。表形式で「カット番号/内容/カメラ/尺/セリフまたは字幕」を埋めるだけで十分機能する。この表の各行が、そのまま1本の生成プロンプトに対応する。台本を先に作るメリットは、生成の前に構成の弱点が見えることだ。同じ画角が続いていないか、説明カットが多すぎないか、クライマックスの尺が足りているかを、生成コストを払う前に確認できる。
ステップ3:少ない試行で方向性を確認する
いきなり全カットを本番品質で生成しない。まず解像度を落とし、尺を短くし、各カットを1回ずつ生成してラフを並べる。この段階で見るのは質感ではなく、構図、被写体の位置、動きの方向、カット間のつながりだ。ラフ段階で構成を直せば、後工程のコストは大きく下がる。
ステップ4:採用カットを選び、必要なら再生成する
同じプロンプトでも出力は毎回異なる。1カットにつき2〜4本生成し、最も意図に近いものを採用する。ここで重要なのは「惜しいが惜しい」で妥協しないこと。破綻が小さくても、それが動きの中心にあると視聴者はすぐ気づく。妥協するなら画面の端、動きの速い一瞬など、視線が向きにくい場所に限る。
ステップ5:編集でつなぎ、音を載せる
生成されたカットは尺が揃っていないことが多い。編集ソフトで切り詰め、トランジションでつなぎ、BGM、効果音、ナレーション、字幕を載せる。音が入ると、映像の粗が驚くほど目立たなくなる。逆に、音がなくても成立するかを確認しておくと、映像そのものの強度が測れる。
ステップ6:書き出しと配信、そして記録
配信先ごとに解像度、ビットレート、アスペクト比を出し分ける。そして忘れてはならないのが記録だ。採用したプロンプト、モデル、設定、生成回数、却下理由を残しておくと、次回の類似案件で再利用できる。生成AIの制作は、資産が「映像ファイル」だけでなく「再現可能なプロンプト資産」として積み上がる。
モデル選定の判断基準
モデルは日々入れ替わり、名前だけを追いかけても意味がない。大切なのは「どの判断軸で選ぶか」を持っておくことだ。以下の5つの軸で比較すれば、新しいモデルが出てきても同じ基準で評価できる。
軸1:得意分野で選ぶ
一口に動画生成といっても、得意分野ははっきり分かれる。実写風の人物や自然な肌質に強いモデル、アニメやイラスト調に強いモデル、物理的な動きや流体表現に強いモデル、そして映像の「意味」を理解して複数ショットを一貫させられるモデル。たとえば人物のアップと街並みの移動ショットを得意とする系統、テキスト指示の解釈力が高くナラティブを組み立てやすい系統、コスト効率と汎用性のバランスに優れた系統、といった具合に分類して捉えると整理しやすい。
選び方の実践的なコツは、自分の案件に近い題材でテストすることだ。「猫の映像がきれい」という評価は、自社の商品である腕時計の質感再現にはほとんど参考にならない。
軸2:尺・解像度・アスペクト比
1回の生成で得られる尺はモデルごとに異なる。数秒単位のクリップを大量に生成して編集でつなぐタイプと、より長いカットを一発で作れるタイプでは、ワークフローが変わる。長尺が作れるモデルは便利だが、途中で破綻が混ざるリスクも上がる。短尺クリップをつないだほうが、結果的に制御しやすい場面も多い。
解像度とアスペクト比の対応も確認しておきたい。縦型のショート動画を前提にするなら、後から横型をトリミングするのではなく、最初から縦型で生成したほうが構図の無駄が出ない。
軸3:生成コストと反復回数
ここで意識したいのは単価そのものではなく「1本の採用カットに何回生成が必要か」という視点だ。単価が安くても5回に1回しか使えないなら実質コストは高い。逆に単価が高くても一発で決まるなら安い。制作では、モデルごとに「採用率」を測っておくと判断が速くなる。
運用としては、方向性を探るラフ段階は低コストなモデルで回し、最終的な見せ場だけ高品質なモデルに切り替える二段構えが現実的だ。
軸4:一貫性の制御手段
同一キャラクターを複数カットで登場させる場合、参照画像を渡せるか、シードを固定できるか、同じスタイル記述が効くかが重要になる。この制御手段が乏しいモデルは、単発の美しいカットは作れても、シリーズものや連続したストーリーには向かない。
軸5:ライセンスと商用利用条件
業務利用では必ず確認したい項目だ。生成物の商用利用可否、学習データに関する方針、出力の権利归属于、クレジット表記の要否などは、サービスごとに条件が異なる。法務担当がいる組織なら、導入前に条件を文書で残しておくと後のトラブルを避けられる。
プロンプト設計は4層構造で考える
動画生成のプロンプトは、文章をうまく書く能力ではなく、情報を漏れなく並べる能力が問われる。おすすめは、次の4層に分けて記述する方法だ。
第1層:被写体とシーン
誰が、どこに、何をしているか。ここは最も基本的な層だ。主役の見た目、服装、年代、表情、そして場所と時間帯、天候、周囲の要素を具体的に書く。曖昧な形容詞より、観察できる事実を書く。「美しい女性」より「30代の女性、紺のトレンチコート、左手に紙コップ」のほうが、出力は安定する。
第2層:カメラと構図
同じ被写体でも、画角とカメラワークで意味は変わる。バストショット、全身、俯瞰、ローアングル、クローズアップ。カメラの動きは、固定、パン、チルト、ドリーイン、ドリーアウト、オービット、手持ち風の揺れなど。ここを指定しないと、モデルは勝手に動かし、カットごとに画角がばらつく。
特に重要なのは「動きの方向」だ。前のカットで右から左へ被写体が動いたなら、次のカットも同じ方向に流れるほうが編集で自然につながる。
第3層:光と質感
光は映像の感情を作る。逆光、サイド光、窓からの柔らかい自然光、ネオン、夕暮れのゴールデンアワー、スタジオの三点照明。質感はフィルムグレイン、クリアなデジタル、彩度を抑えた渋めのトーンなど、レンズやフィルムの比喩で伝えると効果が出やすい。
ここで注意したいのは、光の指定を変えるとキャラクターの見え方も変わることだ。シリーズものでは、光のキーワードを全カットで固定する。
第4層:動きと時間
被写体の動作、動きの速さ、スローモーションか等速か、動きの始点と終点。そしてカメラと被写体のどちらが動くのか。動画生成では、この層の指定が最も結果に効く。「歩き出す」「振り返る」「風で髪がなびく」のように、動作を動詞で明示する。
4層を1つの長い文章に詰め込むと、後半の指示が薄まることがある。改行や箇条書きで構造化し、モデルが読み落としにくい形にするのが実務的だ。
ネガティブ指定の使いどころ
避けたい要素を指定できる場合は活用する。ただし、過剰なネガティブ指定は表現の幅を狭める。「指の崩れ」「文字化け」「余計な人物」など、実際に発生した問題だけを追加していく運用がよい。
カット間の一貫性を保つワークフロー
生成AI映像で最も多くの人がつまずくのが一貫性だ。解決の鍵は、生成に頼る前に「基準」を固定することにある。
キャラクターシートを作る
まず主人公の基準となる1枚を作る。正面、斜め、横の3方向があれば理想だが、まずは正面の1枚でよい。この画像を全カットの参照として使う。テキストのプロンプトも、最初に確定した記述をテンプレートとして使い回す。形容詞を毎回書き換えると、顔も毎回変わる。
画像から動画へ、の順序を徹底する
テキストだけで動画を作ると、構図も人物も毎回ゼロから抽選される。いったん画像を生成し、その画像を動画化する流れにすると、構図と人物が固定され、動きだけを指定できる。手間は増えるが、採用率は大きく上がる。結果として総コストは下がることが多い。
背景と色調を先に決める
キャラクターと同じくらい重要なのが背景と色調だ。同じ街、同じ時間帯、同じ色温度で統一すると、別々に生成したカットでも同一世界に見える。逆に、色調がばらつくと、どれだけ人物が揃っていても別の作品のように見える。編集ソフトでカラーグレーディングを揃える工程を、最初から予定に入れておきたい。
つなぎ目の設計
カットの切り替えは、視聴者の注意をリセットする。一貫性の負担を減らすには、切り替えを「動作の途中」で行うのが有効だ。ドアを開ける動きの最中、振り向きの最中で切ると、視聴者の脳が変化を補完してくれる。また、インサートカット(手元、小物、風景)を挟むと、キャラクターの連続性を気にせず尺を稼げる。
音声・字幕・BGMの統合
映像だけでは伝わらない情報を補うのが音の役割だ。生成AIの映像は音が弱い場合が多いので、ここは別工程として丁寧に作る。
ナレーションとリップシンク
セリフがある場合は、先に音声を確定させ、それに映像を合わせる順序が失敗しにくい。生成した映像の口の動きに合わせて音声を作るより、確定した音声に合わせて映像を選ぶほうが制御しやすい。リップシンク機能を使う場合も、元の音声が明瞭であるほど精度が上がる。
字幕設計
ショート動画では字幕は必須に近い。1行あたりの文字数、表示秒数、フォントサイズを決めておく。経験的には、縦型なら1行10〜13文字、表示は1秒あたり4〜6文字程度が読みやすい。テロップの位置は、プラットフォームのUIと重ならない場所に固定する。
BGMと効果音
BGMは尺に合わせて編集するだけでなく、カットの切り替えに合わせてリズムを刻むと、映像の粗が目立たなくなる。効果音は、扉、足音、紙、水など、画面内の出来事に同期させる。ここを丁寧にやるだけで、同じ映像が別物のように見える。
音量バランス
ナレーション、BGM、効果音のバランスは、最終的にスマートフォンのスピーカーで確認する。制作環境のモニターで整えても、実際の視聴環境では聞こえ方が変わる。
よくある失敗とトラブルシューティング
ちらつき・形状の破綻
フレーム間で模様がちらつく、手足の形が崩れる、背景の模様が溶ける。原因は多くの場合、動きの指定が多すぎるか、1カットに要素を詰め込みすぎていることだ。対策は、動きを1つに絞る、尺を短くする、解像度を上げる、参照画像を使う。それでも直らない場合は、そのカットを分割して別々に生成する。
動きが不自然・止まって見える
カメラだけが動いて被写体が静止していると、紙芝居のように見える。逆に動きが速すぎると、何が起きたか伝わらない。解決策は、動きの速度を言葉で指定すること。「ゆっくり」「急に」といった副詞は想像以上に効く。
意図と違う画角になる
指定したカメラワークが無視される場合は、プロンプトの後半に書かれていることが多い。重要な指示は前に移す。また、カメラワークの用語はモデルによって解釈が異なるため、同じ意味の言い換えを併記すると安定する。
尺が足りない・長すぎる
生成されたクリップが必要な尺に届かない場合は、同じカットを複数生成して尺の長いものを選ぶ、編集で速度を落とす、前後のカットで補う、という3つの対処がある。逆に長すぎる場合は、動きの山場だけを切り出す。
人物が毎回変わる
参照画像を使う、プロンプトの人物記述を固定する、シードを固定する、同じカットを分割して同じ条件で生成する。それでも揺れる場合は、顔が映るカットを減らし、手元や後ろ姿、シルエットで構成する脚本に切り替えるのも実務的な解決策だ。
急にスタイルが変わる
スタイル記述がカットごとに微妙に違うと、質感が飛ぶ。スタイルに関する記述はテンプレート化し、コピーして使う。モデルを途中で変えると質感も変わるため、モデルの切り替えはシリーズの区切りで行う。
チームで回すためのレビューとバージョン管理
個人制作なら気にならないが、チームで生成AI映像を回すと、必ず「どのプロンプトのどの版が採用版か」がわからなくなる。
命名規則を最初に決める
案件名、カット番号、版番号、モデル名を組み合わせた命名規則を決める。ファイル名だけで出自がわかる状態にしておくと、後から差し替えが発生しても混乱しない。
プロンプトを台本に埋め込む
プロンプトは別ファイルにせず、絵コンテ表の同じ行に書く。採用したプロンプトには印を付け、却下した理由も一行で残す。この記録が、次の案件のスタート地点になる。
レビューの観点を分ける
レビューでは「構成」「映像品質」「音声」「コンプライアンス」を分けて確認する。混ぜて議論すると、本質でない指摘に時間が消える。特に、生成AIの映像は「雰囲気が違う」という曖昧な指摘が出やすいので、判断基準を先に共有しておくことが重要だ。
権利と表記の確認
使用したモデルの利用条件、素材の権利、出演者や商標の扱いをチェックする工程を、フローの最後に固定で入れておく。
よくある質問
Q. テキストから動画生成AIは、どこから始めればよいですか。
A. まず15秒、3カットの短い映像を1本完成させることをおすすめします。企画、生成、編集、書き出しの全工程を一度通すと、どこで時間がかかるかが見えます。最初から長尺に挑むと、問題の切り分けが難しくなります。
Q. プロンプトは英語のほうが良いですか。
A. モデルによります。英語の学習データが多いモデルでは英語が安定することもありますが、日本語でも十分な結果が出るモデルが増えています。重要なのは言語よりも構造です。被写体、カメラ、光、動きの4層が漏れなく書かれているかを確認してください。
Q. 1カットにつき何回生成すればよいですか。
A. ラフ段階では1回、本番では2〜4回が目安です。採用率が極端に低い場合は、回数を増やすより、プロンプトか参照画像を見直したほうが効果的です。
Q. 生成した映像はそのまま使えますか。
A. 短いカットをそのまま使うことは可能ですが、音を載せ、カットをつなぎ、色調を揃える編集工程を挟むと完成度が大きく変わります。生成は素材作りであり、作品作りは編集で行われると考えたほうが現実的です。
Q. 実写の撮影は不要になりますか。
A. すべてが置き換わるわけではありません。実際の人物や商品を正確に映す必要がある場面、法的な証拠性が求められる場面では撮影が必要です。生成AIは、撮影が難しいカット、概念的なカット、バリエーション量産に向いています。
Q. コストを抑えるコツはありますか。
A. ラフは低コストなモデルで作り、見せ場だけ高品質なモデルに切り替える。不要なカットを台本段階で削る。尺を短くする。この3点で大きく変わります。
Q. 失敗した生成を減らすには。
A. 記録を取ることです。どのプロンプトが失敗しやすいか、どの要素を足すと破綻するかを蓄積すると、同じ失敗を繰り返さなくなります。
まとめ:小さく試して型を作る
テキストから動画を生成するAIは、もはや珍しい技術ではなく、制作フローの一部になった。だが、ツールを触った回数と成果は比例しない。成果を分けるのは、目的と尺を先に決める習慣、4層構造でプロンプトを設計する技術、参照画像で一貫性を固定する運用、そして音と編集で仕上げる工程だ。
最初の一歩は、小さな1本を作ることにある。15秒、3カット。それを通すだけで、自分の案件のどこがボトルネックかが見えてくる。そして、その経験をプロンプトと手順として記録すれば、次の案件はもっと速く、もっと安定する。生成AIの映像制作は、才能ではなく、型の積み重ねで上手くなる領域だ。




