なぜ今、テキストから動画生成が実務になったのか
動画制作のボトルネックは、長らく「撮影」と「素材集め」にありました。企画が固まってからも、ロケの手配、出演者の調整、機材の準備、テイクの取り直し、そして大量の素材からの選別が必要で、1本の短尺動画に数日から数週間かかることは珍しくありませんでした。テキストから動画を生成する技術が実務で使われるようになった最大の変化は、この「撮影」という工程を、条件付きで「設計」に置き換えたことです。
もちろん、すべての映像制作が置き換わるわけではありません。実在の人物インタビュー、実際の店舗の内観、細かい質感が求められる製品のクローズアップなど、撮影でしか得られない情報は残ります。しかし、コンセプト映像、SNS向けの短尺コンテンツ、説明用のイメージカット、絵コンテ代わりのプリビズなど、「まず映像として形にして、判断したい」用途では、生成を起点にする流れが定着しつつあります。
変化1:プロンプト解釈が「単語」から「演出」へ
初期のテキスト・トゥ・ビデオは、キーワードの羅列に近い入力しか扱えませんでした。「海」「夕日」「カメラが動く」と書いても、出てくるのは海と夕日の断片的な映像で、カメラワークは意図を反映しませんでした。現在のモデルは、文章の中から被写体、動作、時間経過、ライティング、レンズ感、画面のトーンを同時に読み取り、ひとつのショットとして構成します。
実務的に重要なのは、「指示の粒度を上げられるようになった」より「演出の意図を文章で伝えられるようになった」点です。たとえば「逆光で髪の輪郭が光る」「ゆっくりドリーイン」「手前の草がボケる」といった、撮影用語に近い表現が出力に反映されるようになりました。これはつまり、映像ディレクションの知識がそのままプロンプト設計のスキルになるということです。
変化2:時間方向の一貫性が実用水準に到達
動画生成で最も難しかったのは、フレーム間の一貫性です。被写体の形が途中で変わる、背景の小物が消える、手の指の本数が変わる、といった破綻が頻発していました。最近のモデルは、短いカットであれば物理的な整合性を保ちやすくなり、人物の歩行、髪や布の揺れ、水しぶきの飛散なども自然に見えるようになっています。
ただし「実用水準」は「完璧」ではありません。生成は確率の上に成り立つため、同じプロンプトでも結果が変わります。だからこそ、ワークフロー側で「何テイク撮るか」「どの時点で妥協するか」「どの破綻は編集で隠せるか」を決めておく必要があります。生成技術の進歩は、制作の設計力の重要性をむしろ高めました。
変化3:編集前提のワークフローが整った
生成されたクリップは、そのままでは作品になりません。長さが揃わない、音がない、カットのテンポが合わない、といった調整が必要です。現在は、生成したクリップをそのまま編集ソフトに持ち込み、音声合成、字幕、BGM、カラー調整を重ねる前提の制作フローが一般的になりました。
この前提が整ったことで、役割分担も変わりました。撮影の現場仕事が減る代わりに、企画、プロンプト設計、選別、編集、品質検査という工程が増えます。つまり、テキストから動画を作る作業は「魔法のボタン」ではなく、上流の設計と下流の仕上げを含む一連のパイプラインなのです。
ワークフロー全体像:6つの工程と成果物マップ
ここからは、実際に手を動かす順番で全体像を示します。ポイントは、いきなり生成を始めないことです。生成は反復が必要な工程なので、上流で決めておくべきことを決めてから入るほうが、結果的に速く安く仕上がります。
- 企画設計:目的、配信先、尺、トーン、成功条件を決める。成果物は企画メモ1枚。
- 脚本とショットリスト:カット割り、各カットの尺、動作、セリフ、テロップを表にする。成果物はショットリスト。
- キーフレーム作成:主要カットの静止画、または参照用の画像を用意する。成果物は参照画像セット。
- 動画生成:カットごとにクリップを生成し、複数テイクから選ぶ。成果物はクリップ群。
- 音声と編集:音声合成、BGM、効果音、カット編集、字幕を入れる。成果物は編集タイムライン。
- 品質検査と納品:破綻チェック、権利確認、書き出し設定の確認。成果物は最終マスター。
上流工程ほど手戻りのコストが高い
生成が速いと、つい「作りながら考えよう」となりがちです。しかし、尺が決まっていないまま生成すると、必要なクリップの長さが後から変わり、作り直しになります。配信先が決まっていないと、アスペクト比の変更で構図が破綻します。トーンが決まっていないと、カットごとに色味がばらつきます。
経験的には、制作時間のおよそ3割から4割を工程1と2に使うのが、最終的な手戻りを最も減らします。逆に、工程1と2を10分で済ませて生成に飛び込むと、途中で方向転換が起き、結果として何倍もの時間を使うことになります。
受け渡しの型を決めておく
複数人で進める場合、工程間の受け渡し形式を固定します。ショットリストは表計算で統一し、列の意味を変えない。参照画像はファイル名にカット番号を入れ、命名規則を揃える。生成クリップはカット番号とテイク番号を含む名前で保存する。この単純な規律が、後の選別と差し替えを劇的に楽にします。
企画とショットリスト:生成前の設計が8割を決める
用途別の尺とアスペクト比の目安
縦型ショート(SNS・ショート動画):15秒から30秒、9:16。1カット2秒から4秒。テンポ重視で、テロップ前提。
商品紹介:30秒から60秒、16:9または1:1。商品のクローズアップと使用シーンを交互に。
解説・教育:3分から8分、16:9。章立てが必要で、図解やテロップの比重が高い。
広告・プロモーション:15秒または30秒、16:9と9:16の両方を設計。
社内・プレゼン用:1分から3分、16:9。ナレーション主体で、映像は補助。
尺が決まると、必要なカット数が逆算できます。15秒でテンポの速い編集なら6から10カット、30秒の落ち着いた構成なら5から8カットが目安です。逆算せずに生成すると、クリップが足りないか、余りすぎて使われないかのどちらかになります。
ショットリストに書くべき10項目
- カット番号:編集時の管理単位。
- 尺:目標秒数。生成では多少前後するので、許容範囲も書く。
- 被写体:誰が、何が、どこにいるか。人数と服装まで。
- 動作:そのカットで起きることは1つだけ。
- カメラ:位置(目線の高さ、俯瞰、ローアングル)、動き(固定、パン、ドリー、ハンドヘルド)、レンズ感(広角、標準、望遠)。
- 照明:時間帯、光源の方向、硬さ、色温度。
- 背景:場所、天候、背景の要素、避けたい要素。
- スタイル:実写調、アニメ調、フィルムグレイン、色彩のトーン。
- セリフ・テロップ:読み上げる文言、表示する文言。
- 音:BGMの雰囲気、効果音、環境音。
この10項目のうち、5番と8番を省略する人が最も多く、それが「思ったのと違う映像」の主因になります。カメラとスタイルは、モデルが最も解釈に迷う領域だからです。
「1カット1アクション」の原則
1つのカットに複数の動作を入れると、生成はどちらかを犠牲にします。「人物が歩きながら振り返って扉を開ける」という1カットは、3つのカットに分けたほうが成功率が上がります。分割したうえで編集でつなげば、見た目は1カットのように見せられます。生成の世界では「ワンカット・ワンアクション」が基本原則です。
プロンプト設計:映像モデルに伝わる指示の書き方
基本の5要素テンプレート
プロンプトは、次の5要素を順に並べると安定します。
被写体+動作+カメラ+照明+スタイル
例:若い女性が白いシャツを着て、窓辺に座って静かに本を閉じる。カメラは目線の高さでゆっくりドリーイン。午後の柔らかい自然光が横から差し込む。実写調、浅い被写界深度、落ち着いた暖色トーン。
この形にすると、モデルは「何が」「何をして」「どう撮られ」「どう照らされ」「どんな質感か」を順に処理できます。逆に、要素を混ぜて書くと、優先順位が曖昧になり、結果がばらつきます。
一貫性を固定する3点セット
複数カットで同じ人物や同じ空間を出したい場合、次の3つを固定します。
参照画像:主要な人物や空間の参照を用意し、各カットの生成時に併用する。
記述テンプレート:人物の記述(年齢感、髪型、服装、体格)と空間の記述(家具、壁の色、窓の位置)を毎回同じ文言で書く。
乱数の固定:シード値が指定できる場合は固定し、変化させたい部分だけを書き換える。
この3点を守るだけで、カット間の人物の同一性は大きく改善します。特に「服装の記述を毎回変えてしまう」という失敗が多く、色や素材の単語ひとつで別人のようになります。
避けたい表現とネガティブ指示
ネガティブ指示(出したくない要素の指定)は有効ですが、万能ではありません。多用すると、モデルが混乱して全体的な品質が落ちることがあります。優先度の高い2つから4つに絞るのが実務的です。
たとえば、人物主体のカットなら「余分な手指の破綻、文字の混入、顔の歪み」程度に留める。街並みのカットなら「読める文字、ロゴ、不自然な反射」を指定する。何でも禁止リストに入れるのではなく、そのカットで本当に困るものだけを書きます。
プロンプトのバージョン管理
プロンプトは資産です。うまくいったプロンプトは、メモアプリではなく、ショットリストと同じ表に残します。列としては「カット番号/プロンプト本文/使用モデル/パラメータ/採用テイク/気づき」の6つで十分です。
この記録があると、別の案件で似たカットが必要になったときに、ゼロから書き直す必要がなくなります。また、モデルを切り替えたときに「何が変わったか」を比較できます。記録を取らないチームは、毎回同じ失敗を繰り返します。
モデルとパラメータの選定基準
ジャンル別の選び方
実写調・シネマティック:光の扱いと質感表現が得意なモデルを選ぶ。人物の顔立ちの自然さと、肌の質感を最優先で比較する。
アニメ・イラスト調:線の安定性とキャラクターの同一性を重視。動きの誇張が映えるモデルと、静止画的な美しさが得意なモデルは別物。
商品・モーショングラフィックス:形状の維持と、無機物の動きの正確さが重要。回転や質感の反射が破綻しないかをテストする。
自然・風景:パーティクル(雲、煙、水しぶき、葉の揺れ)の自然さで選ぶ。
解像度・フレームレート・尺のトレードオフ
解像度を上げるほど、生成にかかる時間と計算資源は増えます。最終的な配信先が縦型ショートであれば、最初から4Kで作る必要はありません。1080p相当で作り、必要なカットだけ高解像度にする、という段階的な進め方が現実的です。
フレームレートも同じです。24fpsは映画的な質感、30fpsは一般的な配信、60fpsはゲームやスポーツ的な滑らかさに向きます。ただし、生成モデルによって得意なフレームレートは異なるため、編集で変換する前提を持つと安全です。
生成時間と計算コストの見積もり
見積もりの基本は「1カットあたりの生成回数 × カット数」です。1カットにつき3テイク生成して選ぶなら、10カットの動画で30回の生成が発生します。ここに失敗による再生成を2割から3割上乗せして見積もります。
コストを抑える方法は3つあります。第一に、尺を短くする。第二に、テイク数を減らすために上流の設計を詰める。第三に、低解像度で構図と動きを確認し、採用が決まったカットだけ高解像度で再生成する。特に第三は効果が大きく、試行錯誤の段階では解像度を落とすのが定石です。
モデルを乗り換える判断基準
同じモデルを使い続けるべきか、切り替えるべきかの判断は、次の3点で行います。破綻率が一定以下に収まっているか。表現の幅が企画に対して不足していないか。生成時間が制作サイクルに収まっているか。
この3点のどれかが明確に破綻している場合のみ乗り換えます。単発の失敗で切り替えると、学習コストが毎回発生し、結果的に品質が下がります。乗り換えた場合は、同じショットリストで比較テストを行い、記録に残します。
音声・字幕・編集:生成物を作品に変える
音声合成の選び方と語速
ナレーションを入れる場合、声質は「情報の種類」に合わせます。解説は落ち着いた中低音、商品紹介は明るめ、ドラマ風は感情の起伏がある声。語速は1分あたり300文字前後が聞き取りやすい目安ですが、字幕を併用する場合は少し遅めにします。
読み上げ原稿は、書き言葉のまま読ませると不自然になります。「〜である」を「〜です」に変える、数字を読み方どおりに書く、英単語はカタカナに直す。この調整だけで、聞き取りやすさが大きく変わります。
BGMと効果音のレイヤリング
音は3層で考えます。ナレーション、BGM、効果音です。BGMはナレーションの邪魔をしない帯域に抑え、話している間は音量を下げます。効果音は画面のアクションに合わせ、鳴らしすぎないこと。1カットに2つ以上の効果音を入れると、情報過多で疲れる映像になります。
カットのテンポとトランジション
生成クリップは、そのままの長さで使えることは稀です。テンポを作るには、動きの「入り」と「終わり」で切ります。手が動き始める直前から切り、動きが止まった直後で切ると、つなぎが自然になります。
トランジションは最小限にします。ディゾルブやワイプを多用すると、ごまかしに見えます。カットの切り替えだけで十分に成立させ、章の変わり目など意味のある箇所にだけトランジションを置きます。
字幕とモバイル最適化
縦型では、画面の上3分の1と下3分の1がUIに隠れる前提で設計します。字幕は中央やや上、1行あたり全角12文字から16文字。2行まで。テロップの表示時間は最低1秒、読み終わる前に消さないこと。
重要なのは、字幕を「後から足すもの」ではなく、ショットリストの段階で設計に入れることです。字幕の位置が決まっていれば、生成時にその領域を空けて構図を作れます。
カラーとグレインで統一感を出す
カットごとに生成すると、色温度とコントラストが微妙にずれます。編集の最後に、全体へ同じカラー調整を適用し、必要なら軽いフィルムグレインを重ねます。これだけで「同じ作品」に見えるようになります。逆に、カットごとに個別の色調整をすると、ばらつきが目立って粗く見えます。
品質管理チェックリストと破綻パターン
よくある破綻パターン7種
- 手指の破綻:指の本数、関節の向き、手首のつながり。
- 顔の変化:目や口の形がカット内で変わる、左右非対称が激しくなる。
- 文字の崩れ:看板、本の背表紙、画面内のテキストが意味不明な記号になる。
- 物理の破綻:影の向きが光源と合わない、物が浮く、水が跳ねない。
- 背景の溶け:人物の輪郭と背景が混ざる、背景の要素が消える。
- ループの継ぎ目:最後のフレームと最初のフレームがつながらない。
- リップシンクのずれ:口の動きと音声が一致しない。
納品前チェックリスト
・冒頭1秒で内容が伝わるか
・音量が全カットで揃っているか
・字幕の誤字脱字、表記の統一
・縦型でUIに隠れる位置に重要情報がないか
・カット間に不要な黒味やフラッシュがないか
・画面内に意図しないロゴや文字が写っていないか
・人物の同一性が作品全体で保たれているか
・色味が全カットで統一されているか
・音声と映像の同期
・書き出し設定(解像度、ビットレート、音声形式)
・ファイル名と納品形式の確認
・使用素材の権利とライセンス
・実在の人物やブランドに似ていないか
・誇大表現や断定表現がないか
レビューの観点を分ける
レビューは「技術」「演出」「法務」の3つに分けます。混ぜると、指の破綻を指摘しながら構成の話をして、結局何を直すのか分からなくなります。技術は破綻の有無、演出はテンポと伝達、法務は権利と表現。担当と順番を決めておくと、修正が速くなります。
トラブルシューティング:症状別の対処
動きが不自然・カクつく
原因は3つ考えられます。動作が複雑すぎる、フレームレートが合っていない、カットが短すぎる。まず動作を1つに絞り、次に生成のフレームレート設定を確認し、それでも改善しなければ尺を伸ばします。1秒や2秒のカットで複雑な動きを求めると破綻しやすくなります。
キャラクターが毎回変わる
記述のゆれが最大の原因です。「白いシャツ」と「白いブラウス」は別の服装として解釈されます。人物の記述をテンプレート化してコピー&ペーストで使い回し、参照画像を併用し、乱数を固定します。それでも変わる場合は、カットを減らして同一カット内で見せる構成に変えるのも手です。
文字やロゴが崩れる
生成モデルは一般に、意味のある文字を正確に描くのが苦手です。対策は「生成に文字を任せない」ことです。看板や画面内の文字が必要な場合は、文字のない状態で生成し、編集でテロップや画像を重ねます。どうしても必要な場合は、文字が小さくボケている構図に逃げるのが現実的です。
生成が遅い・試行回数が膨らむ
試行回数が膨らむ原因は、合格基準が曖昧なことです。事前に「この条件を満たせば採用」を決めます。たとえば、人物の顔が同一であること、手の破綻がないこと、カメラの動きが指定どおりであること、の3点。これを満たした最初のテイクを採用し、完璧を求めない。この割り切りが制作速度を決めます。
音と映像のずれ
音声合成の音声は、生成クリップと別に作るため、尺が合わないことがあります。対策は、音声を先に作り、その長さに合わせてカットを組むことです。映像を先に作って音を合わせると、どうしても無理が生じます。ナレーション主体の動画では、音声が主、映像が従と考えるほうが安定します。
ケーススタディとチーム運用の仕組み化
ケース1:縦型ショート(15秒・9:16)
構成は、つかみ3秒、展開8秒、締め4秒。カット数は7。工程1と2に30分、生成に60分、編集に45分が目安です。テロップは全カットに入れ、音声は入れないか最小限にします。最初の1秒で最も強い映像を置くため、最後に生成したカットを冒頭に持ってくる編集も有効です。
ケース2:商品紹介(30秒・16:9)
構成は、課題提示5秒、商品登場8秒、使用シーン10秒、締め7秒。カット数は6から8。商品の形状を維持するため、生成は背景と光だけに使い、商品自体は撮影素材やCGを合成する方法が安全です。生成に任せる部分と撮影する部分を最初に分けるのが成功の鍵です。
ケース3:解説動画(3分・16:9)
構成は章立て3つから4つ。ナレーションを先に完成させ、その音声に合わせてカットを割り当てます。映像は雰囲気を作るイメージカットが中心で、情報は図解とテロップが担います。カット数は20前後になりますが、同じ参照画像と記述テンプレートを使い回すため、1カットあたりの設計コストは下がります。
チームで回すための仕組み
属人化を防ぐには、3つのテンプレートを用意します。ショットリストのテンプレート、プロンプトのテンプレート、納品前チェックリストです。これらを毎回コピーして使うだけで、担当が変わっても品質の下限が保たれます。
また、権利と表現の方針も文書化します。実在の人物や既存ブランドに似せない、生成物であることの表記が必要かどうかを確認する、使用素材のライセンスを記録する。この3点を案件開始時に確認する習慣をつけておくと、公開直前の手戻りを防げます。
FAQ
まったくの初心者でも作れますか
作れます。ただし、最初から長い動画を狙うと挫折しやすいので、5秒から10秒の1カットから始めてください。1カットを納得いくまで作り、次に3カットをつなげる、という順序で進めると、どこでつまずいているのかが明確になります。
日本語のプロンプトでも大丈夫ですか
多くのモデルは日本語の指示を理解しますが、細かい映像用語や質感の表現は英語のほうが精度が高い傾向があります。実務的には、日本語で内容を書き、重要なカットだけ英語に直して比較する方法が効率的です。どちらを使うにしても、5要素の順番を守ることが重要です。
実写撮影はもう不要ですか
用途によります。人物の証言、実際の店舗、手に持った質感、正確な文字やロゴが必要な場面では撮影が有利です。一方で、概念の可視化、イメージカット、プリビズ、SNSの量産では生成が有利です。両者を組み合わせる前提で企画を立てるのが現実的です。
何本作れば上達しますか
10本から15本が目安です。ただし、同じやり方を繰り返すだけでは伸びません。1本ごとに「どのカットで手戻りが起きたか」を記録し、次の案件でその工程を先に固める。この振り返りを伴う反復が、上達の速度を決めます。
生成物の品質が安定しません
安定しない最大の原因は、記述のゆれと合格基準の曖昧さです。人物と空間の記述をテンプレート化して固定し、採用条件を3点に絞る。この2つを実行するだけで、ばらつきは大きく減ります。
商用利用や権利はどう考えればよいですか
利用するツールの規約、使用した参照画像の権利、実在人物やブランドとの類似性、生成物であることの表示義務。この4点を案件ごとに確認します。判断に迷う場合は、法務やクライアントと公開前にすり合わせるのが安全です。
音声は自分で録るべきですか
短い尺で信頼感が重要な場合は、自分の声のほうが有利です。長尺のナレーションや多言語展開、修正が多い案件では音声合成が効率的です。どちらの場合も、音声を先に固めてからカットを組むと、編集の手戻りが減ります。


