Limited Time Sale: Get 30% OFF on Next-Gen AI Video Creation 🎉

テキストから動画を作るAI動画生成ワークフロー:プロンプト設計から編集まで

Sep 14, 2026

AI動画生成で制作の前提はどう変わったか

テキストから動画を生成する技術は、実験的なデモの段階を越えて、日々の制作フローに組み込めるレベルに達した。最も大きな変化は、工程の順番が入れ替わったことだ。従来は「撮影してから編集で意味を作る」流れだったが、いまは「言葉で設計し、映像を起こし、編集で整える」流れが現実的な選択肢になっている。

撮影できない画、予算が下りない画、天候に左右される画。そうした制約が理由で絵コンテの段階で没になっていたアイデアが、テキスト記述だけで映像として立ち上がるようになった。これは単なる時短ではなく、企画の幅そのものを広げる変化だ。

一方で、変わらないものもある。企画の解像度、カット割りの意図、音の設計、テンポの作り方。生成技術がどれだけ進歩しても、作品の良し悪しを決める中心はここにある。生成AIは「撮れない絵を手に入れる手段」であって、構成を代わりに考えてくれる存在ではない。したがって、うまく使う人ほど、生成の前に紙とペンで考える時間を増やしている。

この記事では、テキストから動画を作る一連の流れを、企画から書き出しまで通しで解説する。特定のツールに依存しない形で、モデルの選び方、プロンプトの書き方、一貫性の保ち方、音の作り方、よくある失敗と対策まで扱う。これから始める人は、まず全体像をつかみ、自分の用途に必要な工程だけを深掘りしてほしい。

テキストから動画を作る全体ワークフロー

生成AIの動画制作は、大きく5つの工程に分かれる。この順番を守るだけで、手戻りの回数が大きく減る。

ステップ1:目的と尺を先に固定する

最初に決めるのは、ツールではなく着地点だ。縦型か横型か、尺は何秒か、どこで再生されるのか。SNSの縦型ショートなら9:16で15〜30秒、プレゼン用なら16:9で60〜90秒、Web広告なら6秒と15秒の2バージョン、といった具合に数字で決め切る。

尺が決まると、必要なカット数が逆算できる。1カット2〜3秒なら30秒で10〜14カット、60秒で20〜25カットが目安になる。ここを曖昧にしたまま生成を始めると、良い素材が取れても尺に収まらず、結局作り直しになる。

ステップ2:絵コンテとショットリストを作る

次に、各カットを一行で書き出す。主語・動作・場所・カメラの4要素があれば十分だ。

  • カット1:早朝の駅のホーム、通勤者が足早に歩く、引きの固定
  • カット2:手元のスマートフォン、通知が光る、寄り
  • カット3:オフィスの窓、雨、ゆっくりパン

この段階では映像の美しさを追求しない。「どのカットが物語を前に進めるか」だけを考える。削れるカットはここで削る。生成は1カットにつき数回の試行が必要になるため、カット数を減らすことがそのまま制作時間の短縮につながる。

ステップ3:生成と選別を分離する

生成と選別を同時にやると判断が鈍る。まず全カットを一気に生成し、後から見返して選ぶほうが効率がよい。1カットにつき3〜5案を出し、動きの自然さ、構図、破綻の少なさで絞る。

選別の基準は明文化しておくとぶれない。たとえば「1. 破綻がない 2. 意図した構図に近い 3. 動きが滑らか 4. 前後カットと色味がつながる」の順で評価する。完璧な案が出ることは少ないので、7割の出来で採用し、残りは編集で補う前提を持つ。

ステップ4:編集で時間軸を作る

生成したクリップは、それ単体では意味を持たない。並べ替え、長さを調整し、つなぎ方でリズムを作る。ここが映像制作の本質であり、AIが代替しにくい領域だ。

ステップ5:書き出しと展開

最終書き出しは、配信先ごとに解像度・ビットレート・アスペクト比を変えて複数用意する。同じ素材から縦型・横型・正方形を作っておくと、後からの再利用が効く。

モデル選定の判断基準

生成モデルは日々入れ替わるが、選び方の基準はそれほど変わらない。以下の観点で比較すると、流行に振り回されにくくなる。

リアリズムと質感

実写調を狙うなら、肌の質感、髪の動き、布のしわ、背景の被写界深度がどこまで自然かを確認する。人物のアップが多い企画では、顔の安定性が最重要になる。逆に風景や物撮り中心なら、テクスチャの解像感を優先したほうがよい。

スタイルの再現性

アニメ調、水彩、フィルムグレイン、3DCG風など、スタイルを固定したい場合は、同じプロンプトで同じ雰囲気が出るかをテストする。スタイルの再現性が低いモデルは、シリーズものに向かない。

モーションの量と制御

動きの大きさはモデルごとに癖がある。大きなアクションを得意とするもの、微細な表情変化に強いもの、カメラワークの指示に忠実なもの。カメラ指示(寄り、引き、パン、ドリー、オービット)がどこまで効くかは、最初に必ず試しておきたい。

扱える尺と連続生成

1回の生成で得られるクリップの長さはモデルによって異なる。長尺を一度に作れるモデルは便利だが、後半で破綻しやすい傾向もある。実務では「短いクリップを多数つなぐ」ほうが制御しやすい。

テキスト・手・細部の再現

看板の文字、ロゴ、指の本数、眼鏡のフレーム。こうした細部は破綻の温床になる。文字が重要な企画では、生成後に合成で差し替える前提で設計したほうが安全だ。

プロンプト設計の実践テクニック

基本の型を決める

もっとも再現性が高いのは、次の順で書く型だ。

  1. 被写体(誰・何か、年齢感、服装)
  2. 動作(何をしているか、動きの速さ)
  3. 場所と時間帯(屋内・屋外、朝・夕・夜)
  4. カメラ(画角、距離、動き)
  5. 光と色(光源の方向、色温度、雰囲気)
  6. スタイル(実写調、フィルム、アニメ調など)

例:30代の女性が白いシャツを着て、雨の窓辺に立ち、湯気の立つカップを両手で持つ。ミディアムショット、ゆっくりとしたドリーイン。窓からの柔らかな拡散光、寒色寄りの色調、浅い被写界深度、実写フィルム調。

カメラ用語は具体的に

曖昧な言葉は結果も曖昧になる。「かっこよく」ではなく「ローポジションからの見上げ、28mm相当、手持ちの揺れ」と書く。よく使う語彙を自分用に10個ほど決めておくと、指示が速く安定する。

  • 画角:ワイド、標準、望遠、マクロ
  • 距離:エクストリームロング、ロング、ミディアム、クローズアップ
  • 動き:固定、パン、ティルト、ドリー、オービット、ハンドヘルド
  • 速度:ゆっくり、一定、素早く

光と色で空気を作る

同じ構図でも光の指定で印象が大きく変わる。「逆光のゴールデンアワー」「曇天の拡散光」「ネオン反射の夜」「単一光源の硬い影」など、光源の性質と方向をセットで書く。色温度も「暖色寄り」「寒色寄り」「彩度低め」と明示すると安定する。

動きは1カット1アクション

複数の動作を1カットに詰め込むと破綻しやすい。「立ち上がって歩き出して振り返る」より、「立ち上がる」で1カット、「歩き出す」で1カットに分けたほうが成功率が高い。編集でつなげば、視聴者には連続した動作に見える。

除外したい要素を明示する

避けたい要素はネガティブ指定で伝える。手ぶれ、余分な人物、透かし、文字化け、過度な彩度、歪んだ手足など。モデルによって効き方が違うので、自分の定番リストを作っておく。

一貫性を保つ:キャラクター・世界観・カメラ

シリーズものやストーリー仕立てで最大の壁になるのが一貫性だ。カットごとに顔が変わる、服装が変わる、部屋の照明が変わる。これを抑えるには3つの方法がある。

参照画像を使う

テキストだけで人物を固定するのは難しい。基準となる静止画を1枚作り、それを参照として各カットを生成する。正面・斜め・横の3方向を用意しておくと、カメラアングルの変化に対応しやすい。

記述をコピーして使い回す

人物や場所の記述は、毎回ゼロから書かずテンプレート化する。「30代女性、肩までの黒髪、白シャツ、細いシルバーのネックレス」といった文字列を固定し、カットごとに変えるのは動作とカメラだけにする。

色と光を統一する

全カットに共通の色調指示を入れる。「寒色寄り、彩度低め、コントラスト中庸」など。編集段階でもカラー調整をそろえることで、別々に生成したクリップが同じ世界に見えるようになる。

場所の連続性をメモする

部屋の間取り、窓の位置、家具の配置。これらを文章でメモし、各カットのプロンプトに含める。地味な作業だが、破綻を防ぐ効果は大きい。

音声・BGM・ナレーションの組み立て

映像の印象は音で半分決まる。生成映像は無音なので、音の設計は必須工程だ。

ナレーション

音声合成で読み上げを作る場合、尺に合わせて原稿を調整する。日本語は1分あたり300〜350文字が目安。原稿を先に書き、読み上げ時間を測ってからカット割りを合わせると、後戻りが減る。

環境音と効果音

足音、雨音、街の喧騒、扉の開閉。こうした環境音を薄く敷くだけで、生成映像の説得力が大きく上がる。カットの切り替えに短い効果音を重ねると、つなぎの粗さが目立たなくなる。

BGM

BGMは要素を増やしすぎない。テンポと雰囲気が合っていれば、派手な曲でなくても十分機能する。ナレーションがある場合は、BGMを6〜10dB下げて声の帯域を空ける。

リップシンク

人物が話すカットは、リップシンク処理を使うと印象が大きく変わる。ただし口元の動きと音声がずれると逆効果なので、まず短い1文でテストし、問題がなければ本番に進む。

編集とポストプロダクション

つなぎの設計

生成クリップは動きの始点と終点が揃わないことが多い。そのまま並べると不自然になるため、カットの切り位置を工夫する。動作の途中で切る、寄り→引きで切り替える、暗転やフラッシュを挟む、といった定番の処理が有効だ。

長さの調整

速いテンポなら1カット1.5〜2秒、落ち着いた演出なら3〜4秒。同じ素材でも尺を変えるだけで印象が変わる。一度通しで見て、間延びしているカットを半分の長さにしてみる。

カラー調整

全カットに共通のカラー調整をかける。コントラスト、彩度、色温度をそろえるだけで、別々に生成した素材が同じ作品に見えてくる。

アップスケールとノイズ処理

必要に応じてアップスケールやノイズ除去をかける。ただし強くかけすぎると質感が失われるので、等倍で見て不自然にならない範囲にとどめる。

テロップとグラフィック

文字は生成に頼らず、編集ソフトで載せる。フォント、行間、余白を決めておけば、シリーズ化しても作業が安定する。

用途別ワークフロー例

SNSショート(15〜30秒)

カット数8〜12。冒頭1秒で結論かインパクトを出す。縦型9:16、テロップは画面中央から上寄り。生成は速さ優先で、細部の破綻はテロップと音でカバーする。1本作ったら同じ構成で3本展開し、反応を見る。

製品紹介(30〜60秒)

カット数15〜20。背景を統一し、製品だけは実写素材または静止画合成を使うと信頼感が保てる。生成は背景・空間・ライフスタイルシーンに限定し、製品そのものは別処理にするのが安全だ。

解説・チュートリアル動画(3〜8分)

生成映像は導入と場面転換に使い、本編は画面収録と図解で構成する。長尺では生成の一貫性を保つのが難しいため、生成クリップは5秒以内に抑える。

ストーリーテリング(1〜3分)

カット数20〜30。人物の参照画像を最初に固め、全カットで共通の記述を使う。感情の山場に尺を長めに配分し、それ以外は短く刻む。音の設計に最も手間をかけるべきジャンルだ。

よくある失敗と対策

失敗1:プロンプトが長すぎる

要素を詰め込みすぎると、モデルがどれを優先すべきか判断できず、全部が中途半端になる。1カットにつき強調点は2つまで。残りは編集で足す。

失敗2:生成回数で解決しようとする

品質が上がらないとき、回数を増やしても同じ結果が続くことが多い。原因は多くの場合プロンプトの構造かモデルの選択だ。書き方を変える、モデルを変える、参照画像を足す、の3つを先に試す。

失敗3:カット間の色味を無視する

1カットずつ見ると良くても、並べると色がバラバラで別作品のように見える。共通の色調指定と編集でのカラー調整を必ず入れる。

失敗4:音を後回しにする

映像だけを完成させてから音を考えると、尺と間が噛み合わない。ナレーション原稿とBGMのテンポは、絵コンテの段階で決めておく。

失敗5:手・文字・反射を軽視する

手指、看板の文字、鏡や窓の反射は破綻しやすい。これらが重要なカットは、構図を変える、寄りを避ける、合成で差し替える、といった回避策を先に決めておく。

失敗6:完成度を上げすぎようとする

生成映像は8割の出来で採用し、残りを編集と音で補うほうが、結果的に作品の完成度は上がる。1カットに何十回も試行するより、全体を1本通すことを優先したい。

FAQ

テキストだけで思い通りの映像は作れますか?

短いカットであれば十分可能です。ただし長い尺や複雑な动作の連続は難しいため、短いクリップに分割し、編集でつなぐ前提で考えるのが現実的です。

日本語のプロンプトと英語のプロンプト、どちらが良いですか?

モデルによって得意な言語が異なります。まず日本語で試し、意図が伝わりにくい場合は英語に翻訳して比較してください。固有名詞やカメラ用語は英語のほうが安定することがあります。

1カットは何秒くらいが目安ですか?

2〜4秒が扱いやすい範囲です。5秒を超えると後半で破綻しやすくなり、10秒を超えると制御が難しくなります。長回しが必要な場合も、短いクリップをつないで長く見せる方法を検討してください。

人物の顔が毎回変わってしまいます。

参照画像を用意し、人物の記述をテンプレート化して全カットで固定してください。それでも揺れる場合は、顔のアップを減らし、引きや後ろ姿、手元のカットで構成を組む方法が有効です。

生成した映像は商用利用できますか?

利用条件はツールごとに異なります。利用規約、生成物の権利、学習データに関する記載を必ず確認し、必要に応じて法務に相談してください。ここは自己判断で進めないほうが安全です。

編集ソフトは何を使えばよいですか?

無料のものでも、カット編集、テロップ、カラー調整、音声のミックスができれば十分です。高度な合成やカラーグレーディングが必要になった段階で、上位のツールに移行すれば遅くありません。

音声合成とリップシンクは必須ですか?

必須ではありません。ただし人物が話すカットがある場合、音声と口の動きが合っていないと違和感が残ります。ナレーション中心の構成にして、話している顔を映さないという選択も有効です。

どのくらいの時間で1本作れますか?

15〜30秒の縦型ショートで、慣れれば数時間から1日程度が目安です。ただし初回は試行錯誤で倍以上かかると見込んでください。2本目以降はプロンプトと参照画像を使い回せるため、速度が大きく上がります。

まとめ

テキストから動画を作る作業は、魔法のボタンを押す行為ではない。企画を数字に落とし、カットを一行で書き、生成と選別を分け、音と編集で意味を与える。この流れを一度作ってしまえば、あとは速くなる。

最初に取り組むべきは、ツールを増やすことではなく、自分の定番の型を作ることだ。プロンプトのテンプレート、選別の基準、共通の色調、音の設計方針。この4つをメモにまとめておけば、モデルが入れ替わっても制作の質は落ちない。

そして忘れないでほしいのは、生成映像は素材であって作品ではないということだ。編集でリズムを作り、音で空気を作り、構成で意味を作る。その工程を丁寧にやる人ほど、AI動画生成は強い武器になる。

Alexander

Alexander