AIを使えば、頭の中にある物語を映像にするまでの距離が大きく縮まる。少し前まで、脚本・絵コンテ・撮影・編集・音声をそれぞれ別の専門家に依頼する必要があった工程を、いまは一人でも最後まで通せる。ただしAIは魔法の箱ではない。物語の核が曖昧なまま生成を始めると、カットは大量に量産できても作品にはならない。
この記事では、企画の固め方から脚本、絵コンテ、ショット生成、音声統合、編集、書き出しまでを一本のパイプラインとして整理する。特定のツールに依存しない形で説明するので、どの生成モデルを使っていても応用できる。読み終えたときには、自分の物語を「どの順番で、何を決めながら」映像にすればよいかが具体的に見えているはずだ。
AIによる映像化ワークフローの全体像
AI映像制作の最大の特徴は、工程が一直線ではないことだ。従来の制作は「脚本→撮影→編集」という一方通行に近かったが、AI制作はループ構造になる。生成したカットを見て脚本のトーンを修正し、修正した脚本に合わせて絵コンテを描き直し、また生成する。この往復をどれだけ早く回せるかが、完成度を左右する。
全体は大きく7つの段階に分かれる。
- 企画設計:ログライン、テーマ、尺、配信先、想定視聴者を決める
- 脚本:シーン分割、ビート、台詞、ト書きを書く
- 絵コンテとショットリスト:カット割り、アングル、動きを設計する
- ビジュアル設計:キャラクターシート、配色、画風の基準を作る
- ショット生成:静止画または動画を生成し、使えるカットを選別する
- 音声:ナレーション、台詞、効果音、BGMを用意する
- 編集と書き出し:テンポを整え、音量を揃え、解像度を確定する
重要なのは、最初の2段階に投じる時間を惜しまないことだ。AI生成は後半の工程を劇的に速くするが、前半が雑だと「速く失敗する」だけになる。経験上、5分尺の作品なら企画と脚本に全体の3割以上の時間を使うほうが、最終的な手戻りは少なくなる。
従来制作とAI制作の違い
従来の制作では、撮影できないものは描くか、諦めるかだった。AI制作では、書いた文章がそのまま映像候補になる。逆に、撮影の制約がないぶん「何を映すか」の判断がすべて自分に戻ってくる。カメラの位置も、光の当たり方も、俳優の表情も、すべて指示しなければならない。自由度が高いということは、決めるべきことが増えるということでもある。
反復を前提にした設計
最初から完璧なカットを狙うより、同じシーンを複数パターン生成して選ぶ前提で動いたほうがよい。1カットにつき3〜5案を作り、その中から選ぶ。選んだ理由をメモしておくと、後で追加カットが必要になったときに一貫性を保ちやすい。
企画の設計:生成を始める前に決めること
生成モデルに何を渡すかを決める前に、作品として何を作るかを決める。ここを飛ばすと、どんなに映像が綺麗でも「断片の寄せ集め」になる。
ログラインとテーマ
ログラインは1〜2文で書く。「誰が、何を望み、何に阻まれ、どうなるのか」の4要素が入っていれば十分だ。テーマはもう少し抽象度が高く、「喪失後の再出発」「テクノロジーと孤独」といった形で言語化しておく。テーマはカット選びの判断基準になる。迷ったときは「このカットはテーマに近づいているか」で決めればよい。
尺とカット数の目安
尺が決まれば、必要なカット数が逆算できる。目安として、会話中心のシーンは1カット3〜6秒、アクションは1〜3秒、風景や導入のカットは4〜8秒が扱いやすい。
- 30秒:8〜15カット
- 1分:18〜30カット
- 3分:50〜90カット
- 10分:150〜280カット
生成AIは1カットあたり数秒の出力が中心なので、長尺作品は必然的にカットの積み重ねになる。この前提でショットリストを設計しておくと、後工程で慌てない。
配信先とアスペクト比
縦型ショート、横型の長尺、正方形のSNS投稿では、同じ脚本でも絵の作り方が変わる。縦型は人物の上半身と顔が主役になり、背景の情報量は絞られる。横型は空間の広がりや群衆表現が活きる。最初に決めておかないと、生成後にトリミングで構図が崩れる。
脚本をAIで書く:プロンプト設計の実践
脚本作成は、物語の骨格を決める工程だ。AIに丸投げするのではなく、構造を指定して書かせるのがコツになる。
シーン分解とビート設計
まず物語をシーンに分ける。各シーンには「目的」を一行で書く。そのうえで、シーン内をビート(感情や情報の変化点)に分割する。ビートは3〜5個が扱いやすい。たとえば「日常→違和感→決断→代償」のように、感情の動きを並べる。
AIへの指示は次のような形が実用的だ。
「3分の短編。主人公は引っ越し直後の女性。テーマは『場所属感の再構築』。シーンは6つ。各シーンに目的、感情の変化、尺の目安、必要なカット数を箇条書きで示す。台詞は1シーンにつき3行以内。比喩表現は使わず、視覚化できる行動で書く」
ポイントは「視覚化できる行動で書く」という制約だ。AIは内面描写を好むが、内面は映像にならない。手が震える、目を逸らす、ドアを閉める、といった行動に変換させる。
台詞の自然さを引き出す
AIの台詞は説明過多になりやすい。対策は3つある。第一に、1行の文字数を短く指定する。第二に、台詞で説明させず、映像で見せる部分を明示する。第三に、生成後に声に出して読む。読んで不自然な箇所は、どれだけ映像が良くても観客を冷めさせる。
ト書きとカメラ指示
脚本の段階でカメラの意図を書き込んでおくと、絵コンテ工程が楽になる。「ゆっくり寄る」「背後から回り込む」「手元のアップから顔へ」など、動きの方向まで書く。ただし、生成モデルが対応できる動きには限界があるので、複雑な動きは分割して考える。1カット1モーションが原則だ。
よくある失敗
- 主人公の目的が途中で変わる:序盤で目的を固定し、最後まで一貫させる
- 尺に対してシーンが多すぎる:1シーンあたり20〜30秒を目安に削る
- 台詞で感情を説明する:行動と表情に置き換える
- 映像化不可能な比喩を使う:「心の嵐」ではなく「窓を叩く雨」にする
絵コンテとショットリストの作り方
脚本が決まったら、カット単位に分解する。ここが映像化の設計図になる。
ショットリストの項目
最低限、次の項目を表形式で管理するとよい。
- カット番号
- シーン番号
- 内容(1行)
- アングル(俯瞰、水平、あおり)
- ショットサイズ(顔のアップ、上半身、全身、引き)
- カメラの動き(固定、パン、寄り、引き、回り込み)
- 尺
- 生成方法(画像から動画、動画のみ、既存素材の加工)
- 使用ツール
- 状態(未着手、生成済み、採用、却下)
この表があるだけで、どこまで進んだかが一目でわかる。長尺作品では、カットの管理がそのまま品質管理になる。
キャラクターの一貫性を保つ
AI映像で最も崩れやすいのが人物の同一性だ。対策は「基準画像を先に作る」ことに尽きる。正面、斜め45度、横顔、全身の4枚を用意し、髪型、服装、体格、年齢感を固定する。生成時は毎回この画像を参照させ、テキストでも特徴を繰り返し記述する。
服装はシーンごとに変えてもよいが、髪型や骨格は変えない。観客は顔よりも「輪郭と髪」で人物を識別しているためだ。
画風の基準を作る
色温度、コントラスト、レンズ感、粒子の粗さを最初に決める。同じ作品内で色味がばらつくと、どれだけ各カットが美しくても素人っぽく見える。基準となるカットを1枚決め、「この色調に合わせる」と毎回指示するのが効果的だ。
動画生成モデルの選び方
モデルは用途で選ぶ。万能なものは存在しない。
タイプ別の分類
- テキストから動画:プロンプトだけで短いカットを作る。導入や風景、抽象表現に向く
- 画像から動画:基準画像の動きを制御できる。キャラクター作品の主力になる
- モーション制御型:参照動画の動きを別のキャラクターに移す。ダンスやアクションに向く
- 編集特化型:生成済みカットの一部を差し替える、不要物を消す、表情を変える
- 音声同時生成型:映像と効果音・環境音をまとめて出す。テンポの速い編集に向く
判断基準
モデル選びで見るべきは、次の5点だ。
- 一貫性:同じ人物を複数カットで保てるか
- 動きの自然さ:歩行、手の動き、関節の破綻が少ないか
- カメラ制御:寄り・引き・回り込みを指示できるか
- 尺:1回の生成で何秒出せるか
- 修正のしやすさ:部分的な再生成ができるか
解像度や見た目の派手さより、修正のしやすさを優先したい。制作の8割は修正だからだ。
使い分けの実例
導入の風景はテキストから動画、主人公の会話シーンは画像から動画、回想のダンスはモーション制御型、最後の1カットだけ音声同時生成型、というように混ぜて使う。1本の作品で複数モデルを使うことはもはや標準であり、混在による色味の差は編集で揃えればよい。
生成したカットを「使える素材」に仕上げる
生成しただけのカットは、まだ素材だ。ここから作品の部品に変えていく。
選別の基準
まず、採用・保留・却下の3段階で仕分ける。判断は「動きの破綻がないか」「構図が意図どおりか」「前後のカットと色が合うか」の3点。完璧でなくても、後処理で直せるものは保留に回す。
モーション制御と動きの調整
動きが速すぎる、遅すぎるという問題は非常によく起きる。対策は、生成時の指示に速度を含めることだ。「ゆっくり歩く」「静止したまま瞬きだけ」「風で髪が揺れる程度」のように、動きの量を言葉で制限する。それでも合わない場合は、編集で速度を0.8〜1.2倍の範囲で微調整する。
人物の同一性を修復する
顔が崩れたカットは、部分再生成で顔だけ描き直す。服装が変わってしまった場合は、背景を保ったまま人物だけ差し替える。手が崩れるのは頻出の問題で、手を画面外に出す、手前に物を置く、構図を変えるといった回避策のほうが速いことも多い。
リップシンクと表情
会話シーンは、音声を先に作ってから映像を合わせる順番が効率的だ。台詞の音声を確定させ、その波形に合わせて口の動きを生成する。表情は「微笑み」「困惑」「怒り」のような抽象語より、「眉を上げる」「口角を上げる」「視線を落とす」といった筋肉レベルの指示のほうが意図に近づく。
アップスケールとノイズ処理
最終的な解像度は編集の最後にまとめて上げる。途中で何度もアップスケールすると、細部が潰れて不自然な質感になる。ノイズ除去は控えめに。肌の質感まで消すと、のっぺりした人形のような見た目になる。
音声・音楽・編集の統合
映像が8割できたら音の工程に入る。観客が「安っぽい」と感じる原因の多くは、実は音にある。
ナレーション
ナレーションは作品の体温を決める。合成音声を使う場合も、句読点の位置、間の長さ、話速を調整する。同じ原稿を2〜3パターン生成し、シーンごとに良い部分を繋ぐ方法が実用的だ。一人語りの作品では、声のトーンを序盤と終盤で少し変えると物語の変化が伝わる。
台詞とアフレコ
台詞は事前に音声を確定させ、その尺に合わせてカットを調整する。逆順にすると、口の動きと音がずれて修正が膨らむ。多人数の会話は、話者の切り替わりでカットを割ると自然に見える。
効果音とBGM
効果音は「見えているもの」より「見えていないもの」に置くと効果的だ。扉の向こうの足音、遠くの汽笛、隣室の笑い声。これらは画面外の世界の広がりを生む。BGMはシーンの感情を二重に説明しないよう注意する。悲しい場面に悲しい音楽を重ねると過剰になる。むしろ無音や環境音だけの区間を1つ入れると、前後の音楽が際立つ。
編集の進め方
編集は「粗編→微調整→音→色→書き出し」の順で進める。粗編ではテンポだけを見て、色や音は後回しにする。テンポが決まってから、カットの長さを1〜2フレーム単位で詰める。この作業で作品の印象は大きく変わる。
字幕とテキスト
字幕は読みやすさが最優先だ。1行の文字数を抑え、表示時間は最低1秒を確保する。縦型動画では画面下部のUIと重ならないよう上下に余白を取る。テロップのフォントは作品の世界観に合わせて1種類に統一する。
実践ワークフロー:3分の短編を1本作る
ここまでの内容を、具体的な進行に落とし込む。
1日目:企画と脚本
ログライン、テーマ、尺、配信先を決める。シーンを6つに分け、各シーンの目的と感情の変化を書く。AIに下書きを作らせ、自分の言葉で書き直す。最後に声に出して台詞を読む。
2日目:絵コンテとキャラクター設計
ショットリストを作る(50〜70カット)。キャラクターの基準画像を4枚生成し、画風の基準カットを1枚選ぶ。この日の成果物が、以降すべての判断基準になる。
3日目:ショット生成(前半)
導入から中盤までを生成する。1カットにつき3案。採用したカットには印をつけ、失敗の理由を一言メモする。同じ失敗を繰り返さないための記録だ。
4日目:ショット生成(後半)と選別
残りを生成し、全カットを仕分ける。この時点で足りないカットが見つかるのが普通なので、追加生成の時間を必ず確保する。
5日目:音声と粗編
ナレーションと台詞を確定させ、粗編でテンポを整える。音を先に置くと、不要なカットが自然に削れる。
6日目:仕上げ
効果音、BGM、色調整、字幕、書き出し。書き出し後に一度、別の端末で再生して確認する。スマートフォンとPCでは見え方が違うためだ。
この6日間は、あくまで集中して作業できる場合の目安だ。仕事や家事の合間に進めるなら、2〜3週間に伸ばしてよい。大事なのは順番であり、速度ではない。
つまずきやすいポイントと対処法
実際の制作でよく起きる問題と、その対処をまとめる。
カットの色味がバラバラになる
原因は、カットごとに画風の指示が微妙に違うこと。対処は、基準カットを1枚決めて常に参照させること。編集の色調整でトーンを揃える工程も必ず入れる。
人物の顔がカットごとに変わる
基準画像の参照を徹底する。それでも崩れる場合は、その人物の登場カットを減らすか、後ろ姿や手元のカットに置き換える。物語上問題がないなら、見せないという解決策は有効だ。
動きが不自然で気持ち悪い
動きの量を減らす。静止に近いカットのほうが破綻は目立たない。動きが必要な場面だけモーション制御型のモデルを使う。
尺が足りない、間が持たない
挿入カット(風景、小物、手元、空、影)を足して時間を稼ぐのではなく、テンポを落として1カットを長く持たせる。間は退屈ではなく、感情の余白になる。
生成がうまくいかないときの考え方
同じ指示で何度も失敗するなら、指示の方向を変える。具体的にしすぎると破綻し、抽象的すぎると意図から外れる。中間の粒度を探す。また、複雑な1カットを3つの単純なカットに分けるだけで解決することが多い。
よくある質問
Q. 脚本はAIに完全に任せてもよいですか
下書きとしては有効ですが、最終稿は自分で書き直すことを勧める。AIは構造を作るのが得意で、固有の体験や微妙な感情のニュアンスを書くのは苦手だ。自分の記憶や観察から来るディテールが、作品を他人事でなくす。
Q. 何カットくらい生成すれば1本の作品になりますか
3分なら50〜90カットが目安になる。ただし、これは採用カットの数であり、実際にはその3〜5倍を生成することになる。最初は15カット程度の短い作品から始めると、工程全体を体験できる。
Q. 人物の一貫性を保つ最も確実な方法は
基準画像を複数角度で用意し、毎回参照させること。加えて、髪型・体格・服装をテキストでも固定する。顔だけに頼らず、シルエットで識別できるようにデザインするのが最も強い対策だ。
Q. 音声は先に作るべきですか、映像の後ですか
会話がある作品では音声を先に作る。尺が確定するため、映像側の調整がしやすい。ナレーションのみの作品でも、仮の音声を先に入れてからカットを合わせると、間の取り方が格段に楽になる。
Q. 生成した映像が実写に見えません
レンズ感、被写界深度、粒子、照明の方向を明示する。特に「光源の位置」を指定すると立体感が増す。また、カメラを完全固定にせず、わずかな揺れや呼吸のような動きを加えると実写らしさが出る。
Q. どのくらいの期間で上達しますか
工程を一通り体験する作品を2〜3本作ると、判断の速度が明確に上がる。上達の鍵は生成回数ではなく、失敗の理由を記録して再利用できる形にすることだ。
まとめ:物語が先、ツールは後
AIによる映像化で最も重要なのは、ツールの選定ではない。何を伝えたいのかが明確であることだ。ログラインがあり、テーマがあり、シーンの目的が決まっていれば、生成の指示は自然に具体化する。逆に、物語が曖昧なまま最先端のモデルを使っても、作品にはならない。
進め方はシンプルだ。企画を固め、脚本を書き、カットに分解し、基準画像を作り、生成と選別を繰り返し、音を載せて編集する。この順番を守るだけで、手戻りは大きく減る。
まずは15カット、30秒の作品から始めてみてほしい。短くても、最後まで作り切った経験は、次の作品の設計を確実に変える。物語を映像にする力は、一回の成功ではなく、作り切る回数によって育っていく。



