AIで脚本と絵コンテを同時に設計するワークフロー全体像
映像制作の初期工程は、長らく「企画 → 脚本 → 絵コンテ → 撮影または生成」という直線的な流れで語られてきた。しかし生成AIを前提にすると、この流れはもっと密結合にできる。脚本の一行がそのままショットの設計情報になり、ショットの設計情報がそのまま画像生成のプロンプトになり、画像がそのまま動画生成の入力になる。この連鎖を最初から意識して設計しておくと、工程間の翻訳ロスがほとんどなくなる。
本記事で扱うのは、AIアシスタントを使って脚本と絵コンテを自動生成し、そのまま動画素材までつなげる実務ワークフローである。重要なのは「AIに丸投げする」ことではなく、AIが迷わないように制約と文脈を設計することだ。逆に言えば、人間の仕事は企画の解像度を上げることと、出力を検証する基準を持つことに集約されていく。
このワークフローが向いているケース
- 15秒〜3分の短尺動画(SNS広告、プロダクト紹介、ショートドラマ、解説動画)
- 絵コンテのラフを何十枚も手描きする時間がない小規模チーム
- 同一キャラクターを複数話・複数カットで使い回したいシリーズ企画
- 撮影を伴わず、生成映像だけで完結させたい企画
- 企画段階で複数パターンの絵コンテを並べて比較したい案件
向いていないケース
- 実写の演技設計が主目的で、俳優との細かな演出調整が必要な作品
- 法務・コンプライアンス上の表現チェックが非常に厳しい広告
- 一度きりの単発制作で、ワークフローを整備するコストが見合わない案件
全体の6ステップ
- 企画ブリーフを作る(人間が主導)
- ログラインとビートシートをAIで展開する
- シーンリストと台本に落とし込む
- シーン記述をショットリストに変換する
- ショットリストからキーフレーム画像を生成する
- キーフレームを動画化し、音声と編集で仕上げる
この6ステップのうち、もっとも差がつくのは1と4である。1が曖昧だとAIは平均的な物語を返し、4が雑だと絵コンテが「雰囲気のある絵の寄せ集め」になってしまう。
なぜ脚本と絵コンテを一体化すると強いのか
従来の分業モデルが抱えていたボトルネック
脚本と絵コンテを別工程として分けると、必ず情報が欠落する。脚本家は「沈黙の間」や「視線の動き」を文章で書くが、絵コンテ担当者はそれを別の解釈で絵にする。この翻訳のたびに、演出意図は数パーセントずつ失われていく。10シーン程度なら誤差で済むが、40ショットを超えると作品全体のトーンがばらつく。
さらに、脚本の修正が入ったときの手戻りが大きい。台詞が1行変わっただけで、対応するカットの絵コンテも描き直しになる。分業モデルでは、この同期コストが制作スケジュールを圧迫する最大要因になる。
一体化で得られる3つの変化
第一に、修正が一箇所で完結する。シーン記述を書き換えれば、そこから派生したショットリストと画像プロンプトも同じ文脈で再生成できる。
第二に、映像文法を最初から組み込める。脚本を書く段階で「これは寄りのカットで感情を見せる場面」「ここは俯瞰で状況を説明する場面」とタグ付けしておけば、絵コンテ化のときに判断材料がすでに揃っている。
第三に、比較検討が速くなる。同じシーンに対して「静かな演出」「動きの多い演出」の2パターンの絵コンテを並べて出し、クライアントやチーム内で選ぶという進め方が現実的な速度で回る。
「AIに書かせる」ではなく「AIに選ばせる」
もっとも成果が出る使い方は、AIにゼロから作らせるのではなく、人間が用意した選択肢をAIに展開・比較させる方法だ。プロットの方向性を3つ出させ、そのうち1つを人間が選び、選んだ方向をさらに10シーンに分解させる。この往復を2〜3回繰り返すだけで、脚本の骨格はかなり固まる。
準備編:AIアシスタントに渡す企画ブリーフの作り方
ログラインは「誰が・何を・なぜ」で書く
AIの出力品質は、入力の解像度にほぼ比例する。最初に作るべきは、20〜40文字のログラインである。「売れない靴職人が、亡き父の工房を守るためにSNSで勝負を始める」のように、主人公・目的・障害が一目で分かる形にする。抽象語(絆、成長、挑戦)だけで書かれたログラインは、AIに平均的な物語を書かせるだけなので避けたい。
制約条件を必ず明記する
脚本生成の前に、以下を箇条書きで渡す。
- 尺:30秒 / 60秒 / 3分など
- 配信先:縦型か横型か、字幕前提か音声前提か
- トーン:温かい、乾いたユーモア、緊張感、叙情的など
- 登場人物の人数と関係性
- 避けたい表現(暴力、特定の業界用語、実在ブランド名など)
- カメラの制約(生成しやすい構図かどうか)
特に尺の指定は効果が大きい。60秒と伝えれば、AIは台詞の量とカット数を自然に調整する。指定しないと、3分尺の台本が返ってきて半分以上を削る羽目になる。
キャラクターシートを先に固める
キャラクターの外見情報は、脚本より先に決めておく。年齢、髪型、髪色、体型、服装、持ち物、表情の癖。これを表形式で整理し、以降のすべてのプロンプトに同じ記述を貼り付ける。ここを後回しにすると、ショットごとに別人が生成されて、後工程で膨大な修正が発生する。
ビジュアルリファレンスを言語化する
「フィルムルック」「シネマティック」といった曖昧な言葉は、生成結果をばらつかせる。代わりに「柔らかい逆光」「彩度を落とした寒色寄り」「浅い被写界深度で背景をぼかす」のように、観察可能な要素に分解して書く。参考にしたい映像があっても、それをそのまま入力するのではなく、色・光・構図・レンズ感の4項目に分解して言語化するのがコツだ。
脚本生成フェーズの実践手順
ステップ1:ビートシートを作る
いきなり台本を書かせない。まず物語のビート(感情の転換点)を5〜8個、一行ずつで出させる。たとえば「日常の紹介 → 違和感 → 決断 → 失敗 → 再起 → 結末」。この段階では台詞を書かせないほうが良い。台詞が入ると、構成の弱さが見えにくくなるからだ。
ステップ2:シーンリストに展開する
選んだビートシートを、シーン単位に分解する。各シーンには以下を必ず含める。
- 場所と時間帯
- 登場人物
- そのシーンの目的(情報提示、感情の山場、転換など)
- 想定秒数
- 使用する映像技法(寄り、引き、手持ち、静寂など)
このフォーマットを固定しておくと、後でショットリストに変換するときの作業が機械的になり、抜け漏れが減る。
ステップ3:シーン単位で台本を書かせる
全シーンを一度に生成させると、後半になるほど密度が薄くなる傾向がある。1シーンずつ生成し、良ければ次へ進む方式のほうが最終品質は高い。各シーンの出力には、ト書き・台詞・ナレーションを分けて書かせると、後の編集で扱いやすい。
ステップ4:台詞を読み上げて確認する
生成された台詞は、必ず声に出して読む。日本語の台本は、黙読では自然でも音読すると不自然な箇所が必ず出る。1文が長すぎる、助詞が続いて舌が回らない、同じ語尾が3回続く。こうした問題は音読でしか見つからない。
ステップ5:口語チェックと尺チェック
台詞の文字数からおおよその秒数を計算する。日本語の自然な会話は1秒あたり5〜7文字程度が目安になる。これを超える長台詞は、たとえ内容が良くても映像では破綻する。読み上げ速度の確認と、尺に収まるかの確認はセットで行いたい。
ステップ6:演出メモを追記する
最後に、各シーンへ演出メモを追加する。「ここは無音にする」「カメラは固定」「背景の音を強調」など、映像化のときに効く指示を書き残す。このメモが、次の絵コンテ工程のプロンプト素材になる。
絵コンテ自動生成フェーズの実践手順
シーン記述をショットに分割する
1シーンは通常3〜8ショットに分かれる。分割の基準は「カメラが切り替わるタイミング」と「情報が変わるタイミング」だ。AIに分割させる場合は、「1ショットにつき1つの情報だけを含める」という制約を与えると、冗長なカットが減る。
ショットリストの必須項目
| 項目 | 記述例 |
|---|---|
| ショット番号 | S03-02 |
| 尺 | 2.5秒 |
| 構図 | ミディアムショット、少し俯瞰 |
| カメラ | ゆっくり前進(プッシュイン) |
| 被写体 | 主人公、右手に工具箱 |
| 光 | 夕方の逆光、暖色 |
| 背景 | 古い工房、埃が舞う |
| 音 | 遠くの車の音、足音 |
この表を埋める作業をAIに手伝わせると、絵コンテの密度が一気に上がる。逆にこの表を省略して「シーンの絵を描いて」と頼むと、出てくる画像は雰囲気重視で物語の情報を持たないものになりがちだ。
カメラワークの語彙を統一する
プッシュイン、プルバック、パン、ティルト、トラッキング、ハンドヘルド、ドローン上昇。この7種類程度に語彙を絞り、プロジェクト内で同じ言葉を使い続ける。語彙がばらつくと、動画生成AIの解釈もばらつき、カット間のリズムが崩れる。
画像生成プロンプトへの変換
ショットリストの各項目は、そのままプロンプトの構成要素に変換できる。おすすめの並び順は「被写体 → 服装と持ち物 → 動作 → 構図 → カメラ → 光 → 背景 → スタイル」。この順序を固定しておけば、どのショットも同じ粒度で記述でき、結果の比較がしやすくなる。
ラフと決定版を分けて管理する
最初から高品質の画像を狙わない。まず低コストで全ショットのラフを出し、構図と人物配置だけを確認する。そのうえで採用したラフに対して、光や質感を詰めた決定版を生成する。この二段階方式は、試行回数の無駄を大幅に減らす。
キャラクターとスタイルの一貫性を守る方法
固定すべき3つの要素
一貫性が崩れる原因は、ほぼ次の3つに集約される。人物の外見、色調、レンズ感。逆に言えば、この3つを固定すれば見た目の統一感はかなり保てる。
- 外見:髪型、髪色、瞳の色、体型、服装の色と形
- 色調:寒色寄りか暖色寄りか、彩度の高低、影の色
- レンズ感:焦点距離の印象、被写界深度、歪みの有無
記述テンプレートを固定する
キャラクターごとに「固定記述ブロック」を作り、すべてのショットのプロンプトに同じ文を貼る。毎回言い換えると、AIは微妙に違う人物を生成する。表現の揺れは、それ自体が一貫性の敵だ。
参照画像を使う場合の注意点
参照画像を使う手法は強力だが、参照画像のポーズや背景まで引きずられることがある。対策としては、参照画像はバストアップの正面に近いものを選び、背景が無地に近いものを用意する。ポーズ指定はテキスト側で行うほうが制御しやすい。
スタイルガイドを1枚にまとめる
プロジェクトの冒頭で、色見本・照明パターン・レンズ感・服装の固定記述を1枚のドキュメントに整理する。これは人間のチームにもAIへの指示にも同時に効く。新しくメンバーが加わったときの共有コストも下がる。
画像から動画へ:モーションと音声の設計
ショット単位でモーションを決める
画像が揃ったら、各ショットに対して動きの指示を与える。動きの種類は大きく4つに分かれる。
- 被写体が動く(歩く、振り返る、手を伸ばす)
- カメラが動く(プッシュイン、パン)
- 環境が動く(煙、雨、揺れる木々)
- 何も動かさない(静止で緊張を作る)
4番目を忘れると、すべてのカットがそわそわした映像になる。静止カットはリズムを作るうえで欠かせない。
尺は短めに切る
生成映像は長尺になるほど破綻しやすい。まず2〜4秒で作り、編集でつなぐ前提にすると歩留まりが良い。長回しが必要な場合も、複数の短いカットを連続させて疑似的に作るほうが結果は安定する。
音声とリップシンク
台詞のあるカットでは、音声を先に確定させ、それに合わせて映像を生成する順序が扱いやすい。逆順にすると、口の動きに合わせて台詞を調整する作業が発生し、かえって手間が増える。ナレーション主体の動画なら、リップシンクの必要性は大きく下がるので、企画段階でどちらにするかを決めておきたい。
編集でのリズム調整
生成したカットを並べただけでは、どこか平坦な印象になる。編集では、意図的に数フレームの間を詰めたり、あえて1秒の黒を挟んだりして緩急を作る。AI生成映像はカット単体の情報量が多いため、間の取り方だけで作品の印象が変わる。
よくある失敗と修正パターン
失敗1:シーンが説明口調になる
原因は、シーン目的に「情報を伝える」とだけ書いていること。対策は、シーン目的を「誰が何を感じるか」に書き換えること。「新商品の特徴を伝える」ではなく「主人公が新商品の便利さに驚く」と書けば、台詞もカメラも自然に変わる。
失敗2:カットが繋がらない
ショット間で人物の位置や光の方向が矛盾していると、観客は違和感を覚える。対策は、シーン内で「カメラが今どこにあり、どの方向を向いているか」を簡単な平面図でメモすること。数秒で描ける図が、数十回の再生成を防ぐ。
失敗3:キャラクターが別人になる
固定記述ブロックの使い回し漏れが最大の原因。ショットリストに「固定ブロックを貼る」というチェック欄を設け、機械的に確認する運用にする。
失敗4:テンポが単調になる
すべてのカットが同じ尺、同じ動き量だと、見ていて疲れない代わりに記憶にも残らない。対策として、ショットリストの尺の列を見渡し、同じ秒数が3つ以上続いていたら意図的に崩す。
失敗5:AIの提案をそのまま採用してしまう
生成された台本は、文法も構成も整っているぶん、違和感に気づきにくい。対策は、一度音読し、さらに「この台詞を友人が言ったら自然か」と自問すること。整いすぎた文章は、しばしば人間らしさを失っている。
ツール選定とチーム運用の判断基準
テキスト・画像・動画を分けて選ぶ
脚本生成、キーフレーム生成、動画生成は、それぞれ得意なツールが異なる。ひとつのツールで全部を賄おうとすると、どこかで品質か操作性を妥協することになる。テキストは長文の文脈保持力、画像は人物の一貫性、動画は動きの自然さと尺の安定性を基準に選ぶとよい。
判断基準のチェックリスト
- 同じキャラクターを何十枚生成しても破綻しないか
- 縦型・横型の両方に対応できるか
- 出力の著作権や利用条件が明確か
- チームで同じ設定を共有できるか
- 再生成のコストが見積もりやすいか
- 日本語のニュアンスをどこまで扱えるか
少人数チームの役割分担
3人以下のチームなら、企画と最終判断を1人、プロンプト設計と生成を1人、編集と音声を1人という分け方が現実的だ。役割を兼ねる場合でも、「判断する人」と「量産する人」を分けておくと、品質のブレが小さくなる。
レビューのタイミングを決める
レビューは、ラフ段階・決定版画像・動画化後・編集後の4回に絞る。各段階で見る項目を固定し、それ以外は指摘しないというルールにすると、レビューが発散しない。ラフでは構図と人物配置、決定版では光と質感、動画では動きの自然さ、編集ではテンポと尺を見る。
ドキュメントを残す
採用したプロンプト、却下したプロンプト、その理由を簡単に記録する。次の案件で同じ試行錯誤を繰り返さずに済むうえ、チームの判断基準が言語化されていく。
FAQ
Q. 脚本と絵コンテは同時に生成すべきですか
同時に走らせるのが効率的ですが、順序は守ったほうが安全です。シーンリストが固まる前に絵コンテを作ると、構成変更のたびに絵を作り直すことになります。まずシーンリスト、次にショットリスト、最後に画像という順序を基本にしてください。
Q. 何ショットくらいが適正ですか
30秒の動画なら8〜15ショット、60秒なら15〜25ショットが目安です。これより多いと編集で取捨選択が必要になり、少ないと単調になります。迷ったらやや多めに作り、編集で削るほうが最終的な品質は上がります。
Q. 生成した絵コンテはどこまで修正すべきですか
構図、人物配置、光の方向の3点が意図どおりなら、質感の細部は動画化の段階で吸収できます。逆にこの3点がずれていると、後工程でどれだけ調整しても違和感が残ります。修正の優先順位を明確にしておくことが重要です。
Q. 日本語の台詞が不自然になることはありますか
あります。特に語尾や敬語の粒度が安定しない傾向があります。対策としては、登場人物ごとに口調のルールを箇条書きで指定し、生成後に必ず音読する運用を徹底することです。
Q. 事前準備にどれくらい時間をかけるべきですか
短尺1本なら1〜2時間、シリーズ企画なら半日から1日かける価値があります。準備で作ったキャラクターシートや固定記述は、以降のすべてのカットで使い回せるため、投資対効果は最初の数本で回収できます。
Q. うまくいかないときの最初の見直し先は
企画ブリーフに戻るのが最短です。出力が平坦に感じたら、ほぼ例外なくログラインが抽象的か、制約条件が不足しています。プロンプトを細かくいじるより、上流の記述を1行足すほうが結果は大きく変わります。
最後にひとつだけ。このワークフローで本当に価値が出るのは、生成の速さではなく、判断の速さです。選択肢を素早く並べ、基準に沿って選び、選んだ理由を記録する。このサイクルを回せるチームは、ツールが入れ替わっても同じ品質を出し続けられます。



