AI動画制作の全体像をつかむ
静止画から物語へ:何が変わったのか
かつて動画を作るには、撮影機材、照明、出演者、そして編集用のワークステーションが必要だった。撮影できない題材は企画の段階で没になる。ところが画像生成AIと動画生成AIが実用水準に達したことで、まず絵を作り、その絵をそのまま動かすという作り方が現実的になった。小さな店舗でも、個人の学習者でも、映像表現を持てるようになったわけだ。
ただし誤解してはいけない。AI動画は長い物語を一度に出力する道具ではない。実際の制作は、数秒単位のカットを大量に作り、それをつないで一本の物語に仕立てる作業になる。つまり映像制作の本質である設計と編集の比重は、むしろ上がっている。生成が楽になった分、どこで何を見せるかを決める力が作品の質を左右する。
この記事では、画像生成から始めて、キャラクターの一貫性を保ちながら、感情の流れのある短編映像を完成させるまでの手順を順番に解説する。専門的な撮影経験は不要だが、工程を飛ばすと必ず破綻する箇所があるので、そこを重点的に扱う。
六つの工程を順番に並べる
作業は次の六段階に分けると整理しやすい。第一に物語の設計、第二に見た目の基準作り、第三にカットの生成、第四に接続と編集、第五に音声の統合、第六に書き出しと配信最適化である。この順序を飛ばすと、後の工程で必ず作り直しが発生する。とりわけ第二工程を省略したときの損失が大きい。
| 工程 | 目的 | 主な作業 | つまずきやすい点 |
|---|---|---|---|
| 1 設計 | 物語を決める | ログライン、ビート、ショットリスト | いきなり生成を始める |
| 2 基準作り | 見た目を固定する | 基準画像、画風の定義 | 毎回ゼロから作る |
| 3 生成 | カットを作る | 画像から動画、カメラ指定 | 動きが過剰になる |
| 4 接続 | 連続性を保つ | 色調統一、つなぎの設計 | カットごとに別人になる |
| 5 音声 | 情報と感情を足す | ナレーション、音楽、効果音 | 無音のまま提出する |
| 6 仕上げ | 配信に最適化する | 書き出し、縦横変換 | 一度作って終わる |
短い作品ほど、この六工程を軽く回すことが重要になる。三十秒の作品なら、設計に一時間、生成に三時間、編集と音声に三時間という配分が現実的だ。工程を細かく分けるほど挫折しやすくなるので、まずは六つで十分だと考える。
初心者が最初に捨てるべき思い込み
最初に捨てるべき思い込みが四つある。第一に、良いプロンプトを書けば自動的に名作になるという考え方だ。生成は素材作りであり、物語を作るのは編集である。第二に、多くのツールを試すほど上達するという考え方。学習が分散し、どのツールの癖も掴めなくなる。第三に、長いカットのほうが贅沢に見えるという考え方。破綻は時間の経過とともに増えるため、長尺はリスクでしかない。第四に、音は後回しでよいという考え方。ナレーションの長さがカットの尺を決めるのだから、音は設計段階から関わっている。
制作環境と素材管理の準備
使用ツールを四つに絞る
最初に決めるのはツールの数だ。画像生成を一つ、動画生成を一つ、音声を一つ、編集を一つ。この四つに絞る。理由は単純で、画像生成と動画生成では操作の考え方が違い、それぞれに固有の癖があるからだ。同じ役割のツールを二つ並べても、学びは二倍にはならない。
画像生成は、参照画像を複数渡せるか、キャラクターの固定機能があるかで選ぶ。動画生成は、カメラワークの指定方法と破綻の少なさで選ぶ。音声は、日本語の抑揚の自然さで選ぶ。編集は、色調整のしやすさと書き出し設定の細かさで選ぶ。価格や知名度は最後の判断材料でよい。
フォルダ構成と命名規則
制作が進むと、素材は必ず散らかる。最初に次の構成を作っておく。
- 01_設計:ログライン、ビートシート、ショットリストの表
- 02_基準画像:キャラクターと舞台の参照画像
- 03_生成カット:動画ファイルと使用した画像
- 04_音声:ナレーション、音楽、効果音
- 05_編集:プロジェクトファイルと書き出し前の中間ファイル
- 06_完成:配信用の書き出し
ファイル名は、カット番号と内容を組み合わせる。たとえば c03_kasa_mise_01 のように、番号、被写体、動作、連番の順で付ける。日本語のファイル名は環境によって文字化けするので、英数字と記号に統一するのが安全だ。
記録シートの作り方
生成したカットごとに、次の項目を一行で記録する。カット番号、使用した基準画像、指示文の要点、使用モデル、生成日、尺、採用か不採用か。この記録がないと、再生成が必要になったときに同じ絵を二度と出せない。表計算ソフトで十分であり、作業のたびに十秒で書ける程度の項目数に抑えるのが長続きのコツだ。
物語設計:ログライン・ビート・ショットリスト
ログラインを一文で書く
誰が、何を望み、何に阻まれ、どう変わるか。この四要素を一文にまとめる。たとえば、引っ越しの朝、少女は捨てられない古いランプを抱えて家を出るが、途中で雨に降られ、最後にはそのランプを他人に譲る決断をする、という具合だ。生成AIは抽象的な指示が苦手なので、この一文がすべての判断基準になる。迷ったときは、この一文に戻って取捨選択する。
ビートシートで感情の山を作る
三十秒から九十秒の短編なら、五から八個のビートで十分だ。導入で状況を示し、転換で問題を起こし、上昇で試行錯誤を描き、クライマックスで最大の障壁を置き、解決で変化を示す。各ビートに秒数を書き添える。ここで秒数を決めておくと、後工程で必要なカット数が自動的に決まる。
感情の山は一つより複数のほうが良い。小さな山をいくつか置いてから大きな山に収束させると、短い尺でも引き込まれる。逆に平坦な構成は、どんなに絵が美しくても最後まで見てもらいにくい。
ショットリストに分解する
各ビートを一から三カットに分解する。一カットは三から六秒が扱いやすい。表には、カット番号、尺、被写体、アクション、カメラ、場所、時間帯、感情の八列を用意する。この八列を埋めると、生成時の指示文を機械的に組み立てられる。最初の一本では必ずこの表を作ることを勧める。表があるだけで、生成中の迷いが大幅に減る。
設計を飛ばしたときに起こること
設計なしで生成を始めると、素材だけが増えて物語が組み上がらない。結果として、きれいだが意味のない映像の寄せ集めになり、編集段階で全部作り直すことになる。制作時間の半分を設計に使ってよい。それくらい設計は効く。
キャラクターと画風の一貫性を固定する
基準画像を四枚そろえる
主人公、主要な小道具、舞台となる場所について、それぞれ基準となる一枚を決める。さらに主人公については、正面、横顔、全身、後ろ姿の四枚を用意する。一枚だけでは構図を変えたときに顔立ちが崩れる。四枚あれば、顔の寄りから引きの画まで対応できる。以降の生成ではこの画像を参照として渡し、構図だけを変えていく。
画風を言語化する
シネマティックという言葉だけでは情報が足りない。光の種類、レンズ感、色調、質感まで言葉にする。たとえば、窓から差し込む柔らかな逆光、三十五ミリ相当の広角、彩度を抑えたフィルム調、細かな粒子感、という具合だ。画風を文章で定義しておけば、別のツールに切り替えてもトーンを維持できる。逆に定義がないと、ツールを変えた瞬間に世界観が崩れる。
一貫性チェックの習慣
十カットごとに並べて見る。並べたときに、顔、髪型、衣装、色温度、光源方向の五点が揃っているかを確認する。違和感があれば、そのカットだけを再生成する。全体を作り直す必要はない。この小さな確認を習慣にすることで、後の編集が格段に楽になる。
画像から動画へ:カット生成の実践
動かす要素は一カットにつき一つ
テキストだけで動画を作るより、基準画像を入力して動かすほうが制御しやすい。動かしたい要素は一カットにつき一つに絞る。風で髪がなびく、人物が振り返る、カメラがゆっくり寄る、を同時に指示すると破綻しやすい。二つ以上を動かしたい場合は、カットを分けたほうが結果が良い。
カメラワークの語彙を持つ
カメラの動きは感情の記号である。固定は感情の停滞や静けさ、横移動は空間の広がり、寄りは内面への接近や緊張の高まり、引きは孤立や結末の余韻、手持ち風は不安や臨場感を表す。なんとなく動かすのではなく、そのカットで視聴者に何を感じてほしいかを先に決めてから選ぶ。
破綻したときの調整順序
生成結果が崩れたら、次の順で調整する。第一に動きの量を下げる。第二に尺を短くする。第三に画面内の被写体を減らす。第四に背景を単純にする。第五に別のモデルで試す。多くの場合は最初の二つで解決する。モデルを変えるのは最後の手段だと考えたほうがよい。
尺は短く、数を多く
一カットを長く粘るより、三から四秒のカットを多めに用意して編集で選ぶほうが結果が良い。破綻は時間の経過とともに増えるため、長尺はリスクが高い。十カット作って六カット使うくらいの余裕を持った計画が現実的だ。
編集で連続性と感情のリズムを作る
感情曲線を紙に描く
横軸に時間、縦軸に感情の強度を取ったグラフを描く。山が一つだけの平坦な構成より、小さな山をいくつか置いてから大きな山に収束させる構成のほうが、短い尺でも引き込まれる。このグラフがあると、どのカットを削るべきかが一目で分かる。
つなぎの技術を覚える
マッチカットは似た形や動きでカットをつなぐ。アクションつなぎは動きの途中で切る。視線誘導は人物の視線の先に次のカットを置く。音先行は次のシーンの音を先に鳴らす。生成カットは連続性が弱いので、これらの編集技術で補う。とくに音先行は効果が大きく、映像の粗さをかなり隠せる。
色調を統一する
カットごとに生成すると色温度がばらつく。編集ソフトで全カットに共通のカラー調整を適用し、最後に個別に微調整する。統一感とは同じに見えることではなく、同じ世界に見えることだと考えると判断しやすい。極端に明るいカットが一本混ざるだけで、別の場所に見えてしまう。
場所と時間の手がかりを入れる
観客は説明がないと迷子になる。看板、服装、光の角度、天候など、場所と時間を示す小さな手がかりを各カットに一つ入れる。説明の台詞を足すより、小道具一つで示すほうが映像として強い。
音声・音楽・効果音の統合
ナレーションは感情の補助に使う
ナレーションは説明ではなく感情の補助に使う。全カットに語りを入れると映像が死ぬ。無音のカットを意図的に残し、要所だけ声を乗せる。基本は、導入の一箇所と結末の一箇所、余裕があれば転換点に一つ。この三点で十分に物語は伝わる。
音声合成を使う場合の調整
自分の声を録るのが最善だが、環境が整わない場合は音声合成を使う。速度、間の取り方、抑揚を調整し、文を短く区切る。日本語は抑揚が平坦になりやすいので、句読点ごとに感情のラベルを付けて読み分けると自然になる。数字や固有名詞は読み間違いが起きやすいため、事前に試聴して確認する。
音楽と効果音のバランス
音楽は利用条件が明確な素材を選ぶ。効果音は、見えているものより画面外の気配に使うと臨場感が出る。音量は音楽を控えめにし、環境音と声を前に出す。スマートフォンの内蔵スピーカーでは低音が聞こえにくいので、低音に頼りすぎた作りは避ける。
編集ソフトの選び方
手軽さを重視するならモバイル対応の編集アプリ、本格的な色調整と音声処理なら DaVinci Resolve、チーム連携とテンプレートなら Premiere Pro、モーショングラフィックスなら After Effects が候補になる。最初は手軽なツールで完成させ、物足りない部分だけを高度なツールに移すのが効率的だ。最初から高機能なツールを選ぶと、機能の多さに圧倒されて完成に至らないことが多い。
書き出しと配信最適化
解像度とフレームレート
縦型の短尺は 1080×1920、横型は 1920×1080 を基本にする。フレームレートは、24fpsで映画的な質感、30fpsで自然な動き、60fpsで滑らかな動きになる。生成カットはフレーム間の整合が弱いため、24fpsのほうが破綻が目立ちにくい。動きの速い素材を扱う場合だけ60fpsを検討すればよい。
ビットレートと圧縮
圧縮でつぶれると、生成の質感が失われる。書き出し時は配信先の推奨値より少し高めに設定し、アップロード後に実際の見え方を確認する。特に暗部の階調は圧縮で潰れやすいので、暗いシーンが多い作品では余裕を持った設定が必要だ。
一本から複数展開へ
同じ素材で、縦型、横型、正方形の三種類を書き出す。冒頭三秒を変えたA版とB版も作る。制作の手間はほとんど増えないのに、検証できる面が増える。冒頭は視聴維持率に最も影響する部分なので、ここだけを差し替えて比較する価値は大きい。
記録を残して再現性を確保する
カット番号、指示文、使用モデル、生成日を記録する。この記録は、続編を作るときの設計図にもなる。一度作った世界観を再現できるかどうかは、記録の有無で決まる。シリーズ化を少しでも考えているなら、最初の作品から必ず残す。
実例:三十秒の短編を最後まで作り切る
題材は、雨の日に古い傘を誰かに譲る少年とする。
ログラインとビート
ログラインは、傘をなくした少年が、雨宿り先で出会った老人に自分の傘を譲り、自分は濡れて帰る、というもの。ビートは五つ。導入で雨と傘探し、転換で老人との出会い、上昇で迷い、クライマックスで傘を渡す、解決で濡れて歩く背中を描く。
十カットのショットリスト
- 雨粒が路面に落ちる接写、三秒
- 少年が軒下で周りを見る、四秒
- 濡れた靴の接写、二秒
- 老人がベンチに座っている引きの画、四秒
- 少年の横顔、視線の先に老人、三秒
- 少年の手元、傘の柄を握る、三秒
- 傘を差し出す手と老人の手、四秒
- 少年が雨の中を歩き出す後ろ姿、四秒
- 空を見上げる少年、三秒
- 地面に広がる水たまりと題字、四秒
制作のポイントを整理する。カット1と3は環境のみで人物を出さず、感情の準備を作る。カット4と5で視線を接続し、カット6で迷いを手元で表現する。カット7は手だけのカットにして、顔の一貫性問題を回避する。カット8で引き、カット9で固定、カット10は静止に近い動きにして余韻を残す。
音の設計
音声は、ナレーションをカット2と9の二箇所のみに入れる。音楽はカット4から始め、クライマックスで一度止め、カット9で戻す。雨音は全編を通して一定に保ち、空間の連続性を担保する。この設計なら、生成する画像は十二枚程度、動画カットは十本。半日から一日で初稿に到達できる。
よくある失敗と対策
キャラクターが毎回変わる場合は基準画像が足りない。正面、横顔、全身、後ろ姿の四枚を用意し、参照の強度を上げる。動きが不自然な場合は、動きの量を下げ、尺を短くし、被写体を減らす。なんとなく見劣りする場合は、光源の方向がカットごとに違うことが原因であることが多い。全カットで光を同じ方向から来させると、それだけで見違える。テンポが悪い場合は尺が長い。全カットを一から二割短くし、とくに導入を徹底的に削る。声と映像が合わない場合は、ナレーションを先に録り、その長さに合わせてカット尺を決める。完成しない場合は、範囲を広げすぎている。最初の一本は三十秒、カット数十前後に固定する。
よくある質問と最後の確認
絵が描けなくても作れますか
作れる。必要なのは画力ではなく、言語化する力と編集の根気である。構図や色の知識は、好きな映像を観察して言葉にすることで身につく。模写ではなく、観察と言語化を繰り返すことが上達の近道になる。
費用はどのくらいかかりますか
試作の段階では無料の範囲でも試せるが、出力解像度、透かしの有無、生成回数の上限といった制約がある。本番制作では有料プランが必要になることが多い。まずは小さな範囲で試し、どこに費用をかけるべきかを見極めるのがよい。
どのくらいの時間がかかりますか
三十秒の短編で、初回は十から二十時間を見込む。二本目以降は設計と編集の型ができるため、半分以下に短縮できる。時間の大半は生成待ちではなく、選別と調整に使われる。この事実を知っておくと、途中で心が折れにくくなる。
実写と組み合わせてもよいですか
問題ない。むしろ生成カットだけを並べるより、実写の手元や風景を混ぜたほうが現実感が出る。条件は色調を揃えることだ。同じ光の方向、同じ色温度に寄せるだけで、違和感はほとんど消える。
生成物の権利はどうなりますか
利用するツールごとに条件が異なる。商用利用の可否、学習への利用、再配布の制限を必ず確認する。仕事として受注する案件では、使用したツールと条件を記録として残しておく。
同じキャラクターでシリーズ化できますか
できる。基準画像、指示文のテンプレート、色調の設定をファイルとして保存し、毎回同じ出発点から始める。これがシリーズ化の鍵になる。一度作った設定は、他の企画にも流用できる資産になる。
スマートフォンだけで作れますか
画像生成と編集の一部はスマートフォンでも可能だが、参照画像の管理や色調整、音声処理を考えると、最終的な仕上げはパソコンでの作業が現実的だ。撮影と切り抜きだけをスマートフォンで行い、仕上げをパソコンに回す分担も有効である。
まとめ:最初の一本を完成させるために
画像生成からストーリーテリング動画を作る流れは、次の順序に集約される。物語を一文で決める。ビートに分ける。ショットリストにする。基準画像で見た目を固定する。カットを短く作る。色調と音でつなぐ。最後に配信形式へ書き出す。
技術より順序が大事だ。順序を守れば、機材も出演者もいない状態でも、感情の流れのある映像が作れる。逆に順序を無視すると、いくら生成を繰り返しても作品にはならない。まずは三十秒、十カットで一本を作り切る。完成した経験が、次の作品の質を最も大きく引き上げる。




