AIショート動画制作の全体像:初心者が最初に押さえる3つの原則
AIを使えば、撮影機材も出演者もスタジオもなしに、数秒から数十秒の縦型動画を短時間で作れる。ただし「AIに丸投げすれば良い動画ができる」わけではない。完成度を左右するのは、生成ツールの性能よりも、その前後にある設計と編集の工程だ。初心者が最初に押さえるべき原則は3つある。第一に、目的と視聴者を先に決めること。第二に、尺と構成を固定してから素材を作ること。第三に、生成は「素材づくり」であり、最終的な品質は編集で決まると理解すること。この3点を意識するだけで、同じツールを使っても成果物の差は大きく変わる。
ショート動画は、縦型・短尺・音声ありという3つの条件が前提になる。横型の映像をそのまま切り抜いても、視聴維持率は伸びない。スマートフォンの画面いっぱいに被写体が収まり、最初の1秒で意味が伝わり、最後まで見たくなる構成になっている必要がある。AI生成はこの条件を満たす素材を効率よく用意する手段であり、企画と編集の代わりにはならない。
また、生成AIの出力は毎回同じにならない。同じプロンプトでも構図や表情、光の当たり方が変わる。これは欠点ではなく、選択肢が増えるという利点でもある。1回で完璧な映像を狙うのではなく、複数案を出して選ぶ前提でワークフローを組むと、精神的な負担が減り、結果的に品質も安定する。
制作前に決めること:目的・尺・公開先の設計
目的から逆算して動画タイプを決める
動画を作る前に、「何のために作るのか」を一行で書き出す。商品の紹介、ノウハウの共有、世界観の演出、キャラクターの日常、ニュースの要約など、目的によって必要なカット数もテンポも変わる。商品紹介なら冒頭で商品を映し、特徴を3点に絞り、最後に行動を促す。ノウハウ共有なら、結論を最初に置き、理由と手順を追い、最後に要点を繰り返す。世界観の演出なら、説明を減らし、光・色・音で感情を動かす構成にする。
目的が曖昧なまま生成を始めると、素材は増えるのに構成が決まらず、編集段階で迷い続けることになる。最初の30分を企画に使うだけで、作業時間は数時間単位で短縮できる。
尺は15秒・30秒・60秒のどれかに寄せる
ショート動画の尺は、15秒、30秒、60秒のいずれかに寄せると構成が作りやすい。15秒は1メッセージに絞る。30秒は結論と根拠を1つずつ。60秒は3つのポイントを順に紹介する。尺が決まれば、カット数が逆算できる。15秒なら3〜5カット、30秒なら6〜9カット、60秒なら10〜15カットが目安になる。
カット数が決まっていると、生成する素材の数もおのずと決まる。各カットにつき2〜3案を生成し、その中から選ぶ方式にすると、後戻りが少ない。逆に、素材を先に大量生成してから構成を考える進め方は、使わない映像が増えて時間もコストも無駄になりやすい。
公開先ごとの作法を確認する
縦型ショートを配信できる場所は複数あり、それぞれ画面比率や推奨尺、テロップの安全領域が少しずつ異なる。上下にUIが重なる領域があるため、重要な文字や被写体の顔は画面の中央寄りに配置する。複数の場所へ同時に出す場合は、共通の安全領域に収まるように設計しておけば、書き出しを分けずに済む。
企画と絵コンテ:AIに渡す前の準備が品質を決める
一文コンセプトを書く
最初にやることは、動画の内容を一文で書くことだ。「忙しい社会人が3分で作れる朝食を、手順と失敗しないコツつきで紹介する動画」のように、誰に、何を、どの角度で伝えるかを一文にまとめる。この一文は、後のプロンプトやテロップ、音選びの判断基準になる。迷ったときに立ち返る基準があると、作業が速い。
シーン分割表を作る
次に、動画をシーンに分けて表にする。列は「カット番号」「時間」「映像内容」「カメラ」「セリフ・テロップ」「音」の6つで十分だ。表を作る際のポイントは、各カットを動詞で書くこと。「美しい朝の光」ではなく「カーテンを開けて光が入る」と書く。動詞で書かれたカットは、そのままプロンプトに変換しやすい。
シーン分割表があると、生成の順番を入れ替えても構成が崩れない。締め切りが迫っているときは、重要なカットから先に生成し、余裕があれば残りを埋めるという進め方もできる。
冒頭1秒の設計を最優先にする
ショート動画で最も重要なのは冒頭の1秒だ。ここで視聴者の指が止まらなければ、どれだけ中身が良くても見られない。冒頭の型はいくつかある。結果を先に見せる、意外な問いを投げる、強い動きのある映像を置く、文字で強い主張を出す、の4つが基本だ。AI生成の映像は動きが強いカットを作りやすいので、最初のカットに動きを持たせると離脱を抑えやすい。
冒頭の1秒を作るために、生成するカットのうち1〜2本だけは解像度と動きの質に多めに時間をかける。全体を均等に作るより、冒頭と締めに集中投資するほうが、視聴維持率への影響が大きい。
生成モデルの選び方:得意分野で使い分ける
モデルごとの性格を理解する
映像生成モデルは、大きく分けて3つの系統がある。写実的な人物や風景を得意とする系統、スタイライズされたアニメ調やイラスト調を得意とする系統、そして長回しや複雑なカメラワークに強い系統だ。Flux系は静止画のディテールと質感に強く、Runway系は映像の一貫性と編集機能のバランスが良い。KlingやPixVerseなどは動きの自然さや縦型向けの出力に特徴がある。Sora系は長めのショットや物理的な動きの表現に強みがある。
重要なのは、どれが「最強」かではなく、どのカットに向いているかだ。人物のクローズアップは写実系、背景の世界観はスタイライズ系、商品の回転ショットは動きに強い系統、というようにカット単位で割り当てると失敗が減る。
選定チェックリスト
モデルを選ぶときは、次の順で確認する。第一に、出力できる縦横比と解像度。第二に、1本あたりの生成にかかる時間。第三に、同じ人物や同じ部屋を再現できる一貫性。第四に、音声やリップシンクに対応しているか。第五に、商用利用の条件。この5点を確認せずに使い始めると、後工程で作り直しが発生しやすい。
特に一貫性は初心者が見落としやすい。同じ人物を複数カットに登場させる場合、顔立ち・髪型・服装の説明を毎回同じ言葉で書く必要がある。参照画像を使えるモデルなら、基準となる1枚を作り、それを全カットで参照する運用が安定する。
無料枠と有料枠の使い分け
無料枠はテスト用、有料枠は本番用と割り切るのが現実的だ。構図の確認やカメラワークの検証は無料枠で行い、本番の書き出しだけ有料枠を使う。ただし無料枠は待ち時間が長く、透かしが入る場合もあるため、公開用の最終素材には向かない。まず無料枠で試作し、構成が固まってから有料枠で作り直す流れが効率的だ。
プロンプト設計:映像ディレクターのように指示する
5つの要素を順番に書く
映像生成のプロンプトは、次の5要素を順に書くと安定する。被写体、動作、構図、カメラ、光と雰囲気だ。例えば「白いシャツの女性が、木の机でノートを開く。上半身のミディアムショット。ゆっくりとしたプッシュイン。朝の柔らかい自然光、落ち着いた色調」という具合に組み立てる。
形容詞を並べるより、動詞とカメラ用語を具体的に書くほうが、意図に近い映像が出やすい。「美しい」「かっこいい」といった主観語は、モデルにとって情報量が少ない。代わりに「逆光」「浅い被写界深度」「手持ち風のわずかな揺れ」のように、撮影用語で指定する。
カメラワークの語彙を増やす
ショート動画では、カメラワークが視聴者の注意を引っ張る。覚えておきたい語彙は、固定ショット、プッシュイン、プルアウト、パン、チルト、オービット、ドリー、クレーン、手持ち、俯瞰、ローアングルだ。同じ被写体でも、カメラワークを変えるだけで印象が変わる。1本の動画の中で同じカメラワークを連続させると単調になるため、3カットごとに変化をつけると良い。
注意したいのは、1つのカットに複数のカメラワークを指示しすぎることだ。「オービットしながらプッシュインしてチルトする」のような指示は、モデルが混乱して破綻しやすい。1カット1モーションを原則にする。
一貫性を保つテクニック
一貫性を保つ方法は3つある。第一に、人物・服装・場所の説明文をテンプレート化し、全カットで同じ文言を使う。第二に、参照画像を用意し、それを全カットに適用する。第三に、背景を固定し、被写体だけを変える。特に第三の方法は簡単で、同じ部屋・同じ机・同じ照明で撮影したかのような統一感が出る。
また、色調を統一するために、プロンプトの末尾に共通のスタイル指定を入れるとよい。「シネマティックな色調」「彩度を抑えたフィルム風」「寒色寄りのホワイトバランス」など、1つの指定を全カットに付けるだけで、別々に生成したカットが同じ作品に見えてくる。
ネガティブ指定の使い方
避けたい要素はネガティブ指定に回す。文字化け、余分な指、歪んだ顔、二重の手足、ぼやけた輪郭などが代表例だ。ただしネガティブ指定を増やしすぎると、映像全体が硬くなる。多くても5項目程度に絞るのが実用的だ。
実践ワークフロー:15秒のショート動画を1本作る手順
ステップ1:企画とシーン分割(15分)
テーマを決め、一文コンセプトを書き、6カットのシーン分割表を作る。各カットの長さは2〜3秒を基本にする。この段階でテロップの文言も決めておくと、後の編集が速い。
ステップ2:キービジュアルの生成(20分)
最も重要な1カット、つまり冒頭か締めのカットから作る。静止画として構図を固め、気に入った1枚を基準画像にする。この1枚が動画全体の色調と雰囲気を決める。
ステップ3:各カットの映像生成(40分)
基準画像を参照しながら、各カットを2〜3案ずつ生成する。生成中に別の作業をすると待ち時間を有効に使える。選ぶ基準は、構図、動きの自然さ、一貫性の3点だ。完璧なカットを探すより、編集でつなげて違和感がないかを優先する。
ステップ4:編集でつなぐ(40分)
生成したカットをタイムラインに並べ、不要な冒頭と末尾を切り落とす。AI生成の映像は最初と最後の数フレームが不安定なことが多いため、各カットの前後を0.2〜0.5秒トリムすると安定する。カットの切り替えは、動きの方向を合わせると自然につながる。
ステップ5:テロップと音声(30分)
テロップは1画面1メッセージを守る。文字数は15〜20字程度に収め、表示時間は1.5秒以上確保する。音声は、ナレーションを入れる場合と、音楽と効果音だけで構成する場合がある。初心者には後者のほうが作りやすい。ナレーションを入れる場合は、生成音声の読み上げ速度を少し遅めに設定し、テロップと完全に一致させないほうが自然に聞こえる。
ステップ6:書き出しと確認(10分)
縦型の解像度で書き出し、スマートフォンで実際に再生して確認する。確認項目は、冒頭1秒で内容が伝わるか、文字が小さすぎないか、音量が急に大きくならないか、最後に余韻があるかの4点だ。
ステップ7:改善メモを残す(5分)
公開後、どのカットで離脱されやすかったかを記録する。冒頭の1秒、3秒地点、最後の3秒の3か所を確認すると、次回の改善点が見つかる。
編集と仕上げ:ツールの使い分けと音の設計
編集ツールの選び方
編集ツールは、手軽さと自由度のトレードオフで選ぶ。スマートフォン向けのアプリは、テロップのテンプレートや自動字幕が充実しており、短時間で見栄えのする動画を作れる。デスクトップ向けの無料編集ソフトは、カラー調整やキーフレーム制御ができ、色調の統一に向く。プロ向けの編集ソフトは細かい制御ができるが、学習時間が必要だ。初心者は、まずスマートフォンのアプリで1本完成させ、物足りなさを感じた部分から上位ツールに移るのがよい。
音の3層構造を作る
音は、ナレーション、音楽、効果音の3層で考える。音楽は動画の感情を決めるため、最初に選ぶ。効果音はカットの切り替えや動作の瞬間に置き、視覚的なリズムを補強する。ナレーションは情報を補足する。3層すべてを同じ音量で重ねると聞き取りにくくなるため、音楽は小さめ、効果音は短く、ナレーションは明瞭に調整する。
色調の統一
別々に生成したカットは、色温度やコントラストが微妙に違う。編集ソフトのカラー調整機能やフィルターを使って、全カットに同じ補正をかける。彩度を少し下げ、ハイライトを柔らかくすると、映像が同じ作品に見えやすい。
字幕とテロップの違いを意識する
字幕は音声の内容を文字で示すもの、テロップは情報を強調するものだ。両方を同じ見た目にすると、画面が単調になる。字幕は下部に小さめ、テロップは中央に大きめ、と役割で位置とサイズを分けると読みやすい。
よくある失敗とトラブルシューティング
映像が不自然に歪む
人物の指や顔が歪む場合、解像度が足りていないか、カメラワークの指示が複雑すぎる可能性がある。解像度を上げ、1カット1モーションに絞り、人物の全身よりも上半身のショットにする。手を使う動作は、手が画面から出る構図を避けると破綻しにくい。
カットごとに人物が別人になる
一貫性が崩れる最大の原因は、説明文の揺れだ。人物の特徴を固定したテンプレートを作り、全カットで同じ文言を使う。参照画像が使えるモデルなら必ず併用する。それでも崩れる場合は、顔のクローズアップを減らし、後ろ姿や手元のカットで構成を組む方法もある。
動きが速すぎて落ち着かない
短尺動画ではテンポが重要だが、すべてのカットで動きが激しいと疲れる。動きの強いカットの後に、静止に近いカットを挟むと、リズムが生まれる。3カット目、6カット目に静かなカットを置くのが定番の構成だ。
書き出しで色が変わる
編集ソフトで見た色と、書き出した動画の色が違うことがある。カラープロファイルの設定を確認し、公開先の推奨設定に合わせる。SNS向けなら標準的な色空間で書き出すと大きく崩れない。
生成に時間がかかりすぎる
生成待ちの時間は、プロンプトの見直しやテロップ作成に使う。複数カットを同時に生成できる環境なら、並行して依頼する。1本ずつ順番に生成するより、まとめて依頼して選ぶほうが効率的だ。
量産体制を作る:テンプレート化とレビュー
構成テンプレートを資産化する
1本作ったら、その構成をテンプレートとして保存する。冒頭の型、カット数、テロップの位置、音楽の種類、書き出し設定をメモし、次の動画で再利用する。テンプレートがあると、企画にかかる時間が大幅に短縮される。
プロンプト集を作る
よく使うプロンプトは、カットの種類ごとに整理しておく。人物の導入、動作のクローズアップ、風景の確立ショット、締めのカットなど、用途別に分類すると探しやすい。色調やカメラワークの共通指定も別枠で保存しておくと、全カットに適用しやすい。
レビューの観点を固定する
完成した動画は、毎回同じ観点で確認する。冒頭1秒で伝わるか、テロップは読みやすいか、音は聞き取りやすいか、色調は統一されているか、最後に次の行動につながるか。この5項目をチェックリストにしておくと、見落としが減る。
公開後の数字を記録する
再生回数だけでなく、視聴維持率、冒頭の離脱率、保存数、コメントの内容を記録する。数字が良い動画の共通点を探し、次のテンプレートに反映する。改善のループを回すことで、AI生成のばらつきを経験でカバーできるようになる。
よくある質問
Q. プログラミングや専門知識は必要ですか?
基本的には不要だ。必要なのは、伝えたい内容を整理する力と、映像の見た目を判断する目だ。編集ソフトの操作は、基本的なカット、テロップ、音量調整、書き出しの4つを覚えれば、大半のショート動画は作れる。
Q. 無料で始められますか?
試作段階は無料の範囲でも始められる。ただし公開用の素材は、透かしや解像度の制限がない環境で作り直すことを勧める。まずは短い動画を1本完成させ、必要になった時点で環境を整える順番が現実的だ。
Q. どのくらいの時間がかかりますか?
15秒の動画なら、慣れれば2〜3時間で1本完成する。最初の数本は倍以上の時間がかかるのが普通だ。作業を録画して振り返ると、どこで時間を使っているかが見え、短縮のヒントが得られる。
Q. 実写素材と組み合わせてもよいですか?
問題なく組み合わせられる。実際、スマートフォンで撮影した手元の映像や商品の実写を混ぜると、説得力が増す。AI生成の映像は世界観や導入に、実写は証拠や具体例に使うと役割分担が明確になる。
Q. 音声は自動生成と録音のどちらが良いですか?
情報を正確に伝えたい場合は録音、世界観を演出したい場合は自動生成が向く。自動生成の音声は、句読点の位置で間の取り方が変わるため、テロップと合わせて調整すると自然に聞こえる。
Q. 同じ動画を複数の場所に公開してもよいですか?
問題はないが、縦型の安全領域と推奨尺が異なる点に注意する。共通の安全領域に文字を収めておけば、1本の書き出しで複数の場所に対応できる。
Q. 生成した映像の権利はどうなりますか?
利用するサービスごとに条件が異なる。商用利用の可否、生成物の扱い、参照画像の権利について、利用前に規約を確認する習慣をつける。クライアント案件では、使用したツールと条件を記録しておくと安心だ。
Q. 上達するには何を練習すればよいですか?
1つのテーマを、尺を変えて3本作る練習が効果的だ。15秒、30秒、60秒で同じ内容を作ると、情報の取捨選択が上達する。また、好きな動画を1本選び、カット割りを書き出す練習も、構成力を鍛える。
まとめ:企画と編集に時間をかけるほど、AIは力を発揮する
AIショート動画制作の成否を分けるのは、ツールの数や新しさではなく、企画と編集の質だ。目的と視聴者を決め、尺とカット数を固定し、シーン分割表を作る。生成モデルはカットごとに得意分野で選び、プロンプトは被写体・動作・構図・カメラ・光の順で書く。一貫性はテンプレートと参照画像で担保し、最後は編集でテンポ、色調、音を整える。
最初から完璧を目指す必要はない。15秒の動画を1本作り、振り返り、テンプレートを更新する。この小さなループを繰り返すことが、最も確実な上達の道だ。生成の待ち時間を企画やテロップ作成に使い、判断基準をメモとして蓄積していけば、作業は確実に速くなる。AIは演出家ではなく、優秀な撮影クルーだと考え、監督の仕事である企画と編集に集中することが、初心者にとって最も近道になる。


