Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AIショート動画の作り方:初心者向けに企画・生成・編集の全工程を解説

Sep 30, 2026

AIショート動画制作の全体像:初心者が最初に押さえる3つの原則

AIを使えば、撮影機材も出演者もスタジオもなしに、数秒から数十秒の縦型動画を短時間で作れる。ただし「AIに丸投げすれば良い動画ができる」わけではない。完成度を左右するのは、生成ツールの性能よりも、その前後にある設計と編集の工程だ。初心者が最初に押さえるべき原則は3つある。第一に、目的と視聴者を先に決めること。第二に、尺と構成を固定してから素材を作ること。第三に、生成は「素材づくり」であり、最終的な品質は編集で決まると理解すること。この3点を意識するだけで、同じツールを使っても成果物の差は大きく変わる。

ショート動画は、縦型・短尺・音声ありという3つの条件が前提になる。横型の映像をそのまま切り抜いても、視聴維持率は伸びない。スマートフォンの画面いっぱいに被写体が収まり、最初の1秒で意味が伝わり、最後まで見たくなる構成になっている必要がある。AI生成はこの条件を満たす素材を効率よく用意する手段であり、企画と編集の代わりにはならない。

また、生成AIの出力は毎回同じにならない。同じプロンプトでも構図や表情、光の当たり方が変わる。これは欠点ではなく、選択肢が増えるという利点でもある。1回で完璧な映像を狙うのではなく、複数案を出して選ぶ前提でワークフローを組むと、精神的な負担が減り、結果的に品質も安定する。

制作前に決めること:目的・尺・公開先の設計

目的から逆算して動画タイプを決める

動画を作る前に、「何のために作るのか」を一行で書き出す。商品の紹介、ノウハウの共有、世界観の演出、キャラクターの日常、ニュースの要約など、目的によって必要なカット数もテンポも変わる。商品紹介なら冒頭で商品を映し、特徴を3点に絞り、最後に行動を促す。ノウハウ共有なら、結論を最初に置き、理由と手順を追い、最後に要点を繰り返す。世界観の演出なら、説明を減らし、光・色・音で感情を動かす構成にする。

目的が曖昧なまま生成を始めると、素材は増えるのに構成が決まらず、編集段階で迷い続けることになる。最初の30分を企画に使うだけで、作業時間は数時間単位で短縮できる。

尺は15秒・30秒・60秒のどれかに寄せる

ショート動画の尺は、15秒、30秒、60秒のいずれかに寄せると構成が作りやすい。15秒は1メッセージに絞る。30秒は結論と根拠を1つずつ。60秒は3つのポイントを順に紹介する。尺が決まれば、カット数が逆算できる。15秒なら3〜5カット、30秒なら6〜9カット、60秒なら10〜15カットが目安になる。

カット数が決まっていると、生成する素材の数もおのずと決まる。各カットにつき2〜3案を生成し、その中から選ぶ方式にすると、後戻りが少ない。逆に、素材を先に大量生成してから構成を考える進め方は、使わない映像が増えて時間もコストも無駄になりやすい。

公開先ごとの作法を確認する

縦型ショートを配信できる場所は複数あり、それぞれ画面比率や推奨尺、テロップの安全領域が少しずつ異なる。上下にUIが重なる領域があるため、重要な文字や被写体の顔は画面の中央寄りに配置する。複数の場所へ同時に出す場合は、共通の安全領域に収まるように設計しておけば、書き出しを分けずに済む。

企画と絵コンテ:AIに渡す前の準備が品質を決める

一文コンセプトを書く

最初にやることは、動画の内容を一文で書くことだ。「忙しい社会人が3分で作れる朝食を、手順と失敗しないコツつきで紹介する動画」のように、誰に、何を、どの角度で伝えるかを一文にまとめる。この一文は、後のプロンプトやテロップ、音選びの判断基準になる。迷ったときに立ち返る基準があると、作業が速い。

シーン分割表を作る

次に、動画をシーンに分けて表にする。列は「カット番号」「時間」「映像内容」「カメラ」「セリフ・テロップ」「音」の6つで十分だ。表を作る際のポイントは、各カットを動詞で書くこと。「美しい朝の光」ではなく「カーテンを開けて光が入る」と書く。動詞で書かれたカットは、そのままプロンプトに変換しやすい。

シーン分割表があると、生成の順番を入れ替えても構成が崩れない。締め切りが迫っているときは、重要なカットから先に生成し、余裕があれば残りを埋めるという進め方もできる。

冒頭1秒の設計を最優先にする

ショート動画で最も重要なのは冒頭の1秒だ。ここで視聴者の指が止まらなければ、どれだけ中身が良くても見られない。冒頭の型はいくつかある。結果を先に見せる、意外な問いを投げる、強い動きのある映像を置く、文字で強い主張を出す、の4つが基本だ。AI生成の映像は動きが強いカットを作りやすいので、最初のカットに動きを持たせると離脱を抑えやすい。

冒頭の1秒を作るために、生成するカットのうち1〜2本だけは解像度と動きの質に多めに時間をかける。全体を均等に作るより、冒頭と締めに集中投資するほうが、視聴維持率への影響が大きい。

生成モデルの選び方:得意分野で使い分ける

モデルごとの性格を理解する

映像生成モデルは、大きく分けて3つの系統がある。写実的な人物や風景を得意とする系統、スタイライズされたアニメ調やイラスト調を得意とする系統、そして長回しや複雑なカメラワークに強い系統だ。Flux系は静止画のディテールと質感に強く、Runway系は映像の一貫性と編集機能のバランスが良い。KlingやPixVerseなどは動きの自然さや縦型向けの出力に特徴がある。Sora系は長めのショットや物理的な動きの表現に強みがある。

重要なのは、どれが「最強」かではなく、どのカットに向いているかだ。人物のクローズアップは写実系、背景の世界観はスタイライズ系、商品の回転ショットは動きに強い系統、というようにカット単位で割り当てると失敗が減る。

選定チェックリスト

モデルを選ぶときは、次の順で確認する。第一に、出力できる縦横比と解像度。第二に、1本あたりの生成にかかる時間。第三に、同じ人物や同じ部屋を再現できる一貫性。第四に、音声やリップシンクに対応しているか。第五に、商用利用の条件。この5点を確認せずに使い始めると、後工程で作り直しが発生しやすい。

特に一貫性は初心者が見落としやすい。同じ人物を複数カットに登場させる場合、顔立ち・髪型・服装の説明を毎回同じ言葉で書く必要がある。参照画像を使えるモデルなら、基準となる1枚を作り、それを全カットで参照する運用が安定する。

無料枠と有料枠の使い分け

無料枠はテスト用、有料枠は本番用と割り切るのが現実的だ。構図の確認やカメラワークの検証は無料枠で行い、本番の書き出しだけ有料枠を使う。ただし無料枠は待ち時間が長く、透かしが入る場合もあるため、公開用の最終素材には向かない。まず無料枠で試作し、構成が固まってから有料枠で作り直す流れが効率的だ。

プロンプト設計:映像ディレクターのように指示する

5つの要素を順番に書く

映像生成のプロンプトは、次の5要素を順に書くと安定する。被写体、動作、構図、カメラ、光と雰囲気だ。例えば「白いシャツの女性が、木の机でノートを開く。上半身のミディアムショット。ゆっくりとしたプッシュイン。朝の柔らかい自然光、落ち着いた色調」という具合に組み立てる。

形容詞を並べるより、動詞とカメラ用語を具体的に書くほうが、意図に近い映像が出やすい。「美しい」「かっこいい」といった主観語は、モデルにとって情報量が少ない。代わりに「逆光」「浅い被写界深度」「手持ち風のわずかな揺れ」のように、撮影用語で指定する。

カメラワークの語彙を増やす

ショート動画では、カメラワークが視聴者の注意を引っ張る。覚えておきたい語彙は、固定ショット、プッシュイン、プルアウト、パン、チルト、オービット、ドリー、クレーン、手持ち、俯瞰、ローアングルだ。同じ被写体でも、カメラワークを変えるだけで印象が変わる。1本の動画の中で同じカメラワークを連続させると単調になるため、3カットごとに変化をつけると良い。

注意したいのは、1つのカットに複数のカメラワークを指示しすぎることだ。「オービットしながらプッシュインしてチルトする」のような指示は、モデルが混乱して破綻しやすい。1カット1モーションを原則にする。

一貫性を保つテクニック

一貫性を保つ方法は3つある。第一に、人物・服装・場所の説明文をテンプレート化し、全カットで同じ文言を使う。第二に、参照画像を用意し、それを全カットに適用する。第三に、背景を固定し、被写体だけを変える。特に第三の方法は簡単で、同じ部屋・同じ机・同じ照明で撮影したかのような統一感が出る。

また、色調を統一するために、プロンプトの末尾に共通のスタイル指定を入れるとよい。「シネマティックな色調」「彩度を抑えたフィルム風」「寒色寄りのホワイトバランス」など、1つの指定を全カットに付けるだけで、別々に生成したカットが同じ作品に見えてくる。

ネガティブ指定の使い方

避けたい要素はネガティブ指定に回す。文字化け、余分な指、歪んだ顔、二重の手足、ぼやけた輪郭などが代表例だ。ただしネガティブ指定を増やしすぎると、映像全体が硬くなる。多くても5項目程度に絞るのが実用的だ。

実践ワークフロー:15秒のショート動画を1本作る手順

ステップ1:企画とシーン分割(15分)

テーマを決め、一文コンセプトを書き、6カットのシーン分割表を作る。各カットの長さは2〜3秒を基本にする。この段階でテロップの文言も決めておくと、後の編集が速い。

ステップ2:キービジュアルの生成(20分)

最も重要な1カット、つまり冒頭か締めのカットから作る。静止画として構図を固め、気に入った1枚を基準画像にする。この1枚が動画全体の色調と雰囲気を決める。

ステップ3:各カットの映像生成(40分)

基準画像を参照しながら、各カットを2〜3案ずつ生成する。生成中に別の作業をすると待ち時間を有効に使える。選ぶ基準は、構図、動きの自然さ、一貫性の3点だ。完璧なカットを探すより、編集でつなげて違和感がないかを優先する。

ステップ4:編集でつなぐ(40分)

生成したカットをタイムラインに並べ、不要な冒頭と末尾を切り落とす。AI生成の映像は最初と最後の数フレームが不安定なことが多いため、各カットの前後を0.2〜0.5秒トリムすると安定する。カットの切り替えは、動きの方向を合わせると自然につながる。

ステップ5:テロップと音声(30分)

テロップは1画面1メッセージを守る。文字数は15〜20字程度に収め、表示時間は1.5秒以上確保する。音声は、ナレーションを入れる場合と、音楽と効果音だけで構成する場合がある。初心者には後者のほうが作りやすい。ナレーションを入れる場合は、生成音声の読み上げ速度を少し遅めに設定し、テロップと完全に一致させないほうが自然に聞こえる。

ステップ6:書き出しと確認(10分)

縦型の解像度で書き出し、スマートフォンで実際に再生して確認する。確認項目は、冒頭1秒で内容が伝わるか、文字が小さすぎないか、音量が急に大きくならないか、最後に余韻があるかの4点だ。

ステップ7:改善メモを残す(5分)

公開後、どのカットで離脱されやすかったかを記録する。冒頭の1秒、3秒地点、最後の3秒の3か所を確認すると、次回の改善点が見つかる。

編集と仕上げ:ツールの使い分けと音の設計

編集ツールの選び方

編集ツールは、手軽さと自由度のトレードオフで選ぶ。スマートフォン向けのアプリは、テロップのテンプレートや自動字幕が充実しており、短時間で見栄えのする動画を作れる。デスクトップ向けの無料編集ソフトは、カラー調整やキーフレーム制御ができ、色調の統一に向く。プロ向けの編集ソフトは細かい制御ができるが、学習時間が必要だ。初心者は、まずスマートフォンのアプリで1本完成させ、物足りなさを感じた部分から上位ツールに移るのがよい。

音の3層構造を作る

音は、ナレーション、音楽、効果音の3層で考える。音楽は動画の感情を決めるため、最初に選ぶ。効果音はカットの切り替えや動作の瞬間に置き、視覚的なリズムを補強する。ナレーションは情報を補足する。3層すべてを同じ音量で重ねると聞き取りにくくなるため、音楽は小さめ、効果音は短く、ナレーションは明瞭に調整する。

色調の統一

別々に生成したカットは、色温度やコントラストが微妙に違う。編集ソフトのカラー調整機能やフィルターを使って、全カットに同じ補正をかける。彩度を少し下げ、ハイライトを柔らかくすると、映像が同じ作品に見えやすい。

字幕とテロップの違いを意識する

字幕は音声の内容を文字で示すもの、テロップは情報を強調するものだ。両方を同じ見た目にすると、画面が単調になる。字幕は下部に小さめ、テロップは中央に大きめ、と役割で位置とサイズを分けると読みやすい。

よくある失敗とトラブルシューティング

映像が不自然に歪む

人物の指や顔が歪む場合、解像度が足りていないか、カメラワークの指示が複雑すぎる可能性がある。解像度を上げ、1カット1モーションに絞り、人物の全身よりも上半身のショットにする。手を使う動作は、手が画面から出る構図を避けると破綻しにくい。

カットごとに人物が別人になる

一貫性が崩れる最大の原因は、説明文の揺れだ。人物の特徴を固定したテンプレートを作り、全カットで同じ文言を使う。参照画像が使えるモデルなら必ず併用する。それでも崩れる場合は、顔のクローズアップを減らし、後ろ姿や手元のカットで構成を組む方法もある。

動きが速すぎて落ち着かない

短尺動画ではテンポが重要だが、すべてのカットで動きが激しいと疲れる。動きの強いカットの後に、静止に近いカットを挟むと、リズムが生まれる。3カット目、6カット目に静かなカットを置くのが定番の構成だ。

書き出しで色が変わる

編集ソフトで見た色と、書き出した動画の色が違うことがある。カラープロファイルの設定を確認し、公開先の推奨設定に合わせる。SNS向けなら標準的な色空間で書き出すと大きく崩れない。

生成に時間がかかりすぎる

生成待ちの時間は、プロンプトの見直しやテロップ作成に使う。複数カットを同時に生成できる環境なら、並行して依頼する。1本ずつ順番に生成するより、まとめて依頼して選ぶほうが効率的だ。

量産体制を作る:テンプレート化とレビュー

構成テンプレートを資産化する

1本作ったら、その構成をテンプレートとして保存する。冒頭の型、カット数、テロップの位置、音楽の種類、書き出し設定をメモし、次の動画で再利用する。テンプレートがあると、企画にかかる時間が大幅に短縮される。

プロンプト集を作る

よく使うプロンプトは、カットの種類ごとに整理しておく。人物の導入、動作のクローズアップ、風景の確立ショット、締めのカットなど、用途別に分類すると探しやすい。色調やカメラワークの共通指定も別枠で保存しておくと、全カットに適用しやすい。

レビューの観点を固定する

完成した動画は、毎回同じ観点で確認する。冒頭1秒で伝わるか、テロップは読みやすいか、音は聞き取りやすいか、色調は統一されているか、最後に次の行動につながるか。この5項目をチェックリストにしておくと、見落としが減る。

公開後の数字を記録する

再生回数だけでなく、視聴維持率、冒頭の離脱率、保存数、コメントの内容を記録する。数字が良い動画の共通点を探し、次のテンプレートに反映する。改善のループを回すことで、AI生成のばらつきを経験でカバーできるようになる。

よくある質問

Q. プログラミングや専門知識は必要ですか?

基本的には不要だ。必要なのは、伝えたい内容を整理する力と、映像の見た目を判断する目だ。編集ソフトの操作は、基本的なカット、テロップ、音量調整、書き出しの4つを覚えれば、大半のショート動画は作れる。

Q. 無料で始められますか?

試作段階は無料の範囲でも始められる。ただし公開用の素材は、透かしや解像度の制限がない環境で作り直すことを勧める。まずは短い動画を1本完成させ、必要になった時点で環境を整える順番が現実的だ。

Q. どのくらいの時間がかかりますか?

15秒の動画なら、慣れれば2〜3時間で1本完成する。最初の数本は倍以上の時間がかかるのが普通だ。作業を録画して振り返ると、どこで時間を使っているかが見え、短縮のヒントが得られる。

Q. 実写素材と組み合わせてもよいですか?

問題なく組み合わせられる。実際、スマートフォンで撮影した手元の映像や商品の実写を混ぜると、説得力が増す。AI生成の映像は世界観や導入に、実写は証拠や具体例に使うと役割分担が明確になる。

Q. 音声は自動生成と録音のどちらが良いですか?

情報を正確に伝えたい場合は録音、世界観を演出したい場合は自動生成が向く。自動生成の音声は、句読点の位置で間の取り方が変わるため、テロップと合わせて調整すると自然に聞こえる。

Q. 同じ動画を複数の場所に公開してもよいですか?

問題はないが、縦型の安全領域と推奨尺が異なる点に注意する。共通の安全領域に文字を収めておけば、1本の書き出しで複数の場所に対応できる。

Q. 生成した映像の権利はどうなりますか?

利用するサービスごとに条件が異なる。商用利用の可否、生成物の扱い、参照画像の権利について、利用前に規約を確認する習慣をつける。クライアント案件では、使用したツールと条件を記録しておくと安心だ。

Q. 上達するには何を練習すればよいですか?

1つのテーマを、尺を変えて3本作る練習が効果的だ。15秒、30秒、60秒で同じ内容を作ると、情報の取捨選択が上達する。また、好きな動画を1本選び、カット割りを書き出す練習も、構成力を鍛える。

まとめ:企画と編集に時間をかけるほど、AIは力を発揮する

AIショート動画制作の成否を分けるのは、ツールの数や新しさではなく、企画と編集の質だ。目的と視聴者を決め、尺とカット数を固定し、シーン分割表を作る。生成モデルはカットごとに得意分野で選び、プロンプトは被写体・動作・構図・カメラ・光の順で書く。一貫性はテンプレートと参照画像で担保し、最後は編集でテンポ、色調、音を整える。

最初から完璧を目指す必要はない。15秒の動画を1本作り、振り返り、テンプレートを更新する。この小さなループを繰り返すことが、最も確実な上達の道だ。生成の待ち時間を企画やテロップ作成に使い、判断基準をメモとして蓄積していけば、作業は確実に速くなる。AIは演出家ではなく、優秀な撮影クルーだと考え、監督の仕事である企画と編集に集中することが、初心者にとって最も近道になる。

Alexander

Alexander