AI動画生成の現在地——「作れる」から「使い分ける」へ
AI動画生成は、奇妙で短いデモを眺める段階を終えた。いま現場で問われているのは「どのモデルが最もすごいか」ではなく、「どの工程でどのモデルを使い、どう繋げば納品できる品質になるか」である。
数秒のクリップを1本作るだけなら、プロンプトを一行入れるだけでそれらしい映像は出てくる。しかし15秒の広告、60秒の商品紹介、3分のブランドストーリーとなると景色は一変する。ショット間で人物の顔が変わり、ロゴが崩れ、カメラが勝手に跳ね、光の向きがカットごとに反転する。視聴者は理屈ではなく直感でその違和感を拾う。
ボトルネックは生成能力そのものではなく、工程設計にある。モデルは日々更新され、昨日の最適解が今日の次善手になる。だからこそ「モデル名の暗記」ではなく「選定の基準」と「手順の型」を持っておくことが、長く使えるスキルになる。
この記事では、Kling系をはじめとするアジア発のモデル群と、Sora、Runway、Luma、Pikaといった欧米系モデルの特性を比較軸で整理し、企画から納品までの実務ワークフロー、一貫性を守る具体テクニック、よくある失敗のリカバリー、チーム運用までを一本にまとめる。特定のツールを信仰するのではなく、案件ごとに最適な組み合わせを選べる状態を目指したい。
モデル選定の前に固めるべき要件
機材やツールの話に入る前に、案件の要件を言語化しておく。ここを飛ばすと、生成のたびに方針が揺れ、試行回数だけが増えて完成が遠のく。
尺とショット数
最終尺が8秒なのか90秒なのかで、必要なショット数はまるで違う。目安として、テンポの速いSNS向けなら1ショット1.5〜2.5秒、解説動画なら3〜5秒、情緒的なブランド映像なら5〜8秒で1カットを設計する。90秒の動画なら20〜35ショットになり、これは「1本の長い生成」ではなく「多数の短い生成を編集で繋ぐ」前提だと考えたほうがよい。
一貫性の要求度
同じ人物が複数カットに登場するのか、同一の商品が角度を変えて映るのか、あるいは風景だけの映像なのか。人物の顔と衣装の一貫性は最も難易度が高く、商品の形状維持はそれに次ぐ。逆に風景や抽象映像は一貫性の要求が緩く、比較的短時間で成立する。
動きの複雑さ
歩行、走行、車の走行、水しぶき、布のはためき、手を使った動作。これらは難易度が段階的に上がる。とくに手指を使う動作、複数人物の接触、鏡や液体の反射は破綻しやすい。複雑な動きが必要なカットは、生成に頼らず実写やモーショングラフィックスで補う判断も必要になる。
テキストとロゴの扱い
画面内に日本語の文字を出したい場合、多くのモデルは依然として苦手だ。結論から言えば、文字は生成させず、編集ソフトで後載せするのが最も確実で速い。ロゴも同様に、生成結果に任せず合成する。この割り切りができるだけで、制作時間は大きく短縮される。
納品形式と権利
縦型か横型か、解像度は、フレームレートは、音声は必要か、商用利用の範囲はどうか。これらを最初に確定しておくと、後工程での作り直しが激減する。
主要モデルの比較軸と実際の傾向
モデル比較で意味があるのは、ベンチマークの順位ではなく「どの用途でどれが安定するか」という傾向の把握だ。以下は実際の制作現場で観察されやすい特徴を、用途別に整理したものである。
欧米系モデルの傾向:Sora、Runway、Luma、Pika
Sora系は長尺での物語的一貫性と物理挙動の自然さに強みがある。複雑なシーン遷移を含む映像や、カメラが大きく動くカットでも破綻が少ない。一方で生成にかかる時間とコストは重めで、ラフ検討の段階で大量に回す用途には向かない。
Runway系は編集機能との統合が進んでおり、部分的な修正やスタイル変換、モーション制御の操作性が高い。マットペイントやVFX的な発想で使いたい場合に強い。
Luma系はカメラワークの指示に対する応答が素直で、滑らかな動きの映像を作りやすい。商品の回り込みや空間の移動など、カメラ設計が主役のカットで力を発揮する。
Pika系は短尺のSNS向けクリップやスタイライズされた表現に向く。軽快なテンポのカットを数多く量産する用途で扱いやすい。
アジア発モデルの傾向:Kling、Hailuo、Hunyuan、PixVerse
Kling系はプロンプトの指示に対する忠実度が高く、とくに人物の動きや身体表現の自然さで評価されることが多い。マーケティング素材を短時間で大量に必要とする案件では、指示通りの構図が出やすい点が実務上の利点になる。
Hailuo系は短尺で強い動きのあるカットに強く、SNS広告のフック映像と相性がよい。Hunyuan系はリアルな質感とライティングの再現に安定感があり、人物の肌や屋外光の表現で扱いやすい。PixVerse系はスタイルのバリエーションが豊かで、アニメ調やイラスト調の表現を素早く試せる。
重要なのは、これらの傾向は数か月単位で入れ替わるという前提だ。モデルの優劣を固定観念で語るのではなく、案件ごとに小さなテストを行って確認する習慣を持つほうがよい。
選定マトリクスの作り方
選定を属人的な勘にしないために、次のような表をチームで共有しておく。
| 要件 | Sora系 | Runway系 | Kling系 | Hailuo系 | Luma系 |
|---|---|---|---|---|---|
| 長尺の一貫性 | ◎ | ○ | ○ | △ | ○ |
| 指示忠実度 | ○ | ○ | ◎ | ○ | ○ |
| カメラ制御 | ◎ | ◎ | ○ | ○ | ◎ |
| 短尺量産 | △ | ○ | ◎ | ◎ | ○ |
| 動きの激しさ | ○ | ○ | ◎ | ◎ | ○ |
| 生成スピード | △ | ○ | ◎ | ◎ | ○ |
この表は絶対的な評価ではなく、あくまで初期仮説だ。自社の案件で3〜5本ずつテスト生成し、結果を上書きしていくことで、自分たち専用の判断基準になっていく。
実践ワークフロー——企画から納品までの8ステップ
ここからは具体的な手順を示す。ポイントは、生成AIを「撮影の代替」ではなく「撮影前の設計を支援し、撮影後を補完する道具」として位置づけることだ。
ステップ1:目的とKPIを一文で書く
「新商品の存在を知ってもらい、LPへの遷移率を上げる」「社内研修で手順を誤解なく伝える」。この一文がないまま生成を始めると、映像が綺麗でも成果に繋がらない。尺、媒体、視聴者、行動喚起の4点を最初に決める。
ステップ2:台本とショットリストを作る
台本は音声の原稿ではなく、ショットリストとして設計する。表形式で「カット番号/内容/尺/カメラ/ライティング/必要な一貫性要素」を列記する。この表がそのままプロンプトの設計図になり、レビューの基準にもなる。
例えば30秒の商品紹介なら、次のように分解する。
- 0.0〜3.0秒:商品のシルエットが暗闇に浮かぶ。カメラはスローなプッシュイン。
- 3.0〜8.0秒:自然光の下で商品を手に取る人物の手元。浅い被写界深度。
- 8.0〜15.0秒:使用シーンのカットバック。人物の表情は映さず、動きだけを見せる。
- 15.0〜22.0秒:商品のクローズアップ6カットをテンポよく繋ぐ。
- 22.0〜30.0秒:ロゴとコピーを後載せ、余韻のある静止に近い動き。
ステップ3:参照アセットを揃える
一貫性の土台は参照画像である。人物なら正面・斜め・横・後ろの4方向、表情バリエーション、衣装のディテール。場所なら広角・中景・寄りの3種。これらをあらかじめ用意しておくと、以降の生成が驚くほど安定する。参照画像は高解像度すぎる必要はないが、ライティングの方向が揃っていることが重要だ。
ステップ4:プロンプトを構造化する
思いつきの文章を投げるのではなく、要素を固定したテンプレートを使う。
- 被写体:誰が/何が、年齢感、服装、表情
- アクション:何をするか、動きの速度と方向
- 環境:場所、時間帯、天候、周囲の要素
- カメラ:ショットサイズ、アングル、動き、レンズ感
- ライティング:光源の方向、質、色温度
- スタイル:質感、フィルム感、色調
- 制約:避けたい要素(例:余計な人物、文字、ロゴ)
この7項目を毎回同じ順序で書くだけで、結果のばらつきが減り、失敗したときにどこを直すべきかが分かるようになる。
ステップ5:生成して選別する
1カットにつき複数案を出し、比較して選ぶ。選別の観点は「綺麗かどうか」ではなく「前後のカットと繋がるか」だ。単体で見て美しくても、隣のカットと光の向きが違えば使えない。選別は必ずショットリストの順に並べて行う。
効率化のコツは、まず低い解像度と短い尺で構図だけを確定し、構図が決まったカットだけを本番品質で再生成すること。最初から最終品質で回すと、試行回数がそのまま時間になる。
ステップ6:動きとカメラを調整する
生成段階で動きが思い通りにならない場合、二つの選択肢がある。ひとつはプロンプトのカメラ記述を具体的にすること(例:ゆっくりと右にパン、被写体に対して平行移動、焦点距離を保つ)。もうひとつは動きを諦めて静止に近い映像にし、編集側でスケールと位置をキーフレームで動かすことだ。後者のほうが制御は圧倒的に容易で、視聴者の知覚上も遜色ないことが多い。
ステップ7:編集・音・カラーで仕上げる
生成結果は素材であって完成品ではない。編集でテンポを整え、BGMと効果音を載せ、カラーグレーディングでショット間の色調を統一する。テキストとロゴはこの工程で載せる。音が入るだけで、AI生成映像の印象は大きく変わる。とくに環境音と質感のある効果音は、生成特有のわずかな不自然さを覆い隠してくれる。
ステップ8:レビューと納品
チェックリストで確認し、必要なら部分修正する。全面的な再生成は最後の手段であり、部分的な差し替えや編集での処理で解決できるケースが多い。納品時には、使用した素材の管理情報と、規約上の確認事項をまとめておく。
一貫性を守る実務テクニック
一貫性は才能ではなく手順で担保する。以下は現場で効果が大きい順に並べた実践策だ。
キャラクターの一貫性
参照画像を固定し、髪型、衣装、体格を言語でも明記する。とくに「同じ人物」と指示するだけでは不十分で、「短めの黒髪、右眉の上にほくろ、紺のシャツ、細身」のように識別可能な特徴を毎回同じ表現で書く。表現を言い換えると、モデルは別人として解釈することがある。
ロケーションの一貫性
同じ部屋や街を複数カットで使う場合、基準となる1枚を「マスター画像」として固定する。窓の位置、家具の配置、壁の色を明記し、カメラアングルが変わっても同じ空間だと分かる手がかりを最低2つ入れる。
小道具と衣装の連続性
カットごとに小道具の位置が変わると観客は瞬時に気づく。ショットリストに小道具の状態(例:時計は左手、コップは半分、扉は閉まっている)を注記する。地味だが効果は絶大だ。
ライティングの統一
最も見落とされやすいのが光の連続性である。同じシーンなら、光源の方向と色温度を全カットで統一する。「左からの暖色の窓光、補助光なし」のように言語化し、プロンプトに毎回含める。編集段階でカラー調整して合わせるより、生成段階で揃えたほうが品質は高い。
カメラワークとモーション制御の設計
カメラの動きは、映像の意味を決める重要な要素だ。ここを設計せずに生成すると、モデルは勝手に動かし、カットごとに落ち着きのない映像になる。
基本のカメラ語彙
- フィックス:カメラを固定し、被写体だけが動く。最も安定し、一貫性も保ちやすい。
- パン/ティルト:水平・垂直の回転。空間の広がりを見せたいときに使う。
- ドリー/プッシュイン:前後移動。感情の高まりや注意の集中に効く。
- トラッキング:被写体と並走。動作の速度感を伝える。
- クレーン/上昇:視点の解放。シーンの締めに使いやすい。
生成AIでカメラを制御するコツ
第一に、1カットに複数のカメラ動作を入れない。パンとズームを同時に指示すると、破綻率が跳ね上がる。第二に、速度を言葉で指定する(ゆっくり、一定の速さで、加速しながら)。第三に、被写体とカメラの距離関係を明示する。第四に、必要なら撮影後の編集で動きを加える前提で、生成ではむしろ動かさない選択をする。
「動かしたい」という欲求を編集工程に移すだけで、破綻の大半は消える。これはAI映像制作における最も費用対効果の高い判断のひとつだ。
用途別プロンプトと構成の実例
商品広告(15〜30秒)
構成は「フック→課題→解決→証拠→行動喚起」の5ブロック。フックの1ショットで動きを強くし、以降は安定したカットで信頼感を作る。生成では商品の形状維持が課題になるため、参照画像を複数角度から用意し、回転や移動は控えめにする。文字と価格は編集で載せる。
教育・研修(3〜8分)
長尺では一貫性の要求が最も厳しい。人物を出す場合、ナレーション主体にして人物は手元や後ろ姿に限定すると破綻が減る。図解やテロップ主体の構成にし、AI生成は導入の情景カット、概念の比喩映像、まとめの映像に絞る。章ごとにライティングと色調を固定すると、長時間でも統一感が保てる。
SNSショート(6〜15秒)
最初の1秒で動きか意外性を出す。テロップは大きく、1画面1メッセージ。縦型前提で構図を設計し、被写体の顔を画面中央よりやや上に置く。量産が前提なので、バリエーション違いを複数生成して当たりを探る運用が向く。
ストーリーテリング(60〜180秒)
ショットの長さに緩急をつける。静のカットを続けたあとに動のカットを置くと、感情の起伏が生まれる。人物のクローズアップは最小限にし、手元、足元、後ろ姿、風景で感情を語ると、一貫性の問題を回避しつつ余韻を作れる。
よくある失敗とリカバリー手順
手指や体の破綻
最も頻出する問題。対策は3段階。まず構図から手を外す。次に手を使う動作を短いカットにし、動きの途中で切る。それでも残る場合は、手元だけ別カットとして生成し、編集で繋ぐ。手のクローズアップはどうしても破綻しやすいので、避けられるなら避けるのが正解だ。
テキストやロゴの崩れ
生成に任せないこと。これが唯一の確実な解決策である。背景に文字が混入する場合は、ネガティブ指定に「文字、看板、ロゴ、記号」を加え、それでも消えない場合は編集でマスクして消す。
フリッカーとちらつき
ショット内で細部が細かく振動する現象。原因は主に動きの複雑さと解像度の不足だ。動きを単純化し、参照画像を増やし、生成尺を短くして編集で伸ばす。編集ソフトの手ぶれ補正やノイズ除去が効く場合もある。
カット間のジャンプ
色調、光の向き、レンズ感の不一致から起こる。カラーグレーディングで色を揃え、必要なら中間カットを挿入して視覚的な橋渡しをする。あるいは意図的にトランジションを使い、不連続を演出として処理する。
意図しない人物の増殖
群衆シーンで発生しやすい。人数を明示し、「背景に他の人物を入れない」と指定する。それでも増える場合は、人数の少ない構図に変更する。
品質チェックリストとチーム運用
納品前の最終確認は、感覚ではなくチェックリストで行う。
- ショット間で人物の特徴が一致しているか
- 光源の方向と色温度がシーン内で揃っているか
- 小道具の位置と状態が連続しているか
- カメラの動きが意図通りで、不要な揺れがないか
- テキストの可読性と誤字、安全領域の確保
- 音声とBGMのバランス、無音区間の有無
- 尺、解像度、フレームレート、書き出し形式
- 権利と規約上の確認事項
チームで運用する場合は、次の3点を仕組みにする。第一に、プロンプトのテンプレートと参照画像を共有ライブラリに置く。第二に、生成パラメータと結果を記録し、再現できるようにする。第三に、レビューをショットリスト上で行い、修正指示をカット番号で管理する。これにより、担当者が変わっても品質が落ちない。
コストと時間の管理も重要だ。1カットあたりの試行回数の上限を決め、超えたらアプローチ自体を変える。同じプロンプトを繰り返し回すのは、時間の使い方として最も効率が悪い。
FAQ
どのモデルから始めればよいですか
用途が決まっていないなら、短尺の量産が得意なモデルと、カメラ制御に強いモデルの2つを試すのが効率的だ。両者の得意分野は重ならないことが多く、組み合わせの幅が見えてくる。
日本語のプロンプトでも問題ありませんか
多くのモデルは英語のほうが意図を正確に解釈しやすい。日本語で組み立てた後、英語に翻訳して投入する運用が安定しやすい。ただし固有名詞やスタイル名は英語のまま使うほうがよい。
実写とAI生成はどう使い分けますか
人物の演技、商品の質感、手指を使う動作は実写が有利だ。風景、抽象概念、危険な場所、存在しない世界、大量のバリエーションが必要な素材はAI生成が有利。両者を同じタイムラインで色調を揃えて混ぜるのが現実的な最適解になる。
生成した映像の権利はどう考えればよいですか
利用するサービスの規約を必ず確認し、商用利用の可否、学習利用の扱い、第三者素材との関係を整理しておく。判断に迷う案件では、契約書に利用条件を明記する。
一貫性がどうしても取れないときは
生成で解決しようとせず、カット割りを変える。正面の顔を見せず、手元や後ろ姿、シルエット、風景で繋ぐ。あるいは静止画を先に作り、そこから動かす方式に切り替える。制約を構図で吸収するのが最も確実な解決策だ。
どれくらいの学習時間が必要ですか
最初の1本を完成させるまでが最も長い。ショットリストを書き、3〜5カットを生成し、編集で繋いで15秒にまとめる演習を1回通せば、勘所の大半は掴める。以降は案件ごとに精度が上がっていく。
まとめ——モデルは入れ替わるが、工程は残る
AI動画生成の世界は、特定のモデル名を追いかけるだけでは追いつけない速さで動いている。しかし、要件を固め、ショットリストを書き、参照を揃え、プロンプトを構造化し、選別して編集で仕上げるという工程そのものは、モデルが入れ替わっても価値を持ち続ける。
Kling系のような指示忠実度の高いモデルは、量産と精度の両立を可能にした。欧米系のモデルは長尺の一貫性とカメラ制御で優位に立つ。だが最終的な品質を決めるのは、どのモデルを使ったかではなく、どのカットをどう繋いだかである。
まずは15秒の動画を1本、最後まで通してみてほしい。生成、選別、編集、音入れ、書き出しまでを一度経験すると、次にどの工程を改善すべきかが具体的に見えてくる。それが、モデルの流行に振り回されない制作体制への第一歩になる。



