テロップから動画へ変わる制作工程
テロップとは、もともと映像に重ねる文字情報を指す言葉です。ニュース番組の下部テロップ、講義動画の補足字幕、SNS動画の大きな文字など、目的はさまざまですが、共通しているのは「短い言葉で意味を伝える」という点です。近年は、このテロップや台本、箇条書きのメモを出発点にして、AIで映像そのものを生成する流れが現実的になりました。従来の映像制作では、企画、絵コンテ、ロケハン、撮影、編集、修正という工程を順番に進める必要がありました。プロンプトベースの制作では、この工程を完全になくすのではなく、一部を前倒ししたり並列化したりできます。
重要なのは、AIに丸投げするのではなく、テキスト情報を映像の設計図に変換するという考え方です。テロップは視聴者に向けたメッセージですが、プロンプトはAIモデルに向けた制作指示です。この二つを橋渡しする作業こそが、これからの映像制作の中心になります。たとえば「新商品の紹介」というテロップがあったとします。それをそのまま入力しても、商品の形、背景、光、カメラの動き、尺、雰囲気は決まりません。そこで、被写体、動作、環境、カメラ、ライティング、スタイル、時間軸を分解して記述します。
この記事では、テロップや台本から動画を組み立てるための実践的なワークフローを解説します。特定のサービスに依存せず、AI動画生成ツール全般に応用できる考え方を中心にします。初心者が最初の1本を作るための手順から、複数ショットの一貫性を保つ方法、音声や字幕の統合、よくある失敗の回避策まで扱います。
プロンプトベース映像制作の基本構造
プロンプトベースの映像制作は、大きく分けると「発想」「設計」「生成」「編集」「改善」の5段階で進みます。発想ではテロップや台本から伝えたいことを整理します。設計ではシーンを分割し、各カットの映像指示を作ります。生成ではAIモデルにプロンプトを入力し、複数候補を出力します。編集では選んだ素材をつなぎ、音声や字幕を加えます。改善では視聴者の反応や違和感をもとに指示を書き直します。
プロンプトに含めるべき7つの要素
映像生成の品質を安定させるには、次の7要素を意識すると整理しやすくなります。
- 被写体:誰が、何が映るのか。人物、動物、商品、風景など。
- 動作:何をしているのか。歩く、振り返る、手に取る、微笑むなど。
- 環境:どこで起きているのか。室内、街、海辺、抽象空間など。
- カメラ:距離、角度、動き。クローズアップ、俯瞰、ドリー、パンなど。
- ライティング:自然光、逆光、柔らかい光、ネオン、夕暮れなど。
- スタイル:写実的、アニメ、水彩、シネマティック、レトロなど。
- 時間軸:何秒で、どの順番で変化するのか。
これらをすべて毎回長文で書く必要はありません。最初は short に作り、出力を見ながら足し算と引き算をします。プロンプトは命令書であると同時に、修正可能な設計図です。
テロップ、ナレーション、字幕の違い
テロップは画面上の文字、ナレーションは音声、字幕は音声を文字にしたものです。AI動画生成では、これらを混同すると指示がぶれます。画面上に文字を出したいのか、読み上げさせたいのか、後から編集で載せるのかを先に決めます。生成モデルに文字そのものを描かせると崩れることが多いため、文字は編集工程で載せるほうが安全です。
短いプロンプトと長いプロンプトの使い分け
短いプロンプトは探索に向いています。まず「夕暮れの駅で電車を待つ人物、シネマティック、中景」のように入力し、構図の方向性を確かめます。長いプロンプトは再現性に向いています。採用する構図が決まったら、レンズ感、服装、背景の小道具、光の角度、カメラの速度まで書き足します。最初から長文にすると、どの指示が効いたのか分からなくなるため、段階的に増やすのがコツです。
台本とテロップをプロンプトに変換する手順
ここでは、実際の変換手順を見ていきます。題材は「地域のカフェを紹介する30秒動画」とします。テロップ案は「朝7時、一杯のコーヒーから始まる」「豆は店主が毎朝挽く」「窓際の席が人気」「今日もありがとう」の4つです。
ステップ1:シーンを分割する
最初にテロップを時間軸に並べます。0〜5秒は導入、5〜12秒は豆を挽く動作、12〜22秒は店内と窓際、22〜30秒は締めです。各テロップに対して1カットを作るのか、複数カットを重ねるのかを決めます。30秒なら4〜8カットが扱いやすいです。
ステップ2:各カットの目的を決める
カット1の目的は「朝の静けさと期待感」です。カット2は「手仕事の質感」、カット3は「居心地の良さ」、カット4は「余韻」です。目的が決まると、映像の色温度やカメラの速度が自然に決まります。
ステップ3:プロンプトを構造化する
カット1の例です。「早朝のカフェ、窓から差し込む柔らかな光、湯気の立つコーヒーカップ、木製カウンター、クローズアップ、ゆっくりしたプッシュイン、浅い被写界深度、温かい色調、写実的、シネマティック」。これをテロップの意味と照合します。テロップが「朝7時」なら、時計や外光で時間を示す小道具を足します。
ステップ4:候補を複数出す
同じプロンプトで2〜4案を生成し、構図、手の形、湯気の自然さ、背景の乱れを比較します。AI生成は毎回同じ結果にならないため、1回で決めずに選ぶ前提で進めます。
ステップ5:プロンプトを修正する
湯気が強すぎるなら「湯気は控えめ」、手が不自然なら「手はカップを持たず、注ぐ動作のみ」、背景がうるさいなら「背景はぼかし、木製棚のみ」と具体化します。否定形だけに頼らず、望む状態を肯定的に書くほうが安定します。
AIモデルとツールの選び方
AI動画生成ツールは、得意分野が異なります。写実的な人物、アニメ調、商品撮影、風景、抽象表現、長尺生成、短尺ループなど、目的に合わせて選びます。すべてを1つのツールでまかなうより、役割分担したほうが品質が上がる場合もあります。
判断軸は5つ
第一に、尺です。数秒のループが得意なモデルと、10秒以上のショットを生成できるモデルでは設計が変わります。第二に、一貫性です。同じ人物や商品を複数カットで出したいなら、参照画像やキャラクター固定の機能があると有利です。第三に、解像度とアスペクト比です。縦型ショート、横型広告、正方形投稿では必要な比率が違います。第四に、編集のしやすさです。出力形式、フレームレート、ウォーターマークの有無を確認します。第五に、作業量です。生成回数が増えるほど、選別と修正の時間も増えるため、自分の制作体制に合うものを選びます。
モデルごとの得意分野を把握する
写実的なシネマティック表現が得意なモデル、アニメやイラスト調が得意なモデル、広告商品の質感が得意なモデル、動きの大きいアクションが得意なモデルがあります。プロンプトの書き方もモデルごとに少しずつ違います。同じ指示でも、あるモデルでは自然に解釈され、別のモデルでは大げさになることがあります。日頃から短いテスト生成を行い、モデルごとの癖をメモしておくと判断が速くなります。
役割分担の考え方
すべてのカットを同じモデルで作る必要はありません。人物のクローズアップはA、風景のワイドはB、商品のマクロはCというように分担できます。ただし、色調やレンズ感がばらつくと別々の動画に見えるため、共通のルック指定を用意します。たとえば「色温度は暖色寄り」「コントラストは中程度」「フィルムグレインは弱め」といった共通プロンプトを各カットに足します。
絵コンテ・カメラワーク・ショット設計
テキストから映像を作るときも、絵コンテの考え方は役立ちます。絵コンテは上手に描く必要はありません。各カットの目的、被写体、カメラ、尺をメモした表で十分です。
カメラ用語をプロンプトに落とす
カメラワークは映像の意味を大きく変えます。固定ショットは落ち着き、パンは空間の広がり、ドリーは感情の近づき、ハンドヘルドは臨場感、俯瞰は客観性、ローアングルは力強さを生みます。プロンプトでは「固定カメラ」「ゆっくりしたパン」「被写体に近づくドリー」「わずかな手持ちの揺れ」のように書きます。動きを指定しすぎると破綻することがあるため、1カットにつき主要な動きを1つに絞ると安定します。
ショットリストの作り方
ショットリストには、カット番号、尺、テロップ、映像内容、カメラ、音、備考を書きます。例として、カット1は5秒、テロップ「朝7時」、映像は湯気の立つコーヒー、カメラはクローズアップのプッシュイン、音は静かな環境音、備考は時計を背景にぼかして入れる、となります。この表があると、生成後の足りないカットが一目で分かります。
トランジションは編集で考える
AI生成でカットをつなぐ場合、トランジションまで生成モデルに任せると不安定になりがちです。カットごとに素材を作り、編集ソフトでカットつなぎ、ディゾルブ、マッチカット、ホワイトフラッシュなどを加えるほうが制御しやすいです。テロップの切り替えと映像の切り替えを同期させると、短い動画でも印象が強くなります。
一貫性を保つための実践テクニック
複数ショットの動画で最も難しいのが一貫性です。人物の顔、服装、髪型、背景、光の方向、色調がカットごとに変わると、視聴者はすぐに違和感を覚えます。
参照画像を用意する
主人公や商品の参照画像を用意し、各カットの生成時に共通で使います。正面、横顔、全身、表情違いなど複数あると安定します。参照画像は高解像度で、背景がシンプルなものを選びます。
キャラクターシートを作る
文章でキャラクター設定を固定する方法も有効です。「30代前半、黒髪短髪、紺のシャツ、ベージュのエプロン、左手に銀の時計」のように、変えたくない要素を列挙します。各プロンプトの冒頭または末尾に同じ記述を置くことで、モデルが参照しやすくなります。
背景とライティングを固定する
同じ場所で起きているシーンなら、背景の要素と光の方向を固定します。「大きな窓は画面左、午前の柔らかな逆光、木製カウンター、緑の観葉植物」などです。時間経過を描く場合も、光の方向を急に変えないほうが自然です。
シード値とバリエーション管理
多くの生成ツールにはシード値があります。同じシード値を使うと似た傾向の出力が得られ、変更すると別のバリエーションになります。採用したカットのシード値、プロンプト、モデル名、生成日をメモしておくと、後から再現しやすくなります。
失敗しやすいポイント
一貫性が崩れる原因は、プロンプトの語順がカットごとに大きく違う、参照画像の角度がばらばら、色調指定が抜けている、背景の小道具が増減している、などです。解決策は、共通プロンプトブロックを作り、各カットで同じ位置に貼ることです。
音声・字幕・BGM・編集の統合
AIで映像素材を作ったら、次は音と文字を加えます。ここを丁寧にすると、生成映像の粗さが目立ちにくくなります。
ナレーションと音声合成
ナレーションはテロップの内容をそのまま読むのではなく、映像に合わせて短く言い換えます。音声合成を使う場合も、句読点、間、速度を調整します。固有名詞や数字は読み間違いがないか確認し、必要なら別テイクを作ります。
字幕とテロップの配置
字幕は読みやすさが最優先です。フォントサイズ、行数、表示時間、背景とのコントラストを確認します。縦型動画では上下の安全領域を意識し、プラットフォームのUIと重ならない位置に置きます。テロップは強調したい言葉だけに絞ると、画面がうるさくなりません。
BGMと効果音
BGMは映像のテンポを決めます。静かな導入、中盤の高まり、最後の余韻というように構成します。効果音は動作に合わせて少量入れると効果的です。カップを置く音、足音、通知音など、映像にない音を足すことで臨場感が増します。
編集での仕上げ
編集では、カットの長さをテロップの読みやすさに合わせます。色補正でカット間の色をそろえ、必要なら軽いグレインやシャープを加えます。書き出し設定は、投稿先の推奨解像度、フレームレート、ビットレートに合わせます。生成素材は圧縮されていることがあるため、過度な再圧縮を避けます。
よくある失敗とトラブルシューティング
人物の顔や手が崩れる
顔や手は難易度が高い部分です。引きの構図にする、手を使う動作を減らす、参照画像を追加する、別モデルで部分修正するなどの対策があります。どうしても不安定な場合は、手前にテロップや图形を重ねて隠す編集も有効です。
動きが速すぎる、遅すぎる
「ゆっくりした」「わずかな」などの速度表現を足します。それでも速い場合は、フレーム補間や編集での速度調整を使います。逆に遅い場合は、カットを分割してテンポを作ります。
色調がカットごとに違う
共通の色調プロンプトを用意し、編集でホワイトバランスを合わせます。カットごとに時間帯が違う設定なら、意図的な差として見せる工夫も必要です。
テロップと映像が合わない
テロップが先にあり、映像が後から付いていると起こります。各テロップを「見せたい感情」「必要な情報」「視聴後の行動」に分解し、それに合う映像指示を選び直します。
生成回数が増えて迷走する
最初に採用基準を決めます。たとえば「手が自然」「背景がシンプル」「光が左から」「尺が3秒以上」などです。基準を満たさない候補は早めに捨て、プロンプトの変更点を一度に1つにします。
30秒動画を作る実践ワークフロー
ここでは、30秒の商品紹介動画を例に、最初から最後までの流れを整理します。
1. メッセージを1文にする
「毎朝の一杯で、忙しい一日に小さな余白をつくる」を中心メッセージにします。すべてのテロップとカットは、この1文に戻って確認します。
2. テロップを4つに絞る
「朝の余白」「豆を挽く音」「湯気の向こう」「今日も一杯」の4つにします。1テロップあたり5〜8秒を目安にします。
3. ショットリストを作る
カット1は朝の窓とカップ、カット2は豆を挽く手元、カット3は湯気と人物の横顔、カット4は窓際の席と締めのロゴです。各カットにカメラ、光、色、音を書きます。
4. 共通プロンプトを決める
「温かい色調、柔らかな自然光、浅い被写界深度、フィルムグレイン弱め、写実的、シネマティック」を全カットに使います。
5. 各カットを2〜4案生成する
参照画像を使い、手や湯気の自然さを確認します。採用した候補はファイル名にカット番号とテイク番号を入れます。
6. 音声と字幕を作る
ナレーションは15〜20秒程度に収め、テロップは編集で載せます。BGMは静かなピアノから始め、中盤で少し楽器を足します。
7. 編集して書き出す
カットをつなぎ、テロップのタイミングを調整し、色補正をします。縦型なら1080×1920、横型なら1920×1080を基準に、投稿先に合わせて書き出します。
8. 公開後に改善する
最初の3秒で離脱が多いなら導入を変えます。中盤の離脱が多いならテンポを上げます。最後まで見られるなら締めのテロップを強くします。数字を見て、次のプロンプトに反映します。
FAQと上達のためのチェックリスト
初心者は何から始めればよいですか
15秒以内、1カット、テロップ1つから始めます。「誰が、どこで、何をしていて、どんな光か」の4項目だけを書きます。最初から長編を作ろうとすると、修正点が多すぎて学びが散らばります。
プロンプトは英語のほうがよいですか
モデルによっては英語のほうが安定することがあります。ただし日本語で考えた内容をそのまま訳すのではなく、映像用語に置き換えることが大切です。日本語で台本を作り、映像指示だけを英語にする運用も有効です。
有料ツールは必要ですか
無料枠でも練習はできます。ただし書き出し解像度、ウォーターマーク、生成待ち時間、商用利用条件を確認します。作業時間を短縮したい場合や、一貫性機能を使いたい場合に有料プランを検討します。
生成した動画が不自然です
1つのプロンプトに多くの動作を詰め込みすぎていないか確認します。1カット1動作に絞り、カメラも1つにします。それでも不自然なら、参照画像を追加するか、静止画から動画化する方法に切り替えます。
テロップの内容が伝わりません
テロップは短く、具体的にします。「高品質」ではなく「毎朝挽きたて」、「便利」ではなく「片手で開く」のように、視聴者が映像で確認できる言葉にします。
上達のためのチェックリスト
- 中心メッセージは1文で言えるか。
- テロップは1画面につき1メッセージか。
- 各カットの目的は明確か。
- 被写体、動作、環境、カメラ、光、スタイル、時間が書かれているか。
- 共通プロンプトで色調とルックをそろえているか。
- 参照画像やキャラクター設定で一貫性を保っているか。
- 音声、字幕、BGMが映像の意味を強めているか。
- 書き出し設定は投稿先に合っているか。
- 公開後の数字を次の改善に使っているか。
テロップから動画へという流れは、特別な才能よりも設計力がものを言います。言葉を映像の要素に分解し、小さく試し、記録しながら改善する。この繰り返しが、プロンプトベース映像制作をマスターする最短ルートです。最初の1本は短くて構いません。大切なのは、テロップの一行を、光、動き、音、時間へと変換する感覚を身につけることです。


