動画の印象は「映像」より「音」で決まる
動画制作を学び始めると、時間の大半はカット割り、色調整、テロップの配置に費やされる。ところが公開後の視聴データを見ると、離脱が起きるポイントの多くは音に原因がある。ナレーションが小さくて聞き取れない、BGMがうるさくて話が頭に入ってこない、逆に無音の区間が長すぎて間延びする。こうした問題は、映像をどれだけ作り込んでも解決しない。
近年は、スマートフォンで無音のまま再生されるケースも珍しくない。字幕が前提になった一方で、音を消して見る視聴者と、イヤホンで集中して聴く視聴者が同じ動画を共有している。つまり一本の動画に対して、二つの異なる聴取体験を同時に設計しなければならない。前者にはテロップと視覚的なリズム、後者にはナレーションの情報量とBGMの質感が求められる。
AIによる音声合成と音楽生成が実用レベルに達したことで、この設計作業は大きく変わった。かつては声優の収録と楽曲のライセンス取得がボトルネックだったが、今は原稿と指示文があれば短時間で素材が揃う。ただし、生成できることと、作品で使える音になることの間には大きな差がある。本記事では、AI音声とBGMを動画に統合する実務的な流れを、判断基準と失敗例を交えて整理する。
音の設計図を先に描く:3層モデル
音作りで最初にやるべきは、機材やツールを選ぶことではなく、層の分離だ。動画のオーディオは、役割の異なる三つの層に分けて考えると破綻しにくい。
ナレーション層(情報を運ぶ)
ナレーションは情報伝達の主役であり、視聴者が内容を理解する速度を決定する。ここで優先すべきは声の美しさよりも明瞭さだ。一文字も聞き漏らさない状態を作れれば、映像が多少粗くても内容は伝わる。逆に声質が魅力的でも、滑舌や間の取り方が不自然なら内容は入ってこない。
BGM層(感情を運ぶ)
BGMは感情の温度を決める。同じ映像でも、静かなピアノが流れれば郷愁に、速いビートが流れれば高揚に変わる。重要なのは、BGMが主張しすぎないことだ。ナレーションと同じ帯域で音がぶつかると、聞き取りやすさが落ちる。BGMは「聞かせる」ためではなく「感じさせる」ために置く。
効果音・環境音層(現実感を運ぶ)
効果音と環境音は、映像に物理的な重みを与える。扉が閉まる音、足音、遠くの街噪、風の音。これらが欠けると、どれだけ映像が精緻でも空間が平板に見える。逆に過剰に入れると情報が濁る。効果音は「見えているものの音」だけにとどめ、見えないものの音は最小限にするのが基本だ。
この三層を先に決めてから作業に入ると、後戻りが減る。どの層を主役にするかを最初に宣言しておくと、音量バランスの判断に迷わなくなる。
AI音声合成でナレーションを作る
音声合成ツールは多数あり、どれを選ぶかよりも、どう使うかで結果が大きく変わる。ここでは作業順に沿ってポイントを整理する。
声質と話速の選び方
声を選ぶときは、次の順番で絞り込むと失敗しにくい。
- 性別・年齢感よりも「声色の温度」で選ぶ。落ち着いた低音は説明に向き、明るい中音は案内や紹介に向く。
- 話速は標準よりわずかに遅く設定する。速い読み上げは慣れると気にならないが、初見の視聴者には負荷が高い。
- 一文の長さを短くし、句点ごとに短い無音を入れる。これだけで聞き取りやすさが大きく変わる。
- 同じ動画内では声を混ぜない。複数の声を併用するのは、役割が明確に分かれている場合だけにする。
「読む原稿」を「聴く原稿」に書き換える
音声合成の品質が上がっても、原稿が読み言葉のままだと不自然になる。書き言葉は接続詞が多く、修飾が入れ子になりやすい。次の変換を習慣にするとよい。
- 一文を三十字前後に分割する。長い一文は二つに割る。
- 「〜ということになります」は「〜です」に短縮する。
- 記号や括弧は読み上げられない前提で、言葉に置き換える。
- 数字は読み方の揺れを潰す。「1,200円」は「千二百円」と書く。
- 同音異義語が続く箇所は、語順を変えるか別の語に置き換える。
固有名詞と発音の調整
人名、社名、専門用語は音声合成が誤読しやすい。誤読は視聴者の信頼を一瞬で落とすので、公開前の確認は必須だ。対策は三つある。読み辞書に登録する、カタカナやひらがなで読みを直接指定する、どうしても安定しない場合はその一文だけ収録音声に差し替える。
感情と抑揚のコントロール
平坦な読み上げは、内容が正しくても眠くなる。抑揚は文単位で設計する。導入は少し低く落ち着かせ、要点で一度上げ、結論で下げる。段落の変わり目には余白を入れる。この緩急があるだけで、同じ声でも情報の強弱が伝わる。
BGM生成の実践:ムードとテンポを映像に合わせる
BGM生成は、指示文の質がそのまま出力の質になる。感覚的な言葉だけを並べても結果は安定しない。分解して指定するのが近道だ。
プロンプトを5要素に分解する
- ジャンル:ローファイ、アンビエント、オーケストラル、シンセポップなど。
- 楽器構成:ピアノとストリングス、アコースティックギターのみ、など。
- テンポ:おおよそのBPM。会話の下に敷くなら70〜95程度が扱いやすい。
- 感情:希望、緊張、郷愁、軽快、静謐。
- 構成:最初は静かで中盤に盛り上げ、最後は減衰、など。
この五つを明記すると、狙った雰囲気に近い候補が出やすくなる。逆に「かっこいい曲」のような抽象語だけでは、毎回異なる結果になり再利用できない。
尺・ループ・トランジション
生成した曲は、そのまま使うより編集して使う前提で考える。
- 尺は動画より少し長めに作る。切り詰める前提なら余裕があるほうがよい。
- ループ点位相を探し、繰り返しても違和感のない区間を切り出す。
- 場面転換では曲を切り替えるより、フィルターや音量で一度落としてから次へ繋ぐと自然になる。
- 冒頭は映像の1秒前から入れると、耳が音に慣れてから本編に入れる。
映像との同期ポイント
BGMは常に同じ音量で流し続ける必要はない。カットの切り替わり、テロップの出現、ナレーションの区切りに合わせて、数デシベルの上下やフィルターの開閉を入れる。特に話が切り替わる瞬間に一度音を薄くすると、視聴者の注意が新しい話題に向く。
編集ソフトに組み込む7ステップのワークフロー
ここからは実際の作業順を追う。動画編集ソフトは何でもよいが、複数トラックと音量オートメーションが扱えるものを前提とする。
ステップ1:映像のラフカットを確定させる
音を載せる前に、映像の長さとカット位置を固める。音に合わせて映像を直すと、後工程がすべて崩れる。まず絵を決め、音はそれに従わせる。
ステップ2:ナレーションを配置する
読み上げ原稿の段落ごとに音声を書き出し、段落単位でタイムラインに置く。一括生成した長い音声をそのまま置くより、段落ごとに分けたほうが差し替えが容易になる。配置後は、各クリップの頭と尻の無音を詰める。不要な無音はテンポを殺す。
ステップ3:ノイズ処理とイコライジング
音声クリップには次の順で処理をかける。
- ハイパスフィルターで80ヘルツ以下を軽く落とす。
- こもりが気になる場合は200〜400ヘルツを数デシベル下げる。
- 明瞭さを上げたい場合は3〜5キロヘルツをわずかに持ち上げる。
- 歯擦音が目立つ場合は7〜9キロヘルツを狭い帯域で抑える。
処理は足し算ではなく引き算を基本にする。上げすぎると疲れる音になる。
ステップ4:BGMのダッキング
ナレーションが鳴っている間だけBGMを下げる。手動で音量オートメーションを描いてもよいし、ダッキング機能を使ってもよい。下げ幅は6〜10デシベルが目安だが、BGMの音域とナレーションの声域が重なる場合はさらに下げる。切り替えはゆっくりめにし、急な音量変化を作らない。
ステップ5:効果音の配置
効果音は「見えている動作」に同期させる。ズレは数十ミリ秒でも気になる。配置したら一度画面を消して音だけで確認すると、不要な効果音が見つかる。
ステップ6:ラウドネスとダイナミクスの調整
最終的な音量は、配信先の基準に合わせる。動画配信では、平均ラウドネスをおよそ−14から−16の範囲に収め、ピークが0を超えないようにする。ナレーションのピークが基準より下がっている場合は、マスター段で持ち上げず、クリップ段で整える。
ステップ7:書き出しと実機確認
書き出したら、必ず三つの環境で聴く。イヤホン、ノートPCのスピーカー、スマートフォンのスピーカー。特にスマートフォンでは低音が消えるため、BGMの低域に頼りすぎたミックスは別の曲のように聞こえる。
ジャンル別の音作り
同じ三層モデルでも、ジャンルによって配分は変わる。
ショート動画
冒頭1秒で音を出す。無音の始まりはスクロールで飛ばされる。ナレーションは速めでもよいが、テロップと情報を重複させない。BGMはテンポ重視で、ループの継ぎ目を意識する。
解説・チュートリアル
ナレーションが主役。BGMは最小限にし、場面転換でだけ動かす。無音の区間を恐れず、考える余白として使う。
商品紹介・広告
最初の数秒で音の印象を決める。製品の質感に合う音を選び、効果音で操作感を補強する。BGMの盛り上がりと商品の提示タイミングを一致させる。
ドキュメンタリー風
環境音を厚めに使い、ナレーションの間を長めにとる。BGMは控えめにし、要所でだけ入れる。静けさそのものを演出として扱う。
よくある失敗と対策
- 音量が小さすぎる:スマートフォンで確認し、ナレーションを基準に全体を再調整する。
- BGMが終始大きい:ダッキングを入れ、ナレーション帯域を下げる。
- 声が機械的に聞こえる:原稿を短く分割し、句点ごとに余白を入れる。
- 誤読がある:読み辞書に登録し、固有名詞だけ個別に確認する。
- 場面転換が唐突:曲を切り替えず、一度音量を落として繋ぐ。
- 同じ曲を多用して飽きる:二、三種類の候補を用意し、動画ごとにローテーションする。
- スマートフォンで低音が消える:低域だけに頼らず、中域で厚みを作る。
- 権利確認が後回しになる:公開前に利用条件を必ず確認する。
権利とライセンスの押さえどころ
生成した音声や楽曲を使う際は、ツールごとの利用条件を確認する。確認すべき点は、商用利用の可否、生成物の帰属、再配布の制限、クレジット表記の要否、学習データ由来の制限の有無だ。条件はプランによって変わる場合があるため、契約中のプランの規約を都度確認するのが安全である。
また、実在の人物の声に似せた音声の利用は避ける。声は個人の識別要素であり、無断の模倣はトラブルの原因になる。ナレーション用の音声は、提供元が利用を許諾している音源から選ぶのが原則だ。
品質を保つためのチェックリスト
公開前に次の項目を確認する。
- ナレーションは一度聴いて全内容が理解できるか。
- 固有名詞の読みは正しいか。
- BGMはナレーションを邪魔していないか。
- 無音の区間は意図的か、それとも埋め忘れか。
- 効果音は動作と一致しているか。
- 冒頭3秒で音が鳴っているか。
- スマートフォンのスピーカーで音量は足りるか。
- 書き出し形式とラウドネスは配信先の基準に合っているか。
FAQ
AI音声は不自然に聞こえないか
原稿の作り方で大きく変わる。一文を短くし、句点ごとに余白を入れ、誤読を潰せば、多くの視聴者は気にしない。逆に長い一文を一息で読ませると、機械的な印象が強くなる。
BGMは動画ごとに作るべきか
尺と雰囲気が合うなら再利用してよい。ただし同じ曲を連続で使うと単調になる。二、三曲を用意し、シリーズ内でローテーションすると飽きにくい。
無音区間はどこまで許容されるか
解説動画では数秒の余白は有効だが、ショート動画では1秒でも長い。ジャンルと視聴環境によって基準が変わるため、想定視聴環境で確認する。
ナレーションとBGMの音量比の目安は
ナレーションを主役にし、BGMがその下で支える関係を作る。数値は素材によって変わるため、最終的には聴感で決める。
複数の声を使い分けてもよいか
役割が明確に分かれている場合のみ有効。同じ役割を複数の声で読ませると、視聴者は混乱する。
生成した音源の確認は何をするべきか
商用利用の可否、帰属、再配布の制限を確認する。条件は変更されることがあるため、公開のたびに確認するのが望ましい。
まとめ
AI音声とBGMの生成は、制作の入口を大きく広げた。しかし、最終的な聴取体験を決めるのは、生成物そのものではなく設計と調整である。三層モデルで役割を分け、原稿を聴く言葉に書き換え、映像に合わせて音量とタイミングを整える。この工程を固定化すれば、制作のたびに同じ品質を再現できる。
まずは短い動画一本で、ナレーション、BGM、効果音の三層を分けて組んでみることを勧める。手順を一度通せば、どのツールを選んでも応用が利くようになる。


