Limited Time Offer: Get 50% OFF your first month of Pro & Ultra plans 🎉

AI音声合成とBGM自動生成で作る動画サウンド設計ガイド|ナレーションと音楽の実践ワークフロー

Sep 16, 2026

なぜ音響設計が映像のクオリティを決めるのか

動画制作の現場では、カメラワークやカラーグレーディング、テロップのデザインに時間が割かれる一方で、音は最後にまとめて整える工程になりがちである。しかし視聴体験の満足度を左右する要素として、音の影響力は映像と同等か、それ以上だと考えたほうがよい。耳は閉じることができないため、聞き取りにくいナレーションや唐突に鳴り出す音楽は、そのまま視聴者のストレスになる。逆に、声が明瞭で音楽の入り方が自然な動画は、内容そのものが良く見える。

視聴者が離脱する本当の理由

離脱の原因を分析すると、画質の粗さよりも音響的な要因が上位に来ることが多い。声が聞き取れない、音量が大きすぎる、小さすぎる、同じ音楽が延々と続く、無音が長すぎる。とくにスマートフォンの内蔵スピーカーで視聴される機会が増えた現在では、低音が消えてしまい、子音の不明瞭さが致命的になる。モニターヘッドホンでは問題なく聞こえても、スマホでは台詞が埋もれているというケースは非常に多い。

音の3層構造を最初に決める

動画の音は三つの層に分けて考えると整理しやすい。第一層はナレーションや台詞など情報を運ぶ声、第二層は環境音や効果音など場を作る音、第三層はBGMなど感情を誘導する音である。この優先順位を決めずに作業を進めると、すべてが同じ音量でぶつかり合い、結果として何も聞こえないミックスになる。原則は単純で、第一層が常に最前面、BGMはその下に控える。この順序を台本の段階で共有しておくと、編集時の判断が速くなる。

音響は後工程ではなく設計工程

音響を編集の最後に整える作業と考えると、手戻りが増える。台本を書く時点で、どこで間を取るか、どこで音楽を切り替えるか、どの言葉を強調するかを決めておけば、後の工程はほぼ機械的に進む。音響設計は編集の一部ではなく、構成の一部である。

AI音声合成で作るナレーション設計

台本の書き方が読み上げ品質を決める

音声合成の品質は、モデルの性能だけでなく台本の書き方に大きく依存する。一文は40〜60文字を目安に短く切り、読点は1文に1〜2個までに抑える。漢字が連続する語はひらくか、読み仮名を辞書に登録する。数字や記号は意図しない読み方をされることがあるため、「3つ」なのか「みっつ」なのか、記号をどう読ませるのかを事前に指定する。専門用語、固有名詞、英略語はもっとも読み間違いが起きやすい。

また、書き言葉と話し言葉の差も大きい。「〜である」の連続は硬く聞こえるため、「〜です」「〜ます」を軸に、要所で体言止めを混ぜるとリズムが生まれる。逆に過度にくだけた表現は、合成音声では不自然に浮くことが多い。

話速・間・アクセントの数値設計

日本語ナレーションの話速は1分あたり300〜350文字が基準になる。ショート動画では350〜400文字でも成立するが、学習目的の解説動画では250〜300文字まで落としたほうが理解度が上がる。速さを上げたい場合は、語尾を伸ばすのではなく、文間の無音を削るほうが聴感上自然になる。

間の設計も数値で持っておくと再現性が高い。文と文の間は0.2〜0.4秒、段落の切り替えでは0.6〜1.0秒、画面が切り替わる直前には0.3秒程度の余白を入れる。この余白がない動画は、情報量が同じでも体感速度が速くなり、疲れやすくなる。

アクセントについては、地名や人名、社名などで標準と異なる読みを指定できるかどうかが実用性を左右する。読み辞書を編集できるツールを選ぶと、修正のたびに台本全体を作り直す手間がなくなる。

感情表現の精度と限界

近年の音声合成は、抑揚や間の制御によって驚くほど自然な感情表現を実現する。ただし、怒り、悲しみ、叫びといった強い感情は依然として破綻しやすい。無理に強い感情を設定するよりも、中立的なトーンに小さな強弱を加え、間の取り方で感情を伝えるほうが破綻が少ない。とくに長尺のナレーションでは、抑揚を一定に保ちすぎると眠くなるため、段落ごとに強弱の目標値を決めておくとよい。

声を選ぶときに確認する項目

声を選ぶ際は、性別や年齢感だけで決めない。確認すべきは、話速の可変幅、ピッチの調整範囲、アクセントの種類、多言語対応の有無、読み辞書の編集可否、書き出し形式、そして利用条件である。とくに長期的に同じ声を使う場合は、後から似た声へ乗り換えることが難しいため、最初の選定が重要になる。

BGM自動生成の仕組みと選び方

プロンプトから音楽を作る流れ

BGM生成ツールは、ジャンル、楽器編成、テンポ、ムード、尺といった条件を指定して楽曲を生成する。数十秒のループ素材を作り、それを必要な長さに組み合わせる方式が一般的である。シーンの長さを指定すると自動で尺を調整してくれるもの、映像のカットに合わせてビートを配置できるものもある。重要なのは、生成した音楽をそのまま使うのではなく、場面の切り替わりに合わせて編集する前提で考えることだ。

テンポ・キー・楽器編成の決め方

テンポは編集のリズムと揃えると気持ちよく感じる。目安として、穏やかな説明やインタビューはBPM90〜110、軽快な商品紹介は120〜130、情緒的な場面は70〜80が扱いやすい。カットの長さが2秒なら、BPM120で1拍が0.5秒なので、カットとビートが自然に噛み合う。逆に、カット割りと無関係なテンポの音楽を重ねると、視覚と聴覚がずれて落ち着かない印象になる。

キーは場面の感情を決める。長調は明るく前向き、短調は緊張や切なさを帯びる。同じメロディでも調を変えるだけで印象が変わるため、シリーズものでは場面ごとに調を揃えると一貫性が出る。

楽器編成は2〜3種類に絞ると声が埋もれにくい。人の声の明瞭度は2〜4kHzの帯域に集中しているため、鋭いシンセリードや金管の強奏など、この帯域を占有する音は避けるか音量を下げる。逆に、低音のベースと高音のパーカッションで隙間を作ると、声が抜けやすくなる。

ループとトランジションの編集

生成したループをつなぐときは、単純に繰り返すのではなく、境目にフィルインや1拍の無音を挟むと自然になる。場面転換では0.3〜0.8秒のクロスフェードを使い、音量をいったん下げてから次を立ち上げる。急に音楽が切れると視聴者は違和感を覚えるため、フェードアウトは1〜2秒かけるのが無難である。

制作ワークフロー:設計から書き出しまで

ステップ1 サウンドマップを作る

最初に、シーン番号、尺、ナレーションの有無と文字数、BGMのムードとテンポ、効果音、目標音量を表にまとめる。5〜10分の動画なら30分程度で作れるこの表が、後の数時間の手戻りを防ぐ。とくに「どのシーンで音楽を止めるか」を決めておくと、編集が驚くほど速くなる。無音は失敗ではなく、設計された間である。

ステップ2 ナレーションを先に確定させる

映像に合わせて音を後から詰めると、尺の調整で台本を削ることになり、意味が変わってしまう。先にナレーションを確定させ、その尺に映像を合わせるほうが結果的に速い。合成、聞き直し、読み方辞書の修正、再生成のサイクルを2〜3回回し、違和感がなくなった時点で音声を固定する。この段階で妥協すると、後工程で必ず蒸し返すことになる。

ステップ3 BGMを当ててダッキングを調整する

ナレーションの上にBGMを置いたら、声がある区間だけ音楽を下げる。目安は-12〜-18dBで、声の密度が高い解説動画では深め、余白のある映像では浅めにする。サイドチェイン圧縮を使うと自動で追従するが、アタックとリリースを0.1〜0.3秒に設定しないと、声の立ち上がりが潰れたり、逆に不自然に揺れたりする。細かい部分はキーフレームで手動調整したほうが仕上がりは良い。

ステップ4 ミックスとラウドネス調整

配信先ごとに目標ラウドネスが異なる。一般的な動画プラットフォームはおおむね-14 LUFS前後、音声主体の配信は-16 LUFS前後が目安になる。ピークは-1dBTP以下に抑え、クリッピングを避ける。確認は必ず二種類以上の再生環境で行う。ヘッドホン、スマートフォンのスピーカー、可能ならノートPCのスピーカーで聞き比べると、低音の埋もれや高音の刺さりに気づける。

ステップ5 最終確認と書き出し

最後に、冒頭3秒で音が不自然に始まっていないか、末尾が唐突に切れていないか、字幕とタイミングがずれていないか、無音区間にノイズが乗っていないかを確認する。書き出しは映像と音声を分けて出すと修正が効きやすい。音声のみをWAVで保持しておけば、後から別の編集ソフトで作り直す場合にも困らない。

ジャンル別のサウンド設計パターン

商品紹介・広告

冒頭で音楽を短く鳴らし、続いてナレーションを入れる構成が定番である。BPMは120前後、楽器は3種類まで。価格や特徴を述べる区間では音楽をさらに下げ、視覚情報と声に集中させる。15秒の尺なら、音楽の山を2回、無音の瞬間を1回入れると印象に残りやすい。

教育・解説動画

疲労を抑えることが最優先になる。BPM90前後、低音を控えめにし、ループの継ぎ目を目立たせない。章の切り替えでは音楽をいったん止め、新しい章で別のムードに変えると、視聴者は頭の切り替えができる。ナレーションの話速は300文字前後に落とし、重要語の前後に0.3秒の間を入れる。

ショート動画

冒頭1秒で音のインパクトを作る必要がある。BPM130前後、ビートの頭にカットを合わせる。ただし情報密度を上げすぎると内容が残らないため、伝えることは1つに絞り、音楽は抑揚のサポートに徹する。縦型は画面が小さく音も軽視されがちだが、実際には音の有無で完視聴率が大きく変わる。

ドキュメンタリー・ブランドムービー

音楽を前面に出すのではなく、環境音と無音を活かす。ナレーションのない区間を意図的に作り、そこに環境音だけを残すと、映像の密度が上がる。BPMは70〜90、楽器は弦やピアノなど持続音を中心にすると、語りの邪魔をしにくい。感情の頂点では音楽を一度止め、次のカットで静かに戻す手法が効果的である。

ツール選定の判断基準

音声合成ツールを選ぶチェックリスト

読み辞書を編集できるか、話速と間を数値で指定できるか、同じ声で長文を安定して生成できるか、書き出し形式がWAVに対応しているか、多言語で同じ話者を保てるか、利用条件が用途に合っているか。この六点を確認するだけで、後からの乗り換えコストを大きく下げられる。

BGM生成ツールを選ぶチェックリスト

尺の指定ができるか、ループのつなぎ目が自然か、パート別に書き出せるか、テンポを数値で固定できるか、生成結果の利用条件が明確か。とくにパート別の書き出しは、声が埋もれるときに該当する楽器だけを下げられるため、実務での価値が高い。

既存のストック音楽との使い分け

すべてを生成でまかなう必要はない。汎用的な場面はストック音源、固有の世界観が必要な場面は生成、という役割分担が現実的である。また、生成した音楽は同じ条件でも結果が毎回異なるため、気に入った素材はプロジェクトごとに保存しておき、シリーズのテーマとして使い回すと一貫性が生まれる。

権利・ライセンス・利用条件の実務

音声の利用条件を確認する

合成した音声を商用利用する場合、ツールの利用規約と、話者モデルの提供条件を確認する。実在の人物の声を模したモデルを使う場合は、本人の同意が前提となる。社内の研修動画など限定的な用途でも、規約上の制限に触れることがあるため、用途を先に決めてからツールを選ぶ順序が望ましい。

音楽のライセンスで見るべき点

生成音楽であっても、配布条件や再配布の可否、他プラットフォームへの転載可否が定められている場合がある。クライアントワークでは、成果物に含まれる音源の扱いを契約時に確認しておくと、後から差し替えが発生しない。ストック音源を併用する場合は、動画プラットフォームの Content ID に登録されていないかを事前に確認する。

なりすましと誤情報への配慮

実在の人物の声に似た音声を、本人の同意なく公開することは避ける。また、ニュースや解説を装った内容で合成音声を使う場合は、冒頭または概要欄に合成音声であることを明示するのが誠実な運用である。技術的に作れることと、公開してよいことは別である。

よくある失敗と改善策

失敗1 ナレーションが速すぎる

原因は、尺に合わせて台本を詰め込んだことにある。対策は、先に音声を確定させ、その尺に映像を合わせる順序に変えること。それでも収まらない場合は、情報を削るか、動画を分割する。

失敗2 BGMが大きすぎる

音楽を聴かせたいという意識が原因である。声がある区間の目標値を決め、メーターで確認する習慣をつける。判断に迷ったら、一度ミュートして声だけを聞き、次に音楽を戻して違和感がないかを確認する。

失敗3 声と映像のトーンが合っていない

子ども向けの明るい映像に落ち着いた低音の声を合わせるなど、トーンの不一致は視聴者に違和感を与える。映像の色温度や被写体の動きと、声の速さ・明るさを並べて確認する。

失敗4 音量がシーンごとにばらつく

シーンごとに個別に調整した結果、全体の音量が揃わないことが原因である。最後に通しで再生し、平均値ではなく体感で揃える。章の冒頭と末尾だけを連続再生して確認する方法も有効である。

失敗5 同じ声をすべての動画に使う

効率は良いが、表現の幅を狭めることになる。用途ごとに2〜3の声を用意し、シリーズごとに使い分けると、視聴者は文脈を音で理解できるようになる。

品質を一段上げる上級テクニック

トラックを分けて管理する

ナレーション、BGM、効果音、環境音を別トラックに分け、それぞれに音量とEQを設定する。一つのトラックにまとめると、後から一箇所だけ直したいときに全体を作り直すことになる。

EQとリバーブは最小限に使う

ナレーションのEQは、こもりを取るために200〜400Hzを1〜3dB下げ、明瞭度を上げるために3kHz付近を1〜2dB上げる程度で十分である。リバーブは0.3〜0.8秒の短いものをわずかにかける程度にとどめる。かけすぎると、スマートフォンのスピーカーでは声がぼやける。

多言語展開で声の一貫性を保つ

同じ動画を複数言語で展開する場合、話者のトーンと話速を言語ごとに揃える。日本語の300文字/分と英語の150語/分は体感速度が近いため、この比率を基準にすると違和感が少ない。字幕の改行位置と音声の間を合わせておくと、視聴者の理解度が上がる。

よくある質問

音声合成だけで作った動画は不自然に見えないか

台本と間の設計を丁寧に行えば、多くの視聴者は合成音声だと気づかない。不自然さが出るのは、話速が速すぎる、アクセントが不揃い、間が均一すぎるといった設計上の問題が原因であることが多い。

BGMは生成と既存音源のどちらを使うべきか

固有の世界観が必要な場面や、尺に合わせて調整したい場面は生成が向く。定番の雰囲気でよく、多くの動画で使い回したい場合は既存音源のほうが安定する。両者を併用するのがもっとも現実的である。

話速はどのくらいが最適か

日本語では1分あたり300〜350文字が基準になる。ショート動画は350〜400文字、学習目的の解説は250〜300文字を目安に調整するとよい。

ダッキングの深さはどう決めるか

声がある区間で-12〜-18dBを目安にする。声が連続する解説動画は深め、間の多い映像は浅めにする。最終的にはメーターではなく、スマートフォンのスピーカーで聞いたときの聞き取りやすさで判断する。

音響設計にかけるべき時間の目安は

5分の動画であれば、サウンドマップ作成に30分、音声確定に1〜2時間、BGM調整とミックスに1〜2時間が目安になる。この時間を惜しむと、公開後の修正対応で結局同じだけの時間を失う。

無音の区間は作ったほうがよいのか

作ったほうがよい。無音は情報の欠落ではなく、視聴者に考える時間を与える設計上の余白である。とくに重要な結論の直前と直後では、0.5〜1秒の無音が理解度を大きく上げる。

音響設計は特別な才能を必要とする作業ではない。順序を決め、数値の目安を持ち、確認の工程を省かないこと。それだけで、同じ映像でも伝わる内容と残る印象が変わる。まずは次の1本で、サウンドマップを一枚作るところから始めてみるとよい。

Alexander

Alexander