なぜ音声とBGMを先に設計すると制作が速くなるのか
動画制作の現場では、映像を組み終えてからナレーションを録り、最後にBGMを探す流れが長く標準とされてきた。しかし生成AIで映像・音声・音楽をそれぞれ作れるようになった今、この順番はむしろ大きな手戻りを生む。映像のカット尺に対して読み上げ原稿が長すぎる、BGMの盛り上がりとクライマックスの位置がずれる、テンポが合わないので結局すべて組み直す——こうした事故の多くは、音声と音楽を最初に設計しておけば防げる。
音は「後から貼る装飾」ではなく、映像のテンポと情報量を決める骨格である。とくにショートフォームの動画では、視聴者は最初の2〜3秒で離脱するかどうかを決める。その数秒を支えているのは、多くの場合ナレーションの入りの速さとBGMのアタック感だ。つまり音の設計は、編集の最後ではなく企画の最初に置くべき工程なのである。
音声と音楽を後回しにすると起きる3つの問題
第一に尺の問題。日本語の読み上げはおおよそ1分あたり300〜350文字が目安だが、話速や間の取り方で±20%は簡単に振れる。台本を書いた時点で文字数から尺を概算し、音声を先に生成して実測しておけば、絵コンテの段階でカット数を調整できる。逆に映像を先に完成させてしまうと、ナレーションを詰め込むために不自然な早口にするか、映像を切り直すかの二択になる。
第二にトーンの不一致。落ち着いた解説映像に明るすぎるポップスを当てると内容が陳腐に見え、逆に重厚な音楽は軽い話題を仰々しくする。ナレーションの声質と音楽の質感はセットで決めるべきで、後から片方だけ差し替えると全体の印象が崩れる。低い男性声に軽快なシンセポップ、明るい女性声に重低音のシネマティック——どちらも単体では良くても組み合わせで破綻する典型例だ。
第三に音の出所管理。生成した音声や音楽は、どのツールで、どんな入力から作り、どの利用条件が適用されるのかを記録しておかないと、後で公開範囲を広げるときに困る。制作の最初に「音の出所台帳」を作る習慣をつけておくと、確認作業が格段に楽になる。
音声先行ワークフローの全体像
推奨する流れは次の8工程だ。(1)企画と尺の決定、(2)台本を読み上げ設計書に変換、(3)音声合成エンジンの選定、(4)ナレーション生成と試聴、(5)BGMの生成または選定、(6)映像と音の同期、(7)ミックスとマスタリング、(8)書き出しと品質チェック。映像生成や撮影は(4)と(5)の間、あるいは並行して進めると無駄がない。
この順番の利点は、もっとも修正コストが高い工程を前倒しできることにある。台本の修正は数十秒で終わるが、完成した映像の尺を変えるのは数時間かかる。音を先に固めれば、映像側は「決まった尺とテンポに合わせて絵を作る」という単純な作業になる。
台本を「読み上げ設計書」に変える
台本と読み上げ設計書は別物だ。台本は内容を伝える文書であり、読み上げ設計書は「どう読ませるか」を指定する指示書である。AI音声合成に台本をそのまま渡すと、句読点だけを頼りにした平坦な読みになる。ここで差がつく。
文の長さと息継ぎを設計する
読み上げの自然さは、息継ぎの位置でほとんど決まる。目安として、一息で読む単位は40〜60文字程度に収めると安定する。長い修飾節は前置きと主文に分割し、分割点に読点ではなくポーズ指示を入れる。
悪い例:「この機能は従来の手法と比較して処理速度が大幅に向上しているため長時間の動画制作でもストレスなく作業を進められるようになりました」——息継ぎの余地がない。
良い例:「この機能は、従来の手法と比べて処理速度が大きく向上しています。(ポーズ)そのため、長時間の動画制作でも、作業の流れが途切れにくくなります。」——意味の切れ目と呼吸の切れ目が一致している。
数字・固有名詞・記号の読み方を指定する
AI音声合成がもっとも失敗しやすいのが数字と記号だ。「2026」は「にせんにじゅうろく」か「に〇にろく」か、文脈で変わる。「1,200円」は「せんにひゃくえん」と読んでほしいが、「いちカンマに〇〇」と読むエンジンもある。対策は単純で、原稿の段階でひらがな・カタカナに開いてしまうのが最も確実だ。
固有名詞は読み辞書に登録する。人名、社名、製品名、地名は、一度正しい読みを登録すれば以降のすべての原稿で再利用できる。読み辞書を持たないエンジンを使う場合は、原稿側にカナ表記を併記する運用でカバーする。
記号も要注意だ。「/」は「または」か「スラッシュ」か、「〜」は「から」か「チルダ」か。「%」は「パーセント」、「℃」は「ど」と読ませたい場面が多い。記号を残す理由がなければ、すべて語に置き換えるのが安全である。
感情とトーンをタグで割り当てる
感情表現をサポートするエンジンでは、文単位でトーンを指定できる。導入は「落ち着いた・やや遅め」、問題提起は「少し強い・やや速め」、解決策は「明るく・標準」、締めは「柔らかく・遅め」。この4段階を台本の行頭にメモしておくだけで、生成後の違和感が激減する。
感情を指定できないエンジンでも、文末の処理で印象は変えられる。断定で終えるか、語尾を伸ばすか、体言止めにするか。台本の書き方そのものが演出になることを意識したい。
AI音声合成エンジンを選ぶ基準
エンジン選びで迷ったら、次の4軸で比較する。日本語の自然さ、制御の細かさ、声のバリエーション、そして利用条件と権利の明確さだ。
日本語の自然さを決める4つの要素
(1)アクセント:日本語は高低アクセント言語であり、「箸」と「橋」のように同音異義を高低で区別する。アクセント辞書の精度が低いエンジンは、文脈上ありえない山を作る。
(2)プロソディ:文全体の抑揚の設計。文末を下げるのか上げるのか、強調語をどこに置くのか。ここが平坦だと、どれだけ声質が良くても「読み上げ感」が残る。
(3)ポーズ制御:句読点以外の間をどれだけ細かく指定できるか。ミリ秒指定ができるエンジンは、映像のカットに合わせた調整がしやすい。
(4)声質:収録音声か学習モデルかで、息遣いや倍音の自然さが変わる。長尺のナレーションでは、数分聞いたときの疲労感が判断基準になる。
主要な選択肢の性格の違い
ElevenLabs系は多言語の声質と感情表現の幅が広く、英語混じりの原稿や海外向けの吹き替えに向く。日本語のアクセントは改善が続いているが、固有名詞は読み辞書での補正が前提になる。
OpenAI系の音声合成はAPI経由での扱いが簡単で、速度と安定性のバランスが良い。長文を短時間で大量に処理したい量産用途に向く一方、細かい抑揚の指定は他のエンジンほど自由ではない。
Azure AI SpeechやGoogle Cloud Text-to-Speechは、SSMLによる細かな制御と多言語対応が強みで、企業の制作フローに組み込みやすい。日本語のニューラル音声も豊富で、用途別に声を切り替えられる。
VOICEVOXやStyle-Bert-VITS2はローカル環境で動かせるものが多く、外部に原稿を送りたくない案件や、大量生成のコストを固定したい案件で選ばれる。話者ごとの個性が強く、キャラクター性のあるコンテンツと相性が良い。
Piper系の軽量モデルは、リアルタイム処理やエッジ環境での利用に向く。品質よりも遅延と軽さを優先する場面で意味がある。
声の複製と同意・権利の扱い
自分の声を複製して使うのは問題が少ないが、第三者の声を複製する場合は本人の明確な同意が必要だ。契約書に利用範囲(媒体、期間、地域、二次利用の可否)を明記し、同意記録を制作ファイルと一緒に保管する。
故人の声、著名人の声、特定の職業を連想させる声は、たとえ技術的に可能でも避けるのが無難だ。炎上リスクだけでなく、配信先のポリシー違反で公開停止になる可能性がある。迷ったら「その声を本人が見たらどう感じるか」を判断基準にする。
読み上げ品質を引き上げる調整テクニック
生成した音声は、そのまま使うより一工程加えると別物になる。ここでは調整の優先順位を示す。
ポーズと間の制御
もっとも効果が大きいのはポーズだ。文間は0.4〜0.6秒、段落間は0.8〜1.2秒、強調前は0.2〜0.3秒を目安にする。これをカットの切れ目と一致させると、映像とナレーションが「噛み合っている」感覚が生まれる。
映像の尺が決まっている場合は、ポーズを伸縮して総尺を合わせる。話速を上げるより、間を削るほうが聴感上の自然さを保ちやすい。
話速・ピッチ・抑揚のバランス
話速は標準の1.0を基準に、解説は0.95、広告は1.05〜1.1、子ども向けは0.9程度が扱いやすい。ピッチは±2半音を超えると不自然になりやすい。抑揚の幅は、ナレーションの場合は狭めにするほうが聞き疲れしない。
調整は一度に一つずつ動かす。話速とピッチを同時に変えると、どちらが効いたのか分からなくなる。変更前の音声を必ず残し、A/Bで聴き比べる。
失敗パターン別の修正手順
棒読み:ポーズを増やし、文頭のトーン指定を追加する。それでも改善しない場合は文の長さを見直す。長文は必ず平坦になる。
早口:話速を0.95に落とし、ポーズを0.1秒延ばす。それでも速い場合は原稿の文字数を削る。話速でごまかすと情報が伝わらない。
アクセント誤り:読み辞書に登録する。辞書がない場合はカナ表記に開く。固有名詞は初出だけ補正すれば済むことが多い。
サ行の刺さり:2〜4kHzを2〜3dB下げる。EQで解決しない場合は、ディエッサーを軽くかける。かけすぎると声が曇るので、1〜3dB程度にとどめる。
不自然な無音:生成の分割点で波形が切れている可能性がある。文単位で生成し、編集側でつなぐほうが安定する。
AIでBGMを作るためのプロンプト設計
BGM生成は「雰囲気を言葉にする」作業だ。感覚的な語だけを並べても狙った音は出ない。構造化して伝えるのが近道になる。
プロンプトの構成要素
有効なのは次の6項目だ。ジャンル(アンビエント、ローファイ・ヒップホップ、オーケストラル・ポップなど)、主要楽器(ピアノ、エレキギター、シンセパッド、ストリングス)、テンポ(BPM)、感情(静か、前向き、緊張、温かい)、構成(イントロなし、徐々に盛り上げる、一定のまま)、そして音像(広い、近い、こもった、明るい)。
例:「控えめなピアノと柔らかいシンセパッド、BPM 80、落ち着いた前向きな雰囲気、大きな起伏なし、一定の音量感、ナレーションの下で邪魔にならないミックス」。この粒度なら、意図に近い音が返ってくる確率が大きく上がる。
逆に避けたいのは「かっこいい音楽」「感動的な曲」だけの指示だ。解釈の幅が広すぎて、毎回違うものが返る。
ループ・ステム・ステム分離の使い方
長尺の動画では、同じ曲を繰り返すのではなく、ループ素材として扱うのが実践的だ。イントロ、本編、ブリッジ、アウトロの4パーツを作り、映像の展開に合わせて並べ替える。
ステム(楽器別のトラック)が得られる場合は、ナレーション区間だけドラムを下げ、盛り上げ区間で戻すといった制御ができる。ステム分離ツールで後から分解する方法もあるが、生成時に分けておくほうが音質の劣化が少ない。
生成音楽の権利と商用利用の確認ポイント
確認すべきは、生成物の利用範囲、再配布の可否、Content IDなどの自動検出システムへの登録可否、そして第三者の権利を侵害しないことの担保だ。ツールごとに条件が異なるため、案件ごとに条件を読み、要点を制作メモに残す。
とくに注意したいのは、既存アーティスト名を指定して「その人風」を求める行為だ。スタイルの模倣は法的にも配信先のポリシー上もリスクがある。ジャンルと楽器で指定するに留めるのが安全である。
映像と音楽を同期させる編集テクニック
音と映像が「合っている」と感じるのは、多くの場合ビートとカットが一致しているからだ。逆に言えば、この一致を意図的に作れば素人っぽさは消える。
カットとビートを対応させる
BPMから1拍の長さを計算する。BPM 120なら1拍0.5秒、BPM 90なら約0.667秒。カットの長さをこの倍数に揃えると、見ていて気持ちいいリズムが生まれる。すべてのカットを揃える必要はなく、要所(3〜5カットに1回)で合わせるだけでも効果がある。
逆に、意図的にずらす手法もある。ビートの直前にカットを置くと、わずかな「もたつき」が緊張感になる。ただしこれは音楽が十分に強い場合のみ機能する。
ダイナミックレンジとナレーションの共存
ナレーションとBGMが同じ帯域を奪い合うと、どちらも聞き取りにくくなる。人の声の主要帯域はおよそ200Hz〜4kHz、明瞭度を決めるのは1〜4kHzだ。BGM側でこの帯域を2〜4dB下げておくと、音量を上げなくても声が前に出る。
BGMの周波数帯域を狭めるのも有効だ。ハイパスフィルターで80Hz以下を切り、ローpass寄りの処理で高域を軽く抑えると、声の居場所が生まれる。
ダッキングとサイドチェーン圧縮
ナレーションが入った瞬間にBGMを自動で下げる処理をダッキングと呼ぶ。下げ幅は3〜6dBが目安で、深すぎると音楽が消えて不自然になる。立ち上がりは速め(10〜30ms)、戻りは遅め(300〜800ms)にすると自然に感じる。
サイドチェーン圧縮を使うと、ナレーションのレベルに応じてBGMが連続的に変化する。しきい値とレシオを調整し、声が小さい場面では音楽が戻るように設計する。
ミックスとマスタリングの実践手順
音の最終工程は、音量を揃えるだけでなく、どの再生環境でも聞き取れる状態にすることだ。
目標ラウドネスと配信先別の基準
動画配信では-14 LUFS前後、ポッドキャストは-16 LUFS前後、放送基準は-23 LUFSが目安とされる。重要なのは数値そのものより、シリーズ内で一貫させることだ。動画ごとに音量が違うと、視聴者は毎回ボリュームを調整することになる。
True Peakは-1dBTP以下に抑える。エンコード時に歪むのを防ぐためだ。
EQ・コンプレッサー・リミッターの適用順序
標準的な順序は、ハイパスフィルター→不要帯域のカット→コンプレッサー→トーン調整のEQ→リミッター。順序を逆にすると、後段の処理が前段の意図を壊す。
ナレーションはコンプレッサーで3〜4dB程度のゲインリダクションをかけ、音量差を均す。レシオは2:1〜3:1、アタックは5〜15ms、リリースは80〜200msが扱いやすい。
書き出し設定とファイル命名規則
動画用はAAC 320kbpsまたはPCM 48kHz/24bit、素材の受け渡しはWAV 48kHz/24bitが無難だ。書き出しファイル名は「案件名_尺_版_日付」のように統一し、最終版と試作版を取り違えないようにする。
ミックスのプロジェクトファイルは、使用した音声モデル名・BGM生成の入力・利用条件をメモしたテキストと一緒に保存する。これが「音の出所台帳」になる。
量産のためのパイプラインと自動化
同じ形式の動画を定期的に出す場合、都度ゼロから設計するのは非効率だ。テンプレート化と自動化で、判断の回数を減らす。
テンプレート化とプリセット管理
尺別にテンプレートを用意する。15秒、30秒、60秒、5分、15分。各テンプレートには、ナレーションの話速、ポーズの既定値、BGMのBPM帯、ラウドネス目標、ダッキングの設定値まで含める。新規案件はテンプレートを複製して差分だけ調整する。
音声のプリセットも同様に固定する。「解説用・標準」「解説用・ゆっくり」「広告用・明るい」の3種があれば大半の案件はカバーできる。
バッチ処理とスクリプト連携
台本を1行1文のCSVやMarkdownで管理し、行ごとにポーズ値とトーンを列で持たせると、スクリプトで一括生成できる。生成後のファイル名に行番号を付けておけば、編集ソフトへの読み込みも機械的に行える。
ffmpegのようなコマンドラインツールを使えば、音量の正規化、無音のトリミング、形式変換をまとめて処理できる。手作業の試聴は「最終確認」に集中させる。
品質チェックの自動化
自動で確認できる項目は意外に多い。ピーク値が規定を超えていないか、目標ラウドネスに収まっているか、無音区間が長すぎないか、ファイルの尺が規定どおりか。これらをスクリプトで検査し、異常のあるファイルだけを人間が聴く運用にすると、確認時間を大幅に削れる。
よくある失敗とトラブルシューティング
声がこもる/サ行が刺さる
こもりの原因は、200〜400Hzの溜まりか、高域の不足だ。該当帯域を2〜3dB下げ、8kHz以上を1〜2dB持ち上げると抜けが出る。ただし上げすぎると歯擦音が目立つ。サ行が刺さる場合は、前述のとおり2〜4kHzを軽く下げ、ディエッサーで補正する。
BGMが単調で飽きられる
同じループを数分続けると、聴覚はすぐに飽きる。対策は3つ。楽器を1つ追加して変化を作る、フィルターや音量を緩やかに動かす、そして無音または極小音量の区間を意図的に作る。とくに無音は強力で、数秒の沈黙のあとに音楽が戻ると印象が大きく変わる。
カットとテンポがずれる
原因はBPMの計算違いか、編集ソフトのフレームレート設定の不一致だ。29.97fpsと30fpsを混在させると、わずかなズレが蓄積する。プロジェクトのフレームレートを統一し、BPMから拍の長さをフレーム数に換算してからカットを配置する。
スマホで聞くと声が埋もれる
スマートフォンのスピーカーは低域を再生できない。モニターヘッドホンで整えたミックスが、スマホでは音楽だけ聞こえて声が消えることがある。対策は、低域を削って中域に情報を寄せること。100Hz以下のBGMを明確にカットし、声の1〜4kHzを相対的に持ち上げる。
スマホ実機での試聴をチェック工程に必ず入れる。イヤホン、ノートPC、スマホの3環境で確認すれば大きな事故は防げる。
ケーススタディとFAQ
15秒のショート広告
音声は1文を短く、全体で3〜4文に収める。話速はやや速め、冒頭0.3秒以内に声を出す。BPMは100〜128、アタックの強い音から始め、8秒付近で一度だけ音を抜いて注意を戻す。ラウドネスは-14 LUFS前後、ナレーションは常時ダッキングで4〜5dB下げる。
5分の解説動画
導入・本論・まとめの3部構成にし、BGMは本論で控えめ、まとめで少し持ち上げる。BPMは80〜100、歌詞のないインストゥルメンタルを選ぶ。章ごとにBGMを切り替えるか、同一曲のステムを出し入れする。ナレーションの話速は0.95〜1.0、ポーズは段落間1.0秒を基本にする。
30分の教材・ポッドキャスト
長尺ではBGMを常時流さない。章の切り替え、演習の導入、締めの3箇所に限定し、それ以外は無音か環境音にする。ナレーションは0.95倍で一定にし、10〜15分ごとにトーンを変えて単調さを避ける。ラウドネスは-16 LUFS前後で全編を通す。
よくある質問
Q. 生成した音声をそのまま公開しても問題ないか。
A. ツールの利用条件を確認し、商用利用の可否、再配布の可否、自動検出システムへの登録可否をチェックする。条件の要点を制作メモに残しておくことが実務上の安全策になる。
Q. 声質はどこまで統一すべきか。
A. シリーズ内では1〜2種類に絞るのが基本だ。声はブランドの一部であり、回ごとに変わると視聴者の記憶に残らない。別の声を使う場合は、明確に役割が違う場面に限定する。
Q. BGMは生成と既存ライブラリのどちらが良いか。
A. 尺と展開を完全にコントロールしたいなら生成、品質の安定と選曲の速さを優先するならライブラリが向く。両方を併用し、テンプレートで使い分けるのが現実的だ。
Q. 多言語展開はどう進めるか。
A. まず原稿を言語ごとに書き直す。直訳した原稿は読み上げのリズムが崩れる。次にポーズと話速を言語別に再調整する。日本語は1文あたりの情報量が多く、英語は語順が違うため、同じ尺に収めるには原稿側の調整が必要になる。
Q. 音声と音楽のどちらを先に作るべきか。
A. 音声が先だ。音楽は声の帯域とテンポに合わせて作るものであり、逆にすると音楽の制約がナレーションの自然さを損なう。
音声と音楽を「あとで何とかする工程」から「最初に決める設計要素」に移すだけで、動画制作の手戻りは目に見えて減る。台本を読み上げ設計書に変換し、エンジンの特性を理解し、テンプレートで再現性を確保する。この3つが習慣になれば、音は作品の弱点ではなく強みになる。


