音声と音楽が動画の成果を左右する
動画のクオリティは映像だけで決まらない。視聴者が最初に違和感を覚えるのは、多くの場合「音」のほうだ。ナレーションの発音がわずかに不自然、BGMのテンポが編集のリズムとずれている、声と音楽が同じ帯域でぶつかって聞き取りづらい。こうした問題は、映像がどれほど美しくても離脱の引き金になる。
AI音声合成とAI楽曲生成が実用レベルに達したことで、個人クリエイターでも放送品質に近い音声トラックを短時間で組めるようになった。ただし、ツールを起動してテキストを貼り付ければ終わり、というわけではない。成果を分けるのは、生成そのものではなく「設計」と「後処理」にある。
この記事では、台本の設計からナレーション生成、BGMの構成、ミックス、書き出しまでを一本のワークフローとして整理する。特定のサービスに依存しない形で手順を説明するので、どのツールを使っていても応用できるはずだ。
全体の流れは次のとおり。
- 目的と尺を決める
- 台本を話し言葉に変換する
- 声を選び、ナレーションを生成する
- BGMのムードと構成を設計して生成する
- 声と音楽をミックスする
- 映像タイムラインに同期させて書き出す
- 聞き直して修正する
順番が重要なのは、後工程の失敗の多くが前工程の曖昧さに起因するからだ。たとえば「BGMが合わない」と感じたとき、原因は楽曲ではなく台本のトーンが定義されていないことにある、というケースは珍しくない。
制作前の設計:台本・トーン・尺を先に固める
音声制作で最も見落とされやすいのが、生成前の設計工程だ。ここを丁寧にやるだけで、リテイクの回数は劇的に減る。
台本を「話し言葉」に変換する
読み上げ用の台本と、目で読む文章は別物だ。書き言葉のまま読み上げると、AI音声でも人間でも不自然に聞こえる。変換のポイントは次の4つ。
- 一文を短くする。 目安は40〜60文字。長い一文は息継ぎの位置が定まらず、抑揚が平坦になる。
- 漢語を開く。 「実施する」より「やる」、「検討する」より「考える」のほうが耳に残る。
- 数字の読み方を指定する。 「1,200」は「せんにひゃく」か「いちにせん」か。ここは後述の発音辞書で必ず固定する。
- 接続詞を減らす。 「しかしながら」が3回続くと、視聴者は内容ではなく話し方に意識が向いてしまう。
変換後の台本は、必ず一度声に出して読む。声に出して息が苦しい箇所は、AI音声でも必ず不自然になる。
尺とテンポの逆算
日本語のナレーションは、おおよそ1分あたり280〜350文字が自然な速度の目安になる。落ち着いた解説なら280文字前後、テンポの速い紹介映像なら350文字前後だ。
たとえば3分の解説動画なら、850〜1,000文字の台本が必要になる。ここで文字数が足りないと、映像に合わせて無理に引き伸ばすことになり、間の悪いナレーションが生まれる。逆に多すぎると、早口で情報が流れていく。
尺の設計では「どこで間を取るか」も決めておく。導入の後、重要な結論の前、章の切り替わり。この3箇所に1秒前後の空白を入れるだけで、聞き取りやすさは大きく変わる。
トーンボードを作る
トーンボードとは、声と音楽の方向性を言語化した短いメモだ。次の3項目を埋めるだけでいい。
| 項目 | 記入例 |
|---|---|
| 誰に向けて話すか | 制作を始めたばかりの個人クリエイター |
| どんな印象を与えたいか | 落ち着き、信頼、少しの親しみ |
| 避けたい印象 | 威圧的、早口、営業的 |
このメモは、声質の選定、話速の設定、BGMのジャンル選択すべてに効いてくる。トーンボードなしで生成を始めると、後から「なんとなく違う」という曖昧な違和感に悩まされることになる。
AI音声合成の選び方:5つの評価軸
音声ツールは多数あるが、比較すべきポイントはそれほど多くない。以下の5軸で見れば、目的に合うものを短時間で絞り込める。
声質とキャラクターの一致
第一に、トーンボードと声質が合うかどうか。若々しい声、落ち着いた中年の声、ニュートラルな性別不明の声など、選択肢の幅を確認する。デモ音声は「きれいに聞こえるか」ではなく「自分の台本を読ませたときに自然か」で判断したい。できれば自社の原稿を10行ほど読み上げさせて比較する。
抑揚と感情表現の粒度
感情パラメータをどの粒度で操作できるかは重要な差になる。大きく分けて2種類のアプローチがある。
- プリセット方式: 「落ち着き」「興奮」「共感」といったプリセットを選ぶ。操作が簡単で、初心者でも破綻しにくい。
- パラメータ方式: 話速、ピッチ、ポーズ、強調を数値で調整する。細かい表現ができるが、設計力が問われる。
実務では、プリセットで大枠を作り、パラメータで微調整する併用がもっとも扱いやすい。
一貫性と安定性
同じ設定で複数回生成したとき、声がぶれないかは必ず確認したい。長尺の動画では、前半と後半で声のトーンが変わると強い違和感につながる。
チェック方法は簡単で、同じ原稿を3回生成して聞き比べる。ピッチや話速が目立って揺れるツールは、長尺には向かない。
多言語・発音精度
日本語のAI音声では、固有名詞、英単語、数字、記号の読みが鬼門になる。たとえば「AI」を「エーアイ」と読むか「アイ」と読むか、「3D」を「スリーディー」と読むかで印象は変わる。
発音辞書機能の有無、カタカナ指定の可否、アクセント位置の調整可否を確認する。多言語展開を予定しているなら、同一の声質で別言語を生成できるかも判断材料になる。
編集可能性と出力形式
生成した音声をそのまま使うことは少ない。無音の削除、語尾の伸縮、テイクの差し替えができるかは作業効率に直結する。
- 文単位・段落単位で個別に再生成できるか
- タイムスタンプ付きの字幕データを出力できるか
- WAVなどの非圧縮形式で書き出せるか
- ステム(声だけ・音楽だけ)で書き出せるか
この4点が揃っていると、後工程が格段に楽になる。
ナレーション制作の実践ワークフロー
ここからは実際の作業手順に入る。台本が完成している前提で進める。
ブロック分割とディレクション
台本を一度にすべて生成するのではなく、意味のまとまりごとに分割する。目安は2〜4文、15〜30秒程度。
分割する理由は3つある。第一に、感情の指示が効きやすくなる。第二に、1箇所の失敗を部分的に直せる。第三に、映像のカット割りに合わせて差し替えが効く。
各ブロックには、簡単なディレクションを添える。
ブロック3:課題の説明。ややトーンを落として、共感を示す。話速は標準より少し遅く。
この一言があるだけで、生成結果の安定度は変わる。
発音辞書と固有名詞の対策
固有名詞・略語・数字は、事前に辞書登録する。カタカナで読みを指定する方法がもっとも確実だ。
- 数字:文脈に応じて「にせんじゅうよん」か「にせんよん」かを指定
- 単位:mm は「ミリ」、% は「パーセント」と明示
- 英字:URL は「ユーアールエル」と読ませるか、読み上げを省略するか
- 人名・社名:読みが揺れやすいので登録必須
辞書を作る手間はかかるが、長期的には大きな時間の節約になる。プロジェクトごとに辞書ファイルを保存し、再利用する運用がおすすめだ。
間(ま)と無音の設計
生成された音声は、文と文の間が詰まりすぎていることが多い。ここを整えるだけで、聞き取りやすさは劇的に向上する。
- 文の間:0.2〜0.3秒
- 段落の間:0.5〜0.7秒
- 章の切り替わり:0.8〜1.2秒
注意点は、無音を「ゼロ」にしてしまわないことだ。完全な無音は不自然に聞こえるため、-50dB前後の低いノイズフロアを残すか、BGMを敷いたままにする。
リテイクとバージョン管理
生成した音声は、必ずファイル名で管理する。
narration_03_block2_v2_flat.wav
日付や「最終」「本当の最終」といった命名は避ける。ブロック番号、テイク番号、調整内容を入れておけば、後から戻るのが簡単になる。
リテイクの判断基準も決めておく。「意味が伝わらない」は必ず直す。「少し好みと違う」は、優先度が高くなければ保留にする。すべてを完璧にしようとすると、制作は終わらない。
BGM生成の設計:ムードから構造へ
BGMは「良い曲を選ぶ」ものではなく「映像に合う曲を設計する」ものだ。
ムードを言葉にする
AI楽曲生成は、テキスト指示の解像度が結果を左右する。曖昧な指示は曖昧な曲を生む。
悪い例:
明るくてカッコいい曲
良い例:
シネマティックなオーケストラ。静かなピアノで始まり、中盤でストリングスが加わる。テンポは90BPM。緊張感はあるが不安にはならない。派手なドラムは使わない。
ポイントは、ジャンル、楽器編成、テンポ、強弱の推移、避けたい要素の5点を入れること。特に「避けたい要素」は効果が大きい。
映像のビートに合わせて構成する
BGMの構成は、映像の章立てと対応させる。3分の動画なら、おおむね次のような構成になる。
| 時間 | 映像 | 音楽の役割 |
|---|---|---|
| 0:00-0:15 | 導入 | 静かな立ち上がり。主張しない |
| 0:15-1:15 | 課題提示 | 中程度の密度。不安や緊張を支える |
| 1:15-2:15 | 解決策 | 明るさが増す。楽器が加わる |
| 2:15-3:00 | まとめ | 余韻を残して減衰 |
この表を作ってから生成すると、「なぜか合わない」という状態を避けやすい。1曲をまるごと生成して無理に切るより、セクションごとに生成して繋ぐほうが制御しやすい。
ループ・ステム・尺の調整
実務では次の3点を確認する。
- ループ性: 繰り返し再生しても継ぎ目が目立たないか
- ステム出力: ドラム、ベース、メロディを個別に調整できるか
- 尺の伸縮: 5秒単位で自然に伸ばせるか
尺を伸ばすときは、単純な繰り返しではなく、楽器を減らしてから戻す「引き算の展開」を作ると自然になる。
ライセンス条件の確認
生成した楽曲の利用条件は、必ず利用規約で確認する。確認すべき点は、商用利用の可否、収益化された動画での利用、再配布の扱い、クレジット表記の要否、そして生成物の権利帰属だ。
特にプラットフォームごとにポリシーが異なるため、複数の媒体に展開する場合は事前に整理しておく。判断に迷う場合は、利用条件が明確で、書面で確認できるツールを選ぶのが安全だ。
ミックスとマスタリング
声と音楽が揃ったら、次は両者を戦わせない作業に入る。
周波数帯域の住み分け
人間の声の明瞭度を決めるのは、おおよそ1kHz〜4kHzの帯域だ。BGMがこの帯域で鳴りすぎると、声が埋もれる。
対策はシンプルで、BGM側の2kHz〜4kHzを2〜4dBほど下げる。加えて、BGMの200Hz以下を軽く削ると、声の低域とぶつかりにくくなる。
- 声:80Hz以下をハイパスでカット(不要な低域ノイズを除去)
- 声:3kHz付近を1〜2dB持ち上げて明瞭度を確保
- BGM:2〜4kHzを軽く下げる
- BGM:200Hz以下を軽く削る
数値はあくまで出発点で、最終的には耳で判断する。
ダッキングで声を前に出す
もっとも効果が高いのがダッキング(サイドチェイン圧縮)だ。ナレーションが鳴っている間だけ、BGMの音量を自動的に下げる処理を指す。
設定の目安:
- 下げ幅:4〜7dB
- 立ち上がり:20〜50ms
- 戻り:200〜400ms
戻りを速くしすぎるとBGMが上下にうねって聞こえる。遅すぎると、次の文が始まるまでBGMが小さいままになる。300ms前後から調整を始めるのが扱いやすい。
ラウドネスと書き出し
書き出し時の目標値は、配信先によって異なる。
| 配信先の種類 | 目安 |
|---|---|
| 動画共有サイト | -14 LUFS 前後 |
| ポッドキャスト | -16 LUFS 前後 |
| 放送 | -23 LUFS 前後 |
重要なのは、数字を合わせることよりも、シリーズ内で音量を揃えることだ。動画ごとに音量が違うと、チャンネル全体の印象が悪くなる。
また、ラウドネスを上げるためにリミッターを強くかけすぎると、声の抑揚が潰れる。目標値に対して2〜3dBの余裕を残しておくと、聞き疲れしにくい音になる。
映像タイムラインとの同期
音声と映像を合わせる工程は、工程表のなかでもっとも根気が要る。
マーカーを先に打つ
編集を始める前に、音声側にマーカーを打つ。ナレーションの開始点、BGMの切り替え点、効果音を入れる位置。これを先に済ませておくと、映像を動かすたびに音を探す手間がなくなる。
尺の伸縮と「間」の活用
映像と音声の尺が合わないとき、多くの人は映像を切って調整する。しかし先に検討すべきは、音声側の間だ。
- 0.3秒の間を2箇所削るだけで、映像を1カット切らずに済むことがある
- 逆に、映像が余っている場合は、文の間に余白を足して自然に伸ばせる
「音を削る前に、間を削る」。これは覚えておいて損のない原則だ。
字幕・テロップとの関係
音声を生成すると、タイムスタンプ付きのテキストが得られることが多い。これを字幕の下書きに使うと、文字起こしの手間が大きく減る。
ただし、そのまま使うと読みにくい字幕になる。字幕は音声よりも情報を削る必要がある。
- 一文を32文字以内に収める
- 句読点は最小限にする
- 同じ行に句点を置かない
音声とテロップのタイミングが半秒ずれるだけで、視聴者は無意識に違和感を覚える。書き出し前に必ず通しで確認する。
よくある失敗と回避策
実務で繰り返し発生する問題と、その対処をまとめる。
声が平坦で眠くなる
原因は、台本の文が長いこと、話速が一定であること、感情指示が入っていないことの3つが多い。対策は、長い文を分割すること、重要な文だけ話速を10%落とすこと、段落ごとに異なる感情を指定すること。
BGMが最後まで同じで飽きる
1曲をまるごと敷き詰めると、3分を超えたあたりから単調に感じられる。対策は、AパートとBパートの2種類を生成し、章の切り替わりで入れ替えること。あるいは、ステム出力を使ってドラムだけを中盤で抜く。
声と音楽がぶつかる
ミックスの問題であることがほとんど。前述の帯域処理とダッキングを試す。それでも解決しない場合は、BGMのキー(調)が声の帯域と重なっている可能性がある。半音下げたバージョンを試すと改善することがある。
固有名詞で毎回つまずく
辞書登録を後回しにすると、生成のたびに同じミスを繰り返す。最初のプロジェクトで辞書ファイルを作り、以降は使い回す運用にする。
音量がバラバラになる
複数人で作業している場合に起きやすい。ラウドネスの目標値をチーム内で決め、書き出し設定をテンプレート化する。
ツール選定の比較基準
音声・音楽ツールを選ぶときの判断軸を整理する。
| 観点 | 確認する内容 |
|---|---|
| 日本語の自然さ | 固有名詞と数字の読みが安定しているか |
| 感情の制御 | プリセットとパラメータの両方が使えるか |
| 尺の自由度 | 長尺でも声質がぶれないか |
| 出力形式 | WAV、ステム、タイムスタンプ付きテキスト |
| 編集のしやすさ | 文単位の再生成ができるか |
| 利用条件 | 商用利用と再配布の扱いが明確か |
| 連携 | 動画編集ソフトに取り込みやすいか |
選定のコツは、複数ツールを目的別に使い分けることだ。ナレーション用、BGM用、仕上げ用と分けたほうが、結果的に品質が上がる。
また、ツールは定期的に見直す価値がある。音声合成の分野は進歩が速く、半年前に不自然だった部分が改善されていることが多い。ただし、プロジェクトの途中でツールを乗り換えると声質が変わるため、乗り換えは新しいシリーズを始めるときに限るのが安全だ。
よくある質問
AI音声はどのくらい自然なのか
短い文であれば、聞き手がAIと気づかないレベルに達している。ただし長尺になると、抑揚の単調さや息継ぎの不自然さが出やすい。対策は、ブロック分割と感情指示、そして無音の調整だ。
BGMは1曲作れば足りるのか
動画の長さによる。1分以内なら1曲で十分だが、3分を超える場合は2〜3パートに分けることを勧める。章ごとに楽器構成を変えるだけで、単調さは大きく改善する。
ナレーションとBGMの音量バランスの目安は
最終的な目標値は配信先によって異なるが、作業中は「BGMを切っても内容が伝わる」状態を基準にする。BGMを切ったときに物足りなさを感じる程度なら、BGMの存在感が強すぎる可能性がある。
声を途中で変更してもいいのか
シリーズ内では統一するのが原則だ。どうしても変更が必要な場合は、章の切り替わりなど、視聴者が自然に受け入れられるポイントで行う。
生成した音声にノイズが乗る
多くの場合、原因は書き出し設定か、無音部分の処理にある。無音を完全なゼロにすると不自然な切れ方をすることがある。低いノイズフロアを残すか、書き出し形式を見直す。
どの工程に最も時間をかけるべきか
台本の設計だ。ここに時間をかけると、生成、リテイク、ミックスのすべてが短縮される。逆に台本が曖昧なまま進めると、後工程で何度もやり直すことになる。
まとめ:ワークフローを資産化する
AI音声とBGM生成の価値は、作業を速くすることだけではない。設計から書き出しまでの流れを型として持つことで、毎回の試行錯誤を減らせる点にある。
押さえるべきポイントを整理する。
- 生成の前に、トーンボードと尺を決める
- 台本は話し言葉に変換し、息継ぎを確認する
- ナレーションはブロック分割し、感情指示を添える
- BGMは映像の章立てに対応させて構成する
- ミックスでは帯域の住み分けとダッキングを優先する
- 書き出しの目標値を決め、シリーズ内で揃える
最初はすべてを完璧にやろうとしなくていい。まずは台本の分割と、BGMの2パート化だけを試してみる。その2つだけでも、動画の聞きやすさは明確に変わるはずだ。慣れてきたら、発音辞書の整備、ステム出力を使ったミックス、テンプレート化へと進めていけばいい。
音は、視聴者が無意識に評価している領域だ。だからこそ、見えない部分に手をかけた動画は、理由は説明できなくても「なんとなく良い」と感じられる。それが結果的に、再生維持率や評価につながっていく。

