Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

AI音声とBGM制作の完全ガイド:ナレーション設計からミックス・書き出しまでの実践ワークフロー

Oct 4, 2026

音声と音楽が動画の成果を左右する

動画のクオリティは映像だけで決まらない。視聴者が最初に違和感を覚えるのは、多くの場合「音」のほうだ。ナレーションの発音がわずかに不自然、BGMのテンポが編集のリズムとずれている、声と音楽が同じ帯域でぶつかって聞き取りづらい。こうした問題は、映像がどれほど美しくても離脱の引き金になる。

AI音声合成とAI楽曲生成が実用レベルに達したことで、個人クリエイターでも放送品質に近い音声トラックを短時間で組めるようになった。ただし、ツールを起動してテキストを貼り付ければ終わり、というわけではない。成果を分けるのは、生成そのものではなく「設計」と「後処理」にある。

この記事では、台本の設計からナレーション生成、BGMの構成、ミックス、書き出しまでを一本のワークフローとして整理する。特定のサービスに依存しない形で手順を説明するので、どのツールを使っていても応用できるはずだ。

全体の流れは次のとおり。

  1. 目的と尺を決める
  2. 台本を話し言葉に変換する
  3. 声を選び、ナレーションを生成する
  4. BGMのムードと構成を設計して生成する
  5. 声と音楽をミックスする
  6. 映像タイムラインに同期させて書き出す
  7. 聞き直して修正する

順番が重要なのは、後工程の失敗の多くが前工程の曖昧さに起因するからだ。たとえば「BGMが合わない」と感じたとき、原因は楽曲ではなく台本のトーンが定義されていないことにある、というケースは珍しくない。

制作前の設計:台本・トーン・尺を先に固める

音声制作で最も見落とされやすいのが、生成前の設計工程だ。ここを丁寧にやるだけで、リテイクの回数は劇的に減る。

台本を「話し言葉」に変換する

読み上げ用の台本と、目で読む文章は別物だ。書き言葉のまま読み上げると、AI音声でも人間でも不自然に聞こえる。変換のポイントは次の4つ。

  • 一文を短くする。 目安は40〜60文字。長い一文は息継ぎの位置が定まらず、抑揚が平坦になる。
  • 漢語を開く。 「実施する」より「やる」、「検討する」より「考える」のほうが耳に残る。
  • 数字の読み方を指定する。 「1,200」は「せんにひゃく」か「いちにせん」か。ここは後述の発音辞書で必ず固定する。
  • 接続詞を減らす。 「しかしながら」が3回続くと、視聴者は内容ではなく話し方に意識が向いてしまう。

変換後の台本は、必ず一度声に出して読む。声に出して息が苦しい箇所は、AI音声でも必ず不自然になる。

尺とテンポの逆算

日本語のナレーションは、おおよそ1分あたり280〜350文字が自然な速度の目安になる。落ち着いた解説なら280文字前後、テンポの速い紹介映像なら350文字前後だ。

たとえば3分の解説動画なら、850〜1,000文字の台本が必要になる。ここで文字数が足りないと、映像に合わせて無理に引き伸ばすことになり、間の悪いナレーションが生まれる。逆に多すぎると、早口で情報が流れていく。

尺の設計では「どこで間を取るか」も決めておく。導入の後、重要な結論の前、章の切り替わり。この3箇所に1秒前後の空白を入れるだけで、聞き取りやすさは大きく変わる。

トーンボードを作る

トーンボードとは、声と音楽の方向性を言語化した短いメモだ。次の3項目を埋めるだけでいい。

項目 記入例
誰に向けて話すか 制作を始めたばかりの個人クリエイター
どんな印象を与えたいか 落ち着き、信頼、少しの親しみ
避けたい印象 威圧的、早口、営業的

このメモは、声質の選定、話速の設定、BGMのジャンル選択すべてに効いてくる。トーンボードなしで生成を始めると、後から「なんとなく違う」という曖昧な違和感に悩まされることになる。

AI音声合成の選び方:5つの評価軸

音声ツールは多数あるが、比較すべきポイントはそれほど多くない。以下の5軸で見れば、目的に合うものを短時間で絞り込める。

声質とキャラクターの一致

第一に、トーンボードと声質が合うかどうか。若々しい声、落ち着いた中年の声、ニュートラルな性別不明の声など、選択肢の幅を確認する。デモ音声は「きれいに聞こえるか」ではなく「自分の台本を読ませたときに自然か」で判断したい。できれば自社の原稿を10行ほど読み上げさせて比較する。

抑揚と感情表現の粒度

感情パラメータをどの粒度で操作できるかは重要な差になる。大きく分けて2種類のアプローチがある。

  • プリセット方式: 「落ち着き」「興奮」「共感」といったプリセットを選ぶ。操作が簡単で、初心者でも破綻しにくい。
  • パラメータ方式: 話速、ピッチ、ポーズ、強調を数値で調整する。細かい表現ができるが、設計力が問われる。

実務では、プリセットで大枠を作り、パラメータで微調整する併用がもっとも扱いやすい。

一貫性と安定性

同じ設定で複数回生成したとき、声がぶれないかは必ず確認したい。長尺の動画では、前半と後半で声のトーンが変わると強い違和感につながる。

チェック方法は簡単で、同じ原稿を3回生成して聞き比べる。ピッチや話速が目立って揺れるツールは、長尺には向かない。

多言語・発音精度

日本語のAI音声では、固有名詞、英単語、数字、記号の読みが鬼門になる。たとえば「AI」を「エーアイ」と読むか「アイ」と読むか、「3D」を「スリーディー」と読むかで印象は変わる。

発音辞書機能の有無、カタカナ指定の可否、アクセント位置の調整可否を確認する。多言語展開を予定しているなら、同一の声質で別言語を生成できるかも判断材料になる。

編集可能性と出力形式

生成した音声をそのまま使うことは少ない。無音の削除、語尾の伸縮、テイクの差し替えができるかは作業効率に直結する。

  • 文単位・段落単位で個別に再生成できるか
  • タイムスタンプ付きの字幕データを出力できるか
  • WAVなどの非圧縮形式で書き出せるか
  • ステム(声だけ・音楽だけ)で書き出せるか

この4点が揃っていると、後工程が格段に楽になる。

ナレーション制作の実践ワークフロー

ここからは実際の作業手順に入る。台本が完成している前提で進める。

ブロック分割とディレクション

台本を一度にすべて生成するのではなく、意味のまとまりごとに分割する。目安は2〜4文、15〜30秒程度。

分割する理由は3つある。第一に、感情の指示が効きやすくなる。第二に、1箇所の失敗を部分的に直せる。第三に、映像のカット割りに合わせて差し替えが効く。

各ブロックには、簡単なディレクションを添える。

ブロック3:課題の説明。ややトーンを落として、共感を示す。話速は標準より少し遅く。

この一言があるだけで、生成結果の安定度は変わる。

発音辞書と固有名詞の対策

固有名詞・略語・数字は、事前に辞書登録する。カタカナで読みを指定する方法がもっとも確実だ。

  • 数字:文脈に応じて「にせんじゅうよん」か「にせんよん」かを指定
  • 単位:mm は「ミリ」、% は「パーセント」と明示
  • 英字:URL は「ユーアールエル」と読ませるか、読み上げを省略するか
  • 人名・社名:読みが揺れやすいので登録必須

辞書を作る手間はかかるが、長期的には大きな時間の節約になる。プロジェクトごとに辞書ファイルを保存し、再利用する運用がおすすめだ。

間(ま)と無音の設計

生成された音声は、文と文の間が詰まりすぎていることが多い。ここを整えるだけで、聞き取りやすさは劇的に向上する。

  • 文の間:0.2〜0.3秒
  • 段落の間:0.5〜0.7秒
  • 章の切り替わり:0.8〜1.2秒

注意点は、無音を「ゼロ」にしてしまわないことだ。完全な無音は不自然に聞こえるため、-50dB前後の低いノイズフロアを残すか、BGMを敷いたままにする。

リテイクとバージョン管理

生成した音声は、必ずファイル名で管理する。

narration_03_block2_v2_flat.wav

日付や「最終」「本当の最終」といった命名は避ける。ブロック番号、テイク番号、調整内容を入れておけば、後から戻るのが簡単になる。

リテイクの判断基準も決めておく。「意味が伝わらない」は必ず直す。「少し好みと違う」は、優先度が高くなければ保留にする。すべてを完璧にしようとすると、制作は終わらない。

BGM生成の設計:ムードから構造へ

BGMは「良い曲を選ぶ」ものではなく「映像に合う曲を設計する」ものだ。

ムードを言葉にする

AI楽曲生成は、テキスト指示の解像度が結果を左右する。曖昧な指示は曖昧な曲を生む。

悪い例:

明るくてカッコいい曲

良い例:

シネマティックなオーケストラ。静かなピアノで始まり、中盤でストリングスが加わる。テンポは90BPM。緊張感はあるが不安にはならない。派手なドラムは使わない。

ポイントは、ジャンル、楽器編成、テンポ、強弱の推移、避けたい要素の5点を入れること。特に「避けたい要素」は効果が大きい。

映像のビートに合わせて構成する

BGMの構成は、映像の章立てと対応させる。3分の動画なら、おおむね次のような構成になる。

時間 映像 音楽の役割
0:00-0:15 導入 静かな立ち上がり。主張しない
0:15-1:15 課題提示 中程度の密度。不安や緊張を支える
1:15-2:15 解決策 明るさが増す。楽器が加わる
2:15-3:00 まとめ 余韻を残して減衰

この表を作ってから生成すると、「なぜか合わない」という状態を避けやすい。1曲をまるごと生成して無理に切るより、セクションごとに生成して繋ぐほうが制御しやすい。

ループ・ステム・尺の調整

実務では次の3点を確認する。

  • ループ性: 繰り返し再生しても継ぎ目が目立たないか
  • ステム出力: ドラム、ベース、メロディを個別に調整できるか
  • 尺の伸縮: 5秒単位で自然に伸ばせるか

尺を伸ばすときは、単純な繰り返しではなく、楽器を減らしてから戻す「引き算の展開」を作ると自然になる。

ライセンス条件の確認

生成した楽曲の利用条件は、必ず利用規約で確認する。確認すべき点は、商用利用の可否、収益化された動画での利用、再配布の扱い、クレジット表記の要否、そして生成物の権利帰属だ。

特にプラットフォームごとにポリシーが異なるため、複数の媒体に展開する場合は事前に整理しておく。判断に迷う場合は、利用条件が明確で、書面で確認できるツールを選ぶのが安全だ。

ミックスとマスタリング

声と音楽が揃ったら、次は両者を戦わせない作業に入る。

周波数帯域の住み分け

人間の声の明瞭度を決めるのは、おおよそ1kHz〜4kHzの帯域だ。BGMがこの帯域で鳴りすぎると、声が埋もれる。

対策はシンプルで、BGM側の2kHz〜4kHzを2〜4dBほど下げる。加えて、BGMの200Hz以下を軽く削ると、声の低域とぶつかりにくくなる。

  • 声:80Hz以下をハイパスでカット(不要な低域ノイズを除去)
  • 声:3kHz付近を1〜2dB持ち上げて明瞭度を確保
  • BGM:2〜4kHzを軽く下げる
  • BGM:200Hz以下を軽く削る

数値はあくまで出発点で、最終的には耳で判断する。

ダッキングで声を前に出す

もっとも効果が高いのがダッキング(サイドチェイン圧縮)だ。ナレーションが鳴っている間だけ、BGMの音量を自動的に下げる処理を指す。

設定の目安:

  • 下げ幅:4〜7dB
  • 立ち上がり:20〜50ms
  • 戻り:200〜400ms

戻りを速くしすぎるとBGMが上下にうねって聞こえる。遅すぎると、次の文が始まるまでBGMが小さいままになる。300ms前後から調整を始めるのが扱いやすい。

ラウドネスと書き出し

書き出し時の目標値は、配信先によって異なる。

配信先の種類 目安
動画共有サイト -14 LUFS 前後
ポッドキャスト -16 LUFS 前後
放送 -23 LUFS 前後

重要なのは、数字を合わせることよりも、シリーズ内で音量を揃えることだ。動画ごとに音量が違うと、チャンネル全体の印象が悪くなる。

また、ラウドネスを上げるためにリミッターを強くかけすぎると、声の抑揚が潰れる。目標値に対して2〜3dBの余裕を残しておくと、聞き疲れしにくい音になる。

映像タイムラインとの同期

音声と映像を合わせる工程は、工程表のなかでもっとも根気が要る。

マーカーを先に打つ

編集を始める前に、音声側にマーカーを打つ。ナレーションの開始点、BGMの切り替え点、効果音を入れる位置。これを先に済ませておくと、映像を動かすたびに音を探す手間がなくなる。

尺の伸縮と「間」の活用

映像と音声の尺が合わないとき、多くの人は映像を切って調整する。しかし先に検討すべきは、音声側の間だ。

  • 0.3秒の間を2箇所削るだけで、映像を1カット切らずに済むことがある
  • 逆に、映像が余っている場合は、文の間に余白を足して自然に伸ばせる

「音を削る前に、間を削る」。これは覚えておいて損のない原則だ。

字幕・テロップとの関係

音声を生成すると、タイムスタンプ付きのテキストが得られることが多い。これを字幕の下書きに使うと、文字起こしの手間が大きく減る。

ただし、そのまま使うと読みにくい字幕になる。字幕は音声よりも情報を削る必要がある。

  • 一文を32文字以内に収める
  • 句読点は最小限にする
  • 同じ行に句点を置かない

音声とテロップのタイミングが半秒ずれるだけで、視聴者は無意識に違和感を覚える。書き出し前に必ず通しで確認する。

よくある失敗と回避策

実務で繰り返し発生する問題と、その対処をまとめる。

声が平坦で眠くなる

原因は、台本の文が長いこと、話速が一定であること、感情指示が入っていないことの3つが多い。対策は、長い文を分割すること、重要な文だけ話速を10%落とすこと、段落ごとに異なる感情を指定すること。

BGMが最後まで同じで飽きる

1曲をまるごと敷き詰めると、3分を超えたあたりから単調に感じられる。対策は、AパートとBパートの2種類を生成し、章の切り替わりで入れ替えること。あるいは、ステム出力を使ってドラムだけを中盤で抜く。

声と音楽がぶつかる

ミックスの問題であることがほとんど。前述の帯域処理とダッキングを試す。それでも解決しない場合は、BGMのキー(調)が声の帯域と重なっている可能性がある。半音下げたバージョンを試すと改善することがある。

固有名詞で毎回つまずく

辞書登録を後回しにすると、生成のたびに同じミスを繰り返す。最初のプロジェクトで辞書ファイルを作り、以降は使い回す運用にする。

音量がバラバラになる

複数人で作業している場合に起きやすい。ラウドネスの目標値をチーム内で決め、書き出し設定をテンプレート化する。

ツール選定の比較基準

音声・音楽ツールを選ぶときの判断軸を整理する。

観点 確認する内容
日本語の自然さ 固有名詞と数字の読みが安定しているか
感情の制御 プリセットとパラメータの両方が使えるか
尺の自由度 長尺でも声質がぶれないか
出力形式 WAV、ステム、タイムスタンプ付きテキスト
編集のしやすさ 文単位の再生成ができるか
利用条件 商用利用と再配布の扱いが明確か
連携 動画編集ソフトに取り込みやすいか

選定のコツは、複数ツールを目的別に使い分けることだ。ナレーション用、BGM用、仕上げ用と分けたほうが、結果的に品質が上がる。

また、ツールは定期的に見直す価値がある。音声合成の分野は進歩が速く、半年前に不自然だった部分が改善されていることが多い。ただし、プロジェクトの途中でツールを乗り換えると声質が変わるため、乗り換えは新しいシリーズを始めるときに限るのが安全だ。

よくある質問

AI音声はどのくらい自然なのか

短い文であれば、聞き手がAIと気づかないレベルに達している。ただし長尺になると、抑揚の単調さや息継ぎの不自然さが出やすい。対策は、ブロック分割と感情指示、そして無音の調整だ。

BGMは1曲作れば足りるのか

動画の長さによる。1分以内なら1曲で十分だが、3分を超える場合は2〜3パートに分けることを勧める。章ごとに楽器構成を変えるだけで、単調さは大きく改善する。

ナレーションとBGMの音量バランスの目安は

最終的な目標値は配信先によって異なるが、作業中は「BGMを切っても内容が伝わる」状態を基準にする。BGMを切ったときに物足りなさを感じる程度なら、BGMの存在感が強すぎる可能性がある。

声を途中で変更してもいいのか

シリーズ内では統一するのが原則だ。どうしても変更が必要な場合は、章の切り替わりなど、視聴者が自然に受け入れられるポイントで行う。

生成した音声にノイズが乗る

多くの場合、原因は書き出し設定か、無音部分の処理にある。無音を完全なゼロにすると不自然な切れ方をすることがある。低いノイズフロアを残すか、書き出し形式を見直す。

どの工程に最も時間をかけるべきか

台本の設計だ。ここに時間をかけると、生成、リテイク、ミックスのすべてが短縮される。逆に台本が曖昧なまま進めると、後工程で何度もやり直すことになる。

まとめ:ワークフローを資産化する

AI音声とBGM生成の価値は、作業を速くすることだけではない。設計から書き出しまでの流れを型として持つことで、毎回の試行錯誤を減らせる点にある。

押さえるべきポイントを整理する。

  • 生成の前に、トーンボードと尺を決める
  • 台本は話し言葉に変換し、息継ぎを確認する
  • ナレーションはブロック分割し、感情指示を添える
  • BGMは映像の章立てに対応させて構成する
  • ミックスでは帯域の住み分けとダッキングを優先する
  • 書き出しの目標値を決め、シリーズ内で揃える

最初はすべてを完璧にやろうとしなくていい。まずは台本の分割と、BGMの2パート化だけを試してみる。その2つだけでも、動画の聞きやすさは明確に変わるはずだ。慣れてきたら、発音辞書の整備、ステム出力を使ったミックス、テンプレート化へと進めていけばいい。

音は、視聴者が無意識に評価している領域だ。だからこそ、見えない部分に手をかけた動画は、理由は説明できなくても「なんとなく良い」と感じられる。それが結果的に、再生維持率や評価につながっていく。

Alexander

Alexander