動画の印象を決めるのは音である
動画制作の議論はどうしても映像に集まりがちだ。構図、色、カメラワーク、カットのテンポ。どれも重要だが、視聴者が「わかりやすい」「感情が動いた」「最後まで見られた」と感じるかどうかの大部分は、音の設計で決まる。ナレーションが聞き取りづらければ内容は伝わらないし、BGMが場面と食い違えば違和感だけが残る。効果音が唐突に鳴れば、映像がどれほど滑らかでも安っぽく感じられてしまう。
これまで、この音の品質を担保するには専門の音響エンジニアの力が必要で、台本の読み合わせ、収録、編集、ミックスという工程に多くの時間と予算がかかっていた。個人制作や小規模チームにとって、ここが最大のボトルネックだった。映像だけなら作れる、しかし音に手が回らない。その状態が長く続いてきた。
状況が変わったのは、音声合成、楽曲生成、効果音の推薦、自動ミックスのすべてが実用レベルに達してからだ。テキストを渡せば自然な抑揚のナレーションが返り、シーンの説明を書けばムードに合ったBGMが生成され、カットのタイミングに合わせて効果音の候補が並ぶ。しかも同じプロジェクト内で設定を共有できるため、声のトーンと音楽の温度感がばらつかない。映像生成と音響生成を別々のツールで行き来する手間は、ほとんどなくなった。
ここで誤解してはいけないのは、AIが音響エンジニアを置き換えるという話ではないという点だ。変わるのは判断の速さと試行回数である。十通りの読み方を数分で比較できるから、いちばん伝わる読みを選べる。五種類のBGMを並べて、カットの切り替わりと最も自然に重なるものを選べる。この比較の回数が増えることが、最終的な品質を押し上げる。耳で選ぶ作業をどれだけ回せたかが、作品の仕上がりを分ける。
AI音響ワークフローの全体像
AI音響を「なんとなく雰囲気の良い音を足す作業」と捉えると、たいてい失敗する。うまくいく現場では、音を四つの層に分けて考え、それぞれに役割と基準を与えている。層を分けておくと、仕上がりに違和感があったときに「どの層が原因か」を切り分けられる。
| 層 | 役割 | 主な判断基準 |
|---|---|---|
| ナレーション | 情報と感情を伝える主役 | 明瞭度、テンポ、感情の一貫性 |
| BGM | 場面の空気とテンポをつくる | 尺との一致、声を邪魔しない帯域 |
| 効果音 | 物理的な説得力を与える | タイミング、音量、定位 |
| ミックス | 全体を一本にまとめる | ラウドネス、トゥルーピーク、重心 |
ナレーション層が担うもの
ナレーションは作品の背骨だ。ここが崩れると、他の三層がどれだけ優秀でも作品は成立しない。逆に、声が明瞭でテンポが良ければ、映像の粗さは驚くほど目立たなくなる。判断すべきは「誰が話しているか」「誰に向けて話しているか」「どの温度で話しているか」の三点である。この三点が決まっていないまま生成を始めると、あとで全部作り直すことになる。
BGM層が担うもの
BGMは感情の地図である。視聴者に「ここは明るい場面だ」「ここから緊張する」と無意識に伝える。ただし主役ではない。ボーカル入りの楽曲をそのまま流すと、ナレーションと帯域がぶつかって両方が聞き取りづらくなる。インストゥルメンタルを基本にし、人の声に近い帯域を控えめにしたものを選ぶのが鉄則だ。
効果音層が担うもの
効果音は「そこに物がある」という感覚を作る。ドアが閉まる音、足音、衣擦れ、キーボードの打鍵。派手なアクション音よりも、地味なアンビエンスのほうが効果は大きい。無音のシーンに薄い環境音を一枚敷くだけで、映像は突然リアルになる。
ミックス層が担うもの
ミックスは地味だが最も差がつく工程だ。各層を並べただけでは聞きづらい。ナレーションを前に出し、BGMを数デシベル下げ、効果音を必要な瞬間だけ持ち上げる。この相対関係の設計こそがミックスであり、AIの自動処理に任せたあとで必ず人の耳で確認すべき部分でもある。
ナレーション設計:AI音声合成の実践手順
音声合成の品質は、モデルそのものよりも入力の設計で決まる。同じモデルでも、台本の書き方ひとつで結果は別物になる。
台本を「耳で理解できる文章」に変換する
読み上げ用の文章は、黙読用の文章と別物だ。まず一文を短くする。目安は四十文字前後。長い従属節は分割し、接続詞は文頭に置く。次に、漢字の連続を避ける。「製造工程管理表」のような語は、ひらがなを混ぜて読みの負荷を下げる。数字は読み方を明示する。たとえば「1,200」は「千二百」と書いたほうが意図どおりに読まれることが多い。略語は初出でフルスペルを添える。
句読点は息継ぎの指示になる。読点を打てば短い間が入り、句点を打てば長い間が入る。逆に、間を入れたくない箇所では読点を打たない。感嘆符や疑問符は感情のトーンを変えるので、多用すると平坦な演出になる。強調したい語は、前後に読点を置いて孤立させると自然に際立つ。
感情・間・アクセントの設計
生成された音声をそのまま使うのは、撮影した素材をそのまま出すのと同じだ。必要なのは編集である。具体的には、話速、ピッチ、抑揚の幅、そして無音区間の四つを調整する。
話速は一分間あたりの文字数で管理すると安定する。情報量の多い説明パートは少し速め、感情を乗せるパートは遅めにする。抑揚の幅を広げすぎると芝居がかって聞こえ、狭すぎると機械的に聞こえる。まずは中程度から始めて、聞き返したくなる箇所だけ調整するのが効率的だ。
無音区間は最も見落とされやすい。文と文の間に零点三秒、段落の切り替わりに零点八秒。この程度の余白を入れるだけで、聞き手の理解速度に声が追いつく。逆に詰め込みすぎると、内容が頭に入る前に次の文が始まってしまう。
アクセントの指定が必要な場合は、読みを仮名で指定するか、音素レベルの指定ができるツールを使う。人名、地名、専門用語、そして数字は必ず確認する。ここを放置すると、視聴者の信頼を一度で失う。
多言語展開とキャラクターの一貫性
同じ内容を複数言語で出したい場合、翻訳してから読み上げるのではなく、各言語の話者に自然な語順へ書き直してから読み上げる。直訳した文章は、どの言語でも不自然に聞こえる。
シリーズものでは、声の一貫性を最優先する。毎回同じ声、同じ話速、同じ抑揚の基準を守る。声を固定できない場合は、話者設定をプロジェクトのテンプレートとして保存し、新しい回でも同じ設定を読み込む。聴衆は「同じ番組を見ている」感覚を声から受け取るため、ここがぶれるとシリーズの資産価値が落ちる。
BGM設計:映像のリズムに同期させる
BGMは「場面に合う曲」を探す作業ではない。映像の時間軸に沿って、どこで始まり、どこで変化し、どこで終わるかを設計する作業だ。
キューシートを作る
編集を始める前に、タイムコード付きのキューシートを作る。列は「開始時刻」「終了時刻」「場面の内容」「感情のラベル」「音楽の有無」の五つで十分だ。この表があると、生成すべき楽曲の数と長さが確定し、無駄な生成がなくなる。
感情のラベルは抽象語で構わない。静けさ、期待、軽快、緊張、余韻。このラベルがそのまま生成プロンプトの語彙になる。ラベルが曖昧なまま生成すると、どの場面にも合わない無難な曲が返ってくる。
プロンプト設計:ムード・テンポ・編成
楽曲生成のプロンプトは、次の順序で組み立てると狙いどおりになりやすい。
- ジャンルと用途(例:企業紹介向けの控えめな電子音楽)
- 楽器編成(例:ピアノ、柔らかいシンセパッド、控えめなパーカッション)
- テンポ(例:毎分九十拍、ただしドラムは控えめ)
- 感情の推移(例:静かな導入から少しずつ前へ進む)
- 除外条件(例:ボーカルなし、鋭い高音なし、急な音量変化なし)
重要なのは除外条件だ。多くの生成結果は、指定しなければボーカルや派手なシンバルを含んでくる。ナレーションの下に敷くなら、人の声の帯域と重なる要素は最初から排除しておく。
尺は映像より少し長めに生成し、編集で切り詰める。ぴったり合わせようとすると、フレーズの途中で切れて不自然になる。
ステム分割とループの活用
一部の生成ツールは、楽曲を楽器ごとのステムに分けて出力できる。これが使えると編集の自由度が大きく上がる。導入ではピアノだけ、山場でパーカッションを足す、結末で低音を抜く。この操作が一本の楽曲の中で完結する。複数の曲を並べるより、よほど自然につながる。
長尺の場合はループ可能なセクションを作り、場面の長さが変わっても対応できるようにしておく。ループの継ぎ目は必ず耳で確認する。波形ではきれいでも、聴くと継ぎ目が分かることはよくある。
効果音:マッチングと手動配置の使い分け
効果音は大きく三つのレイヤーに分けて考える。
アンビエンス
その場の空気を伝える層。室内の反響、街の遠い騒音、風、鳥の声。音量は極めて小さく、意識されない程度に敷く。この層があるだけで映像の説得力は一段上がる。逆に、これがない映像は無菌室のように感じられる。
フォーリー
人物の動作に付く音。足音、衣擦れ、椅子のきしみ、カップを置く音。AIによる自動マッチングが最も得意な領域であり、カットを検出して候補を並べてくれる。ただし自動配置はタイミングが数フレームずれることが多い。必ず波形を拡大し、映像の動作と音の立ち上がりを揃える。ずれは十ミリ秒でも知覚される。
アクセント
画面転換、テキストの出現、図表の切り替わりに付く短い音。使いすぎると騒がしくなるので、一つの動画で三種類まで、と自分に制限をかけると統一感が出る。
配置の原則は「見えているものに音を付け、見えていないものは控えめに」だ。画面に映っていない動作に大きな音を付けると、視聴者は違和感の原因を特定できないまま離脱する。
映像と音の同期:モーションに合わせる設計
映像生成の品質が上がるほど、音の同期精度が目立つようになる。高精細な映像に粗い音響を合わせると、映像のほうが嘘っぽく見えてしまう。
ビートグリッドでカットを決める
編集タイムラインに音楽の拍を表示し、カットの位置を拍に合わせる。すべてのカットを合わせる必要はない。重要な転換点、たとえば話題が変わる瞬間や商品が登場する瞬間だけを拍に合わせる。それ以外は意識的にずらしたほうが、単調さを避けられる。
逆の手順も有効だ。先に映像を組み、その動きのリズムに合わせてBGMのテンポを後から決める。人物の歩行、車の移動、手の動作には固有のリズムがあり、それに合うテンポを選ぶと映像と音楽が一体化する。
映像の解像度と音響の解像度を揃える
映像に合わせて音の情報量も調整する。広い風景をゆっくり見せる場面では、音も広く、余白のあるものにする。細かいカットが続く場面では、音も情報量を増やす。映像が静かなのに音が忙しいと、視聴者は疲れてしまう。
また、映像生成モデルによって動きの滑らかさは異なる。滑らかな動きの映像には長い余韻を持つ音が合い、コマ送りのような動きには短く切れる音が合う。使用している映像生成の特性を把握したうえで、音の減衰時間を選ぶとよい。
ミックスとラウドネス:配信先ごとの基準
仕上がりの良し悪しを最も左右するのが、この最終工程だ。
配信先ごとの目標値
| 配信先 | 目標ラウドネス | トゥルーピーク上限 |
|---|---|---|
| 動画共有サイト | マイナス十四LUFS前後 | マイナス一dBTP |
| ポッドキャスト | マイナス十六LUFS前後 | マイナス一dBTP |
| 放送規格 | マイナス二十三LUFS | マイナス一dBTP |
| SNS縦型広告 | マイナス十四から十二LUFS | マイナス一dBTP |
数値は目安であり、配信先が自動で音量を調整する場合もある。重要なのは、どの環境でも過度に圧縮せず、声が明瞭に聞こえることだ。
ダッキングとサイドチェイン
ナレーションが鳴っている間だけBGMを自動的に下げる処理をダッキングと呼ぶ。下げ幅は三から六デシベルが目安。下げすぎると音楽が消えたように聞こえ、下げなさすぎると声が埋もれる。立ち上がりと戻りの時間をゆっくりめ(百五十ミリ秒程度)にすると、機械的な印象を避けられる。
モニタリング環境
ミックスの確認は、少なくとも三つの環境で行う。ヘッドホン、スピーカー、そしてスマートフォンの内蔵スピーカー。特に最後が重要で、多くの視聴者はスマートフォンで見る。低音は再生されないことが多く、そこで初めて聞こえなくなる要素に気づける。
よくある失敗と回避策
失敗にはパターンがある。先に知っておけば、ほとんどは避けられる。
- 声と音楽が同じ帯域でぶつかる。回避策は、BGM側で人の声に近い帯域を数デシベル下げ、ボーカル入りの楽曲を避けること。
- 効果音を全カットに付けすぎる。回避策は、付ける場所を意図的に減らし、無音の区間を残すこと。
- ラウドネスを上げるために圧縮しすぎる。回避策は、目標値を守り、トゥルーピークを必ず確認すること。
- 読み上げが速すぎる。回避策は、一度書き出して別の作業を挟み、翌日に聞き直すこと。
- テンポが一定で単調になる。回避策は、キューシートの段階で感情の起伏を設計しておくこと。
- 多言語版で声の印象がばらつく。回避策は、言語ごとに声を固定し、設定をテンプレート化すること。
- 生成した音をそのまま使い、ノイズや不要な残響が残る。回避策は、書き出し前の確認工程を必ず入れること。
- ファイル名とバージョン管理が崩れる。回避策は、命名規則を先に決めること。
ツール選定の判断基準と実例ワークフロー
ツールは機能数ではなく、次の四点で選ぶ。
- 書き出し形式(ステム分離、WAV、サンプルレートの指定可否)
- 声の一貫性を保つ仕組みがあるか
- 商用利用の条件が明確か
- 既存の編集ソフトに持ち込めるか
音声合成なら、感情指定と多言語対応、そして声の固定機能を持つものを選ぶ。楽曲生成なら、インストゥルメンタル指定とステム出力があるものを選ぶ。仕上げは、ラウドネス測定とダッキングができる編集ソフトで行うのが現実的だ。
ショート動画(三十秒)
冒頭二秒でフックを作る。ナレーションは十五秒分、BGMは最初から鳴らし、中盤で一度抜いて、最後にもう一度入れる。効果音は三箇所まで。字幕とナレーションのタイミングを完全に一致させる。
商品紹介(二分)
導入、課題提示、解決策、証拠、行動喚起の五幕で構成する。BGMは二つのセクションに分け、課題提示で一度暗くし、解決策で明るく戻す。ナレーションの話速は幕ごとに変え、証拠の部分だけ遅くする。
ドキュメンタリー調(八分)
アンビエンスを厚めに敷き、BGMは合計三分以内に抑える。音楽がない時間の長さが、作品の重みになる。ナレーションは抑揚を控えめにし、間を長めに取る。効果音は動作に合わせて丁寧に配置する。
よくある質問
Q. 音声合成だけで十分な品質になりますか。
読みの設計と編集を丁寧に行えば、多くの用途で十分な品質に到達する。ただし人名、専門用語、数字は必ず試聴し、必要なら読みを仮名で指定する。
Q. BGMは一曲で通すべきですか、複数曲を使い分けるべきですか。
尺による。三十秒から一分なら一曲で通すほうが自然だ。二分以上なら二つから三つのセクションに分ける。ただし曲調が極端に変わると別作品のように感じられるので、テンポと編成を近づける。
Q. 効果音はどこまで自動に任せられますか。
候補の提示までは自動で任せ、最終的な位置決めは手で行うのが現実的だ。特に人物の動作に付く音は、数フレームのずれが目立つ。
Q. ラウドネスの数値はどこまで厳密に守るべきですか。
配信先が指定している場合は従う。指定がない場合はマイナス十四LUFS前後を目標にし、トゥルーピークがマイナス一dBTPを超えないようにする。数値よりも、複数の再生環境で聞きづらくないことのほうが重要だ。
Q. 音の作業はどの工程で始めるべきですか。
台本の確定後、映像編集と並行して始めるのが最も効率的だ。キューシートを先に作り、ナレーション、BGM、効果音の順に確定させ、最後にミックスする。
Q. どこから手を付ければよいかわかりません。
まず一本の動画で、ナレーションの明瞭度だけを改善する。それだけで視聴維持率は変わる。次にBGMを声の邪魔をしないものに差し替え、最後に効果音とミックスに進む。順番を守るほうが、全部を一度に触るより結果が安定する。
音響は、映像のあとに付け足す装飾ではない。作品の意味を決める構造の一部である。四つの層を分けて設計し、比較して選び、複数の環境で確認する。この手順を一度身につければ、制作のたびに迷う時間は確実に減っていく。



