動画の評価は「音」で決まる場面が多い
映像だけをどれだけ作り込んでも、声がこもっていたり、BGMが大きすぎてセリフが聞き取れなかったりすると、視聴者は早い段階で離脱します。逆に、映像がシンプルでも、声がクリアでBGMの音量バランスが自然であれば、「丁寧に作られた動画」という印象を持たれます。音声は視覚情報と違って「違和感」としてしか認識されにくいため、問題があっても制作者自身が気づきにくいのが厄介な点です。
特に初心者が最初にぶつかる壁は、次の3つに集約されます。1つ目は録音時のレベル設定、2つ目は不要なノイズの除去、3つ目はBGMとナレーションの音量バランスです。この3つは、無料のオーディオ編集ソフトであるAudacityで十分に対処できます。高価な機材や有料プラグインを揃える前に、まず「正しい順番で処理する」という基本を押さえることが、仕上がりの差になります。
この記事では、Audacityの初期設定から録音、波形編集、ノイズ除去、EQ、コンプレッション、BGMのダッキング、そして動画編集ソフトへの書き出しまでを、実際の作業順に沿って解説します。読み終えたときには、自分の動画に対して「どこを、どの順番で、どれくらい動かせばよいか」を判断できるようになっているはずです。
Audacityを導入して最初に整えるべき設定
インストールとデバイスの選択
AudacityはWindows、macOS、Linuxで動作するオープンソースのオーディオ編集ソフトです。公式サイトから配布されているインストーラーを使い、最新の安定版を導入します。インストール後、最初に確認すべきは「オーディオ設定」です。上部のデバイスツールバーで、ホスト(WindowsならWASAPI、macOSならCore Audio)、録音デバイス、再生デバイス、チャンネル数を指定します。
USBマイクを使う場合、OS側のサウンド設定でも入力デバイスとして認識されているかを確認してください。ここがずれていると、Audacityのメーターがまったく動かないという初歩的なトラブルが起きます。また、Bluetoothヘッドセットを録音に使うのは避けるのが無難です。遅延や帯域圧縮によって音質が劣化し、後から修正できない問題になります。
プロジェクトのサンプルレートとビット深度
動画用の音声を扱う場合、サンプルレートは48kHzに統一するのが基本です。音楽素材が44.1kHzで配布されていても、動画編集ソフト側で読み込むときに自動変換されるため、プロジェクト内で混在させなければ問題ありません。ビット深度は32bit floatで作業し、書き出し時に24bitまたは16bitへ落とす流れが扱いやすいです。32bit floatで作業しておくと、一時的に0dBを超えてもクリッピング情報が保持されるため、後からレベルを下げて救済できます。
自動保存と作業フォルダ
Audacityのプロジェクトファイル(拡張子 .aup3)は、参照している音声データを内部に保持します。長い動画の音声を扱うと数GBになることもあるため、作業用のフォルダをあらかじめ決めておきましょう。また、環境設定の「自動保存」を有効にしておくと、予期しない終了時の被害を減らせます。外部ストレージやクラウド同期フォルダに直接置くと、同期競合でプロジェクトが壊れることがあるため、ローカルディスク上で作業するのが安全です。
ナレーション録音を成功させるワークフロー
マイクゲインとピークレベルの目安
録音で最初に決めるのは入力レベルです。目安として、話しているときのピークが-12dBから-6dBの範囲に収まるようにマイクのゲインを調整します。Audacityの入力メーターが赤くなったら、それはデジタルクリッピング(音割れ)が発生しているサインで、その部分は復元できません。小さめに録って後から増幅するほうが、歪んだ音を直すよりもはるかに簡単です。
環境音のフロアノイズも確認しておきます。無音の状態でメーターが-60dB以下に収まっていれば理想的です。エアコンの送風音やPCのファン音が-45dB程度で乗っていると、ノイズ除去の負担が大きくなり、声が不自然に加工されたような質感になりやすくなります。録音前にマイクを口から15〜25cm程度離し、マイクの正面から少し外して呼吸の破裂音(ポップ)を避ける位置を探しましょう。
読み方とテイクの取り方
ナレーションは一発で決めようとせず、文単位で区切って複数テイクを録るのが現実的です。ミスをしたら止めずにそのまま続け、後から良いテイクを選ぶほうが結果的に速く仕上がります。長い無音を作らず、テイク間に2秒程度の間を入れておくと、後で波形を見て区切りが判別しやすくなります。
読み方は「少しゆっくり、少し大げさ」が基本です。普段の会話のテンポで読むと、再生時に早口に感じられます。文末を下げすぎず、語尾を軽く残す意識を持つと、聞き取りやすさが向上します。
ラベルトラックで区間を管理する
Audacityにはラベルトラックという機能があり、波形上の任意の位置に目印を付けられます。テイクの頭、言い直しの位置、編集で削る区間などをラベルとして記録しておくと、後戻りが格段に減ります。ラベルはテキストとして書き出せるため、動画編集ソフト側のタイムラインと突き合わせる際の作業メモとしても活用できます。
波形編集の基本操作を身につける
選択・カット・フェード
編集の中心は、波形の一部を選択して切り取り、必要に応じてつなぎ直す作業です。Audacityではマウスドラッグで範囲選択し、キーボードショートカットでカット、コピー、貼り付けを行います。切り貼りをした境界には必ずと言っていいほど不自然な「プツ」という音が出るため、境界の前後に数ミリ秒のフェードイン/フェードアウトを掛けてなじませます。
無音と呼吸音の扱い
話と話の間の無音は、完全にゼロにするのではなく、短く詰める程度にとどめるのが自然です。すべての呼吸音を消すと、機械的な読み上げのように聞こえます。大きな息継ぎだけを選んで音量を下げる、あるいは短く詰めるという処理が現実的です。
ズームを使い分ける
波形編集の精度はズーム操作に直結します。全体を見て構成を確認するズームと、ミリ秒単位で境界を調整するズームを頻繁に行き来してください。耳だけで判断しようとすると、ノイズやクリック音を見落とします。波形の形を見れば、破裂音は急峻なスパイクとして、クリックノイズは孤立した細い線として視認できます。
音声処理は「順番」が命:推奨チェーン
エフェクトを闇雲に掛けると、音は確実に悪くなります。動画用のナレーションであれば、次の順番を基本の型として覚えておくと迷いません。
- ノイズリダクション
- ハムノイズ・クリックノイズの除去
- ハイパスフィルター(低域の不要成分を切る)
- EQによる音色調整
- コンプレッションによる音量の均一化
- ディエッサー(歯擦音の抑制)
- ノーマライズ/ラウドネス調整
- リミッターでピークを抑える
ノイズリダクション
まず、声が入っていない数秒間を選択し、「ノイズプロファイルの取得」を実行します。その後、トラック全体を選択してノイズリダクションを適用します。設定値の初期目安は、ノイズ低減量6〜12dB、感度5〜6、周波数平滑化3程度です。
もっとも多い失敗は、低減量を強くしすぎることです。20dB以上を一気に掛けると、声が水中で話しているようなこもり方をし、サ行が不明瞭になります。適用後にヘッドホンで確認し、違和感があれば元に戻して設定を弱めましょう。ノイズ除去は「1回で大きく削る」より「2回に分けて控えめに削る」ほうが破綻しにくいです。
ハムノイズとクリックノイズの除去
電源由来のブーンという低周波ノイズは、50Hzまたは60Hz付近のピークとして現れます。地域によって周波数が異なるため、スペクトル表示で該当のピークを確認してからノッチフィルターを掛けます。倍音成分が乗っている場合は、その倍数の周波数にも軽くフィルターを掛けます。
クリックノイズは、スマートフォンの通知音や机に物を置いた音など、短い衝撃音として波形に現れます。比較的新しいバージョンにはクリック除去の機能が用意されているので、まず自動処理を試し、残ったものを手動で選択して修復します。
EQによる音色調整
EQは「足す」より「引く」を優先すると失敗しにくくなります。ナレーションの場合、200〜400Hz付近のこもり成分を2〜3dB程度下げ、2〜5kHz付近を軽く持ち上げると、聞き取りやすさが上がります。低域は80〜100Hz以下をハイパスフィルターで切っておくと、BGMと重なったときの濁りが減ります。
持ち上げる量は3dB以内を目安にしてください。大きく持ち上げると、歯擦音や息遣いまで強調され、耳に痛い音になります。EQは音量を変える処理ではないため、掛けた後に「何となく大きく聞こえる」場合は、聴感上の変化をEQの効果と誤認している可能性があります。
コンプレッションによる音量の均一化
コンプレッションは、大きい音を抑えて小さい音との差を縮め、聞き取りやすくする処理です。ナレーションの初期設定の目安は、しきい値-18dB、比率2.5:1〜4:1、アタック10ms、リリース100ms程度です。掛けすぎると、息遣いだけが持ち上がって呼吸がうるさく聞こえたり、音量が脈打つように感じられたりします。
判断に迷ったら、コンプレッションのオンとオフを交互に切り替えて聴き比べてください。差が「少し整った」程度が適正で、「明らかに変わった」と感じたら掛けすぎです。
ノーマライズとラウドネスの目標値
最後の音量調整では、ピーク基準のノーマライズではなく、ラウドネス基準を意識します。動画配信プラットフォーム向けなら-14 LUFS前後、ポッドキャストや音声主体の配信なら-16 LUFS前後が目安です。トゥルーピークは-1dBTP以下に抑えておくと、エンコード時の歪みを避けられます。
プラットフォーム側で音量が自動調整される場合、こちらが大きすぎる音を出すと全体が圧縮されて迫力が失われます。目標値に近づけておくほうが、意図したバランスが保たれます。
ディエッサーとリミッター
サ行やタ行が刺さる場合は、ディエッサーで歯擦音だけを抑えます。強く掛けると「サ」が「シャ」に変わったように聞こえるため、掛けすぎに注意します。最後にリミッターを掛けて、瞬間的なピークだけを抑えれば、ミックスの完成です。
BGMと効果音を設計する
BGMの選び方とライセンス確認
BGMは「動画の雰囲気を決める」と同時に「邪魔をしない」ことが求められます。ナレーション主体の動画では、ボーカル入りの楽曲は避け、楽器構成がシンプルで中域が空いているものを選びます。ピアノやアコースティックギターの単音系、控えめなアンビエント系は相性が良いです。
もっとも重要なのはライセンスの確認です。利用規約には、商用利用の可否、クレジット表記の要否、動画プラットフォームでの収益化可否、再配布の可否などが書かれています。表記が必要な場合は、動画概要欄に正確なクレジットを記載します。出典が不明な音源を「たぶん大丈夫」で使うと、後から動画の公開停止や収益化停止につながるリスクがあります。
ダッキングでナレーションを前に出す
ダッキングとは、ナレーションが入っている間だけBGMの音量を自動的に下げる処理です。Audacityには自動ダッキングの機能があり、ナレーショントラックを制御側、BGMトラックを対象側に指定して実行します。下げ幅は-10〜-15dB程度、フェード時間は0.3〜0.5秒程度から調整すると自然に聞こえます。
自動処理だけで完璧にならない場合は、BGMトラックの音量エンベロープを手動で編集します。文章の切れ目、間の部分だけ音量を戻すようにエンベロープを打つと、BGMが呼吸しているように感じられ、単調さが減ります。
効果音の配置とミックス
効果音は、画面の動きに音を合わせることで情報の理解を助けます。ただし数を増やしすぎると、却って何が重要か分からなくなります。動画全体で使う効果音の種類を5〜8種類程度に絞り、音量はナレーションより-12〜-18dB程度下に置くのが基本です。
効果音のタイミングは、映像の動きより1〜2フレーム早めに置くと自然に感じられます。逆に遅れると、反応が鈍い印象になります。また、同じ効果音を連続で使うと耳が慣れて効果が薄れるため、音量やピッチを少し変えるか、別の音に差し替えましょう。
動画編集ソフトへの受け渡しと同期
書き出し形式の選び方
動画編集ソフトに読み込ませるマスター音声は、非圧縮のWAV、48kHz、24bitが基本です。MP3やAACは圧縮形式であり、繰り返し書き出しをすると音質が劣化します。編集途中の確認用としてなら圧縮形式でも構いませんが、最終的な受け渡しはWAVで行いましょう。
ナレーションとBGMを別トラックのまま渡したい場合は、複数トラックの同時書き出しを使います。ステム(パート別ファイル)として書き出しておけば、動画編集ソフト側で微調整ができます。逆に、動画側で音量を触る予定がないなら、1本のミックス済みファイルとして渡すほうがトラブルが少なくなります。
同期ズレの直し方
映像と音声の同期がずれる原因は、大きく3つあります。1つ目はフレームレートとサンプルレートの不一致、2つ目は録音開始タイミングのずれ、3つ目は編集ソフト側の自動変換による丸め誤差です。
撮影時に手を叩く、または拍手音を入れておくと、波形のスパイクを目印に同期を取りやすくなります。ずれが動画の後半に向かって大きくなる場合は、サンプルレートの不一致を疑ってください。44.1kHzの素材を48kHzのプロジェクトで扱うと、数秒単位のずれとして現れることがあります。
マルチトラックとSync-Lock
Audacityには、トラック間の相対位置を保ったまま編集するためのSync-Lock機能があります。BGMと効果音の位置関係を維持したいときに有効です。オンにしたまま編集すると意図しない位置にラベルが動くことがあるため、作業内容に応じて切り替えましょう。
つまずきやすいポイントと対処法
ノイズ除去後に声がこもる
低減量を下げ、適用を2回に分けます。それでも改善しない場合は、録音環境を見直すほうが根本的です。マイクの背面に反射板を置く、PCのファンから離れる、といった対策は、ソフト側の処理より効果が大きいことがあります。
音量が小さいと言われる
話しているときのピークが低すぎる状態で録音している可能性があります。録音時に-12dB〜-6dBを確保し、編集ではラウドネス目標値に合わせて調整します。コンプレッションで持ち上げるのではなく、録音段階で適正レベルを確保するのが原則です。
BGMがうるさいと言われる
スマートフォンのスピーカーで確認すると、低域が再生されずBGMが小さく聞こえます。逆に、イヤホンで確認するとBGMが大きく感じられます。複数の再生環境で確認し、ナレーションの明瞭度を最優先に調整してください。
書き出したファイルが無音になる
トラックのミュート設定、ソロ設定、出力デバイスの選択ミスが主な原因です。また、書き出し範囲の選択が有効になっていると、意図した範囲外だけが出力されることがあります。
処理が重くて作業が進まない
長尺のプロジェクトでは、不要なトラックをまとめて1本にミックスしてから作業を続けると軽くなります。表示のズームを広げすぎない、スペクトル表示を常時オンにしない、といった工夫も有効です。
作業を仕組み化する:チェーン保存とマクロ
毎回同じ設定を手作業で再現するのは非効率です。Audacityにはエフェクトの適用順をまとめて保存するチェーン機能と、複数操作を記録して自動実行するマクロ機能があります。
たとえば「ノイズプロファイル取得後のノイズリダクション→ハイパス→EQ→コンプレッション→ノーマライズ」という流れを1つのチェーンとして保存しておけば、複数の動画を同じ品質で処理できます。シリーズものの動画を作る場合、音質の一貫性はチャンネルの信頼感に直結します。
ただし、マクロは録音環境や話し方の違いを考慮しません。素材ごとに強度を調整する前提で使い、適用後は必ず聴き直してください。
よくある質問
Q. 無料のソフトでプロ並みの音になりますか
録音環境と処理の順番を守れば、配信レベルとしては十分な品質に到達できます。差が出るのは機材より「録音時のレベル」と「ノイズの少ない環境」です。
Q. ノイズ除去は何回掛けてもよいですか
複数回に分けること自体は問題ありませんが、合計の低減量が大きくなりすぎると声質が変わります。最終的に自然に聞こえることを基準に判断してください。
Q. BGMの音量はどのくらいが適切ですか
ナレーションがある区間では、BGMを-18〜-24dB程度まで下げるのが目安です。数値よりも、スマートフォンのスピーカーで聞いてセリフが明瞭に聞こえるかを優先してください。
Q. モノラルとステレオのどちらで録音すべきですか
ナレーション単体はモノラルで録音し、編集時にステレオへ配置する方法が扱いやすいです。BGMや効果音はステレオのまま扱い、空間の広がりを残します。
Q. 書き出し形式はWAVとMP3のどちらがよいですか
動画編集ソフトに渡すマスターはWAV、確認用の共有はMP3やAACという使い分けが基本です。
Q. ラウドネスの目標値はどこを見ればよいですか
配信先のガイドラインを確認してください。配信先が自動で音量を調整する場合でも、目標値に近づけておくほうが意図したバランスを保ちやすくなります。
Q. チェーン機能はどこまで自動化できますか
音量調整やフィルター処理の再現に向いています。ノイズプロファイルの取得や、素材ごとの判断が必要な処理は手動で行う前提で使いましょう。
まとめ:公開前チェックリスト
最後に、書き出し前の確認項目をまとめます。
- ナレーションのピークが0dBを超えていないか
- ノイズ除去後にこもりや不自然な質感が出ていないか
- サ行の刺さりが気にならないか
- BGMがナレーションを邪魔していないか
- 効果音の音量がナレーションより下に収まっているか
- ラウドネス目標値とトゥルーピークに収まっているか
- ライセンス表記が必要な素材を記載したか
- 複数の再生環境(イヤホン、スマートフォン、PCスピーカー)で確認したか
音声編集は、派手な効果を加える作業ではなく、聞きづらさを取り除く作業です。Audacityの基本操作と処理の順番を身につければ、映像の出来をそのまま伝えられる土台が整います。まずは1本の動画で、録音から書き出しまでの流れを最後まで通してみてください。その経験が、次の動画の作業時間を確実に短くします。



