Warum Audio über Erfolg oder Misserfolg entscheidet
Zuschauer verzeihen erstaunlich viel. Ein leicht unscharfes Bild, ein wackeliger Schwenk, eine flache Farbkorrektur – all das fällt auf, aber es vertreibt kaum jemanden. Schlechter Ton dagegen vertreibt fast immer. Sobald eine Stimme dumpf klingt, die Musik das Sprechen übertönt oder Raumhall zwischen Sprecher und Publikum tritt, sinkt die Verweildauer, unabhängig davon, wie stark das Bild ist.
Das hat einen einfachen Grund: Bildinformation können wir wegsehen, Toninformation müssen wir hören. Ein dumpfer Satz lässt sich nicht überfliegen. Wer drei Sekunden braucht, um ein Wort zu entziffern, ist gedanklich schon ausgestiegen. Deshalb ist Audio kein Anhang der Videoproduktion, sondern ihr tragendes Element – besonders in erklärenden Formaten, Kursen, Produktdemos und Social-Clips.
Lange war professioneller Ton teuer. Studio, Sprecherin, Komponist, Mischung: Ein Erklärvideo mit mehreren Stimmen, Musikbett und Geräuschebene bedeutete mehrere Arbeitstage und ein Budget, das kleine Teams selten stemmen konnten. Mit synthetischen Stimmen und kuratierten Musikbibliotheken lässt sich derselbe Umfang heute in wenigen Stunden abbilden. Der Unterschied zwischen einem Ergebnis, das professionell wirkt, und einem, das nach Bastelprojekt klingt, liegt dabei fast nie am Werkzeug, sondern an der Methode. Dieser Leitfaden beschreibt den kompletten Weg: Stimmwahl, Skript, Generierung, Musikauswahl, Mischung, Qualitätskontrolle und Skalierung.
Der Audio-Stack: vier Ebenen mit unterschiedlichen Aufgaben
Wer Audioprobleme lösen will, muss wissen, welche Ebenen es überhaupt gibt. Vier sind es, und jede verfolgt ein eigenes Ziel. Verwechselt man sie, entstehen typische Fehler wie überlaut gewordene Musik oder eine Stimme, die eigentlich gut ist, aber im falschen Frequenzbereich kämpft.
Sprache
Die Sprachspur trägt die Information. Sie muss in erster Linie verständlich sein, danach erst schön. Verständlichkeit hängt weniger vom Mikrofonpreis ab als von drei Faktoren: Aufnahmeabstand, Rauschteppich und Konsistenz der Lautstärke über die gesamte Laufzeit. Genau hier scheitern die meisten Amateurproduktionen – einzelne Sätze sind zu leise, andere übersteuern, und der Zuschauer dreht ständig nach.
Musik
Musik steuert Emotion und Tempo. Sie sagt dem Publikum, ob eine Szene optimistisch, sachlich, dramatisch oder verspielt ist, noch bevor der erste Satz gesprochen wird. Gute Filmmusik für Videoinhalte ist unaufdringlich: Sie stützt, ohne Aufmerksamkeit zu fordern. Wenn jemand nach dem Ansehen die Melodie mitsummen kann, war sie in der Regel zu präsent.
Geräusche und Atmosphäre
Geräusche erzeugen Räumlichkeit. Ein Tastaturklick bei einer Software-Demo, ein leises Straßenrauschen bei einer Reportage, ein kurzer Übergangston bei einem Szenenwechsel – das sind kleine Signale, die dem Gehirn sagen, wo wir uns befinden. Ohne diese Ebene wirken selbst saubere Videos steril, wie in einem schalltoten Raum aufgenommen.
Mix und Ausgabe
Der Mix bringt die drei Ebenen in ein Verhältnis. Die Ausgabe verlangt unterschiedliche Lautheitswerte, denn Plattformen normalisieren unterschiedlich aggressiv. Wer diese Zielwerte ignoriert, liefert auf dem einen Gerät zu leise und auf dem anderen übersteuert aus.
Ein pragmatischer Startpunkt für die erste Mischung: Sprache klar im Vordergrund, Musik 15 bis 22 dB darunter, Geräusche situativ dosiert und nur an den Stellen, die räumliche Orientierung brauchen. Diese Zahlen sind kein Gesetz, aber ein zuverlässiger Ausgangspunkt, von dem aus man in zehn Minuten zu einem brauchbaren Ergebnis kommt.
KI-Stimmen auswählen: Kriterien statt Bauchgefühl
Die Stimmwahl ist die wichtigste Einzelentscheidung der gesamten Audioproduktion. Eine falsch gewählte Stimme lässt sich durch keinen Mix retten – und eine gut gewählte Stimme verzeiht erstaunlich viel Nachlässigkeit bei der Nachbearbeitung.
Stimmcharakter und Zielgruppe
Ordnen Sie die Stimme dem Publikum zu, nicht Ihrem persönlichen Geschmack. Eine B2B-Software-Schulung profitiert von einer ruhigen, mitteltiefen Stimme mit klarer Artikulation. Ein Fitness-Kanal braucht Energie, Tempo und Druck. Ein Kinderformat braucht Wärme, Dynamik und größere Tonhöhenschwankungen. Ein Finanzkanal braucht eine Stimme, die nüchtern bleibt, auch wenn die Zahlen spannend sind.
Prüfen Sie drei Kandidaten mit demselben Satz und entscheiden Sie nach dem Höreindruck auf einem Laptop-Lautsprecher, nicht nur über Kopfhörer. Ein großer Teil des Publikums hört mobil, oft über einen einzelnen kleinen Lautsprecher. Eine Stimme, die auf Studio-Kopfhörern brilliant klingt und auf dem Telefon dünn und zischelig wird, ist die falsche Wahl.
Emotion, Tempo und Pausen
Moderne Stimmmodelle arbeiten mit Parametern für Tempo, Tonhöhe, Stabilität und Ausdrucksstärke. Ein häufiger Fehler: maximale Ausdrucksstärke einstellen. Das Ergebnis klingt werblich und unglaubwürdig, weil die Betonungen gleichmäßig stark sind und dadurch nichts mehr betont wird. Für erklärende Inhalte liegt der bessere Weg meist bei mittlerer Ausdrucksstärke plus bewusst platzierten Pausen.
Setzen Sie nach wichtigen Aussagen 250 bis 500 Millisekunden Stille. Das wirkt wie ein Atemzug und gibt dem Zuschauer Zeit, den Gedanken aufzunehmen. Bei Aufzählungen funktionieren kürzere Pausen von 150 bis 250 Millisekunden. Am Ende eines Abschnitts dürfen es 600 bis 900 Millisekunden sein – dort darf der Zuschauer kurz durchatmen, bevor das nächste Thema beginnt.
Aussprache, Akronyme und Zahlen
Testen Sie jede Stimme mit den schwierigsten Stellen Ihres Skripts, nicht mit dem ersten Satz. Dazu gehören Produktnamen, Akronyme, englische Fachbegriffe in deutschem Satz, Zahlenfolgen, Einheiten und Abkürzungen. Schreiben Sie problematische Begriffe lautmalerisch um, wenn das Modell sie falsch betont: Aus „API“ wird dann etwa „A-P-I“, aus „24/7“ wird „vierundzwanzig sieben“, aus „10x schneller“ wird „zehnmal schneller“.
Bei Markennamen lohnt sich ein zentrales Aussprache-Glossar, das im Team gepflegt wird. Dort stehen Produktnamen in der Schreibweise, die das Modell korrekt betont, plus eine kurze Notiz zur Herkunft. So klingen Folgeproduktionen konsistent, und neue Teammitglieder müssen nicht raten.
Mehrsprachige Fassungen
Wer Videos in mehreren Sprachen veröffentlicht, sollte Lokalisierung nicht als Übersetzung behandeln, sondern als Neuschöpfung. Deutsche Sätze sind länger als englische, japanische oft kürzer und dichter. Ein Voiceover, das einfach übersetzt und mit gleicher Geschwindigkeit generiert wird, passt fast nie auf die Bildlängen.
Planen Sie pro Sprache einen eigenen Timing-Durchlauf und rechnen Sie mit 10 bis 25 Prozent Längenunterschied in beide Richtungen. Prüfen Sie jede Sprachfassung mit jemandem, der die Sprache muttersprachlich spricht. Ein Modell, das eine Sprache nur angelernt hat, produziert gelegentlich korrekte Wörter mit falscher Melodie – das fällt Muttersprachlern sofort auf, technisch geschulten Ohren oft nicht.
Workflow: vom Skript zum fertigen Voiceover
Dieser Ablauf hat sich in der Praxis bewährt und funktioniert sowohl mit menschlichen Sprecherinnen als auch mit synthetischen Stimmen.
Schritt 1: Skript fürs Hören schreiben
Ein Hörskript ist kein Lesetext. Kürzen Sie Nebensätze, vermeiden Sie verschachtelte Aufzählungen und ersetzen Sie Zahlen durch runde Werte, wo Präzision nicht nötig ist. Ein Satz sollte selten länger als etwa 20 Wörter sein, damit Sie später Bildschnitte sauber setzen können. Markieren Sie Pausen mit doppelten Absätzen und notieren Sie Betonungen, wenn Ihr Werkzeug das unterstützt.
Ein praktischer Test: Lesen Sie das Skript laut vor. Jede Stelle, an der Sie Luft holen müssen, ist eine Stelle, an der auch das Publikum eine Pause braucht. Jede Stelle, an der Sie stocken, ist eine Stelle, die stilistisch zu kompliziert ist.
Schritt 2: Testgenerierung und Auswahl
Erzeugen Sie die ersten 30 Sekunden mit zwei bis drei Stimmen und identischen Einstellungen. Vergleichen Sie nicht im schnellen Wechsel, sondern hören Sie jede Variante einmal komplett durch. Achten Sie auf drei Dinge: Verständlichkeit bei halber Lautstärke, Natürlichkeit der Übergänge zwischen den Sätzen und Konsistenz über den gesamten Ausschnitt. Erst danach entscheiden Sie – nicht nach dem ersten Eindruck der ersten drei Sekunden.
Schritt 3: Blockweise generieren
Teilen Sie das Skript in Blöcke von 60 bis 120 Wörtern pro Generierung. Kürzere Blöcke erzeugen stabilere Ergebnisse und lassen sich einzeln neu erzeugen, wenn eine Betonung misslingt. Längere Blöcke sparen Zeit, machen aber jede Korrektur teuer, weil immer der gesamte Block neu entsteht.
Wenn Sie Blöcke einzeln erstellen, normalisieren Sie anschließend die Lautstärke jedes Blocks auf denselben Zielwert. Sonst hört man an jeder Blockgrenze einen Sprung, der wie ein schlecht geklebter Filmschnitt wirkt.
Schritt 4: Nachbearbeitung
Auch die beste synthetische Stimme profitiert von drei Minuten Nachbearbeitung: ein Hochpass bei 80 bis 100 Hertz entfernt Rumpeln, ein sanfter De-Esser bei 5 bis 8 Kilohertz zähmt scharfe S-Laute, und ein Kompressor mit moderatem Verhältnis glättet Lautstärkeunterschiede innerhalb eines Satzes.
Wichtig: Atempausen nicht vollständig wegschneiden. Vollständig atmefreie Stimmen wirken künstlich und unangenehm, weil das Gehirn bei längeren Passagen unbewusst nach Atemzügen sucht. Bei synthetisch erzeugten Stimmen ist es oft sinnvoller, an einigen Stellen bewusst eine kurze Pause einzufügen, als störende Artefakte herauszuschneiden.
Schritt 5: Sync mit dem Bild
Legen Sie die Sprachspur zuerst in die Timeline, dann schneiden Sie das Bild darauf. Wenn Sie zuerst schneiden und dann vertonen, kämpfen Sie ständig gegen Versatz. Bei Bildern, die zu lang sind, kürzen Sie lieber Zwischenbilder als die Sprechgeschwindigkeit zu erhöhen. Sprechgeschwindigkeit ist Stimmung – sie sollte nicht das Ergebnis eines Schnittproblems sein.
Schritt 6: Abnahme mit fremden Ohren
Lassen Sie die Tonspur einmal von jemandem hören, der das Skript nicht kennt. Fragen Sie nicht „Klingt das gut?“, sondern „Was habe ich gesagt?“ Wenn die Person den Kerninhalt in einem Satz wiedergeben kann, ist die Tonspur verständlich. Wenn sie nachfragt, wo ein bestimmter Begriff stand, liegt dort ein Problem.
Lizenzfreie Musik strategisch einsetzen
Lizenzfreie Musik ist nicht kostenlose Musik, sondern Musik mit klaren, vorab geregelten Nutzungsrechten. Das ist der entscheidende Unterschied für Unternehmen, Agenturen und alle, die Inhalte für Kunden produzieren. Kostenlos heißt lediglich, dass kein Entgelt anfällt – über die erlaubte Verwendung sagt der Preis nichts aus.
Stimmung, Genre und Instrumentierung
Wählen Sie Musik nach der Emotion der Szene, nicht nach persönlichem Gefallen. Für sachliche Erklärvideos funktionieren reduzierte Arrangements mit wenig Melodie: Flächen, Puls, leichte Perkussion. Für emotionale Kundenstimmen eignen sich Klavier und Streicher, für Produktvorstellungen rhythmische Patterns mit klarer Steigerung, für Rückblicke oder Zusammenfassungen langsamere Stücke mit offenem Ende.
Tempo und Schnittrhythmus
Musik und Schnitt sollten atmen, nicht kämpfen. Ein Track mit 100 Beats pro Minute liefert etwa alle 0,6 Sekunden einen natürlichen Schnittimpuls. Wenn Ihr Rohschnitt deutlich langsamer oder schneller ist, klingt es immer nach Unruhe, auch wenn niemand die Ursache benennen kann. Suchen Sie entweder passende Musik zum Schnitt oder passen Sie die Schnittfrequenz an den Track an – nicht beides gleichzeitig.
Länge, Loops und Stems
Kaufen oder laden Sie Tracks in voller Länge plus Stems, wenn verfügbar. Mit Stems können Sie die Musik unter der Sprachspur auf ein Minimum reduzieren und in Übergängen anheben. Das klingt deutlich professioneller als pures Leiser-Drehen, weil die Instrumentierung konsistent bleibt.
Für lange Videos brauchen Sie Loops: Prüfen Sie, ob der Track an der Loop-Grenze sauber klingt, sonst entsteht ein hörbarer Sprung. Alternativ legen Sie zwei verschiedene Tracks hintereinander und verbinden sie mit einem kurzen Übergang, in dem die Sprache für zwei Sekunden pausiert.
Lizenzprüfung: vier Fragen vor dem Dreh
Lesen Sie die Lizenzbedingungen, bevor Sie produzieren, nicht danach. Relevant sind vier Fragen: Ist kommerzielle Nutzung erlaubt? Ist die Lizenz pro Projekt oder pro Kanal begrenzt? Muss der Urheber genannt werden? Und was passiert, wenn der Track später aus der Bibliothek genommen wird?
Bei Produktionen für mehrere Auftraggeber gehört eine kurze Lizenzübersicht in die Projektablage: Trackname, Quelle, Lizenzform, Datum des Downloads. Auf diese Weise können Sie Jahre später belegen, woher eine Spur stammt. Das ist keine Bürokratie, sondern Risikovorsorge – gerade wenn ein Kunde sein Video später als Werbemittel einsetzen will.
Mixing, Lautheit und Verständlichkeit
Die verbreitetsten Normalisierungswerte liegen für Social- und Videoplattformen bei etwa −14 LUFS integriert, für Podcast-Auslieferung bei −16 LUFS und für Broadcast bei −23 LUFS nach EBU R128. Diese Werte sind Zielkorridore, keine Geschmacksfragen: Wer zu leise ausliefert, wird von der Plattform hochgeregelt und klingt danach flach, wer zu lauter ausliefert, wird heruntergeregelt und verliert Transienten.
Ducking statt Handarbeit
Für das Verhältnis von Sprache und Musik ist Sidechain-Ducking das zuverlässigste Werkzeug. Sobald die Sprachspur einsetzt, senkt der Kompressor die Musik automatisch um 8 bis 15 dB ab und lässt sie in den Pausen zurückkehren. Das ist eleganter als manuelles Fahren und bei langen Videos deutlich schneller. Wenn Ihr Schnittprogramm kein Ducking bietet, setzen Sie die Musik in Sprachpassagen konsequent auf einen festen niedrigen Pegel und heben Sie sie nur in echten Pausen an.
Frequenzkonflikte auflösen
Sprache lebt zwischen 200 Hertz und 5 Kilohertz. Musik, die genau dort viel Energie hat – etwa ein dichtes Klavierbett oder ein volles Streicherarrangement – kämpft mit der Stimme, selbst wenn die Pegel rechnerisch stimmen. Die Lösung ist meistens nicht mehr Lautstärke, sondern ein anderer Track oder eine breite Absenkung der Musik um 2 bis 3 dB im Bereich von 1 bis 4 Kilohertz.
Mono-Kompatibilität prüfen
Ein erheblicher Teil des Publikums hört über einen einzelnen Telefonlautsprecher. Breite Stereoeffekte, die auf Kopfhörern beeindrucken, verschwinden dort oft vollständig. Prüfen Sie den Mix einmal in Mono. Wenn die Sprachspur dann nicht klar vorne steht, korrigieren Sie die Balance, bevor Sie exportieren.
Zielwerte dokumentieren
Legen Sie im Projekt fest, für welche Plattform die Hauptfassung gedacht ist. Ein Video, das primär auf einer Social-Plattform läuft, sollte auf deren Lautheit ausgelegt sein. Eine Zweitfassung für die Website oder für Präsentationen entsteht dann als separater Export mit angepasstem Pegel, nicht durch nachträgliches Lauterdrehen der Bildspur.
Drei Produktionsszenarien im Vergleich
Dieselben Werkzeuge, drei sehr unterschiedliche Anforderungen. Diese Gegenüberstellung hilft bei der Entscheidung, wie viel Aufwand welches Format wirklich braucht.
B2B-Erklärvideo, 90 Sekunden
Hier zählt Klarheit. Eine ruhige Stimme mit mittlerem Tempo, wenig Ausdrucksschwankungen, klar getrennte Absätze. Musik: eine reduzierte Fläche mit dezentem Puls, keine Melodie im Vordergrund, −20 dB unter der Sprache. Geräusche: ein bis zwei subtile Signale an Übergängen. Aufwand für den Ton: etwa zwei bis drei Stunden inklusive Nachbearbeitung. Kritischster Punkt ist die Aussprache von Produktnamen und Akronymen.
Social-Clip-Serie, 15 bis 30 Sekunden pro Folge
Hier zählt Aufmerksamkeit in den ersten zwei Sekunden. Schnelleres Sprechtempo, kantigere Betonung, Musik mit klarem Rhythmus, Pegel näher an der Sprache (−12 bis −15 dB), dafür kürzere Passagen, in denen die Sprache überhaupt läuft. Kritischster Punkt ist die Wiedererkennbarkeit: dieselbe Stimme, dasselbe Musikthema, dieselbe Pausenlänge über alle Folgen. Aufwand pro Clip: 30 bis 45 Minuten, wenn Vorlagen stehen.
Mehrsprachiges Kursmodul, 10 bis 20 Minuten
Hier zählt Konsistenz über lange Strecken. Ein festes Stimmprofil pro Sprache, gleichbleibender Pausenabstand, Musik, die über zwanzig Minuten nicht ermüdet – was meist bedeutet: sehr reduzierte Arrangements oder zwei bis drei Tracks, die thematisch zusammenpassen. Kritischster Punkt ist das Timing: Pro Sprache entsteht eine eigene Fassung, und die Bildlängen müssen für die längste Sprachversion funktionieren. Aufwand: ein bis zwei Stunden Nacharbeit pro zusätzlicher Sprache.
Typische Fehler und wie Sie sie vermeiden
Musik zu laut. Der häufigste Fehler überhaupt. Richten Sie sich an der Regel, dass Musik in Sprachpassagen nicht bewusst wahrgenommen werden soll. Wenn Kollegen die Melodie loben, ist sie meist zu präsent.
Stimme ohne Verschnaufpause. Generierte Sprache neigt zu konstanter Dichte. Bauen Sie Pausen ein, auch wenn das Skript sie nicht vorsieht.
Uneinheitliche Lautstärke über Blöcke. Prüfen Sie nach jeder Generierungssitzung die Pegel aller Blöcke nebeneinander, bevor Sie sie zusammenfügen.
Fachbegriffe falsch betont. Testen Sie schwierige Wörter, bevor Sie zwanzig Minuten Material produzieren, nicht danach.
Musik, die nicht zur Bildstimmung passt. Ein fröhlicher Track unter einer nachdenklichen Szene erzeugt unfreiwillige Ironie und untergräbt die Aussage.
Fehlende Geräuschebene. Reiner Sprach- und Musikton wirkt flach. Zwei oder drei subtile Atmosphärenspuren heben die wahrgenommene Qualität spürbar, ohne mehr Arbeit zu machen als eine Viertelstunde.
Export in falscher Lautheit. Stellen Sie den Zielwert vor dem Rendern ein, nicht danach. Nachträgliches Anpassen eines fertigen Exports kostet dieselbe Zeit und klingt schlechter.
Keine Versionierung. Sprecherwechsel, Musikänderungen und Textkorrekturen kommen immer. Arbeiten Sie mit klaren Dateinamen und Datumsstempeln, sonst liegt irgendwann die falsche Fassung im Schnitt.
Atemlosigkeit durch zu kurze Pausen. Wenn Sie Pausen nur deshalb kürzen, um auf eine Bildlänge zu kommen, verlieren Sie Verständlichkeit. Kürzen Sie stattdessen das Bild.
Qualitätskontrolle, Vorlagen und Skalierung
Checkliste vor dem Export
- Sprachspur auf Verständlichkeit bei 50 Prozent Lautstärke geprüft
- Alle Blöcke auf identischen Pegel normalisiert
- Musik unter Sprache hörbar abgesenkt, in Pausen zurückkehrend
- Atempausen erhalten, Störgeräusche entfernt
- Aussprache von Marken, Akronymen und Zahlen kontrolliert
- Mono-Kompatibilität geprüft
- Integrierte Lautheit auf Zielwert gebracht, True Peak unter −1 dBTP
- Lizenzinformationen für jede verwendete Spur dokumentiert
- Untertitel oder Transkript aus der finalen Tonspur erzeugt
- Export in allen benötigten Auflösungen und Seitenverhältnissen getestet
Vorlagen statt Einzelentscheidungen
Sobald der erste Durchlauf sitzt, geht es um Wiederholbarkeit. Legen Sie eine Audiovorlage an: eine Spurgruppe für Sprache mit fester Effektkette, eine für Musik mit Ducking-Seitenkette, eine für Geräusche. Definieren Sie zwei oder drei Stimmprofile mit festen Parametern für Tempo, Pausenlänge und Ausspracheregeln. Erstellen Sie ein Glossar für Produktnamen.
Für Serien lohnt sich ein Musiksystem statt einzelner Tracks: ein Hauptthema für den Einstieg, eine reduzierte Variante für Inhaltsabschnitte und eine kurze Auflösung für das Ende. Diese Konsistenz ist ein Wiedererkennungsmerkmal und senkt gleichzeitig die Auswahlzeit pro Folge erheblich – aus zwanzig Minuten Musiksuche werden zwei.
Bei mehrsprachigen Versionen empfiehlt sich eine feste Reihenfolge: Bildschnitt finalisieren, dann pro Sprache ein eigenes Sprachtiming erzeugen, dann Musik an die längste Sprachversion anpassen. Wer mit der kürzesten Sprache beginnt, muss später alles neu schneiden.
FAQ: häufige Fragen zu Stimmen, Musik und Mischung
Klingen synthetische Stimmen für professionelle Videos gut genug?
Für erklärende Inhalte, Schulungen, Produktdemos und Social-Clips ja. Kritischer wird es bei emotionalen Erzählformaten, in denen nuancierte Interpretation gefragt ist. Ein praktikabler Mittelweg: synthetische Stimme für den Hauptteil, menschliche Stimme für Intro und Schluss.
Brauche ich für jede Sprache eine eigene Stimme?
Idealerweise ja, und zwar mit Muttersprachlern als Referenz. Prüfen Sie jede Sprachversion mit jemandem, der die Sprache muttersprachlich spricht. Achten Sie dabei auf Melodie und Satzbetonung, nicht nur auf die Aussprache einzelner Wörter.
Wie lang sollte ein Voiceover-Block maximal sein?
60 bis 120 Wörter pro Generierung sind ein guter Korridor. Längere Blöcke sparen Zeit, machen aber Fehlerkorrekturen teuer, weil Sie den gesamten Block neu erzeugen müssen.
Reicht kostenlose Musik für kommerzielle Projekte?
Das hängt allein von der Lizenz ab, nicht vom Preis. Manche kostenlose Bibliotheken erlauben kommerzielle Nutzung ohne Nennung, andere verlangen Namensnennung oder schließen bestimmte Verwendungen aus. Prüfen Sie die Bedingungen pro Track und dokumentieren Sie sie im Projekt.
Wie vermeide ich, dass Musik und Sprache sich gegenseitig verdecken?
Arbeiten Sie mit Sidechain-Ducking statt manuellen Pegeländerungen, wählen Sie Arrangements mit wenig Energie im Bereich von 1 bis 4 Kilohertz und prüfen Sie den Mix einmal auf einem Telefonlautsprecher.
Was ist wichtiger: Stimme oder Musik?
Die Stimme. Musik ist Verstärkung, Sprache ist Inhalt. Wenn Sie zwischen einer besseren Stimme und einem besseren Track wählen müssen, entscheiden Sie sich für die Stimme und passen Sie die Musik später an.
Wie gehe ich mit Sonderzeichen und Zahlen im Skript um?
Schreiben Sie sie aus, wenn das Modell sie falsch interpretiert. Einheiten wie „km“ werden häufig zuverlässig gelesen, Abkürzungen wie „zzgl.“ fast nie. Testen Sie die kritischen Stellen in einem kurzen Ausschnitt, bevor Sie die ganze Produktion starten.
Lohnt sich eine eigene Geräuschebene wirklich?
Ja, sobald die Videos länger als eine Minute sind. Zwei bis drei dezente Atmosphärenspuren kosten wenig Zeit und lassen Produktionen deutlich hochwertiger wirken – besonders dann, wenn Bild und Sprache bereits sauber sind und der letzte Qualitätssprung fehlt.




