Audio ist der Teil einer Videoproduktion, der am häufigsten unterschätzt wird – und der am schnellsten auffällt, wenn er misslingt. Zuschauer verzeihen weiche Bilder, eine wackelige Kamerafahrt oder einen leicht unscharfen Hintergrund. Eine roboterhaft betonte Stimme, ein Lautheitssprung zwischen zwei Szenen oder eine Musik, die gegen die Erzählstimme ankämpft, führen dagegen fast immer zum Abbruch. Bei KI-gestützten Videos verschärft sich dieses Ungleichgewicht: Visuelle Modelle liefern heute in wenigen Minuten brauchbare Ergebnisse, während die Tonspur häufig aus Notlösungen zusammengesetzt wird.
Dieser Leitfaden beschreibt einen vollständigen, wiederholbaren Arbeitsablauf für Sprachaufnahme, Musik und Sounddesign in KI-gestützten Videos. Im Mittelpunkt stehen Entscheidungen, die sich tatsächlich auf das Ergebnis auswirken: Wie wählt man eine Stimme aus? Welche Parameter steuern Emotion und Verständlichkeit? Wie entsteht eine Musikspur, die die Erzählung trägt, statt sie zu übertönen? Und woran erkennt man, dass ein Mix wirklich fertig ist?
Warum Audio über Erfolg oder Misserfolg entscheidet
Bild und Ton werden vom Gehirn nicht als zwei getrennte Ströme verarbeitet. Sie verschmelzen zu einem einzigen Wahrnehmungseindruck. Passt die Stimme nicht zur Figur, wirkt selbst eine perfekt gerenderte Szene unglaubwürdig. Fehlt eine Klangfläche unter einer ansonsten stillen Einstellung, fühlt sich der Schnitt hart und unfertig an. Diese Wechselwirkung erklärt, warum professionelle Produktionen deutlich mehr Zeit in Audio investieren, als es von außen den Anschein hat.
Drei Eigenschaften bestimmen, ob eine Tonspur funktioniert:
- Verständlichkeit: Jedes Wort muss beim ersten Hören sitzen, auch auf einem Laptop-Lautsprecher, in der Küche oder im Auto.
- Emotionale Passung: Tempo, Tonhöhe und Klangfarbe müssen zur Aussage der Szene passen, nicht zur Bequemlichkeit des Werkzeugs.
- Kontinuität: Lautheit, Klangbild und Raum müssen über die gesamte Laufzeit stabil bleiben, auch über Schnittgrenzen hinweg.
Ein einfaches Beispiel macht den Unterschied deutlich. Zwei Videos zeigen dieselbe Produktdemo. Im ersten Video spricht eine hektische Stimme mit hoher Tonlage über eine treibende Synth-Fläche. Im zweiten Video spricht eine ruhige Stimme mit klaren Pausen über eine zurückhaltende Klangfläche, die während der Sprachpassagen leiser wird. Beide Videos enthalten dieselben Fakten. Das zweite bleibt im Kopf, weil der Ton die Aussage stützt statt mit ihr zu konkurrieren.
Ein zweiter Aspekt kommt hinzu: Skalierung. Sobald ein Format mehrfach pro Woche erscheint, reicht es nicht, einzelne Clips manuell zu vertonen. Es braucht Stimmenprofile, Musikvorlagen und feste Prüfschritte, damit die Qualität nicht von der Tagesform abhängt.
Der Audio-Workflow in fünf Phasen
Ein belastbarer Ablauf für KI-Videos gliedert sich in fünf Phasen. Die Reihenfolge ist entscheidend, weil jede Phase die nächste einschränkt.
1. Skriptanalyse und Sprechdauer. Bevor eine Stimme erzeugt wird, muss klar sein, wie lang der Text gesprochen dauert. Als Faustregel gelten 140 bis 160 Wörter pro Minute bei ruhiger Erzählung und 170 bis 190 Wörter pro Minute bei dynamischen Formaten. Wer die Wortzahl kennt, erkennt sofort, ob eine Szene überladen ist. Zu lange Sätze werden an dieser Stelle gekürzt, nicht später über einen schnelleren Tempo-Wert gestaucht. Rechnen Sie zusätzlich rund zehn Prozent der Laufzeit für Pausen ein.
2. Stimmauswahl und Stimmdesign. Hier wird entschieden, wie das Video klingt. Wichtiger als die reine Klangfarbe sind Sprechrhythmus, Pausenverhalten und die Fähigkeit, Betonungen glaubwürdig zu setzen. Legen Sie die Stimme fest, bevor Sie Musik aussuchen – nicht danach.
3. Musik und Atmosphäre. Erst nach der Stimmwahl entsteht die Musikspur, weil Tonhöhe und Frequenzband der Stimme bestimmen, in welchem Bereich die Musik Platz lassen muss. Ein tiefes männliches Stimmprofil benötigt andere Freiräume als eine helle Frauenstimme mit vielen Höhen.
4. Synchronisation und Timing. Bild, Stimme und Musikeinsätze werden auf gemeinsame Zeitmarken ausgerichtet. Hier entstehen die meisten Nacharbeiten: Ein Satz, der zwei Frames zu früh beginnt, wirkt asynchron, auch wenn Lippenbewegungen rechnerisch korrekt sind.
5. Mix und Kontrolle. Lautheit, Dynamik und Hörtests auf mehreren Geräten schließen den Prozess ab.
Für ein drei- bis fünfminütiges Video sind das realistisch zwei bis drei Stunden Arbeit, wenn Vorlagen und Stimmprofile bereits existieren. Beim ersten Durchlauf dauert es deutlich länger – vor allem die Stimmauswahl. Planen Sie deshalb für das erste Projekt eines Formats die doppelte Zeit ein und behandeln Sie diese Zeit als Investition: Die gewählte Stimme und die angelegten Vorlagen werden in allen folgenden Folgen wiederverwendet.
KI-Stimmen auswählen und steuern
Die meisten Werkzeuge zur Stimmensynthese bieten heute eine verwirrende Zahl an Reglern. In der Praxis entscheiden jedoch nur wenige Parameter über die Qualität.
Fünf Entscheidungskriterien für die Stimme
- Klangfarbe: Passt die Stimme zur Zielgruppe und zum Thema? Eine warme, tiefe Stimme trägt erklärende Inhalte, eine hellere und schnellere Stimme passt zu kurzen, dynamischen Formaten.
- Sprechrhythmus: Wirkt die Stimme gleichmäßig oder mechanisch? Hören Sie drei Sätze hintereinander und achten Sie darauf, ob die Abstände zwischen den Wörtern variieren.
- Pausenverhalten: Setzt die Stimme an Satzgrenzen hörbare Pausen oder läuft sie durch? Durchlaufende Stimmen klingen auf Dauer ermüdend.
- Betonungsfähigkeit: Kann die Stimme ein einzelnes Schlüsselwort hervorheben, ohne ins Übertriebene zu kippen?
- Konsistenz: Bleibt die Stimme über mehrere Absätze und über mehrere Videos hinweg identisch? Testen Sie mit demselben Textabschnitt an zwei verschiedenen Tagen.
Wer diese fünf Punkte vor der Produktion prüft, spart später Stunden. Der häufigste Fehler ist, eine Stimme nur anhand eines einzelnen Satzes auszuwählen und die Entscheidung nach der ersten kompletten Folge zu bereuen.
Emotion, Tempo und Pausen: die richtige Reihenfolge
Emotion entsteht nicht durch einen einzelnen Regler, sondern durch das Zusammenspiel von Tempo, Tonhöhenverlauf und Pausenlänge. Ein häufiger Anfängerfehler ist, alle drei gleichzeitig zu verändern – danach ist nicht mehr nachvollziehbar, welcher Eingriff gewirkt hat. Arbeiten Sie in dieser Reihenfolge:
- Tempo auf einen Wert setzen, der zur Szene passt: ruhig bei Erklärstücken, schneller bei Trailern und Ankündigungen.
- Pausenlänge separat justieren. Eine zusätzliche halbe Sekunde vor einem Fazit kann mehr bewirken als jede Tonhöhenänderung.
- Erst danach die Betonung einzelner Schlüsselwörter nachschärfen.
Notieren Sie die finalen Werte. Diese Notiz ist der Beginn Ihres Stimmprofils und die Grundlage dafür, dass Folge zwei bis zwanzig identisch klingen.
Aussprache, Akronyme und Fachbegriffe
Namen, Abkürzungen und Fachbegriffe sind die häufigste Fehlerquelle. Ein sauberer Workflow sieht vor, dass vor der Produktion eine Liste problematischer Begriffe entsteht: Firmennamen, Produktnamen, Akronyme, Fremdwörter, Ortsnamen. Diese Liste wird einmal korrekt hinterlegt und in jeder Folge wiederverwendet. Ohne diese Liste entstehen pro Ausgabe kleine Abweichungen, die im Rückblick wie Nachlässigkeit wirken – besonders dann, wenn dieselbe Marke in drei Videos unterschiedlich ausgesprochen wird.
Achten Sie außerdem auf Plosive (harte p, t, k) und Zischlaute (s, sch, z). Manche Stimmen betonen sie stärker als andere. Klingt ein Testdurchlauf hier auffällig, ist ein Wechsel der Stimme meist wirksamer als nachträgliches Entschärfen mit Filtern. Bei Zahlen gilt: Schreiben Sie Beträge, Jahreszahlen und Einheiten aus, wenn die Lesung sonst missverständlich wird. »1,5 Mio.« wird von manchen Stimmen als »ein Komma fünf Mio.« gelesen – »eineinhalb Millionen« ist eindeutig.
Mehrsprachige Fassungen und Lokalisierung
Für mehrsprachige Formate gilt: Nicht einfach den Text übersetzen und dieselbe Stimme verwenden. Satzlängen, Betonungsmuster und Höflichkeitsformen unterscheiden sich stark. Ein deutscher Satz mit 18 Wörtern kann in einer romanischen Sprache 24 Wörter benötigen und dadurch deutlich länger dauern. Planen Sie pro Sprachfassung einen eigenen Timing-Durchlauf und, wenn möglich, eine eigene Stimme mit passendem Akzent. Ein weiterer Punkt: Redewendungen und Humor übersetzen sich selten wörtlich. Prüfen Sie jede Fassung einmal mit jemandem, der die Zielsprache als Muttersprache spricht – nicht aus Formalität, sondern weil schiefe Betonungen in der Zielsprache sofort auffallen.
Generative Musik und Sounddesign
Musik in Videos hat eine Aufgabe: Sie trägt die Erzählung. Sie ist kein dekorativer Hintergrund und kein Testfeld für Klangideen.
Von der Endlosschleife zur Dramaturgie
Generative Musikwerkzeuge liefern oft brauchbare Loops, aber kaum dramaturgische Bögen. Die Lösung liegt in der manuellen Strukturierung: Teilen Sie das Video in Abschnitte – Einstieg, Aufbau, Wendepunkt, Auflösung – und vergeben Sie für jeden Abschnitt eine klare musikalische Funktion. Ein ruhiges Pad für den Einstieg, ein zusätzliches Rhythmus-Element im Aufbau, ein kurzer Energieabbruch vor dem Fazit, ein wiederkehrendes Motiv im Abschluss. Schon drei bis vier solcher Entscheidungen heben eine Tonspur deutlich vom Durchschnitt ab.
Ein Beispiel: Ein fünfminütiges Erklärvideo über ein Software-Werkzeug wirkt mit einer durchgehenden Klangfläche monoton. Mit einem Wechsel alle 25 bis 35 Sekunden – mal nur Bass, mal Bass plus hohe Fläche, mal kurze Stille – entsteht der Eindruck von Bewegung, obwohl die Musik aus nur zwei Bausteinen besteht.
Übergänge, Stingers und Stille
Übergänge sind der sichtbarste Qualitätsmarker. Ein harter Musikwechsel mitten in einem Satz klingt unfertig. Bewährt haben sich:
- Crossfades von ein bis zwei Sekunden zwischen Abschnitten.
- Stingers – kurze, akzentuierte Klänge für Pointen, Szenenwechsel oder Einblendungen.
- Bewusste Stille vor wichtigen Aussagen. Zwei Sekunden ohne Musik erzeugen mehr Aufmerksamkeit als jede Steigerung.
Stille ist das am seltensten genutzte Werkzeug im Sounddesign und gleichzeitig eines der wirksamsten. Ein weiteres unterschätztes Element sind leise Atmosphären: Raumklang, ein entferntes Geräusch, ein leises Rauschen. Sie füllen Lücken, ohne mit der Stimme zu konkurrieren, und machen einen Schnitt weicher.
Bibliothek oder generativ erzeugte Musik?
| Kriterium | Lizenzierte Bibliothek | Generativ erzeugte Musik |
|---|---|---|
| Kontrolle über Struktur | hoch, fertige Schnitte | mittel bis hoch, abhängig vom Werkzeug |
| Zeitaufwand pro Video | gering | mittel, oft mehrere Versuche nötig |
| Einzigartigkeit | gering, Titel können mehrfach auftauchen | hoch |
| Wiedererkennbarkeit über Folgen | schwierig | gut, wenn ein eigenes Motiv definiert wird |
| Klangqualität | gleichbleibend | schwankt stark zwischen Durchläufen |
Für Formate mit hoher Frequenz ist eine Mischung praktisch: eine kleine kuratierte Bibliothek für Routineabschnitte und generative Musik für Titel, Übergänge und Schlüsselmomente.
Synchronisation und Timing
Bei KI-Videos mit sprechenden Figuren ist Synchronisation ein eigenes Arbeitsfeld. Drei Ebenen sind zu unterscheiden:
- Grobe Synchronität: Die Sprachspur startet im richtigen Moment. Das lässt sich über Zeitmarken im Schnitt lösen.
- Feinsynchronität: Betonungen fallen mit sichtbaren Mundbewegungen zusammen. Hier hilft es, Sätze in kürzere Einheiten zu zerlegen und einzeln zu platzieren.
- Atmosphärische Synchronität: Musik und Geräusche folgen der Bilddramaturgie, nicht nur dem Text. Ein Türenschlag braucht einen Klang, ein Schnitt auf eine neue Location braucht einen Übergang.
Praktisch bewährt hat sich ein zweistufiger Ansatz: Zuerst wird die Tonspur fertiggestellt und in der Länge fixiert. Erst danach wird das Bild darauf ausgerichtet – nicht umgekehrt. Wer zuerst das Bild schneidet und dann die Stimme hineinquetscht, verbringt Stunden mit Mikrokorrekturen und kürzt am Ende Sätze, die inhaltlich wichtig sind.
Ein nützlicher Trick: Erstellen Sie eine Referenzspur mit einer gleichmäßigen Zeitmarkierung (Klick alle zwei Sekunden) und legen Sie sie beim Feinschnitt stummgeschaltet unter das Projekt. Einsätze lassen sich damit deutlich präziser setzen, weil das Gehör einen festen Bezugspunkt hat. Alternativ arbeiten Sie mit einer Tabelle, in der jede Zeile eine Sprecheinheit mit Start- und Endzeit markiert.
Mix, Lautheit und Frequenzmanagement
Der Mix entscheidet darüber, ob eine gute Aufnahme auch gut ankommt. Drei Größen sind zentral:
Lautheit. Für Web-Videos ist ein integrierter Wert um -14 LUFS ein guter Ausgangspunkt, bei stark komprimierten Plattformen eher -16 LUFS. Entscheidend ist nicht der exakte Wert, sondern die Konsistenz über mehrere Videos hinweg. Ein Kanal, der zwischen -9 und -18 LUFS schwankt, zwingt Zuschauer zum Nachregeln.
Dynamik. Sprachspuren profitieren von einer sanften Kompression, die leise Passagen anhebt, ohne laute zu verzerren. Zu starke Kompression macht die Stimme flach und anstrengend – ein Effekt, der auf Dauer wie Werbung klingt.
Frequenzmanagement. Stimmen belegen meist den Bereich zwischen 100 Hz und 8 kHz. Musik sollte dort Platz lassen, besonders zwischen 1 und 4 kHz, wo Sprache ihre Verständlichkeit hat. Ein einfacher Test: Musik um 3 dB absenken und prüfen, ob die Stimme plötzlich klarer wirkt. Wenn ja, war die Musik vorher zu laut. Ein zweiter Test: das Video einmal nur mit Kopfhörern auf einem Ohr hören. Bleibt die Sprache verständlich, sitzt der Mix.
Hörtests sollten immer auf mindestens drei Geräten erfolgen: Kopfhörer, Laptop-Lautsprecher und Smartphone. Wer nur auf Studiomonitoren abhört, verliert den Kontakt zur Realität des Publikums – und die meisten Zuschauer hören über kleine, bassarme Lautsprecher.
Werkzeugkette für die Praxis
Es gibt keinen Grund, den gesamten Werkzeugkasten gleichzeitig einzusetzen. Bewährt hat sich eine schlanke Kette:
- Stimmensynthese: ElevenLabs, PlayHT, Speechify oder vergleichbare Dienste für konsistente Sprecherprofile.
- Sprachreinigung: Descript oder Adobe Podcast Enhance für Rauschentfernung und Nachbearbeitung.
- Musik und Klangflächen: Suno, Udio, Stable Audio oder lizenzierte Bibliotheken, je nach gewünschter Kontrolle.
- Schnitt und Mix: DaVinci Resolve, Reaper oder Audacity für die Endbearbeitung.
- Lautheitskontrolle: Auphonic oder die integrierten Analysewerkzeuge der Schnittsoftware.
Wichtiger als die Werkzeugwahl ist die Reihenfolge: Stimme zuerst, Musik danach, Mix zuletzt. Viele Einsteiger beginnen mit der Musik, weil sie schneller ein ansprechendes Ergebnis liefert – und kämpfen anschließend damit, die Stimme darüber hörbar zu machen. Für Einzelpersonen reicht eine Kette aus drei Werkzeugen: Synthese, Schnitt, Lautheitskontrolle. Teams profitieren zusätzlich von einer gemeinsamen Ablage mit klaren Dateinamen, damit niemand versehentlich eine veraltete Sprachfassung einbaut.
Typische Fehler und Gegenmaßnahmen
Die folgenden Probleme tauchen in fast jedem Projekt auf, das ohne Audioerfahrung entsteht:
- Monotone Dauerbetonung: Alles klingt gleich wichtig. Gegenmaßnahme: Schlüsselwörter im Skript markieren und nur diese betonen.
- Überlange Musikschleifen: Nach 40 Sekunden wirkt derselbe Loop ermüdend. Gegenmaßnahme: Abschnittswechsel alle 20 bis 30 Sekunden.
- Fehlende Stille: Dauerbeschallung ohne Pausen. Gegenmaßnahme: Vor jedem Fazit zwei Sekunden Musik aussetzen.
- Lautheitssprünge zwischen Szenen: Unterschiedliche Quellen. Gegenmaßnahme: Alle Spuren auf einen gemeinsamen Referenzwert normalisieren.
- Zu laute Musik unter Sprache: Häufigster Anfängerfehler. Gegenmaßnahme: Musik während Sprachpassagen um 6 bis 10 dB absenken.
- Keine Hörtests auf Mobilgeräten: Der Mix klingt nur im Studio gut. Gegenmaßnahme: Drei-Geräte-Test als Pflichtschritt.
- Text zu lang für die Szene: Gegenmaßnahme: Kürzen statt beschleunigen.
- Inkonsistente Stimmen über Folgen hinweg: Gegenmaßnahme: Stimmprofil dokumentieren und wiederverwenden.
- Fehlende Raumwechsel: Jede Szene klingt akustisch identisch. Gegenmaßnahme: Innenräume, Außenräume und Übergänge unterschiedlich behandeln.
- Effekte als Selbstzweck: Verzerrungen und Filter ohne Funktion. Gegenmaßnahme: Jeden Effekt mit einer Begründung versehen – sonst entfernen.
Ein einfacher Gegencheck: Hören Sie das Video einmal nur mit geschlossenen Augen. Wenn Sie dabei den roten Faden verlieren, liegt es meist nicht am Bild. Ein zweiter Gegencheck: Spulen Sie zu einer beliebigen Stelle und prüfen Sie, ob Sie nach zwei Sekunden wissen, worum es gerade geht. Ist das nicht der Fall, fehlt eine musikalische oder atmosphärische Orientierung.
Skalierung, Vorlagen und Zusammenarbeit im Team
Sobald ein Format regelmäßig erscheint, entscheidet Struktur über Qualität. Drei Maßnahmen zahlen sich schnell aus:
1. Ein Audio-Styleguide. Kurz dokumentiert: Welche Stimme, welches Tempo, welche Ziel-Lautheit, welche Musikrichtung, welche Pausenlängen, welche Ausspracheregeln. Zwei Seiten genügen. Dieser Guide ist die einzige verlässliche Methode, damit Folge zwölf klingt wie Folge eins.
2. Eine Asset-Bibliothek. Musikbetten, Stingers, Atmosphären und Übergänge werden einmal kuratiert und nach Stimmung benannt – etwa »ruhig-erklaerend«, »spannungsaufbau«, »abschluss-fazit«, »wechsel-schnell«. Wer durch solche Namen sucht statt durch Dateinummern, findet in Sekunden das passende Element.
3. Ein festes Prüfraster. Vor der Veröffentlichung werden Verständlichkeit, Lautheit, Synchronität, Musikpegel und Mobiltauglichkeit geprüft. Wer diesen Schritt überspringt, merkt Fehler erst in den Kommentaren.
Für Teams lohnt sich außerdem eine klare Rollenverteilung: Eine Person verantwortet Skript und Sprechdauer, eine andere Musik und Mix. Die häufigste Ursache für Verzögerungen ist nicht fehlende Technik, sondern unklare Zuständigkeit für den finalen Mix. Legen Sie fest, wer das letzte Wort hat – sonst wird der Mix von mehreren Personen in unterschiedliche Richtungen gezogen.
FAQ
Wie viele Wörter pro Minute spricht eine KI-Stimme?
Bei ruhiger Erzählung etwa 140 bis 160 Wörter pro Minute, bei dynamischen Formaten bis zu 190. Rechnen Sie für Pausen zusätzlich zehn Prozent der Laufzeit ein.
Kann ich eine einmal gewählte Stimme langfristig konsistent nutzen?
Ja, sofern Sie ein festes Profil mit dokumentierten Einstellungen anlegen. Notieren Sie Stimme, Tempo-Wert, Pausenlänge und Betonungsregeln, damit jede Folge identisch klingt. Testen Sie das Profil vor dem ersten Serienstart an einem vollständigen Skript, nicht nur an einem Satz.
Wie laut sollte Musik unter einer Sprachspur liegen?
Als Ausgangspunkt sechs bis zehn Dezibel unter der Stimme. Bei dichten Arrangements mit vielen Höhen eher zehn Dezibel, bei ruhigen Klangflächen weniger. Entscheidend ist der Hörtest, nicht der Zahlenwert.
Was hilft gegen harte Zischlaute und Plosive?
Zuerst ein Stimmwechsel, danach ein sanfter De-Esser. Vermeiden Sie aggressive Filter, sie lassen die Stimme schnell künstlich klingen – und dieser Effekt zieht Aufmerksamkeit auf das Werkzeug statt auf den Inhalt.
Brauche ich einzelne Spuren oder reicht eine Summe?
Arbeiten Sie immer mit getrennten Spuren für Stimme, Musik und Geräusche. Nur so lassen sich Lautheit und Timing später ohne Neuproduktion anpassen. Eine reine Summenspur ist der häufigste Grund, warum kleine Änderungen zu kompletten Neubauten werden.
Wie gehe ich mit Nutzungsrechten für Musik um?
Prüfen Sie die Lizenzbedingungen jedes eingesetzten Werkzeugs und jeder Bibliothek vor der Veröffentlichung. Bei generativ erzeugter Musik lohnt es sich, die Bedingungen einmal schriftlich festzuhalten, damit spätere Formate nicht jedes Mal neu bewertet werden müssen.
Wie lange sollte ich für den Mix einplanen?
Für ein dreiminütiges Video sind 30 bis 60 Minuten realistisch, wenn Vorlagen existieren. Beim ersten Projekt eher das Doppelte. Wer den Mix auf fünf Minuten am Ende schiebt, produziert genau die Fehler, die Zuschauer zum Abschalten bringen.
Woran erkenne ich, dass die Tonspur fertig ist?
Wenn Sie das Video zweimal hintereinander ansehen können, ohne über den Ton nachzudenken. Sobald die Tonspur auffällt, ist sie noch nicht fertig – unabhängig davon, wie viele Stunden bereits darin stecken.
Was mache ich, wenn die Szene einfach zu kurz für den Text ist?
Kürzen Sie den Text oder verlängern Sie das Bild. Beides ist besser als eine Beschleunigung, die den Inhalt unverständlich macht. Wenn beides nicht möglich ist, teilen Sie die Aussage auf zwei Szenen auf.
Eignet sich derselbe Musikbaustein für Erklärvideo und Trailer?
Nur mit anderer Instrumentierung und anderem Tempo. Ein Baustein kann über viele Formate hinweg ein Wiedererkennungszeichen werden, wenn seine Funktion klar definiert ist: ruhige Fläche für Erklärung, Rhythmus plus Akzent für Ankündigungen.
Abschluss-Checkliste für die nächste Produktion
Vor der Veröffentlichung prüfen Sie in dieser Reihenfolge: Ist die Sprache auf einem kleinen Lautsprecher beim ersten Hören verständlich? Bleibt die Lautheit über alle Szenen stabil? Sitzen Musikeinsätze auf Satzgrenzen und nicht mitten in Wörtern? Gibt es mindestens eine bewusste Stille im Video? Bleibt die Stimme identisch mit der vorherigen Folge? Sind alle problematischen Begriffe korrekt ausgesprochen? Wurde auf drei Geräten gehört?
Wer diese Punkte als festen Ablauf etabliert, produziert Videos, bei denen der Ton nicht auffällt – und genau das ist das Ziel. Gute Tonspuren ziehen keine Aufmerksamkeit auf sich. Sie sorgen dafür, dass die Aufmerksamkeit dort bleibt, wo sie hingehört: bei der Geschichte.



