Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

KI-Stimmen und Musik: Audio-Workflow für Videoprojekte

Oct 7, 2026

Warum der Ton das Ergebnis entscheidet

Wer regelmäßig Videos produziert, kennt den Moment, in dem ein Projekt plötzlich fertig wirkt – und er hängt selten am Bild. Er hängt daran, dass Stimme, Musik und Atmosphäre eine Szene gemeinsam tragen, statt nebeneinanderher zu laufen. Ein visuell beeindruckender Clip mit knisternder Sprachspur, einem Musikbett, das jeden Satz übertönt, und abgeschnittenen Satzanfängen wirkt wie ein Entwurf. Ein technisch einfacher Clip mit klarer Stimme, bewusst gesetzten Pausen und zurückhaltender Musik wirkt wie ein fertiges Produkt.

Guter Ton erfüllt vier Aufgaben gleichzeitig:

  • Verständlichkeit: Jede Aussage muss beim ersten Hören ankommen. Wer zurückspulen muss, um einen Satz zu verstehen, springt ab.
  • Emotion: Musik und Stimmklang bestimmen, wie sich eine Szene anfühlt. Dieselben Bilder wirken mit Streichern dramatisch und mit einem tiefen Synth-Bass bedrohlich.
  • Glaubwürdigkeit: Konsistente Stimmen und ein gleichmäßiges Klangbild signalisieren Sorgfalt. Wechselnde Stimmen und schwankende Lautstärken signalisieren das Gegenteil.
  • Rhythmus: Musik und Pausen geben dem Schnitt einen Takt. Ohne diesen Takt wirkt selbst ein sauber geschnittenes Video zufällig.

In der Praxis läuft es oft anders: Der größte Teil der Produktionszeit fließt in Bilder, Prompts und Schnitt, während der Ton in den letzten zwei Stunden entsteht. Diese Reihenfolge erzeugt die typischen Probleme – eine Stimme, die nicht mehr passt, wenn die Szene fertig ist; Musik, die nachträglich unter einen zu dichten Sprechtext gedrückt wird; Geräusche, die fehlen, weil niemand mehr Zeit dafür hat.

Drei Fragen sollten deshalb vor dem ersten generierten Bild beantwortet sein: Wie lang ist jeder Abschnitt des Videos ungefähr? Wer spricht, mit welcher Haltung und in welcher Sprache? Wo darf Stille stehen, und wo muss Musik tragen? Wer diese drei Fragen beantwortet, produziert am Ende schneller, nicht langsamer.

Die drei Ebenen einer Tonspur

Die meisten Audioprobleme in Videoprojekten entstehen nicht durch fehlendes Können, sondern durch Vermischung. Wer Sprache, Musik und Geräusche in eine einzige Datei rendert, kann später nichts mehr austauschen, ohne von vorn zu beginnen. Deshalb gilt: drei Ebenen, drei Spuren, getrennt bis zum finalen Mix.

Ebene 1: Sprache

Die Sprachspur trägt die Information. Sie besteht aus einer oder mehreren Stimmen, möglicherweise in mehreren Sprachen, und muss über alle Szenen hinweg konsistent klingen. Entscheidende Merkmale sind Timbre, Sprechtempo, regionale Färbung, Emotionalität und Lautstärke. Ein häufiger Fehler: Für jede Szene wird neu generiert, und plötzlich klingt das Video, als hätten fünf verschiedene Personen gesprochen.

Ebene 2: Musik

Musik trägt die Dramaturgie. Sie setzt Akzente, überbrückt Schnitte und baut Spannung auf, bevor ein Bild sie erklärt. Musik ist selten durchgehend nötig. Oft ist sie in den ersten Sekunden präsent, in Erklärpassagen deutlich reduziert oder ganz abwesend und im Finale wieder stärker.

Ebene 3: Atmosphäre und Geräusche

Raumklang, Stadtlärm, Schritte, Klicks und Übergangsgeräusche machen aus einer Bildfolge eine Szene. Diese Ebene wird am häufigsten vergessen, weil sie unsichtbar wirkt – und sie ist die wirksamste, wenn Szenen sonst flach klingen. Ein leiser Raumhall unter der Stimme entfernt das Gefühl, in einem schalltoten Raum zu stehen.

Ebene Aufgabe Typisches Warnsignal
Sprache Information, Haltung, Verständlichkeit Stimme kippt nach dreißig Sekunden, Aussprache bricht bei Fachwörtern
Musik Dramaturgie, Übergänge, Tempo Musik konkurriert mit der Stimme oder endet abrupt
Atmosphäre Räumlichkeit, Realismus, Übergänge Szenen klingen leer oder wie aneinandergeklebte Bilder

Der Nutzen der Trennung zeigt sich erst, wenn sich etwas ändert. Ein Beispiel: Der Kunde wünscht einen neuen Schlusssatz. Mit getrennten Spuren ersetzt du einen Absatz, renderst die Sprachspur neu und exportierst – zehn Minuten Arbeit. Ohne Trennung beginnt das Projekt von vorn.

Vom Skript zur Sprechspur

Das Skript ist in einem KI-gestützten Video kein Textdokument, sondern ein Audio-Drehbuch. Wer diesen Unterschied ignoriert, schreibt Sätze, die gelesen brillant und gesprochen unbrauchbar sind.

Skript fürs Hören schreiben

Für Sprachsynthese gelten zusätzliche Regeln:

  • Kurze Sätze. Ein Nebensatz pro Hauptsatz reicht.
  • Keine verschachtelten Aufzählungen innerhalb eines Satzes.
  • Zahlen ausschreiben oder in eine eindeutige Form bringen.
  • Abkürzungen beim ersten Vorkommen ausschreiben.
  • Fachbegriffe so platzieren, dass die Betonung eindeutig ist.

Ein Beispiel: „Die Plattform unterstützt 21 Formate, darunter 4K, HDR sowie vertikale Varianten für Social Media.“ Gesprochen stolpert dieser Satz. Besser: „Die Plattform unterstützt einundzwanzig Formate. Dazu gehören 4K, HDR und vertikale Formate für Social Media.“ Derselbe Inhalt, zwei Sätze, keine Stolperstelle.

Ein bewährter Test: Lies jeden Absatz laut vor. Wenn du stolperst, stolpert die synthetische Stimme an derselben Stelle – oder sie klingt mechanisch, weil die Satzmelodie keine natürliche Pause findet.

Stimmen testen statt Demos anhören

Teste eine Kandidatenstimme nicht mit dem Beispielsatz aus der Vorschau, sondern mit dem schwierigsten Satz deines Skripts. Achte auf vier Dinge:

  • Aussprache von Eigennamen, Marken und Fachwörtern
  • Umgang mit Zahlen, Einheiten und Sonderzeichen
  • Klang bei kurzen Ausrufen wie „Genau.“ oder „Achtung.“
  • Stabilität über längere Absätze: Wird die Stimme lauter, hektischer oder monotoner?

Wenn eine Stimme nach dreißig Sekunden zu kippen beginnt, ist sie für lange Formate ungeeignet – unabhängig davon, wie gut die Vorschau klingt. Prüfe außerdem, ob dein Werkzeug dieselbe Stimme in mehreren Sprachen anbietet. Das ist für Serien wichtiger als jede einzelne Klangfarbe.

Haltung statt Perfektion

Eine Stimme kann technisch makellos sein und trotzdem nicht funktionieren, weil die Haltung nicht zum Video passt. Ein Erklärvideo braucht eine ruhige, sachliche Sprechweise; ein Produktlaunch darf enthusiastischer klingen; ein Dokumentationsclip eher nüchtern. Definiere die Haltung in einem Satz, bevor du generierst: „freundlich, aber nicht werblich“, „sachlich, mit kurzen Pausen“, „erzählend, langsam“. Diese eine Zeile verhindert, dass du zwanzig Varianten testest, ohne zu wissen, wonach du suchst.

Tempo, Pausen und Betonung steuern

Die meisten Sprachwerkzeuge nutzen Satzzeichen als Steuerungselemente. Ein Komma erzeugt eine kurze Pause, ein Punkt eine längere, ein Gedankenstrich oft eine dramatische. Zusätzlich lassen sich Sprechtempo und Tonhöhe abschnittsweise anpassen. Vorsicht: Kleine Änderungen wirken natürlich, große klingen nach Effekt.

Format Wörter pro Minute
Ruhiger Imagefilm, Erklärvideo 120–140
Standard-Erklärvideo 140–155
Social-Clip mit hohem Tempo 160–180
Hörbuchartige Erzählung 110–130

Für ein sechzig Sekunden langes Erklärvideo passen also etwa 140 bis 155 Wörter. Wer 220 Wörter unterbringen will, sollte nicht das Tempo erhöhen, sondern kürzen.

Mehrsprachige Fassungen planen

Wer Videos in mehreren Sprachen veröffentlicht, sollte die Sprachspur nicht Zeile für Zeile übersetzen. Deutsche Sätze sind länger als englische, japanische oft kürzer, spanische brauchen mehr Silben. Übersetze sinngemäß in Abschnitte, die in die gleiche Zeit passen, und prüfe, ob dieselbe Stimme in allen Sprachen verfügbar ist. Wenn nicht, wähle Stimmen mit ähnlichem Timbre, damit die Fassungen als Serie erkennbar bleiben.

Musik erzeugen, die zum Schnitt passt

Ein Prompt, der brauchbare Ergebnisse liefert

Ein guter Musik-Prompt beschreibt Genre, Instrumentierung, Tempo, Stimmung und Produktionscharakter. Statt „epische Musik“ also:

Ruhiger Neo-Klassik-Loop, Klavier und tiefe Streicher, siebzig Schläge pro Minute, hoffnungsvoll aber zurückhaltend, warmer Raumklang, ohne Schlagzeug, ohne Gesang.

Negative Angaben sind genauso wichtig: keine Vocals, keine plötzlichen Höhepunkte, keine dominanten Becken. Gerade in Hintergrundmusik zerstören Schlagzeug-Fills die Sprachverständlichkeit, weil sie genau in dem Frequenzbereich arbeiten, in dem Konsonanten sitzen.

Dramaturgie über die Timeline

Musik muss sich mit dem Video verändern. Eine bewährte Struktur:

  • Sekunde 0 bis 3: musikalischer Einstieg, oft der einzige Moment, der wirklich Aufmerksamkeit beanspruchen darf
  • Sekunde 3 bis 15: Reduktion auf ein oder zwei Instrumente unter der Stimme
  • Mittelteil: minimales Wachstum, alle zehn bis fünfzehn Sekunden eine neue Ebene
  • Finale: Rückkehr des Hauptmotivs und ein kurzer Schlussakzent
  • Outro: ausklingend oder harter Schnitt, passend zum Bildschnitt

Musik als Zeitgeber für den Schnitt

Musik ist nicht nur Kulisse, sondern ein metronomisches Werkzeug. Wenn du den Schnitt auf die Schwerpunkte der Musik legst, wirkt das Video automatisch rhythmischer: Bildwechsel auf einen Akzent, Textzeilen auf den Taktbeginn, Übergänge auf das Ende einer Phrase. Das funktioniert auch umgekehrt – wenn du zuerst schneidest und dann Musik suchst, achte darauf, dass Betonungen und Bildwechsel nicht gegeneinander arbeiten. Ein um wenige Zehntelsekunden verschobener Bildwechsel fällt beim Zuschauer als Unruhe auf, ohne dass er sagen könnte, warum.

Abschnitte statt Endlosschleife

Erzeuge lieber drei kurze Abschnitte von fünfzehn bis zwanzig Sekunden als ein fünfminütiges Stück, das du zurechtschneidest. Abschnitte lassen sich sauberer an Szenenwechsel anpassen, und du vermeidest die typische Nahtstelle, an der ein Loop hörbar neu anfängt.

Stems, Loops und Übergänge

Wenn dein Werkzeug Stems oder getrennte Einzelspuren exportiert, nutze sie. Du kannst dann die Schlagzeugspur stummschalten, während gesprochen wird, und im Übergang wieder einblenden. Ohne Stems bleibt nur Lautstärkeautomation – funktioniert, ist aber grober. Übergänge zwischen Musikabschnitten sollten zwischen einer halben und anderthalb Sekunden lang sein; kürzere wirken wie Fehler, längere wie Leerlauf.

Wann Musik schadet

Nicht jedes Video braucht Musik. Ein Interview, ein technisches Tutorial mit vielen Fachbegriffen oder eine Szene mit starkem Originalklang funktioniert oft besser mit Atmosphäre statt Melodie. Wenn du unsicher bist, exportiere zwei Fassungen: eine mit Musikbett, eine ohne, und entscheide nach dem Blick auf den stummen Bildschnitt.

Timing, Synchronisation und Schnittreihenfolge

Bei Audio für KI-Videos gibt es zwei grundsätzlich verschiedene Arbeitsweisen.

Voice-first

Du erzeugst zuerst die Sprachspur und baust die Szenenlängen darum. Vorteil: Der Ton ist immer natürlich, Pausen sitzen, nichts wird gestaucht. Nachteil: Du musst beim Generieren der Bilder bereits wissen, wie lang jede Szene wird.

Video-first

Die Szenen stehen bereits, und du passt den Ton an. Vorsicht: Eine Stimme um mehr als etwa zehn Prozent zu beschleunigen klingt fast immer künstlich. Besser ist es, Sätze zu kürzen als sie zu stauchen.

Der Mittelweg für Einsteiger

Erzeuge die Sprachspur zuerst, schneide dann die Bilder und passe am Ende nur noch kleine Lücken an. Diese Reihenfolge löst die meisten Timing-Probleme, bevor sie entstehen. Plane pro Szene etwa eine halbe Sekunde Reserve ein – diese Reserve verschwindet von selbst, wenn du später Atmosphäre und Übergänge einbaust.

Pausen als Schnittmarken

Eine bewusste Pause ist mehr als eine Lücke: Sie ist ein Schnittpunkt. Setze vor jedem neuen Gedanken eine halbe bis ganze Sekunde Stille, und du kannst den Bildwechsel genau dorthin legen. Ohne diese Pausen musst du entweder mitten in ein Wort schneiden oder den Übergang künstlich strecken. Wer sein Skript mit markierten Denkpausen schreibt, schneidet später schneller und muss weniger korrigieren.

Ein Beispiel mit zwei Sprachen

Angenommen, ein Produktclip läuft auf Deutsch 46 Sekunden. Die englische Fassung mit derselben Aussage braucht oft fünf bis zehn Prozent weniger Zeit, die französische tendenziell etwas mehr. Wenn du für jede Sprache separat schneidest, verlierst du den Wiedererkennungswert. Besser: identische Szenenlängen, leicht angepasstes Sprechtempo innerhalb der Toleranz und bei Bedarf ein bis zwei Sätze mehr oder weniger pro Abschnitt.

Mischen, Lautheit und Abhören

Reihenfolge im Mix

Erst hier laufen alle Ebenen zusammen. Bewährte Reihenfolge: Stimme zuerst ausbalancieren, dann Musik darunter einpassen, zuletzt Atmosphäre ergänzen. Diese Reihenfolge verhindert, dass du Musik laut drehst, weil die Stimme zu leise war. Ein weiterer Grundsatz: Arbeite mit Pegeln, die auch bei einem leisen Abhören funktionieren. Ein Mix, der nur bei hoher Lautstärke verständlich ist, verliert die halbe Zuhörerschaft.

Lautheit und Limiter

Für Web-Video haben sich Zielwerte um minus vierzehn LUFS integriert durchgesetzt, für reine Sprachformate um minus sechzehn LUFS. Wichtiger als der exakte Wert ist Konsistenz: Jede Folge und jedes Video sollte gleich laut sein. Ein True-Peak-Limit von minus einem dBTP verhindert Verzerrungen beim Kodieren.

Ducking und Frequenzmanagement

Ducking senkt die Musik automatisch, sobald gesprochen wird. Schlecht konfiguriert pumpt der Ton hörbar, gut konfiguriert ist er unsichtbar. Gute Startwerte: Absenkung um sechs bis neun Dezibel, Ansprechzeit um zehn Millisekunden, Freigabezeit um dreihundert bis fünfhundert Millisekunden. Zusätzlich hilft ein leichter Eingriff im Frequenzbereich: Wenn die Stimme zwischen zweihundert Hertz und vier Kilohertz sitzt, hält eine breite Absenkung um zwei bis drei Dezibel in der Musik diesen Bereich für die Sprache frei.

Abhören auf drei Systemen

Prüfe den Mix mindestens auf drei Wegen: Kopfhörer, Laptop-Lautsprecher und Smartphone. Der Smartphone-Test deckt zu leise Stimmen und zu dominante Bässe auf – und dort hört der Großteil des Publikums. Ein zweiter nützlicher Test: Höre den Mix einmal, ohne auf den Bildschirm zu sehen. Wenn du jedes Wort verstehst und die Musik nie stört, ist der Mix in Ordnung.

Exportformate und Sicherheitskopien

Exportiere die Sprachspur immer als unkomprimierte oder verlustfrei komprimierte Datei, auch wenn das Endvideo komprimiert ausgeliefert wird. Aus einer stark komprimierten Tonspur lässt sich später nichts mehr retten. Arbeite zusätzlich mit Versionsnummern: Sprachspur, Musikspur und Mix getrennt ablegen, jeweils mit Datum im Dateinamen. Wenn ein Kunde nach zwei Wochen eine Änderung wünscht, ist der Weg zurück zur Rohspur deutlich kürzer als der Weg zurück zum fertigen Video.

Workflow-Beispiel: ein Clip in sechs Etappen

Etappe Aufgabe Werkzeugkategorie Ergebnis
1 Skript fürs Hören umschreiben Texteditor 145 Wörter, abschnittsweise gegliedert
2 Stimme auswählen und Sprachspur erzeugen Sprachsynthese eine Audiodatei pro Absatz
3 Szenenlängen festlegen und Bilder erzeugen Videogenerator und Schnitt Rohschnitt mit Tonspur
4 Musik in drei Abschnitten erzeugen Musikgenerator getrennte Loops, nach Möglichkeit Stems
5 Atmosphäre und Übergänge ergänzen Geräuschbibliothek dritte Ebene unter der Stimme
6 Mix, Lautheit, Export Schnitt- oder Audioprogramm finales Video mit einheitlicher Lautheit

Der entscheidende Punkt ist Etappe 2. Wenn die Sprachspur sauber ist, sind alle folgenden Schritte reine Handwerksarbeit. Wenn sie es nicht ist, kämpfst du in jeder weiteren Etappe gegen dasselbe Problem.

Typische Fehler in diesem Ablauf

  • Musik zu laut gemischt. Im Sprachbereich sollte Musik nie konkurrieren.
  • Die Stimme pro Szene neu generiert. Das erzeugt hörbare Bruchstellen.
  • Sprechtempo als Lösung für zu viel Text. Kürze den Text statt zu beschleunigen.
  • Keine Stille zugelassen. Ein Video ohne Pausen wirkt gehetzt.
  • Musik abrupt beendet. Blende über eine halbe bis anderthalb Sekunden.
  • Nur auf Kopfhörern abgehört. Kopfhörer sind gnädig, Handy-Lautsprecher ehrlich.
  • Ebenen zu früh zusammengeführt. Danach lässt sich nichts mehr austauschen.
  • Sonderzeichen ignoriert. Ein Bindestrich oder eine Abkürzung kann eine korrekt klingende Stimme in eine unbeholfene verwandeln.
  • Musik nach Geschmack statt nach Funktion gewählt. Frage immer, welche Aufgabe der Abschnitt im Video hat.

Werkzeugkategorien und Auswahlkriterien

Du brauchst keine bestimmte Plattform, um diesen Workflow umzusetzen – du brauchst die richtigen Kategorien.

Sprachsynthese

Achte auf Stimmenvielfalt, Mehrsprachigkeit, Kontrolle über Tempo und Pausen, Exportformate und Konsistenz über lange Texte. Für Videos in mehreren Sprachen ist wichtig, dass dieselbe Stimme in mehreren Sprachen verfügbar ist; sonst klingt die zweite Fassung wie ein anderes Video.

Musikgenerierung

Achte auf instrumentale Ausgabe ohne Gesang, steuerbare Länge, Stems oder zumindest saubere Loops, klar geregelte Nutzungsrechte und die Möglichkeit, Stilreferenzen wiederzuverwenden. Eine Funktion, die Stile speichert, ist mehr wert als zwanzig zusätzliche Voreinstellungen, weil sie Konsistenz über eine Serie hinweg erzeugt.

Schnitt und Mix

Für einfache Projekte reicht ein Videoprogramm mit spurbasiertem Audio. Sobald Ducking, Kompression und Lautheitsnormalisierung gebraucht werden, ist eine kleine Audioumgebung mit Effektkette die bessere Wahl.

Kriterium Frage, die du dir stellen solltest
Konsistenz Klingt die Stimme nach fünf Minuten noch gleich?
Kontrolle Lassen sich Tempo, Pausen und Betonung steuern?
Ausgabe Bekomme ich getrennte Spuren und Rohdaten?
Rechte Darf ich das Ergebnis kommerziell verwenden?
Skalierung Funktioniert der Ablauf auch bei zwanzig Videos?
Wiederholbarkeit Kann ich einen einmal gefundenen Klang erneut erzeugen?

Visuelle Stile und Klangbild

Bei KI-Videos mit unterschiedlichen visuellen Stilen ändert sich nur die Musikwahl, nicht die Audioarchitektur. Ein fotorealistischer Clip trägt eher subtile, natürliche Klänge, ein stark stilisierter oder anime-artiger Clip eher markante Synths und klarere Akzente. Die Trennung in Sprache, Musik und Atmosphäre bleibt in beiden Fällen gleich – nur Instrumentierung und Übergangslängen unterscheiden sich. Wichtig ist, dass du die Klangwelt eines Formats einmal festlegst und dann nicht bei jedem Video neu verhandelst.

Häufige Fragen

Muss ich Musik überhaupt selbst erzeugen?
Nein. Für viele Projekte genügt eine lizenzierte Bibliothek. Musikgenerierung lohnt sich, wenn du eine sehr spezifische Stimmung brauchst, die exakte Länge steuern willst oder mehrere Videos in einem wiedererkennbaren Klangstil produzieren möchtest.

Wie lang sollte ein Musikstück für ein Video sein?
Kurz. Mehrere Abschnitte von fünfzehn bis zwanzig Sekunden sind praktischer als ein langes Stück, das du zerschneidest. So kannst du jeden Abschnitt an einen Szenenwechsel setzen.

Klingt eine KI-Stimme über ein ganzes Video zu monoton?
Nur bei zu gleichförmigem Skript. Variiere Satzlängen, setze bewusste Pausen und ändere die Intensität in der zweiten Hälfte. Die Textvorlage beeinflusst die Wirkung stärker als die Stimme selbst.

Sollte ich Atmosphärengeräusche hinzufügen?
Ja, aber sparsam. Ein leiser Raumklang unter der Stimme entfernt das Gefühl, in einem leeren Raum zu stehen. Zu viele Geräusche lenken von der Aussage ab.

Wie teste ich, ob mein Mix gut ist?
Höre ihn einmal auf dem Handy an, ohne hinzusehen. Verstehst du jedes Wort und stört die Musik nie, ist der Mix in Ordnung. Wiederhole den Test auf Kopfhörern und prüfe, ob das Klangbild noch ausgewogen wirkt.

Wie halte ich mehrere Videos klanglich konsistent?
Lege eine Vorlage an: ein Stimmenprofil, zwei bis drei Musikstile und feste Lautheitswerte. Neue Videos starten dann nicht bei null, sondern bei einem bereits funktionierenden Klangbild.

Was mache ich, wenn die Stimme bei Fachwörtern falsch betont?
Schreibe das Wort so, wie es klingen soll – mit Bindestrichen, Großschreibung oder einer lautnahen Schreibweise. Wenn das nicht hilft, ersetze die Formulierung. Ein anderes Wort ist meist schneller gefunden als eine perfekte phonetische Schreibweise.

Brauche ich für kurze Clips überhaupt einen eigenen Mix?
Ja, aber einen reduzierten. Stimme normalisieren, Musik auf niedrigerem Pegel darunterlegen, Lautheit auf einen Zielwert bringen. Das dauert wenige Minuten und ist der Unterschied zwischen „schnell gemacht“ und „fertig“.

Wie gehe ich mit Originalgeräuschen um, wenn ich keine Aufnahme habe?
Baue die Szene aus zwei bis drei Bibliothekselementen auf: ein Grundrauschen für den Raum, ein konkretes Geräusch für die Handlung, ein Übergangsgeräusch für den Schnitt. Mehr braucht es selten, und weniger klingt leer.

Fazit

Audio ist bei KI-gestützten Videoprojekten selten der Teil, der begeistert – und fast immer der Teil, der über die Wirkung entscheidet. Wer Sprache, Musik und Atmosphäre getrennt plant, das Skript fürs Hören schreibt und erst am Ende mischt, bekommt Ergebnisse, die nicht nach Werkzeug klingen, sondern nach Absicht. Der Aufwand liegt vor allem in der Disziplin, diese Reihenfolge einzuhalten: saubere Sprachspur zuerst, Musik in Abschnitten, Atmosphäre als dritte Ebene, Mix ganz zum Schluss. Der Rest ist Handwerk – kurze Sätze, definierte Übergänge, ein festes Stimmenprofil, einheitliche Lautheitswerte und ein letzter Test auf dem Smartphone.

Alexander

Alexander