Warum die Tonspur über Reichweite entscheidet
Bild und Ton werden vom Publikum unterschiedlich streng bewertet. Das Auge ist erstaunlich nachsichtig: Ein leicht weicher Fokus, ein sichtbarer Kompressionsartefakt oder ein unruhiger Kameraschwenk fallen meist erst auf, wenn man gezielt darauf achtet. Das Ohr verzeiht deutlich weniger. Ein hohles Voiceover, hörbarer Raumhall aus der Küche, eine Musik, die mitten im Satz hart einsetzt oder unter der Sprache um Aufmerksamkeit kämpft – all das erzeugt ein Unbehagen, das Zuschauer selten benennen können. Sie brechen einfach ab.
Wer regelmäßig Auswertungen von Videoplattformen liest, kennt das Muster: Die Absprungpunkte liegen überraschend oft dort, wo sich im Tonspur-Editor etwas ändert. Dort setzt eine neue Musikpassage ein, dort wechselt die Stimmlage, dort wurde ein Satz hart geschnitten. Die visuelle Ebene ist heute in kürzester Zeit produziert – Text zu Video, Bild zu Video, generative Szenen in Serie. Die Tonspur bleibt dagegen der Teil, der entweder Handarbeit kostet oder sofort nach Vorlage klingt.
Dieser Leitfaden beschreibt keinen einzelnen Anbieter, sondern den prinzipiellen Workflow, mit dem moderne Sprachsynthese, generative Musik und klassisches Sounddesign zu einer überzeugenden Tonspur zusammengeführt werden. Die Schritte funktionieren mit unterschiedlichen Werkzeugen, weil sie auf Entscheidungen beruhen und nicht auf Knöpfen. Wer die Entscheidungen kennt, kann Werkzeuge wechseln, ohne den Ablauf neu zu lernen.
Der wichtigste Grundsatz lautet: Die Ebenen werden getrennt gedacht, getrennt erzeugt und erst am Ende zusammengeführt. Der häufigste Anfängerfehler besteht darin, Sprache, Musik und Geräusche gleichzeitig zu mischen und danach nicht mehr zu wissen, welcher Baustein das Problem verursacht. Trennung ist keine Bürokratie, sondern Fehlerdiagnose.
Die vier Ebenen einer modernen Tonspur
Eine Videotonspur besteht aus vier Ebenen, die sich unterschiedlich gut automatisieren lassen. Sprache ist am anspruchsvollsten, weil sie inhaltlich verstanden wird. Musik wirkt emotional, aber selten bewusst. Ambience und Foley wirken unterbewusst und sind deshalb der günstigste Hebel für Qualität. Synchronisation ist keine eigene Ebene, sondern die Disziplin, die alle drei zusammenhält.
Sprachsynthese: die digitale Stimme steuern
Moderne Text-to-Speech-Modelle klingen in ruhigen, mittellangen Sätzen überzeugend. Interessant wird es bei der Steuerung. Statt nur Text einzugeben, solltest du vier Parameter bewusst nutzen: Tempo, Pausenlänge, Betonung und Aussprache.
- Tempo: Für deutsche Erklärvideos liegt ein angenehmer Bereich bei etwa 145 bis 165 Wörtern pro Minute. Darunter wirkt es belehrend, darüber gehetzt. Nachrichtenformate liegen eher bei 170 bis 185.
- Pausen: Der Unterschied zwischen einer guten und einer sehr guten Vertonung liegt oft in Mikropausen von 200 bis 350 Millisekunden an Kommagrenzen und Gedankenstrichen. Viele Modelle setzen sie zu kurz, wodurch Aufzählungen hastig wirken.
- Betonung: Einzelne Wörter lassen sich über Großschreibung, Kursiv-Hinweise oder Satzzeichenketten hervorheben. Teste pro Modell, welche Methode tatsächlich etwas verändert – die Wirkung ist nicht bei allen Anbietern gleich.
- Aussprache: Eigennamen, Abkürzungen und Fremdwörter brauchen fast immer einen manuellen Eintrag im Aussprache-Wörterbuch oder eine phonetische Umschrift. Plane dafür Zeit ein, sonst bleibt ein Markenname im ganzen Video falsch.
Sprachklone sind verlockend und rechtlich heikel. Nutze sie nur, wenn eine schriftliche Einwilligung der sprechenden Person vorliegt und die Lizenz des Modells kommerzielle Nutzung erlaubt. Für Unternehmensstimmen lohnt sich stattdessen eine neutrale, klar gekennzeichnete Markenstimme, die aus lizenzierten Aufnahmen entsteht. Achte außerdem darauf, dass die Stimme über alle Szenen hinweg identisch bleibt: Ein Wechsel der Sprecherin mitten im Video wirkt wie ein Produktionsfehler, auch wenn er inhaltlich begründet ist.
Musikgenerierung: Stimmung als Prompt
Generative Musik lässt sich inzwischen so präzise beschreiben, dass sie sich wie eine Bibliothek mit unendlicher Auswahl verhält. Der Schlüssel ist, nicht nach Genre zu fragen, sondern nach Funktion. Der Prompt ruhige Fläche mit tiefen Streichern, kein Schlagzeug, Spannung für erklärende Passagen funktioniert besser als der Prompt Cinematic Score.
Beschreibe fünf Dinge: Instrumentierung, Tempo in BPM, Tonart beziehungsweise Modalität, Energiekurve und ob ein Loop oder eine durchkomponierte Struktur gewünscht ist. Ein Beispiel für ein Erklärvideo: tiefe Streicherfläche, 72 BPM, Moll, gleichbleibende Energie, kein Schlagzeug, keine Gesangsstimme, Ausklang am Ende. Ein Beispiel für einen Social-Clip: perkussiver Auftakt, 110 BPM, Dur, Energie steigt nach acht Sekunden, kurzer Stopp, kein Melodieinstrument im Vordergrund.
Praktisch ist der Umgang mit Stems. Wenn du Bass, Fläche und Rhythmus getrennt exportieren kannst, kannst du einzelne Ebenen unter Dialogen herausnehmen, statt die ganze Musik leiser zu drehen. Das ist der größte Qualitätssprung, den generative Musik für Videos ermöglicht, weil die Energie erhalten bleibt, während die Verständlichkeit steigt.
Geräusche und Atmosphäre: der unterschätzte Kleber
Ambience und Foley sind das, was Übergänge unsichtbar macht. Ein leiser Raumklang, ein Papierrascheln, ein einzelner Whoosh an einem Szenenwechsel – diese Details kosten wenig Zeit und verändern die Wahrnehmung einer Produktion stark. Wichtig ist Disziplin: Ein Geräusch pro Schnittpunkt, nicht drei. Sobald sich Geräusche stapeln, klingt der Schnitt nach Zufall.
Ambience hat außerdem eine narrative Funktion. Ein Büroklang, ein Stadtgeräusch, ein Windrauschen auf einer Terrasse: Der Zuschauer versteht sofort, wo er sich befindet, auch wenn das Bild abstrakt ist. Bei generierten Szenen ist das besonders wertvoll, weil Räume dort oft wenig Textur haben. Ein Bett aus Atmosphäre ersetzt fehlende Bilddetails.
Synchronisation und Timing
Erst hier entscheidet sich, ob die Ebenen zusammenwirken. Arbeite mit Markern an Wortenden, nicht an Satzanfängen. Musikwechsel gehören auf Atempausen der Stimme, nicht auf den Schnittpunkt der Bilder. Bei Talking-Head-Aufnahmen mit sichtbarer Lippenbewegung verschiebt sich die Tonspur oft um 40 bis 80 Millisekunden, weil generative Videomodelle Mundbewegungen nicht exakt auf die Tonspur legen. Eine hartnäckige, aber lösbare Aufgabe: Verschiebe die Tonspur in kleinen Schritten und prüfe bei halber Geschwindigkeit.
Ein zweiter Timing-Punkt betrifft Untertitel. Sie müssen auf dem gesprochenen Wort liegen, nicht auf dem Schnitt. Wenn Untertitel und Stimme um mehr als 300 Millisekunden auseinanderlaufen, wirkt das Video unprofessionell, selbst wenn beide Inhalte korrekt sind.
Der Arbeitsablauf: vom Skript zum fertigen Master
Sechs Etappen genügen für eine saubere Produktion. Die Reihenfolge ist wichtiger als die Werkzeugwahl, denn ein späterer Wechsel der Stimme kostet mehr Zeit als jeder Einstellungsfehler.
Etappe 1: Skript sprechbar machen
Lies jeden Satz einmal laut. Alles, was du dabei holprig findest, wird in der Synthese noch holpriger. Kürze Schachtelsätze, schreibe Zahlen aus, ersetze Klammern durch Nebensätze und markiere bewusst Stellen, an denen später Atem oder Pause stehen soll. Ein Skript in Sprechform hat typischerweise 10 bis 15 Prozent mehr Wörter als die schriftliche Version, aber deutlich weniger Silben pro Satz. Das ist kein Widerspruch, sondern das Ergebnis kürzerer Einheiten.
Etappe 2: Stimme casten statt wählen
Erzeuge von deinem ersten Absatz drei Varianten mit unterschiedlichen Stimmen und identischen Einstellungen. Höre sie anschließend in drei Situationen an: über Handylautsprecher, über Kopfhörer und im Hintergrund, während du etwas anderes tust. Die dritte Situation ist die wichtigste, denn sie entspricht der Realität vieler Zuschauer. Achte auf Verständlichkeit bei Nebengeräuschen, Sympathie, Tempo und Zuverlässigkeit bei Eigennamen. Eine Stimme, die im Kopfhörer brilliert, aber am Handylautsprecher undeutlich wird, ist die falsche Wahl.
Etappe 3: In Blöcken generieren
Generiere nicht das ganze Skript in einem Durchgang. Arbeite absatzweise, speichere jede Datei mit Versionsnummer und Notiz und korrigiere sofort, wenn Betonung oder Pause nicht passen. Ein späteres Ändern eines einzelnen Satzes ist trivial, ein kompletter Neuaufbau nicht. Bewährt hat sich eine Benennung wie 03_absatz2_v4_tempo152, damit du auch nach zwei Wochen weißt, welche Datei die aktuelle ist.
Etappe 4: Musik in Ebenen anlegen
Baue drei Elemente: ein Intro, das in den ersten Sekunden Aufmerksamkeit erzeugt, eine ruhige Fläche für die Kernaussagen und einen Abschluss, der ausklingt statt abzubrechen. Halte den Rhythmusanteil niedrig, solange gesprochen wird. Wenn du mit Loop-Material arbeitest, prüfe die Nahtstelle bei voller Lautstärke – Knackser fallen im fertigen Video deutlich stärker auf als im Editor. Ein Loop mit vier Takten ist für 30 Sekunden Sprache meist zu kurz; strebe mindestens 16 Takte an.
Etappe 5: Mixdown mit klaren Zielwerten
Setze die Sprache auf etwa minus 6 dBFS Spitzenpegel und senke die Musik unter Sprache um 12 bis 18 dB per Ducking. Ein Hochpass zwischen 80 und 100 Hz räumt Rumpeln auf, ein De-Esser entschärft Zischlaute bei etwa 6 bis 8 kHz, ein sanfter Kompressor mit Verhältnis 3 zu 1 und mittlerer Ansprechzeit glättet Lautstärkeschwankungen. Für die Ausgabe gilt: minus 16 LUFS stereo für Web-Plattformen, minus 14 LUFS mono für reine Podcast-Fassungen, True Peak nicht über minus 1 dBTP.
Etappe 6: Export in mehreren Varianten
Exportiere immer einen Master mit Musik, eine Fassung ohne Musik für Untertitel-Workflows und eine sprecherfreie Musikfassung für Remixe oder Sprachversionen. Diese drei Dateien kosten kaum Zeit und retten später ganze Produktionsrunden, weil sie Nachvertonungen oder Übersetzungen ohne Neuaufbau ermöglichen.
Stimmenführung: Emotion entsteht durch Rhythmus
Emotion entsteht nicht durch ein Label wie begeistert, sondern durch Rhythmus. Drei Hebel wirken zuverlässig:
- Satzlänge variieren. Auf einen langen Satz folgt ein kurzer. Das erzeugt automatisch Dynamik, ohne dass du an der Stimme schrauben musst.
- Pausen bewusst setzen. Ein Absatz, der mit einer Pause endet, klingt nachgedacht. Ein Absatz ohne Pause klingt abgelesen.
- Betonung verschieben. Wenn jeder Satz auf dem gleichen Hauptwort endet, entsteht ein Singsang. Drehe die Reihenfolge der Satzteile um.
Ein weiterer wichtiger Punkt ist die Konsistenz über Szenen hinweg. Wenn du pro Szene eine neue Generation startest, können Tempo und Klangfarbe minimal abweichen. Nutze deshalb denselben Stimmen-Referenzwert und dieselben Einstellungen über das gesamte Projekt und generiere Stimmen in einer Sitzung. Wenn das nicht möglich ist, dokumentiere die verwendeten Werte und gleiche die neuen Abschnitte mit einem A-B-Vergleich am Übergang ab. Ein Unterschied von zwei Prozent Tempo fällt im direkten Übergang sofort auf, mitten in einer Szene dagegen nie.
Musik, die nicht mit der Stimme kämpft
Sprache belegt im Wesentlichen den Bereich zwischen 200 Hz und 4 kHz, mit einem Verständlichkeitszentrum um 2 bis 4 kHz. Musik, die genau dort stark ist – Synth-Flächen, Streicher in hoher Lage, gezupfte Saiten –, überdeckt Sprache selbst dann, wenn sie objektiv leiser ist. Lautstärke ist also nicht das einzige Werkzeug.
Praktische Gegenmaßnahmen: Nutze eine Kerbe zwischen 2 und 5 kHz auf der Musikspur, reduziere dort um 3 bis 5 dB, und halte gesungene Passagen grundsätzlich von Sprechparts fern. Bei Übergängen hilft der klassische Trick, die Musik an einem Satzende kurz auszublenden und neu einzusetzen. Und wenn du einen Loop unter einer längeren Passage verwendest, ändere alle 30 Sekunden eine Ebene – Bass raus, Fläche rein –, damit Wiederholung nicht als Wiederholung hörbar wird.
Eine zweite Regel betrifft die Dynamik. Musik, die durchgehend gleich laut ist, wirkt wie eine Tapete. Automatisiere die Lautstärke in mindestens drei Stufen: Intro präsent, Kernaussagen zurückhaltend, Abschluss wieder präsent. Dieses Muster reicht für Videos von zwei bis zwanzig Minuten, ohne dass du eine einzige neue Musikdatei benötigst.
Werkzeuge und Entscheidungskriterien
Werkzeugvergleiche sind schnell veraltet, Entscheidungskriterien nicht. Prüfe jedes Angebot anhand derselben sechs Fragen, bevor du dich festlegst.
- Stimmumfang und Sprachen: Wie viele Stimmen gibt es, wie klingen sie in deiner Zielsprache, und wie zuverlässig ist die Aussprache von Eigennamen?
- Steuerbarkeit: Lassen sich Tempo, Pausen und Betonung getrennt einstellen, oder gibt es nur einen globalen Regler?
- Stem-Export: Kannst du Musik in Einzelspuren exportieren? Ohne Stems verlierst du den wichtigsten Qualitätshebel.
- Konsistenz: Bleibt eine Stimme über mehrere Sitzungen hinweg identisch?
- Lizenzumfang: Kommerzielle Nutzung, Weitergabe an Kunden, Social-Media-Nutzung, Broadcast.
- Ausgabeformate: WAV, 48 kHz, 24 Bit, mono und stereo. Fehlt eines davon, entstehen später Konvertierungsschritte.
Für die tägliche Arbeit hat sich eine Arbeitsteilung bewährt: Sprachsynthese im Hauptwerkzeug, Musik in einem separaten Generator mit Stem-Ausgabe, Mixdown in einer klassischen Audiosoftware. Diese Aufteilung klingt umständlicher als eine All-in-One-Lösung, ist aber robuster, weil du einzelne Teile austauschen kannst, ohne den ganzen Ablauf zu verlieren.
Rechte, Lizenzen und realistische Zeitbudgets
KI-Audio scheint zunächst kostenlos, weil die Nutzungsgrenzen großzügig wirken. Drei Punkte gehören trotzdem vor den ersten Upload geklärt.
- Nutzungsumfang: Erlaubt die Lizenz kommerzielle Nutzung, Social-Media-Nutzung, Broadcast und Weiterlizenzierung an Kunden? Viele Standardtarife erlauben nur persönliche oder rein redaktionelle Nutzung.
- Trainings- und Speicherklauseln: Wird hochgeladenes Material für Modellverbesserungen verwendet? Bei eigenen Sprachaufnahmen ist das eine relevante Frage, besonders wenn Kundenstimmen im Spiel sind.
- Zeitaufwand: Der eigentliche Kostenfaktor ist nicht das Werkzeug, sondern die Iterationsschleife. Plane pro Minute fertigem Video etwa 20 bis 40 Minuten Audioarbeit ein, wenn du Stimme, Musik und Mix selbst machst. Automatisierung senkt diesen Wert, aber nur bei einer sauberen Reihenfolge.
Für die Projektkalkulation hilft eine einfache Rechnung: monatliche Werkzeugkosten geteilt durch die Anzahl produzierter Videominuten. Sobald dieser Wert unter dem Stundensatz für manuelle Vertonung liegt, lohnt der Wechsel. Noch wichtiger ist die zweite Kennzahl: Wie viele Takes brauchst du pro fertiger Videominute? Sinkt diese Zahl über mehrere Projekte, funktioniert dein Workflow. Steigt sie, stimmt meistens das Skript nicht.
Drei Praxis-Szenarien mit konkretem Setup
Erklärvideo, 90 Sekunden. Eine Stimme, Tempo 155 Wörter pro Minute, zwei Musikpassagen, keine Ambience. Musik unter Sprache bei minus 15 dB, Übergang exakt nach dem ersten Satz der zweiten Szene. Stimme mit dezentem Kompressor, kein Effekthall. Export als Master plus Untertitel-Fassung ohne Musik.
Dokumentarischer Beitrag, sechs Minuten. Zwei Stimmen, eine Erzählerstimme und Zitate aus dem Off, drei Musikthemen, dichte Ambience. Hier zahlt sich Stem-Arbeit aus: Rhythmusebenen pausieren unter Zitaten komplett, Flächen bleiben. Ambience wechselt pro Ort, Lautheit konstant bei minus 16 LUFS. Zwischen den Zitaten bleibt eine Sekunde Stille, damit der Wechsel hörbar wird.
Social-Clip, 20 Sekunden. Eine Stimme, Tempo 175 Wörter pro Minute, ein Musikbett mit klarem Auftakt. Der erste Satz muss in den ersten zwei Sekunden sitzen, deshalb beginnt Musik hier vor der Sprache und wird nach dem ersten Satz abgesenkt. Untertitel sind Pflicht, weil viele ohne Ton schauen. Der Schluss braucht keinen Ausklang, sondern einen sauberen Stopp.
Ein viertes, oft unterschätztes Szenario ist die Sprachversionierung. Wenn du denselben Clip in drei Sprachen ausspielst, ändert sich das Timing der Stimme erheblich. Baue deshalb Musik und Geräusche so, dass sie ohne Sprecher funktionieren, und kürze oder verlängere nur die Sprachspur. So bleibt eine Tonspur wartbar, aus der mehrere Fassungen entstehen.
Qualitätssicherung, typische Fehler und Gegenmaßnahmen
Checkliste vor dem Export
- Handylautsprecher-Test: Verstehst du jedes Wort, ohne hinzuhören?
- Kopfhörer-Test: Hörst du Schnittkanten, Atmer, Klicks oder Brummen?
- Hintergrund-Test: Läuft das Video, während du etwas anderes tust? Bleibst du dran?
- Loudness-Messung: Stimmen die Werte für die Zielplattform und liegt der True Peak im grünen Bereich?
- Konsistenzprüfung: Klingen alle Szenen nach derselben Produktion?
- Stille: Gibt es einen sauberen Anfang und ein ausklingendes Ende ohne abgehackte Musik?
- Untertitel: Passt der Text zu dem, was tatsächlich gesprochen wird, inklusive Zahlen und Eigennamen?
Sieben Fehler, die immer wieder auftreten
Zwei Stimmen mit unterschiedlichem Raumcharakter kombinieren. Synthetische Stimme und echte Aufnahme haben einen anderen Hallanteil. Lösung: Beide durch denselben kurzen Faltungshall schicken.
Musik durchgehend auf gleicher Lautstärke. Das erzeugt Eintönigkeit. Lösung: Lautstärkeautomatisierung in mindestens drei Stufen.
Text ohne Interpunktion einwerfen. Das Modell kann Betonung nicht raten. Lösung: Punkte, Kommas und Gedankenstriche als Steuerzeichen begreifen.
Zu viel Hall auf der Stimme. Klingt groß, wird aber unverständlich. Lösung: Nahaufnahme-Charakter, höchstens 15 Prozent Hallanteil.
Abweichende Sampleraten mischen. 44,1 und 48 kHz in einem Projekt führen zu Tonhöhenfehlern. Lösung: Vor dem Import vereinheitlichen.
Auf Satzanfängen schneiden. Das zerstört die Betonung. Lösung: Auf Atempausen schneiden.
Keine Sicherung der Rohdateien. Generative Projekte sind schwer reproduzierbar, wenn Einstellungen nicht dokumentiert sind. Lösung: Ordnerstruktur mit Datum, Werkzeugname und Parameterliste.
FAQ: häufige Fragen zur Audioproduktion mit KI
Klingt eine KI-Stimme immer erkennbar synthetisch? Bei kurzen, ruhigen Sätzen meist nicht. Auffällig wird sie bei Aufzählungen, Zahlen, emotionalen Ausbrüchen und sehr langen Sätzen. Genau dort lohnt die Nacharbeit an Pausen und Betonung.
Wie viele Stimmen sollte ein Projekt haben? In der Regel eine Erzählerstimme plus maximal eine Zitatstimme. Mehr Stimmen ohne visuelle Zuordnung verwirren, weil das Publikum nicht weiß, wer spricht.
Muss ich Musik überhaupt einsetzen? Nein, aber dann brauchst du Ambience, damit das Video nicht leer wirkt. Stille ist ein Werkzeug, kein Standardzustand.
Wie lang darf ein generierter Musikabschnitt sein? So lang wie nötig, aber wechsle mindestens alle 30 bis 45 Sekunden die Intensität, sonst nutzt sich das Thema ab.
Was ist wichtiger: Stimme oder Musik? Die Stimme. Musik kann eine mittelmäßige Vertonung nicht retten, aber eine sehr gute Vertonung funktioniert auch ohne Musik.
Wie teste ich, ob mein Mix gut ist? Höre ihn einmal auf dem Handylautsprecher und einmal leise im Hintergrund. Wenn du im Hintergrund den Faden verlierst, liegt es fast immer an der Musikbalance, nicht an der Stimme.
Lohnt sich Voice-Cloning? Nur bei wiederkehrenden Formaten mit klarer rechtlicher Grundlage. Für einmalige Projekte ist eine hochwertige Standardstimme schneller und rechtlich einfacher.
Wie dokumentiere ich Einstellungen? Führe pro Projekt eine kurze Textdatei mit Stimmen-ID, Tempo, Pausenregeln, Musik-Prompts, Ducking-Werten und Exporteinstellungen. Das beschleunigt jede Folgeproduktion erheblich.
Wie gehe ich mit Musik in mehreren Sprachen um? Halte die Musiksprache neutral, also ohne Text und ohne kulturell eindeutige Instrumente, wenn du international ausspielst. Regionale Instrumentierung wirkt stark, schränkt aber die Wiederverwendung ein.
Was mache ich bei Rückkopplung oder Brummen in eigenen Aufnahmen? Erst die Aufnahme prüfen, dann einen Hochpass setzen, dann eine schmale Kerbe bei der Brummfrequenz. Wenn das nicht hilft, ist die Aufnahme unbrauchbar – generierte Stimmen sind dann die günstigere Lösung als stundenlange Reparatur.
Fazit: Audio ist ein Prozess, kein Plug-in
Die Qualität einer KI-gestützten Tonspur entsteht nicht durch ein einzelnes Werkzeug, sondern durch die Reihenfolge der Entscheidungen. Skript sprechbar machen, Stimme testen, in Blöcken generieren, Musik in Ebenen anlegen, mit klaren Zielwerten mischen, in mehreren Varianten exportieren. Wer diesen Ablauf einmal sauber aufgesetzt hat, produziert jede weitere Folge in einem Bruchteil der Zeit – und erkennt sofort, an welcher Stelle ein Problem entstanden ist.
Beginne mit einem einzigen kurzen Video und dokumentiere jeden Schritt. Die zweite Produktion dauert dann die Hälfte, die dritte ein Drittel. Genau darin liegt der eigentliche Vorteil generativer Audiowerkzeuge: nicht in der ersten Datei, sondern in der zwanzigsten.


