Warum Storytelling und Generierung getrennt geplant werden müssen
Die meisten Enttäuschungen in der KI-Videoproduktion entstehen nicht durch schlechte Modelle, sondern durch eine falsche Reihenfolge im Arbeitsprozess. Wer mit der Generierung beginnt und die Geschichte später „zusammenbaut“, produziert eine Sammlung hübscher Einzelbilder, die zusammen keine Handlung ergeben. Wer umgekehrt zuerst die Dramaturgie entwickelt und die Technik als ausführendes Werkzeug behandelt, erhält selbst mit durchschnittlichen Modellen brauchbare Ergebnisse.
Der Grund ist einfach: Generative Videomodelle sind extrem gut darin, eine beschriebene Situation sichtbar zu machen. Sie sind schlecht darin, eine Situation zu erfinden, die in einen dramaturgischen Zusammenhang passt. Ein Beschreibungstext wie „Frau blickt in den Regen“ ergibt einen schönen Clip, aber keine Szene. Erst wenn klar ist, was diese Frau will, was sie daran hindert und was sich vom Anfang bis zum Ende der Einstellung verändert, wird aus dem Clip ein Baustein einer Geschichte.
Hinzu kommt ein ökonomischer Faktor. Die Generierung selbst ist der schnellste Teil der Produktion. Schnitt, Tonmischung, Farbabgleich und Qualitätskontrolle benötigen in der Praxis deutlich mehr Zeit als das Erzeugen der Rohclips. Wer also Zeit sparen will, spart sie nicht bei der Vorbereitung, sondern bei der Nacharbeit. Und Nacharbeit entsteht fast immer durch fehlende Planung: inkonsistente Beleuchtung, wechselnde Gesichtsmerkmale, unklare Kamerasprache.
Dieser Leitfaden beschreibt deshalb einen zweigleisigen Ansatz. Das eine Gleis ist die erzählerische Arbeit: Idee, Struktur, Figuren, Tempo. Das andere Gleis ist die technische Kette: Referenzbilder, Prompting, Generierung, Schnitt, Vertonung. Beide Gleise müssen getrennt geplant und erst am Ende zusammengeführt werden. Klingt unspektakulär, ist aber der zuverlässigste Unterschied zwischen Projekten, die fertig werden, und Projekten, die in einer Ordnerstruktur mit 200 unbenannten Dateien enden.
Die drei Ebenen einer KI-Videoproduktion
Jedes KI-generierte Video besteht aus drei Ebenen, die unterschiedlich schnell scheitern. Wer die Ebenen kennt, kann Fehler früher verorten, statt wahllos am Modell zu schrauben.
Ebene eins: Dramaturgie
Die Dramaturgie ist die einzige Ebene, die vollständig ohne Technik funktioniert. Ein Test: Lesen Sie Ihr Skript laut vor, ohne Bilder. Verstehen Zuhörer, worum es geht, wer etwas will und warum es sich am Ende anders verhält als am Anfang? Wenn nicht, hilft kein Modell der Welt. Dramaturgische Schwächen werden durch visuelle Brillanz nicht repariert, sondern nur verdeckt – und fallen spätestens beim zweiten Ansehen auf.
Ebene zwei: Bildsprache
Die Bildsprache umfasst Farbpalette, Lichtlogik, Objektivcharakter und den Grad der Abstraktion. Hier entstehen die meisten Konsistenzprobleme. Ein Weitwinkelbild in hartem Mittagslicht neben einer Nahaufnahme in weichem Dämmerlicht wirkt wie ein Bruch, selbst wenn beide Aufnahmen für sich gelungen sind. Definieren Sie deshalb vor der ersten Generierung, wie Ihr Video aussehen soll: kühl oder warm, kontrastreich oder flach, dokumentarisch oder stilisiert.
Ebene drei: Ton
Der Ton trägt einen überproportionalen Anteil der wahrgenommenen Qualität. Eine mittelmäßige Bildfolge mit klarer Stimme, gut gesetzter Musik und präzisen Geräuscheffekten wirkt professioneller als perfekte Bilder mit dumpfer, ungleichmäßiger Vertonung. Planen Sie Ton von Anfang an mit, nicht als letzten Arbeitsschritt.
Dazu kommt eine vierte, oft übersehene Ebene: der Rhythmus. Generierte Clips kommen selten im finalen Tempo. Sie sind Rohmaterial mit einer eigenen inneren Geschwindigkeit. Erst der Schnitt entscheidet, ob eine Sequenz atmet oder hetzt.
Von der Idee zum visuellen Drehbuch
Zwischen „Ich habe eine Idee“ und „Ich kann generieren“ liegen drei Arbeitsmittel. Wer sie überspringt, zahlt später drauf.
Die Logline als Kompass
Formulieren Sie einen Satz, der Figur, Ausgangslage, Widerstand und Wendepunkt enthält. Beispiel: „Eine Fahrradkurierin verliert in einer fremden Stadt ihre Route und entdeckt dabei einen Ort, den sie nur mit einer gebrochenen Regel erreicht.“ Dieser Satz ist kein Marketingtext, sondern ein Filter. Jede spätere Entscheidung – welche Einstellung, welche Perspektive, welcher Ton – muss zu diesem Satz passen. Alles, was nicht passt, fliegt raus, egal wie schön der Clip ist.
Das Beat-Sheet
Zerlegen Sie die Logline in fünf bis neun Beats. Ein Beat ist eine kleine dramaturgische Einheit mit eigener Spannungskurve: Ausgangszustand, Störung, Reaktion. Für ein 45-Sekunden-Video reichen sechs Beats. Für ein dreiminütiges Erklärvideo planen Sie zwölf bis achtzehn Beats, gruppiert in drei Akte.
Ein bewährtes Zeitverhältnis für kurze Formate: rund 15 Prozent Einstieg, 25 Prozent Aufbau, 40 Prozent Kern, 20 Prozent Auflösung. Bei längeren Formaten verschiebt sich der Schwerpunkt nach hinten, weil der Zuschauer mehr Kontext braucht, bevor die zentrale Wendung zündet.
Szenenliste und Keyframes
Erst jetzt entsteht die Szenenliste: pro Beat eine oder mehrere Einstellungen mit geschätzter Dauer, Kameraposition und Funktion im Ganzen. Notieren Sie zu jeder Einstellung, welche Aufgabe sie erfüllt – Information, Emotion, Übergang, Pointe. Einstellungen ohne Aufgabe sind Kandidaten für die Streichliste.
Parallel entsteht eine Sammlung von Keyframes: Standbilder, die Licht, Palette und Komposition jeder Szene festlegen. Diese Referenzbilder sind Ihr visuelles Drehbuch und gleichzeitig Ihr wichtigstes Konsistenzwerkzeug. Bauen Sie eine kleine Bibliothek: Hauptfigur in drei Ansichten, Hauptschauplatz in zwei Perspektiven, ein Stimmungsbild pro Akt. Alternativ ein Stimmungsboard mit acht bis zwölf Bildern, das Sie während der gesamten Produktion geöffnet lassen.
Ein praktischer Tipp: Legen Sie allen Referenzbildern dieselbe Auflösung und denselben Bildausschnitt zugrunde. Das klingt nach Detail, erleichtert aber den späteren Vergleich erheblich, weil Ihr Auge dann Licht und Komposition beurteilt und nicht versehentlich das Format.
Prompting als Regieanweisung
Prompts sind keine Wunschzettel, sondern Regieanweisungen. Je präziser Sie beschreiben, was die Kamera tun soll, desto weniger Entscheidungen übernimmt das Modell eigenmächtig – und desto reproduzierbarer wird Ihr Ergebnis.
Die fünf Elemente eines Szenenprompts
Ein tragfähiger Prompt enthält Motiv, Handlung, Umgebung, Kamera und Licht. Eine brauchbare Struktur sieht so aus: „Nahaufnahme einer Person mittleren Alters, die langsam den Kopf hebt, in einem regennassen Innenhof, langsame Fahrt nach vorne, kühles Dämmerlicht mit weichen Schatten.“ Jedes Element hat eine Funktion. Wer eines weglässt, überlässt dem Modell eine Entscheidung, die später vielleicht nicht mehr zur Nachbareinstellung passt.
Vermeiden Sie Adjektivketten ohne Bezug. Wörter wie „episch“, „atemberaubend“ oder „filmreif“ liefern keine verwertbare Anweisung, weil sie nichts Physisches beschreiben. Ersetzen Sie sie durch konkrete Angaben: „tiefe Kameraposition“, „Gegenlicht durch ein Fenster“, „langsame Fahrt über acht Sekunden“.
Kamera und Licht als stärkste Hebel
Kamerasprache ist der zuverlässigste Konsistenzhebel überhaupt. Entscheiden Sie sich pro Szene für einen Kamerastil und halten Sie ihn durch: statische Einstellung, langsame Fahrt, seitliche Mitführung, Handkamera oder Drohnenbewegung. Mischen Sie nicht innerhalb einer Szene. Ein harter Wechsel der Kamerasprache ist ein dramaturgisches Mittel und sollte an einer Stelle stehen, an der inhaltlich etwas kippt.
Beschreiben Sie Licht so, als würden Sie ein Set aufbauen: Tageszeit, Richtung der Hauptquelle, Härtegrad, Farbstimmung. „Spätes Nachmittagslicht von links, weiche Schatten, leicht warme Grundstimmung“ ist eine Anweisung, mit der ein Modell etwas anfangen kann. „Schönes Licht“ ist es nicht.
Nennen Sie zusätzlich das visuelle Material, wenn es für Ihre Marke relevant ist: Filmkorn, klarer digitaler Look, analoge Weichheit, leichte Unschärfe an den Rändern. Dieser eine Satz entscheidet oft darüber, ob eine Sequenz zusammenhängend wirkt.
Ausschlüsse sparsam und spezifisch einsetzen
Negative Anweisungen sind nützlich, aber gefährlich. Schließen Sie gezielt aus, was Ihre Geschichte zerstört: unerwünschte Texteinblendungen, zusätzliche Personen im Bild, schnelle Zoombewegungen, übertriebene Gesichtsausdrücke. Halten Sie die Liste kurz – drei bis fünf Punkte pro Projekt, nicht pro Prompt. Zu viele Ausschlüsse verengen den Ergebnisraum und führen zu flachen, ausdruckslosen Bildern.
Der Iterationskreislauf: Generieren, prüfen, verwerfen
Die eigentliche Arbeit beginnt nach dem ersten Ergebnis. Der produktive Umgang mit generiertem Material folgt einem Kreislauf aus vier Schritten.
Erstens: in Varianten denken. Erzeugen Sie pro Einstellung mindestens drei, besser fünf Varianten. Der erste Treffer ist fast nie der beste, weil Sie ohne Vergleich nicht wissen, was möglich gewesen wäre.
Zweitens: nach Verwendbarkeit bewerten, nicht nach Schönheit. Stellen Sie vier Fragen. Passt die Bewegungsrichtung zur vorherigen und zur nächsten Einstellung? Ist die Figur wiedererkennbar? Ist die Kamera ruhig genug, um einen harten Schnitt zu überleben? Erfüllt die Einstellung ihre dramaturgische Aufgabe? Ein Clip, der drei dieser Fragen mit Ja beantwortet, ist brauchbar, auch wenn er für sich genommen unspektakulär aussieht.
Drittens: eine Wiedervorlage anlegen. Sortieren Sie Material in drei Körbe: verwendet, vielleicht, verworfen. Der vielleicht-Korb ist kein Friedhof, sondern ein Puffer. Wenn sich der Schnittrhythmus später ändert – und das passiert fast immer –, retten diese Clips ganze Sequenzen.
Viertens: dokumentieren. Notieren Sie pro Einstellung den verwendeten Prompt, das Referenzbild, die Modelleinstellungen und die Auswahlentscheidung. Ohne diese Notizen können Sie eine gelungene Szene nicht reproduzieren und auch nicht gezielt variieren. Ein einfaches Tabellenblatt genügt: Szenennummer, Prompt, Referenzbild, Modell, Dauer, Status, Notiz.
Konsistenz über Szenen hinweg sichern
Konsistenz ist das wichtigste Qualitätsmerkmal von KI-Videos und gleichzeitig die häufigste Schwachstelle. Drei Strategien haben sich bewährt.
Die Referenzbild-Methode
Erzeugen oder wählen Sie ein Standbild der Hauptfigur. Nutzen Sie dieses Bild als Ausgangspunkt für jede Einstellung und ändern Sie nur Kamera, Pose und Umgebung. Die Identität bleibt stabil, weil sie in jedem Schritt verankert ist, nicht nur im Text beschrieben wird. Dasselbe gilt für Schauplätze: ein festes Referenzbild pro Ort, aus dem alle Perspektiven abgeleitet werden.
Die Segment-Methode
Zerlegen Sie eine längere Bewegung in kurze Abschnitte mit überlappenden Endbildern. Statt eine zehnsekündige Fahrt in einem Durchgang zu erzeugen, produzieren Sie drei Abschnitte von je vier Sekunden, deren letztes und erstes Bild sich überschneiden. Diese Abschnitte lassen sich später im Schnitt sauber verbinden, und Sie können einen misslungenen Teil ersetzen, ohne die ganze Sequenz neu zu erzeugen.
Die Akzent-Methode
Legen Sie für jede Figur zwei bis drei unveränderliche Merkmale fest – ein Kleidungsdetail, eine Frisur, die Form einer Brille oder Tasche – und beschreiben Sie sie in jedem Prompt identisch. Diese kleinen Marker leisten für den Wiedererkennungswert mehr als eine lange Gesichtsbeschreibung, weil sie einfacher zu treffen und leichter zu überprüfen sind.
Ergänzend hilft eine Farbdisziplin: Definieren Sie pro Akt eine dominante Palette mit zwei Akzentfarben und prüfen Sie am Ende alle Einstellungen nebeneinander in einer Kontaktabzug-Ansicht. Inkonsistenzen fallen dort sofort auf, während sie in der Timeline nacheinander oft unbemerkt bleiben.
Schnitt, Tempo und Ton: wo die Wirkung entsteht
Emotion entsteht nicht durch ein einzelnes Bild, sondern durch die Abfolge. Drei Techniken wirken zuverlässig.
Kontrastschnitt. Ein ruhiger Clip bricht die Wirkung eines hektischen vorherigen Clips und umgekehrt. Wechseln Sie bewusst zwischen Bewegung und Stillstand, zwischen Totaler und Nahaufnahme, zwischen heller und dunkler Stimmung.
Verzögerung vor dem Höhepunkt. Halten Sie eine Einstellung länger als erwartet, bevor der entscheidende Moment kommt. Diese Dehnung erzeugt Spannung, ohne dass zusätzliches Material nötig wäre.
Ton-Dramaturgie. Beginnen Sie nicht mit voller Musik. Bauen Sie Klangschichten über die Szenen auf, damit der Höhepunkt auch akustisch einer ist. Wenn Musik und Bild gleichzeitig ihren Höhepunkt haben, wirkt beides schwächer.
Beim Schnitt von generiertem Material gilt eine praktische Faustregel: Schneiden Sie jede Einstellung um zwei bis vier Frames kürzer, als Ihnen angenehm erscheint. KI-Material verzeiht harte Schnitte besser als lange Auslaufzeiten, weil am Ende vieler Clips kleine Bewegungsunschärfen oder Detailfehler sitzen. Übergänge setzen Sie sparsam ein – ein harter Schnitt ist fast immer die bessere Wahl, außer ein Ortswechsel oder Zeitsprung muss erklärt werden.
Beim Ton lohnt sich Sorgfalt an drei Stellen. Erstens Sprachaufnahme oder Sprachsynthese: Achten Sie auf gleichmäßige Lautstärke über alle Sätze und einen konsistenten Abstand zum Mikrofon. Zweitens Musik: Senken Sie die Musik unter Dialogen deutlich ab, damit die Stimme immer verständlich bleibt. Drittens Geräusche: Wenige, gut gesetzte Effekte – Schritte, Regen, ein Türgeräusch – verankern die Bilder in einem Raum und machen sie glaubwürdiger. Prüfen Sie jede Sequenz einmal auf dem Handy-Lautsprecher und einmal mit Kopfhörern; erst dann zeigt sich, ob die Mischung trägt.
Untertitel sind kein Zusatz, sondern Standard. Prüfen Sie Zeilenlänge, Lesegeschwindigkeit und Safe Areas, besonders in vertikalen Formaten, wo Bedienelemente den unteren Bildbereich überdecken können.
Zeitplanung, Rollen und Tool-Auswahl
Eine realistische Zeitverteilung für ein 45-Sekunden-Video sieht ungefähr so aus: 20 Prozent Vorbereitung und Skript, 25 Prozent Referenzbilder und Prompts, 20 Prozent Generierung und Auswahl, 30 Prozent Schnitt und Ton, 5 Prozent Kontrolle und Export. Die Generierung ist also nicht der aufwendigste Teil, sondern der sichtbarste.
Rollen lassen sich auch in kleinen Teams klar trennen. Eine Person verantwortet Dramaturgie und Text, eine zweite Bildsprache und Prompts, eine dritte Schnitt und Ton. Bei Einzelarbeit hilft es, diese Rollen zeitlich zu trennen: erst schreiben, dann Bilder entwickeln, dann schneiden. Der Wechsel der Perspektive ist produktiver als das gleichzeitige Jonglieren aller Entscheidungen.
Bei der Werkzeugauswahl ist die Modelllandschaft zu schnelllebig für einen starren Vergleich. Prüfen Sie stattdessen Kriterien. Erstens Konsistenzfähigkeit: Unterstützt das Werkzeug die Arbeit mit Referenzbildern oder Keyframes, oder nur reine Textbeschreibung? Zweitens Kontrolle: Lassen sich Kamera, Bewegungsrichtung und Länge steuern? Drittens Auflösung und maximale Länge pro Durchlauf – reicht das für Ihre geplanten Schnittlängen? Viertens Wiederholbarkeit: Liefert dieselbe Eingabe ähnliche Ergebnisse? Fünftens Integration: Passen Exportformate und Metadaten in Ihren bestehenden Schnittablauf?
Für Planung und Storyboarding genügen klassische Text- und Bildwerkzeuge. Für Bewegung und Animation brauchen Sie videogenerierende Modelle. Für Stimme nutzen Sie eine Sprachsynthese oder eine Aufnahme, für Mischung und Schnitt ein Programm mit sauberer Audiopipeline. Entscheidend ist nicht die Anzahl der Werkzeuge, sondern eine stabile Kette von Skript über Bild zu Ton – wenige Werkzeuge, die zuverlässig ineinandergreifen, schlagen eine lange Liste halb verstandener Optionen.
Typische Fehler, ihre Symptome und Gegenmaßnahmen
Kein Skript. Symptom: viele schöne Clips, kein Zusammenhang, ständiges Umordnen in der Timeline. Gegenmaßnahme: Textfassung schreiben, laut vorlesen, Logline und Beat-Sheet anlegen, bevor ein Modell geöffnet wird.
Überproduktion. Symptom: zu viele Einstellungen, zu viele Perspektivwechsel, das Publikum verliert den Faden. Gegenmaßnahme: Szenenzahl reduzieren, starken Bildern Raum geben, jede Einstellung auf eine Aufgabe prüfen.
Inkonsistentes Licht. Symptom: Die Sequenz wirkt zusammengesetzt, obwohl jede Einstellung einzeln überzeugt. Gegenmaßnahme: Palette pro Akt definieren, Referenzbilder nebeneinander vergleichen, Farbtemperatur nachträglich angleichen.
Ignorierter Ton. Symptom: Gute Bilder, aber niedrige Verweildauer beim Publikum. Gegenmaßnahme: Zeit für Sprachaufnahme, Rauschunterdrückung, Pegelausgleich und Musikmischung einplanen – mindestens ein Drittel der Gesamtzeit.
Fehlende Versionierung. Symptom: Eine gelungene Szene lässt sich nicht reproduzieren, ein Nachdreh wird zum Neustart. Gegenmaßnahme: Prompts, Referenzbilder und Einstellungen strukturiert ablegen, Dateien und Einstellungen konsistent benennen.
Zu viele Verbote im Prompt. Symptom: korrekte, aber leblose und flache Bilder. Gegenmaßnahme: Ausschlussliste kürzen, stattdessen positiv beschreiben, was sichtbar sein soll.
Falsche Reihenfolge. Symptom: Stunden im Modell verbracht, aber kein Fortschritt in der Geschichte. Gegenmaßnahme: Die Generierung als ausführenden Schritt behandeln, nie als Entwicklungsphase.
FAQ: Häufige Fragen zum KI-Storytelling
Wie lang sollte ein KI-generiertes Video sein?
FÜr Social-Feeds liegt der praktische Bereich bei 15 bis 45 Sekunden, weil die Abbruchrate danach deutlich steigt. Erklärformate funktionieren zwischen zwei und vier Minuten. Entscheidend ist weniger die Länge als die Frage, ob jede Einstellung eine Aufgabe erfüllt.
Brauche ich ein Storyboard?
Zumindest eine Szenenliste mit Keyframes. Ohne visuelle Referenzen entsteht keine Konsistenz, und Nacharbeit kostet mehr Zeit als die Vorbereitung. Ein Stimmungsboard mit acht bis zwölf Bildern ist ein guter Kompromiss, wenn Ihnen klassisches Storyboarding zu aufwendig ist.
Wie viel Zeit sollte ich für die Nachbearbeitung einplanen?
Rechnen Sie mit 30 bis 50 Prozent der Gesamtzeit für Schnitt, Ton und Farbabgleich. Die Generierung ist der schnellste Teil des Prozesses, nicht der aufwendigste.
Eignen sich KI-Videos für Markeninhalte?
Ja, wenn Konsistenz und Tonqualität stimmen und die visuelle Sprache der Marke in Referenzbildern festgehalten ist. Legen Sie vorab verbindliche Farben, Typografie und Bildcharakter fest und prüfen Sie jede Einstellung gegen diese Vorgaben.
Wie viele Varianten sollte ich pro Szene erzeugen?
Mindestens drei, besser fünf. Die Auswahl entsteht durch Vergleich. Reserve-Material im vielleicht-Korb ist keine Verschwendung, sondern Versicherung gegen spätere Änderungen im Schnittrhythmus.
Was tun, wenn eine Figur nicht stabil bleibt?
Reduzieren Sie die Anzahl gleichzeitig sichtbarer Figuren, verankern Sie zwei unveränderliche Merkmale im Prompt und arbeiten Sie mit einem festen Referenzbild statt mit reiner Textbeschreibung. Oft hilft es außerdem, die Bewegung zu verlangsamen, weil schnelle Bewegungen mehr Interpretationsspielraum lassen.
Wie verhindere ich, dass alle Szenen gleich aussehen?
Variieren Sie Brennweite, Perspektive und Lichtrichtung pro Akt. Planen Sie eine visuelle Dramaturgie, die sich über den Verlauf verändert – zum Beispiel von offenen, hellen Bildern zu engen, kontrastreicheren Einstellungen.
Wie viele Werkzeuge brauche ich wirklich?
FÜr die meisten Projekte genügen vier bis fünf: ein Textwerkzeug für Skript und Szenenliste, ein Bildwerkzeug für Referenzen, ein videogenerierendes Modell, ein Schnittprogramm und eine Stimmlösung. Mehr Werkzeuge erhöhen selten die Qualität, aber fast immer den Koordinationsaufwand.
Was ist der wichtigste erste Schritt?
Das Skript. Schreiben Sie eine Fassung, die auch ohne Bilder funktioniert. Alles Weitere – Prompts, Referenzen, Modelle, Effekte – dient dazu, diese Fassung sichtbar zu machen, nicht dazu, sie zu ersetzen.
Wer diese Reihenfolge einhält, arbeitet am Ende nicht nur schneller, sondern liefert zuverlässig Inhalte, die eine Geschichte erzählen statt nur gut auszusehen. Genau das ist in einem Umfeld, in dem täglich unzählige Videos erscheinen, der eigentliche Wettbewerbsvorteil: nicht der eine Glückstreffer, sondern ein Ablauf, der sich Woche für Woche wiederholen lässt.


