Vom Drehbuch zur Szene: Wie KI-Skripte den Produktionsfluss umdrehen
Wer heute ein Video produziert, arbeitet selten noch linear. Früher galt eine klare Reihenfolge: Exposé, Drehbuch, Shotliste, Dreh, Schnitt, Vertonung. Jeder Schritt war eine Schleuse, an der ein Projekt hängen bleiben konnte. Mit generativen Video-Modellen hat sich die Kette verkürzt, aber sie ist nicht verschwunden — sie hat ihre Form geändert. Das Skript ist nicht mehr ausschließlich ein Dokument für Menschen. Es ist gleichzeitig eine Spezifikation für Maschinen.
Das hat eine praktische Konsequenz, die viele unterschätzen: Jede Beschreibung, die im Skript fehlt, wird vom Modell nicht als Lücke, sondern als Freiraum interpretiert. Ein Satz wie „Sie betritt den Raum und schaut sich um“ ergibt für einen menschlichen Kameramann ein klares Bild. Für ein Videomodell ist er ein Zufallsgenerator: Brennweite, Tageszeit, Lichtstimmung, Kleidung, Blickrichtung und Tempo werden gewürfelt. Wer zwölf Shots so beschreibt, erhält zwölf unterschiedliche Welten, die sich nicht zu einer Szene fügen.
Die Lösung ist unspektakulär, aber wirksam: das Skript als strukturierte Szenenbeschreibung schreiben. Statt Prosa entsteht eine Tabelle aus Szenen, Einstellungen und Parametern. Der künstlerische Kern bleibt — Figur, Konflikt, Wendepunkt —, aber er wird in eine Form gebracht, die Modelle tatsächlich auslesen können. Genau dieser Zwischenschritt, halb Drehbuch, halb technische Spezifikation, ist der eigentliche Hebel moderner Videoproduktion.
Wer ihn beherrscht, produziert nicht schneller, weil die Generierung schnell ist, sondern weil Nacharbeit wegfällt. Und Nacharbeit ist bei KI-Video der wahre Kostenfaktor: Jeder neu gerenderte Shot kostet Zeit, Rechenleistung und Nerven.
Die Bausteine eines KI-tauglichen Skripts
Ein Skript, das mit generativen Modellen funktioniert, besteht aus vier Schichten. Sie bauen aufeinander auf, und wenn eine fehlt, rutscht die Qualität sichtbar ab.
Logline, Beat-Sheet und Szenenkarten
Die oberste Schicht ist dramaturgisch. Eine Logline in maximal zwei Sätzen beantwortet: Wer will was, warum geht es nicht, was steht auf dem Spiel? Darunter liegt ein Beat-Sheet mit fünf bis acht Stationen. Für ein 60-Sekunden-Video reichen vier: Ausgangslage, Störung, Wendung, Auflösung.
Darunter kommen Szenenkarten. Jede Karte enthält Ort, Zeit, beteiligte Figuren, emotionale Temperatur und die Funktion der Szene im Ganzen. Diese Karten sind der Ort, an dem sich Storytelling und Produktion treffen — sie sind kurz genug, um sie beim Prompting direkt zu verwenden.
Shot-Liste statt Fließtext
Die zweite Schicht ist handwerklich. Aus jeder Szenenkarte entstehen zwei bis fünf Einstellungen. Eine brauchbare Shot-Liste hat pro Zeile: Nummer, Größe (Total, Halbtotal, Nah, Detail), Kamerabewegung (statisch, Schwenk, Fahrt, Handkamera), Motiv, Handlung, Dauer und Übergang.
Ein Beispiel für eine Zeile, die funktioniert: „Shot 07 | Halbtotal | langsame Fahrt nach links | Küche am Morgen, Gegenlicht durch Jalousien | Figur gießt Kaffee ein, Blick aus dem Fenster | 3,5 s | harter Schnitt.“ Diese Zeile ist später eins zu eins in einen Prompt übersetzbar.
Kontinuitätsregeln und Verbotsliste
Die dritte Schicht ist oft unsichtbar, entscheidet aber über den Wiedererkennungswert. Notiere feste Merkmale: Haarfarbe, Frisur, Kleidungsstücke, Requisiten, Farbpalette, Lichtrichtung. Ergänze eine kurze Verbotsliste — was auf keinen Fall im Bild auftauchen darf, etwa zusätzliche Personen im Hintergrund, lesbare Texte, Logos oder Wetterwechsel innerhalb einer Szene.
Ton und Text
Die vierte Schicht ist auditiv. Off-Sprecher-Text, On-Screen-Dialog, Musikstimmung und Geräuschebene sollten pro Szene notiert sein. Wer Sprechertext erst nach dem Rendern schreibt, schneidet später Bilder auf Sätze zu — statt Sätze auf Bilder. Das führt fast immer zu hektischen Schnitten und gequetschter Musik.
Schritt für Schritt vom leeren Blatt zum fertigen Schnitt
Die folgende Reihenfolge hat sich in der Praxis bewährt, egal ob Social-Clip oder erklärender Langform-Beitrag.
Phase 1: Auftrag und Format klären
Bevor ein einziges Wort generiert wird, werden vier Dinge festgelegt: Zielgruppe, Kernbotschaft, Länge und Ausspielkanal. Ein vertikales 9:16-Format für mobile Feeds verlangt andere Bildkompositionen als ein 16:9-Erklärvideo. Gesichter gehören im Hochformat höher ins Bild, Details näher an die Kamera, Text nie in die unteren zwanzig Prozent.
Phase 2: Recherche und Struktur
Erst jetzt kommt das Sprachmodell ins Spiel — nicht als Autor, sondern als Strukturierer. Ein sinnvoller Prompt lautet: „Ich mache ein 90-Sekunden-Erklärvideo für Einsteiger zum Thema X. Erstelle ein Beat-Sheet mit fünf Stationen und markiere pro Station die emotionale Kurve.“ So entsteht ein Gerüst, das man prüfen und verwerfen kann, bevor Arbeit in Bilder fließt.
Phase 3: Skript und Szenenbeschreibungen prompten
Der entscheidende Trick: In zwei getrennten Durchgängen arbeiten. Zuerst den Sprechertext schreiben — kurz, sprechbar, ohne Schachtelsätze. Danach die Bilder dazu, aber in separaten Prompts pro Shot. Wer Skript und Bildbeschreibung in einem Aufwasch generiert, bekommt austauschbare Sätze, die sich nicht in konsistente Einstellungen übersetzen lassen.
Phase 4: Bild- und Videogenerierung
Aus der Shot-Liste entstehen Keyframes. Diese Keyframes sind der eigentliche Qualitätsanker. Erst wenn Standbilder für alle Einstellungen stimmig sind, lohnt sich die Animierung. Ein bewährter Arbeitsrhythmus: alle Keyframes rendern, in der Shot-Reihenfolge ansehen, problematische Bilder korrigieren, dann erst animieren.
Phase 5: Ton, Schnitt, Export
Vertonung, Musikbett, Geräusche und Untertitel werden getrennt produziert. Beim Schnitt gilt: lieber ein Shot zu kurz als zu lang. Generative Clips sind am Anfang und Ende meist unsauber, deshalb werden 0,3 bis 0,5 Sekunden an beiden Enden abgeschnitten. Für Details, die lebendig wirken sollen, hilft eine leichte Nachschärfung und eine dezente Farbkorrektur, damit alle Shots denselben Look teilen.
Prompt-Handwerk: Konsistenz über viele Shots
Konsistenz ist das größte Problem generativer Videoproduktion. Es gibt drei Hebel, die zuverlässig wirken.
Charakterbibel und Referenzbilder
Lege eine Figurenkarte an: Alter, Gesichtsform, Frisur, Kleidung, Accessoires, typische Haltung. Dazu drei bis fünf Referenzbilder aus unterschiedlichen Winkeln. Diese Karte wird in jeden Prompt kopiert, wortwörtlich und immer in derselben Reihenfolge. Schon kleine Umformulierungen verändern das Gesicht.
Keyframes als Regieanweisung
Wenn ein Modell Bild-zu-Video unterstützt, kontrolliert der Keyframe die Komposition, der Textprompt nur die Bewegung. Das ist der zuverlässigste Weg zu konsistenten Ergebnissen: Erst ein Standbild bauen, das exakt stimmt, dann nur noch die Bewegung beschreiben — „langsame Kamerafahrt nach vorn, Haare bewegen sich leicht im Wind, der Hintergrund bleibt stabil“. Wer versucht, Bewegung und Aussehen gleichzeitig im Text zu steuern, verliert die Kontrolle.
Kamera, Licht, Objektiv als Prompt-Bausteine
Drei Kategorien reichen, um Shots planbar zu machen. Kamera: Brennweite, Höhe, Bewegung, Tempo. Licht: Quelle, Richtung, Härte, Tageszeit, Farbtemperatur. Material: Objektivcharakter, Filmkorn, Schärfentiefe, Farblook. Ein Prompt, der alle drei benennt, produziert reproduzierbare Bilder. Ein Prompt, der nur das Motiv nennt, produziert Glückstreffer.
Werkzeuge im Vergleich: Welche Rolle spielt was
Es gibt kein einzelnes Werkzeug, das den gesamten Ablauf abdeckt. Sinnvoll ist eine Aufteilung nach Aufgaben.
| Aufgabe | Typische Werkzeuge | Worauf achten |
|---|---|---|
| Struktur und Sprechertext | ChatGPT, Claude, Gemini | Tonfall steuerbar, kurze Sätze, klare Formatvorgaben |
| Keyframes und Stillbilder | Midjourney, Flux, Stable Diffusion, ComfyUI | Referenzbild-Unterstützung, Reproduzierbarkeit per Seed |
| Animation | Runway, Kling, Luma, Pika, Veo, Sora | Bild-zu-Video, Länge pro Clip, Bewegungstreue |
| Sprache und Musik | ElevenLabs, Suno, Bibliotheksmusik | Sprechgeschwindigkeit, Betonung, Rechteklärung |
| Schnitt und Finish | DaVinci Resolve, Premiere Pro, CapCut | Farbkorrektur, Untertitel, Exportprofile |
| Upscaling und Reparatur | Topaz Video AI, Frame-Interpolation | Artefakte entfernen, ohne Gesichter zu verfremden |
Wichtig ist weniger die Marke als die Schnittstelle: Unterstützt das Videomodell Bild-zu-Video? Lässt es sich mit festem Seed reproduzieren? Kann man Länge und Seitenverhältnis frei wählen? Diese drei Fragen sortieren den Markt schneller als jede Feature-Liste.
Entscheidungskriterien: Welcher Ansatz zu welchem Projekt passt
Nicht jedes Format braucht dieselbe Sorgfalt. Die folgenden drei Projekttypen unterscheiden sich deutlich.
Kurze Social-Clips
Bei 15 bis 30 Sekunden zählt der erste Eindruck. Hier lohnen sich acht bis zwölf sehr kurze Shots mit harten Schnitten. Konsistenz ist weniger kritisch, solange Farbpalette und Tempo stimmen. Der Text wird zuerst geschrieben, dann auf die Sekunden verteilt: etwa zwei bis drei Wörter pro Sekunde Sprechgeschwindigkeit.
Erklärvideos und Tutorials
Hier trägt die Struktur. Ein Erklärvideo braucht grafische Elemente, Diagramme und wiederkehrende Bildmuster, damit Zuschauer Orientierung behalten. Animierte Diagramme sind oft günstiger und klarer als realistische Szenen. Menschen sollten sparsam eingesetzt werden — als Sprecherfigur oder für emotionale Anker.
Erzählformate mit wiederkehrenden Figuren
Sobald dieselbe Figur in mehreren Videos auftaucht, wird Konsistenz zur Hauptaufgabe. Dann lohnt sich eine echte Figurenbibel, ein festes Farbschema und ein begrenztes Set an Drehorten. Drei bis vier wiederkehrende Locations sind besser als zwölf wechselnde, weil Zuschauer Räume wiedererkennen und die Produktion reproduzierbar bleibt.
Typische Fehler und wie du sie vermeidest
Die häufigsten Probleme sind gut dokumentiert, weil sie fast alle Produktionen betreffen.
Zu lange Prompts mit widersprüchlichen Angaben. „Nahaufnahme einer weiten Landschaft“ ergibt kein kohärentes Bild. Widersprüche erzeugen Artefakte statt Kreativität.
Text im Bild. Modelle erzeugen Buchstaben, die wie Schrift aussehen, aber keine sind. Beschriftungen gehören in den Schnitt, nicht in die Generierung.
Zu viele Figuren pro Shot. Ab drei Personen steigt die Fehlerquote deutlich. Gruppenaufnahmen löst man besser über Silhouetten, Unschärfe oder mehrere Einzelshots.
Fehlende Kontinuität der Lichtrichtung. Wenn in Shot 4 die Sonne von links und in Shot 5 von rechts kommt, wirkt die Szene unbewusst falsch. Lichtrichtung einmal festlegen und in jeden Prompt schreiben.
Bewegung doppelt beschreiben. Wenn der Prompt eine Kamerafahrt und das Standbild bereits eine perspektivische Flucht enthält, übersteuert das Modell. Bewegung im Text, Komposition im Bild — nicht beides im Text.
Kein Rohmaterial-Reserve. Wer nur die benötigten Clips rendert, hat beim Schnitt keinen Puffer. Zwei Varianten pro kritischem Shot sparen später Stunden.
Qualitätssicherung: Der Kontinuitätscheck vor dem Rendern
Bevor die Animierung startet, lohnt ein strukturierter Durchgang. Vier Prüfungen decken fast alle Probleme ab.
- Figurencheck. Sind Gesicht, Frisur und Kleidung über alle Keyframes identisch? Auffällig ist meist nicht das Detail, sondern die Gesichtsform.
- Farbcheck. Liegen alle Bilder in derselben Palette? Ein kühler Blaustich neben warmem Gelb bricht den Zusammenhang.
- Achsencheck. Bleibt die Blickrichtung über Schnitte hinweg stabil? Ein Achssprung irritiert stärker als ein unscharfer Hintergrund.
- Requisitencheck. Taucht ein Gegenstand in Shot 3 auf und in Shot 6 in veränderter Form wieder auf, fällt das sofort auf.
Nach dem Rendern kommt ein zweiter Durchgang: Ton prüfen, Untertitel gegenlesen, Export in Zielauflösung testen. Der letzte Schritt wird oft vergessen — ein Video, das auf dem Monitor perfekt aussieht, kann auf dem Smartphone unlesbare Untertitel oder abgeschnittene Gesichter haben.
Eine Wochenroutine für Solo-Creator und kleine Teams
Ein realistischer Rhythmus hilft mehr als ein perfekter Plan. Bewährt hat sich eine Aufteilung über fünf Arbeitstage.
Tag 1: Konzept. Logline, Beat-Sheet, Formatentscheidung, Sprechertext in Rohfassung.
Tag 2: Shot-Liste und Figurenkarte. Alle Keyframe-Prompts schreiben, ohne zu rendern.
Tag 3: Keyframes rendern und auswählen. Erst hier zeigt sich, ob die Beschreibungen tragen.
Tag 4: Animierung und Tonproduktion. Parallel arbeiten, während Clips rendern.
Tag 5: Schnitt, Farbkorrektur, Untertitel, Export und Archivierung.
Der wichtigste Teil ist die Archivierung. Wer Figurenkarten, Prompts, Seeds und Projektdateien sauber ablegt, produziert die nächste Folge in einem Bruchteil der Zeit. Der Wiedererkennungswert wächst dabei automatisch, weil Look und Figuren identisch bleiben.
FAQ
Wie lang sollte ein KI-Video-Skript sein?
Als Faustregel gilt eine Seite Skript pro Minute fertiges Video, bei sehr bildlastigen Formaten entsprechend weniger. Entscheidend ist nicht die Textmenge, sondern die Zahl der Shots: Für eine Minute rechnet man mit zwölf bis zwanzig Einstellungen, bei schnellen Social-Clips auch mehr.
Brauche ich zwingend ein Sprachmodell?
Nein, aber es beschleunigt Struktur, Variantenbildung und Übersetzung deutlich. Der größte Nutzen liegt nicht im Formulieren, sondern im Umsortieren: Ein Modell kann eine Szene in fünf Varianten mit unterschiedlicher emotionaler Kurve ausgeben. Die Auswahl bleibt eine menschliche Entscheidung.
Warum sehen meine Figuren in jedem Shot anders aus?
Meist fehlt eine Figurenbibel oder sie wird nicht wortgleich wiederholt. Zweite häufige Ursache: Der Keyframe stimmt, aber der Bewegungsprompt beschreibt zusätzlich das Aussehen und überschreibt damit das Bild. Dritte Ursache sind sehr kurze Clips mit starker Bewegung, bei denen Details zerfallen.
Wie viele Varianten sollte ich pro Shot rendern?
Zwei bis drei Varianten für Schlüsselbilder, eine für Nebenbilder. Wer bei jeder Einstellung zehn Varianten erzeugt, verliert mehr Zeit mit Auswahl als mit kreativer Arbeit. Besser ist es, den Prompt zu verbessern, statt die Menge zu erhöhen.
Kann ich realistisch wirkende Menschen zuverlässig erzeugen?
In Nahaufnahmen ja, in Bewegung mit mehreren Personen schwierig. Bewährt ist eine Mischung: Details und Hände sparsam einsetzen, Gesichter frontal und ruhig halten, Gruppenauflösungen über Unschärfe oder Silhouetten lösen. Sprechende Gesichter bleiben die anspruchsvollste Aufgabe, weil kleinste Lippen- und Kieferbewegungen auffallen.
Woran erkenne ich, dass ein Skript verfilmbar ist?
An einer einfachen Probe: Kann eine fremde Person jede Zeile lesen und ein Bild zeichnen, ohne nachzufragen? Wenn ja, ist das Skript reif. Wenn nein, fehlen Angaben zu Ort, Licht, Größe oder Bewegung — und die wird sich das Modell selbst ausdenken.
Wie gehe ich mit Musik und Rechten um?
Musik und Stimme sollten aus klar lizenzierten Quellen stammen oder selbst erzeugt sein. Bei generativer Musik lohnt es sich, die Nutzungsbedingungen vor der Veröffentlichung zu prüfen, besonders bei kommerzieller Verwendung. Sicherheitshalber werden Projektdateien, Prompt-Protokolle und Quellenvermerke archiviert.
Eignet sich der Workflow auch für lange Formate?
Ja, mit einer Änderung: Statt alles am Stück zu erzählen, wird in Kapitel von drei bis fünf Minuten gedacht. Jedes Kapitel bekommt eigene Figurenkarte, Farbpalette und Shot-Liste. So bleibt die Konsistenz über längere Laufzeiten beherrschbar, und Fehler wirken sich nur auf ein Kapitel aus, nicht auf das gesamte Video.

