Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

KI-Drehbuch und Shot-Design: Leitfaden für Videoproduktion

Sep 29, 2026

Warum Storytelling und Shot-Design am selben Tisch entstehen sollten

Die klassische Produktionsreihenfolge lautet: schreiben, planen, drehen. In der Praxis führt diese Trennung zu einem wiederkehrenden Problem. Das Drehbuch beschreibt eine Stimmung, für die die geplante Einstellungsfolge kein Bild findet. Die Shot-Liste enthält Bilder, die technisch sauber sind, aber keine dramaturgische Aufgabe erfüllen. Am Ende wird zweimal gearbeitet: einmal für den Text, einmal für das Bild – und beim Schnitt stellt sich heraus, dass die Hälfte der Aufnahmen nicht gebraucht wird.

Der Grund ist einfach: Eine Szene ist gleichzeitig eine Information und eine Perspektive. Wer sie zuerst als Text und später als Bild denkt, trifft zwei unabhängige Entscheidungen, die sich anschließend widersprechen können. Eine Figur, die in der Szene die Kontrolle verliert, braucht eine Einstellung, die diesen Kontrollverlust sichtbar macht – eine Hand, die zögert, ein Blick, der aus dem Bild rutscht, eine Kamera, die zu früh schwenkt. Solche Details entstehen nicht nachträglich aus einer Tabelle heraus. Sie müssen aus der Szene abgeleitet werden, während man sie plant.

KI verändert diesen Ablauf nicht dadurch, dass sie das Schreiben übernimmt. Sie verändert ihn, weil sie beide Ebenen in einem Arbeitsschritt verarbeiten kann: eine Szene als Textstruktur und als Einstellungsfolge. Das ist der eigentliche Hebel – nicht die Geschwindigkeit allein, sondern die Kopplung von Dramaturgie und Bildsprache. Jede Änderung an einer Figur, einem Konflikt oder einem Ort schlägt auf die Shot-Liste durch und umgekehrt.

Wer diesen Hebel nutzen will, muss allerdings wissen, welche Entscheidungen beim Menschen bleiben. Das sind mehr, als viele Anleitungen zugeben: Ton, Subtext, ethische Fragen der Darstellung, Faktenprüfung und die Auswahl zwischen Varianten. Dieser Leitfaden beschreibt einen durchgehenden Arbeitsablauf – von der ersten Notiz bis zur vorbereiteten Videogenerierung – und benennt an jeder Stelle die Prüfpunkte, an denen Qualität tatsächlich entsteht.

Drei Dokumente, die vor dem ersten Prompt entstehen

Bevor du ein Sprachmodell oder einen Bildgenerator öffnest, brauchst du drei Dokumente. Sie dürfen kurz sein, aber sie müssen existieren. Ohne sie liefert jedes Werkzeug beliebige, austauschbare Ergebnisse – und du verbringst mehr Zeit mit Korrigieren als mit Konzipieren. Die drei Dokumente haben unterschiedliche Aufgaben: Das erste legt die Richtung fest, das zweite die Reihenfolge, das dritte den Umfang. Zusammen bilden sie den Vertrag, gegen den jede Ausgabe geprüft wird.

Logline und Publikumsversprechen

Die Logline ist ein Satz, der Figur, Ziel, Hindernis und Einsatz benennt. Ein Beispiel: „Eine Schichtleiterin in einem Logistikzentrum entdeckt, dass die neuen Routen ihres Arbeitgebers Menschen gefährden, und muss entscheiden, ob sie ihre Stelle riskiert.“ Dieser Satz legt fest, wessen Perspektive das Publikum einnimmt, welcher Konflikt trägt und welcher Einsatz auf dem Spiel steht. Aus ihm lässt sich später jede Einstellung ableiten: Wer schaut? Worauf? Mit welchem Abstand?

Ergänze ein Publikumsversprechen: Was soll das Publikum nach dem Video wissen, fühlen oder tun? Ein anderthalbminütiges Erklärvideo hat ein anderes Versprechen als ein dreiminütiger Markenfilm. Formuliere es in einem Satz und hänge es sichtbar neben die Logline. Wenn eine Einstellung weder zur Logline noch zum Versprechen beiträgt, hat sie im Plan nichts zu suchen.

Beat-Sheet mit acht bis zwölf Wendepunkten

Ein Beat-Sheet listet die Wendepunkte in Reihenfolge, jeweils in einer Zeile. Acht bis vierzehn Beats reichen für kurze Formate. Entscheidend ist, dass jeder Beat eine Veränderung beschreibt, nicht nur eine Information. „Sie erfährt von den Routen“ ist eine Information. „Sie findet die Routendatei und erkennt, dass ihr eigener Name auf der Freigabeliste steht“ ist ein Beat. Der Unterschied liegt im Zustandswechsel: Vorher wusste sie nichts, nachher muss sie handeln.

Beats liefern der Bildplanung automatisch Konflikte, Requisiten und Orte. Ein Beat, in dem eine Figur etwas versteckt, braucht eine Einstellung mit Händen und eine Einstellung mit Gesicht. Ein Beat, in dem eine Entscheidung fällt, braucht Nähe. Wer die Beats sauber formuliert, bekommt die halbe Shot-Liste geschenkt.

Szenenliste mit Funktion, Ort und Figuren

Übersetze die Beats in Szenen und notiere für jede Szene drei Dinge: Funktion (Exposition, Eskalation, Wendepunkt, Auflösung), Ort und beteiligte Figuren. Szenen ohne Funktion werden gestrichen, nicht umgeschrieben. Diese Disziplin spart später mehr Arbeit als jede Prompt-Optimierung, weil sie verhindert, dass du Bilder für Szenen planst, die der Schnitt ohnehin entfernt.

Ergänze eine vierte Spalte: geschätzte Dauer. Eine Szene, die nur zwei Sekunden Bildschirmzeit hat, braucht keine vier Einstellungen. Die Dauerangabe zwingt zu realistischen Erwartungen und verhindert, dass ein 90-Sekunden-Video mit Material für fünf Minuten geplant wird.

Wie Sprachmodelle beim Strukturieren helfen – und wo sie versagen

Sprachmodelle sind hervorragend darin, Struktur zu erzeugen, Varianten zu vergleichen und Widersprüche zu finden. Sie sind schlecht darin zu wissen, was du sagen willst. Behandle sie deshalb als Struktur-Werkzeug, nicht als Autor. Diese Haltung klingt selbstverständlich, hat aber praktische Konsequenzen: Du gibst immer ein fertiges Gerüst hinein und lässt dir Alternativen dazu bauen – statt ein leeres Blatt füllen zu lassen.

Drei Aufgaben, die Assistenten zuverlässig erledigen

Variantenbildung: Ein Assistent liefert in wenigen Minuten fünf unterschiedliche Dramaturgien für dasselbe Material – chronologisch, als Rückblende, als Kammerspiel zweier Figuren, als Countdown, als Beobachtung von außen. Das ist wertvoll, weil die Auswahl schwerer ist als das Erzeugen.

Konsistenzprüfung: Du kannst eine Figurenbibel und eine Szenenliste gemeinsam hochladen und fragen, an welchen Stellen Eigenschaften, Requisiten, Zeitangaben oder Orte widersprüchlich werden. Diese Prüfung findet Fehler, die beim reinen Lesen durchgehen.

Übersetzungsarbeit: Aus einer Szene lassen sich Einstellungsgrößen, Winkel und Motivvorschläge ableiten, die als Ausgangspunkt für die Shot-Liste dienen. Auch hier gilt: Du entscheidest, was übernommen wird, und streichst, was nach Klischee klingt.

Vier Grenzen, die du kennen musst

Subtext entsteht nicht auf Bestellung. Modelle formulieren Gefühle oft explizit aus – „sie ist wütend“ statt eines Blicks auf die Kaffeetasse, die zu heiß ist. Ton und Rhythmus gehen verloren, wenn du nicht sehr genau vorgibst, wie gesprochen werden soll. Kulturelle Details sind häufig generisch: Wohnungen sehen nach Katalog aus, Berufe nach Klischee. Und Modelle erfinden gern Fakten. Bei erklärenden Videos musst du jede Zahl, jeden Prozess und jede Aussage gegen eine belastbare Quelle prüfen.

Ein Prompt-Muster in vier Bausteinen

Ein brauchbares Muster hat vier Teile: Rolle, Kontext, Aufgabe, Format. Ein Beispiel: „Du bist Dramaturg für kurze Markenfilme. Hier sind meine Logline, mein Beat-Sheet und meine Szenenliste. Finde die drei schwächsten Übergänge und schlage für jeden eine Alternative vor, die den Konflikt verschärft. Antworte als Tabelle mit den Spalten Beat, Problem, Alternative und betroffene Figur.“ Ohne Formatvorgabe bekommst du Fließtext, den du mühsam übertragen musst. Mit Formatvorgabe wird die Antwort direkt zum Arbeitsdokument.

Vom Beat zur Shot-Liste: die eigentliche Übersetzungsarbeit

Die Shot-Liste ist das Bindeglied zwischen Drehbuch und Kamera beziehungsweise Videogenerierung. Sie besteht aus Zeilen, nicht aus Prosa. Jede Zeile enthält: Szenennummer, Einstellungsgröße, Winkel, Bewegung, Motiv, Dauer und Funktion. Diese sieben Felder sind kein bürokratisches Ritual, sondern die Grundlage dafür, dass generierte Einstellungen später zusammenpassen.

Einstellungsgrößen und ihre Wirkung

Die weite Einstellung zeigt Kontext und Isolation. Die halbtotale Einstellung ordnet Figuren zueinander ein. Die Nahaufnahme zeigt Entscheidungen, die Großaufnahme zeigt Widerstand – ein zitterndes Kinn, ein Blinzeln, eine Hand, die sich schließt. Ein häufiger Anfängerfehler ist eine reine Abfolge von Nahaufnahmen: Das Publikum verliert den Raum und damit die Orientierung. Eine brauchbare Faustregel für kurze Formate: weit beginnen, enger werden, am Ende wieder in eine weitere Einstellung auflösen.

180-Grad-Logik, Eyeline und Achsensprung

Wenn zwei Figuren miteinander sprechen, definiert eine gedachte Linie zwischen ihnen den Handlungsraum. Bleib auf einer Seite dieser Linie, sonst schauen beide Figuren in dieselbe Richtung und die Szene wirkt zusammenhanglos. Die Blickrichtung muss stimmen: Wer nach rechts schaut, schaut in der Gegeneinstellung nach links. Diese Regel klingt technisch, ist aber einer der stärksten Konsistenzhebel für generierte Szenen, weil Videomodelle die Richtung bei mehreren Einstellungen gern willkürlich wechseln. Notiere die Achse deshalb explizit in jeder Shot-Zeile.

Eine Szene in drei bis sechs Einstellungen zerlegen

Eine Szene braucht selten mehr als sechs Einstellungen. Zerlege sie nach Funktion: Orientierung, Aktion, Reaktion, Detail, Entscheidung, Auflösung. Nicht jede Szene füllt alle sechs. Eine Actionszene kann mit drei Einstellungen auskommen, ein Dialog braucht möglicherweise fünf. Prüfe jede Einstellung mit einer Frage: Welche neue Information liefert sie? Wenn die Antwort „keine“ lautet, streiche sie. Kürzen ist billiger als generieren.

Ankerbild zuerst, Rest danach

Bestimme pro Szene eine Ankereinstellung – das Bild, das den Kern der Szene trägt. Dieses Bild erzeugst du zuerst und prüfst daran Stil, Licht, Farbtemperatur und Figurenkonsistenz. Erst wenn der Anker sitzt, entstehen die übrigen Einstellungen. Dieses Vorgehen verhindert den teuersten Fehler im ganzen Prozess: zwanzig Einstellungen zu rendern, die alle einen leicht anderen Look haben.

Figurenkonsistenz ist eine Planungsfrage

Nichts zerstört die Wirkung eines KI-Videos schneller als eine Figur, die zwischen zwei Einstellungen Gesicht, Kleidung oder Alter wechselt. Konsistenz ist deshalb keine Nachbearbeitungsfrage, sondern eine Frage der Vorbereitung.

Die Figurenbibel

Lege für jede Figur ein kurzes Dossier an: Alter, Gesichtsform, Frisur, Haarfarbe, zwei bis drei Kleidungsstücke, eine Signatur-Requisite wie Brille, Narbe, Uhr oder Armband, Körperhaltung und Sprechweise. Beschreibe so konkret, dass dieselbe Formulierung in jedem Prompt wiederholt werden kann. Kopiere den Baustein wörtlich. Variationen in der Beschreibung erzeugen Variationen im Bild – auch dann, wenn du nur ein Adjektiv änderst.

Ergänze pro Figur eine Zeile zu Beleuchtung und Umgebung: In welchem Licht wird sie meist gesehen, in welchen Räumen bewegt sie sich? Diese Zusatzangaben verhindern, dass dieselbe Figur in einer Szene warm und in der nächsten kalt ausgeleuchtet wird, ohne dass es dramaturgisch gewollt ist.

Kontinuitäts-Check vor dem ersten Durchlauf

Prüfe vor dem ersten Rendern vier Punkte: Gibt es pro Figur einen wiederverwendbaren Prompt-Baustein? Sind Requisiten und Farbcodes festgelegt? Ist die Ausgangseinstellung jeder Szene bestimmt – Standort, Tageszeit, Wetter? Ist die Kleidung über Szenen hinweg logisch, kann sie innerhalb der erzählten Zeit wechseln? Wer diese vier Punkte abhakt, spart erfahrungsgemäß mehrere Durchläufe und viel Schnittarbeit.

Licht, Optik und Bewegung als dramaturgische Hebel

Bildsprache ist kein Dekor. Sie entscheidet, wem das Publikum folgt, wie nah es sich fühlt und wie viel es über die Situation weiß. Drei Hebel sind besonders wirksam und lassen sich in jeder Shot-Zeile festhalten.

Brennweite als Entscheidung

Weitwinkel verzerren Räume, betonen Distanz und lassen Figuren klein erscheinen. Normalbrennweiten wirken neutral und dokumentarisch. Telebrennweiten komprimieren den Raum, isolieren Figuren und erzeugen Nähe ohne körperliche Nähe. Wenn du eine Brennweite notierst, notiere auch die Begründung. Eine Einstellung mit 85 mm in einer überfüllten Halle sagt etwas anderes als dieselbe Einstellung mit 24 mm. In generierten Videos ist die Angabe zusätzlich ein Stabilitätsfaktor: Extreme Brennweiten erzeugen häufiger Verzerrungen an Rändern und Gesichtern.

Kamerabewegung braucht eine Begründung

Schwenk, Fahrt, Kran, Handkamera – jede Bewegung hat eine Aufgabe. Eine Fahrt nach vorn verdichtet, eine Fahrt nach hinten löst auf. Handkamera signalisiert Unruhe, ein Stativ signalisiert Kontrolle. In generierten Videos ist Bewegung besonders teuer: Je komplexer die Fahrt, desto höher die Wahrscheinlichkeit von Artefakten. Plane deshalb pro Szene höchstens eine aufwendige Bewegung und halte den Rest ruhig. Ruhige Einstellungen schneiden sich außerdem leichter.

Licht in drei Achsen

Arbeite mit drei Achsen: Härte (weich oder hart), Richtung (frontal, seitlich, Gegenlicht) und Farbe (warm, neutral, kühl). Gegenlicht erzeugt Geheimnis, seitliches Licht erzeugt Volumen, frontales Licht erzeugt Flachheit. Für Erklärvideos ist weiches, seitliches Licht meist die sicherste Wahl, weil es Gesichter strukturiert, ohne sie zu verschatten. Lege für jede Szene eine Lichtstimmung fest und wiederhole sie in den Prompts – sonst wechselt die Stimmung mitten in einer Szene.

Praxisbeispiel: ein 90-Sekunden-Erklärvideo in sieben Etappen

Angenommen, ein Weiterbildungsanbieter will erklären, wie ein Onboarding-Prozess in vier Wochen abläuft. Das Video soll 90 Sekunden lang sein, drei Figuren zeigen und auf einer Website eingebettet werden. So sieht der Ablauf aus:

  1. Material sichten. Sammle Fakten, Zitate und Referenzbilder. Sortiere alles nach Szenenfunktion, nicht nach Chronologie. Ergebnis: eine Liste mit etwa fünfzehn Fundstücken.
  2. Struktur bauen. Formuliere Logline, Publikumsversprechen und ein Beat-Sheet mit neun Beats, ohne KI. Erst wenn diese drei stehen, kommt der Assistent ins Spiel.
  3. Varianten prüfen. Lass zwei Dramaturgien gegeneinander laufen – chronologisch und aus Sicht einer neuen Mitarbeiterin – und entscheide nach einem klaren Kriterium: Welche Version macht den Konflikt am frühesten sichtbar?
  4. Szenenliste schärfen. Streiche Szenen ohne Funktion. Formuliere jede verbliebene Szene in drei Sätzen: Ausgangslage, Veränderung, Endpunkt. Am Ende bleiben sechs Szenen mit insgesamt 90 Sekunden.
  5. Shot-Liste ableiten. Übersetze die Szenen in zwölf Einstellungen. Achte auf Wechsel der Größen, die 180-Grad-Logik und eine klare Ankerentscheidung pro Szene. Notiere pro Zeile auch die benötigte Toninformation.
  6. Ankerbilder erzeugen. Rendere zuerst die sechs Ankerbilder, prüfe Stil, Licht und Figurenkonsistenz und korrigiere die Prompt-Bausteine, bevor die restlichen sechs Einstellungen entstehen.
  7. Montage vorbereiten. Plane Übergänge, Ton und Untertitel mit. Ein guter Schnitt kann mittelmäßige Bilder tragen, ein schlechter Schnitt zerstört gute Bilder.

Nach diesem Ablauf liegen zwölf prüfbare Artefakte vor: drei Plandokumente, eine Shot-Liste, sechs Ankerbilder, sechs Ergänzungsbilder und ein Schnittplan. Wenn ein Ergebnis nicht überzeugt, lässt sich eingrenzen, in welcher Etappe der Fehler entstanden ist – und du korrigierst dort, statt am Ende alles neu zu bauen.

Typische Fehler und ihre Gegenmaßnahmen

  • Zu früh generieren. Wer mit der Videogenerierung beginnt, bevor die Struktur steht, produziert teure Bilder für Szenen, die später entfallen. Gegenmaßnahme: eine Sperrfrist, bis Beat-Sheet und Szenenliste freigegeben sind.
  • Zu viele Einstellungen. Anfänger planen zwanzig Einstellungen für eine Minute. Gegenmaßnahme: auf acht bis zwölf kürzen und prüfen, ob jede Einstellung eine neue Information liefert.
  • Beschreibungen nicht wiederholen. Figuren sehen in jeder Einstellung anders aus. Gegenmaßnahme: wörtliche Prompt-Bausteine aus der Figurenbibel verwenden.
  • Bewegung als Selbstzweck. Jede Einstellung fährt, schwenkt oder kreist. Gegenmaßnahme: maximal eine aufwendige Bewegung pro Szene, der Rest ruhig.
  • Ton vergessen. Stimme, Atmosphäre und Musik werden am Ende angehängt. Gegenmaßnahme: in der Shot-Liste notieren, welche Einstellung welches Geräusch braucht.
  • Konsistenz erst beim Schnitt prüfen. Gegenmaßnahme: Ankerbilder zuerst, alles andere danach.
  • Unrealistische Zeitplanung. KI beschleunigt Konzeption und Varianten, nicht die Entscheidungsfindung. Gegenmaßnahme: bewusst Zeit für Auswahl und Verwerfen einplanen.
  • Fakten ungeprüft übernehmen. Gegenmaßnahme: jede Zahl und jede Prozessbeschreibung gegen eine Primärquelle abgleichen, bevor sie in die Shot-Liste wandert.

Der Werkzeug-Stack nach Rollen sortiert

Ein funktionierender Stack hat vier Schichten. In der Textschicht arbeiten Sprachmodelle wie ChatGPT oder Claude für Beat-Sheets, Varianten und Konsistenzprüfungen. In der Bildschicht erzeugen Storyboard-Werkzeuge oder Bildmodelle wie Midjourney und Stable Diffusion Ankerbilder und Referenzen. In der Videoschicht kommen Videomodelle wie Runway, Kling, Luma oder Sora zum Einsatz; hier zählt vor allem, wie gut sie Bewegung und Figurenkonsistenz halten. In der Nachbearbeitungsschicht übernehmen Schnittprogramme wie DaVinci Resolve oder Premiere Pro die Montage, dazu Werkzeuge für Farbkorrektur, Ton und Untertitel.

Wichtiger als die Marke ist die Rollenverteilung: Jede Schicht hat genau eine Aufgabe, und zwischen den Schichten liegen prüfbare Artefakte – Beat-Sheet, Szenenliste, Shot-Liste, Ankerbild, Schnittfassung. Diese Trennung macht Fehler lokalisierbar. Wenn die Figuren inkonsistent wirken, liegt das Problem fast nie in der Videoschicht, sondern in der Figurenbibel oder in abweichenden Prompt-Texten. Wenn die Bilder nicht zusammenpassen, prüfe in dieser Reihenfolge: Prompt-Bausteine, Lichtrichtung, Brennweite, Farbtemperatur.

Ein Hinweis zur Auswahl: Für kurze Erklärformate reichen oft zwei Werkzeuge – ein Sprachmodell und ein Bildmodell – plus eine Schnittumgebung. Videomodelle lohnen sich, wenn Bewegung und Atmosphäre tatsächlich Teil der Aussage sind. Wer sie einsetzt, nur weil sie verfügbar sind, erzeugt zusätzliche Prüfschleifen ohne dramaturgischen Gewinn.

FAQ: häufige Fragen zu Drehbuch, Shot-Design und KI

Ersetzt KI das Drehbuchschreiben?

Sie ersetzt das Strukturieren und Variieren, nicht die Entscheidung. Ein Modell kann dir fünf Wege zeigen, wie eine Geschichte funktionieren könnte. Welcher davon zu deiner Marke, deinem Publikum und deinem Budget passt, entscheidest du.

Wie lang sollte eine Shot-Liste für ein kurzes Video sein?

Für ein ein- bis zweiminütiges Video sind acht bis sechzehn Einstellungen eine realistische Größe. Mehr Einstellungen bedeuten mehr Generierungen, mehr Konsistenzprüfungen und mehr Schnittarbeit.

Wie verhindere ich, dass Figuren zwischen Einstellungen wechseln?

Durch wörtlich wiederverwendete Beschreibungen, feste Requisiten und Farbcodes sowie durch das Prinzip, zuerst die Ankerbilder zu erzeugen und erst danach die restlichen Einstellungen.

Brauche ich filmisches Vorwissen?

Nein, aber vier Grundregeln: Einstellungsgrößen bewusst wechseln, die 180-Grad-Logik einhalten, Bewegung begründen und Licht als Stimmungswerkzeug behandeln. Alles andere ist Übung.

Was mache ich, wenn die generierten Bilder nicht zusammenpassen?

Prüfe in dieser Reihenfolge: Prompt-Bausteine, Lichtrichtung, Brennweite, Farbtemperatur. Meist liegt die Inkonsistenz nicht am Modell, sondern an unterschiedlichen Beschreibungen derselben Szene.

Wann sollte ich KI einsetzen und wann nicht?

Nutze sie für Rechercheorganisation, Variantenbildung, Konsistenzprüfung und Bildideen. Verlasse dich nicht auf sie bei Fakten, Subtext, Tonalität und ethischen Entscheidungen über die Darstellung von Menschen.

Wie dokumentiere ich den Prozess für ein Team?

Halte die vier Artefakte versioniert: Beat-Sheet, Szenenliste, Shot-Liste und Ankerbilder. So kann jede Person nachvollziehen, warum eine Einstellung existiert. Änderungen werden am Dokument vorgenommen, nicht im Gespräch – das verhindert, dass zwei Beteiligte von unterschiedlichen Versionen ausgehen.

Womit fange ich an?

Mit einem Blatt Papier und einer Logline. Danach ein Beat-Sheet mit acht bis zwölf Beats, danach eine Szenenliste mit Funktion, dann die Shot-Liste mit sechs bis sechzehn Zeilen, dann ein Ankerbild. Wenn dieses erste Bild sitzt, ist der Rest ein Ausbau – und kein Neuanfang.

Alexander

Alexander