Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

KI-Storyboard und Shot-Design: Workflow für filmische Sequenzen

Oct 1, 2026

Warum KI-Storyboarding das Handwerk verschiebt, nicht ersetzt

Vor einigen Jahren bedeutete Storyboarding: Skizzen auf Papier, Klebezettel an der Wand, ein Skript mit handschriftlichen Randnotizen. Diese Phase war langsam, aber sie erzwang eine frühe Auseinandersetzung mit Dramaturgie, Bildsprache und Schnittfolge. Heute fällt genau diese Denkphase in vielen Produktionen weg, weil ein Text-zu-Video-Modell in wenigen Minuten einen brauchbaren Clip liefert.

Der eigentliche Gewinn liegt nicht darin, dass Ideen sofort fertig aussehen, sondern darin, dass Varianten billig werden. Zwanzig Bildideen für eine Szene zu prüfen, war früher ein voller Arbeitstag. Heute ist es eine Sache von Minuten – vorausgesetzt, der Prozess ist strukturiert. Ohne Struktur entsteht das Gegenteil: ein Ordner voller hübscher, aber unzusammenhängender Clips, die sich nicht zu einer Sequenz fügen.

Der Unterschied zwischen einem beliebigen KI-Clip und einer filmischen Sequenz ist fast nie das Modell. Es ist die Entscheidungsebene darüber: Welche Einstellung transportiert welche Information? Wann wird geschnitten? Warum sieht dieselbe Figur in Einstellung 1 anders aus als in Einstellung 7?

Dieser Leitfaden beschreibt einen werkzeugunabhängigen Workflow für Storyboarding und Shot-Design mit KI. Er passt auf Werbefilm, Kurzfilm, Erklärvideo und Social-Serie, weil er nicht von den Funktionen eines einzelnen Anbieters ausgeht, sondern von Aufgaben: Idee schärfen, Bilder planen, Bewegung kontrollieren, Konsistenz sichern, Material bewerten. Wer diese fünf Aufgaben trennt, kann jedes Werkzeug austauschen, ohne den Prozess neu zu lernen.

Für wen das gedacht ist: Solo-Creator, die allein eine ganze Sequenz bauen; kleine Teams mit getrennten Rollen für Regie, Schnitt und Ton; und Marketingverantwortliche, die wiederkehrende Formate produzieren. In allen drei Fällen ist nicht das Rendern der Engpass, sondern die Entscheidung, was überhaupt gerendert werden soll.

Die drei Ebenen der Regie: Drama, Bild, Bewegung

Wer KI-Video nur als Prompt-Eingabe versteht, überspringt zwei Ebenen. Brauchbare Ergebnisse entstehen, wenn drei Ebenen getrennt geplant und erst danach zusammengeführt werden.

Ebene 1: Drama – was die Szene leistet

Zerlege das Skript in informationstragende Einheiten. Jede Szene beantwortet genau eine dramaturgische Frage: Wer will was, was steht im Weg, was verändert sich? Formuliere für jede Szene einen Satz, der beschreibt, was der Zuschauer danach weiß, das er vorher nicht wusste. Szenen ohne diesen Satz sind Schnittkandidaten – auch wenn sie visuell beeindruckend sind. Ein Beispiel: Eine Szene, in der jemand bei Sonnenuntergang über eine Brücke läuft, leistet nichts, solange nicht klar ist, was sich durch diesen Weg verändert. Bekommt die Figur dort eine Entscheidung, ist die Brücke plötzlich dramaturgisch.

Ebene 2: Bild – wie die Szene aussieht

Erst danach wird entschieden, wie die Szene aussieht: Einstellungsgröße, Perspektive, Lichtstimmung, Farbpalette, Requisiten. Diese Parameter sind nicht dekorativ, sie tragen Bedeutung. Untersicht macht eine Figur mächtig, Aufsicht macht sie verletzlich. Ein warmer Lichtkegel in einem kalten Raum lenkt den Blick stärker als jede Kamerafahrt. Ein leerer Bildrand kann Einsamkeit erzählen, ohne dass jemand sie aussprechen muss.

Ebene 3: Bewegung – was sich innerhalb der Einstellung ändert

Die dritte Ebene beschreibt Veränderung: Kamerabewegung, Figurenbewegung, Lichtwechsel, Tempo. Videomodelle reagieren empfindlich auf zu viele gleichzeitige Bewegungen. Die Faustregel lautet: pro Einstellung eine dominante Bewegung plus höchstens eine unterstützende. Wenn eine Figur geht und die Kamera fährt und der Hintergrund wackelt und Licht flackert, verliert das Modell die Kontrolle über alle vier Elemente gleichzeitig.

Diese Trennung hat einen sehr praktischen Nutzen: Sie macht Fehler lokalisierbar. Sieht ein Clip falsch aus, liegt es selten am Modell, sondern meist an einer unklaren Bildebene oder einer überladenen Bewegungsebene. Statt den Prompt blind umzuschreiben, prüfst du gezielt die Ebene, die nicht stimmt – und sparst Iterationen.

Vom Treatment zur Shotlist in sieben Schritten

Dieser Ablauf hat sich für Projekte zwischen 30 Sekunden und fünf Minuten bewährt.

  1. Logline und Zielgruppe festlegen. Ein Satz, der Handlung und Adressat benennt: „Ein Kurierfahrer entdeckt auf seiner letzten Tour, dass er die Stadt besser kennt als die Menschen, für die er fährt – für ein Fahrradlabel, Zielgruppe 25 bis 40, urban.“ Ohne diesen Satz wird jede spätere Entscheidung beliebig.
  2. Beats statt Szenen. Notiere acht bis zwölf dramaturgische Beats auf einer Seite. Das ist dein Gerüst, an dem später jeder Shot hängt.
  3. Shotlist mit Absicht. Jeder Shot bekommt eine Nummer, eine Funktion (Orientierung, Emotion, Information, Übergang), eine geschätzte Dauer und einen Satz Begründung, warum es ihn gibt.
  4. Look-Referenzen sammeln. Zwölf bis zwanzig Bilder, die Licht, Palette und Textur definieren. Diese Sammlung wird zur gemeinsamen Sprache zwischen Regie, Schnitt und Prompts.
  5. Keyframes generieren. Zuerst nur Standbilder – pro Shot drei bis fünf Varianten. Standbilder sind schnell, günstig und zeigen sofort, ob die Bildidee trägt.
  6. Animation in Reihenfolge. Erst wenn die Keyframes stehen, werden Clips erzeugt, und zwar shot-weise in chronologischer Reihenfolge, nicht kreuz und quer.
  7. Schnitt und Ton. Rohschnitt aus allen Clips, dann Musik, dann Feinschnitt. Der Schnitt verrät, welche Shots tatsächlich fehlen.

Ein Erfahrungswert für ein 60-Sekunden-Projekt: rund 90 Minuten Planung, 120 Minuten Keyframes, 180 Minuten Animation, 90 Minuten Postproduktion. Wer die Planung halbiert, verdoppelt meist die Animationszeit, weil unklare Shots mehr Iterationen brauchen. Deshalb gilt Schritt 5 und 6 strikt trennen: Wer direkt Videos generiert, bezahlt teure Renderingläufe für Bildideen, die er ohnehin verworfen hätte.

Das Vokabular für Shot-Design: Brennweite, Licht, Bewegung

Prompting ist kein Zauberwort, sondern Beschreibung. Je präziser filmische Parameter benannt sind, desto weniger muss das Modell raten.

Brennweite und Perspektive

Formulierungen wie „Weitwinkelaufnahme aus niedriger Position“, „Teleobjektiv, komprimierte Tiefe“ oder „Halbtotale von der Seite“ wirken zuverlässiger als vage Adjektive wie „episch“ oder „cinematisch“. Ergänze die Entfernung zur Figur und den Bildausschnitt: Kopf bis Knie, nur Hände, Gesicht füllt den Rahmen.

Licht und Farbe

Lichtbeschreibungen sollten Quelle, Richtung und Härte enthalten: „weiches Seitenlicht von links durch ein Fenster“, „hartes Gegenlicht mit Lens Flare“, „Neonlicht in Magenta und Cyan von oben“. Farbe nie isoliert nennen, sondern immer in Relation: „kühle Umgebung, warmes Gesicht“ oder „entsättigter Raum, ein roter Akzent im Hintergrund“.

Komposition und Bewegung

Nenne eine Blickachse, eine Fluchtlinie oder ein Negativraum-Konzept. Bei Bewegung gilt: Richtung, Tempo und Endpunkt angeben. „Langsame Vorwärtsfahrt, endet auf dem Gesicht“ ist brauchbar, „dynamische Kamera“ ist es nicht. Auch hier hilft ein Nebensatz, der beschreibt, wo die Bewegung aufhört – Modelle halten Bewegungen ohne Ziel oft bis zum letzten Frame durch.

Die Fünf-Felder-Vorlage

Baue dir eine eigene Prompt-Vorlage mit fünf Feldern: Sujet, Einstellung, Licht, Palette, Bewegung. Vorher und nachher im Vergleich:

Schwach: „Ein Fahrradkurier fährt nachts durch die Stadt, dramatisch, cinematisch, hohe Qualität.“

Brauchbar: „Sujet: Kurier Anfang dreißig, Regenjacke, Fahrradanhänger. Einstellung: Halbtotale von hinten, leicht erhöht, Teleobjektiv, komprimierte Tiefe. Licht: Neonreklame von rechts, kalt, harte Kanten. Palette: Cyan, Magenta, nasses Asphaltgrau. Bewegung: Kamera zieht langsam mit, eine dominante Bewegung, endet, als er in eine Seitenstraße abbiegt.“

Der zweite Prompt ist nicht besser, weil er schöner klingt, sondern weil er entscheidbar ist. Jedes Feld lässt sich einzeln variieren: gleiche Einstellung, anderes Licht; gleiches Licht, andere Bewegung. So entstehen gezielte Tests statt Zufallstreffer.

Konsistenz über mehrere Einstellungen: Figuren, Räume, Requisiten

Konsistenz ist der häufigste Grund, warum KI-Sequenzen auseinanderfallen. Vier Hebel lassen sich kombinieren:

  • Referenzbild statt Adjektive. Beschreibe eine Figur nicht jedes Mal mit neuen Worten, sondern verankere sie über ein Referenzbild oder einen Stilanker.
  • Feste Beschreibungsblöcke. Lege für jede Figur und jeden Drehort einen kurzen, immer identischen Textblock an und kopiere ihn unverändert in jeden Prompt.
  • Chronologische Reihenfolge. Generiere Shots einer Szene in Reihenfolge. Modelle arbeiten häufig stabiler, wenn sie den unmittelbaren Vorgänger kennen.
  • Gemeinsame Stilreferenz. Eine Farb- und Texturreferenz für die gesamte Sequenz verhindert, dass jede Einstellung aus einem anderen Film zu stammen scheint.

Für Räume gilt dasselbe wie für Gesichter: Ein grob skizzierter Grundriss verhindert, dass Fenster die Seite wechseln. Notiere Stichpunkte wie „Fenster links, Tür hinten rechts, Tisch mittig“ und wiederhole sie konsequent. Das klingt banal, spart aber ganze Nachmittage.

Ein schneller Test gefällt mir besonders: der Reihenfolge-Test. Nimm drei aufeinanderfolgende Einstellungen, lege sie nebeneinander, verdecke alle Beschreibungen und frage eine zweite Person, ob es dieselbe Figur und derselbe Ort ist. Wenn nicht, ist der Beschreibungsblock nicht stabil genug – und du weißt sofort, welches Feld du festnageln musst.

Werkzeug-Routing: Aufgabe statt Trend

Es gibt nicht das eine beste Modell, sondern unterschiedliche Stärken. Eine pragmatische Aufteilung sieht so aus:

  • Bildmodelle für Keyframes, Stil-Exploration und Figurendesign. Sie sind schnell, günstig und iterierbar.
  • Videomodelle für Bewegung, Kameraarbeit und Atmosphäre. Sie brauchen ein festes Startbild, sonst driften sie.
  • Sprachmodelle als Regie-Assistenz für Beat-Struktur, Kürzung der Shotlist und Variantenbildung von Prompts.
  • Restaurierungs- und Skalierungswerkzeuge erst ganz am Ende, wenn der Schnitt steht.

Wähle das Werkzeug nach der Aufgabe, nicht nach dem Trend. Für eine ruhige Dialogszene ist Gesichtsstabilität wichtiger als spektakuläre Kamerafahrten. Für einen Establishing-Shot zählt Bildtiefe mehr als Lippensynchronität. Praktisch heißt das: Baue pro Projekt ein kleines Routing-Blatt.

Shot-Kategorie Wichtigste Eigenschaft Werkzeugtyp
Establishing, Landschaft Tiefe, Weite, Stimmung Bildmodell, dann Animation mit festem Startbild
Gesicht, Dialog Identität, Mikroausdruck Modell mit hoher Gesichtsstabilität
Detail, Hände Textur, Kontrolle Bildmodell, kurze Clipdauer
Übergang, Bewegung Richtung, Tempo, Endpunkt Videomodell mit klarer Bewegungsangabe
Finale Einstellung Ruhe, Auflösung ruhige Kamera, minimale Bewegung

Jeder Shot bekommt einen Eigentümer im Blatt. Das verhindert, dass ein Shot nur deshalb mit einem bestimmten Werkzeug erzeugt wird, weil es gerade geöffnet ist.

Beispielprojekt: 60-Sekunden-Markenfilm an einem Tag

Angenommen, du produzierst einen 60-sekündigen Film für ein Fahrradlabel.

Vormittag – Planung. Logline, acht Beats, Shotlist mit 14 Einstellungen, Look-Referenzen. Ergebnis: eine Seite, die das gesamte Projekt beschreibt.

Mittag – Keyframes. Für jeden Shot drei Varianten in einem Bildmodell, mit identischem Beschreibungsblock für die Hauptfigur. Aus 42 Bildern werden 14 ausgewählt. Zwei Shots fliegen raus, weil sie dramaturgisch nichts beitragen – die Shotlist schrumpft auf zwölf.

Nachmittag – Animation. Jedes Keyframe wird animiert, pro Clip drei bis vier Versuche. Kritisch sind Gesicht und Hände; hier lohnt die zusätzliche Iteration. Die Kamera bleibt in den meisten Shots ruhig, nur zwei Shots bekommen eine Bewegung.

Abend – Post. Rohschnitt auf Musik, danach Farbangleichung über alle Clips, dann Ton-Design. Erst hier zeigt sich, ob ein Zwischenschnitt fehlt – meistens fehlt ein Detail-Shot als Atempause.

Was in diesem Ablauf typischerweise schiefgeht: Ein Shot sollte Kurier, Kamera und Regen gleichzeitig bewegen. Das Ergebnis war ein Brei aus verschmierten Rädern. Die Lösung war unspektakulär – ruhige Kamera, Figur fährt durchs Bild, Regen bleibt statisch im Hintergrund. Der Zeitgewinn entsteht nicht durch das Rendern, sondern durch die frühe Festlegung. Wer morgens zwei Stunden in die Shotlist investiert, spart nachmittags fünf.

Zwei weitere Praxisbeispiele

Erklärvideo, 90 Sekunden, ein Sprecher

Beats folgen einer Frage-Antwort-Logik: Problem, Ursache, Lösung, Beweis, Handlungsaufruf. Die Shotlist enthält vier Kategorien: Sprecher im Bild, Hände an einem Objekt, Grafikfläche, Übergang. Hier zählt Lesbarkeit mehr als Kino. Klare Flächen, wenig Bewegung, und Grafik lieber als Standbild erzeugen und im Schnitt animieren, als sie als Video zu generieren. Faustregel: Je mehr Text im Bild, desto weniger Bewegung. Ein Sprecher-Shot mit zwei Bewegungen gleichzeitig lenkt vom Inhalt ab.

Social-Serie mit wiederkehrender Figur

Sechs Clips à 15 Sekunden, dieselbe Hauptfigur, dieselbe Umgebung. Hier ist Konsistenz wichtiger als Bildqualität. Ein einziges Referenzbild plus fester Beschreibungsblock, Shots in Reihenfolge, gleiche Palette. Zwei wiederkehrende Detailaufnahmen – Hände, Schuhe – bauen über die Serie hinweg eine visuelle Signatur auf, die Zuschauer sofort erkennen. Wichtig: Pro Clip nur ein neuer visueller Reiz, sonst zerfällt die Serie in sechs Einzelideen.

Typische Fehler, Gegenmaßnahmen und Abnahmekriterien

  • Zu viele Ideen pro Shot. Eine Handlung, eine Bewegung, ein Fokus.
  • Direkt Videos generieren. Immer erst Keyframes, dann Animation.
  • Inkonsistente Beschreibungen. Feste Textblöcke kopieren statt neu formulieren.
  • Fehlende Dramaturgie. Jeder Shot braucht eine Funktion. Ästhetik allein ist keine Funktion.
  • Kein Ton-Plan. Musik und Ton früh mitdenken, nicht erst nach dem Schnitt.
  • Zu viele Stile in einer Sequenz. Eine Farb- und Texturreferenz für das ganze Projekt.
  • Kein Protokoll. Prompts, Referenzbilder, Seeds und Werkzeugversionen dokumentieren, sonst ist eine Einstellung nicht reproduzierbar.
  • Bewegung ohne Endpunkt. Immer angeben, wo eine Kamerafahrt oder Figurenbewegung aufhört.

Vor dem teuren Rendern prüfe fünf Punkte: Sitzt die Bildidee im Standbild? Ist die Figur wiedererkennbar? Passt die Einstellungsgröße zur dramaturgischen Funktion? Ist genau eine dominante Bewegung definiert? Stammt der Prompt aus der Vorlage und nicht aus dem Bauchgefühl?

Fünfmal Ja bedeutet: Der Clip wird wahrscheinlich im ersten oder zweiten Versuch brauchbar. Danach folgt die Postproduktion – grober Schnitt, Farbangleichung, Ton, Export in mehreren Formaten. Für die Dokumentation reicht ein einfaches Protokoll: Shot-Nummer, Prompt, Referenzbild, Seed, Werkzeug und Version. Diese Angaben machen jede Einstellung reproduzierbar und ersparen später viel Rätselraten.

FAQ

Brauche ich zeichnerisches Talent?
Nein, aber visuelles Vokabular. Wer Einstellungsgrößen, Lichtrichtungen und Kompositionsbegriffe benennen kann, bekommt deutlich bessere Ergebnisse als jemand, der nur Stimmungen beschreibt.

Wie viele Shots sollte eine Minute haben?
Als Orientierung: acht bis fünfzehn Einstellungen pro Minute, abhängig vom Tempo. Ruhige Markenfilme liegen eher bei acht, dynamische Social-Clips bei fünfzehn oder mehr.

Warum sehen meine Figuren in jedem Shot anders aus?
Meist, weil die Beschreibung variiert. Lege einen festen Beschreibungsblock an, nutze ein Referenzbild und generiere Shots einer Szene in Reihenfolge.

Reicht ein einziges Werkzeug für das ganze Projekt?
Es kann funktionieren, ist aber selten optimal. Unterschiedliche Shot-Typen profitieren von unterschiedlichen Stärken – Gesichter, Landschaften, Bewegung, Licht.

Wie gehe ich mit fehlenden Shots im Schnitt um?
Erst prüfen, ob der Schnitt ohne sie funktioniert. Wenn nicht, einen Detail-Shot oder einen Zwischenschnitt ergänzen. Solche Nachdrehs sind bei KI-Produktionen günstig, weil kein Set aufgebaut werden muss.

Was mache ich, wenn ein Clip fast perfekt ist?
Behalte ihn und arbeite mit Schnitt und Ton. Ein zu neunzig Prozent passender Clip, der dramaturgisch sitzt, ist wertvoller als ein technisch perfekter, der die Geschichte nicht trägt.

Wie lang sollte ein einzelner generierter Clip sein?
Kurz. Drei bis sechs Sekunden lassen sich zuverlässig kontrollieren; längere Einstellungen driften eher. Für ruhige Momente kannst du zwei kurze Clips im Schnitt verbinden, statt einen langen zu erzwingen.

Woran erkenne ich, dass mein Prompt zu voll ist?
Wenn du beim Lesen mehr als ein Verb der Bewegung findest. Reduziere auf eine dominante Bewegung und formuliere den Rest als Zustand („Regen fällt im Hintergrund“) statt als Aktion.

Alexander

Alexander