Regiearbeit ist der eigentliche Engpass
Text-zu-Video-Modelle erzeugen inzwischen einzelne Aufnahmen von beeindruckender Qualität. Eine Person, die eine Tür öffnet, ein Sonnenuntergang über einer Küstenstadt, ein Roboter im Neonlicht – das gelingt häufig beim ersten Versuch. Das eigentliche Problem beginnt erst danach. Sobald aus mehreren schönen Clips eine Geschichte werden soll, tauchen Fragen auf, die kein Generierungsmodell von selbst beantwortet: Welche Einstellung erzählt was? In welcher Reihenfolge? Wie lange darf eine Aufnahme dauern, bevor sie langweilt? Wie bleibt eine Figur über zwölf Einstellungen hinweg erkennbar? Und warum wirkt ein fertiges Kurzvideo trotz guter Bilder flach?
Genau hier setzt KI-gestützte Regieassistenz an. Sie ersetzt keine Kreativität, sondern übernimmt Strukturarbeit: Sie übersetzt eine Absicht – etwa den Wunsch, die Zuschauer sollen misstrauisch werden – in abgeleitete Einstellungsgrößen, Perspektiven, Kamerabewegungen und Übergänge. Der Wert liegt nicht darin, dass ein System Bilder erzeugt, sondern dass es Entscheidungen sichtbar, prüfbar und wiederholbar macht. Ein Regieplan ist im Kern ein Dokument, das erklärt, warum eine Aufnahme so und nicht anders aussieht.
Für Creator mit regelmäßigem Output ist das der Unterschied zwischen Basteln und Produzieren. Wer jede Woche zwei bis fünf kurze Videos veröffentlicht, kann sich keine drei Stunden pro Clip für improvisierte Entscheidungen leisten. Ein schlanker Plan – Logline, Beat-Liste, Shot-Liste, Anker-Text – kostet zehn bis zwanzig Minuten und spart meist ein Vielfaches davon in der Postproduktion. Noch wichtiger: Ein Plan macht Fehler früh sichtbar, wenn sie noch billig zu beheben sind.
Dieser Leitfaden richtet sich an Creator, die kurze Formate produzieren, und an Teams, die generative Werkzeuge in eine bestehende Postproduktion integrieren. Der Aufbau folgt der Reihenfolge, in der die Arbeit tatsächlich anfällt: erst erzählen, dann planen, dann generieren, dann schneiden. Wer diese Reihenfolge umdreht, merkt es spätestens beim vierten Take.
Die drei Ebenen der Erzählung: Story, Shot, Schnitt
Wer KI-Video nur als Prompt-Eingabe versteht, arbeitet auf einer einzigen Ebene und wundert sich, warum das Ergebnis trotz guter Bildqualität nicht trägt. Sinnvoller ist ein Modell mit drei Ebenen, die aufeinander aufbauen.
Ebene eins: Story
Hier geht es um Absicht, Figur, Konflikt und Auflösung. In Kurzformaten heißt das meistens: eine Figur, ein Ziel, ein Hindernis, eine Wendung, ein Ende in unter sechzig Sekunden. Die Story-Ebene bestimmt, was überhaupt gezeigt werden muss – und vor allem, was weggelassen werden kann. Ein Clip über einen Kaffeeautomaten, der die Bestellung falsch versteht, braucht keine Exposition über die Herkunft der Bohne. Er braucht eine saubere Pointe.
Ebene zwei: Shot
Die Shot-Ebene übersetzt Absicht in Bilder. Aus „die Figur fühlt sich beobachtet“ wird eine Halbtotale mit viel leerem Raum, aus „Kontrolle geht verloren“ wird ein schneller Schwenk mit kurzer Brennweite. Hier liegen die größten Hebel: Größe der Einstellung, Achse, Perspektive, Objektivwirkung, Bewegung, Lichtstimmung. Diese Ebene ist auch die, auf der generative Werkzeuge am zuverlässigsten unterstützen, weil sie konkrete, benennbare Parameter kennt.
Ebene drei: Schnitt
Die Schnitt-Ebene entscheidet über Rhythmus. Wie lange dauert eine Einstellung? Wo wird hart geschnitten, wo weich überblendet? Wo setzt die Musik einen Akzent, der mit einem Bildwechsel zusammenfällt? Viele Kurzvideos scheitern nicht an schlechten Bildern, sondern an einem Tempo, das entweder einschläft oder den Zuschauer hetzt.
Diese drei Ebenen sind auch der Grund, warum ein Regieassistent nützlich ist: Er hält den Überblick, wenn man gleichzeitig an Details schraubt und dabei leicht die Dramaturgie aus den Augen verliert. Die Reihenfolge ist nicht beliebig. Wer auf der Shot-Ebene optimiert, bevor die Story-Ebene steht, poliert später ein Fundament, das verschoben werden muss.
Storytelling-Analyse: Von der Absicht zur Beat-Liste
Bevor ein einziger Prompt geschrieben wird, sollte klar sein, was die Szene leisten soll. Drei Leitfragen reichen meistens aus, um aus einer vagen Idee eine spielbare Struktur zu machen.
Absicht, Hindernis, Wendung
Die Absicht ist das, was die Figur will – nicht das, was sie tut. „Sie kocht Kaffee“ ist eine Handlung, „sie will zehn ruhige Minuten“ ist eine Absicht. Das Hindernis ist alles, was dazwischenkommt: ein Gerät, ein Mitbewohner, ein Anruf, ein Selbstzweifel. Die Wendung ist der Moment, in dem klar wird, ob die Absicht erreicht wird oder nicht. Formate ohne Wendung wirken wie eine Beobachtung, nicht wie eine Geschichte – und Beobachtungen halten in Kurzformaten selten länger als drei Sekunden Aufmerksamkeit.
Die Beat-Liste als Skelett
Eine Beat-Liste besteht aus fünf bis acht Zeilen, jeweils ein Satz, bewusst ohne Bildideen. Sie ist absichtlich sprachlich und nicht visuell, weil man sonst zu früh über Kamerawinkel diskutiert und dabei die Dramaturgie verliert. Ein brauchbarer Beat endet mit einer Veränderung: Vorher glaubt die Figur etwas, nachher glaubt sie etwas anderes. Wenn zwei aufeinanderfolgende Beats dieselbe Überzeugung beschreiben, gehören sie wahrscheinlich zusammen oder einer davon fällt weg.
Ein zweiter Test: Lässt sich jeder Beat in einem einzigen Bild erklären? Wenn nicht, ist er zu groß und muss geteilt werden. Umgekehrt gilt: Wenn zwei Beats nur durch einen Schnitt getrennt sind und keine neue Information liefern, sind sie einer.
Beispiel: ein 45-Sekunden-Clip
Eine Vorlage, die sich gut anpassen lässt:
- Eine Bäckerin öffnet morgens den Laden und stellt fest, dass die Lieferung fehlt.
- Sie improvisiert mit dem, was da ist.
- Ein Stammgast kommt, bestellt wie immer – und bekommt etwas anderes.
- Er zögert, probiert, schweigt.
- Sie wartet auf die Reaktion, die Kamera bleibt auf ihrem Gesicht.
- Er lächelt und bestellt das Improvisierte erneut.
Sechs Beats, acht bis zehn Einstellungen, etwa 45 Sekunden. Aus dieser Liste lassen sich alle weiteren Entscheidungen ableiten – sogar die Frage, welcher Beat eine Nahaufnahme braucht. Beat fünf braucht sie zwingend, Beat drei nicht. Beat zwei funktioniert besser als Detail-Montage aus Händen und Arbeitsflächen, weil Tempo hier Kompetenz signalisiert.
Shot-Design: Größe, Brennweite, Bewegung
Shot-Design ist ein Handwerk mit Faustregeln. Wer sie kennt, kann sie später bewusst brechen – und das wirkt dann wie eine Entscheidung statt wie ein Zufall.
Bildgrößen und ihre Aufgaben
- Weit / Establishing: zeigt Ort und das Verhältnis von Figur zu Raum. Gut als Einstieg, danach sparsam.
- Halbtotal: der Standard für Handlung und Interaktion. Der größte Teil eines Kurzvideos spielt hier.
- Nahaufnahme: Emotion und Detail. Wirkt nur, wenn sie nicht inflationär verwendet wird.
- Detail / Insert: ein Objekt, eine Hand, ein Blick auf ein Display. Perfekt für Ursache und Wirkung – weil das passiert, passiert jenes.
Perspektive als Bedeutungsträger
Untersicht macht Figuren mächtig, Aufsicht macht sie klein. Augenhöhe ist neutral und wird deshalb oft als langweilig empfunden – aber genau diese Neutralität braucht es, damit ein Wechsel in die Untersicht später wirklich wirkt. Wer jede Einstellung inszeniert, nimmt der Inszenierung ihre Wirkung. Ein nützlicher Test: Entfernt man aus einem fertigen Clip drei Einstellungen und das Drama bricht sofort zusammen, war man mit dem Drama zu großzügig.
Bewegung dosieren
Bewegung erzeugt Energie, kostet aber Aufmerksamkeit. Eine ruhige Kamera mit präzisem Schnitt wirkt oft teurer als permanente Bewegung. Für kurze Formate gilt eine einfache Regel: pro Beat eine Bewegungsidee, nicht mehrere. Also entweder Push-in oder Schwenk oder Handheld-Drift – nicht alles gleichzeitig. Widersprüchliche Anweisungen wie „ruhig und statisch“ plus „dynamische Handheld-Bewegung“ erzeugen meist einen Kompromiss, der beides halb erfüllt.
Absicht in Einstellungen übersetzen
| Erzählerische Absicht | Einstellung | Bewegung | Dauer |
|---|---|---|---|
| Orientierung geben | Weit | langsam, ruhig | 2–3 s |
| Nähe herstellen | Halbtotal / Nah | minimal | 1,5–2 s |
| Bedrohung aufbauen | Untersicht, weit | Push-in | 2–3 s |
| Überraschung auslösen | Detail | statisch, harter Schnitt | 0,7–1,2 s |
| Kontrollverlust zeigen | Halbtotal | Handheld, schnelles Nachziehen | 1–2 s |
| Abschluss markieren | Weit oder Nah | statisch, lange halten | 2,5–4 s |
Die Tabelle ist bewusst grob. Sie soll keine Ästhetik vorschreiben, sondern verhindern, dass jede Einstellung nach demselben Muster aussieht. Wer mit mehreren Generatoren arbeitet, sollte zusätzlich eine Regel beachten: Regie bleibt konstant, Stil darf variieren. Bildgröße, Bewegung und Achse werden in allen Werkzeugen identisch formuliert; Look, Farbgebung und Rendering dürfen sich unterscheiden, wenn man bewusst Looks vergleicht. Diese Trennung macht Tests erst aussagekräftig.
Visuelle Grammatik: Achse, Blickrichtung, Übergänge
Sobald zwei Einstellungen hintereinander liegen, entsteht eine Aussage über den Raum. Diese Aussage kann man kontrollieren – oder man überlässt sie dem Zufall.
Die Achse halten
Die 180-Grad-Regel besagt, dass eine Kamera eine gedachte Linie zwischen zwei Figuren oder zwischen Figur und Objekt nicht überschreiten sollte, solange der Raum verständlich bleiben soll. Wechselt sie doch die Seite, scheint das Gegenüber plötzlich auf der falschen Seite zu stehen. Bei generierten Einstellungen ist das ein häufiger Fehler, weil jedes Bild isoliert entsteht. Lösung: Achse in der Shot-Liste notieren – etwa „Figur links, Fenster rechts“ – und in jeden Prompt kopieren. Blickrichtungen gehören ebenfalls dazu: Wer nach links schaut, muss in der Gegeneinstellung rechts stehen.
Übergänge sparsam einsetzen
Je kürzer das Video, desto weniger Übergänge. Harte Schnitte sind der Standard, weil sie keine Zeit kosten und keine Bedeutung behaupten. Überblendungen, Wischer und Zoom-Übergänge behaupten eine Beziehung zwischen zwei Bildern – eine Zeitlücke, einen Zeitsprung, eine Überlagerung. Wer sie zwischen Sätzen derselben Szene verwendet, verwirrt. Als Faustregel: Ein Übergang muss eine Frage beantworten, die der harte Schnitt offenlässt, sonst ist er Dekoration.
Match Cut, Insert und Reaktion
Ein Match Cut verbindet zwei Einstellungen über eine Form, eine Bewegung oder ein Geräusch: Die Hand, die die Tasse greift, wird zur Hand, die den Schlüssel dreht. In generativen Workflows funktioniert das nur, wenn beide Takes vorher geplant wurden. Es ist einer der wenigen Tricks, die ein kurzes Video sofort größer wirken lassen – und gleichzeitig einer der ersten, den Anfänger überstrapazieren.
Mindestens ebenso wichtig ist die Reaktionsaufnahme. Sie ist die Einstellung, die eine Information bewertet, und oft die einzige, die eine Emotion trägt. Wer Reaktionen einplant, muss weniger erklären. Ein Clip mit drei Reaktionen und zwei Handlungen fühlt sich meist reicher an als ein Clip mit sechs Handlungen und keiner Reaktion.
Charakterkonsistenz über viele Einstellungen
Konsistenz ist der Punkt, an dem die meisten Projekte scheitern. Eine Figur sieht in Einstellung eins anders aus als in Einstellung sieben. Die Jacke wechselt die Farbe. Das Licht wird plötzlich mittags statt abends. Solche Sprünge zerstören die Illusion schneller als jede Unschärfe.
Anker-Text statt Ad-hoc-Beschreibung
Ein kurzer, immer identischer Beschreibungsblock: Figur (Alter, Frisur, Gesichtsform, Kleidung, Farben), Setting (Ort, Tageszeit, Wetter), Look (Lichtstimmung, Kontrast, Körnung). Dieser Block steht wörtlich in jedem Prompt, auch wenn er redundant wirkt. Er ist kein Stilmittel, sondern eine technische Notwendigkeit. Wichtig ist Kürze: Ein Anker-Text mit 40 Wörtern wird eher vollständig übernommen als einer mit 150, bei dem das Modell anfängt zu gewichten.
Referenzbilder für Gesicht und Kleidung
Ein oder zwei Standbilder als visuelle Referenz halten Gesicht und Garderobe stabiler als jede Prosa. Besonders wirksam sind sie bei Nahaufnahmen, weil dort jede Abweichung auffällt. Für Kleidung reicht oft ein einziges Bild, für Gesichter sind zwei Perspektiven hilfreich – frontal und halb seitlich. Wer wiederkehrende Figuren plant, sollte diese Referenzen versionieren, sonst arbeitet man nach drei Wochen mit zwei leicht unterschiedlichen Gesichtern.
Blockweise Produktion
Statt alle Einstellungen gleichzeitig zu generieren, arbeitet man in Blöcken von drei bis vier Einstellungen desselben Settings. So bleiben Licht und Umgebung konsistent, und man merkt früh, wenn ein Detail nicht funktioniert. Zusätzlich sinkt die Zahl der Versuche pro fertiger Einstellung, weil die Variablen innerhalb eines Blocks konstant bleiben. Für eine Serie mit derselben Figur empfiehlt sich zusätzlich, alle Einstellungen einer Szene hintereinander und nicht kreuzweise zu produzieren.
Fehlerprotokoll führen
Eine kurze Liste mit allem, was zwischen Takes abweicht: Frisur, Jackenfarbe, Hintergrunddetails, Lichtrichtung. Nach zwei Projekten kennt man seine persönlichen Schwachstellen und schreibt sie direkt in den Anker-Text. Dieser Schritt klingt bürokratisch, spart aber pro Projekt mehrere Stunden Nacharbeit. Besonders wertvoll ist das Protokoll, wenn mehrere Personen an einem Projekt arbeiten – dann ersetzt es Absprachen, die sonst per Zuruf passieren.
Prompt-Muster für echte Regieanweisungen
Ein Prompt ist keine Bestellung, sondern eine Regieanweisung. Wer ihn wie eine Beschreibung behandelt, bekommt hübsche Bilder ohne Dramaturgie. Ein festes Muster mit sechs Feldern hat sich bewährt:
- Was passiert: eine Handlung, eine Bewegung, ein Ziel.
- Wer: Figur plus Anker-Details.
- Wo: Ort, Tageszeit, Wetter, Umgebung.
- Wie gefilmt: Bildgröße, Perspektive, Bewegung, Brennweite, Schärfentiefe.
- Licht und Farbe: Lichtquelle, Stimmung, Kontrast, Palette.
- Ausschlüsse: was nicht vorkommen darf – zusätzliche Personen, Text im Bild, harte Verzerrungen.
Ein Beispiel für Feld vier, das den Unterschied macht:
Halbtotale, Kamera auf Augenhöhe, langsames Push-in, 50 mm, flache Schärfentiefe, Figur rechts im Bild, viel Leerraum links.
Verglichen mit einer vagen Formulierung wie „schöne Aufnahme der Figur“ enthält diese Zeile vier Entscheidungen, die später im Schnitt Bedeutung tragen. Der Leerraum links ist keine Dekoration – er ist der Platz, an dem ein Zuschauer Einsamkeit liest.
Länge und Reihenfolge im Prompt
Generative Werkzeuge gewichten unterschiedlich. Als Praxisregel gilt: Die ersten Begriffe prägen die Komposition, spätere Begriffe eher Stil und Details. Wer also Bildgröße und Bewegung zuerst nennt, bekommt zuverlässiger die gewünschte Kamera. Ausschlüsse gehören ans Ende, weil sie sonst die Aufmerksamkeit auf genau das lenken, was vermieden werden soll – auch wenn sie als Negativanweisung formuliert sind.
Prompt-Varianten statt Prompt-Neubau
Bei einem misslungenen Take ist die Versuchung groß, alles neu zu schreiben. Besser ist es, gezielt eine Variable zu ändern: Bewegung, Bildgröße oder Licht. So lernt man, welcher Begriff welche Wirkung hat, und baut mit der Zeit ein eigenes Vokabular auf. Wer dagegen bei jedem Versuch drei Felder gleichzeitig ändert, kann nie sagen, was funktioniert hat.
Tempo, Ton und die ersten zwei Sekunden
Kurzformate leben von den ersten zwei Sekunden. Wer dort eine Establishing-Weite setzt, verliert einen erheblichen Teil des Publikums, bevor die Geschichte beginnt. Besser ist es, mitten in eine Handlung einzusteigen und Orientierung später nachzuliefern – ein Detail, ein Geräusch, ein Satz reichen oft als Kontext. Die Reihenfolge der Informationen ist damit eine Regieentscheidung, nicht nur eine Schnittfrage.
Für die Schnittfrequenz gibt es keinen universellen Wert, aber brauchbare Richtwerte:
- Ruhiger, atmosphärischer Inhalt: 2 bis 3 Sekunden pro Schnitt.
- Dialog- oder Handlungsszenen: 1,5 bis 2,5 Sekunden.
- Montage und Energie: 0,6 bis 1,5 Sekunden.
- Pointe und Schlussbild: bewusst lang halten, 3 bis 5 Sekunden.
Ton ist kein Anhang, sondern Teil der Regie. Ein Bildwechsel auf einen Beat reduziert die wahrgenommene Länge einer Einstellung und lässt den Schnitt beabsichtigt wirken. Umgekehrt klingt ein harter Schnitt mitten in einer Tonphrase wie ein Fehler. Deshalb lohnt es sich, zuerst die Tonspur zu legen und dann zu schneiden – nicht umgekehrt. Wer zuerst schneidet und dann Musik sucht, schneidet zweimal.
Ein weiterer Praxistipp: Atmo-Spuren sind billiger als Musikakzente und oft wirksamer. Ein Raumhall, ein Klick, ein entferntes Geräusch verankern einen Schnitt im Raum, ohne die Szene zu erklären. In generierten Videos fehlt Ton fast immer völlig, weshalb die Nachvertonung mehr zur Glaubwürdigkeit beiträgt als ein zusätzlicher Take.
Werkzeuge, Entscheidungskriterien und typische Fehler
Nicht jedes Projekt braucht denselben Grad an Struktur. Die folgende Einordnung hat sich in der Praxis bewährt.
| Projekttyp | Empfohlenes Vorgehen | Typische Einstellungszahl |
|---|---|---|
| Spontaner Einzelclip | ein Prompt, keine Struktur | 1 |
| Clip mit Pointe | Logline, Beat-Liste, Shot-Liste | 8–14 |
| Serie mit gleicher Figur | Anker-Text, Referenzbilder, Blockproduktion | 10–20 pro Folge |
| Erklärvideo | Storyboard mit Texttafeln | 15–30 |
| Längerer Film | Szenenblöcke, Lichtkontinuität über Szenen | 40+ |
Zwei Kriterien entscheiden, ob sich ein strukturierter Regie-Workflow lohnt: Wiederholbarkeit und Konsistenzbedarf. Sobald dieselbe Figur oder dasselbe Setting mehrfach vorkommt, übersteigt der Aufwand für Nachbesserungen den Aufwand für eine saubere Planung. Bei einem einmaligen, abstrakten Clip ohne Figur ist das Gegenteil der Fall.
Drei weitere Entscheidungskriterien sind nützlich, wenn man Werkzeuge vergleicht: Wie gut hält das System Figuren über mehrere Einstellungen? Wie zuverlässig setzt es Kamerabewegungen um? Und wie einfach lassen sich Ausschlüsse formulieren? Diese drei Fragen entscheiden praktisch über den Produktionsaufwand – Bildqualität ist bei den meisten Anbietern inzwischen kein Unterscheidungsmerkmal mehr.
Typische Fehler
Zu viele Einstellungen. Ein Clip mit 40 Schnitten in 30 Sekunden wirkt nicht dynamisch, sondern unruhig. Weniger Einstellungen mit klarer Funktion schlagen jede Menge.
Keine Achse. Wechselt die Kamera zwischen zwei Einstellungen die Seite, wirkt die Szene wie ein Sprung. Achse einmal festlegen und in der Shot-Liste notieren.
Doppelte Informationen. Wenn die Nahaufnahme zeigt, was die Halbtotale schon gezeigt hat, kostet das Zeit ohne neue Information. Jede Einstellung sollte etwas hinzufügen: neue Information, neue Emotion oder neuen Rhythmus.
Widersprüchliche Regieanweisungen. „Statisch“ plus „dynamische Handheld-Bewegung“ verwirrt jedes Modell und erzeugt einen Mittelweg, der nichts richtig macht.
Sichtung ohne Kriterien. Wer Takes nach Gefühl auswählt, schneidet am Ende austauschbare Varianten zusammen. Besser vorab definieren: Welche Einstellung muss die Emotion tragen? Welche leitet nur über?
Fehlende Reserve. Manche Einstellungen gelingen erst im dritten Anlauf. Wer die gesamte Produktion auf exakt die geplanten Aufnahmen zuschneidet, hat keinen Puffer für Alternativen.
Stil vor Story. Ein Look-Test ist verlockend, weil er sofort sichtbar ist. Aber ein perfekter Look auf einer unklaren Szene bleibt eine unklare Szene – nur teurer.
Kein Ton geplant. Wenn die Musik erst nach dem finalen Schnitt gesucht wird, entstehen Akzente an den falschen Stellen. Tonspur zuerst, Bild danach.
Checkliste, FAQ und Fazit
Vor dem letzten Rendern lohnt ein kurzer Durchgang. Diese Liste hat sich in der Praxis bewährt:
- Story in einem Satz erklärbar?
- Erste zwei Sekunden stark genug ohne Kontext?
- Jede Einstellung mit klarer Funktion in der Erzählung?
- Achse und Blickrichtungen konsistent?
- Anker-Text in allen Prompts identisch?
- Schnittfrequenz variiert, nicht monoton?
- Tonakzente auf Bildwechseln?
- Schlussbild hält lange genug für die Pointe?
- Untertitel lesbar und nicht im Bildrand versteckt?
- Ganze Sequenz einmal ohne Ton angesehen?
Der letzte Punkt wird unterschätzt. Ohne Ton fällt auf, ob die Bilder allein funktionieren. Wenn nicht, trägt die Musik eine Geschichte, die bildlich nicht existiert.
FAQ
Braucht man eine Regieassistenz, wenn man nur ein oder zwei Clips pro Woche macht?
Für sehr kurze, spontane Aufnahmen ist der Nutzen gering. Sobald aber mehrere Einstellungen zu einer Handlung verbunden werden, lohnt sich eine minimale Struktur: Logline, Beat-Liste, Shot-Liste. Das sind zehn Minuten Vorarbeit, die meist eine Stunde Nacharbeit sparen.
Wie viele Einstellungen sollte ein 30-Sekunden-Clip haben?
Realistisch sind acht bis achtzehn Einstellungen. Die genaue Zahl hängt vom Tempo ab: ruhige Inhalte liegen am unteren Rand, Montagen am oberen. Wichtiger als die Anzahl ist, dass jede Aufnahme eine Aufgabe hat.
Funktioniert Storytelling auch ohne Dialog?
Ja, oft sogar besser, weil generierte Sprache schwer konsistent zu halten ist. Visuelles Storytelling überträgt die Erzählung auf Objekte, Blicke, Bewegungen und Schnittfolgen – also auf genau die Elemente, die sich strukturieren lassen.
Was macht man, wenn eine Figur über Einstellungen hinweg nicht stabil bleibt?
Zuerst den Anker-Text kürzen und konkreter machen. Anschließend Referenzbilder für Gesicht und Kleidung einsetzen. Wenn das nicht reicht, die Sequenz so umbauen, dass instabile Momente in Aufsichten, Weitwinkeln oder Halbtotalen ohne Gesicht stattfinden – eine dramaturgisch völlig legitime Lösung.
Wie viele Generierungsversuche sind normal?
Pro Einstellung sind zwei bis vier Versuche üblich, bei komplexen Bewegungen mehr. Wer deutlich mehr braucht, hat meist eine widersprüchliche oder überladene Anweisung im Prompt. Eine gute Diagnose ist, den Prompt zu halbieren und zu prüfen, welche Hälfte das Problem erzeugt.
Eignet sich der Ansatz auch für längere Videos?
Ja, aber mit anderer Gewichtung. Bei längeren Formaten verschiebt sich der Aufwand von der Konsistenz zwischen Einstellungen hin zur Konsistenz zwischen Szenen: gleiche Lichtstimmung, gleiche Objektivlogik, gleiche Figurenanlage über mehrere Minuten. Szenenweise Blöcke zu produzieren wird dadurch noch wichtiger.
Wie dokumentiert man einen Regieplan so, dass andere ihn verstehen?
Eine einfache Tabelle pro Szene reicht: Beat, Absicht, Einstellung, Bewegung, Dauer, Achse. Wer den Plan weitergibt, sollte die Logline mitliefern – sonst wird über Bilddetails diskutiert, bevor die Geschichte klar ist.
Wie geht man mit Rückschlägen um, wenn eine Szene einfach nicht funktioniert?
Meist liegt das Problem auf der Story-Ebene, nicht auf der Shot-Ebene. Prüfe, ob der Beat eine echte Veränderung enthält. Wenn nicht, hilft es, den Beat zu teilen, die Figur stärker unter Druck zu setzen oder eine Reaktionsaufnahme zu ergänzen. Wer stattdessen weiter an Kamerawinkeln dreht, verliert Zeit an der falschen Stelle.
Fazit
KI-Video ist kein Prompt-Wettbewerb, sondern Regiearbeit mit neuen Werkzeugen. Die Modelle liefern Bilder, aber Größe, Perspektive, Dauer und Reihenfolge bleiben Entscheidungen, die man selbst treffen muss – oder die man über eine strukturierte Assistenz treffen lässt. Wer Story, Shot und Schnitt getrennt denkt, konsistente Anker definiert und erst am Ende optimiert, kommt schneller zu Ergebnissen, die nicht nur gut aussehen, sondern erzählen.
Ein guter Einstieg für das nächste Projekt: Logline in einem Satz schreiben, fünf Beats notieren, daraus acht Einstellungen mit klarer Absicht ableiten – und die erste Einstellung mitten in die Handlung setzen. Wenn das funktioniert, ist der Rest Feinarbeit.


