Offre à Durée Limitée : 50% DE RÉDUCTION sur votre premier mois de Pro & Ultra 🎉

KI-Video: Storytelling und Shot-Design planen und umsetzen

Sep 15, 2026

Warum Struktur über den Erfolg entscheidet, nicht das Modell

Generative Videomodelle liefern inzwischen einzelne Einstellungen, die sich von real gedrehtem Material kaum noch unterscheiden lassen. Licht, Hauttextur, Kamerabewegung – vieles davon entsteht in wenigen Sekunden aus einer Textbeschreibung. Der Engpass liegt heute an einer anderen Stelle: Ein Video aus zwölf technisch brillanten Einstellungen kann trotzdem beliebig wirken, weil die dramaturgische Führung fehlt. Es gibt keine Hierarchie der Informationen, keinen Rhythmus, keine Ursache-Wirkung-Kette zwischen den Bildern.

Umgekehrt funktioniert eine Sequenz mit sichtbaren Artefakten erstaunlich gut, wenn die Schnittfolge klar ist, die Figur ein Ziel verfolgt und jeder Shot eine Aufgabe erfüllt. Zuschauer verzeihen technische Schwächen großzügig. Orientierungslosigkeit verzeihen sie nicht.

Dieser Leitfaden behandelt deshalb nicht die Frage, welches Modell die schönsten Pixel produziert, sondern wie du eine Idee systematisch in eine filmische Struktur übersetzt und diese Struktur so aufbereitest, dass ein Videogenerator sie zuverlässig umsetzen kann. Du bekommst einen Workflow, Entscheidungskriterien, konkrete Beispiele und eine Fehlerliste, die du vor jedem Projekt durchgehen kannst.

Der wichtigste Grundsatz dabei: Die Generierung ist der letzte Schritt, nicht der erste. Wer mit dem Prompt beginnt, produziert Material ohne Struktur und merkt oft erst beim Schnitt, dass ein zentraler Wendepunkt fehlt. Dann ist bereits Zeit in Takes geflossen, die nie ins fertige Video kommen.

Dazu kommt ein zweiter Effekt: Ohne Struktur fehlt dir das Kriterium, einen Take zu bewerten. Du entscheidest dann nach „gefällt mir“, nicht nach „erfüllt die Aufgabe“. Das ist der schnellste Weg zu einem Projekt, das nie fertig wird.

Vier Entscheidungen, die jedes KI-Video prägen

Bevor du die erste Einstellung beschreibst, triffst du vier Entscheidungen. Sie kosten zusammen etwa eine halbe Stunde und sparen später mehrere Stunden Nacharbeit. Alle vier lassen sich in Worten festhalten und über das gesamte Projekt hinweg konsistent halten.

Entscheidung eins: Das emotionale Ziel

Jede Sequenz braucht eine Zielsetzung, die der Zuschauer am Ende spürt. Bei kurzen Formaten – Reels, Werbespots, Teaser – ist dieses Ziel oft emotional statt handlungsgetrieben: Ruhe, Dringlichkeit, Staunen, Nostalgie. Formuliere es in einem Satz. „Der Zuschauer soll das Gefühl haben, dass Handarbeit Zeit braucht und sich lohnt“ ist ein brauchbares Ziel. „Es soll gut aussehen“ ist keines.

Wenn du das Ziel nicht in einem Satz sagen kannst, kann es der Zuschauer nicht fühlen. Ein unscharfes Ziel führt außerdem dazu, dass jede Einstellung irgendwie richtig und keine wirklich notwendig erscheint.

Entscheidung zwei: Die Perspektive

Aus welcher Position erzählst du? Beobachterisch aus der Distanz, nah an einer Figur, subjektiv aus deren Sicht oder kommentierend wie in einer Reportage? Diese Wahl bestimmt Einstellungsgrößen, Objektivwirkung und Schnitttempo. Eine subjektive Perspektive lebt von kurzen Brennweiten, Handkamera und Reaktionsbildern. Eine beobachterische Erzählung arbeitet mit ruhigen Totalen, langen Brennweiten und wenig Bewegung.

Mische diese Haltungen nicht unbewusst. Ein Wechsel der Perspektive ist ein starkes Stilmittel, aber nur dann, wenn er gewollt ist und an einer dramaturgisch sinnvollen Stelle stattfindet.

Entscheidung drei: Der Rhythmus

Lege fest, wie schnell das Video atmet. Ein Erklärvideo mit 90 Sekunden verträgt Einstellungen von vier bis sechs Sekunden. Ein Musikclip arbeitet mit halben Sekunden bis zwei Sekunden pro Bild. Werbeformate liegen dazwischen. Diese Festlegung ist wichtig, weil die Generierung von der Ziellänge abhängt: Für kurze Schnitte brauchst du weniger Bewegungsdetails pro Take, für lange Einstellungen mehr.

Ein praktischer Test: Schneide drei Testeinstellungen hintereinander und schau sie einmal stumm an. Wenn du das Gefühl hast, zu lange auf dasselbe Bild zu schauen, ist dein geplanter Rhythmus zu langsam.

Entscheidung vier: Das Konsistenzbudget

Konsistenz ist eine begrenzte Ressource. Jede zusätzliche Figur, jeder neue Schauplatz, jede Änderung der Tageszeit und jede komplizierte Requisite kostet Budget. Wenn Figur, Kleidung, Frisur, Raum und Licht im ganzen Video stabil bleiben sollen, reduziere die Zahl der variablen Elemente bewusst. Ein Video mit einer Figur in einem Raum kann über mehrere Minuten glaubwürdig wirken. Ein Video mit fünf Figuren an vier Orten wird schon nach 40 Sekunden sichtbar inkonsistent, wenn du nicht konsequent mit Referenzbildern arbeitest.

Vom Exposé zum Beat-Sheet: der Planungsweg

Der folgende Ablauf hat sich für Kurzfilme, Markenvideos, Erklärstücke und Musikclips bewährt. Er ist bewusst sequenziell aufgebaut, damit du nicht zu früh in die Generierung springst.

Logline, Zielgruppe und Format

Schreibe drei bis fünf Sätze: Worum geht es, für wen, in welchem Format und in welcher Länge? Alles, was du hier nicht entscheidest, entscheidet später der Zufall. Ein Beispiel: „Eine Bäckerin rettet ihr Traditionsgeschäft, indem sie nachts ein ungewöhnliches Brot entwickelt. Zielgruppe sind Menschen, die Handwerk schätzen. Format: 45-Sekunden-Markenvideo im Hochformat.“ Aus diesen Sätzen ergeben sich Ton, Tempo, Farbwelt und Figurenzeichnung fast von selbst.

Kläre außerdem das Seitenverhältnis früh. Hochformat verlangt zentrierte Komposition, weniger Hintergrunddetails und größere Schrift für Untertitel. Querformat erlaubt Weitwinkelbilder mit viel Kontext. Wer das Format erst nach der Generierung festlegt, verliert Bildinhalte durch Beschnitt oder muss neu generieren.

Das Beat-Sheet: Wendepunkte statt Sätze

Notiere sechs bis zehn Beats. Ein Beat ist eine Veränderung, keine Beschreibung. „Sie entdeckt den Fehler“ ist ein Beat. „Sie steht in der Küche und schaut nachdenklich“ ist eine Einstellung. Die Trennung ist entscheidend, weil Anfänger sonst Bilder schreiben, bevor die Struktur steht, und anschließend versuchen, die Struktur aus den Bildern herauszulesen.

Ein bewährtes Muster für kurze Formate sind vier Blöcke: Ausgangszustand, Störung, Eskalation, Auflösung. Für längere Videos wiederholt sich dieses Muster in Kapiteln, wobei jedes Kapitel seine eigene kleine Spannungskurve erhält.

Szenen zerlegen: Ort, Zeit, Licht, Requisiten

Lege für jede Szene fünf Parameter fest: Ort, Tageszeit, Wetter, Grundstimmung und die drei wichtigsten Requisiten. Diese Parameter werden später zu wiederverwendbaren Textbausteinen. Je disziplinierter du hier arbeitest, desto weniger Nacharbeit entsteht bei der Generierung, weil du identische Formulierungen über mehrere Prompts hinweg kopieren kannst.

Praktisch hilfreich ist eine einfache Tabelle mit einer Zeile pro Szene. Szenen, die keinen eigenen Ort, keine eigene Zeit oder keine eigene Stimmung haben, sind meistens keine eigenständigen Szenen, sondern Unterpunkte einer bestehenden.

Shot-Liste mit Funktionsspalte

Erstelle eine Tabelle mit sieben Spalten: Nummer, Funktion im Schnitt, Einstellungsgröße, Kamerabewegung, Dauer, Licht, Prompt-Kern. Die Funktionsspalte ist die wichtigste. Erlaubte Werte sind zum Beispiel Orientierung, Emotion, Detail, Reaktion, Übergang und Auflösung. Ein Shot ohne benannte Funktion fliegt aus der Liste. Dieses eine Kriterium verhindert mehr Überlänge als jede Schnittregel.

Zusätzlich lohnt eine Spalte „Achse“, in der du notierst, von welcher Seite der gedachten Figurenlinie die Kamera steht. Bei KI-Material ist das kein Luxus, sondern eine Notwendigkeit, weil Modelle die Blickrichtung nicht aus dem Zusammenhang ableiten.

Produktionsreihenfolge festlegen

Generiere nicht in der Reihenfolge der Timeline, sondern in Clustern. Alle Einstellungen desselben Ortes und derselben Lichtsituation gehören zusammen, weil du dann denselben Prompt-Anker und dieselben Referenzbilder verwenden kannst. Sortiere die Shot-Liste entsprechend um und nummeriere die Produktionsreihenfolge getrennt von der Schnittreihenfolge.

Shot-Design: Größe, Achse, Bewegung

Shot-Design ist Handwerk und deshalb gut lernbar. Drei Aspekte decken den größten Teil ab.

Einstellungsgrößen bewusst einsetzen

Die klassische Leiter lautet: Weite, Totale, Halbtotale, Nahaufnahme, Großaufnahme, Detail. Jede Größe hat eine Aufgabe. Die Weite zeigt den Kontext und sagt dem Zuschauer, wo er ist. Die Totale zeigt die Figur im Raum. Die Halbtotale zeigt Handlung. Nahaufnahme und Großaufnahme zeigen Emotion und Entscheidung. Das Detail zeigt Information, die man sonst übersehen würde – ein Zittern der Hand, ein Datum auf einem Schild.

Eine brauchbare Faustregel: Beginne eine Szene weiter als nötig und werde dann näher. Der umgekehrte Weg funktioniert nur mit gutem Grund, weil er den Zuschauer orientierungslos in einen Raum wirft und Spannung nimmt statt gibt.

Die 30-Grad-Regel aus der klassischen Filmproduktion hilft auch bei KI-Material: Zwei aufeinanderfolgende Einstellungen desselben Motivs sollten sich in Perspektive oder Größe deutlich unterscheiden. Zwei fast identische Totale hintereinander kosten Zeit und liefern keine neue Information.

Auch die Brennweite gehört in deine Planung. 24 bis 28 Millimeter wirken weit und dynamisch, aber verzerren Gesichter an den Rändern. 35 Millimeter sind ein neutraler Allrounder. 50 Millimeter entsprechen ungefähr dem menschlichen Sehen. 85 Millimeter und mehr komprimieren den Raum, isolieren die Figur und eignen sich für emotionale Nahaufnahmen.

Die Achse halten

Die 180-Grad-Regel besagt, dass du die gedachte Linie zwischen zwei Figuren nicht überspringst, sonst tauschen die Blickrichtungen und der Zuschauer verliert die Orientierung. Bei KI-Material ist das doppelt wichtig. Notiere in der Shot-Liste für jede Einstellung, von welcher Seite der Achse die Kamera steht, und formuliere das im Prompt – zum Beispiel „Kamera links der Figur, Figur blickt nach rechts aus dem Bild“.

Wenn du bewusst über die Achse gehst, markiere das als dramaturgische Entscheidung und fang den Wechsel mit einer neutralen Einstellung ab: einer Frontalen, einer Weite oder einem Detail. So bleibt der Bruch lesbar.

Kamerabewegung dosieren

Bewegung ist wirkungsvoll, aber teuer in der Generierung. Wähle pro Einstellung genau eine dominante Bewegung: Dolly-in, Dolly-out, Schwenk, Kran, Handkamera, Fahrt. Kombiniere nicht mehrere Bewegungen im selben Take, weil Modelle dann häufig unlogische Ergebnisse liefern – etwa eine Fahrt, die mitten in der Einstellung die Richtung wechselt.

Eine ruhige Einstellung mit leichter Handkamera wirkt oft lebendiger als ein technisch ambitionierter Kamerafahrtsversuch. Wenn eine Bewegung nicht der Information dient, lass sie weg.

Prompts als Regieanweisung schreiben

Ein Prompt ist keine Bestellung, sondern eine Regieanweisung. Ein guter Prompt beschreibt, was die Kamera sieht, nicht was der Zuschauer fühlen soll. Gefühle entstehen aus Licht, Distanz, Tempo und Schnittfolge – nicht aus Adjektiven wie „episch“ oder „emotional“.

Die sechs Slots

Ein brauchbares Gerüst hat sechs Slots: Subjekt und Handlung, Umgebung und Tageszeit, Einstellungsgröße, Objektiv und Perspektive, Lichtstimmung, Bewegung von Kamera und Motiv. Fülle diese sechs Slots in zwei bis vier klaren Sätzen. Halte sie über eine Szene hinweg konstant und ändere pro Einstellung möglichst nur einen Slot. So entsteht Variation ohne Bruch.

Ein Beispiel für einen solchen Prompt: „Eine Frau mittleren Alters in dunkelgrüner Schürze schiebt ein Blech in den Ofen. Kleine Backstube am frühen Morgen, warmes Licht von links durch ein staubiges Fenster. Halbtotale. 50 Millimeter, Kamera auf Augenhöhe. Ruhige, langsame Fahrt nach vorn. Dampf steigt auf.“

Und derselbe Ort als Variante für den nächsten Shot: „Eine Frau mittleren Alters in dunkelgrüner Schürze wischt sich mit dem Unterarm über die Stirn. Kleine Backstube am frühen Morgen, warmes Licht von links durch ein staubiges Fenster. Nahaufnahme. 85 Millimeter, Kamera leicht unter Augenhöhe. Kamera statisch. Mehlstaub in der Luft.“

Diese beiden Prompts enthalten keine Emotion. Sie erzeugen aber eine, weil Anker, Licht und Perspektive zusammenarbeiten.

Wortanker für Konsistenz

Verwende identische Wortgruppen für alles, was sich nicht ändern soll. Wenn die Figur „dunkelgrüne Schürze, rotes Kopftuch, kurzes graues Haar“ heißt, dann heißt sie in jedem Prompt so – wortgleich. Variiere nicht mit Synonymen. Modelle interpretieren Synonyme als neue Information und verändern das Bild.

Anker lohnen sich für Gesicht, Kleidung, Haarlänge, Raum, Lichtrichtung und Farbpalette. Sechs bis acht Anker über das ganze Projekt reichen meist aus. Schreibe sie einmal in eine Textdatei und kopiere sie aus dieser Datei, statt sie neu zu tippen. Tippfehler in Ankern sind einer der häufigsten Gründe für inkonsistente Ergebnisse.

Negativliste führen

Notiere Begriffe, die du nicht willst: zusätzliche Personen im Hintergrund, Text im Bild, Wasserzeichen, verzerrte Hände, Doppelbelichtungen, harte Kontraste, überstrahlte Fenster. Prüfe jeden Prompt gegen diese Liste. Viele Generatoren unterstützen negative Beschreibungen direkt; wenn nicht, formuliere positiv, was stattdessen zu sehen sein soll – „leere Straße“ statt „keine Passanten“.

Reihenfolge der Informationen

Nenne zuerst das Motiv, dann die Handlung, dann die Kamera. Wenn du mit Kameratechnik beginnst, priorisieren viele Systeme die Bewegung und vernachlässigen das Motiv. Vermeide außerdem widersprüchliche Angaben wie „statische Totale mit schnellem Schwenk“ – solche Sätze erhöhen die Ablehnungsquote deutlich.

Konsistenz über viele Einstellungen

Konsistenz entsteht nicht durch einen Trick, sondern durch Disziplin auf drei Ebenen.

Figur

Ein Charakterblatt mit fünf bis acht Merkmalen verhindert die meisten Abweichungen: Alter, Haarfarbe und -form, Kleidung, ein Accessoire, Gesichtsform, Grundhaltung. Verzichte auf Adjektive, die unterschiedlich interpretierbar sind. „Charismatisch“ ist unbrauchbar. „Schmale Schultern, ruhige Haltung, Blick leicht nach unten“ ist brauchbar.

Bewährt hat sich außerdem, die Figur in wenigen Varianten zu beschreiben, die sich nur in einem Merkmal unterscheiden – etwa mit und ohne Kopftuch. Alles andere bleibt wortgleich.

Raum

Skizziere einen Grundriss auf Papier: Wo stehen Fenster, Türen, Möbel? Beschreibe Licht immer aus derselben Richtung. Wenn die Fensterseite in allen Einstellungen die Lichtquelle ist, bleibt der Raum glaubwürdig, auch wenn Details variieren. Für Räume mit mehreren Ansichten lohnt es sich, drei Referenzbilder zu erzeugen: eine Totale, ein Halbtotale aus Gegenrichtung und ein Detail der wichtigsten Requisite.

Stil

Definiere eine visuelle Kurzformel: Farbpalette, Kontrast, Kornstärke, Brennweite, Bewegungstempo. Kopiere sie in jeden Prompt. Ein Stilanker ersetzt drei Sätze Beschreibung und wirkt über das gesamte Video. Beispiel: „gedämpfte Grün- und Brauntöne, weiches Seitenlicht, feines Filmkorn, ruhige Bewegung“.

Akzeptiere, dass kleine Abweichungen normal sind. Vollständige Konsistenz erreichen aktuelle Generatoren nur mit Referenzbildern und Nachbearbeitung, nicht allein über Text. Plane diese Nachbearbeitung von Anfang an mit ein und behandle sie nicht als Notlösung.

Modellwahl und Iterationsstrategie

Modelle als Rollen verteilen

Arbeite mit zwei bis drei Werkzeugen und weise ihnen Rollen zu. Ein Modell liefert Menschen, ein zweites Landschaften und Räume ohne Figuren, ein drittes Spezialaufnahmen wie Makro, Zeitlupe oder abstrakte Übergänge. So nutzt du die jeweiligen Stärken und vermeidest, dass ein System alles können muss.

Wenn du einen Shot mit mehreren Modellen testest, bewerte drei Kriterien: Erfüllt der Take seine Funktion? Bewegt sich die Kamera wie beschrieben? Passt die Figur zum Vorgänger? Erst danach lohnt ein Vergleich der Bildqualität. Qualität ohne Funktion ist eine Sackgasse.

Erst günstig explorieren, dann hochwertig produzieren

Ein schnelles Modell mit mittlerer Qualität ist in der Explorationsphase wertvoller als ein langsames Spitzenmodell. Nutze kurze Testläufe mit geringer Auflösung, um Einstellungsgröße, Bewegung und Komposition zu prüfen. Erst wenn die Einstellung dramaturgisch sitzt, rendere in hoher Qualität. Plane Zeitpuffer ein: Bei komplexen Bewegungen liegt die Trefferquote oft bei einem Drittel.

Ein weiterer Hebel ist die Reihenfolge innerhalb einer Szene. Produziere zuerst die Einstellung, die am schwierigsten ist und die größte Unsicherheit trägt. Wenn sie nicht funktioniert, kannst du die Szene umplanen, bevor du Zeit in die einfachen Bilder investiert hast.

Referenzbilder und Startframes

Für kritische Einstellungen lohnt es sich, den ersten Frame als Bild zu erzeugen und als Startframe in die Videogenerierung zu geben. Damit kontrollierst du Komposition, Figur und Licht deutlich präziser als über Text. Alternativ helfen durchgehende Referenzbilder der Figur, die in mehreren Einstellungen verwendet werden.

Sinnvoll ist außerdem eine klare Projektstruktur: ein Ordner pro Szene, darin Unterordner für Referenzen, Startframes, generierte Takes und ausgewählte Versionen. Wer Takes mit fortlaufenden Zufallsnamen ablegt, verliert nach zwei Stunden den Überblick und generiert doppelt.

Ton, Musik und Schnittrhythmus

KI-Video wird meist stumm gedacht, dabei entscheidet Ton über die halbe Wirkung. Drei Elemente zählen.

Atmosphäre

Ein durchgehender Raumklang – Regen, Straßenverkehr, Küchengeräusche, Wind – verbindet Szenen und kaschiert Schnitte. Lege für jede Szene einen Grundklang fest und lass ihn über Schnittgrenzen hinweg weiterlaufen. Der Effekt ist enorm: Die Zuschauer nehmen die Bilder als zusammenhängender wahr, auch wenn Farben und Details leicht schwanken.

Akzente

Setze punktuelle Geräusche auf Bewegungen, Blicke und Schnitte: ein Klicken, ein Atemzug, ein Papierrascheln. Akzente geben Bildern Gewicht und ersetzen fehlende Detailinformationen, die das KI-Material nicht liefert. Häufig reichen sechs bis zehn Akzente für ein einminütiges Video.

Musik und Schnitt

Die Musik gibt das Tempo vor, aber folge ihr nicht sklavisch. Setze Schnitte auf betonte Schläge nur bei Übergängen zwischen Bildblöcken. Innerhalb eines Blocks darf der Schnitt auf unbetonten Zählzeiten liegen. Entscheidend ist die Motivation jedes Schnitts: neue Information, Perspektivwechsel oder emotionaler Sprung. Motivlose Schnitte wirken hektisch.

Nachbearbeitung als Vereinheitlicher

Ein gemeinsamer Farblook ist der günstigste Konsistenzgewinn überhaupt. Eine einheitliche Kontrast- und Farbkurve über alle Einstellungen, ein dezentes Filmkorn und eine vergleichbare Schärfeebene lassen unterschiedliche Generierungen wie aus einem Guss erscheinen. Prüfe zusätzlich, ob Bildraten und Auflösungen zusammenpassen, und stabilisiere wackelige Einstellungen sparsam. Zu viel Stabilisierung erzeugt einen schwebenden, künstlichen Eindruck.

Typische Fehler und wie du sie vermeidest

Fehler eins: mit dem Prompt beginnen. Ohne Struktur produziert man Material, das im Schnitt nicht zusammenfindet, und verliert die Fähigkeit, Takes sinnvoll zu bewerten.

Fehler zwei: zu viel Information pro Einstellung. Ein Shot, der Figur, Ort, Handlung und Wendepunkt gleichzeitig erklären soll, wirkt überladen und generiert unzuverlässig. Teile ihn in zwei Einstellungen mit unterschiedlicher Größe.

Fehler drei: Überspezifikation unsichtbarer Details. Ob die Jacke zwei oder drei Knöpfe hat, ist in der Halbtotalen irrelevant, kostet aber Konsistenzbudget. Umgekehrt werden sichtbare Merkmale wie Haarlänge oder Brillenform oft zu vage beschrieben.

Fehler vier: keine Negativliste. Ohne sie tauchen immer wieder Textfetzen, Wasserzeichen oder zusätzliche Personen auf, die du dann in der Nachbearbeitung mühsam entfernen musst.

Fehler fünf: Generieren ohne Auswahlkriterium. Wer nicht weiß, welchen Shot-Typ er braucht, erkennt den besten Take nicht, wenn er kommt, und rendert weiter, obwohl die Einstellung längst funktioniert.

Fehler sechs: Einstellungen zu lang generieren. Längere Läufe neigen zu Ghosting, weichen Gesichtern und unlogischen Bewegungen. Generiere drei bis sechs Sekunden und kürze beim Schnitt.

Fehler sieben: Ton erst am Ende denken. Wenn der Schnitt ohne Musik nicht funktioniert, rettet Musik später nichts mehr. Prüfe jede Fassung einmal stumm.

Fehler acht: Perfektion an der falschen Stelle. Die Energie, mit der man den zwanzigsten Take einer Nebeneinstellung bewertet, fehlt später für den letzten Feinschliff am Ende. Priorisiere die Einstellungen, die die Handlung tragen.

Fehler neun: fehlende Pausen. Ein Video ohne ruhige Momente wirkt wie eine Dauerwerbesendung. Eine einzige ruhige Einstellung von zwei Sekunden vor dem Höhepunkt erhöht die Wirkung des Höhepunkts oft mehr als ein zusätzlicher Effekt.

Häufige Fragen und Checkliste

Checkliste vor dem ersten Rendern

Logline in einem Satz vorhanden? Beat-Sheet mit klaren Wendepunkten geschrieben? Ort, Tageszeit, Lichtrichtung und Requisiten definiert? Jede Einstellung mit benannter Funktion? Prompts mit den sechs Slots in der richtigen Reihenfolge? Wortanker für Figur, Raum und Stil konsistent? Referenzen oder Startframes für kritische Einstellungen vorbereitet? Tonkonzept mit Atmosphäre, Akzenten und Musik skizziert? Produktionsreihenfolge nach Orten geclustert?

Wenn ein Punkt offen bleibt, kostet er dich später ein Vielfaches an Zeit – genau in der Phase, in der du schon Material generiert hast und nicht mehr neutral entscheiden kannst.

Wie viele Einstellungen brauche ich für ein 60-Sekunden-Video?

Für ein ruhiges Erklär- oder Markenvideo genügen zwölf bis achtzehn Einstellungen von drei bis fünf Sekunden. Für ein dynamisches Musikformat sind zwanzig bis dreißig kürzere Einstellungen üblich. Wichtiger als die Zahl ist die Verteilung: weit beginnen, näher werden, mit einer Auflösung enden.

Muss ich Drehbuchautor sein, um gute KI-Videos zu machen?

Nein, aber du brauchst Struktur. Ein Beat-Sheet mit acht Zeilen ist keine literarische Leistung, sondern eine Organisationshilfe. Wer sich diese zwanzig Minuten nimmt, spart Stunden beim Generieren und Schneiden.

Wie gehe ich mit inkonsistenten Gesichtern um?

Reduziere die Zahl der Einstellungen, in denen das Gesicht groß sichtbar ist. Zeige stattdessen Hände, Silhouetten, Rückansichten oder Reaktionen anderer Figuren. Wenn ein Gesicht mehrfach gebraucht wird, arbeite mit Referenzbildern und halte Lichtsituation und Blickwinkel konstant. Ein Profil oder eine leichte Untersicht ist oft stabiler als eine frontale Großaufnahme.

Wie lang sollte eine einzelne KI-Einstellung sein?

Generiere drei bis sechs Sekunden und kürze beim Schnitt. Wenn du längere Takes brauchst, teile sie in zwei Einstellungen mit unterschiedlicher Größe auf. Das wirkt nicht nur natürlicher, es versteckt auch Übergänge.

Woran erkenne ich, dass mein Schnitt fertig ist?

Wenn du ihn ohne Musik anschaust und die Handlung trotzdem verständlich bleibt. Wenn du keine Einstellung mehr wegdenken möchtest. Wenn der letzte Shot die Ausgangsfrage beantwortet. Alles andere ist Feinschliff.

Welches Modell ist das beste?

Es gibt keines für alles. Teste dieselbe Einstellung mit zwei oder drei Werkzeugen und vergleiche Bewegung, Kohärenz und Realismus. Entscheide danach pro Einstellung, nicht pauschal. Ein festes Set pro Projekt senkt die Iterationskosten deutlich.

Was mache ich, wenn eine Szene trotz guter Planung nicht funktioniert?

Prüfe zuerst die Struktur, nicht das Material. Fehlt ein Beat? Erklärt die Szene zu viel auf einmal? Fehlt eine Orientierungseinstellung am Anfang? In neun von zehn Fällen liegt das Problem in der Planung, nicht im Generator. Zerlege die Szene in kleinere Einheiten und generiere die fehlende Orientierungseinstellung zuerst.

Wie viel Zeit sollte ich für die Nachbearbeitung einplanen?

Rechne mit einem Drittel der Gesamtzeit. Farbangleichung, Tonspur, Untertitel und letzter Feinschliff sind die Schritte, in denen aus einer Sammlung guter Einstellungen ein fertiges Video wird. Wer hier spart, verliert die Wirkung der Arbeit, die davor entstanden ist.

Am Ende gilt ein einfacher Maßstab: Wenn du deine Sequenz stumm ansiehst und die Geschichte verständlich bleibt, hast du deine Aufgabe als Regie erfüllt. Die Generierung war dann nur noch das Werkzeug.

Alexander

Alexander