Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

KI-Filmemachen: Storytelling-Workflow von Idee bis Schnitt

Oct 5, 2026

Warum sich Filmemachen gerade neu sortiert

Generationen von Filmemachern haben gelernt, in Produktionszwängen zu denken: Drehtage, Licht, Genehmigungen, Budgets, Wetter. Generative Video-Modelle lösen diesen Rahmen teilweise auf. Ein Shot, der früher ein Team, ein Set und einen halben Drehtag gebraucht hätte, entsteht heute aus einer Beschreibung, einem Referenzbild und ein paar Minuten Rechenzeit. Das verschiebt den Engpass: Nicht die Ausführung ist knapp, sondern die Klarheit der Entscheidung.

Das hat eine unangenehme Nebenwirkung. Wenn alles möglich aussieht, entstehen beliebige Filme. Wer schon einmal zwanzig Varianten eines Shots generiert und dann die mittelmäßigste genommen hat, kennt das Problem. Die entscheidende Fähigkeit ist deshalb weniger Prompt-Handwerk als Regie: zu wissen, was ein Shot leisten muss, damit die nächste Szene funktioniert.

Zweitens bleiben Werkzeuge Werkzeuge. Text-zu-Video, Bild-zu-Video, Video-zu-Video, Lip-Sync, Inpainting, Upscaling und Audio-Generierung bilden heute eine Kette, in der jeder Schritt andere Stärken hat. Kein einzelnes Modell gewinnt in allen Kategorien. Wer sich an ein einziges Werkzeug bindet, baut sich selbst einen Flaschenhals.

Drittens liegt der Unterschied zwischen amateurhaftem und professionellem Output selten am Modell. Er liegt an der Konsistenz zwischen den Shots, am Schnittrhythmus, am Ton und an der Bereitschaft, einen großen Teil des Materials zu verwerfen. Genau darum geht es im Rest dieses Artikels: um einen Workflow, der aus generierten Clips einen Film macht – und nicht eine Sammlung schöner Einzelbilder.

Der Workflow im Überblick: sieben Phasen von der Idee zum Master

Ein belastbarer KI-Film entsteht in sieben Phasen. Wer eine davon überspringt, merkt es später an einer Stelle, an der Korrekturen teuer werden.

  1. Story-Architektur: Logline, Thema, Konflikt, Figur, Ende. Kein Bild, keine Einstellung, nur Dramaturgie.
  2. Drehbuch und Szenenzerlegung: Dialog, Handlung, Szenenziele – zerlegt in generierbare Einheiten.
  3. Visuelle Planung: Lookbook, Storyboard, Shotlist, Kontinuitätskarte.
  4. Asset-Vorbereitung: Charakter-Referenzen, Locations, Props, Stil-Referenzen, Farbpalette.
  5. Generierung: Shot für Shot, mit Varianten und bewusster Auswahl.
  6. Auswahl und Iteration: Selects, Vergleich, Nachbesserung einzelner Shots.
  7. Postproduktion: Schnitt, Ton, Musik, Vertonung, Farbkorrektur, Upscaling, Mastering.

Wichtig ist, dass diese Phasen keine Einbahnstraße sind. Realistisch läuft der Prozess in Schleifen: Nach der ersten Generierungsrunde zeigt sich, dass eine Szene im Drehbuch nicht funktioniert, oder dass eine Figur zu wenig Präsenz hat. Dann geht man zurück in Phase zwei oder drei – aber mit dem Wissen aus Phase fünf. Diese Rückkopplung ist kein Scheitern, sondern der normale Weg.

Wer mit KI-Video arbeitet, sollte außerdem akzeptieren, dass die erste Fassung nie die letzte ist. Planen Sie von Anfang an zwei bis drei Iterationsrunden ein, und verteilen Sie Ihre Zeit entsprechend: etwa 70 Prozent Vorbereitung und Auswahl, 30 Prozent Generierung.

Story-Architektur und Drehbuch: die Phase, die niemand überspringen sollte

Von der Idee zur Logline

Bevor irgendetwas generiert wird, sollte in einem Satz stehen, worum es geht: Wer will was, warum, und was steht dabei auf dem Spiel. Diese Logline ist der Kompass für jede spätere Entscheidung. Ohne sie wird bei der Shot-Auswahl nach Optik entschieden statt nach Funktion – und am Ende wirkt der Film hübsch, aber beliebig.

Ein nützlicher Test: Wenn Sie die Logline nicht in einem Satz sagen können, ist die Geschichte noch nicht entschieden. KI-Tools verstärken diesen Mangel, weil sie visuelle Attraktivität liefern, die von dramaturgischer Leere ablenkt.

Szenenzerlegung in generierbare Einheiten

Der zweite Schritt ist eine Übersetzungsarbeit: Was im Drehbuch eine Szene ist, muss für die Generierung in kurze Einstellungen zerlegt werden. Als Faustregel gilt, dass ein generierter Clip nur eine dramaturgische Aufgabe erfüllen sollte. Ein Shot zeigt eine Handlung, eine Reaktion oder eine Information – nicht drei gleichzeitig.

Praktisch bedeutet das: Statt „Sie streiten sich in der Küche, dann geht er raus und es beginnt zu regnen“ entstehen vier Shots. Der Streit. Ihre Reaktion. Sein Abgang durch die Tür. Der Regen auf der Straße. Jeder dieser Shots hat eine klare Dauer, eine klare Aussage und eine klare Verbindung zum nächsten.

Notieren Sie beim Zerlegen für jeden Shot: Zweck, Figur, Ort, Tageszeit, Stimmung, Dauer und wie er an den vorherigen und nächsten Shot anschließt. Diese Notizen sind später Ihr Prompt-Gerüst und Ihre Kontinuitätsprüfung.

Storyboard, Shotlist und visuelle Planung

Shotlist-Spalten, die sich bewährt haben

Eine brauchbare Shotlist hat folgende Spalten: Szenennummer, Shot-Nummer, Einstellungsgröße, Kamerabewegung, geschätzte Dauer, Handlung, Kernbegriffe für den Prompt, Ton und Status. Diese Tabelle ist kein Bürokratie-Anhang, sondern Ihr zentrales Steuerinstrument. Wenn ein Shot nicht funktioniert, sehen Sie sofort, ob das Problem in der Bewegung, der Beschreibung oder der Kontinuität liegt.

Lookbook und Stil-Referenzen

Ein Lookbook mit fünf bis zehn Referenzbildern legt fest, wie Licht, Farben, Textur und Materialität aussehen sollen. Wichtig ist Auswahl, nicht Menge: Referenzen, die sich widersprechen, führen zu inkonsistenten Ergebnissen. Entscheiden Sie sich zum Beispiel für kontrastreiches Licht mit warmen Spitzlichtern oder für weiches, entsättigtes Tageslicht – nicht für beides.

Kontinuitätskarte

Die Kontinuitätskarte ist eine einfache Liste pro Figur und Ort: Kleidung, Frisur, Requisiten, Lichtrichtung, Wetter, Uhrzeit. Sie klingt trivial, ist aber der häufigste Grund, warum KI-Filme „springen“. Wenn ein Mantel im dritten Shot plötzlich eine andere Farbe hat, verliert der Zuschauer die Orientierung – meist ohne zu wissen, warum.

Modellwahl als Entscheidungsproblem: Kriterien statt Bauchgefühl

Es gibt nicht „das beste“ Modell, sondern Modelle mit unterschiedlichen Profilen. Bewerten Sie jedes Kandidatenmodell nach denselben Kriterien, dann werden Entscheidungen reproduzierbar.

Bewegungsqualität. Wie gut hält ein Modell Physik aus? Hände, Stoffe, Flüssigkeiten und Haare sind die klassischen Schwachpunkte. Testen Sie mit einem kurzen Standardtest, etwa einer Person, die ein Glas Wasser einschenkt.

Konsistenz über Shots hinweg. Kann eine Figur über mehrere Clips hinweg stabil bleiben, wenn Sie dieselben Referenzen verwenden? Das ist das wichtigste Kriterium für erzählende Formate.

Steuerbarkeit. Lassen sich Kamerabewegung, Brennweite und Bildausschnitt beeinflussen, oder ist der Zufall zu groß? Für Werbe- und Corporate-Formate ist Steuerbarkeit wichtiger als maximale Kreativität.

Auflösung und Seitenverhältnis. Hochformat für Social, Breitbild für Präsentationen, quadratisch für Kampagnen. Prüfen Sie das vor dem Dreh, nicht danach.

Text und Details im Bild. Logos, Schilder und Schrift sind bis heute instabil. Wenn Text im Bild wichtig ist, planen Sie ihn als Postproduktionsschritt ein.

Lizenz und Nutzungsbedingungen. Klären Sie vor der Arbeit mit Kunden material, welche kommerzielle Nutzung erlaubt ist.

Wann welcher Modelltyp passt

Text-zu-Video eignet sich für schnelle Konzepttests, Stimmungsbilder und Establishing Shots. Bild-zu-Video ist die Arbeitspferd-Technik für Charakterarbeit, weil Sie ein konsistentes Startbild kontrollieren und nur noch die Bewegung generieren lassen. Video-zu-Video hilft bei Retiming, Stiltransfers und bei der Stabilisierung bereits vorhandener Aufnahmen. Für Gesichter und Sprache kombinieren Sie Video-Generierung mit spezialisierter Lip-Sync-Bearbeitung, statt beides von einem einzigen Modell zu erwarten.

Charakter- und Stilkonsistenz meistern

Konsistenz ist die Königsdisziplin. Ein Film mit einer glaubwürdigen Figur über zwanzig Shots schlägt jedes technisch brillante Patchwork.

Werkzeuge für Konsistenz

Charakter-Sheets. Erstellen Sie pro Figur ein Blatt mit vier bis sechs Ansichten: Frontal, Halbprofil, Profil, Ganzkörper, Nahaufnahme. Diese Bilder werden zu Ihrer Referenzsammlung.

Referenzbilder pro Shot. Statt die Figur nur zu beschreiben, geben Sie ein Referenzbild mit und beschreiben Sie nur die Abweichung – Pose, Licht, Umgebung.

Seeds und feste Parameter. Wenn ein Modell einen Seed unterstützt, behalten Sie ihn über eine Sequenz bei. Das reduziert zufällige Sprünge in Textur und Farbstimmung.

Multi-Image-Ansätze. Viele moderne Systeme können mehrere Bilder gleichzeitig als Kontext verarbeiten, beispielsweise Figur plus Location plus Stilvorlage. Das ist der effizienteste Weg, mehrere Vorgaben gleichzeitig zu erzwingen, statt sie in einen langen Textprompt zu quetschen.

Inpainting und Maskierung. Kleinere Fehler – ein kaputter Ärmel, ein verschwommener Hintergrund – reparieren Sie punktuell, statt den ganzen Shot neu zu generieren.

Konsistenz-Checkliste

Prüfen Sie nach jeder Generierungsrunde: Kleidung identisch? Haarlänge und Frisur identisch? Farbtemperatur im Stil der Nachbarszenen? Lichtrichtung passend zur Umgebung? Requisiten am richtigen Ort? Wenn zwei oder mehr Punkte abweichen, korrigieren Sie sofort – Fehler pflanzen sich in der Montage fort.

Regie per Dialog: Anweisungen, die wirklich wirken

Ein Prompt ist keine Beschreibung, sondern eine Regieanweisung. Bewährt hat sich eine feste Reihenfolge: Subjekt, Handlung, Umgebung, Licht, Kamera, Stil, Ausschlüsse. Diese Reihenfolge hilft dem Modell, Prioritäten zu erkennen.

Ein Beispiel: „Eine Frau mittleren Alters in dunkelblauem Mantel betritt eine leere Bahnhofshalle; sie bleibt stehen und blickt nach oben. Neongelbes Deckenlicht, nasser Betonboden, Nebel. Langsame Kamerafahrt nach vorn, leichte Untersicht, 35-mm-Look. Realistisch, entsättigt mit warmen Spitzlichtern. Keine Texte, keine zusätzlichen Personen.“

Beachten Sie, was hier weggelassen wurde: Adjektive wie „schön“, „episch“ oder „cinematisch“. Solche Wörter erzeugen keine konsistenten Ergebnisse. Ersetzen Sie sie durch konkrete Merkmale – Lichtqualität, Objektiv, Bewegung, Materialität.

Regiearbeit heißt auch, den Dialog fortzusetzen. Nach der ersten Generation beschreiben Sie die Abweichung, nicht das Gesamtbild: „Gleiche Figur, gleicher Raum, aber Kamera weiter links und Licht weicher.“ Wer bei jeder Iteration alles neu formuliert, verliert die Kontrolle über das, was schon funktioniert.

Ein weiterer Trick für Sequenzen: Generieren Sie einen Shot, der Ihnen gefällt, als Anschluss-Shot weiter. Sie können das letzte Einzelbild als Startbild des nächsten Shots verwenden. So entsteht eine visuelle Kette statt einer Reihe von Einzelstücken.

Ton, Schnitt und Mastering: wo KI-Videos professionell werden

Schnittrhythmus

Generierte Clips sind selten genau so lang, wie der Film sie braucht. Schneiden Sie auf Wirkung, nicht auf Clip-Länge. Ein brauchbarer Rhythmus für einen 90-Sekunden-Trailer: kurze Einstellungen für Spannung, längere für Emotion. Testen Sie eine Rohmontage ohne Ton – wenn der Film stumm funktioniert, funktioniert er mit Ton doppelt.

Ton und Sprache

Ton ist der schnellste Weg, professionell zu wirken. Drei Ebenen: Atmosphäre (Raumklang, Umgebung), Bewegung (Schritte, Stoff, Türen), Musik. Gerade bei generierten Bildern fehlt der glaubwürdige Raumklang, weshalb die Tonspur besonders wichtig ist. Bei Sprache gilt: Dialog besser separat aufnehmen oder generieren und im Schnitt passend setzen, als ihn aus der Video-Generierung zu erwarten. Achten Sie bei Vertonung auf saubere Laufsynchronisation und darauf, dass die Mundbewegung nicht auffällig abweicht; notfalls kaschieren Sie mit Zwischenschnitten.

Farbkorrektur und Upscaling

Generierte Clips haben oft leicht unterschiedliche Farbstimmungen. Ein einheitliches Grading mit angeglichenem Weißabgleich und Kontrastkurve bindet die Shots zusammen. Danach folgt Upscaling auf Zielauflösung. Vorsicht: Übermäßiges Schärfen erzeugt typische KI-Artefakte in Gesichtern und Texturen. Lieber etwas weicher bleiben und dafür Plastizität erhalten.

Qualitätssicherung, Rechte und ethische Leitplanken

Rechtliche Punkte, die Sie vorab klären sollten

Erstens: Nutzungsrechte an Eingaben und Ausgaben. Zweitens: Persönlichkeitsrechte, wenn erkennbare Personen erzeugt oder imitiert werden. Drittens: Kennzeichnungspflichten für synthetische Medien, die je nach Land und Plattform unterschiedlich ausfallen. Viertens: Musiks- und Stimmrechte bei generierten Audioinhalten.

Ethische Leitplanken

Verwenden Sie keine realen Personen ohne Einwilligung, auch nicht als „Vorlage“. Vermeiden Sie die Nachbildung geschützter Figuren. Und kennzeichnen Sie generierte Inhalte dort, wo Täuschung möglich wäre – das schützt nicht nur Ihr Publikum, sondern auch Ihre eigene Glaubwürdigkeit als Filmemacher.

QS-Checkliste vor dem Export

  • Bild: Konsistenz von Figur, Licht, Farbtemperatur über alle Shots.
  • Bewegung: Hände, Augen, Textilien, Flüssigkeiten prüfen.
  • Ton: Sprache synchron, Raumklang plausibel, kein Clipping.
  • Schnitt: Rhythmus, Anschlussfehler, Achsensprung.
  • Technik: Auflösung, Seitenverhältnis, Bildrate, Laufzeit.
  • Recht: Freigaben und Kennzeichnung dokumentiert.

Typische Fehler, Praxisbeispiel und FAQ

Fünf Fehler, die fast jeder am Anfang macht

Zu lange Prompts mit widersprüchlichen Vorgaben. Mehr Wörter bedeuten nicht mehr Kontrolle. Kürzen Sie auf das Wesentliche.

Zu wenige Shots pro Szene. Anfänger generieren lange Clips und versuchen, darin eine Handlung zu erzählen. Besser: viele kurze Shots.

Generierung vor der Dramaturgie. Wer bei der Technik beginnt, produziert Material ohne Film.

Keine Auswahl. Wer jede Variante behält, verschiebt die Entscheidung in den Schnitt – und dort wird sie teurer.

Ignorierter Ton. Bildgenerierung ist sichtbar, Ton entscheidet über Professionalität.

Praxisbeispiel: 90-Sekunden-Trailer in zwei Tagen

Tag eins, Vormittag: Logline, Szenenliste, Shotlist mit etwa 24 Shots für 90 Sekunden. Tag eins, Nachmittag: Charakter-Sheets für die Hauptfigur, Lookbook, sechs Referenzbilder. Tag eins, Abend: erste Generierungsrunde für die zehn wichtigsten Shots, zwei Varianten pro Shot.

Tag zwei, Vormittag: Auswahl der Selects, Lücken füllen, Konsistenzprüfung, Nachgenerierung von fünf bis acht Shots. Tag zwei, Nachmittag: Rohschnitt, Ton, Musik, angepasste Laufzeit, Farbkorrektur, Upscaling, Export in zwei Formaten – Breitbild und Hochformat. Ergebnis: kein perfekter Film, aber ein präsentierbarer Trailer mit klarer Dramaturgie und konsistentem Look.

FAQ

Brauche ich für KI-Filmemachen klassische Filmkenntnisse? Nein, aber Kenntnisse in Dramaturgie und Montage sind entscheidend. Sie ersetzen technisches Set-Wissen, nicht Erzählhandwerk.

Wie viele Shots sollte ein einminütiger Film haben? Als Orientierung: zehn bis achtzehn Shots pro Minute bei erzählenden Formaten, mehr bei schnellen Trailern. Lassen Sie den Rhythmus entscheiden, nicht eine Regel.

Was ist wichtiger – Modell oder Prompt? Die Vorbereitung. Ein gutes Modell mit schlechter Planung produziert Beliebigkeit; ein mittleres Modell mit klarer Shotlist produziert einen Film.

Wie gehe ich mit inkonsistenten Gesichtern um? Arbeiten Sie mit Referenzbildern und Charakter-Sheets, generieren Sie möglichst aus dem Bild statt aus Text, und reparieren Sie einzelne Shots per Inpainting statt ganzer Szenen.

Wie lang sollten generierte Clips sein? So kurz wie möglich für die dramaturgische Aufgabe – meist drei bis acht Sekunden. Kurze Clips sind konsistenter und im Schnitt flexibler.

Wann lohnt sich KI-Video und wann nicht? Bei Konzepten, Trailern, Erklärstücken, Visualisierungen und Content mit hohem Volumen lohnt es sich fast immer. Bei dokumentarischen Aufnahmen, bei denen die Echtheit der Aufnahme Teil der Aussage ist, bleibt klassische Produktion die richtige Wahl.

Der wichtigste Satz zum Schluss

KI verschiebt Filmemachen nicht weg von Regie, sondern zurück zu ihr. Die Werkzeuge werden schneller; die Entscheidungen bleiben Ihre Aufgabe. Wer in Shots denkt, Figuren konsistent hält, den Ton ernst nimmt und bereit ist, Material zu verwerfen, produziert mit generativen Modellen Ergebnisse, die sich vor klassischer Produktion nicht verstecken müssen.

Alexander

Alexander