Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

KI-Video-Workflow: Planung, Konsistenz und sauberer Schnitt

Sep 22, 2026

Warum die Reihenfolge der Arbeit über das Ergebnis entscheidet

Die Werkzeugfrage ist selten das eigentliche Problem. Wer heute ein KI-Video produziert, kann zwischen zahlreichen Generatoren wählen, und die meisten liefern in Tests erstaunlich überzeugende Einzelbilder. Trotzdem geraten viele Projekte ins Stocken, sobald mehr als eine Einstellung nötig ist. Der Grund liegt nicht in der Modellqualität, sondern in der Reihenfolge der Arbeit: Es wird zuerst generiert und danach überlegt, wie die Teile zusammenpassen.

Wer so arbeitet, verbringt die meiste Zeit mit Reparaturen. Eine Figur sieht in der vierten Einstellung anders aus als in der ersten, der Wechsel zwischen zwei Perspektiven wirkt wie ein Sprung, die Lichtstimmung kippt von warm zu kalt. Jede dieser Beobachtungen führt zu einer neuen Generierung – und jede neue Generierung erzeugt neue Abweichungen. Das ist ein Kreislauf, der keine fertige Sequenz produziert, sondern nur Varianten.

Ein tragfähiger Workflow dreht diese Reihenfolge um. Er beginnt nicht beim Generator, sondern beim Konzept. Er legt vor der ersten Generierung fest, was das Video leisten soll, wie lang es sein darf, welche Figuren wiederkehren und welcher visuelle Stil verbindlich ist. Diese Entscheidungen wirken unspektakulär, sind aber der Unterschied zwischen einer Sammlung hübscher Testclips und einem Video, das man tatsächlich veröffentlichen kann.

Der zweite Grund ist organisatorischer Natur. Jede unklare Entscheidung, die man nach vorne verlagert, taucht später als aufwendige Korrektur wieder auf. Ein sauber ausgefüllter Shotlist-Eintrag kostet zwanzig Minuten und verhindert manchmal eine komplette Neuproduktion. Wer Iterationen einplant statt sie zu erleiden, arbeitet am Ende schneller – nicht langsamer.

Dieser Leitfaden beschreibt den vollständigen Ablauf von der ersten Idee bis zum Export. Er ist bewusst plattformunabhängig: Die Arbeitsschritte gelten für Kurzformate für soziale Kanäle, für Produktdemonstrationen, für erklärende Inhalte und für erzählerische Kurzfilme gleichermaßen. Die Beispiele stammen aus der Alltagsproduktion, nicht aus einem kontrollierten Labor.

Phase 1 und 2: Konzept, Format und Sekundenbudget

Bevor irgendein Prompt geschrieben wird, müssen drei Fragen beantwortet sein. Wer sieht das Video? Was soll nach dem Ansehen anders sein? Und wie viel Zeit steht zur Verfügung? Erst wenn diese drei Punkte geklärt sind, lohnt sich der Griff zum Werkzeug.

Zieldefinition in einem einzigen Satz

Formulieren Sie das Ziel als Satz, der ohne Adjektive auskommt. „Zuschauer sollen verstehen, wie das Produkt in drei Arbeitsschritten entsteht“ ist brauchbar. „Zuschauer sollen begeistert sein“ ist kein Ziel, sondern eine Hoffnung. Diese Unterscheidung klingt nach Beratungssprache, hat aber konkrete Folgen: Aus einem präzisen Ziel lassen sich Szenen ableiten, aus einer Stimmung nicht.

Schreiben Sie den Satz oben auf das Dokument, an dem Sie arbeiten. Er wird zur Entscheidungsregel für jede spätere Frage. Wenn eine Einstellung nichts zu diesem Satz beiträgt, gehört sie nicht in den Schnitt.

Format und Länge realistisch wählen

Die Zielplattform bestimmt die Dramaturgie. Ein vertikales Kurzformat braucht einen schnellen Einstieg, weil die ersten Sekunden über den Verbleib entscheiden. Ein horizontaler Erklärclip darf langsamer anlaufen, weil das Publikum bewusst zugeschaltet hat. Wer für beide Formate produziert, sollte nicht einfach dasselbe Material in zwei Seitenverhältnisse schneiden, sondern den Bildaufbau von Anfang an mitdenken.

Ein häufiger Fehler ist die Überschätzung der Länge. Zwei Minuten klingen kurz, sind in der Produktion aber sechs bis acht Einstellungen mit eigener Lichtstimmung, eigenem Bildausschnitt und eigenem Bewegungstempo. Für den Einstieg sind vierzig bis sechzig Sekunden eine realistische Größe.

Die Sekundenrechnung als Planungswerkzeug

Rechnen Sie Ihr Video in Sekunden durch, bevor Sie drehen. Ein gesprochener Satz dauert bei ruhigem Tempo etwa drei Sekunden. Ein Satz mit Erklärung eher vier. Bei einem Sechzig-Sekunden-Clip mit Voiceover bleiben nach Abzug von Einstieg und Ausklang rund zwölf Sätze – das ist deutlich weniger Inhalt, als die meisten Drehbücher zunächst vorsehen.

Diese Rechnung ist der wirksamste Schutz gegen überladene Videos. Sie zwingt zur Auswahl und verhindert, dass eine Einstellung vier Informationen gleichzeitig transportieren soll.

Sprechtext und Bildsprache getrennt entwickeln

Ein nützliches Arbeitsmittel ist eine Tabelle mit drei Spalten: gesprochener Text, visuelle Handlung, Dauer. Die Trennung ist wichtig, weil beide Ebenen unterschiedlich funktionieren. Der Text erklärt, das Bild zeigt. Wenn der Text beschreibt, was ohnehin zu sehen ist, entsteht Redundanz. Wenn das Bild etwas anderes zeigt als der Text, entsteht Verwirrung.

Füllen Sie zuerst die Zeitspalte, dann die Textspalte, erst danach die Bildspalte. Wer mit dem Bild beginnt, produziert später Videos, die schön aussehen und nichts erklären.

Phase 3: Shotlist und Storyboard als Bauplan

Aus dem Skript entsteht eine Shotlist. Jede Einstellung erhält eine eigene Zeile mit Bildausschnitt, Kamerabewegung, Lichtstimmung, Dauer und einer kurzen Beschreibung der Handlung. Diese Liste ist der eigentliche Bauplan des Projekts – nicht der Prompt.

Einstellungsgrößen bewusst variieren

Ein Video, das ausschließlich aus Halbtotalen besteht, wirkt flach. Eine einfache Rhythmik hilft: Weitwinkel für Orientierung, Halbtotale für Handlung, Nahaufnahme für Emotion oder Detail. Wechseln Sie zwischen diesen Größen, aber nicht beliebig, sondern an inhaltlichen Wendepunkten. Ein Schnitt auf die Nahaufnahme sagt: Jetzt ist das Detail wichtig.

Achten Sie darauf, dass die Perspektive plausibel bleibt. Ein Wechsel von einer frontalen Aufnahme zu einer Aufnahme aus der Gegenrichtung ist erlaubt, solange er als bewusster Schnitt erkennbar ist. Ein Wechsel der Achse innerhalb derselben Kameraposition wirkt dagegen wie ein Fehler.

Kamerabewegung sparsam einsetzen

Generierte Kamerabewegung ist einer der häufigsten Gründe für unruhige Ergebnisse. Definieren Sie pro Einstellung höchstens eine Bewegung: statisch, langsamer Zoom, seitliche Mitfahrt, Schwenk. Mehrere Bewegungen gleichzeitig überfordern die meisten Modelle und erzeugen wackelige oder unlogische Bildfolgen.

Eine gute Regel: Statische Einstellungen für Details und Textbezug, langsame Bewegung für Orientierung, gar keine Bewegung für Momente, in denen eine Figur spricht.

Übergänge im Voraus planen

Planen Sie, wie eine Einstellung in die nächste übergeht – hart geschnitten, weich geblendet oder über eine Bewegung. Harte Schnitte funktionieren bei klaren Orts- und Zeitwechseln. Weiche Übergänge eignen sich für Zeitsprünge. Ein besonders stabiler Trick ist der Bewegungsschnitt: Endet eine Einstellung mit einer Bewegung nach rechts, beginnt die nächste mit einer Bewegung in dieselbe Richtung. Das verbindet zwei Generierungen, die sonst sichtbar unterschiedlich ausfallen.

Phase 4: Referenzmaterial für Figuren, Orte und Requisiten

Vor der Videogenerierung sollte eine kleine Sammlung von Standbildern entstehen. Dieses Referenzmaterial ist der Anker für alle späteren Einstellungen und löst das häufigste Problem beim KI-Video: visuelle Inkonsistenz.

Das Charakterblatt

Legen Sie für jede wiederkehrende Figur drei bis vier Bilder an: ein frontales Porträt bei neutralem Licht, eine Halbprofilansicht, eine Ganzkörperaufnahme mit der Kleidung, die im Video getragen wird. Entscheidend ist, dass die Referenzen untereinander konsistent sind. Unterschiedliche Lichtstimmungen in den Referenzbildern erzeugen unterschiedliche Ergebnisse im Video, und das Modell weiß nicht, welche davon verbindlich ist.

Halten Sie Frisur, Kleidung, Accessoires und Alter über alle Referenzen hinweg konstant. Verzichten Sie auf Referenzen mit starken Emotionen oder ungewöhnlichen Posen – sie verschieben die Interpretation der Figur.

Das Ortsset

Für jeden Schauplatz genügen zwei Bilder: eine Totale, die den Raum erschließt, und eine Detailaufnahme, die Material und Stimmung festhält. Die Totale dient der Orientierung, das Detail der Textur. Wenn ein Ort in mehreren Einstellungen erscheint, ist es hilfreich, die Lichtrichtung festzuschreiben – etwa „Fenster links, weiches Tageslicht“. Lichtrichtung ist der stärkste einzelne Konsistenzfaktor überhaupt.

Requisiten und Materialien

Wiederkehrende Objekte brauchen ebenfalls Referenzen: ein Werkzeug, ein Gefäß, ein Gerät, ein Bekleidungsstück. Diese Bilder sind unscheinbar, aber sie verhindern, dass ein Objekt in der fünften Einstellung plötzlich eine andere Farbe oder Form hat. Bei Materialien – Holz, Metall, Glas, Stoff – lohnt es sich, in der Referenz eine klar erkennbare Oberflächenstruktur zu zeigen.

Phase 5: Prompt-Design mit modularen Bausteinen

Ein Bildprompt beschreibt einen Zustand. Ein Videoprompt beschreibt zusätzlich eine Veränderung über die Zeit. Das ist der entscheidende Unterschied und die häufigste Fehlerquelle.

Der modulare Aufbau

Arbeiten Sie mit fünf Bausteinen in fester Reihenfolge: Motiv, Handlung, Kamerabewegung, Licht, Stil. Diese Reihenfolge ist keine Geschmacksfrage – sie spiegelt die Priorität wider, mit der Modelle Informationen gewichten. Was früh im Prompt steht, hat mehr Einfluss.

Ein Beispiel: „Eine Hand legt ein Werkzeug auf eine Werkbank. Die Bewegung ist langsam und kontrolliert. Kamera statisch. Warmes Seitenlicht von links, geringe Schärfentiefe. Gedeckte Erdtöne, 35-mm-Charakter, entsättigte Grüntöne.“ Der Stilbaustein bleibt über alle Einstellungen identisch und wird nur kopiert.

Bewegung konkret beschreiben

„Eine Frau geht“ ist zu allgemein. Besser ist: „Eine Frau geht langsam von links nach rechts durch den Bildraum, ihre Jacke bewegt sich im Wind.“ Richtung, Tempo und ein sichtbares Detail machen die Bewegung für das Modell berechenbar. Beschreiben Sie außerdem, wo die Bewegung endet – ein Ziel im Bildraum verhindert, dass eine Figur aus dem Bild läuft.

Licht als stärkster Hebel

Beschreiben Sie Licht mit drei Angaben: Richtung, Härte, Farbe. „Weiches Seitenlicht von links, warme Reflexe auf der Haut“ liefert stabilere Ergebnisse als „gut beleuchtet“. Wenn Sie über mehrere Einstellungen hinweg dieselbe Lichtformel verwenden, wirkt das fertige Video deutlich zusammenhängender – selbst wenn die Generierungen im Detail voneinander abweichen.

Negativliste pflegen

Notieren Sie, was Sie nicht wollen: keine zusätzlichen Personen im Hintergrund, keine Schrift im Bild, keine Verzerrungen an Händen, keine harten Schlagschatten. Diese Ausschlüsse gehören in jeden Prompt, der sie betrifft, und sollten als eigener Block verwaltet werden. Eine wachsende Negativliste ist wertvoller als eine wachsende Sammlung guter Prompts.

Prompt-Länge dosieren

Zu kurze Prompts lassen zu viel Interpretationsspielraum, zu lange Prompts verwässern die Prioritäten. Zwei bis vier Sätze sind eine gute Länge. Wenn Sie mehr brauchen, liegt das meist daran, dass die Einstellung zu viel gleichzeitig zeigen soll – dann ist Teilen die bessere Lösung.

Phase 6: Generierung, Modellwahl und Iterationsgrenzen

Die Auswahl des passenden Modells gehört zu den folgenreichsten Entscheidungen im Prozess. Sie sollte nach Anforderungen erfolgen, nicht nach Bekanntheit.

Explorationsmodus und Endfassungsmodus

Die meisten Teams fahren besser mit zwei Betriebsarten. Im Explorationsmodus testen Sie mit schnellen Modellen viele Varianten, um Bildaufbau, Perspektive und Bewegung zu klären. Im Endfassungsmodus generieren Sie dieselbe Einstellung mit einem präziseren Modell, das Details, Materialien und Gesichter stabiler wiedergibt.

Wichtig ist, dass die Entscheidungen aus dem Explorationsmodus dokumentiert werden. Ein Screenshot mit Notiz zur Bildwirkung ist eine gültige Arbeitsgrundlage, auch wenn das Bild selbst nicht verwendet wird.

Wie viele Varianten pro Einstellung?

Bei klarer Stildefinition und guten Referenzen sind drei bis fünf Varianten üblich, bis eine Einstellung sitzt. Brauchen Sie deutlich mehr, liegt die Ursache selten am Modell. Typische Ursachen sind ein widersprüchlicher Prompt, fehlende Referenzen oder eine Einstellung, die mehrere Handlungen gleichzeitig verlangt.

Wann man abbricht und neu denkt

Definieren Sie vorab eine Abbruchregel: Nach fünf erfolglosen Varianten wird die Einstellung neu konzipiert, nicht weiter generiert. Diese Regel ist unangenehm, weil sie Arbeit verwirft – aber sie verhindert, dass ein ganzes Projekt an einer einzigen schwierigen Aufnahme hängen bleibt. Häufig reicht es, eine Einstellung in zwei kürzere Segmente zu teilen oder die Kamerabewegung zu streichen.

Wiederholbarkeit sichern

Führen Sie ein einfaches Protokoll: Einstellungsnummer, Prompt, verwendetes Modell, Einstellungen, Bewertung, Datum. Wenn Sie nach zwei Wochen eine Szene neu aufsetzen müssen, spart dieses Protokoll Stunden. Es ist außerdem die Grundlage für jede Zusammenarbeit im Team, weil es Entscheidungen nachvollziehbar macht.

Phase 7 und 8: Ton, Schnitt, Farbangleichung und Export

Erst in dieser Phase entsteht aus Segmenten ein Video. Sie ist kein Notfallschritt, sondern fester Bestandteil der Planung.

Voiceover zuerst

Sprechen Sie den Text früh auf, idealerweise bevor die Videosegmente final generiert werden. Die meisten Werkzeuge erzeugen überzeugendere Lippenbewegungen, wenn eine Tonspur bereits existiert und die Szenenlänge daran ausgerichtet wird. Alternativ generieren Sie die Stimme zuerst und passen die Videolänge anschließend an – wichtig ist nur, dass beide Längen nicht unabhängig voneinander entstehen.

Musik und Pegel

Bei Musik gilt: weniger ist mehr. Vermeiden Sie Stücke mit ausgeprägter Melodieführung, wenn gesprochener Text im Vordergrund steht. Achten Sie auf einen konsistenten Pegel über die gesamte Länge. Springende Lautstärken fallen Zuschauern stärker auf als kleine Bildfehler.

Geräuschebene als Bindemittel

Eine leise Umgebungsebene – Wind, Raumhall, Schritte, das Ticken einer Uhr – verbindet Einstellungen, die sonst steril wirken. Arbeiten Sie mit zwei Ebenen: einer durchgehenden Atmosphäre und punktuellen Effekten an Übergängen. Die Atmosphäre bleibt über Szenen hinweg gleich, die Effekte variieren.

Farbangleichung und Stabilisierung

Zwischen Generierungen entstehen fast immer kleine Farb- und Helligkeitsunterschiede. Gleichen Sie diese im Schnitt an, bevor Sie über Ästhetik diskutieren. Eine gute Reihenfolge: erst Helligkeit, dann Weißabgleich, dann Sättigung, dann Kontrast. Bei wackeligen Einstellungen hilft eine leichte Stabilisierung, sofern sie keine sichtbaren Ränder erzeugt.

Export

Exportieren Sie in mindestens zwei Auflösungen – eine hohe für die Archivierung und die Wiederverwendung, eine plattformgerechte für die Veröffentlichung. Prüfen Sie vor dem Export, ob Untertitel vorhanden sind. Ein großer Teil des Publikums sieht Videos ohne Ton, und fehlende Untertitel sind der einfachste vermeidbare Qualitätsverlust.

Typische Fehler, Ursachen und Gegenmaßnahmen

Die meisten Probleme im KI-Video-Workflow haben wiederkehrende Ursachen. Wer sie kennt, korrigiert schneller.

  • Figuren verändern sich zwischen Einstellungen. Ursache: fehlende oder inkonsistente Referenzbilder. Gegenmaßnahme: Charakterblatt mit einheitlicher Lichtstimmung, Kleidung und Frisur im Prompt konstant halten.
  • Bewegungen wirken ruckelig. Ursache: zu komplexe Handlung in einer Einstellung. Gegenmaßnahme: Einstellung teilen, eine Bewegung pro Segment, Bewegungstempo senken.
  • Perspektivsprünge und Orientierungsverlust. Ursache: keine Shotlist. Gegenmaßnahme: Achse und Bildausschnitt pro Einstellung vorab festlegen, Totale als Orientierung einsetzen.
  • Text im Bild ist unleserlich. Ursache: Schrift wird generiert. Gegenmaßnahme: Schrift nachträglich als Grafikebene einfügen.
  • Farbstiche zwischen Einstellungen. Ursache: fehlende Angleichung. Gegenmaßnahme: Helligkeit und Weißabgleich vor der Sättigung korrigieren.
  • Bilder wirken überladen. Ursache: zu viele Elemente im Prompt. Gegenmaßnahme: Motiv reduzieren, Nebensächliches in die Negativliste verschieben.
  • Ton klingt asynchron. Ursache: Videolänge und Tonspur entstanden unabhängig. Gegenmaßnahme: Tonspur zuerst, Szenenlänge daran ausrichten.

Eine strukturierte Prüfung vor dem Export spart mehrere Korrekturrunden. Bewährt hat sich ein Vier-Durchgänge-Verfahren: erst ohne Ton auf Bildfehler achten, dann nur mit Ton auf Verständlichkeit, dann im Kontext der Nachbareinstellungen auf Anschlussfähigkeit, zuletzt auf einem kleinen Bildschirm. Der letzte Durchgang ist der wichtigste, weil ein großer Teil des Publikums mobil schaut.

Praxisbeispiel: ein 45-Sekunden-Clip in neun Schritten

Ein konkretes Beispiel macht den Ablauf greifbar. Angenommen, Sie produzieren einen kurzen Clip über einen handwerklichen Arbeitsprozess, von der Idee bis zum Export.

  1. Ziel: „Zuschauer sollen verstehen, wie aus Rohmaterial ein fertiges Objekt wird.“
  2. Skript: fünf Sätze, je etwa vier Sekunden, mit klarer Steigerung von Material zu Ergebnis.
  3. Shotlist: sieben Einstellungen – zwei Details, drei Halbtotale, zwei Totale.
  4. Referenzen: ein Standbild der Werkstatt, eines der Hände bei der Arbeit, eines des fertigen Objekts.
  5. Stilbaustein schriftlich: warmes Morgenlicht von links, geringe Schärfentiefe, gedeckte Erdtöne, 35-mm-Charakter.
  6. Generierung: pro Einstellung drei Varianten mit identischem Stilbaustein, Auswahl der besten.
  7. Ton: Voiceover zuerst aufnehmen, danach Musik ohne Melodieführung, dann Geräuschebene.
  8. Schnitt: Helligkeit und Farbe angleichen, Übergänge setzen, Untertitel anlegen.
  9. Kontrolle: Vier-Durchgänge-Prüfung, Export in zwei Auflösungen.

Der Zeitaufwand liegt überwiegend in den Schritten zwei bis sechs. Wer hier sorgfältig arbeitet, verbringt in Schritt acht nur wenige Minuten mit Korrekturen. Anders formuliert: Die Qualität des Endprodukts wird nicht im Schnitt entschieden, sondern in der Vorbereitung.

Häufige Fragen

Wie viele Varianten pro Einstellung sind normal?

Bei klarer Stildefinition und guten Referenzen sind drei bis fünf Varianten üblich. Brauchen Sie regelmäßig mehr als acht, sollten Sie nicht das Modell wechseln, sondern den Prompt und die Referenzen prüfen.

Brauche ich für jede Szene Referenzbilder?

Für wiederkehrende Figuren und Schauplätze ja. Für einmalige Detailaufnahmen reicht ein präziser Prompt mit festem Stilbaustein.

Wie lang sollte eine generierte Einstellung sein?

Kürzer als man denkt. Drei bis sechs Sekunden lassen sich zuverlässig steuern und im Schnitt flexibel einsetzen. Längere Einstellungen erhöhen das Risiko von Aussetzern und erschweren Korrekturen.

Kann ich Schrift im Video generieren lassen?

In der Regel nicht zuverlässig. Fügen Sie Text nachträglich als Grafikebene hinzu. Das ist lesbarer, schneller und jederzeit korrigierbar.

Was tun, wenn eine Figur zwischen Szenen nicht gleich aussieht?

Reduzieren Sie auf zwei Referenzbilder mit identischer Lichtstimmung, halten Sie Kleidung und Frisur im Prompt konstant und vermeiden Sie extreme Perspektiven, die das Modell neu interpretieren muss.

Wie verhindere ich, dass alle Einstellungen gleich aussehen?

Variieren Sie drei Dinge bewusst: Bildausschnitt, Lichtrichtung und Bewegungstempo. Der Stil bleibt konstant, die Inszenierung wechselt. So entsteht Abwechslung ohne sichtbaren Bruch.

Lohnt sich ein Storyboard wirklich?

Bei allem über drei Einstellungen ja. Es kostet überschaubare Zeit und verhindert die häufigste Ursache für komplette Neuproduktionen: fehlende Anschlussfähigkeit.

Wie gehe ich mit einer Einstellung um, die einfach nicht funktioniert?

Teilen Sie sie in zwei kürzere Segmente, streichen Sie die Kamerabewegung oder ändern Sie die Perspektive. Wenn drei Ansätze scheitern, ist die Einstellung zu komplex geplant – nicht das Werkzeug zu schwach.

Wie dokumentiere ich am besten?

Führen Sie eine Tabelle mit Einstellungsnummer, Prompt, Modell, Bewertung und Datum. Diese Notizen sind bei Revisionen wertvoller als jede Lesezeichen-Sammlung.

Zum Abschluss: KI-Videoproduktion wirkt auf den ersten Blick wie eine Frage der Werkzeuge. In der Praxis entscheidet die Reihenfolge der Arbeit. Wer mit Ziel, Skript und Shotlist beginnt, Referenzen vor der Videogenerierung anlegt und Konsistenz als eigene Aufgabe behandelt, produziert schneller – nicht langsamer. Behandeln Sie jede Einstellung als Teil eines Ganzen, nicht als isoliertes Ergebnis, und legen Sie Stildefinitionen schriftlich fest. Diese Disziplin macht den Unterschied zwischen einer Sammlung beeindruckender Einzelclips und einem Video, das tatsächlich funktioniert.

Alexander

Alexander