Workflow statt Werkzeug: der rote Faden
Ein einzelner KI-Clip ist heute in wenigen Minuten erzeugt. Ein fertiger Film ist es nicht. Zwischen Prompt und publikationsfähigem Video liegen Skriptarbeit, Referenzmaterial, Modellwahl, Konsistenzkontrolle, Ton und Schnitt. Genau diese Kette entscheidet über das Ergebnis – nicht das spektakulärste Einzelmodell. Wer nur auf das neueste Werkzeug schaut, produziert schöne Fragmente, aber keine zusammenhängende Geschichte.
Die praktische Erfahrung aus vielen Projekten lässt sich in einer Faustregel zusammenfassen: etwa ein Fünftel der Qualität entsteht im Generator, vier Fünftel entstehen davor und danach. Davor bedeutet klare Szenenliste, präzise Beschreibungen, gutes Referenzbildmaterial. Danach bedeutet Auswahl der besten Takes, Farbanpassung, Ton, Schnitt und Untertitel.
Dieser Leitfaden beschreibt einen Workflow, der mit unterschiedlichen Werkzeugen funktioniert – ob kommerzielle Dienste wie Runway, Kling, Luma Dream Machine, Pika, Sora oder Veo, offene Modelle wie Wan, Hunyuan Video, LTX-Video oder Mochi, oder lokale Setups in ComfyUI. Die Schritte bleiben gleich, nur die Oberfläche wechselt. Wer den Ablauf versteht, ist nicht mehr von einem einzelnen Anbieter abhängig.
Der wichtigste Perspektivwechsel lautet: Du drehst keinen Film, du kuratierst Material. Deine Aufgabe ist es, viele Varianten zu erzeugen, die brauchbaren auszuwählen und sie so zu montieren, dass sie wie eine bewusste Entscheidung wirken. Diese Haltung verändert alles – vom Prompt-Design bis zur Frage, wie viele Takes eine Szene braucht.
Schritt 1: Idee, Skript und Szenenliste
KI-Video scheitert selten an der Technik, sondern an fehlender Dramaturgie. Bevor der erste Prompt geschrieben wird, steht eine Szenenliste. Sie ist das Drehbuch des Workflows und enthält pro Einstellung vier Angaben: Ort, Figur, Handlung, Stimmung. Alles andere ist Detailarbeit.
Von der Idee zur Einstellung
Ein Beispiel: Ein 30-Sekunden-Clip über einen Bäcker bei Nacht. Statt „Bäcker backt Brot, cinematisch“ entstehen fünf Einstellungen: Außenansicht der Bäckerei im Regen, Nahaufnahme von Mehl auf der Arbeitsfläche, Hände formen Teig, Ofenklappe öffnet sich mit Glutlicht, fertiges Brot auf dem Holzregal. Fünf klare Bilder, die zusammen eine Geschichte ergeben.
Szenenlänge realistisch planen
Generative Modelle liefern heute meist kurze Segmente. Plane deshalb in Einheiten von drei bis zehn Sekunden und montiere später. Wer versucht, eine komplette Minute in einem Durchgang zu erzeugen, verliert die Kontrolle über Bewegung, Konsistenz und Ton. Kurze Einstellungen sind außerdem billiger zu wiederholen, wenn eine Variante misslingt.
Ein Shot-Budget festlegen
Lege vor dem Start fest, wie viele Versuche pro Einstellung erlaubt sind. Ein üblicher Richtwert sind drei bis sechs Varianten pro Shot. Diese Grenze diszipliniert und verhindert, dass du Stunden in eine Einstellung investierst, die dramaturgisch nebensächlich ist. Wichtige Einstellungen – Gesichter, Hände, Logos – bekommen mehr Versuche, Übergänge weniger.
Schritt 2: Prompts, die reproduzierbare Ergebnisse liefern
Ein Prompt ist keine Beschwörung, sondern eine Spezifikation. Er sollte so geschrieben sein, dass eine andere Person mit demselben Werkzeug ein ähnliches Ergebnis erhält. Das gelingt nur mit Struktur.
Die fünf Bausteine eines brauchbaren Prompts
Erstens das Motiv: Wer oder was ist zu sehen. Zweitens die Handlung: Was passiert in diesen Sekunden. Drittens die Kamera: Totale, Halbnah, Nahaufnahme, Fahrt, Schwenk, statisch. Viertens das Licht: weiches Fensterlicht, Natriumdampf bei Nacht, hartes Gegenlicht. Fünftens der Look: Filmkorn, Farbpalette, Objektivcharakter.
Ein typischer Prompt in dieser Struktur: „Halbnah, Bäckerin formt Teig auf bemehlter Holzfläche, Hände im Bild, weiches Seitenlicht von links, warme Farbpalette, leichte Körnung, ruhige Handkamera.“ Das ist überprüfbar, wiederholbar und leicht zu variieren.
Negativbeschreibungen sparsam nutzen
Viele Modelle reagieren empfindlich auf Verneinungen. Statt „keine Unschärfe“ besser „durchgehend scharf auf den Händen“ schreiben. Wenn ein Werkzeug ein separates Negativfeld hat, gehören dort nur wenige Begriffe hinein: Textartefakte, verzerrte Hände, zusätzliche Gliedmaßen, Wasserzeichen. Lange Negativlisten verwirren mehr, als sie helfen.
Konsistente Begriffe über alle Szenen
Wenn deine Figur „Bäckerin mit dunklem Zopf und grüner Schürze“ heißt, dann heißt sie in jeder Einstellung so. Synonyme wie „Backfrau“, „Konditorin“ oder „Bäckerin mit Schürze“ erzeugen unterschiedliche Ergebnisse. Baue für jedes Projekt ein kleines Vokabular auf und halte es schriftlich fest.
Schritt 3: Text zu Video richtig einsetzen
Text-zu-Video ist der schnellste Weg zum ersten Material und gleichzeitig der unzuverlässigste. Es eignet sich hervorragend für Stimmungsbilder, Hintergründe, Establishing Shots und abstrakte Sequenzen. Es eignet sich schlecht für wiederkehrende Figuren, exakte Markenauftritte und präzise Kamerafahrten.
Wo Text-zu-Video stark ist
Landschaften, Wetter, Texturen, Lichtstimmungen und Bewegung ohne Figur gelingen fast immer. Auch Übergänge und Zwischenschnitte profitieren: ein Wasserglas, ein fahrender Zug, Rauch im Gegenlicht. Diese Bilder tragen Atmosphäre und kosten wenig Zeit.
Wo Text-zu-Video an Grenzen stößt
Sobald ein Gesicht mehrfach vorkommt, wird es kritisch. Ebenso bei Händen in Interaktion, bei Schrift im Bild und bei physikalisch widersprüchlichen Bewegungen. Prüfe jeden Take auf drei Dinge: Anatomie, Kontinuität der Bewegung, Bildfehler in Randbereichen. Was in der Vorschau harmlos aussieht, fällt im Vollbild auf.
Die richtige Reihenfolge
Beginne mit Text-zu-Video, um die Stimmung zu testen. Wenn Bildsprache und Farbwelt stehen, wechsle für alle wiederkehrenden Elemente zu Bild-zu-Video. So kombinierst du die Geschwindigkeit des einen mit der Kontrolle des anderen – eine Arbeitsweise, die sich in fast jedem Projekt bewährt.
Schritt 4: Bild zu Video und Referenzkontrolle
Bild-zu-Video ist das Arbeitstier für erzählerische Projekte. Ein vorhandenes Standbild gibt dem Modell Identität, Komposition und Farbwelt vor. Die Aufgabe des Generators reduziert sich auf Bewegung und Lichtverlauf – und genau das erhöht die Trefferquote deutlich.
Referenzbilder richtig auswählen
Ein gutes Referenzbild ist scharf, gut ausgeleuchtet, zeigt das Motiv vollständig und enthält keine störenden Elemente. Vermeide Bilder mit starker Bewegungsunschärfe, mit Text oder mit mehreren konkurrierenden Blickpunkten. Für Figuren sind Portraitaufnahmen mit neutraler Mimik ideal, weil sie mehr Spielraum für die Animation lassen.
Mehrere Bilder kombinieren
Viele Werkzeuge erlauben, zwei oder mehr Referenzen zu mischen: eine für die Figur, eine für den Stil, eine für die Umgebung. Das ist der wirksamste Hebel für visuelle Konsistenz. Wichtig ist eine klare Rollenverteilung – sonst vermischen sich Gesichtszüge oder Farbwelten.
Gewichtung und Reihenfolge testen
Wenn ein Werkzeug Gewichtungen erlaubt, beginne mit einer starken Figur-Referenz und einer mittleren Stil-Referenz. Teste kleine Änderungen systematisch und notiere die Ergebnisse. Ein einfaches Protokoll mit Spalten für Referenzen, Prompt und Bewertung spart über ein Projekt hinweg mehrere Stunden.
Schritt 5: Konsistenz, Bewegung und Kamera steuern
Konsistenz ist das Kriterium, an dem sich Amateur- und Profiarbeit am deutlichsten unterscheiden. Es geht nicht nur um Gesichter, sondern um Kleidung, Frisur, Requisiten, Lichtrichtung, Farbtemperatur und Bildausschnitt.
Figurenkonsistenz aufbauen
Erstelle für jede Hauptfigur ein Referenzpaket: ein frontales Portrait, eine Dreiviertelansicht, eine Ganzkörperaufnahme und ein Detail der Kleidung. Nutze in jedem Prompt dieselbe Beschreibung. Für Nebenfiguren genügt oft eine einzige Referenz, solange sie nicht in Nahaufnahme zu sehen sind.
Bewegung präzise beschreiben
Bewegung braucht ein Verb und eine Richtung. „Sie geht“ ist zu wenig, „sie geht langsam von links nach rechts, Schultern ruhig, Blick nach vorn“ ist steuerbar. Gleiches gilt für Kamerabewegung: langsame Fahrt nach vorn, seitlicher Schwenk, statische Aufnahme mit leichter Handkamera. Vermeide mehrere starke Bewegungen in einer Einstellung – Modell und Zuschauer werden gleichzeitig überfordert.
Kamera, Tempo, Schnittrhythmus
Plane den Schnittrhythmus schon beim Generieren. Ein ruhiger Film braucht lange Einstellungen und langsame Bewegungen, ein dynamischer Clip kurze Takes mit klaren Richtungswechseln. Wenn alle Einstellungen dieselbe Kamerageschwindigkeit haben, wirkt die Montage flach, egal wie gut die einzelnen Bilder sind.
Qualitätskontrolle in drei Durchgängen
Erster Durchgang: alles ansehen, nichts löschen. Zweiter Durchgang: technische Fehler markieren und aussortieren. Dritter Durchgang: nur noch unter erzählerischen Gesichtspunkten bewerten. Diese Trennung verhindert, dass ein hübscher Take wegen eines kleinen Fehlers zu früh verworfen wird – oder umgekehrt ein fehlerfreier, aber belangloser Clip überlebt.
Schritt 6: Ton, Schnitt und Nachbearbeitung
Bild ohne Ton ist ein Test, kein Film. Die Postproduktion entscheidet darüber, ob die Sequenz professionell wirkt. Plane dafür genauso viel Zeit ein wie für die Generierung – das ist in der Praxis der häufigste Planungsfehler.
Musik und Atmosphäre
Beginne mit einer Tonspur, bevor du schneidest. Musik gibt den Rhythmus vor und macht sichtbar, welche Einstellung zu lang ist. Atmosphären – Regen, Raumhall, Wind, Küchengeräusche – verbinden Einstellungen, die sonst zusammenhanglos wirken. Für Sprachaufnahmen lohnt sich eine getrennte Vertonung, weil generative Videomodelle selten brauchbare Dialoge liefern.
Schnitt und Farbanpassung
Ein Schnittprogramm deiner Wahl – etwa DaVinci Resolve oder eine einfache Timeline-App – genügt. Wichtig sind zwei Schritte: alle Clips auf eine gemeinsame Farbtemperatur bringen und die Bewegungsrichtung zwischen aufeinanderfolgenden Einstellungen prüfen. Ein harter Schnitt zwischen zwei ähnlichen Bewegungen wirkt wie ein Sprung; ein Richtungswechsel wirkt wie eine bewusste Entscheidung.
Hochskalierung und Details
Wenn die Auflösung nicht reicht, hilft eine gezielte Hochskalierung mit Werkzeugen wie Topaz Video AI. Vorsicht bei Gesichtern: zu starke Glättung lässt Figuren künstlich wirken. Besser zweimal moderat skalieren als einmal aggressiv. Letzter Schritt sind Untertitel und ein konsistenter Look über alle Plattformformate hinweg.
Entscheidungskriterien: Modellwahl und Skalierung
Die Modellwahl ist eine Frage des Projekts, nicht des Prestiges. Wer regelmäßig produziert, arbeitet fast immer mit zwei oder drei Werkzeugen parallel – einem für Fotorealismus, einem für Stil und Bewegung, einem für schnelle Tests.
Kommerzielle Dienste
Kommerzielle Dienste überzeugen durch Bedienkomfort, Tempo und starke Ergebnisse bei Menschen und Licht. Sie eignen sich für Kundenarbeit mit knappen Deadlines. Nachteil: begrenzte Kontrolle, Abhängigkeit von Verfügbarkeit und Richtlinien sowie laufende Kosten, die bei vielen Varianten schnell steigen.
Offene Modelle und lokale Setups
Offene Modelle bieten maximale Kontrolle, Reproduzierbarkeit und keine inhaltlichen Einschränkungen. Sie verlangen dafür geeignete Hardware, Geduld beim Einrichten und technisches Verständnis. Für wiederkehrende Formate mit festem Look sind sie langfristig oft die wirtschaftlichere Wahl, weil sich ein einmal gebauter Workflow beliebig oft wiederholen lässt.
Wann du mischen solltest
Eine bewährte Aufteilung: Tests und Konzeptbilder mit einem schnellen Dienst, finale Einstellungen mit dem Werkzeug, das die beste Konsistenz liefert. So bleibt der frühe, experimentelle Teil günstig und der finale Teil kontrolliert. Dokumentiere, welches Werkzeug welche Einstellung erzeugt hat – sonst wird die Nacharbeit zum Ratespiel.
Typische Fehler und ihre Lösungen
Viele Probleme wiederholen sich. Wer sie kennt, spart ganze Arbeitstage.
- Zu lange Einstellungen: Modelle verlieren ab etwa zehn Sekunden an Kontrolle. Teile in kürzere Takes und montiere.
- Zu viele Ideen in einem Prompt: Ein Prompt, eine Handlung, eine Kamerabewegung. Alles andere wird ignoriert oder vermischt.
- Fehlende Referenzen: Ohne Bildvorlage schwankt die Figur zwischen den Takes. Ein Referenzpaket löst das Problem.
- Kein Tonkonzept: Musik erst am Ende auszuwählen führt fast immer zu Umbaumaßnahmen im Schnitt.
- Alles behalten: Wer jeden Take aufbewahrt, verliert die Übersicht. Sortiere nach jedem Block aus.
- Kein Backup der Prompts: Notiere Prompts, Referenzen und Einstellungen. Ein Projekt ohne Dokumentation lässt sich nicht reproduzieren.
- Uneinheitliche Auflösungen: Mische Bildformate nicht im Schnitt, sondern normalisiere sie vorher.
FAQ
Wie viele Takes brauche ich realistisch pro Einstellung?
Für unkritische Bilder reichen zwei bis drei Varianten. Bei Gesichtern, Händen und Text im Bild sind fünf bis acht üblich. Plane das Shot-Budget von Anfang an ein, sonst wird die Zeitplanung unrealistisch.
Kann ich mit generativem Video komplette Dialoge produzieren?
Zuverlässig funktioniert es derzeit nicht. Der übliche Weg ist, Videosequenzen ohne Dialog zu erzeugen und Sprache separat aufzunehmen oder zu vertonen. Mundbewegungen in Großaufnahme bleiben ein Risiko.
Welche Auflösung sollte ich anstreben?
Generiere in der höchsten verfügbaren Auflösung, die dein Werkzeug stabil liefert, und skaliere nur bei Bedarf. Hochskalieren kann Details ergänzen, aber keine fehlende Bildinformation ersetzen. Für Social-Plattformen reichen meist kürzere Einstellungen in Full HD.
Wie halte ich Figuren über mehrere Szenen konstant?
Mit einem festen Referenzpaket, einer unveränderten Beschreibung im Prompt und möglichst wenigen Werkzeugwechseln. Wenn du zwischen Diensten wechselst, teste die Figur zuerst in einer kurzen Einstellung.
Lohnt sich ein lokales Setup?
Wenn du regelmäßig und mit festem Look produzierst, ja. Für einmalige Projekte ist der Einrichtungsaufwand meist höher als der Nutzen. Ein Zwischenweg ist ein leistungsfähiger Rechner für Tests und ein kommerzieller Dienst für finale Takes.
Wie vermeide ich rechtliche Probleme?
Verwende eigene oder lizenzierte Referenzbilder, vermeide erkennbare Marken und reale Personen ohne Zustimmung und prüfe die Nutzungsbedingungen jedes Werkzeugs. Bei Musik und Stimmen gelten zusätzliche Regeln.
Wie schnell ist ein Projekt realistisch fertig?
Ein einminütiger Clip mit fünfzehn Einstellungen braucht je nach Erfahrung ein bis drei Arbeitstage – Generierung, Auswahl, Ton und Schnitt eingerechnet. Der erste Tag geht fast immer für Referenzen und Tests drauf, danach wird es deutlich schneller.
Fazit: Der Workflow ist das Produkt
KI-Videogenerierung ist kein Knopfdruck, sondern eine Handwerkskette. Wer Szenen plant, Prompts strukturiert, Referenzen pflegt, Konsistenz prüft und Ton ernst nimmt, erhält Ergebnisse, die sich von Zufallsclips deutlich abheben. Die Werkzeuge werden sich weiter verändern, die Prinzipien bleiben: klare Absicht, kontrollierte Bewegung, wiederholbare Einstellungen.
Beginne beim nächsten Projekt mit der Szenenliste, nicht mit dem Generator. Baue ein kleines Referenzpaket, teste zwei Werkzeuge parallel und dokumentiere jeden brauchbaren Take. Nach zwei oder drei Projekten hast du eine eigene Bibliothek an Prompts und Referenzen – und damit einen Vorsprung, den kein einzelnes Modell ersetzen kann.


