Limited Time Offer: Get 50% OFF your first month of Pro & Ultra plans 🎉

KI-Videos professionell produzieren: Der komplette Workflow

Sep 21, 2026

Generative Videomodelle sind inzwischen so weit, dass einzelne Clips für sich beeindruckend aussehen. Der eigentliche Engpass liegt nicht mehr in der Generierung, sondern in der Frage, wie daraus eine zusammenhängende, wiederholbare und termingerechte Produktion wird. Wer heute mit KI-Video arbeitet, braucht keinen Zauberknopf, sondern eine Arbeitsweise: klare Konzepte, eine begründete Modellwahl, definierte Konsistenzregeln, ein Prompt-Handwerk und eine Postproduktion, die aus Fragmenten eine Geschichte macht.

Dieser Leitfaden beschreibt einen vollständigen Produktionsablauf – von der ersten Idee über Konsistenztests bis zur Auslieferung. Er verzichtet bewusst auf Plattformwerbung und konzentriert sich auf übertragbare Prinzipien, die mit wechselnden Tools funktionieren.

Vom Experiment zum reproduzierbaren Workflow

Die meisten Teams starten mit spontanem Ausprobieren: Prompt eingeben, Ergebnis bestaunen, nächsten Prompt eingeben. Das liefert schnelle Erfolgserlebnisse, aber keine planbaren Ergebnisse. Sobald ein Kunde, ein Redaktionsschluss oder eine Kampagne im Spiel ist, zählt Reproduzierbarkeit.

Ein reproduzierbarer Workflow besteht aus sechs Phasen, die aufeinander aufbauen:

  1. Konzept und Treatment – Was erzählt der Film, in welcher Bildsprache, mit welcher Länge?
  2. Modellwahl – Welches Werkzeug passt zu Aufgabentyp, Stil und Iterationsgeschwindigkeit?
  3. Konsistenzsetup – Referenzen, Charakterbögen, Licht- und Objektivregeln.
  4. Prompting – Bewegung, Kamera und Timing präzise beschreiben.
  5. Auswahl und Postproduktion – Sichten, schneiden, Ton, Farbe, Text.
  6. Qualitätssicherung – Technik, Rechte, Kennzeichnung, Auslieferung.

Wichtig ist die Reihenfolge. Wer mit dem Prompting beginnt und das Treatment erst später klärt, produziert teure Zufallstreffer. Wer umgekehrt den Rahmen festlegt, kann den Zufall als kreatives Element einplanen – dort, wo er nützt, und nicht dort, wo er schadet.

Warum ein Treatment wichtiger ist als der nächste Modell-Release

Jedes neue Modell verschiebt die Grenzen des Machbaren, aber nur geringfügig die Anforderungen an Struktur. Ein Treatment legt fest:

  • Zielgruppe und Tonfall – erklärend, atmosphärisch, humorvoll, sachlich.
  • Szenenlogik – welche Einstellung welche Information trägt.
  • Look – Farbtemperatur, Kontrast, Korn, Objektivcharakter.
  • Laufzeit – und daraus abgeleitet die Zahl der Einstellungen.

Ein nützlicher Richtwert: Rechne pro fertige Sekunde mit zwei bis vier benötigten Generierungen plus Reserve. Bei einem 60-Sekunden-Film sind das schnell 150 bis 250 Einzelversuche, wenn man Varianten, Ausschuss und Konsistenztests einbezieht. Wer diese Größenordnung kennt, plant Rechenzeit realistisch ein, statt in der heißen Phase in Zeitnot zu geraten.

Die Rolle von Referenzboards

Ein Referenzboard ist eine Sammlung von 15 bis 30 Bildern, die den Ziel-Look beschreiben: Lichtstimmung, Materialien, Hauttöne, Hintergründe, Kamerawinkel. Es ersetzt lange Adjektivketten durch visuelle Klarheit. Viele Modelle akzeptieren Referenzbilder oder Stilbeschreibungen – wer dem System ein konsistentes Board liefert, bekommt konsistentere Ergebnisse als mit wechselnden Stilvokabeln pro Prompt.

Phase 1: Konzept und Treatment, die KI wirklich versteht

Ein Treatment für KI-Produktion unterscheidet sich in einem Punkt von klassischen Treatments: Es muss maschinenlesbare Eindeutigkeit mit menschlicher Erzählabsicht verbinden.

Vom Einzeiler zur Szenenliste

Beginne mit einem Satz. Danach zerlege die Geschichte in Szenen, die jeweils eine Aufgabe erfüllen. Beispiel für ein Erklärvideo zum Thema Wasserkreislauf:

  • Szene 1: Ozeanfläche bei Sonnenaufgang, ruhige Drohnenbewegung, Hitze als Verursacher.
  • Szene 2: Verdunstung – aufsteigende Partikel über dem Wasser, Nahaufnahme.
  • Szene 3: Wolkenbildung – Zeitraffer, Wolken ziehen über ein Tal.
  • Szene 4: Regen – Nahaufnahme auf Blätter, Tropfen in Zeitlupe.
  • Szene 5: Rückfluss – Bach läuft bergab, Kamera folgt seitlich.
  • Szene 6: Menschen profitieren – Feldbewässerung, ruhige Totale.

Jede Zeile enthält Subjekt, Bewegung, Kameraperspektive und Stimmung. Genau diese vier Elemente braucht ein Videomodell, um nicht zu raten.

Format, Seitenverhältnis und Zielplattform

Entscheide früh, ob 16:9, 9:16 oder 1:1 produziert wird. Hochformat braucht andere Bildkomposition: weniger Breite, mehr vertikale Dramaturgie, größere Nahaufnahmen, Texte mit sicherem Rand. Wer horizontal generiert und später beschneidet, verliert Bildinhalt und muss unter Umständen neu produzieren – ein vermeidbarer Kostenfaktor.

Realistische Szenenlängen einplanen

Kurze Clips von vier bis acht Sekunden sind derzeit der zuverlässigste Baustein. Längere Einstellungen neigen zu Drift: Gesichter verändern sich, Hände werden unsauber, Hintergründe verschieben sich. Es ist deutlich effizienter, mehrere kurze Einstellungen zu generieren und im Schnitt zu verbinden, als eine lange Einstellung zu erzwingen.

Phase 2: Modellwahl nach Aufgabentyp

Es gibt kein universell bestes Modell. Es gibt Modelle, die für bestimmte Aufgaben besser geeignet sind – und eine Auswahlstrategie, die Frust reduziert.

Text-zu-Video, Bild-zu-Video, Video-zu-Video

  • Text-zu-Video eignet sich für Moodboards, abstrakte Übergänge, Landschaften und Konzepte ohne feste Vorlage. Es bietet maximale Freiheit, aber wenig Kontrolle über Details.
  • Bild-zu-Video ist der Standard für Charakterarbeit und Produktaufnahmen. Ein starkes Startbild plus gezielte Bewegungsanweisung liefert meist die beste Kombination aus Kontrolle und Qualität.
  • Video-zu-Video funktioniert gut für Umstilisierung, Farbvarianten, Tempoanpassung und Effektverstärkung. Es ist ideal, um bereits abgesegnetes Material in eine andere Bildsprache zu überführen, ohne die Kadrage neu zu erfinden.
  • Motion-Transfer und Performance-Übertragung sind praktisch, wenn Schauspiel oder Bewegungsabläufe präzise vorgegeben werden müssen.

Entscheidungskriterien jenseits der Demo-Clips

Bewerte Modelle anhand von sechs Kriterien:

  1. Konsistenz über mehrere Einstellungen – dieselbe Figur, dasselbe Licht, dasselbe Setting.
  2. Bewegungsqualität – Physik von Stoff, Wasser, Haaren, Rauch; Vermeidung von Morphing.
  3. Steuerbarkeit – Reaktion auf Kameraanweisungen, Geschwindigkeit, Brennweitenwirkung.
  4. Iterationsgeschwindigkeit – wie schnell kommt ein verwertbares Ergebnis zurück?
  5. Formatflexibilität – Auflösung, Seitenverhältnis, Dauer, Exportformate.
  6. Rechte- und Nutzungsrahmen – kommerzielle Nutzung, Trainingsdaten, Aufbewahrung.

Teste jedes neue Modell mit demselben Testpaket: eine Person mittlere Einstellung, eine Handbewegung, eine Landschaft mit Bewegung, ein Objekt mit Textur, ein Dialoggesicht. Nach zehn Minuten weißt du mehr als nach zehn Demo-Videos.

Hybrid statt monogam

In der Praxis arbeitet kaum ein Team mit nur einem Werkzeug. Ein typischer Stack: ein Modell für Charakteraufnahmen, ein zweites für Landschaften und Atmosphäre, ein drittes für Stilisierung, plus ein Videoschnittprogramm und ein Audiowerkzeug. Die Kunst liegt darin, Übergänge und Farbanpassung so zu gestalten, dass die Herkunft der Clips nicht mehr erkennbar ist.

Phase 3: Konsistenz über Szenen und Einstellungen

Konsistenz ist der teuerste Teil der Produktion – und der, an dem die meisten Projekte scheitern.

Referenzbilder, Charakterbögen, Seed-Strategie

Erstelle für jede Hauptfigur einen Charakterbogen: Frontalansicht, Dreiviertelansicht, Profil, Nahaufnahme, Ganzkörper, zwei typische Posen. Nutze diese Bilder als Referenz in jeder Einstellung, in der die Figur vorkommt. Halte, wo möglich, identische Startbedingungen fest – gleiche Bildreferenz, gleiche Stilbeschreibung, gleiche Lichtangabe. Notiere alles in einer Tabelle: Figur, Referenzdatei, Prompt-Basis, Ergebnisnote.

Licht, Objektiv, Bewegung konsistent halten

Formuliere drei bis fünf wiederkehrende Lichtsituationen und benenne sie einheitlich: »weiches Seitenlicht von links, kühle Schatten«, »hartes Gegenlicht, warme Kanten«, »diffuses Tageslicht, bedeckter Himmel«. Dasselbe gilt für Optik: »35 mm, geringe Tiefenschärfe« oder »Weitwinkel, tiefe Schärfe«. Wenn diese Vokabeln in jedem Prompt für eine Szene wiederkehren, steigt die visuelle Kohärenz messbar.

Der Konsistenztest vor der Massenproduktion

Bevor du 40 Einstellungen generierst, produziere drei zusammenhängende Einstellungen: dieselbe Figur, dieselbe Szene, unterschiedliche Kamerawinkel. Prüfe dann Gesicht, Kleidung, Lichtrichtung, Farbtemperatur und Umgebung. Wenn diese drei Einstellungen zusammen funktionieren, funktioniert auch die Serie. Wenn nicht, korrigiere jetzt – nicht nach der 30. Generierung.

Phase 4: Prompt-Handwerk für Bewegung und Kamera

Prompts für Video sind Regieanweisungen, keine Wunschlisten. Vier Bausteine haben sich bewährt:

  • Subjekt und Situation: Wer oder was, in welcher Umgebung, in welchem Zustand.
  • Aktion: Was passiert – einmalig, wiederholt, schleichend, plötzlich.
  • Kamera: Perspektive, Brennweite, Bewegung, Tempo.
  • Licht und Atmosphäre: Tageszeit, Wetter, Stimmung, Farbigkeit.

Bewegung beschreiben wie eine Regieanweisung

Statt »schöne Szene mit Frau am Strand« formuliere: »Eine Frau Mitte dreißig steht am Wasser, wendet den Kopf langsam nach links, Haar bewegt sich im Wind. Kamera: langsame seitliche Fahrt nach rechts, 50 mm, leichte Tiefenschärfe. Weiches Gegenlicht der tiefstehenden Sonne, warme Kanten, kühle Schatten auf dem Sand. Ruhige, dokumentarische Stimmung.«

Der Unterschied ist nicht Poesie, sondern Eindeutigkeit. Jeder Satz reduziert Interpretationsspielraum.

Häufige Prompt-Fehler

  • Zu viele Aktionen in einem Clip. Zwei Bewegungen pro Einstellung sind meist das Maximum.
  • Widersprüchliche Kameraangaben. »Statisch« und »Drohnenflug« gleichzeitig führt zu Chaos.
  • Wechselnde Stilvokabeln. Wenn Szene 1 »filmisch« und Szene 5 »cinematisch, cineastisch« heißt, driftet der Look.
  • Fehlende Blickrichtung. Gerade in Dialogszenen entscheidet die Blickrichtung über die Lesbarkeit des Schnitts.
  • Negativlisten als Allheilmittel. Sie helfen punktuell, ersetzen aber keine klare Beschreibung.

Wiederholbarkeit dokumentieren

Führe ein Prompt-Log: Datum, Modell, Prompt, Referenzdateien, Ergebnisbewertung, Link zur Datei. Dieses Log wird schnell zur wertvollsten Ressource im Projekt, weil es gelungene Formulierungen reproduzierbar macht. Neue Teammitglieder können darauf aufbauen, statt bei null zu beginnen.

Phase 5: Vom Rohclip zur fertigen Sequenz

Generierte Clips sind Rohmaterial. Der filmische Wert entsteht im Schnitt.

Sichten, bewerten, aussortieren

Bewerte jede Generierung nach vier Kriterien: technische Sauberkeit, Stil-Treue, Bewegungsplausibilität, Verwendbarkeit im Kontext. Vergib Noten von 1 bis 5. Alles unter 3 wandert in den Ausschussordner, damit er nicht versehentlich wieder im Schnitt landet. Diese Disziplin spart Stunden.

Schnitt und Rhythmus

Beginne mit einer Rohfassung ohne Effekte. Setze die Einstellungen nach Dramaturgie, nicht nach Generierungsreihenfolge. Teste den Rhythmus mit Ton – schon ein einfacher Musikbett zeigt, wo Einstellungen zu lang oder zu kurz sind. Ein bewährter Trick: Schneide jede Einstellung zunächst zehn Prozent kürzer als gefühlt nötig. KI-Clips wirken häufig träge, wenn sie ausklingen dürfen.

Übergänge, Stabilisierung, Retusche

Zwischen unterschiedlich generierten Einstellungen helfen unauffällige Übergänge: Bewegungsschnitt, kurze Überblendung, Zwischenschnitt auf ein Detail. Instabile Bereiche lassen sich in der Postproduktion stabilisieren oder durch Masken und kurze Detailaufnahmen verdecken. Kleinere Fehler – eine kurz verschwindende Hand, ein wackelndes Objekt – fallen im Kontext oft nicht auf. Perfektionismus an einzelnen Frames kostet mehr, als er bringt.

Ton als halbe Miete

Generierte Videos haben keinen brauchbaren O-Ton. Plane Stimmen, Atmosphäre und Musik separat: Sprechertext, Raumklang, Geräuschebene, Musik. Schon eine simple Raumspur unter jeder Szene hebt die wahrgenommene Produktionsqualität deutlich. Achte auf Synchronität bei sichtbaren Sprechbewegungen – hier lohnt sich, entweder auf Lippenferne zu schneiden oder die Sprechszene in einer festen Kameraeinstellung zu halten.

Workflow-Miniatur: 60-Sekunden-Erklärvideo

  • Tag 1: Treatment, Szenenliste, Referenzboard, 8 Einstellungen definiert.
  • Tag 2: Konsistenztest mit 3 Einstellungen, Korrektur von Licht- und Referenzangaben.
  • Tag 3: Massenproduktion, 3 Varianten pro Einstellung, Sichtung und Bewertung.
  • Tag 4: Schnitt der Rohfassung, Tonaufnahme, Musikauswahl.
  • Tag 5: Farbanpassung, Text-Inserts, Qualitätskontrolle, Export in zwei Formaten.

Dieser Fünf-Tage-Rahmen ist realistisch für ein Team von zwei bis drei Personen und skalierbar, sobald Prompt-Log und Referenzboard stehen.

Phase 6: Qualitätssicherung, Rechte und Kennzeichnung

Vor der Auslieferung lohnt eine feste Checkliste, damit nichts übersehen wird.

Technische Prüfung

  • Auflösung, Bildrate und Seitenverhältnis stimmen mit der Zielplattform überein.
  • Keine Schwarzbilder, keine doppelten Frames, keine Tonlücken.
  • Untertitel korrekt positioniert und lesbar, auch auf kleinen Displays.
  • Lautheit für die Zielplattform angepasst, keine Verzerrung.
  • Dateinamen und Versionierung sauber, Master und Ausspielversionen getrennt.

Inhaltliche Prüfung

  • Erzähllogik: Versteht jemand ohne Vorkenntnis die Aussage?
  • Figurenkonsistenz über alle Einstellungen.
  • Keine ungewollten Artefakte in Händen, Augen oder Texturen.
  • Keine unbeabsichtigten Logos, Marken oder erkennbaren Personen.

Rechte, Freigaben und Transparenz

Kläre vorab, welche Nutzungsrechte dein Werkzeug oder dein Auftraggeber erlaubt und wie mit erzeugten Inhalten umgegangen werden soll. Prüfe die Bedingungen jedes eingesetzten Dienstes, dokumentiere verwendete Referenzbilder und hole Freigaben für erkennbare Personen oder geschützte Marken ein. Informiere Auftraggeber und Publikum transparent darüber, dass KI-Technologie eingesetzt wurde – das ist in vielen Kontexten ohnehin vorgeschrieben und schützt vor Missverständnissen.

Produktionsvolumen und Iterationsbudget planen

Die häufigste Fehlkalkulation ist die Annahme, dass Generieren kostenlos sei. Tatsächlich kostet es Zeit, Rechenleistung und Nerven. Plane deshalb bewusst:

  • Varianten pro Einstellung: zwei bis vier. Mehr bringt selten bessere Ergebnisse, sondern nur mehr Sichtungsaufwand.
  • Iterationsrunden: maximal drei pro Einstellung. Danach liegt das Problem meist im Konzept, nicht im Prompt.
  • Puffer: 30 Prozent der Gesamtzeit für Nacharbeiten und Konsistenzkorrekturen.
  • Wartezeit: Generierungen laufen asynchron. Nutze Wartezeiten für Schnitt oder Sichtung paralleler Szenen.
  • Archiv: Speichere alle Ergebnisse, auch Ausschuss. Manchmal passt eine verworfene Variante später perfekt als Detailaufnahme.

Ein einfaches Kostenmodell hilft: Anzahl Einstellungen × Varianten × durchschnittliche Bearbeitungszeit pro Variante = Bruttoaufwand. Ziehe danach die erwartete Ausschussquote ab, um den tatsächlich nutzbaren Output zu schätzen. Wer diesen Wert kennt, kann Angebote realistisch kalkulieren.

Typische Fehler und wie man sie vermeidet

Problem: Figuren verändern sich zwischen Einstellungen.
Ursache ist meist eine fehlende oder wechselnde Referenz. Lösung: feste Referenzbilder, konsistente Lichtvokabeln, ein Charakterbogen pro Figur.

Problem: Bewegung wirkt künstlich oder ruckelig.
Meist sind zu viele Aktionen im Prompt oder die Bewegung ist zu schnell. Lösung: eine Bewegung pro Einstellung, moderate Geschwindigkeit, kurze Cliplänge.

Problem: Der Look driftet über die Szenen.
Häufig durch wechselnde Stilbegriffe und unterschiedliche Modelle. Lösung: ein Look-Leitfaden mit maximal fünf Lichtsituationen, dokumentierte Prompt-Basis, Farbanpassung am Ende.

Problem: Hände, Zähne, Augen mit Artefakten.
Lösung: Bildausschnitt ändern, Hände nicht im Bildzentrum halten, Nahaufnahmen mit langsamer Bewegung generieren, notfalls Einstellung verkürzen und mit einem Detailbild überdecken.

Problem: Zu viele Generierungen, kein Fortschritt.
Nach drei erfolglosen Versuchen ist fast immer das Konzept zu unklar. Kehre zum Treatment zurück und formuliere die Einstellung schriftlich präziser, bevor du weiter generierst.

FAQ: Häufige Fragen zur KI-Videoproduktion

Wie viele Einstellungen pro Minute sind realistisch?
Bei vier- bis achtsekündigen Clips sind das acht bis fünfzehn Einstellungen pro Minute. Schnitt und Übergänge reduzieren die effektiv benötigte Zahl.

Brauche ich teure Werkzeuge und leistungsstarke Hardware?
Fange mit dem an, was du hast, und erweitere gezielt dort, wo ein Engpass auftritt. Ein klarer Workflow mit einfachen Werkzeugen liefert bessere Ergebnisse als teure Tools ohne System. Erst wenn Wartezeiten oder Qualitätsgrenzen zum Projektrisiko werden, lohnt ein Upgrade.

Wie verhindere ich, dass alles gleich aussieht?
Variiere gezielt Kadrage, Brennweite und Licht, nicht nur das Motiv. Feste Regeln für Konsistenz sollten nicht bedeuten, jede Einstellung gleich zu beleuchten. Kontrast zwischen Szenen ist Teil der Dramaturgie.

Eignen sich KI-Videos für Werbung und Kundenprojekte?
Ja, sofern Rechte, Freigaben und Kennzeichnung geklärt sind. Besonders stark sind Konzeptfilme, Erklärvideos, Produktanimationen, Visualisierungen und Moodboards. Für dokumentarische Aufnahmen mit starker Authentizität bleibt klassisches Material oft die bessere Wahl.

Wie lang sollte eine erste Testproduktion sein?
Zehn bis zwanzig Sekunden mit drei bis vier Einstellungen. Damit testest du alle kritischen Punkte – Konsistenz, Bewegung, Ton, Schnitt – ohne unnötig Zeit zu investieren.

Was mache ich, wenn der Auftraggeber Änderungen verlangt?
Dokumentierte Prompts und Referenzen machen Änderungen kalkulierbar. Du kannst eine einzelne Einstellung neu generieren, ohne die gesamte Serie zu zerstören. Genau das ist der praktische Wert eines strukturierten Workflows.

Muss ich mehrere Modelle abonnieren?
Nein. Beginne mit einem und ergänze nur, wenn eine konkrete Aufgabe wiederholt nicht zufriedenstellend lösbar ist. Jedes zusätzliche Werkzeug erhöht Einarbeitungs- und Abstimmungsaufwand.

Fazit: Wer Struktur beherrscht, produziert schneller

KI-Video ist kein Selbstläufer, sondern ein neues Produktionshandwerk. Die Werkzeuge werden sich weiter verändern, die Grundregeln bleiben: klare Idee, dokumentierte Konsistenz, disziplinierte Auswahl und solide Postproduktion. Teams, die diese vier Punkte beherrschen, produzieren schneller als andere – nicht weil ihre Modelle besser sind, sondern weil sie wissen, was sie vor der ersten Generierung tun müssen.

Beginne mit einem kleinen, vollständig durchdachten Projekt. Baue deinen eigenen Charakterbogen, dein Prompt-Log und deine Qualitätscheckliste auf. Nach zwei oder drei Produktionen hast du etwas, das kein Modell-Update dir nehmen kann: einen reproduzierbaren Ablauf, der Ergebnisse liefert, wenn der Termin drückt.

Alexander

Alexander