Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Der komplette KI-Video-Workflow: Idee, Prompt, Schnitt

Sep 30, 2026

Warum KI-Video ein Prozessproblem ist

Videoproduktion mit generativen Systemen wirkt auf den ersten Blick wie ein Werkzeugkasten: Beschreibung eingeben, Ergebnis erhalten, fertig. In der Praxis zeigt sich schnell, dass die Qualität nicht vom einzelnen Werkzeug abhängt, sondern von der Reihenfolge der Entscheidungen. Wer zuerst ein Modell auswählt und danach über Format, Figuren und Ton nachdenkt, produziert Ausschuss. Wer zuerst Format, Zielgruppe und Konsistenzanforderungen klärt, kann Modelle gezielt einsetzen.

Der entscheidende Unterschied zur klassischen Produktion liegt in der Wiederholbarkeit. Ein Dreh lässt sich wiederholen, weil Licht, Bühne und Schauspieler kontrolliert werden. Bei generativen Systemen ist die Kontrolle indirekt: Sie entsteht durch Referenzbilder, präzise Beschreibungen, feste Parameter und dokumentierte Versionen. Ohne diese Disziplin sieht jede Einstellung anders aus, selbst wenn der Prompt identisch ist.

Dieser Leitfaden beschreibt einen neutralen Arbeitsablauf für KI-gestützte Videoproduktion. Er konzentriert sich auf Aufgabenklassen statt auf einzelne Anbieter, auf Entscheidungskriterien statt auf Ranglisten und auf Fehlervermeidung statt auf spektakuläre Einzelbeispiele. Das Ziel ist ein Workflow, der sich in kleinen Teams genauso anwenden lässt wie in größeren Redaktionen.

Die wichtigsten Aufgabenklassen im KI-Video

Bevor man Modelle vergleicht, lohnt sich eine Einteilung nach Aufgaben. Fast jedes System lässt sich einer dieser Klassen zuordnen. Die häufigsten Fehlentscheidungen entstehen, wenn ein Werkzeug für die falsche Klasse eingesetzt wird.

Text-zu-Video. Aus einer Beschreibung entstehen bewegte Bilder. Diese Klasse eignet sich für Moodboards, abstrakte Sequenzen, Hintergründe und erste Konzeptvisualisierungen. Die Stärke ist Geschwindigkeit. Die Schwäche ist Kontrolle: Figuren, Details und Kameraführung ändern sich häufig von Lauf zu Lauf.

Bild-zu-Video. Ein vorhandenes Standbild wird animiert. Das ist der zuverlässigste Weg zu konsistenten Ergebnissen, weil Aussehen, Farben und Komposition bereits festgelegt sind. Für Figuren, Produkte, Architektur und Markenauftritte sollte man hier arbeiten.

Video-zu-Video. Vorhandenes Material wird verändert: Stiltransfer, Farbanpassung, Stabilisierung, Auflösungserhöhung oder Entfernung störender Objekte. Diese Klasse wird oft unterschätzt, ist aber für Teams mit Archivmaterial oft der produktivste Einstieg.

Tonsynthese. Stimmen, Geräusche, Musik und Synchronisation. Ohne diese Ebene bleibt jedes KI-Video ein stummer Entwurf. Moderne Stimmsynthese ist gut genug für Kommentare, Erklärstücke und Dialogfassungen, wenn die Sätze kurz und die Betonung klar ist.

Bildanalyse und Assistenz. Systeme, die Szenen beschreiben, Konsistenz prüfen, Varianten vergleichen oder Shotlists vorschlagen. Sie erzeugen keine Bilder, sparen aber Zeit bei der Strukturierung. Der Nutzen liegt weniger im kreativen Impuls als in der Qualitätssicherung.

Zwischenbild- und Reparaturmodelle. Sie erzeugen Übergänge, glätten Bewegungen, entfernen Artefakte oder verlängern Sequenzen. Diese Werkzeuge sind kein Ersatz für gute Planung, aber sie retten Einstellungen, die sonst neu generiert werden müssten.

Eine einfache Regel: Je höher der Kontrollbedarf, desto weiter unten in dieser Liste sollte man einsteigen. Wer mit Bild-zu-Video beginnt, produziert seltener Ausschuss als jemand, der alles aus einer Textbeschreibung erwartet.

Der Workflow in acht Schritten

Ein tragfähiger Ablauf besteht aus acht Schritten. Sie lassen sich bei kurzen Formaten an einem Tag durchlaufen, bei narrativen Projekten über mehrere Tage strecken.

Schritt 1: Briefing und Formatentscheidung

Am Anfang steht keine Prompt-Idee, sondern eine Formatentscheidung. Hochformat für Feeds, Querformat für Präsentationen und Webseiten, quadratisch für gemischte Ausspielung. Dieses Format bestimmt Komposition, Textgröße, Bewegungsrichtung und den Raum für Untertitel. Wird es später geändert, muss ein großer Teil des Materials neu entstehen.

Zum Briefing gehören außerdem Zielgruppe, Länge, Sprachfassungen, Untertitelbedarf, Markenregeln und die Frage, ob reales Material beigemischt wird. Ein einseitiges Briefing verhindert später zehn Diskussionsrunden.

Schritt 2: Treatment und Shotlist

Aus dem Briefing entsteht ein kurzes Treatment. Danach wird eine Shotlist mit maximal zwölf bis fünfzehn Einstellungen pro Minute erstellt. Jede Einstellung bekommt eine Aufgabe: etablieren, erklären, Emotion erzeugen, Produkt zeigen oder Übergang schaffen. Einstellungen ohne Aufgabe werden gestrichen.

Die Shotlist ist das wichtigste Steuerdokument des Projekts. Sie bestimmt, welche Figuren, Orte und Lichtsituationen konsistent bleiben müssen. Wer sie überspringt, merkt erst beim Schnitt, dass zwei Einstellungen nicht zusammenpassen.

Schritt 3: Referenzbilder erzeugen und einfrieren

Für jede wiederkehrende Figur, jedes Produkt und jeden zentralen Schauplatz entsteht ein Referenzbild in Zielauflösung. Diese Bilder werden versioniert und nicht mehr überschrieben. Sie sind die Grundlage für Bild-zu-Video und für Stilkonsistenz.

Bewährt hat sich eine kleine Bibliothek: eine Ganzkörperansicht, ein Porträt, eine Detailaufnahme und ein Umgebungsbild. Vier Dateien pro Motiv genügen meist, um Szenen über verschiedene Einstellungen hinweg zusammenhängend wirken zu lassen.

Schritt 4: Animation der Einstellungen

Jetzt wird jede Einstellung aus dem Referenzbild animiert. Wichtiger als das Modell ist die Bewegungsangabe: Was bewegt sich, in welche Richtung, wie schnell, und was bleibt statisch? Kamera und Motiv sollten sich nie gleichzeitig stark bewegen, sonst entsteht ein flackerndes Ergebnis.

Generiert wird in kurzen Segmenten von wenigen Sekunden, die später verbunden werden. Das kostet mehr Durchläufe, erhöht aber die Trefferquote deutlich. Ein zehnsekündiger Clip mit drei Bewegungen ist schwerer zu kontrollieren als drei kurze Clips mit je einer Bewegung.

Schritt 5: Auswahl und Ausschussmanagement

Pro Einstellung werden mehrere Varianten erzeugt und nach festen Kriterien bewertet: Konsistenz zur Referenz, Bewegungsplausibilität, Artefakte, Bildkomposition und Anschlussfähigkeit an die Nachbareinstellungen. Die Auswahl wird dokumentiert, damit später nachvollziehbar bleibt, welche Einstellung aus welchem Lauf stammt.

Ein häufiger Fehler ist, den perfekten Take zu suchen. Meist reicht ein guter Take, der im Schnitt funktioniert. Ausschuss ist kein Qualitätsproblem, sondern eingeplanter Bestandteil der Produktion.

Schritt 6: Ton, Stimme und Musik

Erst nach dem groben Bildschnitt wird vertont. Dialog oder Kommentar werden zuerst als Text finalisiert, dann synthetisiert oder eingesprochen, danach folgen Geräusche und Musik. Die Tonspur bestimmt das Tempo rückwirkend, deshalb sollte der Schnitt vorher grob stehen.

Bei mehrsprachigen Fassungen lohnt es sich, Satzlängen früh zu prüfen. Deutsche Sätze sind häufig länger als englische, was im fertigen Video zu Hetze führt. Kürzere Sätze und bewusste Pausen wirken natürlicher.

Schritt 7: Schnitt und Übergänge

Im Schnitt entscheidet die erste Sekunde über den Verbleib. Deshalb gehören die stärkste Bewegung, das klarste Bild und die zentrale Aussage nach vorn. Einstellungen, die nur der Logik dienen, gehören in den Mittelteil oder ganz heraus.

Zwei Einstellungen, die inhaltlich passen, aber visuell springen, zerstören den Fluss. Eine kurze Überblendung, ein Bewegungsmatch oder ein Tonübergang lösen das Problem meist ohne Neugenerierung.

Schritt 8: Ausspielung und Versionierung

Zum Abschluss entstehen Fassungen für die geplanten Kanäle, jeweils mit angepasstem Bildausschnitt, Untertiteln und Lautheitsnorm. Eine klare Dateibenennung mit Projekt, Einstellung, Version und Format verhindert, dass bei Nachbearbeitungen Varianten verloren gehen.

Prompting: Von der Beschreibung zur Spezifikation

Ein guter Prompt für Videomodelle ist keine Beschreibung, sondern eine Spezifikation. Er besteht aus fünf Bestandteilen: Motiv, Handlung, Kamera, Licht und Stil. Fehlt einer davon, füllt das Modell die Lücke selbst, und genau dort entstehen die Überraschungen, die niemand wollte.

Motiv. Wer oder was ist zu sehen, mit welchen sichtbaren Merkmalen. Kleidung, Material, Alter, Zustand und Umgebung sollten knapp, aber eindeutig benannt werden.

Handlung. Eine einzige, klar beschriebene Bewegung. Mehrere gleichzeitige Aktionen überfordern die meisten Modelle.

Kamera. Perspektive, Brennweite, Bewegung und Geschwindigkeit. Eine langsame Fahrt oder ein ruhiger Schwenk sind leichter zu kontrollieren als eine schnelle Kamerafahrt.

Licht. Tageszeit, Richtung, Härte und Farbtemperatur. Licht ist der stärkste Hebel für Konsistenz, weil es Gesichter und Materialien über Einstellungen hinweg verbindet.

Stil. Materialität, Kontrast und Referenz auf eine Bildsprache, nicht auf ein konkretes Werk. Begriffe wie dokumentarisch, weich, körnig oder klar sind hilfreicher als der Name eines Films.

Negativangaben sind ebenso wichtig: keine zusätzlichen Personen, keine Textüberlagerungen, keine schnellen Zoomfahrten, keine wechselnden Lichtfarben. Wer diese Liste pro Projekt einmal definiert, kann sie über alle Einstellungen hinweg wiederverwenden und bekommt dadurch eine erkennbare visuelle Handschrift.

Ein zweiter Hebel ist die Wiederholbarkeit. Gleiche Prompts mit gleichem Startbild und gleichem Zufallswert erzeugen ähnliche Ergebnisse. Wer den Zufallswert nicht fixiert, kann eine gute Einstellung nicht reproduzieren. Das wird zum Problem, sobald eine Szene nachträglich verlängert oder in einer anderen Sprache neu vertont werden muss.

Konsistenz mit Referenzbildern

Konsistenz entsteht nicht im Prompt allein, sondern durch Referenzen. Ein Referenzbild legt Aussehen, Proportionen, Farben und Stil fest. Das Modell animiert dann dieses Bild, statt eine neue Figur zu erfinden. Je klarer die Referenz, desto stabiler das Ergebnis.

Für Figuren haben sich drei Ebenen bewährt. Erstens ein neutrales Porträt bei gleichmäßigem Licht. Zweitens eine Ganzkörperansicht für Bewegungen und Proportionen. Drittens eine Detailaufnahme für Hände, Stoffe oder Produktoberflächen. Wer diese drei Ebenen versioniert, kann Einstellungen über verschiedene Szenen hinweg verbinden.

Für Orte gilt Ähnliches. Ein Umgebungsbild mit klarer Perspektive, etwa eine Straße, ein Innenraum oder ein Tischaufbau, wird zur visuellen Klammer. Ändert sich der Ort, ändert sich oft auch die Lichtstimmung, und genau das fällt Zuschauern auf.

Ein häufiger Fehler ist das Überschreiben von Referenzdateien. Wer eine Datei aktualisiert, verliert die Grundlage älterer Einstellungen. Besser ist eine Versionsnummer im Dateinamen und ein kurzes Änderungsprotokoll. Das klingt bürokratisch, spart aber bei Nachdrehs und Korrekturrunden viel Zeit.

Modellwahl: Sieben Entscheidungskriterien

Die wichtigste Frage ist nicht, welches Modell die schönsten Einzelbilder liefert, sondern welches die Anforderungen des Projekts erfüllt. Sieben Kriterien helfen bei der Entscheidung.

Konsistenzfähigkeit. Bleibt eine Figur über mehrere Einstellungen hinweg erkennbar? Lässt sich ein Referenzbild zuverlässig übernehmen? Dieses Kriterium ist für narrative Arbeit wichtiger als maximale Bildqualität in einem einzelnen Lauf.

Bewegungskontrolle. Reagiert das Modell auf Richtungs- und Geschwindigkeitsangaben, oder improvisiert es? Für Produktvideos und erklärende Sequenzen ist kontrollierte Bewegung entscheidend.

Auflösung und Seitenverhältnis. Passt das native Format zum Zielkanal, ohne dass stark beschnitten werden muss? Ein Modell, das nur Querformat in hoher Qualität liefert, ist für Hochformat-Kampagnen weniger geeignet.

Laufzeit und Durchsatz. Wie lange dauert eine Einstellung, und wie viele Versuche sind realistisch? Nicht der Preis pro Sekunde ist entscheidend, sondern die Zeit bis zur fertigen Auswahl.

Rechte und Lizenz. Sind kommerzielle Nutzung, Weiterverbreitung und Bearbeitung erlaubt? Diese Frage muss vor der Produktion geklärt werden, nicht nach der Auslieferung.

Schnittstellen. Gibt es eine Programmierschnittstelle, Stapelverarbeitung und stabile Dateiausgabe? Für wiederkehrende Formate spart Automatisierung viel Handarbeit.

Nachvollziehbarkeit. Lassen sich Einstellungen, Parameter und Versionen dokumentieren? Ein Modell ohne reproduzierbare Ausgabe ist für Serienproduktionen riskant.

Ein Modell, das bei Konsistenz und Lizenz gut abschneidet und bei den übrigen Kriterien mittelmäßig, ist für narrative Arbeit meist wertvoller als ein System mit spektakulären Einzelbildern, das Figuren bei jedem Lauf neu erfindet.

Ton, Schnitt und Postproduktion

Zuschauer verzeihen mittelmäßige Bilder eher als schlechten Ton. Drei Maßnahmen wirken sofort: eine konsistente Lautheit über alle Einstellungen, ein hörbarer Raumklang statt trockener Stimme und eine Musik, die nicht mit dem Kommentar um Aufmerksamkeit konkurriert.

Für synthetische Stimmen gilt: kurze Sätze, klare Betonung, Pausen an inhaltlichen Grenzen. Ein Sprecher, der fünfundzwanzig Wörter ohne Atemzug vorträgt, klingt künstlich, egal wie gut das Modell ist. Bei Geräuschen ist weniger mehr. Ein einzelnes präzises Geräusch pro Bewegung wirkt überzeugender als eine dichte Tonspur.

Im Schnitt entscheidet die erste Sekunde über den Verbleib. Deshalb sollten die stärkste Bewegung, das klarste Bild und die zentrale Aussage nach vorn. Einstellungen, die nur der Logik dienen, gehören in den Mittelteil oder ganz heraus.

Ein häufiges Übersehen sind Zwischenbilder und Übergänge. Zwei Einstellungen, die inhaltlich passen, aber visuell springen, zerstören den Fluss. Eine kurze Überblendung, ein Bewegungsmatch oder ein Tonübergang lösen das Problem meist ohne Neugenerierung.

Auch Farbanpassung ist ein unterschätzter Hebel. Wenn alle Einstellungen aus unterschiedlichen Läufen stammen, unterscheiden sich Kontrast, Sättigung und Weißabgleich. Ein gemeinsames Grading mit Referenzbild als Ziel macht aus einzelnen Clips eine zusammenhängende Sequenz.

Typische Fehler und wie man sie vermeidet

Zu viele Einstellungen pro Minute. KI-Material braucht länger, um gelesen zu werden. Vier bis sechs Einstellungen pro Minute sind für narrative Inhalte oft ausreichend. Wer schneller schneidet, verstärkt Artefakte statt sie zu verbergen.

Fehlende Referenzverwaltung. Wer Referenzbilder überschreibt oder umbenennt, verliert die Konsistenz. Dateien gehören versioniert, nicht ersetzt.

Alles in einem Durchlauf. Große Erwartungen an einen einzelnen Lauf führen zu Frust. Kurze Segmente, viele Varianten und klare Auswahlregeln sind zuverlässiger.

Rechtefragen am Ende. Lizenzen und Nutzungsrechte müssen vor der Produktion geklärt sein, nicht nach der Auslieferung.

Kein Ausschussbudget. Wer die doppelte Menge an Läufen einplant, produziert entspannter und schneller als jemand, der jeden Lauf rechtfertigen muss.

Ton als Nachgedanke. Die Tonspur sollte parallel zum Bildschnitt geplant werden, weil sie das Tempo bestimmt.

Unklarheit über das Zielformat. Hochformat braucht andere Bildkomposition als Querformat. Wer erst nach dem Schnitt umstellt, verliert Bildinhalte.

Zu viele gleichzeitige Bewegungen. Kamera, Figur und Hintergrund sollten nicht gleichzeitig stark in Bewegung sein. Eine ruhige Achse pro Einstellung erhöht die Trefferquote.

Fehlende Dokumentation. Ohne Notizen zu Prompt, Referenz und Zufallswert lassen sich gute Ergebnisse nicht wiederholen. Ein einfaches Protokoll pro Einstellung reicht.

Skalierung und Dokumentation

Für die Planung zählt nicht der Preis pro Sekunde, sondern der Durchsatz pro Arbeitstag. Vier Größen bestimmen ihn: Laufzeit pro Einstellung, Anzahl der Varianten, Wartezeit in der Warteschlange und Zeit für Auswahl und Nachbearbeitung.

Ein Beispiel: Bei acht geplanten Szenen, je vier Varianten und einer Laufzeit von drei Minuten pro Lauf entstehen rund sechsundneunzig Minuten reine Rechenzeit. Hinzu kommen mindestens sechzig Minuten Auswahl und vierzig Minuten Ton. Wer diese Rechnung vor Projektbeginn aufstellt, erkennt Engpässe frühzeitig und kann Einstellungen streichen, bevor sie Arbeit kosten.

Für größere Produktionen lohnt sich Stapelverarbeitung: erst alle Referenzbilder, dann alle Animationen, dann alle Tonvarianten. Das reduziert Kontextwechsel und macht Fehler sichtbar, bevor die halbe Produktion fertig ist.

Dokumentation sollte leichtgewichtig sein. Ein Tabellenblatt mit Projekt, Einstellung, Referenz, Prompt, Zufallswert, Laufzeit und Status genügt. Es verhindert, dass bei einer Korrektur unklar ist, welche Datei die aktuelle ist.

FAQ und abschließende Empfehlungen

Wie viele Läufe brauche ich pro Einstellung? Drei bis fünf Varianten sind ein guter Richtwert. Bei komplexen Bewegungen oder mehreren Figuren eher sechs bis acht.

Kann ich KI-Material mit echtem Filmmaterial mischen? Ja, und das ist oft die stärkste Lösung. Achten Sie auf passende Brennweite, Lichtrichtung und Bewegung, dann wirkt der Übergang natürlich.

Was mache ich bei flackernden Ergebnissen? Bewegung reduzieren, kürzere Segmente generieren, Referenzbild schärfen. Flackern entsteht meist durch zu viele gleichzeitige Veränderungen.

Wie halte ich Figuren über mehrere Einstellungen stabil? Über feste Referenzbilder, gleiche Stilangaben und möglichst ähnliche Lichtsituationen. Wechselt das Licht stark, wechselt oft auch das Gesicht.

Lohnt sich eine eigene Prompt-Bibliothek? Ja. Wiederkehrende Bausteine für Licht, Kamera und Stil sparen pro Projekt mehrere Stunden und sorgen für einen einheitlichen Look.

Wann sollte ich auf Nachbearbeitung statt Neugenerierung setzen? Wenn Bildinhalt und Bewegung stimmen. Grading, Stabilisierung und Tonschnitt sind fast immer schneller als ein neuer Lauf.

Brauche ich ein eigenes Team? Für kurze Formate reicht eine Person mit klarem Workflow. Sobald mehrere Sprachfassungen, Lizenzen und Kanäle dazukommen, ist eine redaktionelle Rolle sinnvoll, die Auswahl und Freigabe verantwortet.

Wie vermeide ich, dass alle Einstellungen gleich aussehen? Variieren Sie Kamera, Licht und Bildausschnitt, nicht den Stil. Ein konsistenter Look mit unterschiedlichen Perspektiven wirkt professionell.

Was ist der wichtigste erste Schritt? Format und Shotlist. Ohne diese beiden Entscheidungen wird jede weitere Arbeit zur Improvisation.

KI-gestützte Videoproduktion ist kein Werkzeugproblem, sondern ein Prozessproblem. Wer mit einer klaren Formatentscheidung beginnt, Referenzbilder einfriert, in kurzen Segmenten animiert und den Ton gleichrangig behandelt, erhält Ergebnisse, die sich sehen lassen können. Die Auswahl des Modells ist dabei nur ein Baustein und selten der entscheidende. Ausschlaggebend sind Konsistenz, Dokumentation und die Bereitschaft, Ausschuss als Teil der Arbeit zu akzeptieren. Wer diese Grundlage einmal aufgebaut hat, produziert schneller, günstiger und mit deutlich weniger Überraschungen.

Alexander

Alexander