Der Workflow in sechs Schritten
Die meisten Einsteiger beginnen ein KI-Video am leeren Textfeld: Man beschreibt eine Szene, drückt auf Generieren und wartet. Das Ergebnis ist oft spektakulär – und fast nie brauchbar. Der Grund ist struktureller Natur: Ein Text beschreibt eine Idee, aber er legt kein Bild fest. Jede Entscheidung über Gesicht, Licht, Farbton, Ausschnitt und Perspektive trifft das Modell selbst, und zwar bei jedem Durchlauf neu.
Beginnt man stattdessen mit einem Standbild, verschiebt sich die Aufgabe. Das Modell muss keine Welt erfinden, sondern eine bereits entschiedene Welt glaubwürdig bewegen. Das ist technisch deutlich einfacher, ästhetisch kontrollierbarer und wirtschaftlich günstiger, weil die Vorstufe schnell und preiswert zu iterieren ist. Wer zwanzig Bildvarianten erzeugt und vergleicht, investiert wenig Zeit und entscheidet informiert. Wer zwanzig Videovarianten erzeugt, investiert viel Rechenzeit und entscheidet nach Gefühl.
Der zweite, oft übersehene Vorteil ist erzählerischer Natur. Eine Reihe konsistenter Bilder ist bereits ein Storyboard – die klassische Vorstufe jeder Produktion. Der Sprung vom Bild zur bewegten Einstellung ist klein. Der Sprung vom leeren Prompt zum fertigen Film ist groß. Deshalb ist der Bild-Start kein Umweg, sondern eine Abkürzung.
Schritt 1: Idee, Zielgruppe und Szenenliste
Schreibe zuerst drei Sätze auf: Wer sieht den Clip, welche Emotion soll entstehen, welche Handlung passiert? Danach zerlegst du die Handlung in Einstellungen von je drei bis fünf Sekunden. Für einen 30-Sekunden-Clip sind das sechs bis acht Einstellungen, mehr braucht es selten.
Notiere pro Einstellung drei Dinge: Motiv, Kamerabewegung, Lichtstimmung. Beispiel: „Nahaufnahme Hände auf der Töpferscheibe, langsame Fahrt nach rechts, warmes Seitenlicht.“ Diese Notiz ist später dein Prompt-Gerüst und verhindert, dass du am leeren Feld improvisierst.
Schritt 2: Referenzbilder erzeugen oder kuratieren
Jetzt entstehen die Standbilder. Es gibt drei Wege: rein generativ, rein fotografisch oder hybrid. Beim generativen Weg beschreibst du die Szene im Bildmodell, ideal für fiktive Motive und stilisierte Looks. Beim fotografischen Weg nutzt du eigene Aufnahmen oder lizenzierte Stockbilder – echte Details, echte Materialien, echte Gesichter. Der Hybridweg ist in der Praxis der häufigste: grob fotografieren, dann Licht, Hintergrund und Details angleichen.
Wichtig ist Einheitlichkeit. Alle Referenzbilder sollten dieselbe Auflösung und ein ähnliches Seitenverhältnis haben. Modelle übernehmen das Format der Referenz relativ zuverlässig; gemischte Formate führen später zu Beschnitt und Neuberechnung.
Schritt 3: Bewegung als Prompt formulieren
Ein guter Bewegungsprompt hat vier Bausteine: Subjektbewegung, Kamerabewegung, Tempo und Konstanz. Mehr dazu weiter unten im Detail. Halte den Prompt kurz – fünfzig Wörter schlagen zweihundert, weil zu viele Details zu widersprüchlichen Anweisungen führen und das Modell Widersprüche mit Flackern oder Formverlust auflöst.
Schritt 4: Varianten generieren und gnadenlos auswählen
Generiere pro Einstellung mindestens vier Varianten mit leicht veränderten Prompts. Vergib sprechende Dateinamen wie „szene03_fahrt_rechts_v2“ – nach zwanzig Clips verlierst du sonst den Überblick. Sortiere hart aus: Eine Einstellung, die nur „okay“ ist, fällt im fertigen Schnitt sofort auf. Rechne mit einer Ausschussquote von sechzig bis siebzig Prozent; wer mit Volltreffern kalkuliert, plant falsch.
Schritt 5: Montage
Erst wenn alle Einstellungen einzeln funktionieren, wird geschnitten. Umgekehrt – schneiden und dann reparieren – kostet doppelt so viel Zeit, weil eine geänderte Einstellungslänge den ganzen Rhythmus verschiebt. Schneide auf Musikmarken, halte ruhige Einstellungen als Atempausen bereit und prüfe den Clip einmal komplett ohne Ton.
Schritt 6: Ton und Export
Ton ist die halbe Wirkung und kostet den geringsten Aufwand. Musik, Atmosphäre, Geräusche und optional eine Stimme werden als getrennte Spuren aufgebaut. Exportiere mindestens zwei Formate: ein hochwertiges Master und eine kompakte Vertikalversion für Social-Kanäle.
Referenzbilder vorbereiten
Die Qualität der Referenz bestimmt die Qualität des Clips stärker als jede Prompt-Formulierung. Ein unscharfes, flach ausgeleuchtetes Bild produziert in jeder Einstellung ein anderes Ergebnis. Deshalb lohnt es sich, hier mehr Zeit zu investieren als beim Prompt.
Auflösung, Seitenverhältnis und Beschnitt
Arbeite mit mindestens 1024 Pixeln auf der langen Kante, besser mehr. Prüfe vor dem ersten Render das Seitenverhältnis deines Zielformats: Horizontal 16:9, vertikal 9:16, quadratisch 1:1. Ein 16:9-Bild in einem 9:16-Projekt zu verwenden bedeutet, dass das Modell entweder beschneidet oder den Bildrand erfindet – beides kostet Kontrolle.
Wenn du beide Formate brauchst, erzeuge das Bild bewusst mit Sicherheitsrand und schneide zwei Versionen zu, statt eine einzige Referenz zu zwingen.
Licht und Farbpalette festlegen
Lege vor dem ersten Render drei bis fünf Farbwerte fest und beschreibe sie in jedem Prompt identisch: „warmes Orange, entsättigtes Blau, tiefe Schatten“. Vermeide Synonyme – „orange“ und „bernsteinfarben“ erzeugen oft sichtbar unterschiedliche Ergebnisse. Dasselbe gilt für die Lichtrichtung: Wenn die Sonne in der ersten Einstellung von links kommt, muss sie es in allen weiteren auch.
Identität stabilisieren
Bei Personen gilt: Ein klares, frontal ausgeleuchtetes Bild reicht als Basis. Zwei zusätzliche Winkel – Halbprofil und Profil – verbessern die Stabilität deutlich, besonders wenn die Figur im Clip den Kopf dreht. Achte auf Details, die Modelle gern verändern: Augenfarbe, Haaransatz, Brillenform, Schmuck, Muttermale. Was du nicht explizit in der Referenz zeigst, wird neu erfunden.
Der Hybridweg in der Praxis
Fotografiere eine Figur oder ein Objekt in gutem Licht, aber ohne perfekten Hintergrund. Lass anschließend Hintergrund, Lichtfarbe und Details angleichen. So bekommst du echte Materialität – Hautstruktur, Stoff, Holzmaserung – kombiniert mit einem künstlich konsistenten Look. Für Produktaufnahmen ist das der zuverlässigste Weg, weil der Betrachter Fälschungen bei realen Objekten sofort erkennt.
Bewegung beschreiben: die Prompt-Bausteine
Ein Bewegungsprompt ist keine Beschreibung einer Handlung, sondern eine technische Anweisung. Wer das versteht, schreibt kürzer und trifft häufiger.
Baustein 1: Subjektbewegung
Was bewegt sich innerhalb des Bildes? Haare im Wind, aufsteigender Dampf, eine sich drehende Tasse, eine Figur, die den Kopf wendet. Formuliere konkret und klein. „Die Figur geht durch den Raum“ ist eine schlechte Anweisung, weil sie unendlich viele Umsetzungen zulässt. „Die Figur dreht langsam den Kopf nach links“ ist eindeutig.
Baustein 2: Kamerabewegung
Wie verhält sich die Kamera? Langsame Fahrt, Schwenk, feste Stativaufnahme, leichter Aufstieg. Wähle pro Einstellung genau eine dominante Bewegung. Zwei Bewegungen gleichzeitig – Kamera fährt und schwenkt – überfordern viele Modelle und erzeugen wabernde Artefakte an Kanten und Haaren.
Baustein 3: Tempo
Ohne Tempoangabe wählen Modelle oft ein mittleres Tempo, das gleichzeitig zu schnell und zu gleichmäßig wirkt. Schreibe explizit „langsam“, „ruhig“ oder „gleichmäßig“. Für dramatische Momente funktioniert „sehr langsam“ meist besser als „schnell“; schnelle Bewegungen erzeugen in generierten Bildern die meisten Formfehler.
Baustein 4: Konstanz
Formulierungen wie „durchgehend“, „ohne Schnitt“, „konstante Kameraposition“ oder „Gesichtszüge unverändert“ halten die Einstellung stabil. Das klingt technisch, wirkt aber messbar auf die Ergebnisse.
Start- und Endbild als Kontrollinstrument
Unterstützt dein Werkzeug Start- und Endbilder, ist das die zuverlässigste Methode für kontrollierte Übergänge. Du bestimmst exakt, wo eine Einstellung beginnt und endet, und die Montage wird erheblich einfacher, weil die Anschlüsse passen. Auch eine feste Kameraposition mit minimaler Bewegung profitiert davon.
Konsistenz über Szenen sichern
Ein einzelner schöner Clip ist einfach. Fünf Clips, die wie ein Film wirken, sind Arbeit. Konsistenz entsteht nicht durch Zufall, sondern durch Referenzen und Disziplin.
Figurenkonsistenz
Nutze dieselbe Gesichtsreferenz in jeder Einstellung, in der die Figur auftritt. Wechselt die Kleidung, ändere nur das Kleidungsstück, nicht die Gesichtsreferenz. Reduziere die Bewegung, wenn das Gesicht wandert: Ein langsamer Kopfdreh bleibt stabil, eine schnelle Drehung mit Körperbewegung selten.
Stilkonsistenz
Farbe und Licht entscheiden darüber, ob eine Sequenz zusammenhängt. Ein häufiger Fehler ist der Wechsel des Looks mitten in der Szene – warme Innenaufnahme, kühle Außenaufnahme, dann wieder warm. Das wirkt wie zusammengeklebte Fremdmaterialien. Lege einen Look fest und halte ihn über alle Einstellungen.
Umgebungskontinuität
Wenn eine Figur sich durch einen Raum bewegt, brauchst du mindestens eine breite Einstellung, die den Raum etabliert, plus Detailaufnahmen. Übernimm Bodenbelag, Wandfarbe und Möbel aus dem Establishing Shot als Referenz. Sonst wandert der Raum zwischen den Einstellungen.
Ein praktischer Trick: Erzeuge zuerst eine Panoramaaufnahme der Umgebung, schneide daraus virtuelle Ausschnitte für Detailbilder und animiere diese Ausschnitte. So bleiben Perspektive und Raumlogik automatisch konsistent.
Requisiten, Hände und Text
Hände sind die Schwachstelle fast aller Bildmodelle. Zeige Hände in der Referenz möglichst klar und vermeide komplexe Fingerhaltungen im Clip. Text im Bild – Schilder, Etiketten, Verpackungen – ist ein weiteres Risiko: Buchstaben verformen sich bei Bewegung. Wenn Text wichtig ist, rendere ihn separat und lege ihn in der Postproduktion als Grafik darüber.
Kamerasprache und Montagelogik
Viele KI-Clips scheitern nicht an der Technik, sondern an der Bildsprache. Wer filmische Begriffe richtig einsetzt, bekommt sofort bessere Ergebnisse und wirkt weniger künstlich.
| Begriff | Wirkung |
|---|---|
| Fahrt (Dolly) | Nähe und Intensität, Blickführung zum Motiv |
| Schwenk (Pan) | Raum wird erschlossen, Orientierung |
| Neigung (Tilt) | Größe und Höhe werden betont |
| Stativ | Ruhe, Beobachtung, Dokumentation |
| Handkamera | Energie, Realismus, Reportage |
| Kran oder Aufstieg | Größe, Überblick, Abschluss |
| Nahaufnahme | Emotion, Details |
| Weitwinkel | Kontext, Umgebung |
Ein zweiter Profi-Tipp betrifft die Anschlussfähigkeit: Beende jede Einstellung gedanklich mit einer Bewegung, die sich fortsetzen lässt. Ein Schwenk, der langsam beginnt und nicht abgeschlossen wird, lässt sich im Schnitt besser anschließen als eine in sich geschlossene Bewegung. Und plane bewusst ruhige Einstellungen ein – ein Video aus lauter Bewegung wirkt unruhig und billig.
Schnittrhythmus
Wechsle nicht bei jedem Höhepunkt die Einstellung. Ein Rhythmus aus zwei kurzen und einer längeren Einstellung wirkt natürlicher als gleichmäßige Fünf-Sekunden-Blöcke. Dehne oder kürze Einstellungen im Schnitt, statt sie in der Generierung zu erzwingen – ein Clip lässt sich meist um eine Sekunde kürzen, ohne dass es auffällt.
Übergänge kaschieren
Zwischen generierten Einstellungen sind harte Schnitte erlaubt, aber sie müssen motiviert sein: durch einen Blickwechsel, eine Handbewegung oder einen Tonakzent. Weiche Übergänge wie Überblendungen nutzt man sparsam, weil sie den generierten Charakter betonen. Am wirksamsten sind kurze Tonüberlappungen: Der Ton der nächsten Einstellung beginnt ein bis zwei Sekunden vor dem Bildwechsel.
Ton und Postproduktion
Ein KI-Video ohne Ton wirkt immer unfertig. Die gute Nachricht: Audio ist der Bereich mit dem geringsten Aufwand und dem größten Effekt.
Musik
Wähle ein Stück, das zum Schnitttempo passt, und schneide die ersten Bilder auf markante musikalische Punkte. Ein harter Schnitt auf einen Beat kaschiert kleine Unstimmigkeiten in der Bewegung. Achte auf Lizenzfreiheit, besonders wenn der Clip kommerziell genutzt wird.
Atmosphäre
Raumatmosphäre – Wind, Regen, Verkehr, Raumhall – verbindet Einstellungen, die sonst getrennt wirken. Lege sie als durchgehende zweite Tonspur unter das gesamte Video. Das ist der einfachste Weg, aus einzelnen Clips eine Szene zu machen.
Geräusche
Alles, was im Bild passiert, sollte hörbar sein: eine Tür, ein Schritt auf Stein, das Klirren von Keramik. Fehlen diese Geräusche, schwebt das Bild. Achte darauf, dass die Geräusche synchron liegen – auch bei generierten Bildern erwarten Zuschauer Kausalität.
Stimme
Sprache funktioniert am besten als Voice-over im Nachhinein. Für Markenidentität lohnt sich eine echte Sprecherin oder ein echter Sprecher. Wichtig ist ein ruhiger Duktus, der nicht gegen die Bilder arbeitet, und eine Tonspur, die über das ganze Video gleich laut bleibt.
Farbangleich und Export
Gleiche am Ende die Einstellungen farblich an, damit kein Clip aus dem Rahmen fällt. Eine leichte Vignette und ein gemeinsamer Kontrastwert bündeln die Sequenz. Exportiere 1080p bis 1440p für Web, 4K nur, wenn die Aufnahmen stabil und scharf sind – hochskalierte Clips zeigen in 4K oft weiche Kanten und Texturrauschen.
Werkzeugwahl: Entscheidungskriterien
Es gibt nicht das beste Werkzeug, sondern nur das passende. Diese Kriterien helfen bei der Auswahl.
- Bildtreue: Wie stark hält das Ergebnis an der Referenz fest? Für Charakterarbeit das wichtigste Kriterium.
- Bewegungsumfang: Manche Modelle sind auf kleine, realistische Bewegungen optimiert, andere auf große Kamerafahrten.
- Länge pro Durchlauf: Sequenzen von drei bis fünf Sekunden sind leichter zu kontrollieren und einzeln neu zu erzeugen.
- Auflösung und Upscaling: Prüfe, ob intern hochskaliert werden kann, statt später mit generischer Schärfung zu arbeiten.
- Steuerbarkeit: Unterstützt das Werkzeug Referenzbilder, Masken, Kameradefinitionen, Start- und Endbilder?
- Iterationsgeschwindigkeit: Praktisch wichtiger als maximale Qualität, weil du viele Varianten brauchst.
- Kostenstruktur: Kalkuliere das Nutzungsvolumen nach Minuten, nicht nach Einzelclips, und plane Ausschuss ein.
- Datenkontrolle: Wo werden deine Referenzen verarbeitet? Bei vertraulichen Motiven ist das ein Ausschlusskriterium.
Für Gesichter und Figuren lohnt sich die Kombination aus einem Bildmodell mit starker Identitätsführung und einem Video-Modell mit zurückhaltender Bewegung. Für Landschaften, Produkte und abstrakte Visuals sind dramatischere Bewegungen möglich. Nichts hindert dich daran, mehrere Werkzeuge zu mischen – solange Farbpalette und Bildaufbau konsistent bleiben, fällt der Wechsel im Schnitt kaum auf.
Typische Fehler und ihre Lösungen
Zu lange Clips auf einmal. Acht Sekunden sind schwer zu kontrollieren. Baue lieber zwei Vier-Sekunden-Einstellungen und schneide sie zusammen.
Überladene Prompts. Wenn fünf Details gleichzeitig im Prompt stehen, widersprechen sie sich. Reduziere auf eine Hauptbewegung, ein Tempo, eine Kameraanweisung.
Unscharfe oder flach ausgeleuchtete Referenzen. Sie produzieren in jeder Einstellung ein anderes Gesicht. Ersetze die Referenz, statt den Prompt zu optimieren.
Gemischte Bildformate. Unterschiedliche Seitenverhältnisse erzwingen Beschnitt und ruinieren die Kadrierung. Vereinheitliche vor dem Rendern.
Bewegte Kamera plus bewegtes Subjekt. Zwei gleichzeitige Bewegungen erzeugen Artefakte. Entscheide dich für eine.
Fehlende Tonatmosphäre. Ohne durchgehende Atmo-Spur wirken Übergänge hart und amateurhaft.
Text im generierten Bild. Buchstaben verformen sich. Setze Text in der Postproduktion.
Keine Ausschussplanung. Wer 30 Sekunden braucht und mit 30 Sekunden Rendervolumen rechnet, kommt nicht aus.
Checkliste vor dem Export
- Sind Gesicht, Kleidung und Frisur in allen Einstellungen identisch?
- Bleiben Farbtemperatur und Lichtrichtung konstant?
- Gibt es in keiner Einstellung Formverzerrung an Händen, Haaren oder Kanten?
- Sind alle Bewegungen eine Sekunde vor Ende der Einstellung abgeschlossen?
- Passt der Schnittrhythmus zur Musik?
- Ist die Lautheit über das gesamte Video gleich, ohne Sprünge?
- Wurde das Endformat korrekt exportiert (Auflösung, Bildrate, Farbraum)?
- Funktioniert der Clip auch ohne Ton, nur als reine Bildfolge?
Punkt acht ist der strengste Test: Wenn die Bildfolge ohne Ton nicht verständlich ist, fehlt visuelle Klarheit.
Drei Praxisprojekte
Produktclip: Keramiktasse, 30 Sekunden, vier Stunden
Sechs Einstellungen als Standbilder: Nahaufnahme der Hand mit Tasse, Draufsicht auf die Glasur, Seitenansicht der Werkbank, Detail der Finger, Weitwinkel der Werkstatt, Abschluss mit fertiger Tasse. Alle mit derselben Farbpalette und demselben Seitenlicht erzeugt, zwei Varianten pro Einstellung. Dann sechs kurze Clips mit ruhigen Bewegungen: rotierende Tasse, fallender Lichtreflex, aufsteigender Staub, langsame Fahrt auf die Hände. Vier Versuche pro Einstellung, also 24 Renders, davon zwölf brauchbar. Danach Schnitt auf einen ruhigen Musikbogen, Werkstattatmosphäre als zweite Spur, drei Geräusche. Am Ende bleiben 30 Sekunden aus rund 30 generierten Clips.
Portraitclip: Handwerkerin, 20 Sekunden, drei Stunden
Drei Referenzwinkel derselben Person, gleiche Kleidung, gleiches Fensterlicht von links. Fünf Einstellungen: Hände bei der Arbeit, langsamer Kopfdreh zur Kamera, Blick aus dem Fenster, Detail der Werkzeuge, ruhiger Abschluss. Bewegung durchgehend minimal, Kamera meist auf Stativ mit leichter Fahrt. Voice-over im Nachhinein, kein generierter Ton. Dieser Clip-Typ ist der schwierigste, weil Gesichter über Sekunden stabil bleiben müssen – kleine Bewegung ist hier entscheidend.
Landschaftsclip: Küstenwanderung, 25 Sekunden, zwei Stunden
Sieben Standbilder aus einer Fotoserie, bei der Wanderung aufgenommen. Bewegung großzügiger: Wolkenzug, Gischt, Wellen, langsamer Aufstieg. Hier funktionieren dramatische Kamerabewegungen, weil keine Identität stabil bleiben muss. Musik trägt den Clip, Atmosphäre liefert Wind und Brandung. Dieses Projekt zeigt: Wo Menschen fehlen, sind die Ergebnisse schneller überzeugend.
Häufige Fragen
Wie viele Referenzbilder brauche ich pro Figur?
Ein klares, frontal ausgeleuchtetes Bild reicht als Basis. Zwei zusätzliche Winkel verbessern die Stabilität deutlich, besonders wenn der Kopf im Clip gedreht wird.
Kann ich Frames aus einem bestehenden Video nutzen?
Ja, einzelne Frames lassen sich als Standbilder extrahieren. Achte darauf, dass sie scharf und nicht bewegungsunscharf sind – sonst übernimmt das Modell die Unschärfe in jede Einstellung.
Warum verändert sich das Gesicht nach drei Sekunden?
Meist ist die Bewegung zu groß oder die Referenz wirkt nur indirekt. Reduziere das Bewegungstempo, verkürze den Clip und formuliere ausdrücklich, dass Gesichtszüge unverändert bleiben.
Wie lang sollten einzelne Clips maximal sein?
Für kontrollierte Ergebnisse drei bis fünf Sekunden. Längere Sequenzen nur bei minimaler Bewegung, etwa fester Kamera mit leichtem Wind.
Lohnt sich ein 4K-Export?
Nur wenn die Aufnahme stabil und scharf ist. Für Web-Zwecke sind 1080p bis 1440p meist die bessere Wahl, weil Skalierungsartefakte dort weniger auffallen.
Wie vermeide ich den typischen KI-Look?
Durch vier Dinge: begrenzte Bewegung, konsistente Farbpalette, echte Tonatmosphäre und einen Schnittrhythmus, der nicht auf jedem Höhepunkt hart schneidet. Der KI-Look entsteht durch überdrehte Bewegung und fehlende Atmosphäre, nicht durch das Modell.
Kann ich Start- und Endbild vorgeben?
Wenn dein Werkzeug das unterstützt, ist es die zuverlässigste Methode für kontrollierte Übergänge, weil Anfangs- und Endzustand festgelegt sind.
Wie viele Varianten sollte ich pro Einstellung rendern?
Mindestens vier. Bei Gesichtern eher sechs bis acht, bei Landschaften reichen drei. Wer zu wenige Varianten erzeugt, entscheidet aus Mangel, nicht aus Qualität.
Fazit
Der Weg von Fotos zu Filmen ist kein technisches Experiment mehr, sondern ein Handwerk mit klaren Regeln. Wer mit starken Standbildern beginnt, Bewegung sparsam und präzise beschreibt, Konsistenz über Referenzen absichert und Ton genauso ernst nimmt wie das Bild, produziert Ergebnisse, die man nicht mehr als generiert erkennt.
Die wichtigste Erkenntnis ist unspektakulär: Qualität entsteht nicht durch das größte Werkzeug, sondern durch den diszipliniertesten Ablauf. Bilder zuerst, Bewegung danach, Ton zum Schluss – und zwischen jedem Schritt eine ehrliche Auswahl statt blindem Weiterverarbeiten.
Was sich nicht automatisch verbessert, ist das Urteilsvermögen: zu wissen, welche Einstellung funktioniert und welche nicht. Genau dieses Urteilsvermögen ist dein eigentlicher Vorsprung – unabhängig davon, welches Werkzeug du heute benutzt. Übe deshalb mit kurzen Sequenzen, dokumentiere, welche Prompts zuverlässig funktionieren, und baue dir eine eigene Referenzbibliothek aus Figuren, Farbpaletten und Kameraeinstellungen auf. Nach zehn Projekten arbeitest du nicht mehr schneller, sondern gezielter – und das ist der Unterschied, den man am fertigen Clip sieht.




