Warum Video-Prompting eine eigene Disziplin ist
Ein Bild-Prompt beschreibt einen eingefrorenen Moment: Wer ist zu sehen, wo, in welchem Licht. Ein Video-Prompt beschreibt zusätzlich, wie sich dieser Moment verändert – über Sekunden hinweg, mit einer Kamera, die sich bewegt, Figuren, die handeln, und Physik, die stimmen muss. Genau diese vierte Dimension macht Prompting für Video deutlich anspruchsvoller als Prompting für Standbilder.
Hinzu kommt: Videomodelle lesen Prompts nicht wie ein Mensch, der eine Beschreibung genießt. Sie gewichten Wahrscheinlichkeiten über Raum und Zeit. Ein Wort wie „dynamisch“ sagt einem Modell fast nichts, weil es unzählige Arten gibt, dynamisch zu sein. „Die Kamera fährt in einem halbkreisförmigen Bogen von links nach rechts um die Figur, während sich der Stoff des Mantels im Wind hebt“ ist dagegen eine Anweisung, aus der sich konkrete Frames ableiten lassen.
Der vielleicht wichtigste Unterschied: Bei Bildern bleibt ein Fehler lokal. Bei Videos pflanzt er sich fort. Eine Hand mit sechs Fingern ist in Frame 1 noch zu übersehen; in Frame 60, wenn dieselbe Hand greift, wird sie zum sichtbaren Bruch. Konsistenz ist deshalb kein Randdetail des Video-Promptings, sondern sein Kern.
Daraus folgt eine praktische Konsequenz: Wer Videos generiert, arbeitet selten mit einem einzigen großen Prompt. Erfolgreiche Abläufe bestehen aus vielen kurzen, klar umrissenen Einstellungen, die einzeln geprüft und erst danach zusammengesetzt werden. Der Prompt ist dann weniger ein Aufsatz als eine Regieanweisung für einen Shot.
Die Anatomie eines starken Video-Prompts
Ein guter Video-Prompt lässt sich in sechs Bausteine zerlegen. Wer sie bewusst besetzt, statt sie dem Zufall zu überlassen, bekommt reproduzierbare Ergebnisse statt Glückstreffer.
Subjekt und Handlung präzise benennen
Beschreibe zuerst, wer oder was zu sehen ist, und dann, was passiert. „Eine Frau in den Vierzigern, kurze graue Haare, sandfarbener Trenchcoat, geht durch einen Bahnhof“ ist ein brauchbares Subjekt. Entscheidend ist, dass die Handlung eine Richtung und ein Ende hat: „Sie geht drei Schritte, bleibt stehen, dreht den Kopf nach links.“ Unbestimmte Verben wie „bewegt sich“ oder „agiert“ überlässt dem Modell zu viel Interpretationsraum.
Umgebung, Materialität und Details
Nenne Ort, Tageszeit und zwei bis drei konkrete Materialien. „Verlassene Industriehalle, Betonboden mit Rissen, rostige Stahlträger, Staub in der Luft“ erzeugt ein anderes Bild als „dunkler Raum“. Materialangaben steuern Reflexionen, Schatten und Textur – genau die Bereiche, in denen generative Videos am schnellsten künstlich wirken.
Kamera, Objektiv und Bewegung
Die Kamera ist im Video-Prompt kein Zusatz, sondern eine Hauptfigur. Formuliere Brennweite, Position, Bewegung und Geschwindigkeit. „35-mm-Objektiv, statische Kamera auf Augenhöhe“ und „Weitwinkel, Kranfahrt von oben nach unten“ ergeben völlig unterschiedliche Clips aus derselben Szene.
Licht und Farbwelt
Licht beschreibt nicht nur Helligkeit, sondern Stimmung. „Weiches Gegenlicht zur goldenen Stunde, warme Hauttöne, leichter Dunst“ versus „hartes Neonlicht von oben, grün-cyanfarbene Schatten“. Wenn du eine konsistente Serie planst, definiere hier eine wiederkehrende Lichtsignatur.
Stil und Technik
Hier entscheidest du, ob der Clip wie 16-mm-Film, wie eine Digitalkamera oder wie eine Animationsstudie aussehen soll. Vorsicht bei widersprüchlichen Stilangaben: „fotorealistisch, anime, dokumentarisch“ gleichzeitig führt fast immer zu einem weichen Mittelmaß.
Zeitliche Marker
Verteile Ereignisse auf die Clipdauer: „In den ersten zwei Sekunden Stillstand, danach setzt die Bewegung ein, am Ende steht die Figur reglos.“ Solche Marker sind besonders wertvoll, wenn du später einen Schnitt auf einen zweiten Shot planst.
Cinematic Language: Von der Beschreibung zur Regieanweisung
Wer aus der Fotografie kommt, beschreibt Bilder. Wer Videos generiert, muss Regie führen. Der Unterschied liegt im Vokabular.
Brennweite und Kamerabewegung
Ein kleines Repertoire genügt: Schwenk (horizontal), Neige (vertikal), Dolly (Fahrt auf das Motiv zu oder von ihm weg), Kran (vertikale Fahrt), Handkamera (unruhig, dokumentarisch), Steadicam (ruhig, gleitend), Orbit (Kreisbewegung um das Motiv). Ergänze immer eine Geschwindigkeit, etwa „langsam“, „gleichmäßig“ oder „ruckartig“. Ohne Tempoangabe wählt das Modell oft eine mittlere, belanglose Bewegung.
Lichtsetzung, Farbtemperatur und Grading
Nenne die Lichtquelle und ihre Richtung, nicht nur ihre Wirkung. „Ein einzelnes Fenster links außerhalb des Bildes, hartes Seitenlicht“ liefert kontrolliertere Ergebnisse als „dramatisches Licht“. Farbtemperatur und Grading gehören in denselben Satz: „kühles Tageslicht, entsättigte Blautöne, leicht erhöhter Kontrast“.
Ton- und Atmosphärenhinweise
Die meisten Videomodelle erzeugen keinen brauchbaren Ton. Trotzdem helfen akustische Hinweise, weil sie im Training mit bestimmten Bildwelten gekoppelt sind: „Stille, nur fernes Tropfen“ ruft andere Bilder hervor als „lauter Marktplatz, Menschenmengen“. Nutze solche Hinweise sparsam und nur, wenn sie die visuelle Atmosphäre wirklich schärfen.
Text-zu-Video, Bild-zu-Video und Video-zu-Video: Wann was passt
Die Eingabeform entscheidet oft mehr über das Ergebnis als der Prompt selbst. Die folgende Übersicht hilft bei der Wahl.
| Ausgangslage | Empfohlene Eingabe | Warum |
|---|---|---|
| Neues Motiv, keine Vorlage | Text zu Video | Maximale Freiheit bei Bewegung und Komposition |
| Bestehendes Charakterdesign | Bild zu Video | Gesicht, Kleidung und Proportionen bleiben erhalten |
| Bestehende Aufnahme verlängern | Video zu Video | Bewegung und Bildaufbau werden fortgeführt |
| Kamerafahrt nachträglich ändern | Video zu Video mit Bewegungsangabe | Ursprungsmaterial bleibt als Anker erhalten |
| Serie mit festem Look | Bild zu Video mit Stilreferenz | Einheitliche Farb- und Lichtsignatur über alle Shots |
Faustregel: Je mehr Kontrolle du über Identität und Look brauchst, desto weiter wandert dein Workflow von reinem Text zu Video hin zu Referenzbildern und schließlich zu Video-zu-Video. Text zu Video bleibt der Modus für Experimente und für Szenen, in denen es kein festes Vorbild gibt.
Konsistenz über mehrere Shots
Ein einzelner Clip ist eine Übung. Eine Sequenz aus fünf Clips ist ein Projekt – und scheitert meist an Konsistenz.
Textuelle Anker statt Wiederholungen
Lege für jede Figur einen kurzen Ankertext fest und verwende ihn wortgleich in jedem Prompt. Vier bis acht Merkmale reichen: Alter, Frisur, Kleidung, ein auffälliges Detail, Körperhaltung. Je öfter du den Anker variierst, desto stärker driftet das Modell. Denselben Anker nutzt du für Orte und Requisiten.
Referenzbilder und Iterationsschleifen
Generiere zuerst ein Standbild, das Figur und Ort exakt zeigt, und verwende es anschließend als Ausgangsbild für alle Shots. Wenn ein Shot abweicht, ändere nur eine Variable pro Durchlauf – Bewegung, Licht oder Kamerawinkel, nie alles gleichzeitig. So erkennst du, welcher Teil des Prompts den Fehler ausgelöst hat.
Orts- und Requisitenbibliothek
Führe eine kleine Textdatei mit beschreibenden Blöcken für jeden Schauplatz und jedes wiederkehrende Objekt. Das klingt banal, spart aber in der Praxis die meiste Zeit, weil du nicht bei jedem neuen Shot dieselben Formulierungen neu erfindest und dabei unbemerkt Details veränderst.
Modellwahl als Entscheidungsproblem
Es gibt kein Modell, das alles gleich gut kann. Die Wahl hängt von der konkreten Anforderung ab.
Spezialisten und Generalisten
Manche Modelle sind stark bei realistischer Physik und langen Einstellungen, andere bei stilisierten, schnellen Schnitten, wieder andere bei der Konsistenz von Gesichtern über mehrere Shots. Generalisten sind bequem für erste Entwürfe, Spezialisten für die Endausgabe. Ein bewährter Ablauf: Skizze mit einem schnellen Generalisten, Endproduktion mit dem Spezialisten, der die kritische Eigenschaft am besten beherrscht.
Kriterienkatalog für die Auswahl
Prüfe jedes Modell gegen sieben Fragen: Wie glaubwürdig ist Bewegung? Wie stabil bleiben Gesichter? Wie gut funktioniert Text im Bild? Wie lang ist die maximale Cliplänge? Welche Auflösung und Bildrate sind möglich? Wie stark lässt sich ein Startbild erzwingen? Und wie gut reagiert das Modell auf Kameraanweisungen? Bewerte jede Frage mit eins bis fünf für dein Projekt und nicht allgemein – ein Modell, das bei Gesichtern schwächelt, ist für Landschaftsaufnahmen irrelevant.
Umgang mit Generierungskontingenten
Die meisten Dienste begrenzen, wie viele Clips pro Zeitraum entstehen. Behandle dieses Kontingent wie Filmmaterial: Plane die Shots vorher auf Papier, erzeuge einen ersten Durchlauf mit niedriger Auflösung, und generiere erst nach der Auswahl in hoher Qualität. Wer unvorbereitet experimentiert, verbraucht sein Kontingent für Ausschuss statt für Varianten.
Der praktische Workflow: Vom Skript zum fertigen Clip
Schritt 1: Sequenz verschriftlichen
Schreibe die Szene als kurze Shot-Liste. Pro Zeile: Shotnummer, Dauer, Motiv, Handlung, Kamerabewegung. Zwei bis vier Sekunden pro Shot sind für generative Modelle ein realistischer Rahmen.
Schritt 2: Referenzbild bauen
Erzeuge für jeden Schauplatz und jede Figur ein Standbild. Prüfe Gesicht, Kleidung, Lichtrichtung und Umgebung. Erst wenn dieses Bild sitzt, lohnt der Wechsel zum Video.
Schritt 3: Prompt pro Shot formulieren
Setze die sechs Bausteine in eine feste Reihenfolge: Subjekt, Handlung, Umgebung, Kamera, Licht, Stil. Halte die Reihenfolge über alle Shots hinweg gleich, das erleichtert die Fehlersuche erheblich.
Schritt 4: Testdurchlauf in niedriger Qualität
Generiere alle Shots einmal schnell. Ziel ist nicht Schönheit, sondern die Prüfung von Bewegung und Komposition. Markiere jeden Shot, bei dem Richtung, Tempo oder Blickrichtung nicht stimmen.
Schritt 5: Gezielt nachsteuern
Ändere pro Durchlauf genau eine Variable. Wenn die Figur zu schnell geht, passe nur das Tempo an, nicht gleichzeitig auch die Kamera. Notiere, welche Änderung gewirkt hat – nach zwanzig Shots ist die Erinnerung unzuverlässig.
Schritt 6: Endausgabe und Schnitt
Generiere die ausgewählten Shots in hoher Qualität, prüfe die Übergänge und schneide in der Schnittsoftware nach. Achte darauf, dass aufeinanderfolgende Shots unterschiedliche Brennweiten oder Bewegungsrichtungen haben, sonst wirkt die Sequenz trotz korrekter Bilder flach.
Typische Fehler und wie du sie vermeidest
Zu viele Informationen in einem Prompt. Modelle mitteln widersprüchliche Angaben. Kürze auf das, was für diesen Shot wirklich zählt.
Fehlende Bewegungsrichtung. Ohne Richtungsangabe springt das Motiv oft unmotiviert im Bild. Ergänze „von links nach rechts“, „nach vorne aus dem Bild heraus“ oder ähnlich.
Widersprüchliche Stilangaben. Fotorealismus und Cartoon gleichzeitig ergeben weder das eine noch das andere. Entscheide vor dem ersten Prompt.
Figur ohne Ankertext. Wer bei jedem Shot neu beschreibt, erhält jedes Mal eine andere Person. Der Anker ist Pflicht.
Alles auf einmal ändern. Wenn die Änderung mehrerer Variablen gleichzeitig zu einem besseren Clip führt, weiß niemand, warum. Eins nach dem anderen.
Kamerabewegung plus starke Motivbewegung. Beides zusammen überfordert viele Modelle. Entweder die Kamera bewegt sich, oder das Motiv – nur in seltenen Fällen beides gleichzeitig.
Zu lange Clips erzwingen. Über die vom Modell zuverlässig getragene Länge hinaus entstehen Verzerrungen. Lieber zwei kurze Shots als ein langer, der in der Mitte zerfällt.
Prompt-Vorlagen zum Kopieren
Ruhige Charakteraufnahme
„[Ankertext], sitzt an einem Holztisch, hebt langsam eine Tasse, 50-mm-Objektiv, statische Kamera auf Augenhöhe, weiches Seitenlicht von links, warme Töne, entsättigter Hintergrund, fotorealistisch.“
Dynamische Außenaufnahme
„[Ankertext], geht einen nassen Asphaltweg entlang, gleichmäßiger Schritt, langsamer Dolly von vorne, 35-mm-Objektiv, bedeckter Himmel, kühles Tageslicht, Reflexionen in Pfützen, dokumentarischer Look.“
Produktdetail
„Metallflasche auf Steinsockel, dreht sich einmal vollständig um die eigene Achse, Orbit-Kamera in Brusthöhe, gleichmäßige Geschwindigkeit, Studiolicht von oben und hinten, harte Kantenlichter, dunkler Hintergrund, Werbefilm-Ästhetik.“
Ortsaufnahme ohne Figur
„Leerer Flur in einem alten Verwaltungsgebäude, Staub in der Luft, langsamer Schwenk nach rechts, 24-mm-Objektiv, Tageslicht durch hohe Fenster, entsättigte Grün- und Grautöne, ruhige Atmosphäre.“
Jede Vorlage ist ein Gerüst. Ersetze die Klammer durch deinen Ankertext und variiere nur die Bausteine, die für den Shot relevant sind.
Häufige Fragen
Wie lang sollte ein Video-Prompt sein?
Für die meisten Modelle liegt der brauchbare Bereich zwischen 30 und 80 Wörtern. Darunter fehlen entscheidende Angaben, darüber mitteln die Modelle widersprüchliche Signale. Wenn du mehr Kontext brauchst, verteile ihn auf mehrere Prompts für mehrere Shots.
Hilft es, Prompts in englischer Sprache zu schreiben?
Oft ja, weil das Trainingsmaterial vieler Modelle überwiegend englischsprachig ist. Kamera- und Lichtbegriffe haben im Englischen zudem etablierte Entsprechungen. Teste beide Varianten mit demselben Motiv und vergleiche – der Unterschied ist modellabhängig.
Warum sehen meine Clips künstlich aus?
Meistens aus drei Gründen: zu weiche Bewegung, zu wenig Materialdetails und fehlende Lichtrichtung. Ein einzelnes Seitenlicht mit benannten Reflexionsflächen hebt die Bildqualität stärker als jede Stilangabe.
Wie bekomme ich dieselbe Figur in mehreren Shots?
Über einen wortgleichen Ankertext plus ein Referenzbild aus einem Bildgenerator. Wechsle zwischen den Shots nie gleichzeitig Anker und Modell – sonst ist unklar, was die Abweichung verursacht hat.
Wie viele Varianten sollte ich pro Shot erzeugen?
Plane drei bis fünf. Die erste Variante ist fast immer ein Zufallstreffer, die zweite und dritte zeigen die Bandbreite, und ab der vierten erkennst du, welche Formulierung tatsächlich stabil wirkt.
Kann ich Prompt-Elemente wiederverwenden?
Ja, und du solltest. Baue dir Textblöcke für Figuren, Orte, Licht und Kamerastile, die du per Copy-and-Paste kombinierst. Das spart Zeit und ist der einfachste Weg zu visueller Einheitlichkeit.
Fazit: Regie schlägt Formulierungskunst
Video-Prompting ist kein Wettbewerb um die schönste Beschreibung. Es ist die Kunst, eine Einstellung so zu zerlegen, dass ein Modell sie ohne Interpretationsspielraum abbilden kann. Sechs Bausteine, ein fester Ankertext, ein Referenzbild pro Figur und die Regel, immer nur eine Variable zu ändern – damit ist der größte Teil der Ergebnisqualität bereits gesichert.
Der Rest ist Handwerk: kurze Shots statt langer, Bewegung mit Richtung und Tempo, Licht mit Quelle statt Stimmungswort, und eine ehrliche Prüfung, welches Modell für welche Aufgabe taugt. Wer so arbeitet, produziert nicht mehr Zufallsclips, sondern Sequenzen, die sich schneiden lassen. Und genau dort beginnt Film.


