Wer regelmäßig mit Text-zu-Video-Modellen arbeitet, kennt dieses Muster: Man tippt eine Beschreibung, drückt auf Generieren und bekommt einen Clip, der ungefähr stimmt – aber nicht wirklich. Die Figur bewegt sich seltsam, die Kamera macht etwas Unerwartetes, das Licht kippt in der zweiten Hälfte, und der Stil erinnert an eine Mischung aus drei verschiedenen Filmen. Das Modell war nicht zu schwach. Der Prompt war zu ungenau.
Prompt Engineering für Video ist deshalb weniger eine Sammlung von Tricks als ein Handwerk. Es geht darum, ein bewegtes Bild so zu beschreiben, dass ein Modell daraus eine räumlich und zeitlich stimmige Einstellung ableiten kann. Dieser Leitfaden zeigt, wie Videoprompts aufgebaut werden, welche Bausteine wirklich etwas verändern, wie man Konsistenz über mehrere Einstellungen erzeugt und welche Fehler sich mit wenigen Anpassungen vermeiden lassen.
Warum Videoprompts anders funktionieren als Bildprompts
Ein Bildprompt beschreibt einen Zustand. Ein Videoprompt beschreibt einen Zustand und dessen Veränderung. Genau hier entstehen die meisten Probleme, weil Modelle aus einer kurzen Beschreibung sehr unterschiedliche Bewegungsinterpretationen ableiten können.
Wenn ein Bildprompt lautet „Frau im roten Mantel an einem Bahnhof, warmes Licht“, ist die Aufgabe klar umrissen: eine plausible Standaufnahme. Bei Video kommt sofort eine zweite Ebene hinzu. Geht sie? Steht sie? Dreht sie sich um? Fährt die Kamera mit? Ist der Bahnhof voll oder leer? Bewegt sich der Zug im Hintergrund? Je weniger davon spezifiziert ist, desto mehr entscheidet das Modell selbst – und Modelle entscheiden selten so, wie man es im Kopf hatte.
Dazu kommen technische Eigenheiten. Videomodelle müssen zeitliche Kohärenz halten: Gesichter dürfen sich nicht verschieben, Kleidung darf nicht die Farbe wechseln, Hintergründe dürfen nicht zerfließen. Jede zusätzliche Bewegung im Prompt erhöht den Rechenaufwand und die Wahrscheinlichkeit von Artefakten. Ein Prompt mit drei Figuren, zwei Kamerabewegungen und einem aufwendigen Effekt ist daher nicht automatisch beeindruckender als ein ruhiger Prompt mit einer klaren Aktion.
Praktisch bedeutet das: Videoprompts brauchen Prioritäten. Man sollte wissen, was in der Einstellung absolut sein muss und was variabel bleiben darf. Wer fünf Dinge gleichzeitig erzwingt, bekommt oft fünf halb erfüllte Dinge.
Die Bausteine eines belastbaren Videoprompts
Ein guter Videoprompt ist strukturiert, aber nicht überladen. Bewährt hat sich eine Reihenfolge, die vom Inhalt über die Inszenierung bis zur Technik führt. Die Reihenfolge selbst ist weniger wichtig als die Vollständigkeit der Kategorien.
Subjekt und Handlung
Das Subjekt ist die Hauptfigur oder das Hauptobjekt. Wichtig sind erkennbare Merkmale, die über die gesamte Einstellung konstant bleiben sollen: Alter, Kleidung, Frisur, ein einziges markantes Detail. Statt „eine Frau“ besser „eine Frau Ende dreißig, kurze dunkle Haare, karierte Jacke“. Das Modell braucht Ankerpunkte, an denen es sich über die Dauer festhalten kann.
Die Handlung sollte eine einzige, klar begrenzte Aktion sein. „Sie geht langsam auf die Kamera zu und schaut kurz über die Schulter“ funktioniert. „Sie geht, telefoniert, lacht und winkt“ überfordert die meisten Modelle innerhalb eines kurzen Clips. Eine gute Faustregel: eine Hauptaktion pro Einstellung, maximal eine Nebenbewegung.
Umgebung und Zeitgefühl
Orte haben eine Stimmung, die sich über Details transportieren lässt. Statt „Büro“ lieber „offenes Büro am frühen Morgen, leere Kaffeetassen, Sonnenlicht fällt schräg durch Jalousien“. Solche Elemente liefern nicht nur Atmosphäre, sie geben dem Modell auch Aufgaben für den Hintergrund – und verhindern, dass leerer Raum mit zufälligen Requisiten gefüllt wird.
Zeitangaben helfen zusätzlich. „Goldene Stunde“, „kurz nach Sonnenaufgang“, „Regennacht“ steuern Lichtfarbe und Kontrast zuverlässiger als allgemeine Adjektive wie „schön“ oder „stimmungsvoll“.
Kamera, Bewegung und Brennweite
Kameraanweisungen sind der stärkste Hebel im Videoprompt, weil sie bestimmen, wie sich das Bild im Raum verhält. Nützliche Begriffe:
- Feste Kamera / Stativ: ruhig, dokumentarisch, ideal für Dialogszenen.
- Langsamer Schwenk (Pan): horizontal, gut für Landschaften und Räume.
- Dolly In / Push In: Kamera fährt auf das Subjekt zu, erzeugt Nähe und Spannung.
- Crane / Drohne: hebt oder senkt sich, gut für Establishing Shots.
- Handkamera: subtile Unruhe, wirkt reportagehaft.
- Tracking Shot: Kamera folgt einer Bewegung, etwa einer gehenden Person.
Ebenso wichtig ist die Brennweite. „Weitwinkel“ vergrößert den Raum und betont die Umgebung, „35 mm“ wirkt natürlich, „85 mm“ komprimiert den Hintergrund und isoliert Gesichter. Wer beides kombiniert – Bewegung plus Optik – bekommt deutlich kontrolliertere Ergebnisse als mit reiner Stilbeschreibung.
Licht, Farbe und Material
Licht beschreibt man am besten über Richtung und Qualität: „weiches Seitenlicht von links“, „harter Gegenlichtstrahl“, „diffuses Neonlicht von oben“. Farbe beschreibt man über eine Palette: „kühle Blautöne mit warmen Hauttönen“, „entsättigt mit einem roten Akzent“. Material beschreibt man über Textur: „matte Baumwolle“, „nasser Asphalt“, „poliertes Metall“. Diese drei Ebenen zusammen erzeugen visuelle Glaubwürdigkeit, ohne dass man auf Modellnamen oder Presets verweisen muss.
Negativanweisungen ohne Kollateralschaden
Negativprompts sind nützlich, aber sie sind kein Haushaltsreiniger. Wer zwanzig Verbote auflistet, verwirrt das Modell eher, als es zu führen. Der Grund: Viele Modelle verarbeiten Verbote nicht als Ausschluss, sondern als zusätzliche Kontextinformation. Nennt man „kein Wasser“, taucht erstaunlich oft Wasser auf.
Effektiver sind wenige, gezielte Ausschlüsse, die typische Artefakte adressieren:
- unerwünschte Texturfehler wie „verschwommene Hände“, „verzerrte Gesichter“, „flimmernde Kanten“
- unerwünschte Bildfehler wie „Doppelbelichtung“, „Geisterbilder“, „überlagerte Gliedmaßen“
- unerwünschte Stilrichtungen wie „Cartoon“, „3D-Render“, „Wasserzeichen“
Alles andere sollte man positiv formulieren. Statt „keine schnelle Bewegung“ besser „ruhige, langsame Bewegung“. Statt „nicht überbelichtet“ besser „ausgewogene Belichtung mit erhaltenen Schatten“. Positive Anweisungen geben eine Richtung, Verbote nur eine Grenze.
Konsistenz über mehrere Einstellungen
Sobald ein Projekt mehr als einen Clip umfasst, wird Konsistenz zum zentralen Problem. Drei Werkzeuge helfen.
Referenzbilder und Keyframes
Viele Modelle akzeptieren ein Startbild, ein Endbild oder beides. Damit lässt sich eine Einstellung exakt zwischen zwei Zuständen interpolieren. Der Trick: Das Startbild definiert Aussehen und Licht, das Endbild definiert die Bewegung, die dazwischen stattfinden soll. Wer beide Bilder aus derselben Quelle oder demselben Stilrahmen ableitet, reduziert Stilbrüche erheblich.
Für Figuren bedeutet das: ein sauberes Referenzbild in neutraler Pose, klarer Beleuchtung und ohne ablenkenden Hintergrund. Aus diesem Referenzbild werden alle weiteren Einstellungen abgeleitet.
Ein Charakterblock, der immer funktioniert
Statt die Figur in jedem Prompt neu zu beschreiben, lohnt sich ein fester Textbaustein, der wortgleich in jeden Prompt kopiert wird. Er enthält vier bis sechs Merkmale: Alter, Haarfarbe und -länge, Kleidung, ein Accessoire, ein Stilmerkmal. Dieser Block bleibt unverändert, während Umgebung und Kamera pro Einstellung wechseln.
Das klingt banal, ist aber der zuverlässigste Konsistenztrick überhaupt. Modelle reagieren stark auf wiederkehrende Formulierungen. Sobald man „dunkle Locken“ einmal zu „dunklen Locken“ und einmal zu „schwarzen Haaren“ macht, driftet das Aussehen.
Sequenzdenken: Vom Einzelclip zur Szene
Einzelne Clips sind selten das Ziel. Wer eine Sequenz baut, sollte nicht jeden Clip isoliert planen, sondern die Einstellung als Teil eines Ablaufs denken. Drei Fragen helfen vor jedem Prompt:
- Was ist der visuelle Auftrag dieser Einstellung – Orientierung, Emotion, Information?
- Welche Information muss aus der vorherigen Einstellung übernommen werden?
- Welche Bewegung führt natürlicherweise in die nächste Einstellung?
Aus diesen Antworten entsteht eine ruhige Dramaturgie: eine weite Einstellung zum Etablieren, eine mittlere Einstellung für die Handlung, eine nahe Einstellung für die Emotion. Kamera und Brennweite sollten sich dabei nicht wiederholen, sonst wirkt der Schnitt monoton, obwohl jede Einstellung für sich gut aussieht.
Für lange Sequenzen hat sich Prompt Chaining bewährt: Die letzte brauchbare Einstellung wird zur visuellen Referenz für die nächste. So wandert der Look durch das gesamte Projekt, statt bei jedem Generieren neu zu entstehen.
Modellwahl als Entscheidungskriterium
Verschiedene Engines haben unterschiedliche Stärken, und ein Prompt, der in einem Modell brilliert, kann in einem anderen scheitern. Statt jedes Tool gleichzeitig zu testen, ist eine kleine Matrix sinnvoll:
- Realistische Bewegung von Menschen: Runway, Kling
- Kamera-Kontrolle und präzise Fahrten: Luma, PixVerse
- Schnittnahe Kurzclips mit starkem Look: Pika
- Komplexe Szenen mit vielen Elementen: aktuelle Flaggschiff-Modelle, sofern verfügbar
Wichtig ist, die Entscheidung nicht nach Prestige, sondern nach Anforderung zu treffen. Braucht die Szene eine kontrollierte Kamerafahrt, ist ein Modell mit expliziten Kameraparametern die bessere Wahl. Steht eine schauspielerische Nuance im Vordergrund, gewinnt das Modell mit der stabileren Gesichts- und Körperkohärenz.
Ein zweiter Faktor ist die Prompt-Syntax. Manche Modelle verstehen Fließtext, andere reagieren besser auf kompakte Parameterzeilen. Wer häufig wechselt, sollte Prompts so schreiben, dass sie sich leicht umformatieren lassen: Inhalt zuerst, Technik danach, Negativblock am Ende.
Ein Workflow in sieben Schritten
Dieser Ablauf hat sich für wiederkehrende Arbeit bewährt und lässt sich auf Werbeclips, Kurzfilme, Social-Media-Serien und Erklärvideos anwenden.
1. Referenz definieren. Ein Standbild oder ein Stilrahmen legt Look, Licht und Farbpalette fest. Ohne Referenz wird jeder Clip ein eigener Film.
2. Prompt-Gerüst schreiben. Subjekt, Handlung, Umgebung, Kamera, Licht in dieser Reihenfolge. Noch ohne Details, nur die Struktur.
3. Prioritäten markieren. Zwei Dinge festlegen, die unbedingt stimmen müssen – meist Figur und Kamerabewegung. Alles andere bleibt verhandelbar.
4. Kurz generieren. Erst eine kurze Dauer testen, um Bewegung und Komposition zu prüfen. Lange Clips zuerst zu rendern kostet nur Zeit.
5. Eine Variable pro Iteration ändern. Wenn drei Dinge gleichzeitig angepasst werden, ist unklar, was gewirkt hat. Kamerabewegung zuerst, dann Licht, dann Details.
6. Negativblock ergänzen. Erst wenn ein konkretes Artefakt auftritt, nicht vorbeugend. Ein gezielter Ausschluss pro Problem.
7. Nach erfolgreicher Einstellung einfrieren. Den funktionierenden Prompt speichern und als Basis für die nächste Einstellung kopieren. So entsteht eine Prompt-Bibliothek, die mit jedem Projekt wertvoller wird.
Der wichtigste Punkt ist Schritt fünf. Die meisten schlechten Ergebnisse entstehen nicht durch fehlendes Wissen, sondern durch unkontrolliertes Ändern vieler Variablen gleichzeitig.
Typische Fehler und ihre Gegenmittel
Zu viele Adjektive. „Wunderschön, episch, atemberaubend, cinematisch“ beeinflusst das Bild kaum. Konkrete Angaben zu Licht, Objektiv und Bewegung dagegen sehr.
Widersprüchliche Anweisungen. „Statische Kamera mit dynamischem Schwenk“ kann nicht beides sein. Widersprüche führen zu flackernden Ergebnissen.
Fehlende Zeitangabe. Ohne Hinweis, ob eine Bewegung langsam oder schnell sein soll, wählt das Modell zufällig. „Langsam“, „gleichmäßig“, „mit einer kurzen Pause“ sind wirksame Steuerungen.
Überladene Szenen. Fünf Figuren, drei Aktionen und ein Effekt in vier Sekunden führen fast immer zu Verschmelzungen. Reduzieren bringt mehr Qualität als hinzufügen.
Stilbeschreibung ohne Technik. „Cinematisch“ allein ist kein Auftrag. Zusammen mit „35 mm, flache Schärfentiefe, weiches Seitenlicht“ wird daraus eine umsetzbare Anweisung.
Ignorieren des Seitenverhältnisses. Vertikale Formate und Breitbild verlangen unterschiedliche Kompositionen. Ein Prompt, der auf Breitbild ausgelegt ist, wirkt im Hochformat oft leblos.
Prompt-Vorlagen zum Kopieren
Die folgenden Gerüste lassen sich direkt anpassen. Platzhalter in eckigen Klammern ersetzen, Aufbau beibehalten.
Ruhige Charakterszene
[Figur mit drei Merkmalen] sitzt in [Ort mit zwei Details]. Sie [eine langsame Handlung]. Feste Kamera, 50 mm, flache Schärfentiefe. Weiches Seitenlicht von links, warme Palette. Ruhige, gleichmäßige Bewegung.
Establishing Shot
Weite Ansicht von [Ort] zur [Tageszeit]. Keine Personen. Langsamer Dolly In, 24 mm, tiefe Schärfe. [Lichtrichtung], [Farbpalette]. Ruhige Kamerafahrt über [Dauer] Sekunden.
Bewegte Handlung
[Figur] [klare Aktion] in [Umgebung]. Tracking Shot von rechts, 35 mm, Handkamera mit leichter Unruhe. Hartes Gegenlicht, entsättigte Palette mit einem roten Akzent. Gleichmäßiges Tempo, keine Schnitte.
Produktaufnahme
[Produkt] auf [Untergrund] in [Umgebung]. Langsamer Orbit um das Objekt, 85 mm, flache Schärfentiefe. Gerichtetes Licht von oben, saubere Reflexe, matte Textur. Sehr langsame, gleichmäßige Bewegung.
FAQ
Wie lang sollte ein Videoprompt sein?
Für die meisten Modelle liegt der brauchbare Bereich zwischen 40 und 90 Wörtern. Kürzere Prompts geben dem Modell zu viel Freiheit, deutlich längere verwässern die Prioritäten. Entscheidend ist nicht die Länge, sondern die Informationsdichte.
Sind Kamerabegriffe wie „Dolly In“ wirklich nötig?
Nicht zwingend, aber sie erhöhen die Vorhersagbarkeit erheblich. Wenn man eine bestimmte Bewegung im Kopf hat, ist es fast immer besser, sie explizit zu nennen, als sie zu umschreiben. Alternative Formulierungen wie „die Kamera fährt langsam auf die Person zu“ funktionieren ebenso.
Warum ändert sich mein Charakter von Clip zu Clip?
Meist, weil die Beschreibung variiert. Ein fester, wortgleicher Charakterblock plus ein konsistentes Referenzbild lösen das Problem in den meisten Fällen. Zusätzlich hilft es, die Kleidung sehr konkret zu beschreiben, da Modelle bei Textilien schneller driften.
Wie viele Negativanweisungen sind sinnvoll?
Drei bis fünf, jeweils auf ein konkretes Problem bezogen. Wer mehr auflistet, riskiert, dass einzelne Ausschlüsse als Motiv interpretiert werden. Negativprompts sind ein Korrekturwerkzeug, kein Grundgerüst.
Funktioniert derselbe Prompt in jedem Modell?
Nur grob. Der inhaltliche Kern bleibt gleich, aber Syntax und Schwerpunkte unterscheiden sich. Manche Modelle reagieren stark auf Kameraparameter, andere auf Stilbeschreibungen. Deshalb lohnt sich ein umformatierbares Prompt-Gerüst statt fertiger Einzeiler.
Wie gehe ich mit flackernden Details um?
Zuerst die Bewegung reduzieren, dann die Dauer des Tests kürzen. Flackern entsteht häufig durch zu viele gleichzeitige Veränderungen im Bild. Wenn das nicht hilft, ein Referenzbild einsetzen, das die kritischen Details bereits zeigt.
Brauche ich für jede Einstellung einen neuen Prompt?
Nein. Ein Basis-Prompt mit ausgetauschten Variablen für Umgebung und Kamera reicht meist aus. Das spart Zeit und sichert den visuellen Zusammenhang der Sequenz.
Wie dokumentiere ich gute Ergebnisse?
Speichere den exakten Prompt zusammen mit Modell, Seitenverhältnis und Dauer. Diese drei Angaben entscheiden oft darüber, ob ein Prompt später reproduzierbar ist. Eine einfache Tabelle oder ein Textdokument pro Projekt genügt.
Fazit
Prompt Engineering für Video ist kein Wettbewerb um die kreativsten Wörter, sondern um Klarheit. Wer Subjekt, Handlung, Umgebung, Kamera und Licht sauber trennt, konsistente Textbausteine verwendet und pro Durchlauf nur eine Variable ändert, bekommt reproduzierbar brauchbare Clips. Die Technik dahinter ist unspektakulär, aber sie ist genau der Unterschied zwischen einem Ergebnis, das man verwerfen muss, und einer Einstellung, die direkt in den Schnitt wandert.

