Warum Video-Prompts eine eigene Disziplin sind
Ein Bildprompt beschreibt einen Zustand: Motiv, Licht, Perspektive, Stil. Ein Videoprompt beschreibt eine Veränderung. Genau daraus entsteht die Schwierigkeit. Das Modell muss nicht nur ein Gesicht konsistent halten, sondern auch entscheiden, wie sich dieses Gesicht über sechs Sekunden bewegt, wie sich der Stoff einer Jacke verzieht, wie der Schatten wandert, wenn die Figur den Kopf dreht. Jede zusätzliche Information im Prompt erhöht die Zahl der möglichen Interpretationen – und damit die Zahl der Wege, auf denen das Ergebnis kippen kann.
Daraus folgen drei Regeln, die sich durch diesen Artikel ziehen:
- Ein Clip, eine Handlung. Wer zwei Bewegungen in einen Prompt schreibt, bekommt oft eine halbe Bewegung und ein Artefakt.
- Kürze schlägt Vollständigkeit. Acht Sekunden sind kein Kurzfilm. Modelle belohnen Prompts, die eine klare Idee priorisieren, statt alles gleichzeitig zu wollen.
- Kontrolle durch Wiederholung. Gute Videoergebnisse entstehen selten beim ersten Versuch. Sie entstehen durch kontrollierte Varianten: einen Baustein ändern, alles andere gleich lassen.
Wer diese drei Punkte verinnerlicht, braucht kein Deep-Learning-Wissen, um brauchbare Ergebnisse zu produzieren. Der Rest ist Handwerk – und Handwerk lässt sich in Bausteine zerlegen.
Die Anatomie eines guten Video-Prompts
Ein belastbarer Videoprompt besteht aus sechs Bausteinen. Du musst nicht immer alle füllen, aber du solltest wissen, welchen du bewusst weglässt.
Subjekt und Handlung
Das Subjekt trägt die Aufmerksamkeit. Meistens sollte es genau eines sein. „Eine Radfahrerin in gelber Regenjacke“ funktioniert. „Eine Menschenmenge, in der eine Radfahrerin auffällt“ funktioniert schlechter, weil das Modell die Aufmerksamkeit verteilt und am Ende weder Menge noch Radfahrerin sauber rendert.
Die Handlung ist ein Verb mit Tempo, Richtung und einem Detail. „Geht“ ist schwächer als „tritt langsam durch eine tiefe Pfütze und hält kurz inne“. Konkrete Verben liefern dem Modell Ankerpunkte für Bewegung: Ausgangsposition, Bewegungsrichtung, Endpunkt.
Umgebung und Atmosphäre
Ort, Tageszeit, Wetter und Hintergrundaktivität bestimmen, wie glaubwürdig eine Szene wirkt. Der wichtigste Trick: beschreibe nicht nur, was hinten ist, sondern wie es sich bewegt. „Eine belebte Kreuzung bei Nieselregen mit unscharfen Scheinwerfern im Hintergrund“ gibt dem Modell eine Aufgabe, die es gut lösen kann – Tiefe durch Bewegung, nicht durch Textur.
Licht und Farbwelt
Licht ist der stärkste Qualitätshebel, den du hast. Ein präziser Lichtbegriff hebt ein mittelmäßiges Ergebnis auf ein anderes Niveau: weiches Nordlicht durch ein Fenster, warmes Gegenlicht zur blauen Stunde, harte Neonreflexe auf nassem Asphalt, ein einzelner praktischer Lichtkörper im Bild. Vermeide widersprüchliche Angaben wie „dunkle Nacht“ und „strahlende Mittagssonne“ im selben Prompt.
Kamera und Bewegung
Hier trennt sich Anfänger- von Fortgeschrittenenarbeit. Beschreibe die Kamera wie eine Person mit einer Kamera: Position (Augenhöhe, Bodenperspektive, Aufsicht), Brennweite (Weitwinkel, 50 mm, Tele), Bewegung (statisch, langsamer Schwenk, Dolly nach vorn, Tracking seitlich, Drohnenflug) und Tempo (langsam, ruhig, gleichmäßig). Ein Satz reicht – aber er muss eindeutig sein.
Stil, Optik und technische Parameter
Hier gehören Look-Begriffe hin: Filmkorn, analogen Look, dokumentarische Handkamera, klare digitale Schärfe, Seitenverhältnis, Bildrate, Farbpalette. Wichtig: Stilbegriffe sind keine Deko. Sie verändern oft stärker als das Motiv selbst, weil sie die gesamte Bildcharakteristik steuern.
Reihenfolge und Gewichtung
Modelle gewichten, was früh im Prompt steht. Die Reihenfolge Subjekt → Handlung → Umgebung → Licht → Kamera → Stil ist eine solide Standardordnung. Halte den Prompt zwischen 40 und 80 Wörtern. Alles darüber verwässert, alles darunter lässt Lücken, die das Modell mit Zufall füllt.
Prompt-Vorlagen für wiederkehrende Aufgaben
Vorlagen sind keine Schablone für Kreativität, sondern eine Abkürzung zum ersten brauchbaren Ergebnis. Vier Grundmuster decken den Großteil aller Aufgaben ab.
Produkt- und Werbeclip
Nahaufnahme eines [Produkt] auf [Untergrund], [Handlung: rotiert langsam / wird von einer Hand aufgestellt], [Licht: weiches Studiolicht mit klarer Kante], [Kamera: 85 mm, statisch, minimale Kamerafahrt nach vorn], [Stil: klare Werbeoptik, saubere Farben, keine Ablenkung im Hintergrund]
Der entscheidende Zusatz ist „keine Ablenkung im Hintergrund“. Ohne diese Anweisung baut das Modell gern Requisiten ein, die vom Produkt ablenken.
Landschaft und Reise
Weite [Landschaft] bei [Tageszeit], [Wetter und Bewegung: Nebel zieht über den Grat], [Licht: warmes Streiflicht von rechts], [Kamera: Drohnenflug nach vorn, ruhig, gleichmäßig], [Stil: filmisch, natürliche Farben, feines Korn]
Landschaften sind dankbar, weil das Modell keine menschliche Anatomie halten muss. Nutze das für Tests: Wenn ein Landschaftsclip schon wackelt, liegt es meist an zu viel Bewegung im Prompt.
Porträt und Mode
Halbnahaufnahme einer [Person mit zwei konkreten Merkmalen], die [kleine, präzise Handlung] ausführt, [Umgebung], [Licht], [Kamera: 50 mm, Handkamera, leichtes Atmen der Kamera], [Stil: analoger Look, warme Hauttöne]
Porträts sind die Königsdisziplin. Reduziere Bewegung auf das Minimum, das die Szene lebendig hält: Blinzeln, eine Kopfdrehung, ein Windstoß im Haar.
Abstrakte Titelsequenz
[Form oder Material] in [Bewegung], auf [Hintergrund], [Licht], [Kamera: langsame Rotation], [Stil: minimalistisch, hoher Kontrast, keine Figuren]
Abstrakte Clips sind ideal für Intros, Zwischenkarten und Hintergründe. Sie funktionieren auch dann, wenn ein realistischer Clip zu viele Fehler zeigt.
Zero-Shot, Few-Shot und Referenzbilder
Zero-Shot: der schnelle Weg zum Referenzpunkt
Zero-Shot bedeutet: ein Prompt, kein Beispiel, keine Referenz. Das ist der richtige Startpunkt, weil du damit die Grundstimmung der Szene prüfst, bevor du Zeit in Details investierst. Generiere drei bis fünf Varianten mit gleichem Prompt und beobachte, welche Bausteine stabil durchkommen und welche bei jedem Durchlauf neu gewürfelt werden.
Few-Shot: Beispiele als Beschleuniger
Few-Shot heißt, du gibst dem Modell Muster. Das kann ein Beispielprompt mit Beschreibung des gewünschten Ergebnisses sein oder ein Referenzclip, dessen Look du beschreibst. Besonders effektiv ist eine kleine Tabelle im Kopf: „Wie in Beispiel A, aber mit Licht aus Beispiel B.“ So kannst du zwei Eigenschaften kombinieren, ohne den ganzen Prompt neu zu schreiben.
Referenzbilder und Multi-Image-Ansätze
Wenn ein Modell Bild-zu-Video unterstützt, wird das Referenzbild zum Anker. Es legt Figur, Farbwelt und Komposition fest. Der Prompt beschreibt dann nur noch Bewegung, Kamera und Lichtveränderung – nicht mehr das Aussehen. Das ist die wichtigste Umstellung für Einsteiger: Mit Referenzbildern wird der Prompt kürzer, nicht länger.
Zwei Bilder lassen sich oft kombinieren: eines für die Figur oder das Produkt, eines für Umgebung oder Set. Beschreibe im Prompt ausdrücklich, welches Element aus welcher Quelle stammt. Ohne diese Zuordnung mischt das Modell willkürlich.
Referenzbilder lösen allerdings keine Bewegungsprobleme. Wenn die Handlung unklar ist, hilft auch das beste Standbild nicht.
Kamerasprache: Vokabular mit Wirkung
Kamerabegriffe sind der schnellste Weg zu professionell wirkenden Clips, weil sie dem Modell eine eindeutige Aufgabe geben. Eine grobe Übersetzung:
| Kamerabewegung | Wirkung | Formulierung im Prompt |
|---|---|---|
| Statisch | ruhig, konzentriert, produktnah | „statische Kamera auf Stativ, kein Kameraschwenk“ |
| Dolly nach vorn | Spannung, Annäherung | „langsame Kamerafahrt nach vorn, gleichmäßiges Tempo“ |
| Tracking seitlich | Dynamik, Parallele zur Figur | „Kamera fährt seitlich mit der Figur mit“ |
| Handkamera | dokumentarisch, nah | „leichte Handkamera, ruhiges Atmen, minimale Bewegung“ |
| Drohne | Überblick, Landschaft | „ruhiger Drohnenflug nach vorn, konstante Höhe“ |
| Aufsicht | Ordnung, Distanz | „Kamera von oben, senkrecht auf die Fläche gerichtet“ |
| Bodenperspektive | Größe, Bedrohung | „Kamera knapp über dem Boden, leichte Untersicht“ |
Ein Fehler, den fast alle am Anfang machen: Kamera- und Motivbewegung widersprechen sich. „Statische Kamera“ plus „Kamera folgt der Figur“ ergibt ein Ergebnis, das zwischen beiden pendelt. Wähle eine Bewegung – entweder die Kamera bewegt sich oder das Motiv.
Konsistenz über mehrere Szenen halten
Ein einzelner schöner Clip ist nett. Ein Video braucht Wiedererkennbarkeit. Drei Werkzeuge helfen:
Textbaustein für die Figur. Schreibe eine Figurenbeschreibung von 15 bis 25 Wörtern und kopiere sie wortgleich in jeden Szenen-Prompt. Schon kleine Umformulierungen – „graue Jacke“ statt „grauer Mantel“ – führen zu sichtbaren Sprüngen.
Look-Preset. Definiere Licht, Farbpalette, Korn und Brennweite einmal und verwende sie in allen Szenen. Wechsle nur, wenn die Szene es dramaturgisch verlangt – und dann bewusst.
Seed und Modellversion notieren. Wenn ein Ergebnis besonders gut ist, halte fest, mit welchem Seed und welcher Modellversion es entstanden ist. Bei der nächsten Szene kannst du damit weiterarbeiten und vermeidest, den Look neu zu erfinden.
Für längere Sequenzen lohnt sich außerdem eine einfache Szenenlogik: Achte darauf, dass Figuren in aufeinanderfolgenden Einstellungen nicht die Seite wechseln (die klassische Achsenregel), und plane bewusst harte Schnitte statt durchgehender Kamerafahrten. Ein Schnitt verzeiht kleine Inkonsistenzen, eine durchgehende Bewegung nicht.
Zero-Shot ist nicht genug: Iteration als Methode
Der wichtigste Unterschied zwischen frustrierenden und produktiven Ergebnissen ist nicht der erste Prompt, sondern die Schleife danach.
- Basisversion. Prompt schreiben, drei bis fünf Varianten generieren.
- Diagnose. Was ist falsch? Anatomie, Bewegung, Licht, Komposition oder Timimg? Benenne das Problem in einem Satz.
- Ein Baustein ändern. Nur den Baustein anpassen, der das Problem verursacht. Alles andere bleibt.
- Vergleichen. Ergebnisse nebeneinanderlegen, nicht nacheinander anschauen. Der Blick verliert sonst die Referenz.
- Einfrieren. Sobald ein Ergebnis brauchbar ist, Prompt und Einstellungen als Vorlage speichern.
Ein Sprachmodell als Assistent ist dabei hilfreich: Lass dir aus einem Drehbuchabsatz eine Szenenliste ableiten und jeden Eintrag in Subjekt, Handlung, Umgebung, Licht, Kamera und Stil zerlegen. So entsteht ein konsistenter Prompt-Satz statt zufälliger Einzeleingaben.
Typische Fehler und wie du sie behebst
Zu viele Subjekte. Zwei Figuren, die interagieren, sind für viele Modelle noch schwierig. Lösung: Szene in zwei Einstellungen aufteilen und im Schnitt zusammenfügen.
Widersprüchliche Bewegung. „Die Kamera fliegt um die Figur, während sie losläuft“ überfordert. Lösung: eine Bewegung priorisieren.
Überladene Adjektive. Fünf Stilbegriffe ergeben keinen Stil, sondern Matsch. Lösung: maximal zwei Stilbegriffe, der Rest ist Licht und Kamera.
Text im Bild. Schilder, Logos und Schriftzeichen zerfallen fast immer. Lösung: Text im Prompt vermeiden und im Schnittprogramm ergänzen.
Standbild-Look. Wenn das Ergebnis wie ein Foto mit leichtem Wackeln aussieht, fehlt eine klare Bewegungsanweisung. Lösung: ein konkretes Verb plus sichtbare Konsequenz (Wasser spritzt, Haare bewegen sich, Rauch zieht).
Morphing und Verzerrung. Meist Folge von zu viel Bewegung oder zu langer Cliplänge. Lösung: Clip kürzen, Bewegung reduzieren, Referenzbild nutzen.
Gesichter kippen in der Bewegung. Lösung: Kopf kaum drehen lassen, Nahaufnahme vermeiden, Halbtotale wählen, Licht konstant halten.
Alles gleich hell und gleich scharf. Wirkt schnell künstlich. Lösung: eine Lichtquelle mit Richtung und einen Kontrast zwischen Vorder- und Hintergrund definieren.
Workflow: von der Idee zum fertigen Clip
Ein siebenstufiger Ablauf, der sich für Werbeclips, Social-Media-Videos und Kurzfilme gleichermaßen eignet:
- Briefing in einem Satz. Was soll die Zuschauerin nach dem Clip wissen oder fühlen? Wenn du das nicht in einem Satz sagen kannst, ist der Clip noch nicht bereit.
- Szenenliste. Drei bis acht Einstellungen, jede mit einer Aufgabe. Nicht mehr.
- Prompt-Bausteine pro Szene. Subjekt, Handlung, Umgebung, Licht, Kamera, Stil – sechs Zeilen pro Einstellung.
- Erstgenerierung. Kurze Clips, Standardeinstellungen, keine Details. Ziel ist Orientierung, nicht Perfektion.
- Varianten mit kontrollierten Änderungen. Pro Szene die zwei besten Varianten behalten.
- Auswahl und Nachbearbeitung. Schnitt, Farbkorrektur, Ton, Titel. Hier rettet ein guter Schnitt mittelmäßiges Material.
- Bibliothek aufbauen. Jeden brauchbaren Prompt mit Notizen speichern. Nach zehn Projekten arbeitest du aus einem Fundus statt bei null.
Ein häufiger Fehler in dieser Kette: Zu viel Zeit in Stufe 4 investieren. Die Erstgenerierung ist Recherche. Die Qualität entsteht in Stufe 5 und 6.
Prompt-Bibliothek aufbauen und teamfähig machen
Sobald mehr als eine Person mit Prompts arbeitet, brauchst du Struktur. Bewährt hat sich ein einfaches Format: ein Name, der die Aufgabe beschreibt („Produktclip_studio_ruhig“), Platzhalter in geschweiften Klammern für variable Teile und ein Feld für Notizen zu Seed, Modellversion und Ergebnisqualität.
Halte Variablen knapp. Ein Prompt mit zwölf Platzhaltern ist im Alltag unbenutzbar. Besser drei feste Vorlagen als eine überladene. Versioniere Änderungen, statt sie zu überschreiben – du wirst überrascht sein, wie oft eine ältere Version besser funktioniert hat.
Und ein organisatorischer Tipp: Trenne Prompt-Vorlagen nach Aufgabe, nicht nach Modell. Modelle wechseln schneller, als du deine Bibliothek umbauen kannst. Eine Vorlage, die Subjekt, Handlung, Licht und Kamera sauber trennt, lässt sich in jedes neue Werkzeug übertragen.
FAQ
Wie lang sollte ein Videoprompt sein?
Für die meisten Modelle sind 40 bis 80 Wörter ideal. Kürzer lässt zu viel offen, länger verwässert die Prioritäten. Bei Bild-zu-Video darf er deutlich kürzer sein, weil das Referenzbild einen Teil der Arbeit übernimmt.
Reicht ein Prompt für ein ganzes Video?
Nein. Ein Prompt erzeugt eine Einstellung. Für ein Video brauchst du eine Szenenliste und pro Szene einen eigenen Prompt – plus Schnitt.
Warum ignoriert das Modell meine Stilangaben?
Meistens stehen sie zu weit hinten im Prompt oder sind widersprüchlich. Setze Stilbegriffe früher und reduziere sie auf zwei. Prüfe außerdem, ob Licht und Stil sich gegenseitig ausschließen.
Sind Negativbeschreibungen sinnvoll?
Sparsam. Ein bis zwei klare Ausschlüsse helfen („keine sichtbaren Schriftzeichen“), lange Listen lenken eher ab und können unerwünschte Elemente sogar verstärken.
Wie bekomme ich konsistente Figuren über mehrere Szenen?
Mit einem wortgleichen Figurenbaustein, einem festen Look-Preset und, wenn möglich, einem Referenzbild. Änderungen an der Figurbeschreibung nur bewusst und dokumentiert.
Was tun, wenn Bewegungen immer zerfallen?
Bewegung reduzieren, Clip kürzen, ein Hauptsubjekt wählen und die Kamera ruhig halten. In vielen Fällen ist eine ruhige Einstellung mit kleinem Motivdetail besser als eine dynamische mit Artefakten.
Brauche ich verschiedene Prompts pro Modell?
Die Grundstruktur bleibt gleich, die Gewichtung unterscheidet sich. Manche Modelle reagieren stark auf Kamerasprache, andere mehr auf Licht und Material. Teste deine drei wichtigsten Vorlagen einmal pro Werkzeug und notiere die Unterschiede.
Checkliste zum Mitnehmen
- Ein Subjekt, eine Handlung, ein Clip.
- Sechs Bausteine: Subjekt, Handlung, Umgebung, Licht, Kamera, Stil.
- 40 bis 80 Wörter, wichtigstes zuerst.
- Kamera und Motivbewegung nie widersprüchlich.
- Referenzbilder nutzen, Prompt dann kürzen.
- Drei bis fünf Varianten, dann einen Baustein gezielt ändern.
- Konsistenz über Textbaustein, Look-Preset und dokumentierte Seeds.
- Brauchbare Prompts sofort speichern und benennen.
Prompt Engineering für Video ist kein Talent, sondern eine Routine. Wer systematisch variiert, Fehler benennt und Ergebnisse archiviert, produziert nach wenigen Projekten Ergebnisse, die zuverlässig wirken – nicht, weil das Modell besser geworden ist, sondern weil der Prompt klarer geworden ist.




