Warum Prompt-Handwerk über die Qualität deiner KI-Videos entscheidet
Kaum ein Bereich der Medienproduktion hat sich so rasant verändert wie die Arbeit mit generativen Videomodellen. Werkzeuge wie Runway, Sora, Kling, Luma oder Veo erzeugen aus einer kurzen Textbeschreibung bewegte Bilder, die vor wenigen Jahren noch aufwendige Dreharbeiten erfordert hätten. Der eigentliche Engpass liegt heute nicht mehr in der Rechenleistung, sondern in der Kommunikation: Wer dem Modell präzise sagt, was es zeigen soll, bekommt brauchbares Material. Wer vage bleibt, bekommt hübsche Zufälle.
Ein Prompt ist kein Suchbegriff und auch keine Zauberformel. Er funktioniert eher wie ein Briefing an ein Filmteam, das dich nicht kennt, deine Absicht nicht erraten kann und jede Unklarheit mit einer eigenen Interpretation füllt. Jede Information, die du weglässt, wird vom Modell ersetzt – meistens nicht zu deinem Vorteil. Deshalb ist Prompt-Writing keine kreative Nebensache, sondern einehandwerkliche Kernkompetenz für alle, die regelmäßig Videoinhalte produzieren.
Dieser Leitfaden zeigt dir, wie du Prompts für Videogenerierung systematisch aufbaust, wie du visuelle Konsistenz über mehrere Szenen erreichst, wie du Bewegung kontrollierst und wie du typische Fehler erkennst, bevor sie teure Nacharbeit verursachen. Am Ende findest du Vorlagen, einen iterativen Workflow und eine Checkliste für den Alltag.
Die Anatomie eines starken Video-Prompts
Ein guter Video-Prompt beantwortet dieselben Fragen, die ein Kamerateam vor dem Dreh klärt: Was sehen wir? Wo befinden wir uns? Wie bewegt sich die Kamera? Wie ist das Licht? Welcher Stil soll erkennbar sein? Und was darf auf keinen Fall passieren?
Die sieben Bausteine
- Subjekt: Wer oder was ist zu sehen? Alter, Kleidung, Material, Ausdruck, Details wie Narben, Brillen oder Stoffstrukturen.
- Handlung: Was tut das Subjekt – und in welcher Reihenfolge? Beschreibe eine klar erkennbare Hauptaktion statt fünf gleichzeitiger Bewegungen.
- Umgebung: Ort, Tageszeit, Wetter, Hintergrundelemente, Atmosphäre.
- Kamera: Einstellungsgröße, Brennweite, Perspektive, Höhe, Bewegung.
- Licht: Lichtquelle, Richtung, Härte, Farbtemperatur, Kontrastverhältnis.
- Stil und Look: Filmkorn, Farbprofil, Materialität, Referenz auf visuelle Traditionen wie Dokumentarfilm, Werbefilm oder Analogfilm.
- Ausschlüsse: Alles, was nicht erscheinen soll – Logos, Text im Bild, zusätzliche Personen, Verzerrungen.
Derselbe Shot in drei Ausbaustufen
Stufe 1 – zu vage: Ein Mann geht durch eine Stadt.
Stufe 2 – brauchbar: Ein junger Mann in dunkler Jacke geht bei Regen durch eine belebte Innenstadt, Kamera folgt seitlich, gedämpftes Licht.
Stufe 3 – reproduzierbar: Ein Mann Anfang dreißig, kurze dunkle Haare, graue Wolljacke, geht in ruhigem Tempo von links nach rechts durch eine regennasse Innenstadtstraße am frühen Abend; Handheld-Kamera auf Augenhöhe, 35-mm-Objektiv, leichte Mitführung; neonbeleuchtete Schaufenster als Hauptlichtquelle, kühle Farbtemperatur, nasse Asphaltreflexionen; realistischer Dokumentarfilm-Look mit feinem Filmkorn; keine weiteren Personen im Vordergrund, kein Text im Bild, kein Wechsel der Kamerarichtung.
Der Unterschied zwischen Stufe 2 und 3 liegt nicht in mehr Worten, sondern in entscheidungsrelevanten Informationen. Genau das ist das Ziel: nicht länger schreiben, sondern eindeutiger.
Die vier Säulen der Prompt-Struktur
Wenn du Prompts künftig nach vier Säulen ordnest, wird deine Trefferquote sofort messbar besser. Die Reihenfolge ist bewusst gewählt, weil viele Modelle die ersten Begriffe stärker gewichten.
Säule 1: Motiv und Subjekt
Beschreibe das Subjekt so konkret, dass es wiedererkennbar ist. Statt „eine Frau" besser „eine Frau Mitte vierzig mit lockigem rotem Haar, Sommersprossen, weißem Leinenhemd". Vermeide widersprüchliche Attribute wie „lässig, aber formell gekleidet" – Modelle lösen solche Konflikte unvorhersehbar. Wenn mehrere Personen vorkommen, ordne sie eindeutig zu: „links im Bild ein Radfahrer, rechts eine Fußgängerin mit Hund".
Säule 2: Kamera und Optik
Kamerasprache ist der stärkste Hebel für professionelle Wirkung. Nützliche Vokabeln:
- Einstellungsgröße: extreme Weitaufnahme, Totale, Halbtotale, Nahaufnahme, Detailaufnahme
- Brennweite: Weitwinkel (mehr Raum, stärkere Verzerrung), Normalbrennweite (neutral), Tele (flacher, verdichtete Hintergründe)
- Perspektive: Augenhöhe, Froschperspektive, Vogelperspektive, Über-die-Schulter
- Führung: statisch, Handkamera, Gimbal, Kran, Drohne, Dolly
Ein einzelner Satz wie „statische Kamera, halbtotale Einstellung, 50-mm-Objektiv" verändert die Bildwirkung oft stärker als jede Stilangabe.
Säule 3: Licht und Farbe
Licht beschreibt mehr als Helligkeit. Entscheidend sind Quelle, Richtung und Härte:
- Quelle: Sonnenlicht, Fensterlicht, Neonröhren, Kerzenlicht, Praxislicht im Bild
- Richtung: frontal, seitlich, Gegenlicht, von oben, von unten
- Härte: hart mit klaren Schattenkanten oder weich mit sanften Übergängen
- Farbe: warme Abendsonne, kühles Morgenlicht, doppeltönige Mischung aus Tageslicht und Kunstlicht
Für Video ist Konsistenz der Lichtrichtung über die Sequenz hinweg besonders wichtig. Ein Achsensprung beim Licht wirkt sofort wie ein Produktionsfehler.
Säule 4: Bewegung und Tempo
Beschreibe Bewegung immer mit Richtung, Geschwindigkeit und Bezugspunkt. „Die Kamera bewegt sich langsam nach rechts, während das Subjekt stillsteht" ist eindeutig. „Dynamische Kamera" ist es nicht. Nutze Verben wie schwenken, fahren, heben, senken, zoomen und ergänze „langsam", „gleichmäßig" oder „ruckartig" je nach gewünschtem Effekt.
Konsistenz über mehrere Szenen
Die größte Herausforderung beim Arbeiten mit KI-Video ist nicht der einzelne Clip, sondern die Wiederholbarkeit über viele Clips hinweg. Eine Figur, die in Szene eins grüne Augen hat und in Szene drei blaue, zerstört jede Illusion.
Charakter- und Requisitenkonsistenz
Lege für jedes wiederkehrende Element einen festen Beschreibungsblock an und kopiere ihn wortwörtlich in jeden Prompt. Ändere niemals einzelne Wörter „zur Abwechslung". Ein Charakterblock kann so aussehen:
Protagonistin: Frau Ende zwanzig, kinnlanges braunes Haar mit Mittelscheitel, grüne Augen, kleine Narbe über der linken Augenbraue, beigefarbener Trenchcoat, dunkelgrüner Schal.
Gleiches gilt für Requisiten und Orte: Ein Dachzimmer mit schräger Holzwand bleibt ein Dachzimmer mit schräger Holzwand – inklusive Fensterposition und Tageszeit.
Referenzbilder und Multi-Image-Fusion
Viele Modelle akzeptieren Referenzbilder, um Stil oder Subjekt zu stabilisieren. Unterscheide dabei klar zwischen:
- Style-Referenz: überträgt Look, Farbpalette und Materialität
- Content-Referenz: überträgt Subjekt, Objekt oder Komposition
- Kombination: Charakterbild plus Locationsbild plus Look-Referenz
Wichtig ist die Gewichtung. Wenn du ein Charakterbild und ein Stilbild gleichzeitig einspeist, beschreibe im Prompt, was aus welcher Quelle stammen soll: „Gesicht und Frisur wie Referenz A, Farbpalette und Filmkorn wie Referenz B." Ohne diese Zuordnung vermischen Modelle die Ebenen und liefern hybride Ergebnisse, die weder dem Charakter noch dem Look entsprechen.
Seeds, Wiederholung und Namenskonventionen
Arbeite mit fixierten Seeds, wenn du kleine Variationen testen willst: Erst den Seed festhalten, dann nur eine Variable ändern. Lege außerdem eine einfache Datei- und Prompt-Dokumentation an: Projektname, Szenennummer, Prompt-Version, Seed, Ergebnisbewertung. Wer zehn Clips pro Tag produziert, verliert ohne Dokumentation binnen einer Woche den Überblick darüber, welche Formulierung funktioniert hat.
Bewegung und Dynamik kontrollieren
Kamerabewegung vs. Motivbewegung
Viele unbrauchbare Clips entstehen, weil Kamera- und Motivbewegung gleichzeitig unklar beschrieben sind. Entscheide pro Einstellung, was sich bewegt:
- Statische Kamera, bewegtes Motiv: klare, ruhige Beobachtung
- Bewegte Kamera, statisches Motiv: dynamische Annäherung, Spannung
- Beides bewegt: hohe Energie, aber hohes Risiko für Artefakte
Für Einsteiger gilt: Pro Einstellung nur eine dominante Bewegung.
Geschwindigkeit, Richtung, Physik
Ergänze physikalische Hinweise, wo Realismus wichtig ist: „Der Stoff bewegt sich träge im Wind", „Tropfen fallen langsam und schwer", „Haare bleiben unbewegt". Solche Details verhindern, dass Modelle Bewegungen erfinden, die zur Schwerkraft oder zum Material nicht passen.
Häufige Fehler bei Bewegungsanweisungen
- Zu viele Bewegungen in einem Satz
- Richtungsangaben ohne Bezugssystem („nach links" – von wem aus gesehen?)
- Tempoangaben ohne Vergleich („schnell" ist relativ)
- Wechsel der Bewegungsrichtung mitten im Clip, der als Sprung erscheint
Narrative Struktur und Szenenübergänge
Vom Beat-Sheet zur Shot-Liste
Bevor du Prompts schreibst, zerlege die Idee in Beats. Ein 30-Sekunden-Clip braucht selten mehr als sechs bis acht Einstellungen. Notiere pro Beat: Funktion (Einstieg, Konflikt, Wendung, Auflösung), Einstellungsgröße, Kernbewegung. Erst danach entstehen Prompts – nicht umgekehrt.
Übergänge beschreiben
Übergänge sind ein unterschätztes Prompt-Element. Beschreibe das Ende einer Einstellung und den Anfang der nächsten bewusst:
- Schnitt auf Bewegung: „Die Bewegung endet in derselben Richtung, in der die nächste Einstellung beginnt"
- Match Cut: gleiche Form oder Farbe im letzten und ersten Bild
- Weiche Übergänge: Überblendung, Lichtwechsel, Verdeckung durch ein Objekt im Vordergrund
Wenn du Übergänge gar nicht beschreibst, entscheidet das Modell – meist mit einem harten Bruch, der den Fluss zerstört.
Continuity-Regeln
Achte auf drei Kontinuitäten: Bildrichtung (wer von links nach rechts geht, sollte es beibehalten), Lichtrichtung und Requisitenzustand (geöffnete Tür bleibt geöffnet, solange kein Schnitt mit Zeitsprung erfolgt). Diese Regeln stammen aus dem klassischen Film und gelten für KI-Video genauso.
Prompt-Vorlagen für typische Formate
Produkt- und Werbeclip
Produktaufnahme eines [Produkts] auf [Untergrund], zentriert, langsame kreisende Kamera auf Stativ, Makroobjektiv, weiches Studiolicht von links oben mit sanftem Reflektor rechts, klare Schatten, sauberer Hintergrund in [Farbe], hoher Detailgrad, keine Hände, kein Text im Bild.
Wichtig: Produktform und Materialbeschaffenheit mehrfach nennen, damit die Geometrie stabil bleibt.
Talking Head und Interview
Person [Beschreibung] sitzt an einem Holztisch, spricht ruhig in Richtung Kamera, halbtotale Einstellung auf Augenhöhe, 85-mm-Look mit geringer Schärfentiefe, weiches Fensterlicht von links, Hintergrund leicht unscharf mit [Details], natürliche Mimik, keine Kamerabewegung.
Für Sprechszenen gilt: Weniger Bewegung bedeutet mehr Glaubwürdigkeit.
Establishing Shot und Landschaft
Weite Landschaft mit [Merkmalen] zur [Tageszeit], langsamer Kameraflug nach vorne auf konstanter Höhe, dramatisches Gegenlicht, Staub oder Nebel in der Luft, filmischer Look mit weitem Dynamikumfang, keine Gebäude, keine Personen.
Action und Tempowechsel
[Subjekt] rennt von links nach rechts durch [Umgebung], Handkamera folgt dicht, leichte Verwacklung, kurze Brennweite, harter Kontrast, Staubpartikel, Bewegungsunschärfe an Händen und Füßen, keine Zeitlupe.
Action-Prompts profitieren von expliziten Geschwindigkeitsangaben und der Angabe, ob Zeitlupe gewünscht ist oder nicht.
Iterativer Workflow: vom ersten Test zur Serie
- Referenz sammeln: Such zwei bis drei Bilder, die Licht, Look und Komposition zeigen. Sie dienen als mentale Messlatte.
- Prompt-Gerüst bauen: Subjekt, Umgebung, Kamera, Licht, Stil – jeweils ein kurzer Halbsatz.
- Eine Variable testen: Ändere pro Durchlauf nur Licht oder nur Kamera. Alles andere bleibt identisch, sonst kannst du nichts lernen.
- Seed fixieren: Sobald ein Ergebnis passt, Seed notieren und für Variationen desselben Shots wiederverwenden.
- Auf Szenen skalieren: Charakterblock, Lookblock und Ausschlüsse als wiederverwendbare Bausteine in jeden Prompt kopieren.
- Nachbearbeiten: KI-Material ist Rohmaterial. Farbanpassung, Stabilisierung, Schnittrhythmus und Ton entscheiden am Ende über die Wirkung.
Plane pro fertiger Minute mindestens das Fünf- bis Zehnfache an Testmaterial ein. Wer diesen Puffer nicht einplant, produziert unter Zeitdruck und akzeptiert sichtbare Fehler.
Häufige Fehler und Troubleshooting
Flimmern und Morphing
Flimmern entsteht häufig durch zu viele konkurrierende Details im Bild oder durch Texturen wie feine Muster und Gitter. Reduziere die Detaildichte, verkleinere den Bildausschnitt oder erhöhe die Konsistenz, indem du eine Referenz einspeist.
Überladene Prompts
Wenn ein Clip unruhig wirkt, ist meist zu viel beschrieben: drei Bewegungen, zwei Lichtquellen, mehrere Nebenfiguren. Streiche alles, was nicht zur Kernaussage der Einstellung gehört. Kürzen ist oft wirkungsvoller als Ergänzen.
Negativ-Prompts richtig nutzen
Nutze Ausschlüsse gezielt und sparsam: „kein Text im Bild", „keine zusätzlichen Personen", „kein Kamerawackeln", „keine Verzerrung im Gesicht". Lange Negativ-Listen verwirren Modelle ebenso wie lange Positiv-Listen.
Text, Hände und Logos
Schrift im Bild ist für generative Videomodelle weiterhin schwierig. Schreibe Text nicht in den Prompt, sondern setze ihn in der Nachbearbeitung. Bei Händen hilft es, Interaktionen zu vereinfachen: Gegenstände greifen statt jonglieren, ruhige Handpositionen statt schneller Gesten.
Seitenverhältnis und Framing
Lege das Seitenverhältnis vor dem Prompt fest. Ein für 16:9 komponiertes Bild funktioniert beim vertikalen Zuschnitt selten. Wenn du mehrere Formate brauchst, plane bewusst mehr Luft um das Motiv oder generiere pro Format eine eigene Variante.
FAQ und Checkliste
Wie lang sollte ein Video-Prompt sein?
Es gibt keine Wortzahl, aber eine Regel: Jeder Satz muss eine Entscheidung treffen. Prompts zwischen 60 und 120 Wörtern sind für die meisten Einstellungen ausreichend. Komplexe Actionszenen dürfen länger sein, benötigen aber eine klare Reihenfolge.
Sollte ich Prompts auf Deutsch oder Englisch schreiben?
Viele Modelle sind auf englischsprachigen Trainingsdaten stärker kalibriert. Wenn dein Modell mit deutschen Prompts stabil arbeitet, bleib dabei – Konsistenz im eigenen Workflow ist wichtiger als theoretische Optima. Teste beide Sprachen mit identischem Inhalt und vergleiche die Trefferquote.
Wie viele Durchläufe sind normal?
Für eine brauchbare Einstellung sind drei bis acht Durchläufe üblich. Bei komplexen Bewegungen oder mehreren Figuren auch mehr. Wer nach zwei Versuchen aufgibt, verschenkt den größten Qualitätshebel.
Wie halte ich Figuren ohne aufwendige Technik konsistent?
Drei Maßnahmen wirken sofort: ein wortwörtlich kopierter Charakterblock, ein Referenzbild für das Gesicht und eine reduzierte Zahl unterschiedlicher Kamerawinkel pro Figur. Vermeide starke Profilansichten, wenn du später auch frontale Ansichten brauchst.
Darf ich reale Personen oder Marken darstellen?
Prüfe die Nutzungsbedingungen deines Werkzeugs und die rechtlichen Rahmenbedingungen für dein Projekt. Für kommerzielle Produktionen gehören Rechteklärung und Freigaben immer in die Planung – nicht in die Nachbearbeitung.
Checkliste vor dem Generieren
- Ist nur eine dominante Bewegung pro Einstellung beschrieben?
- Sind Lichtrichtung und Tageszeit eindeutig?
- Enthält der Prompt einen kopierten Charakter- und Lookblock?
- Sind Ausschlüsse sparsam und konkret?
- Ist das Seitenverhältnis vorab geklärt?
- Ist der Seed nach einem guten Ergebnis dokumentiert?
- Ist genug Zeit für Iterationen eingeplant?
Wer diese Punkte routiniert abarbeitet, produziert nicht nur schönere Clips, sondern arbeitet planbarer und schneller. Prompt-Writing ist am Ende weniger eine Frage von Talent als von Klarheit – und Klarheit lässt sich üben, Schritt für Schritt, Einstellung für Einstellung.

