Warum Prompt-Qualität über das Ergebnis entscheidet
Generative Videomodelle haben in kurzer Zeit enorme Fortschritte gemacht. Aus kurzen, instabilen Clips sind Sequenzen geworden, die sich für Werbung, Social Media, erklärende Inhalte und konzeptionelle Vorstufen im Film einsetzen lassen. Diese Entwicklung hat einen Nebeneffekt: Die Werkzeuge sind zugänglicher geworden, doch die Ergebnisse unterscheiden sich drastisch – abhängig davon, wie präzise der Prompt formuliert ist.
Ein Prompt ist kein Suchbegriff. Er ist eine Regieanweisung, ein Drehbuchauszug und ein Storyboard in einem einzigen Textblock. Wer das versteht, hört auf, gegen das Modell zu arbeiten, und beginnt, mit ihm zu arbeiten. Modelle wie Runway, Kling, Luma, Pika oder Veo belohnen Klarheit. Sie bestrafen Widersprüche, vage Adjektive und überladene Sätze.
Der praktische Nutzen ist messbar. Ein präziser Prompt senkt die Zahl der Durchläufe erheblich. Er reduziert Zufall, macht Ergebnisse wiederholbar und erlaubt es, eine Bildsprache über mehrere Clips hinweg zu halten. Für Teams bedeutet das planbare Produktionszeiten statt Ausprobieren im Blindflug.
Dabei geht es nicht darum, möglichst viele Wörter zu verwenden. Es geht darum, die richtigen Informationen in der richtigen Reihenfolge zu liefern: Wer oder was zu sehen ist, was passiert, wie es gefilmt wird, wie es aussieht und welche Grenzen das Modell respektieren soll. Die folgenden Abschnitte zeigen, wie diese Bausteine zusammenspielen.
Die Anatomie eines guten Video-Prompts
Ein Video-Prompt lässt sich in vier Ebenen zerlegen: Inhalt, Kamera, Stil und Rahmenbedingungen. Wer alle vier Ebenen bedient, bekommt Ergebnisse, die sich kontrollieren lassen. Wer eine Ebene vergisst, überlässt dem Modell eine Entscheidung – und Modelle entscheiden in solchen Fällen selten so, wie man es sich vorgestellt hat.
Subjekt, Handlung und Umgebung
Der erste Block beschreibt, was im Bild existiert und was dort passiert. Beginne mit dem Subjekt: eine Person, ein Tier, ein Objekt, eine Landschaft. Danach folgt die Handlung in einem klaren Verb. Statt „eine schöne Frau bei Sonnenuntergang“ heißt es: „eine Frau mittleren Alters in einer gelben Regenjacke geht langsam durch knöcheltiefes Wasser“.
Die Umgebung liefert den Rahmen. Nenne Ort, Tageszeit und Wetter, wenn diese Faktoren das Bild prägen sollen. „Neonbeleuchtete Seitenstraße nach Regen“ erzeugt eine andere Stimmung als „staubige Wüstenstraße am Mittag“. Beide Sätze sind kurz, aber sie definieren Licht, Reflexionen und Farbpalette.
Ein häufiger Fehler ist eine überladene Handlung. Modelle verlieren an Stabilität, wenn eine Person gleichzeitig geht, springt, singt und etwas aufhebt. Beschränke dich auf eine Hauptaktion pro Szene. Wenn mehr passiert, teile die Sequenz in mehrere Clips auf und montiere sie später.
Kamera, Objektiv und Bewegung
Die Kameraebene ist der stärkste Hebel für professionelle Wirkung. Sie umfasst Aufnahmeart, Brennweite, Kamerabewegung und Blickwinkel. „Weite Totalaufnahme“ erzeugt Kontext, „Nahaufnahme mit 85-mm-Objektiv“ erzeugt Intimität. Eine „langsame Kranfahrt nach oben“ wirkt episch, eine „handgeführte Kamera“ wirkt dokumentarisch.
Wichtig ist die Trennung zwischen Kamerabewegung und Objektbewegung. Formulierungen wie „die Kamera folgt dem Radfahrer in einer seitlichen Parallelfahrt“ sind eindeutig. Formulierungen wie „bewegte Aufnahme“ sind es nicht. Das Modell muss wissen, wer sich bewegt: die Kamera, das Subjekt oder beide.
Bei kurzen Clips funktioniert eine einzige klare Kamerabewegung am besten. Kombinationen wie „erst Zoom, dann Schwenk, dann Fahrt“ führen in den meisten Modellen zu unruhigen Ergebnissen. Eine Ausnahme sind bewusst geschnittene Momente, bei denen ein Perspektivwechsel gewünscht ist – das sollte dann aber explizit als Schnitt beschrieben werden.
Licht, Farbe und Materialität
Die Stilebene bestimmt, wie das Bild aussieht. Nenne die Lichtquelle, ihre Richtung und ihre Qualität. „Weiches Gegenlicht zur goldenen Stunde“ beschreibt mehr als „schön beleuchtet“. „Hartes Blitzlicht von vorn, hoher Kontrast“ erzeugt einen völlig anderen Look als „diffuses Nordlicht durch ein Fenster“.
Farbpaletten lassen sich präzise steuern. Statt „bunte Farben“ hilft „entsättigte Blau- und Grautöne mit einem einzigen roten Akzent“. Für Materialien und Oberflächen gilt dasselbe: „matter Beton, nasses Kopfsteinpflaster, gebürsteter Stahl“ liefert dem Modell konkrete Texturen.
Technische Parameter und Format
Die vierte Ebene umfasst Aspektverhältnis, Bildrate und visuelle Referenzsysteme. Ein Hochformat eignet sich für Kurzvideos, ein Breitbildformat für Präsentationen. Nenne das Seitenverhältnis ausdrücklich, wenn es für die Ausspielung wichtig ist, und beschreibe den gewünschten Grad an Realismus oder Abstraktion.
Hier lohnt sich auch eine Angabe zum Bildcharakter: „cinematisch mit flacher Schärfentiefe“ oder „archivartig mit leichtem Filmkorn“. Solche Hinweise ersetzen ganze Listen von Adjektiven und wirken konsistenter.
Bewegung, Tempo und Kameraführung präzise steuern
Zeit ist in generativen Videos eine eigene Dimension. Viele Nutzer beschreiben nur das Bild und wundern sich, dass die Bewegung hektisch oder träge wirkt. Tempo lässt sich jedoch direkt beeinflussen: „sehr langsam“, „gemächlich“, „gleichmäßig“, „schnell“ oder „in Zeitlupe“.
Achte darauf, Tempo und Aufnahmedauer nicht zu verwechseln. Ein Clip kann lang sein und trotzdem langsame Bewegung zeigen – das ist oft die bessere Wahl für cinematische Sequenzen. Umgekehrt kann ein kurzer Clip mit hoher Bewegungsdichte in sozialen Medien Aufmerksamkeit erzeugen.
Bewegungsrichtung ist ein weiterer präziser Parameter. „Von links nach rechts durch das Bild“ oder „auf die Kamera zu“ sind eindeutig und helfen dem Modell, eine konsistente Achse zu halten. Bei Dialogen oder Gegenständen, die über mehrere Clips hinweg auftreten, ist die Bewegungsachse ein wichtiges Kontinuitätsmerkmal.
Für Kamerabewegungen gibt es einen bewährten Wortschatz: Fahrt, Schwenk, Neigung, Kran, Handkamera, Steadicam, Drohne, Dolly-Zoom. Nutze diese Begriffe, statt Bewegungen umständlich zu umschreiben. Ergänze sie um Tempoangaben – „langsamer Schwenk nach rechts“ ist eine vollständige Anweisung. Vermeide widersprüchliche Kombinationen wie „statische Aufnahme mit dynamischem Kameraflug“.
Ein letzter Punkt betrifft die Stabilität. Wenn ein Clip ruhig wirken soll, hilft der Hinweis auf ein Stativ oder eine feste Kamera. Wenn Dynamik gewünscht ist, sollte das ausdrücklich stehen. Ohne solche Angaben wählen viele Modelle einen Mittelweg, der weder ruhig noch dynamisch wirkt.
Stilanker und visuelle Konsistenz aufbauen
Stilanker sind kurze, wiederkehrende Formulierungen, die den Look über mehrere Clips hinweg stabilisieren. Ein Stilanker kann technisch sein – „35-mm-Filmkorn, flache Schärfentiefe“ – oder atmosphärisch – „kühles Morgenlicht, hohe Luftfeuchtigkeit, tiefe Schatten“. Wichtig ist, dass du denselben Anker in jedem Prompt einer Sequenz wörtlich wiederholst.
Variation entsteht dann nicht durch neue Stilwörter, sondern durch neue Inhalte. Die Kamera darf sich ändern, die Figur darf sich bewegen, der Ort darf wechseln – aber der Stilanker bleibt konstant. Das ist das Grundprinzip jeder konsistenten Serie, egal ob es sich um ein Werbekampagnen-Set oder eine animierte Kurzgeschichte handelt.
Ein praktischer Tipp: Halte dir eine kleine Textdatei mit drei bis fünf Stilankern für jedes Projekt. Ein Anker für Licht, einer für Farbe, einer für Materialität oder Bildcharakter, einer für Kamerastil. So vermeidest du, bei jedem neuen Clip neu zu improvisieren.
Stilanker helfen auch beim Vergleich von Werkzeugen. Wenn du denselben Anker in mehreren Modellen testest, siehst du schnell, welches Modell deine Bildsprache am besten trifft. Ohne Anker vergleichst du nur Zufallsergebnisse.
Konsistenz über mehrere Szenen sichern
Sobald ein Projekt mehr als einen Clip umfasst, wird Konsistenz zur wichtigsten Herausforderung. Figuren sollen gleich aussehen, Requisiten sollen sich nicht verändern, Lichtstimmung soll zusammenpassen. Dafür gibt es mehrere erprobte Techniken, die sich kombinieren lassen.
Seed-Werte und iterative Verfeinerung
Ein Seed ist ein Zahlenwert, der die Zufallskomponente der Generierung festlegt. Viele Modelle erlauben es, einen Seed beizubehalten oder zu sperren. Wenn dir ein Ergebnis gefällt, ändere nie alles gleichzeitig: Behalte den Seed, passe genau eine Variable an und vergleiche. So wird aus Ausprobieren ein kontrollierter Prozess.
Iterative Verfeinerung bedeutet, in kleinen Schritten zu arbeiten. Erst die Grundkomposition, dann Licht, dann Details, dann Bewegung. Wer in einem Durchlauf alles ändern will, kann nicht nachvollziehen, welcher Teil des Prompts welchen Effekt hatte.
Referenzbilder und Bild-zu-Bild-Startpunkte
Viele Werkzeuge akzeptieren ein Startbild oder Referenzbilder. Das ist der zuverlässigste Weg zu konsistenten Figuren und Orten. Nutze ein klares, gut beleuchtetes Referenzbild und beschreibe im Text nur noch Veränderungen – also Bewegung, Kamerafahrt und neue Handlung.
Kombiniere Referenzbilder sparsam. Zwei Referenzen wirken oft präziser als fünf. Bei mehreren Eingaben sollte im Prompt stehen, welche Rolle jedes Bild spielt: „erstes Bild als Startframe, zweites Bild als Farbreferenz“.
Figuren- und Requisitenbeschreibungen als Bausteine
Lege für jede wiederkehrende Figur einen kurzen Beschreibungsblock an. Alter, Haarfarbe, Kleidung, ein markantes Detail. Dieser Block wird in jeden Prompt derselben Sequenz kopiert, unverändert. Änderungen an der Kleidung sind nur dann sinnvoll, wenn sie erzählerisch gewollt und über alle weiteren Clips hinweg konsistent sind.
Dasselbe gilt für Schauplätze und Requisiten. Ein Fahrzeug, ein Stuhl, eine Lampe: einmal präzise beschreiben, danach immer gleich benennen. Vermeide Synonyme. Wenn das Modell „rote Limousine“ und „rotes Auto“ als zwei verschiedene Dinge interpretiert, bricht die Kontinuität.
Negativ-Prompts, Gewichtung und Ausschlusslogik
Negativ-Prompts beschreiben, was nicht im Bild erscheinen soll. Sie sind dann besonders nützlich, wenn ein Modell zuverlässig denselben Fehler produziert – etwa zusätzliche Gliedmaßen, lesbare Texte oder unerwünschte Wasserzeichen. Formuliere knapp und konkret: „keine Textüberlagerungen, keine verzerrten Gesichter, kein Doppelbild“.
Der häufigste Fehler ist ein überladener Negativ-Prompt. Wer zwanzig Verbote auflistet, verwirrt das Modell und riskiert, dass es unbeabsichtigt genau die verbotenen Elemente hervorbringt. Beschränke dich auf die drei bis fünf wichtigsten Ausschlüsse.
Gewichtung ist die zweite Steuerungsebene. Manche Werkzeuge erlauben es, Begriffe stärker oder schwächer zu gewichten, oft über Klammern oder Zahlenwerte. Nutze das sparsam: Wenn ein Element wichtiger sein soll als der Rest, gewichte es leicht höher, statt den ganzen Prompt umzuschreiben.
Denke bei der Ausschlusslogik auch an unerwünschte Stilwechsel. Wenn ein Modell dazu neigt, in einen animierten Look zu kippen, hilft ein klarer Hinweis auf Fotorealismus zusammen mit einem entsprechenden Ausschluss. Achte darauf, dass positive und negative Anweisungen sich nicht widersprechen.
Prompt-Vorlagen für typische Produktionen
Gute Prompts folgen Mustern. Die folgenden Vorlagen sind Ausgangspunkte, die du an dein Projekt anpasst. Achte darauf, die Reihenfolge beizubehalten: Inhalt, dann Kamera, dann Stil, dann Grenzen.
Cinematische Szene
„Weite Totalaufnahme: eine menschenleere Küstenstraße im Morgengrauen, der Nebel liegt tief über dem Asphalt. Eine einzelne Person in einer dunkelblauen Jacke geht von links nach rechts auf die Kamera zu. Langsame seitliche Parallelfahrt, 35-mm-Objektiv, flache Schärfentiefe. Kühle Blau- und Grautöne, weiches diffuses Licht, feiner Filmkorn-Look. Keine Textüberlagerungen, keine zusätzlichen Personen.“
Produktaufnahme
„Nahaufnahme einer matten Keramiktasse auf einer hellen Steinplatte, Dampf steigt langsam auf. Die Kamera umkreist das Objekt in einer halbkreisförmigen Bewegung mit konstanter Geschwindigkeit. Weiches Studiolicht von links, klare Reflexionen, saubere Hintergrundunschärfe. Neutraler Hintergrund, keine Hände, keine Markenlogos.“
Social-Media-Clip
„Halbnahaufnahme einer Person, die eine leuchtende Getränkedose aus einem Kühlschrank nimmt und sie in die Kamera hält. Schnelle Handkamera-Dynamik, leichte Bewegung, echtes Umgebungslicht einer Küche. Warme Farben, hohe Sättigung, hohe Detailtiefe. Hochformat, keine lesbaren Texte.“
Erklärende Animation
„Flache Vektor-Animation einer Stadtkarte, bei der sich mehrere farbige Linien von einem zentralen Punkt aus nach außen bewegen. Statische Draufsicht, langsame, gleichmäßige Ausbreitung der Linien. Klare Farbpalette aus drei Tönen, kein Text, keine Schatten.“
Diese Vorlagen sind bewusst kurz. Sie lassen sich erweitern, aber jede Ergänzung sollte eine Entscheidung treffen, nicht nur Atmosphäre erzeugen.
Modellspezifische Feinabstimmung
Jedes Modell hat Eigenheiten. Manche interpretieren lange Prompts besser, andere brauchen kurze, fast telegrammartige Anweisungen. Manche priorisieren Bewegung, andere Bildqualität. Wer regelmäßig mit mehreren Werkzeugen arbeitet, entwickelt schnell ein Gefühl dafür, welcher Prompt-Stil zum jeweiligen Modell passt.
Ein praktischer Ansatz ist die Anpassung der Prompt-Länge. Teste denselben Inhalt in drei Varianten: sehr kurz, mittel, ausführlich. Notiere, welche Variante die stabilsten Ergebnisse liefert, und nutze diese Länge als Standard für dieses Modell. Bei Modellen mit starkem Fokus auf Realismus helfen technische Begriffe wie Brennweite, Blende und Lichtsetzung. Bei stilisierten Modellen wirken Referenzen auf Kunstrichtungen oder Bildmedien besser.
Auch die Reihenfolge der Informationen kann eine Rolle spielen. Einige Modelle gewichten den Anfang eines Prompts stärker. Wenn ein Element unbedingt erhalten bleiben muss, gehört es nach vorn. Wenn es eher ein Detail ist, kann es ans Ende.
Wichtig ist, Modellwechsel nicht als Neuanfang zu behandeln. Behalte deine Stilanker, deine Figurenbeschreibungen und deine Kameravokabeln bei und passe nur die Formulierungsweise an. So bleibt die visuelle Identität eines Projekts erhalten, auch wenn die technische Basis wechselt.
Typische Fehler und wie du sie vermeidest
Der häufigste Fehler ist Überladung. Ein Prompt mit zwölf Adjektiven, vier Kamerabewegungen und drei Handlungen erzeugt selten ein klares Bild. Kürze radikal und prüfe, ob jede Information eine Entscheidung trifft.
Zweiter Fehler: Widersprüche. „Statische Aufnahme mit dynamischer Verfolgung“ oder „nachtaktiv bei hellem Tageslicht“ führen zu instabilen Ergebnissen. Lies deinen Prompt einmal gegen und streiche alles, was sich gegenseitig ausschließt.
Dritter Fehler: fehlende Zeitangaben. Ohne Tempo- und Richtungsangaben entscheidet das Modell – und wählt oft den unauffälligsten Mittelweg. Vierte Falle: wechselnde Synonyme für dieselbe Sache, was die Kontinuität zerstört.
Fünftens: unkontrolliertes Testen. Wenn du bei jedem Durchlauf mehrere Variablen gleichzeitig veränderst, lernst du nichts über die Wirkung deines Prompts. Ändere immer nur eine Sache. Sechstens: Ignorieren des Seitenverhältnisses und der Ausspielplattform. Ein Clip, der für Hochformat geplant wurde, verliert im Breitbildformat oft an Wirkung.
Siebter Fehler: das Modell für eigene Fehler verantwortlich machen. Wenn ein Ergebnis wiederholt nicht passt, liegt das fast immer an einer unklaren Anweisung – nicht am Werkzeug. Achter Fehler: zu frühes Aufhören. Oft liegt der brauchbare Clip zwei kleine Anpassungen entfernt.
FAQ: häufige Fragen zu KI-Video-Prompts
Wie lang sollte ein Prompt sein?
Für die meisten Modelle liegt der brauchbare Bereich zwischen 40 und 90 Wörtern. Kürzere Prompts sind oft stabiler, längere erlauben mehr Kontrolle. Entscheidend ist nicht die Länge, sondern die Informationsdichte.
Sollte ich auf Deutsch oder Englisch schreiben?
Beide Wege funktionieren, aber Englisch ist bei vielen Modellen besser abgedeckt. Wenn du auf Deutsch arbeitest, achte auf eindeutige Substantive und vermeide lange Schachtelsätze, die bei der Übersetzung an Präzision verlieren.
Wie bekomme ich dieselbe Figur in mehreren Clips?
Kombiniere einen unveränderten Beschreibungsblock mit einem Referenzbild und, falls verfügbar, einem gesperrten Seed. Ändere dann nur Bewegung, Kamera und Handlung – nicht das Aussehen.
Warum ignoriert das Modell meine Negativ-Prompts?
Meist sind zu viele Ausschlüsse formuliert oder sie widersprechen positiven Anweisungen. Reduziere die Liste auf die wichtigsten Punkte und formuliere positiv, was du stattdessen willst.
Wie viele Durchläufe sind normal?
Bei einem gut vorbereiteten Prompt sind zwei bis vier Varianten realistisch. Deutlich mehr Durchläufe sind ein Signal, dass die Beschreibung zu vage oder zu widersprüchlich ist.
Kann ich Prompts für eine ganze Serie wiederverwenden?
Ja, genau dafür sind Stilanker und Figurenbausteine gedacht. Halte sie wörtlich konstant und variiere nur die Inhalts- und Kamerablöcke.
Was hilft, wenn Bewegungen unnatürlich wirken?
Beschreibe eine einzige Bewegung pro Szene, gib Tempo und Richtung an und reduziere die Zahl paralleler Aktionen. Weniger ist hier fast immer mehr.
Fazit: Vom Ausprobieren zum wiederholbaren Handwerk
Gute Video-Prompts entstehen nicht durch Zufall, sondern durch Struktur. Wer Inhalt, Kamera, Stil und Grenzen getrennt beschreibt, wer Stilanker konsequent wiederverwendet und wer pro Durchlauf nur eine Variable ändert, baut sich ein System auf, das zuverlässig funktioniert – unabhängig davon, welches Modell gerade angesagt ist.
Der Aufwand liegt am Anfang höher. Du wirst Prompts strukturieren, Bausteine pflegen und Ergebnisse dokumentieren. Der Gewinn zeigt sich schnell: schnellere Produktionen, konsistente Bildsprache und Ergebnisse, die du erklären und wiederholen kannst. Genau das unterscheidet professionelle Arbeit von gelegentlichem Ausprobieren.

