Ein gutes KI-Video entsteht selten durch Zufall. Wer schon einmal eine halbe Stunde an einer Beschreibung gefeilt und dann ein Ergebnis bekommen hat, das weder Licht noch Bewegung richtig getroffen hat, kennt das Problem: Moderne Generatoren können sehr viel, aber sie raten, sobald die Anweisung vage bleibt. Prompt Engineering ist deshalb weniger ein Trick als eine Handwerksdisziplin – vergleichbar mit dem Drehbuchschreiben für ein sehr kleines Team, das jede Anweisung wörtlich nimmt.
Dieser Guide zeigt, wie du Prompts für Text-zu-Video- und Bild-zu-Video-Werkzeuge so aufbaust, dass Ergebnisse reproduzierbar werden: von der Grundstruktur über Kamerabewegung und Konsistenz bis zu Fehlerbehebung, Versionierung und einer kleinen Bibliothek wiederverwendbarer Bausteine.
Warum Prompt-Qualität über die Videoqualität entscheidet
Die generative Videoproduktion hat sich in kurzer Zeit von einer Spielerei zu einem echten Produktionsweg entwickelt. Architekturen auf Basis von Transformer- und Diffusionsmodellen erzeugen heute zusammenhängende Bewegungen, plausible Physik und brauchbare Tonspuren. Was dabei oft übersehen wird: Die Modelle sind keine Regisseure. Sie optimieren auf Wahrscheinlichkeit, nicht auf Absicht. Fehlt eine Information, füllt das Modell die Lücke mit dem statistisch wahrscheinlichsten Wert – und der ist selten der, den du im Kopf hattest.
Genau hier liegt der Hebel. Zwei Personen mit demselben Werkzeug und derselben Idee erhalten völlig unterschiedliche Ergebnisse, weil einer Subjekt, Licht, Objektiv und Bewegung beschreibt und der andere nur „Frau läuft durch Stadt“ schreibt. Der Unterschied ist keine Geschmacksfrage, sondern Informationsdichte.
Drei Konsequenzen ergeben sich daraus für die Praxis:
- Präzision schlägt Poesie. „Melancholisch“ ist für ein Modell fast bedeutungslos, „kühles blaues Gegenlicht, langsamer Schritt, gesenkter Blick“ ist umsetzbar.
- Struktur schlägt Länge. Ein langer, unstrukturierter Satz verwässert die wichtigsten Signale. Aufgeteilte Zeilen mit klaren Kategorien wirken zuverlässiger.
- Wiederholbarkeit schlägt Glückstreffer. Wer seine Parameter notiert, kann einen guten Take reproduzieren oder gezielt variieren, statt von vorn zu würfeln.
Wer diese drei Prinzipien verinnerlicht, produziert nicht nur schönere Clips, sondern arbeitet wirtschaftlicher: weniger Generierungen pro brauchbarem Shot, klarere Abstimmung im Team und eine deutlich kürzere Feedbackschleife mit Auftraggebern.
Die Anatomie eines wirksamen Video-Prompts
Ein belastbarer Prompt hat mehrere Ebenen. Du musst nicht immer alle ausschreiben, aber du solltest wissen, welche Ebene du bewusst weglässt – denn jede Auslassung ist eine Entscheidung, die das Modell für dich trifft.
Baustein 1: Subjekt, Handlung, Kontext
Diese drei Elemente bilden das Rückgrat. Das Subjekt beschreibt, wer oder was zu sehen ist, inklusive Alter, Kleidung, Material oder Zustand. Die Handlung ist eine konkrete, beobachtbare Bewegung – nicht eine Stimmung. Der Kontext liefert Ort, Tageszeit und Umgebung.
Schwach: „Ein Mann wirkt nachdenklich.“
Stark: „Ein Mann Mitte vierzig, grauer Mantel, steht an einem Bahnsteig, schaut auf die Anzeigetafel, atmet hörbar aus.“
Der zweite Satz enthält sichtbare Handlungen. Das Modell kann einen Mann nicht „nachdenklich“ rendern, aber es kann einen gesenkten Blick, eine angespannte Schulter und ein langsames Ausatmen rendern – und beim Publikum entsteht genau das Gefühl, das du wolltest.
Baustein 2: Stil, Licht und Material
Stilangaben steuern den Look stärker als fast alles andere. Nützlich sind vier Kategorien:
- Bildsprache: dokumentarisch, werblich, analoger Film, Animationsstil, Mockumentary.
- Licht: weiches Fensterlicht von links, harte Mittagssonne, Neonreflexe, Kerzenlicht, bewölktes diffuses Licht.
- Optik: 24 mm Weitwinkel, 50 mm Normalbrennweite, 85 mm Porträt, Makro, flache oder tiefe Schärfentiefe, leichte Vignette.
- Textur: feine Körnung, saubere Digitaloptik, Regen auf der Linse, Staub in der Luft, Condensation.
Medienreferenzen helfen, solange sie beschreibend bleiben. Statt „im Stil eines berühmten Regisseurs“ ist „kontrastreiche Nachtszenen, praktische Lichtquellen, ruhige Kamerafahrten“ treffsicherer und rechtlich unproblematischer. Beschreibe die Eigenschaften, die dir gefallen, nicht den Namen.
Baustein 3: Ausschlüsse, Konsistenz und Parameter
Negative Anweisungen sind erstaunlich mächtig, wenn sie konkret sind. „Kein Text im Bild, keine Logos, keine verzerrten Hände, keine zusätzlichen Personen im Hintergrund“ funktioniert besser als „nichts Hässliches“. Ein weiterer wichtiger Punkt: Halte Ausschlüsse kurz. Zwanzig Verbote verwässern die Prioritäten und können sogar gewünschte Elemente verdrängen.
Konsistenzparameter betreffen das Seitenverhältnis, die Framerate, die Länge des Clips, die Bewegungsschärfe und – bei Werkzeugen mit Referenzbild – die Stärke, mit der das Referenzbild das Ergebnis bestimmt. Diese Werte gehören nicht in den Fließtext, sondern in eine eigene Parameterzeile, damit du sie später isoliert anpassen kannst.
Ein strukturierter Prompt sieht dann so aus:
Subjekt: 32-jährige Keramikerin, Arbeitskleidung, Ton an den Händen
Handlung: formt eine Vase, hebt die Hände, dreht sich leicht zur Kamera
Umgebung: kleine Werkstatt am Morgen, Staub in der Luft
Licht: weiches Fensterlicht von links, warme Reflexe
Optik: 35 mm, flache Schärfentiefe, leichte Körnung
Kamera: langsame Fahrt nach vorn, ruhiges Tempo
Stil: dokumentarisch, natürliche Farben
Negativ: keine Schrift, kein Logo, keine weiteren Personen
Parameter: 16:9, 5 Sekunden, 24 fps
Workflow: Von der Idee zum fertigen Prompt in sechs Schritten
Ein wiederholbarer Ablauf spart mehr Zeit als jede einzelne Formulierungskunst.
- Absicht festhalten. Schreibe einen Satz: Was soll das Publikum am Ende fühlen oder wissen? Alles Weitere dient diesem Satz.
- In Schüsse zerlegen. Ein Clip von fünf bis acht Sekunden trägt meist genau eine Information. Zerlege längere Sequenzen in Einzel-Shots.
- Pro Shot ein Prompt-Blatt füllen. Nutze die Struktur aus dem vorigen Abschnitt, auch wenn nur vier Zeilen gefüllt sind.
- Erst grob, dann fein. Generiere eine ruhige Variante mit wenigen Angaben und prüfe Komposition und Motiv. Danach schärfe Licht, Optik und Bewegung nach.
- Eine Variable pro Durchlauf ändern. Wenn du gleichzeitig Licht, Kamera und Stil änderst, weiß du nie, welcher Faktor das Resultat verbessert hat.
- Gewinner archivieren. Speichere den exakten Prompt neben dem fertigen Clip. Das ist dein wichtigster Produktionswert.
Dieser Ablauf klingt bürokratisch, ist aber in der Praxis schneller, weil er wilde Versuchsreihen ersetzt. Teams, die so arbeiten, diskutieren nicht mehr über Geschmack, sondern über messbare Parameter.
Kameraführung, Bewegung und Timing präzise steuern
Bewegung ist der häufigste Grund, warum ein sonst gutes KI-Video künstlich wirkt. Meist liegt es nicht am Modell, sondern an einer zu vagen Anweisung. „Dynamische Kamera“ führt zu hektischem, unmotiviertem Gewackel. Benenne die Bewegung lieber explizit.
Kamerabewegungen richtig benennen
- Statisch: Kamera auf Stativ, keine Bewegung. Ideal für Porträts und Produktaufnahmen.
- Fahrt nach vorn / hinten (Dolly): langsame Annäherung, starkes Mittel für emotionale Verdichtung.
- Schwenk (Pan): horizontale Drehung; sparsam einsetzen, da sie Details verwischen kann.
- Neigung (Tilt): vertikale Drehung, gut zum Einführen hoher Gebäude oder Personen.
- Kran / Drohne: aufsteigende oder sinkende Bewegung, wirkt schnell episch, nutzt sich aber ab.
- Handkamera (Handheld): subtile Unruhe, passend für dokumentarische Szenen.
- Tracking: Mitlaufen mit dem Motiv; braucht einen klaren Start- und Endpunkt.
Ergänze immer ein Tempo: „sehr langsam“, „gleichmäßig“, „beschleunigend“, „abrupt stoppend“. Das Modell interpretiert Zeitangaben überraschend zuverlässig, wenn sie konkret sind.
Tempo, Dauer und Rhythmus
Die Clip-Länge bestimmt die mögliche Handlung. Ein 4-Sekunden-Clip trägt eine Geste, ein 8-Sekunden-Clip eine kleine Handlungsfolge, ein 12-Sekunden-Clip nur dann mehr, wenn die Bewegung ruhig bleibt. Überfrachte kurze Clips nicht mit komplexen Abläufen – sonst entstehen Zwischenbilder, in denen Hände verschmelzen oder Requisiten ihre Farbe wechseln.
Für Schnittsequenzen gilt: Wenn du alle Shots mit der gleichen Bewegungsrichtung und dem gleichen Tempo generierst, wirkt die Montage ruhig und professionell. Wechsel zwischen statisch und Handkamera erzeugen Rhythmus, sollten aber bewusst gesetzt werden. Ein praktischer Trick ist, die gewünschte Schnittfrequenz schon im Prompt zu denken: Ein Clip, der in der ersten Sekunde eine Bewegung beginnt und in der letzten beendet, lässt sich deutlich leichter anschließen.
Modellwahl: Passung statt Bauchentscheidung
Nicht jedes Werkzeug ist für jede Aufgabe gleich gut. Die Unterschiede liegen weniger in der „Qualität“ als in der Spezialisierung.
- Fotorealistische Menschen und Gesichter: Modelle mit starkem Fokus auf Gesichtsdetails und Hauttextur. Achte auf Angaben zu Augen, Haarstruktur und natürlicher Mikrobewegung.
- Animations- und Illustrationslooks: Modelle, die flächige Farben und stilisierte Physik gut halten. Hier sind klare Stilbegriffe wichtiger als Brennweiten.
- Produktaufnahmen: Werkzeuge mit stabiler Objektform und kontrollierbarem Hintergrund. Ruhige Kamera, definierte Lichtsetzung, wenig Bewegung.
- Landschaften und Umgebungen: Modelle mit guter Tiefenwirkung; Nebel, Dunst und Wolkenverläufe sind ein guter Indikator.
- Bild-zu-Video: Wenn du Komposition und Figur vorgeben willst, ist die Arbeit mit einem Referenzbild fast immer zuverlässiger als reine Textbeschreibung.
Teste neue Werkzeuge mit einem festen Set aus drei Prompts – ein Porträt, eine Umgebung, eine Bewegung. So vergleichst du fair, statt dich von einzelnen spektakulären Beispielen blenden zu lassen.
Konsistenz über mehrere Szenen
Sobald eine Figur in mehr als einem Clip auftaucht, wird Konsistenz zur wichtigsten Aufgabe. Es gibt vier praktikable Wege:
- Referenzbild-Anker: Du erzeugst ein klares Standbild der Figur und nutzt es als Basis für alle weiteren Shots. Das ist die zuverlässigste Methode.
- Textanker: Du wiederholst exakt dieselben beschreibenden Wörter für Kleidung, Frisur, Alter und Accessoires in jedem Prompt. Wortgleiche Wiederholung ist hier ausdrücklich erwünscht.
- Umgebungsanker: Beschreibe Requisiten und Lichtrichtung identisch, damit der Ort wiedererkennbar bleibt.
- Farbpalette: Nenne zwei bis drei dominante Farben pro Szene. Das stabilisiert den Look über Schnitte hinweg.
Ein typischer Fehler ist, eine Figur in jedem Prompt neu und „schöner“ zu beschreiben. Jede Variation ist eine Einladung an das Modell, ein anderes Gesicht zu erfinden. Konsistenz entsteht durch Wiederholung, nicht durch Abwechslung.
Typische Fehler und ihre Korrektur
Zu viele Aktionen im Prompt. „Sie öffnet die Tür, wirft den Mantel ab, gießt Kaffee ein und liest die Post“ ergibt in fünf Sekunden ein unsauberes Ergebnis. Lösung: eine Handlung pro Clip.
Widersprüchliche Lichtangaben. „Blaue Stunde“ plus „harte Mittagssonne“ führt zu flackerndem Look. Lösung: Lichtsituation eindeutig festlegen, dann eine zweite Lichtquelle als Akzent ergänzen.
Fehlende Blickrichtung. Ohne Angabe schaut das Motiv oft in die Kamera. Ergänze „blickt nach links aus dem Bild“ oder „Blick auf die Hände gesenkt“, wenn du Anschlussfähigkeit brauchst.
Unklare Bewegung. „Die Kamera bewegt sich“ ist offen. Schreibe „gleichmäßige Fahrt nach vorn, 40 cm über 4 Sekunden“.
Text im Bild. Modelle produzieren gern pseudo-lesbare Schriftzüge. Ausschluss ergänzen: „keine Schrift, kein Logo, keine Schilder mit Text“.
Überladene Hände und Requisiten. Finger, Besteck oder dünne Kabel sind klassische Problemzonen. Lösung: Hände beschäftigt, aber nicht feinmotorisch einsetzen – Motiv hält eine Tasse statt eine Nadel einzufädeln.
Zu viele Stilbegriffe. Fünf Stilreferenzen ergeben Matsch. Zwei bis drei genügen.
Kein Negativ-Prompt bei Bild-zu-Video. Wenn das Referenzbild störende Elemente enthält, wandern sie ins Video. Ausschlüsse auch hier formulieren.
Prompt-Bausteine, Qualitätssicherung und Versionierung
Wiederverwendbare Prompt-Bausteine
Baue eine kleine Bibliothek aus Textblöcken, die du kombinierst:
- Licht: „weiches Nordlicht, keine harten Schatten“ | „goldene Stunde von hinten, warmer Rand“ | „Neonreflexe auf nasser Straße“
- Optik: „35 mm, flache Schärfentiefe, sanfter Bokeh-Hintergrund“ | „85 mm Porträt, Hintergrund stark unscharf“
- Textur: „leichte 16-mm-Körnung, minimales Halation“ | „glasklare Digitaloptik“
- Kamera: „statisch auf Stativ, kein Zoom“ | „langsame Fahrt nach vorn, gleichmäßiges Tempo“
- Ausschluss: „keine Schrift, kein Logo, keine zusätzlichen Personen, keine verzerrten Hände“
Diese Blöcke halten deine Prompts konsistent und machen Variationen kontrollierbar. Wenn ein Ergebnis nicht passt, tauschst du gezielt einen Block aus.
Versionierung und Qualitätssicherung
Führe eine einfache Tabelle mit den Spalten Szenen-ID, Prompt-Version, Parameter, Datei, Bewertung, Notiz. Bewerte jeden Take auf drei Kriterien: Komposition, Bewegungsqualität, Figurenkonsistenz. Nur wenn alle drei stimmen, geht der Clip in die Montage.
Prüfe jedes Ergebnis in vier Durchgängen: erst in Originalgröße (Details), dann verkleinert (Komposition), dann als Standbild in der Mitte (Bildsprache), dann in der Timeline neben den Nachbarclips (Anschlussfähigkeit). Viele Fehler fallen erst im Kontext der Montage auf.
FAQ
Wie lang sollte ein Prompt sein?
So lang wie nötig, so kurz wie möglich. Vier bis acht strukturierte Zeilen decken die meisten Fälle ab. Länge ohne Struktur verschlechtert das Ergebnis, weil die Prioritäten verwischen.
Soll ich Prompts auf Deutsch oder Englisch schreiben?
Die meisten Modelle sind auf englischsprachigen Daten trainiert und reagieren dort präziser. Wenn dein Textverständnis reicht, formuliere auf Englisch und notiere die deutsche Intention daneben. Viele Werkzeuge verstehen aber auch deutsche Beschreibungen zuverlässig – teste es mit einem fixen Vergleichsprompt.
Wie viele Durchläufe braucht ein brauchbarer Clip?
Rechne mit drei bis acht Versuchen. Mit strukturierten Prompts und einem Referenzbild sinkt die Zahl deutlich. Wenn du nach fünfzehn Durchläufen nichts Brauchbares hast, ist meist das Konzept zu komplex – zerlege den Shot weiter.
Warum sehen Gesichter in kurzen Clips oft fremd aus?
Weil das Modell bei jeder neuen Generierung Details anders auflöst. Nutze ein Referenzbild, halte die Kopfbewegung gering und vermeide schnelle Drehungen ins Profil.
Was tun gegen Flackern zwischen Frames?
Tempo reduzieren, weniger konkurrierende Bewegungen, stabilere Lichtangaben. Auch eine höhere Bewegungsschärfe oder eine kürzere Clip-Länge hilft häufig.
Wie bekomme ich Kamerabewegungen ohne Wackeln?
Formuliere „gleichmäßig“, „auf Stativ“ oder „ruhige Fahrt“ und vermeide gleichzeitig mehrere Bewegungsachsen. Bewegung in zwei Richtungen zugleich erzeugt fast immer unruhige Ergebnisse.
Kann ich Ton mitprompten?
Viele Werkzeuge erzeugen begleitendes Audio. Beschreibe es getrennt: „Umgebungston: Regen auf Metall, gedämpfte Stimmen im Hintergrund, keine Musik“. So bleibt Bild und Ton unabhängig kontrollierbar.
Wie übertrage ich denselben Look auf ein ganzes Projekt?
Indem du Licht-, Optik- und Texturblöcke in jedem Prompt wortgleich wiederholst und zusätzlich eine feste Farbpalette definierst. Diese Blöcke werden zur Projektvorgabe, nicht zum Einzelfall.
Woran erkenne ich, dass ein Prompt zu voll ist?
Wenn Ergebnisse unvorhersehbar werden und einzelne Elemente willkürlich verschwinden. Dann entferne alles außer Subjekt, Handlung, Umgebung und einer Stilangabe – und baue von dort aus neu auf.
Brauche ich für jede Szene einen neuen Prompt?
Nein. Baue einen Grundprompt mit allen stabilen Angaben und variiere nur die Zeilen für Handlung und Kamera. Das spart Zeit und schützt die Konsistenz des gesamten Projekts.



