Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Prompt Engineering für Video-Künstler: bessere KI-Befehle

Oct 5, 2026

Warum Prompt-Qualität heute über die Qualität deiner Videos entscheidet

Generative Videomodelle sind in den letzten Jahren extrem spezialisiert geworden. Aus einem Satz wie „Ein Astronaut läuft durch eine Stadt“ bekommst du zwar irgendein Ergebnis, aber selten das, was du dir vorgestellt hast. Die eigentliche künstlerische Arbeit beginnt deshalb nicht mehr am Set, sondern in der Textzeile: Der Prompt ist das neue Storyboard, die neue Lichtsetzung und die neue Kamera-Führung in einem.

Das Problem: Ein Prompt ist keine Beschreibung. Er ist eine technische Anweisung an ein System, das Wahrscheinlichkeiten gewichtet. Wörter haben unterschiedliches Gewicht, Reihenfolge beeinflusst Priorität, und Negationen funktionieren in vielen Modellen ganz anders, als du es aus der Alltagssprache kennst. Wer das ignoriert, verbringt Stunden mit Nachbesserungen und wundert sich, warum die Hand der Figur schmilzt, obwohl „perfekte Hände“ im Text stand.

Dieser Leitfaden ist kein theoretischer Aufsatz über Sprachmodelle. Es ist ein Arbeitshandbuch für Menschen, die Videos produzieren: Musikvideos, Werbespots, Kurzfilme, Social-Clips, animierte Sequenzen. Du lernst, wie du Prompts aufbaust, wie du modelsspezifisch denkst, wie du iterierst und wie du vermeidbare Fehler erkennst, bevor du Rechenzeit und Nerven verbrennst.

Die vier Säulen eines tragfähigen Video-Prompts

Ein Prompt, der reproduzierbare Ergebnisse liefert, besteht aus vier Komponenten. Du kannst sie in unterschiedlicher Reihenfolge schreiben, aber alle vier sollten vorkommen.

Säule 1: Subjekt und Handlung

Wer oder was ist zu sehen, und was tut diese Figur? „Eine Frau“ ist zu vage. „Eine Frau Anfang dreißig in abgetragener Wachsjacke, die eine Öllampe anzündet und dabei zweimal zur Tür blickt“ gibt dem Modell ein Motiv, eine Handlung und eine innere Spannung. Achte darauf, dass die Handlung in einem Zeitfenster von fünf bis zehn Sekunden plausibel bleibt. Mehrere Handlungen nacheinander führen fast immer zu einem Bruch, weil das Modell keinen echten zeitlichen Übergang kennt – es hat nur eine sehr kurze Sequenz gelernt.

Säule 2: Kamera und Bildkomposition

Kamerasprache ist das stärkste Werkzeug, das du hast. Begriffe wie Totale, Halbnahe, Nahaufnahme, Over-the-Shoulder, Dolly-in, Slider, Handkamera, Stativ, Drohnenflug, Dutch Angle, Makro oder Weitwinkel verändern das Ergebnis dramatischer als jede Stilbeschreibung. Ein häufig unterschätzter Punkt: Nenne die Brennweite oder das Objektivgefühl. „85-mm-Porträtobjektiv, geringe Tiefenschärfe, Hintergrund in weichem Bokeh“ erzeugt ein anderes Bild als „24-mm-Weitwinkel, tiefe Schärfe, viel Raum um die Figur“.

Säule 3: Licht und Farbwelt

Licht ist Stimmung. Beschreibe nicht nur die Helligkeit, sondern die Lichtquelle und ihre Richtung: „warmes Gegenlicht einer tiefstehenden Sonne“, „kaltes Neonlicht von oben links“, „Kerzenlicht mit flackerndem Schattenwurf“, „bewölktes Nordlicht durch ein hohes Industriefenster“. Ergänze eine Farbpalette: „entsättigte Blautöne mit einem einzigen warmen Akzent“, „kräftiges Magenta und Cyan im Retrostil“, „monochrom in Grüntönen“. Farbangaben stabilisieren die Stimmung über mehrere Einstellungen hinweg.

Säule 4: Bewegung im Bild

Videomodelle verstehen Bewegung oft besser als Details. Beschreibe, was sich bewegt: Haare im Wind, Rauch, der nach oben zieht, Regentropfen auf einer Fensterscheibe, Partikel im Sonnenlicht, eine Kamera, die langsam nach links schwenkt. Wenn du Bewegung nicht beschreibst, entscheidet das Modell selbst – und es entscheidet meistens langweilig oder chaotisch.

Reihenfolge, Syntax und Gewichtung richtig einsetzen

Die Reihenfolge der Informationen ist kein Zufall. Die meisten Modelle gewichten den Anfang und das Ende einer Prompt-Zeile stärker als die Mitte. Subjekt und Hauptmotiv gehören deshalb nach vorne, technische Parameter an den Schluss.

Ein bewährter Aufbau sieht so aus:

[Subjekt + Handlung], [Ort und Zeit], [Kamera und Brennweite],
[Licht und Farbwelt], [Bewegung], [Stilreferenz], [technische Parameter]

Konkret:

Eine ältere Uhrmacherin beugt sich über ein Werkstattpult und setzt ein Zahnrad ein,
staubige Werkstatt im Morgengrauen, Halbnahe mit 50-mm-Objektiv und leichter
Handkamera, warmes Streiflicht durch ein Sprossenfenster, Staubpartikel in der Luft,
ruhige, präzise Bewegungen, dokumentarischer Realismus,
Seitenverhältnis 16:9

Kommas statt Romane

Prompt-Modelle verarbeiten kurze, kommagetrennte Einheiten besser als verschachtelte Nebensätze. Das bedeutet nicht, dass du in Stichworten schreiben musst, aber lange Schachtelsätze mit drei Relativsätzen verwässern die Anweisung. Zerlege komplexe Ideen lieber in zwei Prompts.

Gewichtung mit Klammern

Viele Systeme unterstützen Klammernotation, um die Priorität zu erhöhen oder zu senken. Übliche Formen sind (Begriff), ((Begriff)) oder (Begriff:1.3), wobei der Zahlenwert die Stärke angibt. Ein zu hoher Wert führt zu Artefakten: Wenn du „(Kerzenlicht:2.0)“ schreibst, kann die gesamte Szene in Flammenoptik kippen. Arbeite mit moderaten Werten zwischen 1.1 und 1.4 und erhöhe nur, wenn sich sonst nichts bewegt.

Negationen sind kein Universalschalter

Negative Prompts funktionieren bei einigen Modellen zuverlässig, bei anderen gar nicht oder sogar gegenteilig. Manche Systeme haben ein eigenes Feld dafür, andere erwarten eine Negative-Formel im Prompt-Text, wieder andere ignorieren Negationen vollständig, weil sie nur aus Positivbeispielen gelernt haben.

Die sicherste Strategie: Beschreibe, was du willst, statt was du nicht willst. Statt „keine Unschärfe“ schreibe „gestochen scharfe Details“. Statt „kein Regen“ schreibe „trockener Asphalt, klarer Himmel“. Wenn du ein separates Negativfeld hast, halte es kurz und konkret: „Wasserzeichen, Text, zusätzliche Gliedmaßen, verzerrte Gesichter“. Lange Negativlisten verwirren mehr, als sie helfen.

Modellspezifisch prompten: Realismus, Stil, Konsistenz

Jedes Modell hat eine eigene visuelle Signatur. Wer dieselbe Formulierung überall verwendet, bekommt überall mittelmäßige Ergebnisse.

Cinematischer Realismus

Realismusmodelle belohnen Kamera- und Lichtsprache und bestrafen abstrakte Adjektive. „Schön“, „episch“ oder „atemberaubend“ tragen wenig bei, weil sie keinen visuellen Anker haben. Ersetze sie durch beobachtbare Details: Hautporen, Stoffstruktur, Kondenswasser auf Metall, ein leichtes Zittern der Kamera.

Ein realistischer Prompt sollte außerdem ein physikalisches Verhalten beschreiben. Wenn eine Figur eine Tür öffnet, nenne die Bewegung der Tür und die Reaktion des Lichts. Modelle erzeugen überzeugende Ergebnisse, wenn sie wissen, welche Kräfte wirken.

Stilisierte und illustrative Ästhetik

Bei Animations- und Illustrationsmodellen funktioniert eine andere Grammatik. Hier helfen Stilreferenzen aus der Kunstgeschichte oder dem Medium selbst: Cel-Shading, Aquarell mit sichtbaren Rändern, Siebdruck, Bleistiftskizze, Retro-Anime der späten Achtziger, Stop-Motion mit sichtbaren Fingerabdrücken. Wähle pro Prompt zwei bis drei Stilbegriffe. Mehr führen zu einem Mischmasch, in dem das Modell die Referenzen gegeneinander ausspielt.

Charakterkonsistenz und Video-zu-Video

Wenn eine Figur über mehrere Einstellungen hinweg gleich aussehen soll, brauchst du einen wiederholbaren Identitätsblock. Das ist eine kurze, immer identisch formulierte Beschreibung: Alter, Gesichtsform, Frisur, Kleidung, ein einziges markantes Merkmal. Diesen Block kopierst du wortgleich in jeden Prompt und änderst nur Kamera, Licht und Handlung.

Bei Video-zu-Video- oder Bild-zu-Video-Workflows verschiebt sich die Aufgabe: Das Quellmaterial liefert Identität und Komposition, der Prompt liefert Transformation. Beschreibe dann nicht mehr, wer zu sehen ist, sondern wie sich das Material verändern soll: „Übergang von Tageslicht zu Nacht, Neonreflexionen auf nasser Straße, Kamera bleibt stabil“. Zu viele inhaltliche Änderungen gleichzeitig führen zu Flackern und Identitätsverlust.

Iteration als Handwerk: vom Groben zum Feinen

Gute Ergebnisse entstehen selten im ersten Durchlauf. Behandle die Generierung als Dialog mit vier Runden.

Runde 1 – Komposition. Nutze einen kurzen Prompt mit Subjekt, Kameraeinstellung und Licht. Ziel ist nicht Perfektion, sondern die richtige Bildidee.

Runde 2 – Bewegung. Ergänze die Bewegungsbeschreibung. Variiere nur diese eine Ebene, damit du weißt, was gewirkt hat.

Runde 3 – Stil und Farbe. Nun kommen Stilbegriffe und Farbpalette dazu. Prüfe, ob die Figur noch konsistent ist.

Runde 4 – Feinschliff. Erst jetzt kommen Gewichtungen, Negativfeld und technische Parameter wie Seitenverhältnis, Framerate oder Länge.

Wichtig: Ändere pro Durchlauf maximal zwei Variablen. Wenn du gleichzeitig Kamera, Licht, Stil und Handlung umstellst, kannst du nicht mehr nachvollziehen, welcher Begriff das Ergebnis verbessert hat. Führe ein einfaches Prompt-Log, in dem du Version, Prompt, Seed und Bewertung notierst. Nach zwanzig Einträgen erkennst du Muster, die du sonst nie gefunden hättest.

Der Seed als Konstante

Wenn dein Modell Seed-Werte unterstützt, friere den Seed ein, sobald die Komposition stimmt. So bleiben Figur, Raum und Farbstimmung stabil, während du am Prompt feilst. Änderst du den Seed, änderst du das Modell universum – und beginnst wieder bei Runde eins.

Länge der Sequenz planen

Fast alle Modelle verlieren über die Zeit an Konsistenz. Plane kurze Takes von drei bis sechs Sekunden und schneide sie später zusammen, statt eine lange Einstellung zu erzwingen. Für einen zwanzigsekündigen Clip brauchst du in der Regel vier bis sechs einzelne Generierungen – jede mit eigenem Prompt.

Prompt-Bausteine für wiederkehrende Formate

Wer regelmäßig produziert, braucht Vorlagen. Die folgenden Blöcke sind als Ausgangspunkt gedacht und lassen sich kombinieren.

Produkt und Werbung

Makroaufnahme eines [Produkts] auf [Untergrund], 100-mm-Makro, minimaler Fokus-Sprung,
weiches Studiolicht von links, sanfter Reflexionsverlauf auf der Oberfläche,
langsame Kamerafahrt von links nach rechts, klare Farbwiedergabe, kein Text

Typische Fehler hier: zu viel Bewegung, unruhiger Hintergrund, spiegelnde Flächen ohne Kontrolle. Reduziere Bewegung auf ein Minimum – Produktvideos wirken durch Ruhe hochwertig.

Musikvideo und Performance

Sängerin im Gegenlicht auf einer leeren Bühne, Halbnahe, 35-mm-Objektiv,
Scheinwerfer von hinten, künstlicher Nebel, langsamer Dolly-in,
Silhouette mit sichtbarem Haarflug, körniger Filmlook

Bei Performance-Clips ist Lippensynchronität ein bekanntes Problem. Vermeide geschlossene Münder oder lange Sprechpassagen im Prompt, wenn kein Audio-Guidance-Modell verwendet wird. Setze stattdessen auf Körperbewegung und Atmosphäre.

Landschaft und Establishing Shot

Drohnenflug langsam nach vorne, tiefe Schärfe, kühle Blau- und Violetttöne,
feiner Dunst in den Tälern, keine Menschen im Bild

Establishing Shots profitieren von langsamer, monotoner Bewegung. Schnelle Kamerafahrten werden bei Landschaften oft als ruckelig interpretiert.

Charakter-Close-up

Nahaufnahme einer [Figur] mit [markantem Merkmal], 85-mm-Porträtobjektiv,
weiches Fensterlicht von rechts, ruhiger Blick leicht an der Kamera vorbei,
minimale Bewegung, realistische Hautstruktur

Close-ups sind der Test für Konsistenz. Wenn du dieselbe Figur in drei Einstellungen brauchst, wiederhole den Identitätsblock wortgleich.

Häufige Fehler, die Ergebnisse ruinieren

Zu viele Konzepte in einem Prompt. Wenn drei Settings, zwei Figuren und ein Stilwechsel gleichzeitig gefordert werden, verteilt das Modell seine Kapazität und liefert einen Kompromiss aus allem. Ein Prompt, eine Idee.

Abstrakte Qualitätsadjektive. „4K, ultra HD, masterpiece, best quality“ haben in vielen Modellen kaum Wirkung auf die Bildkomposition. Sie verändern höchstens die Detaildichte. Nutze stattdessen konkrete visuelle Merkmale.

Widersprüchliche Lichtangaben. „Neonlicht“ und „Kerzenlicht“ gleichzeitig erzeugen eine Mischbeleuchtung, die selten gewollt wirkt. Entscheide dich für eine Hauptlichtquelle und beschreibe höchstens eine schwache Sekundärquelle.

Ignorieren des Seitenverhältnisses. Ein vertikaler Prompt für ein horizontales Format führt zu abgeschnittenen Köpfen oder leeren Flächen. Formuliere die Komposition passend zum Ausgabeformat – bei Hochformat gehört die Figur ins obere Drittel, nicht in die Bildmitte.

Bewegung vergessen. Ohne Bewegungsangabe erzeugt das Modell Mikrobewegungen oder gar keine. Ein Video, in dem sich nichts bewegt, wirkt wie ein Standbild mit Rauschen.

Kein Prompt-Archiv. Wer seine guten Prompts nicht speichert, verliert sie. Ein einfaches Textdokument mit Kategorien und kurzen Notizen spart langfristig mehr Zeit als jedes zusätzliche Tool.

Modellwahl als Teil des Promptings

Die Wahl des Werkzeugs ist eine künstlerische Entscheidung, keine reine Qualitätsfrage. Frage dich vor jedem Projekt:

  • Brauche ich fotorealistische Menschen? Dann kommt ein Modell mit starker Realismus-Ausrichtung infrage, und dein Prompt sollte auf Haut, Licht und Physik setzen.
  • Brauche ich einen klaren Stil, der über viele Clips hinweg gleich bleibt? Dann wähle ein Modell mit starker Stilkohärenz und halte die Stilbegriffe wortgleich.
  • Brauche ich Identität über mehrere Einstellungen? Dann brauchst du Referenzbilder oder Video-zu-Video, nicht nur Text.
  • Brauche ich Kontrolle über Kamerafahrten? Dann prüfe, ob das System Kameraanweisungen explizit unterstützt – manche reagieren stark, andere ignorieren sie.

Ein Teil des Handwerks besteht darin, denselben Prompt in zwei Systemen zu testen und die Ergebnisse zu vergleichen. Oft sind die Unterschiede größer als jede Prompt-Optimierung.

Workflow für ein reales Projekt

Angenommen, du produzierst einen sechzigsekündigen Kurzfilm-Trailer mit acht Einstellungen.

  1. Konzept und Shotlist. Schreibe für jede Einstellung einen Satz: was passiert, wie die Kamera steht, welche Stimmung herrscht. Das ist deine Basis.
  2. Identitätsblock definieren. Beschreibe Hauptfigur und Hauptschauplatz in jeweils zwei Zeilen. Diese Blöcke bleiben unverändert.
  3. Basis-Prompts bauen. Kombiniere Identitätsblock, Handlung, Kamera und Licht. Halte Stilbegriffe zunächst zurück.
  4. Testgenerierung pro Einstellung. Generiere zwei Varianten, wähle die bessere, notiere Seed und Prompt.
  5. Stil harmonisieren. Ergänze in allen Prompts dieselben zwei bis drei Stilbegriffe und dieselbe Farbpalette.
  6. Übergänge planen. Notiere bei jeder Einstellung, wie sie endet und wie die nächste beginnt. Häufig hilft ein passender Bewegungsvektor: endet die Kamera links, beginnt die nächste Einstellung ebenfalls links.
  7. Schnitt und Nachbearbeitung. Farbe, Körnung und Ton angleichen. Ein leichter Film-Look kaschiert kleine Unterschiede zwischen den Clips sehr wirksam.
  8. Archiv anlegen. Speichere die finalen Prompts samt Seeds und Einstellungen für spätere Projekte.

Checkliste vor dem Rendern

  • Enthält der Prompt Subjekt, Handlung, Kamera, Licht und Bewegung?
  • Steht das Hauptmotiv am Anfang?
  • Ist die Beschreibung frei von abstrakten Qualitätsphrasen?
  • Passt die Komposition zum Seitenverhältnis?
  • Gibt es nur eine Hauptlichtquelle?
  • Ist die Handlung in fünf bis zehn Sekunden realistisch abbildbar?
  • Sind Stilbegriffe auf zwei bis drei beschränkt?
  • Ist der Identitätsblock bei mehrteiligen Serien wortgleich?
  • Ist das Negativfeld kurz und konkret?
  • Ist der Seed notiert?

Diese zehn Fragen kosten zwei Minuten und sparen häufig mehrere Generierungsrunden.

FAQ: Antworten auf die häufigsten Fragen

Wie lang sollte ein Prompt sein?
Für die meisten Modelle liegt der praktische Bereich zwischen 30 und 80 Wörtern. Kürzere Prompts geben dem Modell mehr Freiheit, längere geben mehr Kontrolle. Bei komplexen Szenen sind zwei kürzere Prompts mit anschließendem Schnitt fast immer besser als ein überladener Satz.

Hilft es, Prompts auf Englisch zu schreiben?
Viele Modelle sind auf englischsprachigen Daten trainiert, weshalb englische Prompts manchmal stabiler wirken. In der Praxis entscheidet aber die Präzision der Begriffe, nicht die Sprache. Wenn dein Modell mehrsprachig arbeitet, teste beide Varianten mit demselben Inhalt und vergleiche.

Warum ignoriert das Modell meine Negationen?
Weil viele Systeme aus Positivbeispielen lernen und keinen echten Ausschlussmechanismus haben. Verlasse dich auf positive Umschreibungen und ein separates Negativfeld, falls vorhanden.

Wie bekomme ich dieselbe Figur in mehreren Clips?
Nutze einen wortgleichen Identitätsblock, friere den Seed ein und arbeite, wenn möglich, mit Referenzbildern oder Video-zu-Video. Erwarte trotzdem kleine Abweichungen – perfekte Konsistenz ist derzeit der schwierigste Teil der Produktion.

Was tun, wenn die Bewegung ruckelt?
Reduziere die Geschwindigkeit im Prompt, verringere die Anzahl gleichzeitiger Bewegungen und kürze den Clip. Häufig liegt das Problem an zu vielen Bewegungsvektoren in einer kurzen Sequenz.

Wie viele Varianten sollte ich generieren?
Zwei bis vier pro Einstellung sind ein guter Richtwert. Mehr Varianten bedeuten nicht automatisch bessere Ergebnisse – oft ist der Prompt das Problem, nicht die Anzahl der Versuche.

Sollte ich Prompts für verschiedene Modelle unterschiedlich schreiben?
Ja. Ein und derselbe Prompt verhält sich in unterschiedlichen Systemen anders, weil Trainingsdaten, Textencoder und Bewegungshandling variieren. Führe pro Werkzeug eine eigene Prompt-Bibliothek.

Fazit: Prompting als eigene Disziplin

Prompt Engineering für Videokunst ist kein Trick, sondern eine Handwerksdisziplin mit eigener Grammatik. Wer Subjekt, Kamera, Licht und Bewegung systematisch beschreibt, wer Negationen richtig einsetzt, wer pro Durchlauf nur eine Variable ändert und wer seine Ergebnisse archiviert, produziert schneller und besser als jemand, der zufällig Sätze variiert.

Der wichtigste Rat ist unspektakulär: Schreibe mit, was funktioniert. Die wertvollsten Prompts entstehen nicht aus Genialität, sondern aus zwanzig dokumentierten Versuchen. Wer diese Bibliothek über Monate aufbaut, hat irgendwann ein Repertoire, mit dem sich jede neue Idee in wenigen Minuten in bewegte Bilder übersetzen lässt.

Alexander

Alexander