Limited Time Offer: Get 50% OFF your first month of Pro & Ultra plans 🎉

Prompt-Engineering für KI-Kunst und Video: Techniken & Workflows

Sep 21, 2026

Warum Prompt-Engineering über die Qualität deiner Ergebnisse entscheidet

Ein Prompt ist keine Bestellung, sondern eine Spezifikation. Wer einem generativen Modell schreibt „ein Ritter im Wald bei Sonnenuntergang“, bekommt genau das: eine Durchschnittsinterpretation. Wer dagegen Brennweite, Lichtstimmung, Materialbeschaffenheit, Bewegungsrichtung und Bildkomposition definiert, bekommt ein Ergebnis, das zu einer bewussten Bildsprache passt. Der Unterschied liegt selten im Talent, fast immer in der Struktur.

Generative Modelle für Kunst und Video haben sich in den letzten Jahren in einem Punkt fundamental verändert: Sie verstehen längere, komplexere Anweisungen deutlich besser als früher. Das verschiebt die eigentliche Herausforderung. Früher musste man ein Modell mit wenigen Wörtern zu einem brauchbaren Ergebnis zwingen. Heute muss man entscheiden, welche der zwanzig möglichen Informationen wirklich relevant sind – und in welcher Reihenfolge sie stehen.

Das hat eine unangenehme Konsequenz: Ein zu kurzer Prompt lässt zu viel Interpretationsspielraum, ein zu langer Prompt verwässert die wichtigen Signale. Gutes Prompt-Engineering ist deshalb kein Sammeln von Schlagwörtern, sondern ein Priorisieren. Man entscheidet bewusst, welche drei bis fünf Merkmale das Ergebnis tragen sollen, und behandelt den Rest als Rahmenbedingungen.

Noch ein zweiter Punkt wird oft unterschätzt: Video ist nicht Bild plus Bewegung. Ein Bild muss einen einzigen Moment überzeugen. Ein Video muss diesen Moment über mehrere Sekunden hinweg halten, ohne dass Gesichter zerfließen, Proportionen kippen oder Lichtrichtungen springen. Genau deshalb braucht Video-Prompting zusätzliche Disziplinen: Kontinuität, Kameraführung und eine klare Vorstellung davon, was sich im Bild überhaupt verändern soll.

Dieser Leitfaden behandelt beides – die statische Kunst und das bewegte Bild – als zusammenhängenden Workflow. Du lernst, wie du Prompts aufbaust, wie du Konsistenz erzwingst, wie du Fehler diagnostizierst und wie du Ergebnisse reproduzierbar machst, statt bei jedem Versuch neu zu würfeln.

Die Anatomie eines belastbaren Prompts

Ein guter Prompt besteht aus klar trennbaren Komponenten. Wenn du sie bewusst durchgehst, kannst du später gezielt einzelne Teile austauschen, statt den ganzen Prompt neu zu schreiben. Das ist der wichtigste Produktivitätsgewinn überhaupt.

Motiv, Aktion und Kontext

Die erste Ebene beantwortet drei Fragen: Wer oder was ist zu sehen, was tut es, und wo befindet es sich? Diese Ebene sollte immer am Anfang stehen, weil sie den stärksten Einfluss auf das Ergebnis hat. Formuliere konkret, aber nicht überladen. „Eine ältere Kartografin beugt sich über eine handgezeichnete Karte“ ist deutlich steuerbarer als „eine Frau mit einer Karte“.

Achte darauf, dass die Aktion im Video eine sichtbare Veränderung beschreibt. „Sie steht am Fenster“ ist ein Zustand. „Sie dreht den Kopf langsam zum Fenster“ ist eine Handlung, die das Modell als Bewegung interpretieren kann. Zustände erzeugen oft Standbilder mit minimaler Drift, Handlungen erzeugen echte Sequenzen.

Der Kontext liefert Ort, Zeit und Atmosphäre. Auch hier gilt: lieber ein präzises Detail als drei vage Adjektive. „Verstaubtes Archiv mit hohen Regalen“ sagt mehr als „interessanter, alter, leicht düsterer Raum“.

Stil, Material und Bildsprache

Die zweite Ebene definiert, wie das Ergebnis aussieht. Hier gehören Begriffe zu Technik, Material und Epoche hin. Also etwa: analoge Filmaufnahme mit feinem Korn, handgezeichnete Tuscheillustration, gerenderte Oberflächen mit leichter Reflektionsunschärfe, flächige Vektorästhetik.

Vorsicht bei widersprüchlichen Stilangaben. „Fotorealistisch“ und „Aquarell“ gleichzeitig ergibt meist Matsch. Wenn du Mischformen willst, benenne die Hierarchie: „fotorealistische Basis, darüber eine halbtransparente Aquarelltextur“ funktioniert deutlich besser als zwei gleich gewichtete Stilbegriffe.

Kamera, Licht und Bewegung

Die dritte Ebene ist bei Video entscheidend und bei Bildern ein starker Verstärker. Kameraangaben wirken überraschend zuverlässig, wenn sie physikalisch formuliert sind: Brennweite, Kamerahöhe, Distanz, Neigung. „Nahaufnahme auf Augenhöhe mit 85 mm und geringer Tiefenschärfe“ ist eine brauchbare Anweisung, „filmisch“ ist keine.

Bewegung beschreibst du am besten in drei Teilen: Kamerabewegung, Motivbewegung und Bewegungsgeschwindigkeit. Also: langsamer Schwenk nach rechts, die Figur geht auf die Kamera zu, gleichmäßiges Tempo. Damit vermeidest du das häufigste Problem hakeliger Clips: ein Modell, das nicht weiß, ob sich die Kamera oder das Motiv bewegen soll.

Licht beschreibst du über Richtung, Härte und Farbe. „Hartes Gegenlicht von links, warm, mit deutlicher Kantenbetonung“ liefert mehr als „schöne Beleuchtung“. Denke in Lichtquellen, nicht in Stimmungen.

Parameter und ihre Reihenfolge

Die Reihenfolge im Prompt ist keine Kosmetik. Was am Anfang steht, wird stärker gewichtet. Bewährte Ordnung: Motiv und Handlung, dann Umgebung, dann Stil, dann Kamera und Licht, dann technische Feinheiten. Negative Anweisungen und Ausschlüsse gehören ans Ende.

Negativanweisungen und Gewichtung richtig einsetzen

Negative Anweisungen sind mächtig, aber sie sind kein Ersatz für präzise Formulierungen. Wer „kein Wasser, kein Blau, keine Menschen“ schreibt, erzeugt oft trotzdem genau diese Elemente, weil das Modell die Begriffe überhaupt erst aktiviert. Effektiver ist es, das gewünschte Ergebnis positiv zu beschreiben und Negativanweisungen nur für wiederkehrende, konkrete Störfaktoren zu nutzen.

Typische sinnvolle Ausschlüsse sind: verzerrte Hände, doppelte Gliedmaßen, Text im Bild, Wasserzeichen, übersättigte Farben, flackerndes Licht, unruhige Komposition. Diese Liste ist kurz, weil sie spezifisch ist. Eine lange Sammlung allgemeiner Verbote verwässert die Steuerung.

Gewichtung funktioniert in vielen Oberflächen über Klammern oder Zahlen. Nutze sie sparsam. Wenn du drei Begriffe gleichzeitig verstärkst, heben sie sich gegenseitig auf und die restlichen Informationen verlieren an Einfluss. Setze eine Gewichtung nur dann, wenn ein Merkmal in mehreren Versuchen konsequent ignoriert wurde.

Bei Video kommt ein zusätzlicher Hebel hinzu: die zeitliche Verteilung. Manche Systeme erlauben es, Anweisungen für Anfang, Mitte und Ende zu trennen. Wenn dein Werkzeug das unterstützt, formuliere die Sequenz explizit – Einstieg, Entwicklung, Ausklang – statt alles als gleichzeitige Beschreibung zu schreiben.

Ein Workflow in sieben Schritten von der Idee zum fertigen Clip

Ein fester Ablauf spart mehr Zeit als jede Trickformulierung. Bewährt hat sich folgende Reihenfolge.

  1. Referenz festlegen. Suche zwei bis drei Bilder oder Clips, die den Zielstil beschreiben. Ohne visuelle Referenz diskutierst du über Wörter statt über Ergebnisse.
  2. Basis-Prompt schreiben. Motiv, Handlung, Umgebung – nicht mehr. Generiere zwei bis drei Varianten und prüfe, ob die Grundidee trägt.
  3. Stil ergänzen. Erst wenn die Komposition stimmt, kommen Stil, Material und Farbwelt hinzu.
  4. Kamera und Licht hinzufügen. Formuliere physikalisch, nicht atmosphärisch.
  5. Bewegung spezifizieren. Kameraweg, Motivbewegung, Tempo. Bei Standbildern entfällt dieser Schritt.
  6. Ausschlüsse ergänzen. Nur konkrete Störfaktoren aus den bisherigen Versuchen.
  7. Seed fixieren und verfeinern. Sobald ein Ergebnis in die richtige Richtung geht, halte den Seed fest und ändere nur noch einen Parameter pro Durchgang.

Der letzte Punkt ist der wichtigste und wird am häufigsten ignoriert. Wer gleichzeitig Stil, Kamera und Licht ändert, kann nicht erkennen, welche Änderung gewirkt hat. Ein-Faktor-pro-Iteration klingt langsam, ist in der Praxis aber deutlich schneller als blindes Herumprobieren.

Konsistenz über mehrere Szenen hinweg

Konsistenz ist die härteste Disziplin im Video-Prompting. Ein einzelner schöner Clip ist einfach; fünf Clips mit derselben Figur und demselben Raum sind Arbeit. Es gibt drei Ebenen, auf denen du sie absichern musst.

Figurenkonsistenz

Beschreibe eine Figur mit einer festen Merkmalsliste und ändere sie nie zwischen Szenen. Diese Liste sollte fünf bis acht Merkmale umfassen, die sich visuell eindeutig unterscheiden lassen: ungefähres Alter, Frisurform, Kleidung mit Farbe und Schnitt, ein wiedererkennbares Detail wie eine Brille oder ein bestimmtes Accessoire, und die Grundstatur. Alles, was nicht auf dieser Liste steht, überlässt du bewusst dem Modell – sonst wird die Beschreibung zu lang und die Merkmale beginnen zu konkurrieren.

Zusätzlich hilft es, dieselbe Formulierung wortwörtlich zu wiederholen. Synonyme sind hier schädlich. Wenn die Figur in Szene eins „kurzes dunkles Haar“ hat und in Szene drei „dunkle Kurzhaarfrisur“, sind das für das Modell unterschiedliche Signale.

Objekt- und Umgebungskonsistenz

Räume funktionieren nach derselben Logik. Definiere drei bis vier Ankerpunkte – Lichtquelle, dominantes Material, eine auffällige Form – und wiederhole sie. Ein Raum, der immer „von hohen Fenstern links beleuchtet“ ist, bleibt über Szenen hinweg erkennbar, selbst wenn Möbel variieren.

Bei Objekten lohnt sich eine funktionale Beschreibung statt einer stilistischen. „Eine flache Holzkiste mit Metallverschluss“ ist stabiler als „eine schöne alte Kiste“, weil Material und Form konkrete visuelle Merkmale liefern.

Übergänge planen

Konsistenz bricht am häufigsten an Übergängen. Plane Schnitte bewusst: Wenn die Kamera in Szene zwei nach links schwenkt, sollte Szene drei nicht mit einem Schwenk nach rechts beginnen, wenn beide Szenen als zusammenhängend gelesen werden sollen. Achte außerdem auf die Lichtrichtung – ein Wechsel von Gegenlicht zu Frontlicht wirkt wie ein Ortswechsel, auch wenn du keinen wolltest.

Kameraführung, Licht und Bewegung präzise beschreiben

Kamerasprache ist erlernbar und belohnt klare Begriffe. Die folgenden Formulierungen haben sich in der Praxis als zuverlässig erwiesen, weil sie physikalische Größen statt Emotionen beschreiben.

  • Einstellungsgröße: Weitaufnahme, Halbtotale, Nahaufnahme, Detailaufnahme.
  • Kamerahöhe: Augenhöhe, leichte Untersicht, Aufsicht, Bodenperspektive.
  • Brennweite: Weitwinkel mit starker Raumwirkung, Normalbrennweite, Tele mit komprimierter Tiefe.
  • Bewegung: langsamer Schwenk, Fahrt nach vorn, kreisende Bewegung, statische Kamera mit minimaler Handkamera-Unruhe.
  • Tiefenschärfe: durchgehend scharf oder selektiv scharf mit weichem Hintergrund.

Beim Licht gilt eine einfache Regel: Nenne eine Hauptlichtquelle, ihre Richtung, ihre Härte und ihre Farbtemperatur. Alles darüber hinaus – Streiflicht, Aufhellung, Reflexe – beschreibst du nur, wenn es das Bild wirklich trägt. Zu viele Lichtangaben führen zu flachen, überbelichteten Ergebnissen.

Bewegung im Bild brauchst du nicht nur für Action. Schon kleine Bewegungen – eine Hand, die sich schließt, ein Vorhang, der sich bewegt, aufsteigender Staub – machen einen Clip glaubwürdiger. Modelle neigen zu statischen Aufnahmen, wenn keine Bewegung explizit genannt wird.

Ein praktischer Trick: Beschreibe, was sich innerhalb der Bildfläche verändert, und was außerhalb bleibt. Diese Trennung hilft dem Modell, zwischen Kamerabewegung und Motivbewegung zu unterscheiden.

Referenzbilder, Stilübertragung und Kontrolle

Referenzbilder sind der schnellste Weg zu reproduzierbarem Stil. Entscheidend ist, welche Rolle du einer Referenz zuweist. Es gibt drei sinnvolle Varianten: Stilreferenz (Farbwelt, Textur, Lichtcharakter), Kompositionsreferenz (Bildaufbau, Perspektive) und Figurenreferenz (Identität eines Charakters).

Wenn du diese Rollen nicht trennst, entstehen Konflikte. Ein Bild kann gleichzeitig Stil und Komposition vorgeben, aber dann bestimmt es eben auch den Bildaufbau – und deine eigene Kompositionsidee fällt weg. Sag deshalb explizit, worauf sich die Referenz beziehen soll.

Bei Stilübertragung ist weniger oft mehr. Eine einzige sehr passende Referenz wirkt besser als fünf mittelmäßige. Wenn du einen Stil aus mehreren Quellen kombinieren willst, beschreibe die Mischung im Text und nutze nur eine Referenz für die Grundstimmung.

Für Figurenreferenzen gilt: Die Referenz sollte das Gesicht klar zeigen, neutral beleuchtet sein und möglichst dem gewünschten Winkel entsprechen. Ein Profilfoto als Referenz für eine Frontalaufnahme führt zu unruhigen Ergebnissen.

Prompts an unterschiedliche Modelltypen anpassen

Nicht jedes System reagiert gleich. Es gibt grob zwei Familien, und der Umgang mit ihnen unterscheidet sich.

Schnelle, spezialisierte Modelle für kurze Clips bevorzugen kurze, dichte Prompts mit starken visuellen Schlüsselwörtern. Lange Sätze mit vielen Nebensätzen werden hier oft nur teilweise umgesetzt. Arbeite mit klar getrennten Fragmenten und maximal zwei Bewegungsangaben.

Größere Systeme für längere Sequenzen verstehen komplexere Anweisungen, neigen aber dazu, Details zu erfinden, wenn du Lücken lässt. Hier ist eine explizite Beschreibung von Anfang und Ende eines Clips hilfreich, ebenso eine klare Angabe zur Bildrate-Stimmung, also ob die Bewegung flüssig oder bewusst ruckelig wirken soll.

Bei Bildmodellen ist die Toleranz gegenüber langen Prompts höher, aber die Wirkung einzelner Begriffe geringer. Hier lohnt sich, statt zu verlängern zu priorisieren: Wenn zwei Begriffe widersprechen, entscheidet meist nicht die Gewichtung, sondern die Position im Prompt.

Ein weiterer Unterschied betrifft Auflösung und Seitenverhältnis. Formuliere das Format immer mit. Ein quadratischer Prompt in einer Breitbildausgabe führt zu Beschnitt, der Komposition und Figuren zerstören kann.

Typische Fehler und ihre Korrektur

Die meisten Enttäuschungen lassen sich auf eine Handvoll Ursachen zurückführen.

  • Zu viele Adjektive. Korrektur: Streiche alle Adjektive, die nicht visuell eindeutig sind. „Elegant“ und „beeindruckend“ liefern keine Information.
  • Widersprüchliche Stile. Korrektur: Hierarchie festlegen oder einen Stil streichen.
  • Fehlende Bewegung. Korrektur: Kamera- und Motivbewegung explizit nennen.
  • Identitätsdrift über Szenen. Korrektur: feste Merkmalsliste, wortwörtlich wiederholen, Seed beibehalten.
  • Alles gleichzeitig ändern. Korrektur: Ein-Faktor-pro-Iteration.
  • Zeichen im Bild. Korrektur: Ausschluss von Text und Schrift ergänzen, und Schriftelemente aus dem Motiv entfernen.
  • Flackerndes Licht. Korrektur: Stabile Hauptlichtquelle definieren, Lichtwechsel im Prompt vermeiden.
  • Überladene Komposition. Korrektur: Auf ein Hauptmotiv reduzieren, Nebenfiguren streichen.

Ein besonders hartnäckiger Fehler ist der Wunsch nach Perfektion beim ersten Versuch. Generative Systeme sind Suchwerkzeuge. Der erste Durchlauf liefert eine Richtung, nicht ein Ergebnis. Wer das akzeptiert, arbeitet entspannter und kommt schneller an.

Qualitätssicherung, Iteration und Dokumentation

Sobald du mehr als ein paar Clips produzierst, brauchst du ein System. Sonst verlierst du den Überblick darüber, welcher Prompt zu welchem Ergebnis geführt hat.

Dokumentiere pro Versuch vier Dinge: den Prompt in voller Länge, den Seed, die Modellversion und eine kurze Notiz, was am Ergebnis gestört hat. Diese Notiz ist wertvoller als der Prompt selbst, weil sie dir beim nächsten Durchlauf sagt, welchen Hebel du ziehen musst.

Für die Bewertung von Ergebnissen hilft eine Checkliste. Prüfe in dieser Reihenfolge: Ist die Komposition richtig? Stimmt die Figur? Passt der Stil? Ist die Bewegung glaubwürdig? Ist das Licht konsistent? Arbeite die Liste von oben nach unten ab. Ein Clip mit falscher Komposition wird durch besseres Licht nicht gerettet.

Iteriere in kleinen Schritten. Drei Varianten pro Parameteränderung sind ein guter Richtwert: eine zur Bestätigung, zwei zum Vergleich. Wenn zwei von drei Varianten in eine unerwünschte Richtung gehen, ist der Prompt das Problem, nicht der Zufall.

Baue dir schließlich eine eigene Bausteinbibliothek. Standardformulierungen für Licht, Kamera und Stil, die du bewährt hast, sparen enorm viel Zeit und erhöhen die Wiederholbarkeit. Eine Bibliothek aus zwanzig geprüften Bausteinen ist wertvoller als hundert gesammelte Beispiele aus dem Netz, weil du ihre Wirkung kennst.

FAQ

Wie lang sollte ein guter Prompt sein?
Für kurze Videoclips sind zwei bis vier dichte Sätze meist optimal. Bei komplexeren Sequenzen und Bildmodellen sind längere Prompts möglich, aber nur, wenn jede Information eine konkrete visuelle Funktion hat. Länge allein erhöht die Qualität nicht.

Helfen Seed-Werte wirklich?
Bei vielen Systemen ja. Ein fester Seed hält die Grundkomposition stabil, sodass du Änderungen am Prompt klar zuordnen kannst. Ohne festen Seed kann dieselbe Änderung zwei völlig unterschiedliche Ergebnisse liefern, was die Diagnose unmöglich macht.

Warum ignoriert das Modell meine Stilangabe?
Meist liegt es an Konkurrenz im Prompt. Wenn drei Stilbegriffe gleichzeitig genannt werden, mittelt das Modell sie. Reduziere auf einen dominanten Stil und beschreibe Abweichungen als Modifikation, nicht als zweiten Stil.

Wie vermeide ich verzerrte Hände und Gesichter?
Kurze, klare Beschreibungen der Figur und eine ruhige Kamera helfen mehr als Verbote. Extreme Winkel, schnelle Bewegungen und sehr kleine Figuren im Bild erhöhen das Risiko deutlich.

Kann ich denselben Prompt für Bild und Video nutzen?
Teilweise. Motiv und Stil lassen sich übernehmen, aber Video braucht zusätzlich Bewegung, Zeitverlauf und Konsistenzangaben. Ein Bild-Prompt ohne Bewegungsangabe erzeugt oft einen nahezu statischen Clip.

Was mache ich, wenn ein Clip nur in der Mitte auseinanderfällt?
Teile die Sequenz in kürzere Abschnitte und beschreibe jeden Abschnitt separat. Zerfall entsteht häufig, weil der Prompt zu viel Veränderung in zu kurzer Zeit verlangt.

Wie viele Iterationen sind normal?
Fünf bis fünfzehn Durchläufe für ein brauchbares Ergebnis sind realistisch, bei konsistenten Szenen mehr. Wer mit drei Versuchen rechnet, plant zu knapp – und wer dreißig braucht, hat meist keinen Ein-Faktor-pro-Iteration-Workflow.

Brauche ich überhaupt Prompt-Engineering, wenn die Modelle besser werden?
Ja, aber die Art ändert sich. Weniger Tricks, mehr Entscheidungen: was wichtig ist, was weggelassen werden kann und wie ein Ergebnis konsistent wiederholbar wird. Genau diese Fähigkeiten werden mit leistungsfähigeren Systemen wertvoller, nicht überflüssiger.

Alexander

Alexander