Limited Time Offer: Get 50% OFF your first month of Pro & Ultra plans 🎉

Prompt Engineering für Einsteiger: Leitfaden für gute KI-Clips

Sep 14, 2026

Ein KI-Video entsteht selten durch einen einzigen genialen Satz. Meist ist es das Ergebnis mehrerer kleiner Entscheidungen: welches Motiv, welche Kamera, welches Licht, welche Bewegung – und in welcher Reihenfolge diese Angaben in der Anweisung stehen. Genau darum geht es beim Prompt Engineering: nicht um geheime Tricks, sondern um eine saubere Übersetzung einer Bildidee in eine Sprache, die ein Modell verarbeiten kann.

Wer diesen Übersetzungsschritt beherrscht, ist nicht mehr vom Zufall abhängig. Statt zwanzig Varianten zu würfeln, bis etwas Brauchbares herauskommt, entstehen gezielte Iterationen. Dieser Leitfaden zeigt, wie Einsteiger systematisch vorgehen, welche Bausteine ein Prompt braucht, wie sich verschiedene Modellfamilien unterscheiden und welche Fehler die meiste Zeit kosten.

Warum die Anweisung oft wichtiger ist als das Werkzeug

Die Videomodelle der letzten Generation haben sich in ihrer Grundqualität stark angenähert. Fotorealistische Texturen, glaubwürdige Haut, weiches Licht – das liefern viele Werkzeuge inzwischen auf einem ähnlichen Niveau. Was weiterhin stark schwankt, ist die Übereinstimmung zwischen dem, was jemand im Kopf hatte, und dem, was auf dem Bildschirm erscheint.

Diese Lücke entsteht fast nie im Modell, sondern in der Beschreibung. Ein Modell kann nicht wissen, dass ein Schwenk von links nach rechts gemeint war, wenn nur von einer weiten Einstellung die Rede ist. Es kann keine ruhige Stimmung erzeugen, wenn unklar bleibt, ob Hektik oder Ruhe gewünscht ist. Jede fehlende Information wird vom Modell mit einer Wahrscheinlichkeitsentscheidung gefüllt – und diese Entscheidung ist manchmal gut, oft aber beliebig.

Prompt Engineering ist deshalb weniger eine technische als eine redaktionelle Fähigkeit. Wer präzise beschreibt, arbeitet am Ende schneller, weil weniger Nacharbeit nötig ist. Ein weiterer Nebeneffekt: Gute Prompts sind übertragbar. Ein sauber aufgebauter Prompt funktioniert in mehreren Werkzeugen mit kleinen Anpassungen. Wer dagegen nur die Eigenheiten eines einzelnen Modells auswendig lernt, verliert dieses Wissen, sobald die nächste Version erscheint.

Die Anatomie eines guten Prompts

Ein brauchbarer Prompt besteht nicht aus möglichst vielen Wörtern, sondern aus den richtigen Kategorien. Die folgenden sechs Bausteine decken in der Praxis den Großteil aller Fälle ab.

Baustein Frage, die er beantwortet Beispiel
Subjekt Wer oder was ist zu sehen? eine Frau in gelber Regenjacke
Handlung Was passiert im Clip? sie öffnet langsam einen Brief
Umgebung Wo und wann spielt es? verregneter Bahnsteig, früher Morgen
Kamera Wie wird gefilmt? halbnahe Einstellung, langsamer Schwenk
Licht und Stimmung Wie fühlt es sich an? weiches Gegenlicht, Neonreflexe
Technik Welche Ausgabe wird erwartet? 16:9, 24 fps, fünf Sekunden

Subjekt und Handlung klar trennen

Anfänger neigen dazu, alles in einen Satz zu packen. Das führt dazu, dass das Modell zwar alle Wörter sieht, aber keine Priorität erkennt. Besser ist es, Subjekt und Handlung als eigenen, kurzen Kern zu formulieren: eine Person, ein Gegenstand, eine Bewegung. Dieser Kern bleibt in allen Varianten gleich und wird nur in den Randbausteinen verändert.

Kameraangaben sind kein Beiwerk

Viele unterschätzen, wie stark Kamerasprache das Ergebnis prägt. Begriffe wie halbnahe Einstellung, Totale, Untersicht, Over-the-Shoulder, langsamer Zoom oder Handkamera erzeugen sehr unterschiedliche Bilder – selbst bei identischem Motiv. Wer hier zwei oder drei Begriffe bewusst einsetzt, bekommt deutlich planbarere Resultate als mit einer reinen Motivbeschreibung.

Licht ersetzt lange Adjektive

Statt zu schreiben, dass etwas dramatisch oder emotional wirken soll, ist es wirksamer, die Lichtsituation zu beschreiben. Hartes Seitenlicht erzeugt Kanten, weiches Fensterlicht erzeugt Ruhe, Gegenlicht erzeugt Silhouetten, Neonlicht erzeugt urbane Kühle. Das Modell versteht diese Signale zuverlässiger als abstrakte Gefühlswörter.

Der Arbeitsablauf in fünf Schritten

Prompting wird erst dann effizient, wenn es als Prozess behandelt wird. Der folgende Ablauf hat sich für Einsteiger bewährt und lässt sich auf fast jede Szene anwenden.

Schritt 1: Referenz zuerst

Bevor der erste Prompt geschrieben wird, sollte eine visuelle Referenz existieren – ein Standbild, ein Filmausschnitt, ein eigenes Foto. Die Referenz muss nicht hochgeladen werden. Sie dient als Maßstab, um zu prüfen, ob das Ergebnis in die richtige Richtung geht. Ohne Referenz verschiebt sich das Ziel mit jedem Ergebnis, und die Sitzung zieht sich endlos.

Schritt 2: Den Kern schreiben

Der erste Prompt enthält nur Subjekt und Handlung. Keine Stilangaben, keine Kamera, keine Effekte. Ziel ist es, die Grundbewegung zu prüfen: Öffnet die Figur wirklich den Brief? Bewegt sich die Hand glaubwürdig? Erst wenn dieser Kern sitzt, lohnt sich Feinschliff.

Schritt 3: Kamera und Licht ergänzen

Jetzt kommen die Bausteine dazu, die das Bild formen. Ein Prompt kann nach diesem Schritt etwa so aussehen:

Halbnahe Einstellung: eine Frau in gelber Regenjacke
öffnet langsam einen Brief auf einem verregneten Bahnsteig
am frühen Morgen. Weiches Gegenlicht, feiner Nieselregen.
Ruhige Kamera, leichte Handbewegung.

Schritt 4: Eine Variable pro Durchlauf ändern

Der häufigste Effizienzfehler ist, bei jeder Iteration drei Dinge gleichzeitig zu verändern. Danach ist nicht mehr nachvollziehbar, welche Änderung gewirkt hat. Besser ist es, pro Durchlauf genau eine Variable anzupassen – zum Beispiel nur die Kameraposition oder nur das Licht – und den Rest konstant zu halten.

Schritt 5: Ergebnisse sichern

Brauchbare Prompts gehören in eine eigene Sammlung, zusammen mit der verwendeten Einstellung und einem Screenshot des Ergebnisses. Nach einigen Wochen entsteht so ein persönliches Nachschlagewerk, das mehr wert ist als jede allgemeine Prompt-Liste, weil es auf den eigenen Stil zugeschnitten ist.

Modellwahl: welches Werkzeug passt zum Motiv

Auch wenn Prompts übertragbar sind, haben Modellfamilien unterschiedliche Stärken. Wer diese kennt, wählt den Prompt-Aufbau passend.

Fotorealistische Modelle

Werkzeuge wie Flux oder Sora liefern eine hohe Detailtreue bei Materialien, Haut und Textur. Sie reagieren gut auf präzise Lichtbeschreibungen und auf Begriffe aus der Fotografie wie Brennweite oder Schärfentiefe. Bei diesen Modellen zahlt sich ein nüchterner, technischer Prompt eher aus als eine blumige Erzählung.

Asiatische Hochleistungsmodelle

Modelle wie Kling AI oder MiniMax Hailuo sind stark bei fließenden Bewegungen, Gesichtsausdrücken und dynamischen Szenen. Sie profitieren von klaren Handlungsbeschreibungen und einer genauen Reihenfolge der Ereignisse innerhalb des Clips. Wer beschreibt, was in welcher Sekunde passiert, erhält hier häufig deutlich stabilere Ergebnisse.

Bewegung und Kameraarbeit

Runway und Luma Ray wiederum sind bekannt für kontrollierte Kamerabewegungen. Hier lohnt es sich, Begriffe wie Fahrt, Schwenk, Orbit oder Dolly bewusst einzusetzen und pro Prompt nur eine Bewegung zu verlangen. Zwei gegenläufige Bewegungen überfordern viele Modelle und erzeugen wackelige Ergebnisse.

Entscheidungskriterien für die Praxis:

  • Geht es um Gesichter und Nahaufnahmen? Dann ein Modell mit Fokus auf Ausdruck und Detailtreue wählen.
  • Geht es um eine Kamerafahrt durch einen Raum? Dann ein Modell mit starker Bewegungskontrolle wählen.
  • Geht es um schnelle Schnittfolgen in einem Stil? Dann lieber mehrere kurze Clips erzeugen und im Schnitt zusammensetzen.
  • Geht es um Wiederholbarkeit? Dann ein Modell wählen, das Referenzbilder oder feste Stilvorlagen unterstützt.

Fortgeschrittene Techniken ohne Rätselraten

Schrittweise Verfeinerung statt Mammutprompt

Ein sehr langer Prompt mit zwanzig Angaben wirkt beeindruckend, führt aber oft zu mittelmäßigen Ergebnissen, weil die wichtigsten Signale zwischen Nebensächlichkeiten untergehen. Stattdessen ist es sinnvoll, in Stufen zu arbeiten: erst Kern, dann Licht, dann Kamera, dann Stil. Jede Stufe wird getestet, bevor die nächste dazukommt.

Few-Shot nach Vorbild

Wenn ein Werkzeug Beispiele akzeptiert, helfen zwei bis drei kurze Beispiele mehr als eine lange Erklärung. Wer dem Modell zeigt, wie ein gewünschter Ausschnitt aussieht und wie ein unerwünschter aussieht, erspart sich viele Korrekturrunden. Das Prinzip stammt aus dem Sprachmodell-Bereich und funktioniert bei Bild- und Videomodellen genauso gut. Wichtig ist, dass die Beispiele wirklich unterschiedlich sind – zwei fast identische Beispiele liefern dem Modell keine zusätzliche Information.

Referenzbilder und Stilanker

Für wiederkehrende Figuren oder Produkte sind Referenzbilder der zuverlässigste Weg zu Konsistenz. Ein einzelnes, gut ausgeleuchtetes Referenzbild mit neutralem Hintergrund schlägt jede noch so ausführliche Textbeschreibung. Zusätzlich lohnt es sich, einen Stilanker zu definieren – eine kurze Formulierung, die in jedem Prompt einer Serie unverändert wiederkehrt.

Konsistenz über mehrere Szenen

Sobald ein Projekt mehr als einen Clip umfasst, wird Konsistenz zur zentralen Herausforderung. Figuren verändern ihr Gesicht, Kleidung wechselt die Farbe, Räume verschieben sich. Dagegen helfen drei einfache Maßnahmen.

Erstens: ein Figurenblatt anlegen. Darin stehen Aussehen, Kleidung, Frisur und zwei bis drei Referenzbilder. Dieses Blatt wird bei jedem Prompt als Basis verwendet.

Zweitens: eine Look-Bibel für Farben und Licht. Wenn jede Szene dieselbe Lichtfarbe und denselben Kontrast nutzt, wirkt die Montage automatisch zusammenhängender, selbst wenn Details abweichen.

Drittens: Nomen und Adjektive nicht variieren. Wer in Szene eins von einer roten Jacke spricht und in Szene zwei von einem roten Mantel, bekommt zwei verschiedene Kleidungsstücke. Wortkonsistenz ist bei KI-Video kein Stilmittel, sondern eine technische Notwendigkeit.

Typische Fehler und wie man sie vermeidet

  • Zu viele Handlungen in einem Clip. Ein Clip sollte eine einzige, klar erkennbare Bewegung enthalten. Alles andere wird im Schnitt ergänzt.
  • Widersprüchliche Angaben. Eine ruhige Kamera und eine hektische Handkamera im selben Prompt heben sich gegenseitig auf.
  • Fehlende Zeitangaben. Gerade bei schnellen Modellen hilft die Angabe, was zu Beginn und was am Ende des Clips passiert.
  • Abstrakte Gefühlswörter. Statt dramatisch besser hartes Seitenlicht und tiefe Schatten beschreiben.
  • Ignorierte Seitenverhältnisse. Ein für Hochformat gedachter Prompt liefert im Querformat oft eine schlecht verteilte Komposition.
  • Kein Negativ-Prompt. Wenn möglich, unerwünschte Elemente explizit ausschließen: unscharfe Hände, doppelte Gliedmaßen, Text im Bild.
  • Ergebnisse nicht dokumentieren. Wer den funktionierenden Prompt nicht speichert, muss ihn später neu erfinden.

Prompt-Vorlagen zum Ausprobieren

Die folgenden Vorlagen sind bewusst knapp gehalten und lassen sich mit eigenen Angaben füllen.

[Einstellungsgröße]: [Subjekt] [Handlung] in [Umgebung],
[Lichtstimmung], [Kamerabewegung], [Dauer und Format].

Beispiel für eine ruhige Szene:

Nahe Einstellung: eine Frau in gelber Regenjacke öffnet langsam
einen Brief auf einem Bahnsteig bei Nieselregen. Kühles Morgenlicht,
weiche Reflexe auf dem nassen Asphalt, statische Kamera, Detail in
der Hand, 16:9, fünf Sekunden.

Beispiel für eine dynamische Szene:

Totale, langsame Vorwärtsfahrt: ein Skater fährt durch eine
unterirdische Passage. Neonlicht von oben, harte Schatten, schnelle
Bewegung, leichte Kameraführung, urbaner Look, 16:9, vier Sekunden.

Wer diese beiden Vorlagen mit eigenen Motiven füllt, merkt schnell, wie stark sich das Ergebnis verändert, sobald Licht und Kamera bewusst gesetzt werden.

Zwei Praxisbeispiele: von der Idee zum brauchbaren Clip

Beispiel 1: Produktclip für einen Sneaker

Der erste Versuch lautet: „Ein Sneaker in einer modernen Umgebung, hochwertig gefilmt.“ Das Ergebnis wirkt beliebig: Der Hintergrund wechselt zwischen Betonwand und Studio, die Kamera bewegt sich unentschlossen, die Beleuchtung passt nicht zur Marke. Die Diagnose ist eindeutig – der Prompt enthält keine Motivdetails, keine Kameraangabe und keine Lichtbeschreibung, also füllt das Modell alle drei Lücken selbst.

Der überarbeitete Prompt setzt genau diese Bausteine:

Nahaufnahme, langsame seitliche Fahrt: ein weißer Sneaker mit
gummierter Sohle steht auf nassem Beton. Kühles Seitenlicht,
harte Schatten, leichte Reflexe auf der Oberfläche.
Ruhiges Ende der Bewegung, 16:9, sechs Sekunden.

Im nächsten Durchlauf wird nur die Bewegungsrichtung geändert: Aus der seitlichen Fahrt wird ein langsamer Orbit. Motiv, Licht und Format bleiben identisch. So lässt sich sauber vergleichen, welcher Kamerazusatz zur Marke passt, ohne dass drei Variablen gleichzeitig wandern.

Beispiel 2: Porträt einer Handwerkerin

Zweiter Fall: eine kurze Szene für ein Imagevideo. Die ersten Versuche zeigen eine Frau in einer Werkstatt, aber Gesicht, Kleidung und Werkzeug ändern sich bei jeder Generierung. Hier liegt das Problem nicht im Prompt-Text, sondern in der fehlenden Referenz. Mit einem Figurenblatt, einem Referenzbild in neutralem Licht und einer festen Formulierung – etwa „dunkelblaue Arbeitshose, rotes Halstuch“ – stabilisiert sich die Figur innerhalb weniger Durchläufe.

Zusätzlich hilft eine zeitliche Beschreibung: Was passiert in der ersten Hälfte des Clips, was in der zweiten? Eine Formulierung wie „zuerst arbeitet sie konzentriert am Werkstück, dann dreht sie den Kopf zur Kamera und atmet sichtbar aus“ verhindert, dass das Modell die Handlung willkürlich über die Laufzeit verteilt. Bei vier bis sechs Sekunden reichen zwei bis drei solcher Abschnitte.

FAQ für den Einstieg

Wie lang sollte ein Prompt sein?

Für einen kurzen Clip reichen in der Regel zwei bis vier Sätze. Entscheidend ist, dass jeder Satz eine eigene Information liefert. Ein Prompt mit 80 Wörtern, von denen 50 Füllwörter sind, funktioniert schlechter als ein Prompt mit 30 präzisen Wörtern.

Muss ich für jedes Modell einen neuen Prompt schreiben?

Nein, aber kleine Anpassungen helfen. Ein Modell, das stark auf Lichtbeschreibungen reagiert, verträgt mehr technische Details. Ein Modell mit Fokus auf Bewegung profitiert von einer klaren Zeitabfolge. Der Grundaufbau bleibt gleich.

Warum sehen meine Figuren in jeder Szene anders aus?

Fehlende Referenzen sind die häufigste Ursache. Ohne Referenzbild entscheidet das Modell bei jeder Generierung neu über Gesichtszüge und Kleidung. Ein Figurenblatt mit konsistenten Formulierungen und mindestens einem Bild pro Figur löst das Problem in den meisten Fällen.

Sind Negativ-Prompts wirklich nötig?

Nicht immer, aber häufig hilfreich. Wenn ein bestimmtes Problem immer wieder auftritt – etwa unscharfe Hände oder eingeblendeter Text –, gehört es in den Negativ-Prompt, statt es bei jeder Iteration neu zu beschreiben.

Wie viele Versuche sind normal?

Für einen brauchbaren Clip sind drei bis sechs gezielte Durchläufe realistisch. Wer deutlich mehr Versuche braucht, hat meist kein Modellproblem, sondern eine unklare Zielvorstellung. In diesem Fall hilft es, zuerst die Referenz zu schärfen und erst danach weiter zu generieren.

Kann ich Prompts aus dem Internet einfach übernehmen?

Als Ausgangspunkt ja, als Endlösung nein. Fremde Prompts enthalten Annahmen über Stil, Format und Modell, die selten zur eigenen Aufgabe passen. Besser ist es, den Aufbau zu übernehmen und den Inhalt auszutauschen.

Wie merke ich, dass ein Prompt verbessert werden muss?

Wenn zwei Durchläufe mit demselben Prompt deutlich unterschiedliche Ergebnisse liefern, ist die Anweisung wahrscheinlich zu vage. Präzise Prompts erzeugen erkennbar ähnliche Resultate. Diese Ähnlichkeit ist das eigentliche Qualitätsmerkmal.

Fazit: Prompting als Handwerk, nicht als Glücksspiel

Wer mit KI-Video arbeitet, verbringt einen großen Teil der Zeit mit Formulieren. Das ist kein Umweg, sondern der eigentliche Gestaltungsakt. Ein Prompt legt fest, was das Publikum sieht, wie es sich anfühlt und wie schnell es versteht, worum es geht.

Der schnellste Weg zu besseren Ergebnissen besteht nicht darin, mehr Werkzeuge auszuprobieren, sondern darin, die eigenen Anweisungen zu strukturieren. Subjekt, Handlung, Umgebung, Kamera, Licht und technische Angaben – wer diese sechs Bausteine bewusst füllt und pro Durchlauf nur eine Variable ändert, kommt mit wenigen Versuchen zu verwertbaren Clips.

Dazu kommen zwei Gewohnheiten, die den größten Unterschied machen: eine Referenz vor dem ersten Prompt festlegen und funktionierende Prompts dokumentieren. Beides kostet wenig Zeit und spart über ein ganzes Projekt gerechnet mehrere Stunden Nacharbeit. KI-Video bleibt unberechenbar genug – aber ein sauberer Prompt verschiebt die Wahrscheinlichkeit deutlich auf die eigene Seite.

Alexander

Alexander