Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Prompting für KI-Video: Leitfaden für starke Ergebnisse

Sep 29, 2026

Warum Prompts über die Qualität von KI-Videos entscheiden

Die generative Videoproduktion hat sich von einer technischen Spielerei zu einem festen Werkzeug in Marketing, Film, Design und E-Learning entwickelt. Wer heute kurze Clips, Animatics, Produktsequenzen oder ganze Szenenfolgen erstellt, arbeitet mit Modellen, die aus einer Textbeschreibung Bilder, Bewegung und teilweise auch Ton erzeugen. Der Unterschied zwischen brauchbarem Material und Ausschuss liegt dabei fast nie am Modell, sondern an der Beschreibung.

Ein Prompt ist keine Suchanfrage. Eine Suchanfrage will finden, was bereits existiert. Ein Prompt will erzeugen, was noch nicht existiert. Deshalb reicht es nicht, ein Motiv zu benennen. Ein Modell muss aus wenigen Wörtern eine komplette Entscheidungskette ableiten: Wer oder was ist zu sehen? Wo? Wie bewegt sich die Kamera? Welche Lichtstimmung herrscht? Welcher Look ist gewünscht? Wie lang ist die Einstellung? Je mehr dieser Fragen offen bleiben, desto stärker greift das Modell auf Durchschnittswerte zurück – und Durchschnitt sieht man den Ergebnissen an.

Dazu kommt ein zweiter Effekt: Prompts sind nicht stabil. Ein Modell interpretiert dieselbe Formulierung nicht immer identisch, weil jede Generierung ein Stichprobenvorgang aus einem gelernten Wahrscheinlichkeitsraum ist. Wer reproduzierbare Ergebnisse braucht, muss deshalb nicht nur gut formulieren, sondern systematisch arbeiten: mit festen Bausteinen, mit Referenzbildern, mit Notizen zu dem, was funktioniert hat, und mit klaren Regeln für die Nachbearbeitung.

Dieser Leitfaden erklärt, wie ein Prompt aufgebaut ist, welche Bausteine wirklich etwas verändern, wie du Prompts über mehrere Szenen hinweg konsistent hältst und welcher Arbeitsablauf von der ersten Idee bis zum fertigen Clip trägt.

Was ein Prompt wirklich ist – jenseits der Suchanfrage

Anweisung, Kontext und Einschränkung

Ein Prompt besteht aus drei Ebenen, die unterschiedliche Aufgaben erfüllen.

Die erste Ebene ist die Anweisung. Sie sagt, was passieren soll: eine Figur geht, ein Auto fährt, ein Produkt dreht sich, eine Hand öffnet eine Schublade. Diese Ebene ist unverzichtbar, aber sie ist auch die schwächste, weil sie am wenigsten spezifisch ist. Zwei völlig verschiedene Videos können dieselbe Anweisung haben.

Die zweite Ebene ist der Kontext. Sie beschreibt den Rahmen: Umgebung, Tageszeit, Wetter, Stimmung, Kleidung, Materialien, Farbwelt, Jahreszeit, sozialer Kontext. Kontext ist der Grund, warum zwei Prompts mit identischer Anweisung grundverschiedene Ergebnisse liefern.

Die dritte Ebene ist die Einschränkung. Sie legt Grenzen fest: Seitenverhältnis, Dauer, Kameraführung, Stilrichtung und das, was ausdrücklich nicht vorkommen soll. Einschränkungen wirken in der Praxis oft stärker als zusätzliche Beschreibungen, weil sie den Lösungsraum verkleinern.

Wer diese drei Ebenen bewusst trennt, schreibt automatisch bessere Prompts – nicht weil die Formulierung eleganter wird, sondern weil nichts Wichtiges fehlt.

Warum dasselbe Modell auf zwei Prompts unterschiedlich reagiert

Ein Modell hat keine Vorstellung davon, was ein Berg ist. Es besitzt Zahlen, die beschreiben, in welchen Kontexten das Wort aufgetreten ist. Aus diesen Zahlen baut es ein Bild zusammen. Formulierungen, die häufig gemeinsam vorkommen, werden stark gewichtet; seltene Kombinationen erzeugen unerwartete oder instabile Ergebnisse.

Praktisch bedeutet das: Je eindeutiger deine Begriffe, desto berechenbarer die Ausgabe. „Düsterer Wald" lässt sehr viel Spielraum. „Kiefernwald im Morgennebel, tief stehende Sonne von links, feuchter Waldboden mit Moos" reduziert den Spielraum erheblich. Das ist keine Geschmacksfrage, sondern der Kern jeder Prompt-Arbeit.

Ein zweites Missverständnis betrifft die Länge. Viele glauben, ein längerer Prompt sei automatisch besser. Das stimmt nur bis zu einem Punkt. Ab einer bestimmten Dichte widersprechen sich Beschreibungen gegenseitig oder verwässern die wichtigste Information. Ein präziser Prompt mit 60 Wörtern schlägt meist einen unstrukturierten Text mit 300 Wörtern.

Die Bausteine eines belastbaren Video-Prompts

Subjekt und Handlung

Benenne genau ein Hauptmotiv. Beschreibe es physisch: Kleidung, Alter-Eindruck, Material, Größe im Verhältnis zum Bild. Ergänze eine konkrete Handlung im Präsens – „öffnet langsam eine Metalltür" ist stärker als „ist in Bewegung". Wenn mehrere Figuren vorkommen, ordne sie eindeutig zu: Wer steht links, wer rechts, wer ist im Vordergrund?

Umgebung und Atmosphäre

Ort, Tageszeit, Wetter, Hintergrundelemente und Tiefenstaffelung machen den größten sichtbaren Unterschied. Achte auf Widerspruchsfreiheit: Ein „leerer Raum" und „Menschenmengen im Hintergrund" passen nicht zusammen. Wenn du Tiefe willst, beschreibe Vordergrund, Mittelgrund und Hintergrund getrennt.

Kamera, Optik und Licht

Diese Angaben steuern den professionellen Eindruck. Nützlich sind: Einstellungsgröße (Totale, Halbtotale, Nahaufnahme, Detail), Brennweite (Weitwinkel, 35 mm, 85 mm, Makro), Kamerabewegung (ruhige Fahrt, Dolly, Handkamera, Kran, statisch) und Lichtführung (weiches Fensterlicht, hartes Gegenlicht, Neonlicht, Kerzenlicht). Ergänze eine Farbtemperatur oder eine Farbpalette, wenn du eine bestimmte Stimmung brauchst.

Bewegung, Tempo und Dauer

Viele Modelle erzeugen nur dann sichtbare Bewegung, wenn Bewegung im Text vorkommt. Beschreibe deshalb nicht nur das Motiv, sondern auch die Veränderung im Bild: „Rauch zieht langsam nach oben", „Haare bewegen sich im Wind", „die Kamera gleitet nach rechts". Für Zeitlupen, Zeitraffer oder Loops gibt es je nach Modell eigene Begriffe oder Einstellungen.

Negativ-Prompts und Ausschlusslogik

Negative Angaben sind nützlich, aber kein Allheilmittel. Fünf bis acht gezielte Ausschlüsse funktionieren besser als dreißig. Typische Kandidaten sind: Text im Bild, Wasserzeichen, zusätzliche Gliedmaßen, verschwommene Gesichter, verzerrte Hände, doppelte Figuren, harte Übergänge. Prüfe nach jeder Generierung, ob ein Ausschluss überhaupt noch nötig ist – manchmal verschwindet das Problem durch eine präzisere positive Beschreibung.

Drei Prompt-Muster, die sich in der Praxis bewährt haben

Das Detail-First-Muster

Beim Detail-First-Ansatz steht die physische Beschreibung am Anfang und die Stilangabe am Ende. Erst wird festgelegt, was tatsächlich zu sehen ist, dann folgt die Ästhetik. Das verhindert, dass Stilbegriffe wie „filmisch" oder „cinematisch" die konkrete Bildbeschreibung überlagern.

Ein Beispiel: „Eine Frau mittleren Alters in einer dunkelblauen Wolljacke öffnet eine schwere Metalltür. Dahinter liegt ein leerer Flur mit grünen Fliesen und flackerndem Deckenlicht. Kamera auf Augenhöhe, ruhige Rückwärtsfahrt, kühles Licht mit leichtem Grünstich. Ruhiger, dokumentarischer Look, 16:9."

Storyboard-Prompting

Bei komplexen Szenen wird die Sequenz in einzelne Beats zerlegt. Jeder Beat bekommt einen eigenen Prompt mit identischem Stilblock. Anschließend werden die Clips in der Nachbearbeitung zusammengesetzt. Der Vorteil: Du behältst die Kontrolle über Timing und Dramaturgie, statt zu hoffen, dass ein einzelner Prompt eine ganze Handlung sinnvoll auflöst.

Die Slot-Methode

Die Slot-Methode arbeitet mit einer festen Vorlage, in der du einzelne Bausteine austauschst:

[Subjekt] + [Handlung] + [Umgebung] + [Licht] + [Kamera] + [Stil] + [Ausschlüsse]

Der entscheidende Vorteil liegt in der Disziplin: Du veränderst pro Testlauf nur einen Slot. So erkennst du zuverlässig, welche Formulierung welchen Effekt hat. Wer drei Slots gleichzeitig ändert, lernt nichts aus dem Ergebnis.

Ein durchgehender Workflow von der Idee zum fertigen Clip

Schritt 1: Briefing in einem Satz. Formuliere zuerst, was die Einstellung leisten soll. Nicht wie sie aussieht, sondern welche Information sie transportiert. Dieser Satz ist später die Messlatte.

Schritt 2: Referenzen sammeln. Suche zwei bis vier Bilder, die Licht, Farbwelt und Kadrierung treffen. Sie sind schneller verständlich als jede Beschreibung und dienen als Stilanker.

Schritt 3: Prompt mit der Slot-Methode bauen. Fülle alle Slots in einer klaren Reihenfolge. Schreibe kurze, konkrete Sätze statt langer Aufzählungen.

Schritt 4: Testserie mit drei Varianten. Ändere nur einen Slot pro Variante – zum Beispiel die Kamera bei identischem Rest. Drei Varianten reichen meist, um die Richtung zu erkennen.

Schritt 5: Bewerten statt nur schauen. Bewerte die Ergebnisse mit einem festen Raster (siehe unten). Ohne Raster entscheidet der erste Eindruck, und der täuscht bei KI-Video häufig.

Schritt 6: Verfeinern. Übernimm die beste Variante, präzisiere zwei bis drei unsaubere Stellen und entferne überflüssige Ausschlüsse.

Schritt 7: Szene erweitern. Nutze für Folgebeats denselben Stilblock und dieselben Ankerbegriffe, damit der Schnitt später nicht bricht.

Schritt 8: Nachbearbeiten. Farbkorrektur, Stabilisierung, Ton, Schnittlänge. KI-Ausgaben sind Rohmaterial, nicht das Endergebnis.

Konsistenz über mehrere Szenen hinweg

Stilanker definieren

Ein Stilanker ist ein kurzer, unveränderlicher Textblock, der in jedem Prompt derselben Sequenz vorkommt. Er enthält Look, Lichtlogik, Farbpalette, Objektivcharakter und Seitenverhältnis. Dieser Block wird wortwörtlich kopiert, nicht umformuliert. Schon kleine Umformulierungen können sichtbare Sprünge erzeugen.

Referenzbilder und feste Parameter

Wenn das Modell Bild-zu-Video unterstützt, ist ein Referenzbild meist wirksamer als jede Beschreibung. Kombiniere es mit einem knappen Text, der nur die Bewegung beschreibt. Feste Parameter wie Seitenverhältnis, Bildrate und Länge gehören ebenfalls in deine Vorlage, weil sie sonst je Szene neu geraten werden müssen.

Benennung und Versionierung

Lege eine einfache Dateistruktur an: Projekt, Szene, Beat, Version. Speichere zu jedem Clip den verwendeten Prompt. Nach zwei Projekten hast du eine eigene Bibliothek an Formulierungen, die nachweislich funktionieren. Das ist der schnellste Weg zu reproduzierbarer Qualität.

Modellwahl und Prompt-Anpassung

Realistische und stilisierte Modelle

Realistische Modelle reagieren stark auf Licht-, Optik- und Materialangaben und weniger auf Stiladjektive. Stilisierte Modelle reagieren umgekehrt: Begriffe wie „Aquarell", „Comic", „Plastilin" oder „Neon-Noir" verändern hier mehr als eine detaillierte Lichtbeschreibung. Passe die Gewichtung deiner Slots an den Modelltyp an.

Text-zu-Video und Bild-zu-Video

Text-zu-Video gibt dir maximale Freiheit, kostet aber Kontrolle. Bild-zu-Video liefert Konsistenz und ist die bessere Wahl für Produktaufnahmen, Figuren mit festem Design und Szenen, die an bestehende Bilder anschließen müssen. Für Animatics und Serienformate ist der Bild-zu-Video-Weg fast immer der effizientere.

Umbau-Regeln für verschiedene Modelle

Wenn du einen Prompt auf ein anderes Modell überträgst, gilt eine einfache Reihenfolge: Erst Stilbegriffe entfernen, dann Licht und Kamera behalten, dann Ausschlüsse prüfen. Modelle unterscheiden sich am stärksten in ihrer Interpretation von Stil und Negationen, am wenigsten in der Interpretation von konkreten Objekten und Bewegungen.

Häufige Fehler und wie du sie vermeidest

Überladene Prompts

Zu viele Details erzeugen ein unscharfes Mittelmaß. Kürze auf die fünf bis sieben Merkmale, die man im Bild tatsächlich erkennen würde.

Widersprüche

„Statische Kamera" und „schnelle Fahrt" im selben Prompt führen zu Zufallsergebnissen. Lies jeden Prompt einmal gegen und streiche jede Information, die einer anderen widerspricht.

Fehlende Bewegung

Ein wunderschönes Standbild bleibt ein Standbild, wenn keine Bewegung beschrieben ist. Ergänze immer mindestens ein bewegtes Element.

Text im Bild

Modelle erzeugen Schrift häufig fehlerhaft. Beschreibe Flächen ohne Text oder füge Text später in der Nachbearbeitung hinzu.

Falsches Seitenverhältnis

Hochformat, Querformat und quadratisch verändern die Bildkomposition erheblich. Lege das Format vor der Prompt-Erstellung fest, nicht danach.

Ein Prompt für alles

Wer eine ganze Handlung in einen Prompt packt, bekommt selten eine brauchbare Dramaturgie. Zerlege in Beats.

Qualitätskontrolle, Bewertungsraster und Beispiele

Ein Raster mit fünf Kriterien

Bewerte jeden Output auf einer Skala von 1 bis 5 in fünf Kategorien: Motivtreue, Bewegung, Bildkohärenz, Licht und Stil, technische Sauberkeit. Summiere die Werte. So vergleichst du Varianten objektiv, statt dich vom hübschesten Einzelbild täuschen zu lassen.

Drei Prompts von grob zu präzise

Grob: „Ein Mann läuft durch eine Stadt." Ergebnis: beliebig.

Mittel: „Ein Mann in einem grauen Mantel läuft bei Regen durch eine europäische Altstadt, Handkamera, kühle Farben." Ergebnis: brauchbar, aber beliebig im Detail.

Präzise: „Ein Mann Ende vierzig in einem nassen grauen Wollmantel geht in mittlerem Tempo über Pflasterstein in einer engen europäischen Gasse. Links eine Bäckerei mit warmem Licht, rechts eine geschlossene Metallrolle. Nieselregen, Pfützen mit Reflexionen. Handkamera auf Brusthöhe, leichte Bewegung, 35-mm-Optik, kühle blaugraue Farbpalette mit warmem Akzent von links. Ruhiger, dokumentarischer Look, 16:9, vier Sekunden. Ausschlüsse: Text im Bild, zusätzliche Personen, Gesichtsverzerrung."

Der Unterschied zwischen Version zwei und drei ist nicht die Länge, sondern die Entscheidungsdichte. Jeder zusätzliche Satz nimmt dem Modell eine Entscheidung ab.

Iterationsschleife statt Neustart

Arbeite immer in Schleifen. Bewahre den besten Prompt als Basis und variiere einen Slot. Nach drei bis vier Runden ist das Ergebnis meist besser als nach zwanzig komplett neuen Versuchen, weil du Wissen aufbaust statt zu raten.

FAQ

Wie lang sollte ein Prompt für KI-Video sein?

Für die meisten Modelle liegt der brauchbare Bereich zwischen 40 und 120 Wörtern. Entscheidend ist nicht die Länge, sondern die Dichte: Jeder Satz sollte eine Information tragen, die im Bild erkennbar wäre.

Sind Negativ-Prompts wirklich notwendig?

Häufig ja, aber sparsam. Starte mit einem klaren positiven Prompt und ergänze Ausschlüsse nur dort, wo immer wieder dasselbe Problem auftaucht. Fünf gezielte Ausschlüsse sind wirksamer als eine lange Verbotsliste.

Warum sehen meine Ergebnisse trotz guter Prompts unruhig aus?

Meist fehlt eine klare Kameraführung. Wenn weder Bewegung noch Statik beschrieben sind, entscheidet das Modell zufällig. Ergänze eine eindeutige Kamerabewegung oder die Angabe, dass die Kamera ruhig steht.

Wie halte ich Figuren über mehrere Szenen konsistent?

Arbeite mit einem wortwörtlich identischen Stil- und Figurenblock, verwende Referenzbilder und ändere pro Szene nur die Bewegung. Vermeide Synonyme für dieselbe Figur, weil sie neue Interpretationen auslösen können.

Welches Format sollte ich zuerst festlegen?

Das Seitenverhältnis. Es beeinflusst Kadrierung, Motivgröße und Bewegungsrichtung. Lege es vor dem ersten Prompt fest und notiere es in deiner Vorlage.

Wie viele Varianten pro Prompt sind sinnvoll?

Drei bis vier. Danach wiederholen sich die Muster, und weitere Versuche kosten nur Zeit. Wechsle stattdessen das Muster oder präzisiere einen Slot.

Kann ich Prompts aus anderen Projekten wiederverwenden?

Ja, und das ist der effizienteste Teil der Arbeit. Baue eine Bibliothek aus Stilblöcken, Lichtbeschreibungen und Ausschlusslisten auf. Neue Projekte werden dann aus vorhandenen Bausteinen zusammengesetzt statt von Null begonnen.

Was mache ich, wenn das Modell mein Motiv ignoriert?

Stelle das Motiv an den Anfang und wiederhole es nicht in Variationen. Häufig liegt das Problem in widersprüchlichen Stilangaben, die das Motiv überlagern. Entferne zuerst alle Stilbegriffe und teste erneut.

Alexander

Alexander