Warum Prompting bei Videos anders funktioniert als bei Bildern
Wer aus der Bildgenerierung kommt, unterschätzt den Sprung zur Videogenerierung regelmäßig. Ein Standbild verzeiht eine vage Beschreibung, weil das Auge in einem einzigen Moment nach Orientierung sucht. Ein Clip dagegen lebt von Zeit. Sobald sich etwas bewegt, muss das Modell entscheiden, was sich wie verändert – und genau dort entstehen die typischen Artefakte: Hände, die ihre Form wechseln, Hintergründe, die atmen, Gesichter, die zwischen zwei Sekunden ihre Identität tauschen.
Die zentrale Verschiebung lautet: Ein Videoprompt beschreibt keinen Zustand, sondern einen Verlauf. Du legst nicht nur fest, was zu sehen ist, sondern auch, wie es sich vom ersten zum letzten Frame entwickelt. Das bedeutet, dass jede Beschreibung implizit eine Bewegungsanweisung enthält. „Eine Frau in einem roten Mantel steht an einer Haltestelle“ ist ein Bild. „Eine Frau in einem roten Mantel tritt aus dem Bus, der Regen spiegelt die Scheinwerfer, sie blickt nach links“ ist ein Clip.
Zweitens arbeiten Videomodelle mit knappen Zeitbudgets. Vier bis zehn Sekunden sind für viele Systeme die realistische Einheit. Das zwingt zu einer anderen Dramaturgie: Statt einer ganzen Geschichte pro Prompt planst du mehrere kurze Einstellungen, die später zusammengesetzt werden. Wer das akzeptiert, arbeitet automatisch präziser.
Drittens ist Konsistenz das eigentliche Qualitätsmerkmal. Nicht der spektakulärste Einzelclip gewinnt, sondern die Sequenz, in der Figur, Kostüm, Lichtstimmung und Farbwelt über mehrere Einstellungen hinweg stabil bleiben. Genau dafür braucht es eine Methode – nicht nur gute Ideen.
Die Anatomie eines belastbaren Videoprompts
Ein guter Videoprompt ist kein Gedicht, sondern eine Spezifikation. Er beantwortet nacheinander vier Fragen: Wer oder was, wie gefilmt, in welcher Welt, und in welcher zeitlichen Entwicklung. Wenn du diese Reihenfolge einhältst, wird dein Prompt lesbar, wiederverwendbar und leichter zu debuggen.
Subjekt und Handlung
Beginne mit dem konkreten Akteur und einer einzigen, klar benannten Aktion. Vermeide zwei gleichzeitige Handlungen in derselben Einstellung – „sie geht und dreht sich und hebt dabei die Hand“ überfordert die zeitliche Auflösung. Ein Verb pro Einstellung reicht oft aus und liefert sauberere Bewegung.
Beschreibe Materialien und Kleidung so, dass sie sich nicht verändern können. „Roter Wollmantel mit Hornknöpfen“ ist stabiler als „roter Mantel“, weil das Modell weniger Freiheitsgrade für Interpretationen hat.
Kamera, Optik und Bewegung
Die Kamerasprache ist das stärkste Werkzeug, das die meisten Einsteiger ignorieren. Ein Satz wie „langsame Kamerafahrt nach rechts, 35-mm-Objektiv, geringe Schärfentiefe“ verändert das Ergebnis stärker als drei zusätzliche Adjektive zur Stimmung.
Bewährte Bausteine:
- Einstellungsgröße: Totale, Halbtotale, Nahaufnahme, Detailaufnahme
- Kamerabewegung: Schwenk, Fahrt, Kran, Handkamera, statisch auf Stativ
- Brennweite: 24 mm für Räume, 50 mm für Normalperspektive, 85 mm für Porträts
- Schärfentiefe: flach für Fokus, tief für Übersicht
- Blickachse: Aufsicht, Untersicht, Augenhöhe
Ein brauchbares Muster sieht so aus:
Halbtotale, 50 mm, statische Kamera auf Stativ,
Studentin in rotem Wollmantel steigt aus dem Linienbus,
langsame Fahrt nach vorn, flache Schärfentiefe,
Regen, Scheinwerferlicht, blaue Stunde
Licht, Farbe und Material
Licht ist der zweite große Hebel. Statt „schön beleuchtet“ beschreibst du die Quelle: „weiches Fensterlicht von links“, „Neonlicht in Magenta und Cyan“, „hartes Mittagslicht mit kurzen Schatten“. Farbangaben sollten sich auf zwei bis drei Haupttöne beschränken, sonst kippt die Palette.
Materialbeschreibungen stabilisieren Oberflächen über Frames hinweg: gebürstetes Aluminium, nasses Kopfsteinpflaster, grober Leinenstoff, mattes Porzellan. Sie geben dem Modell physikalische Ankerpunkte.
Tempo, Dauer und Schnittlogik
Formuliere das Tempo explizit: „ruhige Bewegung“, „hektische Handkamera“, „Zeitraffer“. Auch die Dauer gehört in deine Planung, nicht in den Prompt. Plane Einstellungen mit vier bis sechs Sekunden, wenn du später schneiden willst, und mit acht bis zehn Sekunden, wenn eine durchgehende Bewegung im Vordergrund steht.
Konsistenz aufbauen: Figuren, Welten, Requisiten
Konsistenz entsteht nicht im Prompt allein, sondern durch Referenzen. Der wichtigste Trick: Verwende für jede wiederkehrende Figur eine feste Beschreibungszeile, die du wortwörtlich in jeden Prompt kopierst. Kreative Variation an dieser Stelle ist der häufigste Grund für springende Identitäten.
Referenzbilder und Multi-Image-Fusion
Viele Systeme akzeptieren heute mehrere Referenzbilder gleichzeitig – etwa ein Gesicht, ein Kostüm und einen Schauplatz. Nutze das gezielt: Ein Bild für Identität, ein Bild für Garderobe, ein Bild für Umgebung. Weniger ist mehr: Drei klar getrennte Referenzen funktionieren besser als sechs überlappende, die dem Modell widersprüchliche Signale geben.
Achte darauf, dass Referenzbilder dieselbe Lichtrichtung und ähnliche Farbtemperatur haben. Ein hartes Sonnenlichtfoto als Gesichtsreferenz in einer Nachtszene erzeugt fast immer Spannungen.
Seeds, Startframes und Endframes
Wenn dein Werkzeug einen Seed unterstützt, halte ihn für alle Einstellungen derselben Szene konstant. Das reduziert das visuelle Rauschen deutlich. Noch stärker ist die Arbeit mit Start- und Endframe: Du gibst dem Modell den ersten und letzten Zustand vor und lässt es nur den Übergang erzeugen. Für Kamerafahrten, Türen, die sich öffnen, oder Figuren, die den Bildausschnitt verlassen, ist das die zuverlässigste Methode.
Kontinuitäts-Checkliste
Bevor du eine Sequenz rendern lässt, prüfe diese Punkte:
- Ist die Beschreibungszeile der Hauptfigur in allen Prompts identisch?
- Passen Lichtrichtung und Farbtemperatur zwischen den Einstellungen zusammen?
- Bleibt die Blickrichtung beim Schnitt konsistent (180-Grad-Regel)?
- Wiederholen sich Requisiten in Form, Farbe und Position?
- Ist der Bildausschnitt so gewählt, dass die Bewegung nicht aus dem Frame läuft?
Wer diese fünf Punkte abarbeitet, spart sich später einen Großteil der Nacharbeit.
Modellwahl nach Aufgabe statt nach Hype
Es gibt kein Modell, das alles am besten kann. Die produktive Frage lautet nicht „Welches ist das beste?“, sondern „Welches passt zu dieser einen Einstellung?“. Bewerte Kandidaten anhand von drei Achsen: Konsistenz, Bewegungsqualität und stilistische Kontrolle.
Wenn Konsistenz und Physik zählen
Für Szenen mit wiederkehrenden Figuren, realistischer Schwerkraft und nachvollziehbaren Interaktionen brauchst du ein Modell mit starkem temporalem Gedächtnis. Teste es mit einer einfachen Aufgabe: eine Person, die eine Tasse aufnimmt und absetzt. Wenn der Griff zur Tasse über mehrere Frames stabil bleibt, ist das Modell für narrative Arbeit geeignet.
Wenn Stil und Bewegung zählen
Für Animationslooks, Comic-Ästhetik, Malstile oder stark stilisierte Werbespots zählt eher die Kohärenz der Stilisierung als fotografischer Realismus. Hier sind Modelle im Vorteil, die den Look über die gesamte Sequenz durchhalten, ohne in Realismus zurückzufallen.
Wenn Text, Grafik und Dialog zählen
Sobald Bildschirminhalte, Schilder, Logos oder sprechende Figuren im Spiel sind, verschiebt sich die Priorität. Prüfe, ob Schrift lesbar bleibt und ob Lippenbewegungen zur Tonspur passen. Für solche Einstellungen lohnt es sich, Bild und Ton getrennt zu planen und erst in der Postproduktion zu verbinden.
Eine pragmatische Vorgehensweise: Erstelle eine Testmatrix mit drei Szenentypen – Porträt mit Bewegung, weite Landschaft mit Kamerafahrt, Objektinteraktion – und rendere jede in zwei oder drei Kandidaten. Nach einer halben Stunde hast du belastbare Daten statt Meinungen.
Ein Produktions-Workflow von der Idee zum Masterfile
Die meisten enttäuschenden Ergebnisse entstehen nicht durch schlechte Prompts, sondern durch fehlende Planung. Der folgende Ablauf funktioniert für Werbespots, Kurzfilme, Social-Clips und Erklärvideos gleichermaßen.
1. Beat-Sheet statt Drehbuch
Notiere die Handlung in fünf bis acht Beats, jeder mit einem Satz. Ein Beat ist eine Zustandsänderung: „Sie entdeckt den Brief“, „Der Zug fährt an“, „Er öffnet die Tür“. Aus jedem Beat wird später eine oder zwei Einstellungen.
2. Shotlist mit technischen Feldern
Erstelle eine Tabelle mit den Spalten: Beat, Einstellungsgröße, Kamerabewegung, Licht, Dauer, Referenzbild, Prompt-ID. Diese Tabelle ist dein eigentliches Produktionswerkzeug. Sie macht sichtbar, wo Konsistenzbrüche drohen.
3. Prompt-Bibliothek mit Variablen
Baue Prompts modular. Ein Block für die Figur, einer für die Optik, einer für Licht, einer für die Umgebung. So änderst du für eine neue Einstellung nur die Einstellungsgröße, nicht die gesamte Beschreibung.
[FIGUR] Frau, Ende 30, dunkle Locken, Sommersprossen,
olivgrüner Leinenmantel, Ledertasche
[OPTIK] 40 mm, Handkamera, subtiles Wackeln
[LICHT] bewölktes Nachmittagslicht, weiche Schatten
[UMGEBUNG] Bahnsteig, grauer Beton, gelbe Linie, Herbstlaub
[HANDLUNG] öffnet eine Falttür, blickt kurz zurück
4. Erst testen, dann produzieren
Rendere jede neue Einstellung zunächst in niedriger Auflösung und kurzer Dauer. Prüfe Bewegung und Kontinuität, bevor du hochauflösende Durchläufe startest. Die Iteration im kleinen Format ist immer günstiger als die Korrektur eines fertigen Clips.
5. Bewerten und gezielt nachsteuern
Ändere pro Iteration nur eine Variable. Wenn du gleichzeitig Licht, Kamera und Handlung umstellst, weißt du nie, welche Änderung gewirkt hat. Führe ein kurzes Protokoll: Prompt-ID, Änderung, Ergebnis in einem Satz.
6. Postproduktion als Qualitätsstufe
Der Rohclip ist Rohmaterial, nicht das Endprodukt. Übliche Schritte:
- Upscaling auf Zielauflösung, danach leichtes Schärfen
- Retiming für gleichmäßiges Tempo, oft 10 bis 20 Prozent langsamer
- Stabilisierung, wenn Handkamera-Look nicht gewollt ist
- Farbanpassung, um Szenen aneinander anzugleichen
- Ton, der die Wahrnehmung von Bewegung erheblich beeinflusst
Ein häufiger Fehler: Wer einen Clip zwanzigmal neu rendert, um ein Detail zu retten, verliert mehr Zeit als beim Drehen einer zusätzlichen Einstellung, die das Problem umgeht.
Kamera- und Fachsprache korrekt einsetzen
Fachbegriffe wirken nur, wenn sie konsistent verwendet werden. Ein verbreitetes Problem ist die Mischung widersprüchlicher Anweisungen: „statische Kamera“ und „Handkamera“ im selben Prompt heben sich auf. Ebenso problematisch sind zu viele Bewegungen in kurzer Zeit.
Nützliche Begriffe und ihre Wirkung:
| Begriff | Wirkung |
|---|---|
| Statisch auf Stativ | maximale Stabilität, gut für Details |
| Langsame Fahrt | räumliche Tiefe, dokumentarisch |
| Kranfahrt | epische Wirkung, teuer im Look |
| Handkamera | Nähe und Unmittelbarkeit, leicht unruhig |
| Flache Schärfentiefe | Fokus auf Figur, Hintergrund weich |
| Gegenlicht | Silhouetten, hoher Kontrast |
| Goldene Stunde | warme Töne, lange Schatten |
Ein weiterer Hebel ist die Nennung einer Referenzästhetik, aber vorsichtig: Beschreibe lieber Eigenschaften als Marken oder Regisseursnamen. „Dokumentarischer Look mit natürlichem Licht und sichtbarem Filmkorn“ ist steuerbarer als der Name einer Produktion.
Typische Fehler und wie du sie behebst
Fehler 1: Zu viele Adjektive, zu wenig Struktur. Lösung: Reduziere auf maximal drei Stimmungsadjektive und investiere die frei gewordenen Wörter in Kamera- und Lichtangaben.
Fehler 2: Wiederholte Identitätssprünge. Lösung: Eine feste Figurenzeile plus Gesichtsreferenz, dazu identische Lichtrichtung in jeder Einstellung.
Fehler 3: Bewegungsunschärfe und Geisterbilder. Lösung: Langsamere Aktionen, weniger gleichzeitige Bewegung, kürzere Einstellungen. Ein einzelner Schritt statt einer ganzen Choreografie.
Fehler 4: Der Clip wirkt wie eine Diashow. Lösung: Bewegung explizit anfordern – Wind, Wasser, Verkehr im Hintergrund, leichte Kamerafahrt. Auch eine subtile Bewegung im Hintergrund erhöht die wahrgenommene Lebendigkeit.
Fehler 5: Szenen passen farblich nicht zusammen. Lösung: Eine feste Farbpalette pro Projekt definieren und in jedem Prompt wiederholen. Nachträgliche Farbkorrektur hilft, ersetzt aber keine konsistente Planung.
Fehler 6: Unlesbare Schrift im Bild. Lösung: Text grundsätzlich in der Postproduktion einfügen. Generierte Schriftzeichen sind fast nie zuverlässig.
Fehler 7: Figuren verlassen den Frame. Lösung: Bildausschnitt und Bewegungsrichtung aufeinander abstimmen. Wenn eine Figur nach links geht, sollte links auch Platz sein.
Qualitätskontrolle mit einem einfachen Bewertungsraster
Bewerte jeden Rohclip auf einer Skala von eins bis fünf, bevor du weitermachst:
- Identität: Ist die Figur eindeutig dieselbe?
- Bewegung: Wirkt die Bewegung physikalisch plausibel?
- Kohärenz: Bleiben Objekte über Frames stabil?
- Licht: Passt die Beleuchtung zur geplanten Szene?
- Komposition: Führt der Bildausschnitt das Auge sinnvoll?
- Verwendbarkeit: Kannst du den Clip im Schnitt wirklich einsetzen?
Alles unter drei wird neu gerendert. Wer dieses Raster konsequent anwendet, verhindert, dass mittelmäßige Clips in die Montage rutschen und dort den ganzen Film herunterziehen.
FAQ: Häufige Fragen zur KI-Videogenerierung
Wie lang sollte ein Prompt sein? Lang genug, um die vier Kernbereiche abzudecken, kurz genug, um keine Widersprüche zu erzeugen. In der Praxis sind 40 bis 80 Wörter ein guter Bereich.
Sollte ich Prompts auf Englisch schreiben? Viele Modelle verstehen englische Fachbegriffe präziser, besonders Kameratermini. Wenn dein Werkzeug deutsche Prompts zuverlässig verarbeitet, ist Deutsch völlig in Ordnung – achte nur darauf, innerhalb eines Projekts eine Sprache beizubehalten.
Wie viele Einstellungen pro Szene sind sinnvoll? Drei bis sechs. Zu viele kurze Einstellungen wirken hektisch, zu wenige lange werden schnell langweilig.
Was tun gegen flackernde Details? Hintergrund vereinfachen, Bewegung reduzieren, Seed fixieren und eine ruhigere Kamera wählen. Details wie Schmuck, Muster oder kleine Requisiten sind die ersten, die flackern.
Brauche ich mehrere Werkzeuge? Ja, in der Regel schon. Ein Modell für realistische Figuren, ein zweites für Stilisierung oder schnelle Entwürfe. Die Kombination ist normal und kein Zeichen von Unentschlossenheit.
Wie gehe ich mit Dialogszenen um? Plane Mundbewegung und Ton getrennt. Generiere die Einstellung mit ruhiger Kopfhaltung und füge Sprache in der Postproduktion hinzu. Das ist zuverlässiger als der Versuch, synchronisierte Sprache direkt generieren zu lassen.
Wie dokumentiere ich meine Ergebnisse? Ein einfaches Protokoll mit Prompt, Seed, Modell und Bewertung. Nach zwei Projekten hast du eine persönliche Bibliothek, die dich schneller macht als jede neue Modellversion.
Fazit: Vom Prompt zur wiederholbaren Methode
Der Unterschied zwischen zufälligen guten Ergebnissen und verlässlicher Qualität liegt nicht im Geheimnis eines einzelnen Prompts. Er liegt in der Wiederholbarkeit: feste Figurenzeilen, klare Kamerasprache, definierte Farbpaletten, ein Beat-Sheet als Grundlage und ein Bewertungsraster als Filter. Wer diese Elemente einmal aufsetzt, kann sie über Projekte hinweg wiederverwenden, unabhängig davon, welches Werkzeug gerade populär ist.
Behandle KI-Videogenerierung wie eine Produktionsdisziplin und nicht wie ein Experiment. Plane in kurzen Einstellungen, teste im kleinen Format, ändere pro Iteration nur eine Variable und behandle den Rohclip als Material, das noch durch Schnitt, Farbanpassung und Ton geht. Mit dieser Haltung entstehen aus Prompts keine Glücksfälle mehr, sondern Sequenzen, die du bewusst gestaltest – und die auch dann funktionieren, wenn die nächste Modellgeneration deine Werkzeuge austauscht.



