Warum Prompts über die Qualität deiner KI-Videos entscheiden
Textgenerierte Videoproduktion hat sich von einer technischen Spielerei zu einem ernstzunehmenden Produktionswerkzeug entwickelt. Wer heute einen Clip für Social Media, ein Produktvideo oder eine animierte Szene braucht, kann zwischen mehreren leistungsfähigen Modellen wählen – Sora, Kling, Flux, PixVerse, Runway, Luma oder Veo. Der gemeinsame Nenner all dieser Systeme: Was sie ausgeben, hängt fast vollständig davon ab, was du hineingibst.
Ein Prompt ist kein Suchbegriff und auch keine grobe Idee, die ein Mensch mit Kontext auffüllt. Er ist eine komprimierte Spezifikation. Jedes Detail, das du nicht nennst, wird vom Modell mit einem statistischen Durchschnitt gefüllt – und dieser Durchschnitt ist selten das, was du im Kopf hattest. Genau hier entsteht der Unterschied zwischen einem Clip, der zufällig brauchbar aussieht, und einer Einstellung, die du bewusst gestaltet hast.
Dazu kommt die Wirtschaftlichkeit. Ein fehlgeschlagener Durchlauf kostet Zeit, Rechenleistung und – je nach Tarif – auch Kontingent. Wer gelernt hat, Prompts systematisch aufzubauen, braucht deutlich weniger Versuche pro brauchbarer Einstellung. Das ist der eigentliche Hebel: nicht der eine „magische Satz“, sondern eine reproduzierbare Methode.
Dieser Leitfaden zeigt dir diese Methode. Du erfährst, wie Modelle Prompts interpretieren, welche sechs Bausteine fast immer zum Ziel führen, welches Kamera-Vokabular tatsächlich etwas verändert, wie du Prompts auf einzelne Modelle zuschneidest und wie du aus einzelnen Clips eine kohärente Sequenz baust.
Wie ein Modell deinen Prompt tatsächlich liest
KI-Videomodelle arbeiten nicht wie ein Regisseur, der eine Geschichte versteht. Sie übersetzen Text in latente Vektoren und erzeugen daraus zeitlich konsistente Bildfolgen. Das hat praktische Konsequenzen für deine Formulierungen.
Erstens: Das Modell gewichtet Substantive und klar benannte Objekte stärker als abstrakte Adjektive. „Eine Frau in einem gelben Regenmantel geht durch eine belebte Tokioter Einkaufsstraße bei Nacht“ liefert verlässlichere Ergebnisse als „eine melancholische Szene über Einsamkeit“. Emotionen entstehen aus visuellen Hinweisen, nicht aus Gefühlsbegriffen.
Zweitens: Zeitliche Abläufe müssen explizit sein. Viele Modelle erzeugen standardmäßig eine relativ statische Einstellung mit leichter Bewegung. Wenn du eine Handlung willst, musst du sagen, was wann passiert: „Sie öffnet den Regenschirm in der ersten Sekunde, dreht sich dann nach links und geht aus dem Bild.“
Drittens: Negationen funktionieren schlecht. „Kein Text im Bild“ oder „ohne Menschen“ wird von vielen Systemen nicht zuverlässig umgesetzt, weil das Modell das genannte Objekt trotzdem aktiviert. Formuliere stattdessen positiv: „Leere, verlassene Straße, sauberer Asphalt ohne Beschriftung.“
Viertens: Länge ist kein Qualitätsmerkmal. Ein überladener 200-Wort-Prompt verwässert die wichtigsten Signale. Die besten Ergebnisse entstehen meist mit 40 bis 90 Wörtern, die klar priorisiert sind: Subjekt und Handlung zuerst, Stil und Technik danach.
Die sechs Bausteine eines zuverlässigen Video-Prompts
Wer Prompts nach Gefühl schreibt, wiederholt Fehler. Wer sie nach Bausteinen schreibt, kann einzelne Variablen ändern und dadurch lernen. Die folgende Struktur deckt die Bereiche ab, die Modelle tatsächlich auswerten.
1. Subjekt und Kontext
Beginne mit dem, was zu sehen ist. Wer oder was, wo, in welcher Umgebung? Präzise Subjekte schlagen vage Gruppen: „Ein Handwerker Mitte fünfzig mit grauem Bart“ ist besser als „ein älterer Mann“. Nenne Details, die visuell unterscheidbar sind – Kleidung, Materialien, Farben, Wetter, Tageszeit.
Ein häufiger Fehler ist die Überbevölkerung einer Szene. DreiFiguren, zwei Fahrzeuge und ein Tier in einem achtsekündigen Clip führen dazu, dass das Modell alle Elemente halbherzig rendert. Reduziere auf ein Hauptmotiv pro Einstellung.
2. Handlung und Bewegung
Beschreibe Bewegung mit Verben und Richtungen. „Langsam“, „ruckartig“, „kreisend“, „nach vorne“, „aus dem Bild heraus“ sind verwertbare Signale. Denke in Zeitfenstern: Was passiert in Sekunde eins, was in Sekunde vier? Bei kurzen Clips reicht ein einziger Bewegungsbogen.
Wenn du ein statisches Motiv willst, sag es ausdrücklich: „Die Kamera bleibt ruhig, nur das Wasser bewegt sich.“ Ohne diese Angabe fügen viele Modelle eine autonome Kamerafahrt hinzu, die deine Komposition zerstört.
3. Kamera und Objektiv
Kameraanweisungen sind der am meisten unterschätzte Teil eines Prompts. „Nahaufnahme“, „halbtotale Einstellung“, „Vogelperspektive“, „Dolly-in“, „seitliche Kamerafahrt“, „Handkamera“ – solche Begriffe verändern das Ergebnis oft drastischer als jede Stilangabe.
Ergänze bei Bedarf die Optik: „35-mm-Objektiv“, „leichtes Weitwinkel“, „flache Schärfentiefe mit unscharfem Hintergrund“. Das steuert nicht nur die Perspektive, sondern auch, wie stark Hintergrund und Vordergrund getrennt werden.
4. Licht und Atmosphäre
Licht ist Stimmung. Nenne Quelle, Richtung und Qualität: „weiches Fensterlicht von links“, „hartes Gegenlicht zur blauen Stunde“, „Neonlicht mit grünen und magentafarbenen Reflexen auf nassem Asphalt“. Ein Satz dazu hebt die wahrgenommene Qualität eines Clips stärker als jede Auflösungsangabe.
Nebel, Staub, Regen und Rauch sind ebenfalls nützliche Werkzeuge, weil sie Tiefe erzeugen und dem Modell helfen, Vordergrund und Hintergrund zu trennen. Setze sie sparsam ein: ein atmosphärisches Element pro Szene.
5. Stil und Materialität
Hier entscheidest du, ob das Ergebnis wie ein Dokumentarfilm, ein Anime, eine Werbung oder eine analoge Filmaufnahme aussieht. Nenne konkrete Referenzen statt abstrakter Labels: „Kodak-Portra-Look mit feinem Korn“, „Cel-Shading mit klaren Linien“, „Werbeästhetik mit hohem Kontrast und glänzenden Oberflächen“.
Achte darauf, Stilangaben nicht zu mischen. „Fotorealistisch und animiert, Vintage und futuristisch“ führt zu einem inkonsistenten Bild, in dem das Modell permanent zwischen zwei Looks springt.
6. Technische Vorgaben
Am Ende stehen Format und technische Rahmenbedingungen: Seitenverhältnis, Bildrate, gewünschte Länge, Farbprofil. Viele Plattformen bieten dafür eigene Felder – nutze sie, statt diese Angaben in den Prompt zu schreiben. So bleibt der Textprompt für das frei, was tatsächlich Gestaltung ist.
Ein pragmatischer Tipp: Speichere deine Bausteine als Textbausteine in einem Notizdokument. Mit der Zeit entsteht so eine eigene Bibliothek, die du je nach Projekt zusammensetzen kannst.
Kamerasprache: Das Vokabular, das wirklich etwas verändert
Viele Prompt-Ratgeber listen dutzende Fachbegriffe auf, ohne zu sagen, welche davon messbaren Einfluss haben. Aus der Praxis haben sich einige als besonders wirksam erwiesen.
- Einstellungsgröße: Nahaufnahme, Halbnahaufnahme, halbtotale Einstellung, Totale, Weitwinkelaufnahme. Diese Begriffe steuern, wie viel Umgebung zu sehen ist, und damit auch, wie viel das Modell zusätzlich erfinden muss.
- Kamerabewegung: Dolly-in, Dolly-out, Schwenk nach links, Neigen nach oben, Kamerafahrt entlang einer Achse, Drohnenflug. Diese Anweisungen sind zuverlässiger als „dynamische Kamera“.
- Perspektive: Froschperspektive, Vogelperspektive, Augenhöhe, Über-die-Schulter. Besonders die Frosch- und Vogelperspektive erzeugen schnell einen charakteristischen Look.
- Fokus: Flache Schärfentiefe, selektiver Fokus, durchgehende Schärfe. Damit steuerst du, ob das Bild eher filmisch oder dokumentarisch wirkt.
- Tempo: Zeitlupe, Echtzeit, Zeitraffer. Bei Modellen mit fester Ausgabelänge bestimmt das Tempo, wie viel Handlung in den Clip passt.
Kombiniere höchstens zwei bis drei dieser Elemente pro Prompt. Wer gleichzeitig eine Kamerafahrt, einen Zoom, eine Neigung und einen Perspektivwechsel verlangt, bekommt meist ein wackeliges Resultat ohne klare Bildsprache.
Prompts auf einzelne Modelle zuschneiden
Modelle unterscheiden sich in ihrer Interpretationstreue. Derselbe Prompt kann bei zwei Systemen völlig andere Ergebnisse liefern. Deshalb lohnt es sich, für jedes Modell eine eigene Prompt-Variante zu pflegen.
Sora: narrative Tiefe
Sora verarbeitet längere, zusammenhängende Beschreibungen gut und hält Figuren über mehrere Sekunden konsistent. Nutze das, indem du eine vollständige kleine Szene beschreibst statt nur ein Motiv. Ein Satz zur Vorgeschichte hilft: „Sie hat gerade ihren Koffer abgestellt und blickt zurück zum Terminal.“ Solche Kontextsätze erzeugen bei diesem Modell sichtbare Folgen in Mimik und Körperhaltung.
Verzichte im Gegenzug auf zu viele technische Parameter. Bei narrativen Modellen gewinnt Klarheit der Beschreibung, nicht technische Präzision.
Kling: Präzision und Bewegung
Kling reagiert stark auf Bewegungsanweisungen und physikalische Plausibilität. Beschreibe, wie sich Gewicht, Stoff oder Wasser verhalten: „Der Stoff schwingt nach, als sie sich umdreht.“ Auch Kamerabewegungen setzt das Modell meist sauber um, wenn sie einzeln genannt werden.
Ein bewährter Ansatz ist die Trennung in zwei Sätze: erst Subjekt und Umgebung, dann Bewegung und Kamera. Dadurch bleiben die Informationen klar getrennt.
Flux und stilorientierte Modelle
Die Flux-Serie und verwandte Bild-zu-Video-Modelle punkten bei Stilkonsistenz und Lichtsetzung. Sie sind ideal, wenn du einen bestimmten Look über mehrere Clips halten willst. Arbeite hier mit einer wiederkehrenden Stilzeile, die du in jedem Prompt unverändert wiederholst: „Warmer Analogfilm-Look, leichtes Korn, entsättigte Grüntöne.“
PixVerse und offene Alternativen
Offene und kostengünstige Modelle liefern erstaunlich gute Ergebnisse bei kurzen, klar definierten Einstellungen. Sie eignen sich für Tests, Storyboards und schnelle Iterationen. Erwarte hier keine komplexe Handlung – plane stattdessen eine Einstellung pro Prompt und montiere später.
Von der Einstellung zur Sequenz: Kohärenz über mehrere Clips
Ein einzelner schöner Clip ist kein Video. Sobald du mehrere Einstellungen kombinierst, tauchen neue Probleme auf: Figuren verändern ihr Gesicht, Kleidung wechselt die Farbe, Lichtrichtung springt.
Eine bewährte Methode ist ein Prompt-Anker: ein kurzer, unveränderlicher Block, der in jedem Clip der Sequenz identisch bleibt. Er enthält Figur, Kleidung, Hauptfarbe und Lichtstimmung. Nur der Handlungsteil wird pro Einstellung ausgetauscht.
Beispiel für einen Anker:
Protagonistin: Frau, Anfang dreißig, dunkle Locken, gelber Regenmantel. Umgebung: nächtliche Innenstadt, nasser Asphalt, Neonlicht. Look: analoger Film, leichtes Korn, kühle Grüntöne.
Jeder Clip ergänzt nun nur noch die Einstellung: „Totale von schräg oben, sie geht die Straße entlang.“ Der nächste: „Nahaufnahme, sie blickt nach oben, Regen auf dem Gesicht.“ Der dritte: „Halbtotale, sie öffnet die Tür eines Cafés.“
Zusätzlich hilft es, mit Referenzbildern zu arbeiten. Viele Modelle akzeptieren ein Startbild, das die Figur definiert. Das reduziert die Gesichtsdrift drastisch und spart Iterationen.
Workflow: In sechs Schritten vom Skript zum fertigen Clip
- Skript und Shotlist. Schreibe zuerst den Inhalt in normaler Sprache. Zerlege ihn in Einstellungen von zwei bis acht Sekunden. Jede Einstellung braucht genau eine visuelle Aussage.
- Prompt-Anker definieren. Lege Figur, Umgebung, Look und Licht einmal fest. Dieser Block bleibt über alle Prompts hinweg unverändert.
- Prompt bauen. Kombiniere Anker, Einstellungsgröße, Bewegung und Handlung in dieser Reihenfolge. Halte den Text unter 90 Wörtern.
- Testlauf mit niedriger Priorität. Prüfe bei reduzierter Qualität, ob Bildsprache und Bewegung stimmen. Erst wenn die Komposition sitzt, lohnt sich ein hochwertiger Durchlauf.
- Iteration mit einer Variablen. Ändere pro Durchlauf nur ein Element – Kamera, Licht oder Handlung. Wer gleichzeitig alles verändert, lernt nichts aus dem Ergebnis.
- Montage und Ton. Schnitt fängt viele Schwächen auf. Ein Schnitt auf den Takt, eine Farbanpassung und passende Musik machen aus mittelmäßigen Clips oft eine starke Sequenz.
Für längere Projekte empfiehlt es sich, die Prompts in einer Tabelle zu verwalten: Spalte eins die Einstellungsnummer, Spalte zwei der Anker, Spalte drei die Handlung, Spalte vier das Ergebnis. So entsteht mit der Zeit ein Wissensspeicher, auf den du bei neuen Projekten zurückgreifen kannst.
Häufige Fehler und wie du sie korrigierst
Zu viele Adjektive. „Schön, episch, dramatisch, atemberaubend“ sind für ein Modell kaum unterscheidbar. Ersetze sie durch konkrete visuelle Merkmale.
Keine Kamerafestlegung. Ohne Kameraangabe wählt das Modell selbst – und wählt oft eine langsame, wenig aussagekräftige Bewegung. Nenne die Einstellungsgröße immer.
Widersprüchliche Stile. Fotorealismus und Cartoon gleichzeitig erzeugt Matsch. Entscheide dich für eine Richtung.
Text im Bild. Schilder, Logos oder Schriftzeichen werden fast immer fehlerhaft gerendert. Vermeide sie im Motiv oder füge Text später in der Nachbearbeitung hinzu.
Zu lange Clips planen. Ein Modell, das acht Sekunden ausgibt, kann keine zwanzigsekündige Handlung erzählen. Plane lieber mehrere kurze Einstellungen.
Negationen. Formuliere positiv statt „ohne Autos“ → „leere Straße“.
Ignorieren des Seitenverhältnisses. Hochformat für Social Media, Querformat für Web – das beeinflusst die Bildkomposition erheblich. Lege es vor dem Prompt fest.
Kopierfertige Prompt-Vorlagen
Diese drei Vorlagen decken die meisten Alltagssituationen ab. Ersetze die Platzhalter und behalte die Reihenfolge bei.
Produktaufnahme:
Subjekt: matte Keramiktasse, cremeweiß. Umgebung: minimalistischer Tisch, Betonwand, weiches Tageslicht von links. Handlung: Die Tasse dreht sich langsam um ihre Achse, Dampf steigt auf. Kamera: Nahaufnahme auf Augenhöhe, ruhig, flache Schärfentiefe. Stil: klare Werbeästhetik, hoher Kontrast, kein Text im Bild.
Landschaft mit Bewegung:
Subjekt: einsame Küstenstraße. Umgebung: Klippen, tiefer Nebel, früher Morgen. Handlung: Nebel zieht von rechts nach links, Wellen brechen unten an den Felsen. Kamera: Totale, langsame seitliche Kamerafahrt, leichte Drohnenperspektive. Stil: dokumentarisch, entsättigte Blautöne, natürliches Licht.
Porträt mit Handlung:
Subjekt: Frau, Mitte dreißig, dunkle Locken, gelber Regenmantel. Umgebung: nächtliche Innenstadt, nasser Asphalt, Neonlicht. Handlung: Sie hält inne, blickt nach oben in den Regen und lächelt kurz. Kamera: Halbnahaufnahme, Handkamera, leichte Bewegung nach vorne. Stil: analoger Film, leichtes Korn, kühle Grüntöne.
FAQ
Wie lang sollte ein Prompt sein?
Für die meisten Modelle liegt der optimale Bereich zwischen 40 und 90 Wörtern. Kürzere Prompts geben dem Modell zu viel Freiheit, längere verwässern die Prioritäten. Wenn du mehr Kontrolle brauchst, erhöhe nicht die Wortzahl, sondern die Präzision.
Hilft es, Prompts auf Englisch zu schreiben?
Bei vielen Modellen ja, weil das Trainingsmaterial überwiegend englischsprachig ist. Deutsch funktioniert inzwischen ebenfalls gut, besonders bei Modellen mit mehrsprachigem Training. Teste beide Varianten mit demselben Inhalt – die Unterschiede sind oft kleiner als erwartet.
Warum sieht meine Figur in jedem Clip anders aus?
Das ist Gesichtsdrift. Ursachen sind fehlende Anker, zu viele Variablen pro Prompt und fehlende Referenzbilder. Nutze einen identischen Beschreibungsblock für Figur und Kleidung und arbeite, wenn möglich, mit einem Startbild.
Sollte ich Stilbegriffe wie „filmisch“ verwenden?
Nur in Kombination mit konkreten Merkmalen. „Filmisch“ allein ist zu unspezifisch. Besser: „flache Schärfentiefe, warmes Gegenlicht, leichtes Filmkorn“.
Wie viele Durchläufe sind normal?
Bei klar strukturierten Prompts sind zwei bis vier Versuche pro Einstellung realistisch. Wer deutlich mehr braucht, hat meist ein Problem in der Struktur, nicht im Modell.
Funktionieren Negativ-Prompts?
Bei manchen Systemen ja, aber unzuverlässig. Behandle sie als Ergänzung, nicht als Grundlage. Die wichtigste Arbeit leistet eine positive, konkrete Beschreibung.
Wie halte ich Licht über mehrere Einstellungen konstant?
Schreibe die Lichtangabe in den Anker und ändere sie nicht. Wenn eine Einstellung anderes Licht braucht, plane sie bewusst als eigene Lichtsituation und markiere sie in deiner Shotlist.
Kann ich Prompts aus anderen Projekten wiederverwenden?
Ja, und du solltest es tun. Baue eine Bibliothek aus Ankern, Kamerazeilen und Stilblöcken auf. Neue Projekte entstehen dann durch Kombination bewährter Bausteine statt durch Neuerfindung bei jedem Clip. Das beschleunigt die Produktion erheblich und macht Ergebnisse reproduzierbar.



