Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Text zu Video mit KI: Der komplette Workflow-Leitfaden

Sep 27, 2026

Wo KI-Video heute trägt – und wo es kippt

Text-zu-Video mit KI ist kein Knopf, den man drückt, um einen fertigen Film zu erhalten. Es ist ein Produktionsverfahren. Wer das versteht, produziert in wenigen Stunden Material, das man tatsächlich senden kann. Wer es nicht versteht, verbrennt Tage mit Zufallstreffern und wundert sich, warum Szene drei nicht zu Szene zwei passt.

Die Modelle sind inzwischen erstaunlich gut in allem, was Atmosphäre erzeugt: Establishing Shots, Landschaften, Städte bei Nacht, Regen auf Asphalt, Zeitlupe von Wasser, abstrakte Bewegung, Produktaufnahmen auf ruhigem Hintergrund. Auch kurze, klar beschriebene Handlungen funktionieren – jemand öffnet einen Vorhang, eine Hand streicht über Stoff, eine Figur geht einen Korridor entlang.

Schwach bleiben die Modelle dort, wo mehrere komplexe Ereignisse gleichzeitig koordiniert werden müssen: Hände, die ein Objekt greifen und weitergeben, zwei Personen, die sich berühren, präzise Lippenbewegung über mehrere Sätze, lesbarer Text im Bild, Logos, komplizierte Physik über mehr als acht Sekunden. Auch Kontinuität über einen Schnitt hinweg entsteht nicht von allein, sondern durch Referenzmaterial.

Die praktische Konsequenz daraus ist unspektakulär, aber entscheidend: Man produziert nicht „einen Film aus einem Prompt“, sondern eine Folge kurzer Einstellungen, die man später zusammensetzt. Vier Sekunden pro Clip, zwanzig Clips, ein Schnittprogramm – das ist der Normalfall professioneller KI-Videoproduktion.

Die sechs Bausteine eines belastbaren Workflows

Ein Workflow ist dann belastbar, wenn er auch beim zwanzigsten Shot noch funktioniert. Diese sechs Bausteine gehören dazu, und die Reihenfolge ist kein Zufall.

Skript und Shot-Liste

Bevor irgendein Modell läuft, steht eine Liste. Pro Zeile: Einstellungsnummer, Dauer, Bildinhalt, Kamerabewegung, gewünschte Stimmung. Ein einminütiges Video hat typischerweise 15 bis 25 Einstellungen. Diese Liste ist später die Grundlage für Prompts, für den Schnitt und für die Qualitätskontrolle. Ohne sie entstehen Clips, die einzeln schön und zusammen unbrauchbar sind.

Styleframes als visuelle Klammer

Man definiert ein Look-Bild: Farbpalette, Lichtstimmung, Bildausschnitt, Grad der Realitätstreue. Dieses Styleframe entsteht in einem Bildmodell und dient danach als Referenz für alle Videoclips. Wer diesen Schritt überspringt, bekommt pro Clip eine andere Welt – mal warm und filmisch, mal kühl und flach.

Prompting mit fester Grammatik

Prompts werden nach einem wiederkehrenden Muster gebaut, nicht frei formuliert. Das macht Ergebnisse reproduzierbarer und Fehler auffindbar. Details dazu im nächsten Abschnitt.

Generation in kleinen Stapeln

Man generiert nicht hundert Varianten blind, sondern vier bis sechs pro Shot, mit einer einzigen bewussten Änderung. Wer gleichzeitig Prompt, Seitenverhältnis und Dauer verändert, lernt nichts über die Ursache eines guten Ergebnisses.

Auswahl und Iteration

Aus jedem Stapel wird genau ein Clip ausgewählt. Fällt keiner durch, ändert man eine Variable: Kamerabegriff, Bewegungsintensität, Lichtbeschreibung. Häufig ist das dritte oder vierte Set der Treffer, nicht das erste.

Nachbearbeitung und Ton

Erst im Schnitt entsteht Rhythmus. Clips werden gekürzt, Übergänge gesetzt, Farben angeglichen, Ton und Untertitel ergänzt. Rechne mit 30 bis 50 Prozent der Gesamtzeit für diesen Schritt – er ist kein Anhängsel, sondern die halbe Wirkung.

Prompt-Grammatik: Motiv, Bewegung, Licht, Optik

Ein Prompt ist kein Gedicht. Er ist eine technische Anweisung, und wie jede Anweisung wird er besser, wenn er in einer festen Reihenfolge aufgebaut ist:

Motiv und Handlung → Ort und Zeit → Kamera (Größe, Bewegung, Optik) → Licht und Stimmung → Stil → Ausschlüsse

Ein Beispiel für einen Establishing Shot: „Weite Küstenstraße bei Sonnenaufgang, ein einzelner Kleinwagen fährt von links nach rechts, totale Einstellung, langsame Kamerafahrt nach rechts, 35-mm-Objektiv, weiches Gegenlicht, leichter Dunst, dokumentarischer Look, keine Menschen, kein Text im Bild.“

Ein Beispiel für eine Figur: „Mittlere Einstellung, Frau Mitte dreißig in dunkelgrünem Mantel steht vor einem Fenster und dreht langsam den Kopf nach links, halbnahe Aufnahme, statische Kamera mit minimalem Push-in, weiches Seitenlicht, kühle Farbpalette, cineastisch, keine zusätzlichen Personen, keine Schrift.“

Drei Regeln sparen die meiste Zeit. Erstens: Bewegung immer dosieren. „Die Kamera bewegt sich“ erzeugt Chaos. „Langsamer Push-in“ oder „statische Kamera, nur die Figur bewegt sich“ erzeugt Kontrolle. Zweitens: Nur eine Handlung pro Clip. Sobald zwei Aktionen im Prompt stehen, entscheiden die Modelle selbst, welche sie zeigen – oft keine. Drittens: Ausschlüsse explizit nennen. Text im Bild, Wasserzeichen, zusätzliche Gliedmaßen und doppelte Gesichter gehören in jeden Prompt.

Viele Modelle verstehen deutschsprachige Prompts, reagieren aber auf englische Fachbegriffe für Kamera und Optik präziser. Ein hybrider Prompt – deutscher Inhalt, englische Kamerasprache – ist ein pragmatischer Kompromiss. Wichtig ist, innerhalb eines Projekts bei einer Sprache zu bleiben, sonst verschiebt sich der visuelle Stil unbemerkt.

Charakterkonsistenz über mehrere Einstellungen

Der häufigste Grund, warum KI-Videos unprofessionell wirken, ist eine Figur, die in jeder Einstellung anders aussieht. Das ist lösbar, aber nur mit Vorarbeit.

Charakterbogen anlegen

Erstelle mindestens fünf Referenzbilder derselben Person: frontal, Dreiviertelansicht, Profil, Ganzkörper, Detailaufnahme des Gesichts. Alle mit identischer Kleidung, identischem Haar und identischer Farbpalette. Dazu notiert man die wichtigsten Merkmale in Worten: Haarfarbe, Frisur, Mantelfarbe, Schuhwerk, Alter, Statur. Dieser Bogen ist das eigentliche Kapital des Projekts.

Techniken kombinieren

Drei Methoden greifen ineinander. Erstens Image-to-Video: Der erste Frame ist ein Referenzbild, das Modell animiert es. Zweitens Start- und Endframe: Man gibt Anfang und Ende vor und lässt das Modell dazwischen interpolieren – ideal für kontrollierte Bewegungen. Drittens Figurenreferenzen, wie sie Modelle wie Kling, Runway, Vidu, Hailuo oder Veo in unterschiedlicher Form anbieten. Zusätzlich hilft ein fixer Seed, um bei gleichem Prompt nur kleine Variationen zu erzeugen.

Erwartungen realistisch halten

Auch mit allen Tricks liegt die Trefferquote bei etwa 70 bis 85 Prozent. Deshalb plant man Ausweicheinstellungen ein: Rückansichten, Silhouetten, Hände im Off, Detailaufnahmen von Requisiten, Zwischenschnitte auf Umgebung. Das ist keine Notlösung, sondern klassische Filmsprache – und sie kaschiert Modellschwächen sauberer als jede Nachbearbeitung.

Kamera, Tempo und Schnitt

KI-Clips leben von der Kameraentscheidung, nicht von der Auflösung. Wer Einstellungsgrößen bewusst variiert, erzeugt Dynamik ohne einen einzigen Effekt.

Bewährte Muster: Totale für Orientierung, Halbtotale für Handlung, Nahaufnahme für Emotion, Detail für Information. Bei der Bewegung gilt: Push-in für wachsende Spannung, Pull-out für Auflösung, Orbit für Produkte, Handkamera für Reportage-Gefühl, Kranfahrt für Übergänge.

Im Schnitt werden die Clips kürzer als generiert. Ein vier Sekunden langer Clip landet meist bei anderthalb bis drei Sekunden, weil der erste und der letzte Frame oft weich oder unruhig sind. Man trimmt an beiden Enden, bis die Bewegung sauber sitzt. Achte auf Blickrichtungen: Figur A schaut nach rechts, Figur B nach links, dann passt der Gegenschnitt. Wer das ignoriert, erzeugt das Gefühl, dass zwei Menschen aneinander vorbeireden.

Für Musikvideos, Social Ads und Kurzformate gilt ein eigenes Tempo: Schnitte auf den Takt, 1 bis 2 Sekunden pro Einstellung, Totalen nur als Ruhepol. Für Erklärvideos ist das Gegenteil richtig: längere Einstellungen, ruhige Kamera, damit der Zuschauer dem Inhalt folgen kann, nicht der Bewegung.

Beispielprojekt: 60-Sekunden-Erklärvideo Schritt für Schritt

Ein konkretes Beispiel macht den Aufwand greifbar. Ziel: ein einminütiges Erklärvideo für ein fiktives Lernprodukt.

Schritt 1: Skript. Sechs Abschnitte, je etwa zehn Sekunden, jeweils ein Gedanke. Kein Satz länger als zwölf Wörter, denn Sprechgeschwindigkeit bestimmt später das Timing.

Schritt 2: Voiceover zuerst. Das Voiceover wird vor der Videoproduktion aufgenommen, entweder mit eigener Stimme oder mit einem Sprachmodell. Man erhält eine exakte Zeitachse: Wo beginnt Satz drei, wo endet er. Diese Zeiten sind das Rückgrat der Shot-Liste.

Schritt 3: Shot-Liste. Aus sechs Abschnitten werden achtzehn Einstellungen. Pro Abschnitt eine Totale, eine Detailaufnahme und eine Figur- oder Interface-Einstellung.

Schritt 4: Styleframe. Ein Bild legt Palette und Licht fest: gedämpftes Blau, warmes Fensterlicht, klare Kanten, moderner Bürolook. Dieses Bild ist Referenz für alle Clips.

Schritt 5: Generierung. Achtzehn Shots, je vier Varianten, macht 72 Clips. Mit drei Modellen unterschiedlicher Stärke – eines für Gesichter, eines für Umgebung, eines für Produktdetails – dauert das je nach Auslastung ein bis drei Stunden Rechenzeit.

Schritt 6: Schnitt und Ton. Auswahl, Trimmen, Farbangleich, Musikbett, Soundeffekte, Untertitel, Export in 1080p mit 25 Bildern pro Sekunde sowie eine vertikale Fassung.

Realistischer Zeitrahmen für eine einzelne Person mit etwas Übung: sechs bis zehn Stunden. Der größte Einzelposten ist nicht die Generierung, sondern Auswahl und Schnitt.

Ton ist die halbe Miete: Stimme, Musik, Sound Design

Zuschauer verzeihen einen mittelmäßigen Clip, aber keinen schlechten Ton. Deshalb gilt: Voiceover zuerst, Video danach. Nur so kann man Shots auf Satzlängen zuschneiden, statt Sätze in vorhandene Clips zu quetschen.

Für Musik reicht ein ruhiges, lizenzfreies Bett, das nie lauter ist als die Stimme. Ein professioneller Eindruck entsteht durch kleine Soundeffekte: ein Klick bei Textwechsel, ein leises Whoosh bei einer Einstellung, ein weiches Ausblenden am Ende. Diese Effekte kosten wenig Zeit und tragen überproportional zur Wirkung bei.

Die Stimme sollte hörbar komprimiert und leicht entrauscht sein, Zielwert für Social-Plattformen liegt bei etwa −14 LUFS integriert. Musik wird unter der Stimme abgesenkt – Ducking statt manueller Lautstärkekurven, wenn das Schnittprogramm es anbietet. Untertitel werden zweizeilig gesetzt, maximal rund 40 Zeichen pro Zeile, mit ausreichend Kontrast zum Hintergrund. Wer Untertitel erst nach dem Export automatisch erzeugt, sollte sie manuell prüfen: Eigennamen und Fachbegriffe werden fast immer falsch erkannt.

Qualitätskontrolle: Checkliste vor dem Export

Vor dem finalen Export lohnt eine feste Prüfliste. Sie dauert zehn Minuten und verhindert die häufigsten Peinlichkeiten.

  • Hände und Finger in jeder Einstellung prüfen, besonders bei Greifbewegungen
  • Augen und Zähne bei Nahaufnahmen kontrollieren
  • Auf zufälligen Text, Wasserzeichen oder eingebrannte Logos achten
  • Übergänge auf Bewegungsrichtung und Blickrichtungen prüfen
  • Farbkonsistenz über alle Szenen vergleichen, nicht nur pro Szene
  • Lautheit und Sprachverständlichkeit auf Handylautsprecher testen
  • Untertitel auf Timing, Zeilenlänge und Lesbarkeit prüfen
  • Vertikale und quadratische Bildausschnitte kontrollieren
  • Dateinamen und Versionierung eindeutig halten

Ein Trick aus der Praxis: Das Video einmal stumm und verkleinert auf dem Smartphone ansehen. Alles, was dann auffällt – wackelige Übergänge, unklare Bildinhalte, zu schnelle Schnitte – ist ein echter Fehler und kein Detail.

Typische Fehler und Gegenmaßnahmen

Zu viel Bewegung im Prompt. Ergebnis: verschwommene, unfokussierte Clips. Lösung: Bewegung auf ein Element beschränken, Kamera ruhig halten.

Zu wenige Referenzen. Ergebnis: Figur verändert sich von Szene zu Szene. Lösung: Charakterbogen vor der ersten Generierung anlegen.

Alles gleichzeitig ändern. Ergebnis: Man weiß nie, welcher Parameter den Unterschied gemacht hat. Lösung: Pro Iteration eine Variable.

Stilbruch in der Mitte. Ergebnis: Das Video wirkt zusammengesetzt. Lösung: Styleframe, Farbpalette und Lichtbegriffe im Projekt dokumentieren und konsequent wiederverwenden.

Kein Ton geplant. Ergebnis: Bilder ohne Dramaturgie. Lösung: Voiceover zuerst, Musik und Effekte vor dem Feinschnitt vorbereiten.

Falsche Exporteinstellungen. Ergebnis: Ruckeln, weiche Kanten oder überdimensionierte Dateien. Lösung: Zielplattform vorher festlegen, Bildrate konstant halten, Bitrate eher großzügig wählen.

Keine Versionierung. Ergebnis: Die gute Variante ist nach drei Tagen unauffindbar. Lösung: Klare Ordnerstruktur nach Projekt, Szene und Einstellung, dazu kurze Notizen zu Prompts, die funktioniert haben.

Skalierung: aus einem Video wird eine Serie

Wer regelmäßig produziert, profitiert von Vorlagen. Eine Prompt-Bibliothek mit bewährten Textbausteinen für Licht, Kamera und Stil spart pro Projekt Stunden. Presets für Farbanpassung und Exporteinstellungen sichern den Wiedererkennungswert. Eine Shot-Bibliothek mit passenden Umgebungsaufnahmen reduziert die Zahl der Neuberechnungen deutlich.

Auch die Arbeitsteilung hilft: Eine Person verantwortet Konzept und Skript, eine das Prompting und die Generierung, eine den Schnitt, eine den Ton. Bei kleinen Teams lassen sich diese Rollen zusammenlegen, aber nicht dauerhaft alle auf eine Person – irgendwann leidet immer die Qualitätskontrolle.

Bei Nutzungskosten gilt eine einfache Entscheidungshilfe: Modelle mit sehr guter Gesichtstreue für Figurennahaufnahmen, günstigere Modelle für Umgebung und Hintergrund, spezialisierte Werkzeuge für Produktdetails. Diese Aufteilung senkt die Kosten pro fertiger Minute stärker als jeder Rabatt, weil weniger Ausschuss entsteht. Rechne außerdem mit Stoßzeiten: Wer in Nebenzeiten generiert, bekommt Ergebnisse oft schneller.

FAQ: Häufige Fragen zum KI-Video-Workflow

Wie lang sollten einzelne KI-Clips sein?
Generiere vier bis sechs Sekunden und schneide auf anderthalb bis drei Sekunden herunter. Längere Generierungen kippen häufiger in unruhige Bewegung, und die Ränder sind selten brauchbar.

Welches Modell ist das beste?
Es gibt keines für alles. Für Gesichter und Dialognähe sind Modelle wie Kling, Veo oder Runway stark, für Umgebungen und Stimmungen liefern Hailuo, Wan oder Vidu saubere Ergebnisse, für Produktdetails lohnt ein eigener Durchlauf mit kurzen Clips. Teste drei Modelle mit demselben Prompt und entscheide pro Shot, nicht global.

Brauche ich ein Bildmodell zusätzlich?
Ja. Styleframes und Charakterreferenzen entstehen am zuverlässigsten in einem Bildmodell. Ein gutes Referenzbild verbessert die Videoqualität stärker als die Wahl des Videomodells.

Wie vermeide ich, dass die Figur ihr Gesicht verändert?
Mit Referenzbildern, fixem Seed, identischer Kleidung und stabiler Kameraposition. Wenn es dennoch nicht sitzt, wechsle die Einstellung: Rückansicht, Profil oder Detailaufnahme. Das ist filmisch oft ohnehin die bessere Wahl.

Kann ich deutsche Prompts verwenden?
Ja, aber präzisiere Kamerabegriffe häufig auf Englisch. Entscheidend ist Konsistenz innerhalb eines Projekts. Ein Wechsel mitten im Projekt verändert meist Licht und Stil unbemerkt.

Wie viel Rohmaterial sollte ich einplanen?
Faustregel: dreimal so viel Clipmaterial wie fertige Laufzeit, bei Figurennahaufnahmen bis zu viermal. Wer knapper plant, muss Kompromisse in der Auswahl eingehen – und das sieht man im fertigen Video.

Was mache ich, wenn ein Shot nach zehn Versuchen nicht funktioniert?
Umplanen statt weiterversuchen. Zerlege die Handlung in zwei einfachere Shots oder ersetze sie durch eine Detailaufnahme. Der Umweg ist fast immer schneller als die perfekte Generierung.

Eignet sich der Workflow auch für längere Formate?
Bis etwa drei Minuten funktioniert er sehr gut, weil die Anzahl der Einstellungen überschaubar bleibt. Bei längeren Formaten steigen Konsistenzaufwand und Qualitätskontrolle überproportional – dort lohnt eine Mischung aus KI-Clips, realem Material und Grafik.

Alexander

Alexander