Warum KI-Video jetzt ein Handwerksproblem ist
Die Frage, ob generative Videomodelle brauchbare Bilder liefern, ist beantwortet. Werkzeuge wie Runway, Pika, Kling, Luma oder Veo erzeugen aus einer Textbeschreibung bewegte Aufnahmen, die auf dem Handydisplay überzeugend wirken. Die neue Frage lautet nicht mehr ob, sondern wie: Wie wird aus einem gelungenen Einzelclip eine Sequenz, die zwanzig Sekunden oder drei Minuten lang trägt?
Genau dort entsteht die eigentliche Arbeit. Eine einzelne Generierung ist ein Glücksspiel mit guten Quoten. Eine Sequenz aus zwölf Einstellungen ist ein Projekt. Dazwischen liegt alles, was klassische Produktion ebenfalls kennt: Motiv, Continuity, Lichtlogik, Ton, Schnitt, Freigabe. Der Unterschied besteht darin, dass diese Schritte heute nicht mehr von einem Team am Set erledigt werden, sondern von einer Person am Rechner – in Schleifen, mit Werkzeugen, die jeweils nur einen Teil des Problems lösen.
Wer das unterschätzt, produziert Material statt Filme: schöne Aufnahmen ohne Zusammenhang, Figuren, die zwischen zwei Einstellungen ihr Gesicht wechseln, Kamerafahrten, die im dritten Clip ihre Richtung vergessen. Deshalb ist es sinnvoll, KI-Video nicht als Zauberknopf zu behandeln, sondern als Produktionslinie mit klaren Stationen. Dieser Leitfaden beschreibt eine solche Linie – von der ersten Idee bis zur Auslieferung – und die Entscheidungen, die an jeder Station wirklich zählen.
Der Workflow im Überblick: sieben Phasen
Bevor Details folgen, hilft eine Landkarte. Die meisten frustrierenden Projekte scheitern nicht an der Generierung, sondern an fehlenden Zwischenschritten. Ein belastbarer Ablauf sieht so aus:
- Briefing und Format: Zielgruppe, Länge, Kanal, Aussage.
- Storyboard und Shotlist: Welche Einstellung erklärt was, in welcher Reihenfolge?
- Modell- und Toolwahl: Welches Werkzeug kann welche Aufgabe am besten?
- Prompt-Design und Referenzen: Wiederverwendbare Bausteine statt Einzelversuche.
- Generierung und Selektion: Bewusst mehr Varianten erzeugen, als man braucht.
- Montage, Ton, Text: Der Teil, der aus Clips einen Film macht.
- Qualitätskontrolle und Export: Technische Prüfung, Freigabe, Ausgabeformate.
Wichtig ist die Reihenfolge. Wer mit Phase 5 beginnt, also sofort generiert und später schneidet, verbringt Tage mit Nacharbeit. Wer mit Phase 1 beginnt, spart diese Tage. Das klingt banal, ist in der Praxis aber der häufigste Unterschied zwischen einem Projekt, das fertig wird, und einem Ordner voller Rohmaterial.
Phase 1 und 2: Idee, Format und Storyboard
Format vor Modell
Die Formatentscheidung bestimmt später fast jede technische Wahl. Ein vertikaler Kurzclip für einen Feed braucht schnelle Schnitte, lesbaren Text im oberen Drittel und eine Handlung, die in zwei Sekunden verständlich ist. Ein Erklärvideo mit Sprecherstimme lebt von ruhigen Einstellungen, die lange genug stehen, damit Zuschauer zuhören können. Ein Trailer wiederum braucht Kontrast: langsame Einstellung, harter Schnitt, laute Einstellung.
Wer diese Entscheidung offen lässt, produziert am Ende einen Kompromiss, der in keinem Kontext funktioniert. Deshalb früh festhalten: Seitenverhältnis, Ziellänge in Sekunden, ob es Ton gibt, ob Text im Bild vorkommt, ob eine Figur wiederkehrt.
Die Shotlist als Übersetzungsbrücke
Ein Storyboard muss nicht gezeichnet sein. Eine Tabelle reicht und ist in der Praxis sogar besser, weil sie sich direkt in Prompts übersetzen lässt. Sinnvolle Spalten:
- Nummer und Dauer: Einstellung 3, vier Sekunden.
- Inhalt: Was ist zu sehen, was passiert?
- Kameraführung: Statisch, langsamer Schwenk, Push-in, Handkamera.
- Licht und Stimmung: Warmes Morgenlicht, Neon bei Nacht, weiches Studiolicht.
- Referenzbild: Verweist auf ein vorhandenes Standbild oder eine frühere Einstellung.
- Ton: Sprache, Geräusch, Musik, Stille.
Der unterschätzte Wert dieser Tabelle liegt in der Konsistenz. Sobald Lichtrichtung, Objektivwirkung und Figurenmerkmale schriftlich fixiert sind, kann man bei jeder Generierung prüfen, ob das Ergebnis zur Liste passt. Ohne Liste bleibt nur der Eindruck – und Eindrücke sind bei generierten Bildern notorisch unzuverlässig.
Modellwahl: Entscheidungskriterien statt Hype
Es gibt kein einzelnes bestes Videomodell. Es gibt Modelle mit unterschiedlichen Stärken, und die Aufgabe besteht darin, für jede Einstellung das passende auszuwählen. Sechs Kriterien helfen bei der Entscheidung:
| Kriterium | Warum es zählt | Typische Ausprägung |
|---|---|---|
| Konsistenz | Figuren und Räume müssen über Einstellungen hinweg gleich bleiben | Stark bei bildgestützten Modellen mit Referenzbild |
| Clipdauer | Bestimmt, ob eine Handlung in einem Lauf erzählbar ist | Kurz und stabil oder lang und fehleranfällig |
| Steuerbarkeit | Kamera, Bewegung und Timing müssen kontrollierbar sein | Von Textsteuerung bis Keyframe-Vorgabe |
| Textdarstellung | Beschriftungen und Logos im Bild | Häufig schwach, meist besser extern gelöst |
| Iterationstempo | Wie schnell man Varianten prüfen kann | Beeinflusst die gesamte Projektplanung |
| Nutzungsrechte | Kommerzielle Verwendung, Weitergabe, Bearbeitung | Unterscheidet sich deutlich zwischen Anbietern |
Für die Praxis hat sich eine Aufteilung bewährt: Standbilder entstehen in einem bildstarken Generator, Bewegung in einem videostarken, Stimme in einem Spezialwerkzeug, Musik in einem weiteren. Diese Aufteilung wirkt umständlich, ist aber robuster als der Versuch, alles aus einem einzigen Werkzeug zu pressen. Ein Modell, das Gesichter perfekt hält, aber keine überzeugende Wassersimulation erzeugt, ist für eine Szene am See die falsche Wahl – unabhängig davon, wie gut seine Bewertungen sind.
Sinnvoll ist außerdem, zwei Werkzeuge parallel zu testen, bevor ein Projekt startet. Zehn Minuten Vergleichstest mit derselben Beschreibung sparen später Stunden. Dabei nicht nur die Bildqualität prüfen, sondern auch, ob das Modell Anweisungen zu Kamerabewegung, Tageszeit und Perspektive überhaupt befolgt.
Prompting als Baukasten
Vom Einzeiler zum Baukasten
Ein Prompt in natürlicher Sprache funktioniert für Experimente. Für Produktion braucht man ein System, weil derselbe Look in zwölf Einstellungen reproduzierbar sein muss. Ein bewährter Aufbau besteht aus sechs Bausteinen:
- Motiv: Wer oder was ist zu sehen, mit zwei oder drei konkreten Merkmalen.
- Handlung: Was verändert sich im Clip – eine Bewegung, eine Geste, ein Wetterwechsel.
- Kamera: Perspektive, Brennweite, Bewegung, Geschwindigkeit.
- Licht und Stimmung: Tageszeit, Lichtrichtung, Farbtemperatur, Atmosphäre.
- Stil: Realismus, Animation, Dokumentarästhetik, Farbpalette.
- Technik: Seitenverhältnis, Bildrate, gewünschte Schärfe, Ausschlüsse.
Diese sechs Bausteine bleiben über ein Projekt hinweg konstant, nur Motiv und Handlung wechseln. Das ist der zentrale Trick: Nicht jede Einstellung neu beschreiben, sondern ein Grundgerüst pflegen und nur die variablen Teile tauschen.
Referenzbilder, Seeds und Ausschlüsse
Wer Konsistenz braucht, kommt an Referenzbildern nicht vorbei. Ein Standbild der Hauptfigur, einmal sorgfältig erstellt, wird zur visuellen Ankerkette für alle folgenden Szenen. Modelle, die Bild-zu-Video oder Bild-zu-Bild mit Referenz unterstützen, leisten hier deutlich mehr als reine Textmodelle.
Seeds – also feste Zufallswerte – helfen, Variation zu kontrollieren. Derselbe Seed mit leicht verändertem Prompt erzeugt verwandte Ergebnisse, ein neuer Seed erzeugt einen Sprung. Für Tests empfiehlt sich eine kleine Matrix: drei Seeds, drei Formulierungen, neun Ergebnisse. Danach weiß man, welche Stellschraube tatsächlich wirkt.
Ausschlüsse, oft als Negativ-Prompt bezeichnet, sind kein Allheilmittel, aber nützlich gegen wiederkehrende Fehler: unerwünschte Bildränder, doppelte Gliedmaßen, Wasserzeichen, übermäßige Schärfe, verzerrte Gesichter. Wichtig ist, Ausschlüsse sparsam einzusetzen. Eine lange Verbotsliste verwirrt viele Modelle eher, als dass sie hilft.
Konsistenz über Szenen hinweg
Konsistenz ist die härteste Währung im KI-Video. Sie entsteht nicht durch ein einzelnes Werkzeug, sondern durch Disziplin an vier Stellen:
Figur. Merkmale schriftlich festhalten: Haarfarbe, Frisur, Kleidung, Alter, Gesichtsform, besondere Details. Dann für jede Einstellung prüfen, ob das Referenzbild mitgeliefert wurde.
Raum. Ein Raum braucht eine Orientierung. Wo steht die Tür, wo das Fenster, wo fällt Licht ein? Wenn Zuschauer diese Orientierung nicht aufbauen können, wirken selbst schöne Einstellungen beliebig.
Licht. Lichtrichtung ist eine der stärksten Continuity-Regeln. Zwei Einstellungen derselben Szene mit gegenläufigem Licht wirken falsch, auch wenn niemand benennen kann, warum.
Bewegungsrichtung. Wenn eine Figur nach rechts läuft, sollte sie in der nächsten Einstellung nicht plötzlich nach links laufen, ohne dass ein Schnitt das erklärt.
Für Situationen, in denen ein Modell die Figur trotzdem verändert, gibt es Auswege: kürzere Clips generieren und die Figur in jeder Einstellung durch ein Referenzbild neu verankern, Szenen so schneiden, dass der Wechsel nicht sichtbar wird, oder auf Einstellungen ausweichen, in denen die Figur teilweise verdeckt ist – über die Schulter, im Gegenlicht, von hinten. Diese Lösungen sind nicht elegant, aber sie funktionieren.
Ton, Schnitt und Textgestaltung
Der Ton entscheidet mehr über die wahrgenommene Qualität als das Bild. Ein durchschnittlich generierter Clip mit sauberer Stimme, passender Musik und klarem Rhythmus wirkt professionell. Ein technisch brillanter Clip mit hallender Stimme und liebloser Musik wirkt wie ein Test.
Für Sprachaufnahmen haben sich drei Wege etabliert: eine synthetische Stimme aus einem Spezialwerkzeug, eine selbst eingesprochene Aufnahme mit nachträglicher Bearbeitung, oder ein Hybrid, bei dem die synthetische Stimme als Temp-Track dient und später ersetzt wird. Die entscheidende Frage ist nicht, welche Stimme am natürlichsten klingt, sondern welche zur Aussage passt. Ein erklärender Text braucht eine andere Stimme als ein Trailer.
Beim Schnitt gilt eine Regel aus der klassischen Montage unverändert: Der Schnitt folgt dem Rhythmus, nicht der Clipgrenze. Generierte Clips enden selten dort, wo die Handlung endet. Deshalb ist es üblich, jeden Clip zu beschneiden, die ersten und letzten Bilder zu verwerfen und die brauchbare Mitte zu verwenden. Wer die volle Länge behält, schleppt Ruckler und Auflösungsabfall mit.
Text im Bild sollte grundsätzlich extern entstehen. Generierte Schrift ist unzuverlässig, wandert, verzerrt und ändert zwischen Frames ihre Form. Beschriftungen, Untertitel und Logos gehören in eine Schnitt- oder Grafikumgebung. Das ist ein Zwischenschritt mehr, spart aber unzählige Korrekturschleifen.
Ein oft vergessener Punkt ist die Übergangsgestaltung. Harte Schnitte funktionieren bei generiertem Material meist besser als Überblendungen, weil sie stilistische Sprünge kaschieren. Überblendungen ziehen Aufmerksamkeit genau auf die Stelle, an der sich Figuren oder Licht ändern – also auf die Schwäche.
Qualitätskontrolle und typische Fehlerbilder
Vor der Auslieferung lohnt eine systematische Prüfung in voller Auflösung, nicht in der Vorschau. Fünf Fehlerbilder treten dabei besonders häufig auf:
Morphing. Gesichter und Objekte verändern sich innerhalb weniger Frames. Ursache ist meist eine zu lange Clipdauer oder zu viel Bewegung. Lösung: kürzere Segmente, weniger gleichzeitige Bewegungen, mehr Referenzmaterial.
Instabile Hände und Details. Finger, Brillen, Schmuck und Werkzeuge geraten in Bewegung aus der Form. Lösung: Einstellungen wählen, in denen diese Details nicht im Vordergrund stehen, oder Standbilder mit sauberer Ausgangslage liefern.
Unruhige Kamera. Modelle interpretieren „dynamisch“ oft als hektisch. Lösung: explizite Begriffe wie „langsame Fahrt“, „stabile Stativaufnahme“, „gleichmäßige Bewegung“ verwenden und Bewegungsumfang begrenzen.
Stilbruch. Zwei Einstellungen derselben Szene wirken wie aus verschiedenen Filmen. Ursache ist ein gewechseltes Modell oder ein geänderter Schlüsselbegriff im Stilbaustein. Lösung: Stilblock unverändert übernehmen, Modellwechsel nur zwischen Szenen.
Tonversatz. Lippenbewegung und Stimme driften auseinander. Lösung: Sprache separat aufnehmen, im Schnitt synchronisieren, Einstellungen ohne sichtbaren Mund bevorzugen.
Neben diesen Bildfehlern gibt es organisatorische Fehler, die ebenso teuer sind: Dateien ohne Versionsnummer, Prompts, die nur im Kopf existieren, Referenzbilder ohne Zuordnung. Eine einfache Ordnerstruktur mit Projektname, Szene, Version und Datum löst das Problem dauerhaft.
Skalierung, Rechenzeit und Kosten realistisch planen
Sobald der Workflow steht, stellt sich die Frage nach der Menge. Drei Hebel wirken hier am stärksten.
Vorproduktion mit Standbildern. Wer zuerst alle Schlüsselbilder als Standbilder erstellt, prüft Bildsprache, Licht und Komposition, bevor teure Bewegung generiert wird. Änderungen am Standbild sind schnell und günstig, Änderungen an einem fertigen Clip nicht.
Kurze Segmente. Vier bis sechs Sekunden sind für die meisten Modelle der beste Kompromiss aus Stabilität und Nutzbarkeit. Längere Szenen entstehen durch Montage mehrerer Segmente, nicht durch einen langen Generierungslauf.
Batch-Tests. Zehn Varianten einer Einstellung in einem Durchgang sind effizienter als zehn einzelne Versuche mit dazwischenliegender Bearbeitung. Danach wird ausgewählt, nicht weitergebastelt.
Bei der Planung hilft eine ehrliche Rechnung. Auf eine fertige Minute kommen erfahrungsgemäß deutlich mehr generierte Sekunden, weil Ausschuss, Wiederholungen und Varianten eingerechnet werden müssen. Wer mit einem Verhältnis von eins zu fünf plant, liegt selten falsch. Zusätzlich kostet die Nachbearbeitung Zeit: Schnitt, Ton, Text und Prüfung machen bei kurzen Formaten oft die Hälfte des Arbeitsaufwands aus.
Ein realistischer Projektplan enthält deshalb Puffer für Iteration. Wer einen Tag für zwölf Einstellungen einplant und keinen Puffer für Korrekturen vorsieht, wird die Deadline nicht halten – nicht wegen der Technik, sondern wegen der Normalität von Ausschuss.
Häufige Fragen und Fazit
Wie viele Modelle brauche ich wirklich? Für einfache Projekte reichen zwei: eines für Standbilder, eines für Bewegung. Komplexere Produktionen profitieren von einem spezialisierten Werkzeug für Sprache und einem für Musik. Mehr Werkzeuge bedeuten mehr Konsistenzaufwand.
Was mache ich, wenn eine Figur nicht konsistent bleibt? Erst Referenzbilder erzwingen, dann Clipdauer verkürzen, dann Perspektiven wählen, die Gesichter weniger zeigen. Wenn all das scheitert, ist die Szene falsch geplant und sollte umgeschrieben werden.
Sind lange Clips besser? Meist nicht. Kürzere Segmente liefern stabilere Ergebnisse und mehr Kontrolle im Schnitt.
Brauche ich spezielle Hardware? Für gehostete Modelle nicht. Für lokale Bildgenerierung mit Werkzeugen wie ComfyUI oder Stable Diffusion hilft eine starke Grafikkarte, ist aber für den Einstieg nicht zwingend.
Wie verhindere ich KI-Optik? Durch weniger Perfektion: leichte Unschärfe, unvollkommenes Licht, echte Geräusche, kleine Bewegungen statt spektakulärer Fahrten, Schnitte an den richtigen Stellen. Der Eindruck entsteht im Schnitt, nicht im Modell.
Wie lange dauert ein Projekt? Ein 30-Sekunden-Clip mit sechs Einstellungen ist an einem konzentrierten Arbeitstag machbar, wenn Drehbuch, Referenzbilder und Stimme vorbereitet sind. Ohne Vorbereitung dauert es mehrere Tage.
Das Fazit fällt nüchtern aus. KI-Video ist kein Wunderversprechen, sondern eine neue Produktionslinie mit bekannten Regeln. Wer Format, Storyboard, Modellwahl, Prompt-System, Konsistenzprüfung, Ton und Qualitätskontrolle als zusammenhängende Kette begreift, produziert Ergebnisse, die sich sehen lassen können. Wer nur den Generierungsknopf drückt, produziert Zufall. Der Unterschied liegt nicht im Werkzeug, sondern in der Reihenfolge der Arbeit – und in der Geduld, diese Reihenfolge einzuhalten.




