Warum KI-Video ein Handwerk ist und kein Glücksspiel
Wer heute ein Video produzieren will, braucht kein Studio, kein Kamerateam und keine wochenlange Postproduktion. Ein Laptop, eine klare Idee und ein sauber aufgebauter Arbeitsablauf reichen aus, um Ergebnisse zu erzielen, die vor wenigen Jahren undenkbar gewesen wären. Genau das ist die Verheißung der KI-gestützten Videoproduktion – und gleichzeitig die größte Falle.
Denn die Technik ist nicht das Problem. Die meisten enttäuschenden KI-Videos scheitern nicht an fehlender Rechenleistung, sondern an fehlender Planung. Wer einen Satz in ein Textfeld tippt und auf einen fertigen Film hofft, bekommt Zufall. Wer dagegen in Szenen, Perspektiven, Lichtstimmungen und Übergänge denkt, bekommt Kontrolle.
Die entscheidende Verschiebung betrifft das Verhältnis von Vorbereitung zu Ausführung. In der klassischen Produktion war der Dreh der teuerste Teil: Jede zusätzliche Einstellung kostete Geld, jede Nachaufnahme Zeit. Bei KI-Video ist die Generierung billig und beliebig wiederholbar. Teuer ist nur die verlorene Zeit, wenn die Vorbereitung unklar war. Deshalb gilt: Etwa siebzig Prozent der Qualität entstehen vor dem ersten Generierungsklick – in der Konzeptionsphase.
Dieser Leitfaden beschreibt den kompletten Weg von der ersten Idee bis zum fertigen Schnitt. Er ist bewusst werkzeugneutral gehalten, damit er sich auf jede Kombination aus Generatoren, Schnittprogrammen und Audiowerkzeugen übertragen lässt.
Die Konzeptionsphase: von der Idee zur Prompt-Architektur
Die Konzeptionsphase ersetzt das klassische Storyboard. Statt gezeichneter Panels entsteht eine Sammlung präziser Beschreibungen, die jeweils eine Einstellung definieren. Diese Beschreibungen sind keine kreativen Einfälle mehr, sondern technische Dokumente – und genau darin liegt ihr Wert.
Von der Rohidee zur Szenenliste
Der erste Schritt ist eine Zerlegung. Eine Idee wie „Ein Astronaut erwacht auf einem verlassenen Planeten" ist kein Video, sondern ein Thema. Übersetzbar wird sie erst, wenn man sie in Handlungsschritte gliedert:
- Totale: staubige Ebene, ein beschädigtes Landemodul, Morgenlicht.
- Halbnah: Der Astronaut richtet sich im Cockpit auf, Nebel auf dem Visier.
- Detail: eine Hand greift nach einem gebrochenen Instrument.
- Totale mit Bewegung: Kamera zieht zurück, zeigt die Weite der Landschaft.
Jede Zeile dieser Liste ist eine eigene Einstellung mit eigener Aussage. Wer diese Zerlegung überspringt, produziert später Szenen, die inhaltlich doppelt oder gar nicht erzählen. Eine Szenenliste mit Dauer, Perspektive und emotionaler Funktion ist die stabilste Investition des gesamten Projekts.
Prompt-Bausteine, die sich wiederholen lassen
Gute Prompts sind modular aufgebaut. Sechs Bausteine decken fast alle Fälle ab:
- Subjekt: Wer oder was ist zu sehen? Alter, Kleidung, Materialbeschaffenheit, Zustand.
- Handlung: Was passiert konkret? Eine einzige, klar benannte Bewegung ist besser als drei gleichzeitige.
- Umgebung: Ort, Wetter, Tageszeit, Hintergrunddetails.
- Licht: Weiches Fensterlicht, Gegenlicht, Neon, goldene Stunde, hartes Studiolicht.
- Optik: Brennweite, Tiefenschärfe, Kamerahöhe, Objektivcharakter.
- Bewegung: Wie bewegt sich die Kamera? Stativ, langsamer Schwenk, Fahrt nach vorn, Handkamera.
Der Trick besteht darin, diese Bausteine pro Projekt einmal festzulegen und dann nur die veränderlichen Teile auszutauschen. So entsteht ein konsistentes Grundgerüst, ohne für jede Einstellung bei null zu beginnen.
Ein häufiger Anfängerfehler ist die Überladung. Ein Prompt mit zwölf Adjektiven, drei Handlungen und vier Stilrichtungen erzeugt selten das Gewünschte. Besser ist eine Hauptaussage plus zwei bis drei präzise Verfeinerungen.
Referenzbilder und Stilbibel
Für alles, was wiederkehren soll – Figuren, Orte, Requisiten – lohnt sich eine Stilbibel. Das ist ein einfacher Ordner mit Referenzbildern und Notizen: Wie sieht die Hauptfigur aus? Welche Farbpalette dominiert? Welche Jahreszeit, welche Architektur, welche Materialien?
Drei bis fünf Referenzbilder pro Figur aus verschiedenen Winkeln sind praktikabler als hundert. Entscheidend ist, dass die Referenzen untereinander konsistent sind. Ein Gesicht, das auf einem Bild bartlos und auf dem nächsten bärtig ist, verwirrt jedes Modell.
Neben Figurenreferenzen hilft eine Farb- und Lichtregel. Beispiel: „Kalte Blautöne, ein einziger warmer Lichtakzent pro Bild, keine gesättigten Primärfarben." Solche Regeln sind später im Schnitt die Klammer, die einzelne Clips wie einen zusammenhängenden Film wirken lässt.
Die Produktionsphase: Modellwahl und Generierung
Jetzt beginnt die Ausführung. Der wichtigste Entscheidungspunkt ist die Frage, ob eine Einstellung aus Text oder aus einem Bild heraus entstehen soll.
Wann Text-zu-Video die richtige Wahl ist
Text-zu-Video eignet sich für alles, was neu erfunden werden muss: fremde Welten, abstrakte Konzepte, Establishing-Shots, Stimmungsbilder, Traumsequenzen. Der Vorteil ist maximale Freiheit, der Nachteil geringe Kontrolle über Details wie Gesichter, Kleidung oder Perspektive.
Typische Einsatzfälle:
- Eröffnungseinstellungen, die einen Ort etablieren.
- Übergänge und Zwischenschnitte, die nur Atmosphäre tragen.
- Konzeptvisualisierungen, bei denen es nicht auf Wiedererkennbarkeit ankommt.
- B-Roll für Erklärvideos.
Wann Bild-zu-Video gewinnt
Bild-zu-Video ist die kontrollierte Variante. Man erzeugt oder fotografiert zuerst ein Standbild – mit einem Bildgenerator, aus einem 3D-Rendering, einem Foto oder einem Compositing – und lässt daraus Bewegung entstehen. Da Komposition, Licht und Figur bereits festgelegt sind, bleibt das Ergebnis deutlich näher am Plan.
Für erzählende Projekte ist das meist der bessere Weg. Die Faustregel lautet: Alles, was wiedererkennbar sein muss, beginnt als Bild. Alles, was nur einmal vorkommt, darf als Text starten.
Bewegung, Kameralogik und Timing
Ein Standbild wird erst dann zum Filmbild, wenn Bewegung glaubwürdig motiviert ist. Zu starke oder zu viele Bewegungen sind der häufigste Grund für künstlich wirkende Ergebnisse. Drei Regeln helfen:
- Eine Bewegung pro Einstellung. Entweder die Figur handelt oder die Kamera fährt – nicht beides gleichzeitig intensiv.
- Bewegung folgt Physik. Ein langsamer Schwenk wirkt teurer als ein ruckartiger Zoom.
- Länge nach Inhalt. Eine Einstellung dauert so lange, wie sie Information trägt. Drei Sekunden reichen für einen DetailShot, acht Sekunden für eine Landschaft.
Generiert man vier Varianten pro Prompt, findet man fast immer eine brauchbare. Wichtig ist, die Einstellungen zu nummerieren und die Varianten sauber abzulegen – sonst verliert man nach dreißig Clips die Übersicht.
Visuelle Konsistenz über mehrere Szenen
Konsistenz ist die härteste Herausforderung und gleichzeitig der größte Qualitätsunterschied zwischen Amateur- und Profiarbeit. Ein Publikum verzeiht einzelne schwache Bilder, aber keine Figur, die zwischen zwei Schnitten das Gesicht wechselt.
Figurenkonsistenz
Vier Techniken haben sich bewährt:
- Referenzbild-Sets: mehrere Winkel derselben Figur als Ausgangspunkt.
- Beschreibung mit Ankern: immer dieselben drei bis vier Merkmale im Prompt nennen, alles andere variieren.
- Fusion mehrerer Bilder: zwei oder drei Referenzen gleichzeitig einspeisen, damit das Modell Gesichtszüge und Kleidung stabiler übernimmt.
- Nachbearbeitung: Gesichter im Schnitt angleichen, wenn einzelne Clips abweichen.
Wer es ganz genau braucht, arbeitet mit einem festen Charakter-LoRA oder einem eigenen Trainingsset. Das kostet Vorbereitungszeit, zahlt sich aber bei Serien und wiederkehrenden Formaten sofort aus.
Stilkonsistenz und Farbwelt
Stilkonsistenz entsteht nicht durch einen einzigen Stilbegriff, sondern durch ein Regelwerk:
- Objektivlogik: Immer dieselbe Brennweite für dieselbe Figurengröße.
- Lichtlogik: Tageszeit und Lichtrichtung innerhalb einer Szene nicht sprunghaft wechseln.
- Farbregel: Zwei Grundfarben plus eine Akzentfarbe.
- Grading später: Lieber im Schnitt vereinheitlichen als jedes Modell einzeln zu zwingen.
Ein oft unterschätzter Trick: Eine leichte Filmkörnung oder ein gemeinsames Color-Grading über alle Clips legt sich wie ein Kitt über kleine Unterschiede.
Ton, Stimme und Musik
Video ohne guten Ton wirkt unfertig, selbst wenn das Bild brillant ist. Audio ist kein Anhang, sondern die halbe Wirkung.
Sprachaufnahme und Vertonung
Bei Sprechertexten gibt es zwei Wege: synthetische Stimme oder echte Aufnahme. Synthetische Stimmen sind heute erstaunlich gut, solange man kurze, klar strukturierte Sätze verwendet und Betonungen explizit setzt. Für emotionale Erzählungen bleibt die menschliche Aufnahme meist überlegen.
Für beide Wege gilt: Erst das Skript, dann das Timing, dann das Bild. Wer den Text vertont und danach die Szenenlängen anpasst, spart unzählige Generierungsversuche.
Musik und Geräuschkulisse
Musik steuert Erwartungen. Ein Spannungsbogen braucht nicht zwanzig verschiedene Stücke, sondern ein Thema mit Variationen. Praktisch hat sich bewährt:
- Ein Hauptthema für ruhige Passagen, ein Zweitthema für Bewegung.
- Atmosphärische Grundbetten (Wind, Raumhall, Stadtgeräusch) unter jeder Szene.
- Drei bis fünf Akzentgeräusche pro Minute, mehr wirkt hektisch.
Wichtig ist die Lautheit: Sprache sollte immer verständlich bleiben. Eine einfache Regel ist, Musik um sechs bis zehn Dezibel unter der Sprachspur zu halten.
Postproduktion: aus Clips wird ein Film
Jetzt entscheidet sich, ob die Sammlung einzelner Einstellungen ein zusammenhängendes Werk ergibt oder eine Aneinanderreihung bleibt.
Schnittrhythmus und Szenenlängen
Beginne mit einem Rohschnitt, in dem jede Einstellung genau so lange steht, wie sie Inhalt trägt. Danach kommt der Feinschnitt. Häufige Muster:
- Schneller Einstieg, ruhige Mitte, langsames Ende. Funktioniert fast immer.
- Schnitt auf Bewegung. Ein Schnitt mitten in einer Bewegung wirkt flüssiger als ein Schnitt in der Ruhe.
- Längen variieren. Drei gleich lange Einstellungen hintereinander wirken mechanisch.
Übergänge, Farbanpassung, Sound-Design
Sparsamkeit ist hier die wichtigste Tugend. Hartes Schneiden trägt die meisten Szenenwechsel. Weiche Übergänge, Wipes oder Blenden setzt man gezielt für Zeit- und Ortswechsel ein. Zu viele Effekte machen ein KI-Video sofort erkennbar.
Beim Grading lohnt sich eine einheitliche LUT oder eine feste Farbkurve über das ganze Projekt. Kontrast, Weißabgleich und Sättigung werden pro Clip nur leicht justiert, nicht neu erfunden. Am Ende steht das Sound-Design: Raumklang unter jeder Szene, gezielte Akzente bei Bewegungen, eine saubere Lautheitsnormalisierung.
Export und Formate
Vor dem Export klären: Zielplattform, Seitenverhältnis, Lautheitsstandard, Untertitel. Wer früh im Hochformat plant, muss später nicht neu rahmen. Für Social-Plattformen sind 9:16 mit sicheren Randbereichen und eingebrannten Untertiteln ein solider Standard.
Typische Fehler und wie man sie vermeidet
Zu viele Aktionen pro Prompt. Das Modell mittelt die Bewegungen und erzeugt Matsch. Lösung: eine Handlung pro Einstellung.
Fehlende Nummerierung. Nach zwanzig Clips weiß niemand mehr, welche Variante zu welcher Szene gehört. Lösung: Dateinamen mit Szenennummer und Version.
Stilwechsel mitten im Film. Lösung: Stilbibel führen und Farbregel konsequent anwenden.
Bild ohne Ton geplant. Lösung: Audiospur zuerst, Bild danach.
Zu lange Einstellungen. KI-Bilder „leben" oft von kurzen Momenten. Lösung: lieber zwei kürzere Einstellungen als eine lange.
Perfektionismus pro Clip. Lösung: Rohschnitt zuerst, Nachbesserung nur bei Szenen, die im Kontext wirklich stören.
Ignorierte Auflösung und Seitenverhältnis. Lösung: Ausgabeanforderungen vor der ersten Generierung festlegen.
Ein kompletter Workflow in sieben Schritten
- Idee fixieren. Ein Satz, der sagt, was das Publikum fühlen soll.
- Szenenliste schreiben. Acht bis zwölf Einstellungen für einen Kurzfilm von ein bis zwei Minuten.
- Stilbibel anlegen. Referenzbilder, Farbregel, Lichtregel.
- Referenzbilder erzeugen. Pro Figur drei bis fünf Winkel, pro Ort zwei bis drei Ansichten.
- Audio vorproduzieren. Sprechertext aufnehmen, Musik auswählen, Timing festlegen.
- Clips generieren. Vier Varianten pro Einstellung, dann die beste auswählen und ablegen.
- Schnitt, Grading, Sound-Design, Export. Rohschnitt, Feinschnitt, Vereinheitlichung, Ausgabe.
Der wichtigste Schritt ist der zweite. Er bestimmt alles, was danach kommt.
Tool-Auswahl: Entscheidungskriterien statt Hype
Es gibt Dutzende Generatoren, und jedes Modell hat Stärken. Statt Ranglisten zu folgen, lohnt sich eine Prüfliste:
- Bildqualität und Detailtreue bei Gesichtern und Händen.
- Bewegungsstabilität über mehrere Sekunden.
- Konsistenzfunktionen wie Referenzbilder oder Charaktererhalt.
- Maximale Clip-Länge, passend zu deinen Szenenlängen.
- Seitenverhältnisse und Auflösung.
- Geschwindigkeit pro Iteration – entscheidend, wenn du viele Varianten brauchst.
- Integration in deinen Schnittablauf und die Dateiformate.
- Rechtliche Klarheit bei kommerzieller Nutzung.
Ein guter Praxisweg ist ein Zwei-Tool-Ansatz: ein Generator für kontrollierte, figurenbasierte Aufnahmen und einer für atmosphärische und experimentelle Bilder. So kombinierst du Stärken, ohne dich an ein einzelnes Modell zu binden. Ergänzend helfen Bildgeneratoren für Referenzen, ein Schnittprogramm mit Farbwerkzeugen und ein separates Audiowerkzeug für Stimme und Mischung.
FAQ
Wie lang sollte ein KI-Kurzfilm sein? Für den Einstieg 60 bis 120 Sekunden. Das entspricht etwa acht bis fünfzehn Einstellungen und bleibt überschaubar.
Wie viele Varianten pro Einstellung sind sinnvoll? Drei bis fünf. Mehr bringen selten bessere Ergebnisse, kosten aber viel Zeit.
Kann ich nur mit Text-zu-Video arbeiten? Ja, aber die Konsistenz leidet. Für alles Wiederkehrende ist der Weg über Referenzbilder zuverlässiger.
Warum sehen meine Bewegungen künstlich aus? Meist liegt es an zu vielen gleichzeitigen Bewegungen, zu großen Geschwindigkeiten oder daran, dass die Kamera ohne Motivgrund fährt.
Brauche ich ein Storyboard? Ein vollständiges Storyboard ist optional, eine schriftliche Szenenliste ist es nicht.
Wie halte ich Gesichter stabil? Referenzbild-Sets, feste Beschreibungsanker, Bild-Fusion und – bei Serien – ein eigenes trainiertes Modell.
Wie viel Zeit sollte ich einplanen? Für ein bis zwei Minuten fertiges Material ist ein realistischer Rahmen von mehreren Arbeitstagen über Konzeption, Generierung und Schnitt.
Was ist der häufigste Anfängerfehler? Sofort generieren. Wer zuerst plant, produziert weniger Clips und bessere Filme.
Funktioniert der Workflow auch für Werbung und Erklärvideos? Ja. Bei Erklärvideos verschiebt sich der Schwerpunkt auf Sprechertext und Grafik, bei Werbung auf Produktkonsistenz – die Grundstruktur bleibt gleich.
Woran erkennt man ein gutes KI-Video? Nicht an der Technik, sondern daran, dass man nach zehn Sekunden vergisst, dass es eines ist. Genau das ist das Ziel: nicht die Demonstration von Werkzeugen, sondern das Erzählen einer Geschichte, die trägt. Wer den hier beschriebenen Ablauf zwei- oder dreimal durchläuft, merkt schnell, dass die Technik nur ein Teil der Gleichung ist – und dass die eigentliche Arbeit an der Idee beginnt.

