Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Vom Konzept zum Drehbuch: KI-Regieassistenz für Videos

Oct 6, 2026

Warum zwischen Idee und fertigem Clip die meiste Arbeit liegt

Die meisten Videoprojekte scheitern nicht an fehlenden Ideen. Sie scheitern an der Übersetzung. Zwischen dem ersten Geistesblitz und einem fertigen Clip liegen Dutzende kleiner Entscheidungen: Welche Szene erzählt welchen Teil der Geschichte? Wie sieht die Hauptfigur in der dritten Einstellung aus, wenn sie in der ersten anders beleuchtet wurde? Bewegt sich die Kamera oder das Motiv? Und wie lang darf ein Schnitt dauern, bevor er unruhig wirkt?

Genau an dieser Stelle hat sich in den letzten Jahren ein neuer Arbeitsstil entwickelt. Generative Videomodelle übernehmen die technische Ausführung, während Menschen weiterhin die Regie führen. Der Unterschied zu früheren Werkzeugen: Statt einzelner, isolierter Clips entstehen heute ganze Sequenzen, sofern man den Prozess sauber strukturiert. Wer die Struktur beherrscht, produziert schneller, konsistenter und günstiger. Wer sie ignoriert, verbringt seine Zeit mit dem hundertsten Versuch derselben Einstellung.

Dieser Leitfaden beschreibt einen neutralen, werkzeugunabhängigen Workflow: von der ersten Idee über Szenenplanung und Storyboard bis zum fertigen Clip – inklusive der Entscheidungspunkte, an denen Projekte kippen.

Die vier Ebenen einer KI-gestützten Videoproduktion

Wer KI-Video nur als „Prompt rein, Clip raus“ versteht, überspringt drei Ebenen, die über die Qualität entscheiden. Denken Sie in vier Schichten, die aufeinander aufbauen.

Ebene 1: Narrativ

Hier entsteht die Geschichte: Figur, Ziel, Hindernis, Wendepunkt, Ende. Ohne klares Narrativ wirkt jedes noch so schöne Bild beliebig. Ein nützlicher Test: Können Sie Ihr Video in zwei Sätzen zusammenfassen, ohne über Bilder zu sprechen? Wenn nicht, fehlt die Geschichte – nicht die Technik.

Ebene 2: Visuelle Sprache

Diese Ebene legt Look und Stimmung fest: Farbpalette, Lichtrichtung, bevorzugte Brennweiten, Bildaufbau sowie Wiedererkennungsmerkmale von Figuren und Orten. Sie leistet die meiste Arbeit für Konsistenz und wird am häufigsten vernachlässigt. Ein Beispiel: „warmes Gegenlicht, entsättigte Schatten, 35-mm-Optik“ ist eine brauchbare Vorgabe. „Schön und cinematic“ ist keine.

Ebene 3: Technische Umsetzung

Erst hier kommen Modelle, Auflösungen, Seitenverhältnisse, Bildraten und Bewegungssteuerung ins Spiel. Technik ist wichtig, aber sie kann eine schwache visuelle Sprache nicht retten. Umgekehrt gilt: Eine klare visuelle Sprache macht auch mittelmäßige Technik erstaunlich brauchbar.

Ebene 4: Postproduktion

Schnitt, Ton, Musik, Farbanpassung, Untertitel, Sound-Design. Diese Ebene entscheidet darüber, ob eine Sammlung schöner Einstellungen als Film oder als Aneinanderreihung von Clips wahrgenommen wird.

Die Reihenfolge ist nicht verhandelbar. Wer bei Ebene 3 beginnt, arbeitet rückwärts und merkt es meist erst nach der zehnten Einstellung – wenn Figuren bereits ihr Gesicht gewechselt haben.

Von der Vision zur Logline: der Startpunkt jedes Projekts

Bevor irgendein Prompt geschrieben wird, brauchen Sie drei Sätze: Logline, Ton und Format. Die Logline beschreibt in einem Satz, wer was will und warum es schwierig ist. Der Ton legt fest, wie sich das Video anfühlen soll – sachlich, humorvoll, melancholisch, dramatisch. Das Format bestimmt Seitenverhältnis, Länge und Ausspielkanal.

Ein Beispiel für ein Erklärvideo im Bereich Nachhaltigkeit:

  • Logline: Eine Stadtplanerin entdeckt, dass ein einziger begrünter Innenhof die Temperatur eines ganzen Blocks senkt.
  • Ton: Ruhig, optimistisch, faktenorientiert, ohne Alarmismus.
  • Format: 16:9, 90 Sekunden, Untertitel, Voice-over deutsch.

Aus diesen drei Zeilen lassen sich später alle Szenen ableiten. Fehlt der Ton, bekommen Sie Szenen, die einzeln gut aussehen, aber nicht zusammenpassen. Fehlt das Format, planen Sie Einstellungen, die im finalen Schnitt ohnehin wegfallen.

Vom Treatment zur Szenenliste

Schreiben Sie anschließend ein Treatment von einer halben Seite: Ablauf in fünf bis acht Beats. Jeder Beat ist ein Satz. Diese Beats werden später zu Szenen, und aus Szenen werden Shots. Wer das Treatment überspringt, schreibt stattdessen zwanzig Prompts und wundert sich, warum keine Dramaturgie entsteht.

Szenensegmentierung: Vom Treatment zur Shot-Liste

Die Segmentierung ist der wichtigste Produktionsschritt überhaupt. Sie zerlegen Ihr Treatment in Szenen und jede Szene in einzelne Einstellungen. Jede Einstellung bekommt eine Aufgabe: erklären, zeigen, überleiten, Emotionalität aufbauen oder zusammenfassen.

Eine brauchbare Shot-Liste enthält mindestens sechs Angaben: Nummer, Szene, Beschreibung, Dauer, Kamerabewegung und Prompt-Kern. Beispielhaft könnte das so aussehen:

Shot Szene Beschreibung Dauer Kamera Prompt-Kern
1 Auftakt Stadt bei Hitze aus der Vogelperspektive 4 s langsamer Vorwärtsflug heiße Stadt, Flimmern über Asphalt, entsättigte Töne
2 Auftakt Fußgängerin fächert sich Luft zu 3 s statisch, geringe Tiefenschärfe Nahaufnahme, Schweiß auf der Stirn, hartes Mittagslicht
3 Entdeckung Blick in begrünten Innenhof 5 s Schwenk nach rechts dichter Bewuchs, weiches Licht, kühle Farben
4 Wendepunkt Thermometer fällt sichtbar 3 s Detailaufnahme digitales Display, ruhige Hand, flache Schärfe
5 Abschluss Menschen im Hof, ruhige Atmosphäre 6 s langsamer Rückwärtsflug Abendlicht, Bewegung im Hintergrund, warme Töne

Der Nutzen dieser Tabelle liegt nicht in der Ordnung selbst, sondern in der frühen Fehlererkennung. Sie sehen sofort, ob Ihnen nach 30 Sekunden die visuelle Abwechslung ausgeht, ob zu viele statische Einstellungen aufeinanderfolgen oder ob eine Szene ohne erkennbare Funktion existiert.

Die 3-Sekunden-Regel

Planen Sie Einstellungen zunächst zwischen zwei und sechs Sekunden. Kürzere Shots erzeugen Tempo und eignen sich für Montagen; längere nur dann, wenn im Bild tatsächlich etwas passiert. Bei generativen Modellen gilt zusätzlich: Je komplexer die Bewegung, desto kürzer sollte die Einstellung sein, damit Artefakte nicht sichtbar werden.

Prompts statt Regieanweisungen: So steuern Sie Bild und Bewegung

Ein guter Prompt ist keine Beschreibungswolke, sondern eine Regieanweisung in strukturierter Form. Bewährt hat sich eine Reihenfolge, die von allgemein zu spezifisch geht.

Die Bildformel

  1. Subjekt: Wer oder was ist zu sehen? möglichst konkret, inklusive Kleidung, Alter, Haltung.
  2. Handlung: Was tut das Subjekt in diesem Moment?
  3. Ort und Zeit: Wo, bei welchem Licht, welche Tageszeit, welche Witterung?
  4. Optik: Brennweite, Tiefenschärfe, Perspektive, Bildaufbau.
  5. Stil: Farbpalette, Kontrast, Referenz auf eine visuelle Richtung – ohne konkrete lebende Personen oder geschützte Marken zu imitieren.
  6. Technik: Seitenverhältnis, Auflösungsniveau, Bildrate.

Ein Beispiel, das diese Formel nutzt: „Frau Mitte dreißig in leichter Sommerkleidung, geht langsam durch einen begrünten Innenhof, Nachmittagslicht durch Blätterdach, 35 mm, geringe Tiefenschärfe, entsättigte Grün- und Blautöne, ruhige Handkamera, 16:9.“

Bewegung und Kamera

Beschreiben Sie Bewegung immer zweigeteilt: Was bewegt sich im Bild, und wie bewegt sich die Kamera? „Sie hebt den Kopf, während die Kamera langsam nach oben schwenkt“ ist eindeutig. „Dynamische Szene“ ist es nicht. Bewährte Kamerabegriffe: statisch, Schwenk, Neigung, Dolly vorwärts, Dolly rückwärts, Kranfahrt, Handkamera, Drohnenflug, Orbit.

Was Sie weglassen sollten

Verzichten Sie auf widersprüchliche Angaben – „statisch“ und „schnelle Kamerafahrt“ im selben Prompt erzeugen unvorhersehbare Ergebnisse. Vermeiden Sie außerdem überladene Prompts mit mehr als drei Bewegungen; die Wahrscheinlichkeit steigt, dass das Modell einzelne Teile ignoriert. Und formulieren Sie Ausschlüsse sparsam. Statt zehn Verbote aufzulisten, beschreiben Sie besser präzise, was Sie sehen wollen.

Konsistenz über mehrere Szenen: Figuren, Licht, Look

Konsistenz ist das größte Qualitätsproblem bei KI-Videos – und das am besten lösbare. Es entsteht fast immer aus fehlender Dokumentation. Legen Sie deshalb eine Stil-Datei an, die bei jedem Prompt mitläuft. Sie enthält:

  • Figur: Haarfarbe, Frisur, Gesichtsform, Alter, Kleidung, Accessoires.
  • Licht: Richtung, Härte, Farbtemperatur, Tageszeit.
  • Palette: drei bis fünf Farbwerte in Worten, nicht als Hex-Codes.
  • Optik: Brennweite, Schärfentiefe, Korn.
  • Ausschlüsse: maximal drei Dinge, die nie vorkommen sollen.

Diese Datei ist langweilig – und genau das ist ihr Zweck. Sie ersetzt Gedächtnis durch Nachschlagen. Kopieren Sie die relevanten Zeilen in jeden Prompt, statt sie neu zu formulieren. Kleine Umformulierungen klingen harmlos, verändern aber oft den Look einer ganzen Szene.

Referenzbilder sinnvoll einsetzen

Wo das Werkzeug Referenzbilder unterstützt, verwenden Sie pro Szene höchstens zwei: eines für die Figur, eines für den Look. Mehr Referenzen erzeugen Mischformen, bei denen weder Gesicht noch Stimmung stabil bleiben. Alternativ arbeiten Sie mit einem festen „Keyframe“ pro Szene, den Sie zuerst als Standbild erzeugen und dann animieren lassen.

Ton, Stimme und Musik: der unterschätzte Teil

Viele KI-Videos wirken weniger überzeugend als sie sind, weil der Ton stiefmütterlich behandelt wird. Drei Regeln helfen.

Erst Text, dann Stimme. Kürzen Sie Ihr Voice-over auf das Nötige. Als Faustregel passen in 30 Sekunden etwa 70 bis 80 deutsche Wörter – angenehm gesprochen, mit Atempausen. Wer zu viel Text schreibt, muss später Bilder überfahren.

Musik vor Schnitt oder parallel dazu. Wählen Sie ein Stück mit klarer Struktur und setzen Sie Schnitte auf musikalische Akzente. Das erzeugt den Eindruck von Absicht, selbst wenn die Einstellungen einzeln unspektakulär sind.

Raumklang nicht vergessen. Ein leiser Atmosphäre-Ton unter jeder Szene – Stadtlärm, Blätterrauschen, Bürobrummen – verbindet Einstellungen hörbar. Ohne diese Bettung klingt jeder Schnitt wie ein Bruch.

Typische Fehler und wie Sie sie vermeiden

Nach einigen Dutzend Projekten wiederholen sich dieselben Fehler. Die häufigsten und ihre Gegenmittel:

  1. Zu viele Ideen in einem Clip. Ein 60-Sekunden-Video trägt eine Aussage. Zwei Aussagen brauchen zwei Videos.
  2. Prompts ohne feste Struktur. Ohne Reihenfolge wechseln Look und Figuren zwischen den Einstellungen. Nutzen Sie die Formel aus dem vorigen Abschnitt.
  3. Keine Shot-Liste. Ohne Liste entstehen Lücken in der Dramaturgie, die im Schnitt auffallen – aber dann ist es zu spät.
  4. Bewegung überladen. Je mehr sich gleichzeitig bewegt, desto wahrscheinlicher entstehen Bildfehler. Eine Bewegung pro Shot reicht meist.
  5. Auflösung als Ersatz für Bildidee. Höhere Auflösung macht ein langweiliges Bild nicht interessant. Ändern Sie Perspektive oder Licht.
  6. Konsistenz erst im Schnitt prüfen. Prüfen Sie nach jeder Szene, nicht erst am Ende. Nachträgliche Korrekturen kosten ein Vielfaches.
  7. Ton zuletzt. Wer Ton erst nach dem finalen Schnitt angeht, schneidet oft neu – diesmal gegen die Musik.
  8. Keine Versionierung. Speichern Sie Varianten mit klaren Namen (szene03_v2_licht-warm). Ihr zukünftiges Ich wird Ihnen danken.

Toolauswahl: sechs Entscheidungskriterien

Die Auswahl an KI-Video-Werkzeugen ist groß, und Funktionslisten vergleichen sich schlecht. Orientieren Sie sich an Ihrem Arbeitsablauf statt an Feature-Zählungen.

  • Kontrolle vs. Geschwindigkeit: Manche Werkzeuge liefern sehr schnell brauchbare Ergebnisse mit wenig Steuerung, andere erlauben präzise Kameraführung und Bildkomposition zu Lasten der Geschwindigkeit. Wählen Sie nach Projektart: Social-Clips brauchen Tempo, Markenfilme brauchen Kontrolle.
  • Konsistenzfunktionen: Gibt es Referenzbilder, feste Keyframes, Stilvorlagen oder wiederkehrende Figurenprofile? Für mehrteilige Videos ist das das wichtigste Kriterium.
  • Bewegungssteuerung: Lassen sich Kamerabewegungen getrennt von Motivbewegungen angeben? Wenn nicht, planen Sie mit weniger Bewegung.
  • Format- und Längenflexibilität: Unterstützt das Werkzeug Hochformat, quadratisch, Breitbild sowie kurze und längere Sequenzen ohne Qualitätsverlust?
  • Nachbearbeitbarkeit: Können Sie einzelne Frames austauschen, Segmente verlängern oder Ausgaben in eine Schnittsoftware übernehmen?
  • Lizenz- und Nutzungsbedingungen: Klären Sie vorab, wie erzeugte Inhalte kommerziell verwendet werden dürfen. Das ist kein Nebenaspekt, sondern ein Projektrisiko.

Praktischer Tipp: Testen Sie jedes infrage kommende Werkzeug mit derselben 30-Sekunden-Sequenz aus Ihrer eigenen Shot-Liste. Ein einheitlicher Testaufbau sagt mehr als jede Feature-Beschreibung.

Beispiel-Workflow: ein 90-Sekunden-Erklärvideo

Setzen wir die Schritte zu einem kompletten Durchlauf zusammen. Ausgangspunkt ist die Logline aus dem Nachhaltigkeitsbeispiel.

1. Treatment (30 Minuten). Fünf Beats: Hitze in der Stadt, Beobachtung eines Innenhofs, Messung, Erklärung, Ausblick. Jeder Beat ein Satz, keine Bilder.

2. Szenenliste (30 Minuten). Aus fünf Beats werden sechs Szenen, weil Beat drei in zwei Schritte zerfällt: Messung und Reaktion.

3. Shot-Liste (45 Minuten). 16 Einstellungen zwischen zwei und sechs Sekunden, gesamte Nettolänge etwa 78 Sekunden – die Differenz zum Ziel von 90 Sekunden wird für Titel, Übergänge und Abspann reserviert.

4. Stil-Datei (20 Minuten). Zwei Figuren, eine Lichtsituation pro Tageszeit, vier Farbworte, eine Optikangabe.

5. Keyframes (60 Minuten). Für jede Szene ein Standbild erzeugen. Erst wenn alle Standbilder nebeneinander überzeugen, wird animiert. Diese Reihenfolge spart die meiste Zeit, weil Standbilder schneller und günstiger zu korrigieren sind als Videosequenzen.

6. Animation (90 Minuten). Pro Einstellung zwei bis drei Varianten. Auswahl nach drei Kriterien: Figurenkonsistenz, Bewegungsqualität, Anschlussfähigkeit an die Nachbareinstellung.

7. Schnitt und Ton (60 Minuten). Musik zuerst, Schnitte auf Akzente, Voice-over einpassen, Atmosphärenspur unterlegen.

8. Qualitätskontrolle (20 Minuten). Stumm ansehen: Funktioniert die Geschichte ohne Ton? Dann mit Ton, aber ohne Bild: Klingt der Text wie eine eigenständige Erklärung? Beide Tests decken unterschiedliche Schwächen auf.

In Summe sind das etwa fünfeinhalb Stunden für 90 Sekunden – realistisch für ein Projekt mittlerer Komplexität mit hohem Qualitätsanspruch.

FAQ

Wie lang sollte ein KI-generiertes Video sein?
Für die erste Veröffentlichung 30 bis 90 Sekunden. Längere Formate funktionieren, verlangen aber deutlich mehr Konsistenzarbeit, weil Figuren und Look über mehr Einstellungen stabil bleiben müssen.

Brauche ich ein Storyboard oder reicht eine Shot-Liste?
Eine Shot-Liste ist Pflicht, ein Storyboard ist Kür. Wenn Sie mit Keyframes arbeiten, entsteht das Storyboard ohnehin nebenbei – die Standbilder sind Ihr Storyboard.

Warum sehen meine Figuren in jeder Einstellung anders aus?
Meist fehlt eine dokumentierte Figurenbeschreibung oder die Referenzbilder sind uneinheitlich. Legen Sie eine Stil-Datei an, kopieren Sie die Figurenzeile unverändert in jeden Prompt und nutzen Sie maximal zwei Referenzen pro Szene.

Wie viele Varianten sollte ich pro Einstellung erzeugen?
Zwei bis drei sind ein guter Kompromiss. Bei mehr als fünf Varianten sinkt die Aufmerksamkeit, und Sie wählen am Ende doch nach Bauchgefühl statt nach Kriterien. Definieren Sie die Kriterien vor dem Prüfen.

Kann ich mehrere Werkzeuge in einem Projekt mischen?
Ja, das ist üblich. Achten Sie darauf, dass die visuelle Sprache konsistent bleibt: Palette, Licht und Optik müssen in allen Ausgaben zusammenpassen. Bei Übergängen zwischen Werkzeugen hilft eine neutrale Einstellung ohne Bewegung.

Was mache ich, wenn eine Einstellung einfach nicht funktioniert?
Zerlegen Sie sie. Reduzieren Sie auf eine Bewegung, vereinfachen Sie den Hintergrund, wechseln Sie die Perspektive. Oft löst ein anderer Kamerawinkel das Problem, das drei Prompt-Varianten nicht lösen konnten.

Wie vermeide ich rechtliche Probleme bei Stilreferenzen?
Beschreiben Sie Stilmerkmale (Licht, Palette, Kontrast, Optik) statt konkrete Werke oder Personen zu imitieren. Prüfen Sie zusätzlich die Nutzungsbedingungen des jeweiligen Werkzeugs, bevor Sie veröffentlichen.

Fazit

Der Sprung von der Vision zum Drehbuch ist kein kreativer Akt, sondern ein handwerklicher. Wer Logline, Szenenliste, Shot-Liste und Stil-Datei in dieser Reihenfolge erstellt, bekommt von generativen Werkzeugen genau das, was sie liefern können: konsistente Bilder in Serie. Wer diese vier Dokumente überspringt, produziert Zufallstreffer und nennt sie Stil.

Fangen Sie klein an: ein Video, eine Aussage, sechs Einstellungen. Bauen Sie die Dateien auf, erzeugen Sie Keyframes, animieren Sie erst danach. Nach zwei Projekten wird aus dem Prozess Routine – und aus der Routine ein Tempo, das manuelle Produktion nicht mehr erreichen kann.

Alexander

Alexander