Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

KI-Video-Workflow für YouTube Shorts: Schritt für Schritt

Oct 4, 2026

Warum Kurzformate eine eigene Produktionslogik brauchen

Ein vertikales Kurzvideo ist kein horizontaler Film, der einfach beschnitten wurde. Es ist ein eigenes Format mit eigenen Regeln. Wer das ignoriert, produziert Material, das technisch sauber aussieht und trotzdem nach zwei Sekunden weggewischt wird.

Die wichtigsten Rahmenbedingungen:

  • Seitenverhältnis 9:16, übliche Exportauflösung 1080 × 1920 Pixel. Höhere Auflösungen bringen auf dem Handy kaum sichtbaren Gewinn, kosten aber deutlich mehr Render- und Upload-Zeit.
  • Safe Zones beachten. Die Plattform-Oberfläche überlagert oben etwa 10 bis 12 Prozent und unten bis zu 25 Prozent des Bildes mit Bedienelementen, Beschreibung und Fortschrittsbalken. Alles, was gelesen werden muss, gehört in die mittlere Zone.
  • Der Ton ist nicht immer an. Deshalb braucht jedes Video Untertitel, und die zentrale Aussage sollte auch ohne Ton funktionieren.
  • Die ersten 1,5 Sekunden entscheiden. Nicht die erste Minute, nicht die ersten zehn Sekunden. Wenn in diesem Fenster keine Bewegung, kein Kontrast und kein Versprechen passiert, ist der Rest unsichtbar.
  • Kurzvideos werden in Schleifen geschaut. Der Übergang vom Ende zurück zum Anfang ist ein Gestaltungselement, kein Zufall.

Wer mit KI arbeitet, muss diese Regeln früher einhalten als klassische Produktionen, weil die Generierung selbst Zeit kostet. Ein Clip, der 20 Sekunden lang ist und in Sekunde 4 langweilig wird, hat dich nicht nur Publikum, sondern auch Rechenzeit gekostet. Die Formatlogik ist deshalb kein Marketing-Detail, sondern der Kern der Produktionsplanung.

Was KI-Videoarbeit leisten kann – und wo die Grenzen liegen

KI-Videogenerierung ist kein Ersatz für Dreharbeiten, aber sie verschiebt, was mit kleinem Team realistisch ist. Wer die Stärken und Schwächen kennt, plant anders.

Typische Stärken

  • Konzeptvisualisierung. Eine Idee existiert nach wenigen Minuten als bewegtes Bild, statt nur als Notiz.
  • B-Roll und Atmosphäre. Wetter, Städte, Natur, abstrakte Texturen, Weltraumbilder, Nahaufnahmen von Materialien.
  • Szenen, die man nicht drehen kann. Historische Settings, Fantasy-Umgebungen, gefährliche Orte, mikroskopische Welten.
  • Sprecher-Aufnahmen. Voice-over in mehreren Sprachen, ohne Studio und ohne Terminabsprache.
  • Variantenproduktion. Zehn Hooks für dasselbe Video, um zu testen, welcher zieht.
  • Formatadaption. Ein Kernvideo, daraus mehrere vertikale Kurzfassungen mit anderem Einstieg.

Typische Grenzen

  • Hände und Interaktionen. Finger, die Objekte greifen, Tassen, Besteck, Werkzeuge: hier entstehen die meisten sichtbaren Fehler.
  • Lesbarer Text im Bild. Schilder, Bildschirme, Verpackungen. Generierter Text ist fast immer unbrauchbar und muss im Schnitt ersetzt werden.
  • Durchgehende Kamerafahrten über mehrere Einstellungen hinweg.
  • Lange Takes. Ab etwa fünf bis sechs Sekunden steigt die Wahrscheinlichkeit von Verzerrungen deutlich.
  • Wiederkehrende Gesichter ohne Referenzbilder oder feste Charakterdefinition.

Daraus ergibt sich eine einfache Entscheidungsregel: Alles, was in weniger als drei Sekunden klar erkennbar sein muss, drehst du selbst oder setzt es als Grafik im Schnitt. Alles, was Stimmung, Tempo, Hintergrund und Fantasie trägt, kann die KI liefern. Diese Trennung spart mehr Zeit als jeder Prompt-Trick.

Schritt 1: Idee, Hook und Skript in 30 Minuten

Der teuerste Fehler im KI-Workflow ist Generieren ohne Skript. Zehn halbfertige Clips, die nicht zusammenpassen, kosten mehr Zeit als ein sauberer Plan.

Hook-Muster, die funktionieren

  • Die Gegenthese: eine verbreitete Annahme umdrehen.
  • Die konkrete Zahl: ein überraschendes Ergebnis in Sekunde eins.
  • Der visuelle Bruch: ruhige Szene, plötzlich harter Schnitt.
  • Die offene Frage: nur kurz andeuten, nicht auflösen.
  • Das Ergebnis zuerst: den Payoff vorwegnehmen und danach erklären, wie er entstand.

Skriptgerüst für 35 bis 45 Sekunden

Abschnitt Länge Inhalt
Hook 0–2 s Aussage, Bild oder Bewegung mit Kontrast
Versprechen 2–5 s Warum weiterschauen? Was kommt gleich?
Beats 5–28 s Zwei bis drei Argumente, je ein Bild pro Beat
Payoff 28–38 s Auflösung, Ergebnis, Pointe
Loop 38–42 s Satz oder Bild, das zum Anfang zurückführt

Schreibe das Skript gesprochen, nicht geschrieben. Kurze Hauptsätze, ein Gedanke pro Zeile, maximal zwölf Wörter. Aus jeder Zeile entsteht später genau ein Clip oder eine Grafik. Wenn eine Zeile kein Bild ergibt, ist sie für dieses Format zu abstrakt.

Schritt 2: Prompts, die visuelle Konsistenz erzeugen

Konsistenz ist das Kernproblem jedes mehrteiligen KI-Videos. Zwei Clips mit demselben Motiv sehen oft aus wie aus zwei verschiedenen Filmen. Dagegen hilft Struktur, nicht Glück.

Die Prompt-Formel

Baue jeden Prompt gleich auf:

  1. Subjekt mit drei bis fünf unveränderlichen Merkmalen (Haarfarbe, Kleidung, Alter, Accessoire).
  2. Handlung in einem Satz, im Präsens.
  3. Umgebung mit Ort, Tageszeit, Wetter.
  4. Licht (weiches Fensterlicht, Gegenlicht, Neon, bewölkt).
  5. Optik (35 mm, 85 mm, Makro, Weitwinkel).
  6. Bewegung (langsame Fahrt, statisch, Handkamera, Schwenk).
  7. Stil und Format (dokumentarisch, clean, vertikal 9:16).

Der entscheidende Trick: Der Subjekt-Block bleibt in jedem Prompt wortgleich. Wer bei Clip 1 von einer Frau im roten Mantel und bei Clip 2 von einer Person in rotem Kleid spricht, bekommt zwei verschiedene Personen.

Referenzbilder statt Beschreibungen

Beschreibungen sind unscharf. Ein Referenzbild ist eindeutig. Der stabilste Ablauf:

  • Erzeuge ein Charakterblatt mit Gesicht, Ganzkörperansicht und zwei Posen.
  • Nutze dieses Bild als Referenz für alle weiteren Generierungen.
  • Halte Kamerawinkel und Brennweite zwischen aufeinanderfolgenden Clips ähnlich.
  • Arbeite mit derselben Farbpalette und lege im Schnitt eine gemeinsame Farbkorrektur über alle Clips.

Wenn ein Werkzeug Bild-zu-Video mit Referenzsteuerung erlaubt, nutze es. Der Qualitätsunterschied zu reinem Text-zu-Video ist bei mehrteiligen Videos erheblich.

Schritt 3: Vom Standbild zum bewegten Clip

Die meisten KI-Videos scheitern nicht am Bild, sondern an der Bewegung. Zu viel Bewegung ist der häufigste Grund für Verzerrungen.

Bewegung dosieren

  • Ein Motiv pro Clip, eine Bewegung pro Clip.
  • Langsam statt schnell. Eine ruhige Fahrt wirkt hochwertiger als ein schneller Schwenk.
  • Kurze Segmente. Drei bis fünf Sekunden pro Clip, danach im Schnitt zusammenfügen.
  • Vordergrund einbauen. Eine angeschnittene Schulter oder ein Objekt im Vordergrund erzeugt Tiefe und verdeckt Fehler.
  • Statische Einstellungen mischen. Nicht jeder Clip braucht Kamerabewegung. Statische Bilder mit Bewegung im Motiv wirken oft stärker.

Häufige Artefakte und Gegenmaßnahmen

  • Morphing an Rändern: Motiv weiter in die Bildmitte rücken, Bewegung reduzieren.
  • Flackernde Details: weniger feine Muster, weniger Textiltextur, weniger Laub.
  • Gesichtsverzerrung bei Drehung: Kopf nicht stark drehen lassen, Portraitwinkel beibehalten.
  • Objekt verschwindet: Segment kürzen, statt länger generieren.

Plane außerdem 20 bis 30 Prozent Ausschuss ein. Wer für jeden Clip genau einen Versuch rechnet, plant zu knapp und produziert unter Zeitdruck schlechtere Entscheidungen.

Schritt 4: Ton, Untertitel und Barrierefreiheit

Kurzvideo ist ein Audioformat, auch wenn es stumm geschaut wird. Beides muss funktionieren.

Sprachaufnahme

Eine synthetische Stimme ist dann gut, wenn sie zum Tempo des Videos passt. Zu schnell gesprochen klingt künstlich, zu langsam langweilt. Lies das Skript testweise selbst laut und miss die Dauer. Wenn du bei 40 Sekunden landest, ist die Länge richtig.

Prüfe bei jeder Stimme:

  • Aussprache von Eigennamen und Fachbegriffen
  • Atempausen an Satzgrenzen, nicht mitten im Satz
  • gleichbleibende Lautstärke über alle Takes
  • keine hörbaren Schnittkanten zwischen Sätzen

Abmischung

  • Ziel-Lautheit für YouTube: etwa −14 LUFS integriert.
  • Musik deutlich unter der Stimme, ungefähr 18 bis 22 dB darunter.
  • Soundeffekte sparsam. Ein harter Schnitt braucht keinen zusätzlichen Wusch.
  • Kein Clipping. Ein Limiter auf −1 dB True Peak verhindert Verzerrung auf Handylautsprechern.

Untertitel

Setze Untertitel immer ein, und zwar als eingebrannte Version plus separate Untertiteldatei, falls du sie für andere Plattformen brauchst. Faustregeln: maximal zwei Zeilen, höchstens etwa 32 Zeichen pro Zeile, hoher Kontrast, keine dünnen Schriften, Wort-für-Wort-Hervorhebung nur bei sehr dynamischen Videos.

Ein angenehmer Nebeneffekt: Untertitel zwingen dich zu kürzeren Sätzen. Das verbessert das Skript rückwirkend.

Schritt 5: Schnitt, Tempo und Export

Der Schnitt entscheidet, ob generierte Clips wie ein Video oder wie eine Diashow wirken.

Tempo

  • Schnitt auf die Tonspur. Lege zuerst die Stimme, dann die Bilder. Nicht umgekehrt.
  • Schnittlänge: 1,5 bis 2,5 Sekunden pro Einstellung im Hauptteil, im Hook auch kürzer.
  • J/L-Cuts: Ton des nächsten Clips beginnt vor dem Bildwechsel. Das erzeugt Fluss.
  • Punch-Ins: leichte Zoom-Sprünge von 3 bis 5 Prozent wirken als Akzent ohne harten Schnitt.
  • Ruhepunkte: mindestens ein ruhiger Moment pro Video, sonst ermüdet das Tempo.

Export

  • Auflösung 1080 × 1920, 30 oder 60 fps, konstante Bildrate.
  • H.264, hohes Profil, Datenrate 10 bis 16 Mbit/s.
  • Audio AAC, 320 kbit/s, 48 kHz.
  • Kein schwarzes Startbild und keine Einblendung am Anfang. Der erste Frame muss Inhalt zeigen.
  • Überprüfe das Ergebnis auf dem Handy, nicht am Monitor.

Schritt 6: Veröffentlichen, messen, iterieren

Ein Kurzvideo ist ein Test, kein Endprodukt. Der Upload ist der Beginn der Datenerhebung.

Veröffentlichung

  • Titel mit dem Suchbegriff, nach dem jemand tatsächlich suchen würde.
  • Beschreibung mit zwei bis drei Sätzen und dem Kernbegriff im ersten Satz.
  • Drei bis fünf thematisch passende Hashtags, keine Hashtag-Wüste.
  • Konsistente Upload-Zeiten und eine realistische Frequenz, die du dauerhaft durchhältst.

Kennzahlen, die wirklich etwas sagen

  • Verweildauer in Sekunde 1 und 3. Hier siehst du, ob Hook und erstes Bild funktionieren.
  • Swipe-Away-Rate. Steigt sie im Mittelteil, ist der Übergang zwischen Beat 1 und 2 zu schwach.
  • Replay-Rate. Hohe Wiederholungen sind das beste Signal für einen funktionierenden Loop.
  • Kommentare pro Aufruf. Diskussionen entstehen durch Haltung, nicht durch Information.

Iterationsregeln

Ändere pro Testreihe eine Variable: nur den Hook, nur die Stimme, nur das Tempo. Wer alles gleichzeitig verändert, lernt nichts. Führe ein einfaches Protokoll mit Datum, Hook-Typ, Länge, Musik und Ergebnis. Nach zwanzig Videos siehst du Muster, die dir kein Tutorial erklärt.

Häufige Fehler und Entscheidungskriterien für Werkzeuge

Die meisten Probleme sind Werkzeug-unabhängig. Diese Liste deckt den Großteil ab.

  • Zu lange Einleitung. Kein Logo, keine Begrüßung, kein Marken-Intro.
  • Zu viele Effekte. Übergänge, Filter und Emojis konkurrieren um Aufmerksamkeit.
  • Inkonsistente Figuren. Ohne Referenzbild wird jede Szene zur neuen Person.
  • Aufwendige Hände. Finger bleiben die häufigste Fehlerquelle.
  • Fehlende Untertitel. Ein großer Teil des Publikums schaut ohne Ton.
  • Nur ein Test pro Idee. Dieselbe Idee mit drei Hooks bringt mehr als drei neue Ideen mit einem Hook.
  • Kein Archiv. Ideen, Prompts und Clips gehören in eine strukturierte Ablage, sonst wiederholst du dich.

Worauf du bei der Werkzeugwahl achten solltest

  1. Bild-zu-Video-Qualität – wichtiger als die Anzahl verfügbarer Stilvorlagen.
  2. Konsistenzfunktionen – Referenzbilder, feste Figuren, wiederverwendbare Seed-Werte.
  3. Seitenverhältnisse – natives 9:16 statt nachträglichem Beschneiden.
  4. Export ohne Wasserzeichen und ohne Umweg über fremde Formate.
  5. Nutzungsrechte – kläre vor dem ersten Upload, was kommerziell verwendbar ist.
  6. Wartezeiten – lange Warteschlangen zerstören kreative Iteration.
  7. Bedienbarkeit – ein Werkzeug, das du täglich nutzt, schlägt das leistungsfähigere, das du miedest.
  8. Datenschutz – besonders, wenn du Personen oder interne Motive hochlädst.

Prüfe neue Werkzeuge immer mit demselben Testprojekt: eine Figur, drei Einstellungen, ein Sprecher-Take. So vergleichst du Ergebnisse fair statt nach Demo-Videos.

FAQ

Wie lang sollte ein KI-generiertes Kurzvideo sein?

Für den Einstieg 30 bis 45 Sekunden. Das reicht für Hook, zwei Beats und einen Payoff und ist kurz genug, um die Produktion mehrfach pro Woche zu schaffen. Längere Videos funktionieren nur, wenn der Mittelteil echte Steigerung bietet.

Wie viele Clips brauche ich für 40 Sekunden?

Rechne mit 12 bis 18 Einstellungen, je nach Tempo und Anteil an Grafiken. Bei 1,5 Sekunden pro Schnitt landest du automatisch in diesem Bereich. Weniger Einstellungen wirken schnell wie eine Diashow.

Kann ich dieselbe Figur in mehreren Videos verwenden?

Ja, wenn du ein Charakterblatt anlegst und es in jeden Prompt einfügst. Beschreibe die Figur immer mit denselben Worten und nutze sie als Referenzbild. So entsteht über mehrere Videos hinweg ein erkennbarer Stil.

Lohnt sich eine eigene Stimme oder eine synthetische?

Eine eigene Stimme schafft Bindung, kostet aber Zeit und Ruhe zum Aufnehmen. Synthetische Stimmen sind zuverlässig und konsistent, klingen aber bei emotionalen Passagen schwächer. Ein pragmatischer Mittelweg: eigene Stimme für den Kernkanal, synthetische Stimme für Sprachvarianten und Zweitaccounts.

Wie vermeide ich, dass alles gleich aussieht?

Variiere nicht den Stil, sondern die Perspektive. Gleiche Farbwelt, gleiche Figuren, aber wechselnde Kamerawinkel, Brennweiten und Tageszeiten erzeugen Abwechslung, ohne die Wiedererkennbarkeit zu zerstören. Der häufigste Grund für Langeweile ist nicht das Design, sondern die immer gleiche Einstellungsgröße.

Was mache ich, wenn die Generierung ständig fehlschlägt?

Verkürze den Clip, reduziere die Bewegung, entferne Text und Hände aus der Szene. In neun von zehn Fällen liegt das Problem nicht am Werkzeug, sondern an zu vielen gleichzeitigen Anforderungen in einem einzigen Prompt.

Fazit: Der Workflow ist der Hebel, nicht das Werkzeug

Gute KI-Kurzvideos entstehen nicht durch das spektakulärste Modell, sondern durch ein wiederholbares Verfahren. Ein Skript mit klarem Hook, ein Prompt-Aufbau mit konstantem Subjektblock, kurze Clip-Segmente, saubere Vertonung, rhythmischer Schnitt und eine ehrliche Auswertung der ersten drei Sekunden – das sind die Bestandteile, die den Unterschied machen.

Werkzeuge wechseln schneller als Gewohnheiten. Wer sein eigenes Produktionssystem beherrscht, kann beim nächsten Modellwechsel einfach weiterarbeiten, weil Skript, Charakterblatt und Schnittvorlage bleiben. Beginne deshalb mit einer kleinen Testreihe: eine Idee, drei Hooks, ein Sprecher-Take, fünfzehn Clips. Miss die Verweildauer, ändere eine Variable und wiederhole. Nach wenigen Wochen hast du kein Werkzeug gelernt, sondern ein Format verstanden.

Alexander

Alexander