Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Kurzvideos mit KI erstellen: Von der Idee zum fertigen Clip

Sep 27, 2026

Kurzvideos sind zur Standardsprache des digitalen Erzählens geworden. Ob Produktankündigung, Erklärstück, Recruiting-Clip, Lerninhalt oder reine Unterhaltung: Wer eine Botschaft in 15 bis 90 Sekunden transportieren will, braucht heute kein Drehteam mehr. Generative Videomodelle, eine saubere Tonspur und ein disziplinierter Schnitt reichen in vielen Fällen aus, um ein Ergebnis zu erzielen, das im Feed konkurrenzfähig ist.

Der Unterschied zwischen einem brauchbaren Clip und einem beliebigen liegt selten am Modell. Er liegt im Prozess: Wie klar ist die Idee? Wie präzise ist der Prompt? Wie konsequent bleiben Figur, Licht und Farbe über mehrere Szenen hinweg? Und wie viel Zeit fließt in Ton und Untertitel, die über die wahrgenommene Qualität oft stärker entscheiden als das Bild? Dieser Leitfaden beschreibt einen kompletten Workflow – von der ersten Notiz bis zum exportfertigen Clip.

Warum sich die Produktionslogik verschoben hat

Klassische Videoproduktion folgt einer festen Kette: Drehbuch, Dreh, Materialauswahl, Schnitt, Ton, Farbkorrektur, Export. Diese Kette ist teuer, weil jeder Schritt Zeit und Spezialisten bindet. Generative Werkzeuge verändern nicht jeden einzelnen Schritt, sondern vor allem den Anfang und die Mitte: Konzeption, Visualisierung und Variantenbildung werden deutlich günstiger und schneller. Statt eine Einstellung einmal zu drehen, lassen sich zehn Varianten erzeugen und die überzeugendste auswählen.

Das verändert den Arbeitsstil. Wer früher eine perfekte Einstellung minutiös plante, arbeitet heute eher wie ein Kurator: Man erzeugt eine breite Auswahl, bewertet sie schnell und investiert die eingesparte Zeit in Auswahl und Verfeinerung. Der Engpass verschiebt sich vom Produzieren zum Entscheiden. Wer das nicht akzeptiert und jeden generierten Clip als Endprodukt behandelt, produziert zwar viel, aber selten gut.

Zwei Dinge bleiben unverändert wichtig. Erstens das Konzept: Ohne klare Aussage hilft kein noch so schöner Clip. Zweitens der Ton. Zuschauer verzeihen ein leicht unscharfes Bild, aber keine dumpfe Sprachaufnahme, keinen abgehackten Musikübergang und keine Untertitel, die dem Gesagten hinterherlaufen. Wer sein Budget gedanklich aufteilt, sollte deshalb mindestens ein Drittel der Zeit für Ton, Text und Feinschliff reservieren.

Vom rohen Einfall zum belastbaren Konzept

Der erste Schritt ist keine Software, sondern eine Entscheidung. Bevor irgendein Modell läuft, sollte die Idee in drei Sätzen stehen: Wer sieht das Video? Was soll hängen bleiben? Welche Handlung soll danach folgen? Sind diese drei Sätze nicht klar, wird auch das beste generierte Material beliebig.

Zielgruppe, Kernaussage und Hook zuerst

Die Zielgruppe bestimmt Ton, Tempo und Bildsprache. Ein Erklärvideo für IT-Entscheider darf ruhiger und textlastiger sein als ein Clip für ein Lifestyle-Publikum, der in den ersten zwei Sekunden visuell überraschen muss. Die Kernaussage sollte ein einziger Satz sein, den man am Ende des Videos wiederholen könnte, ohne dass er sich falsch anfühlt. Der Hook ist die visuelle oder inhaltliche Frage, die diese zwei Sekunden füllt.

Ein nützlicher Test: Schreib den Hook auf und lies ihn jemandem vor, der nichts vom Projekt weiß. Fragt die Person nach, was gemeint ist, ist der Hook zu abstrakt. Reagiert sie mit einem Gegenargument oder einer Rückfrage zum Thema, funktioniert er.

Format, Länge und Plattformlogik

Vertikale 9:16-Formate dominieren, aber nicht jedes Thema gewinnt dadurch. Erklärstücke mit Diagrammen funktionieren oft besser in 4:5 oder 1:1, weil mehr Fläche für Text bleibt. Die Länge folgt der Aussage: Ein einzelner Gedanke braucht 15 Sekunden, eine kleine Geschichte 40 bis 60 Sekunden, ein mehrstufiger Ablauf eher 90 Sekunden – wobei alles über 60 Sekunden eine bewusste Entscheidung sein sollte, nicht ein Versehen.

Plane von Anfang an zwei Dinge mit: einen sicheren Bereich für Untertitel und Plattform-Elemente sowie einen ruhigen Moment, in dem der Zuschauer die Kernaussage lesen kann. Wer erst beim Export merkt, dass die Schrift im Interface verschwindet, schneidet neu.

Von der Idee zur Szenenliste

Die Szenenliste ist das wichtigste Dokument im ganzen Prozess. Sie hat typischerweise sechs Spalten: Nummer, Dauer, Bildinhalt, Text oder Voiceover, Zweck der Szene, benötigte Referenz. Fünf bis acht Zeilen reichen für ein Kurzvideo. Der Zweck jeder Szene verhindert, dass schöne, aber funktionslose Einstellungen im Schnitt landen.

Ein Beispiel für eine Szenenliste mit sechs Szenen: Aufmerksamkeit (0–3 s), Problem (3–10 s), Lösung (10–22 s), Beweis oder Detail (22–32 s), Nutzen (32–42 s), Handlungsaufforderung (42–48 s). Diese Struktur ist unspektakulär, aber sie funktioniert in fast jeder Branche und lässt sich beliebig umbenennen.

Prompting: Aus einer Idee wird eine filmbare Szene

Ein Prompt ist kein Wunsch, sondern eine Regieanweisung. Er beschreibt, was die Kamera sieht, nicht was der Zuschauer fühlen soll. „Einsamkeit“ ist kein Bild. „Eine leere Bushaltestelle im Nieselregen, eine Person mit hochgezogenem Kragen, Laternenlicht spiegelt sich in der Pfütze“ ist ein Bild.

Die vier Bausteine eines belastbaren Prompts

Erstens das Subjekt: Figur, Objekt oder Landschaft, mit erkennbaren Merkmalen wie Alter, Kleidung, Material. Zweitens die Handlung oder Bewegung: was sich im Bild wie verändert. Drittens Umgebung und Licht: Ort, Tageszeit, Lichtquelle, Wetter, Stimmung der Farbtemperatur. Viertens die Kamera: Brennweite, Perspektive, Bewegung, Bildtempo.

Wer diese vier Bausteine systematisch abarbeitet, bekommt reproduzierbarere Ergebnisse als mit langen, blumigen Beschreibungen. Ein guter Prompt ist selten länger als fünfzig Wörter.

Beispielhafte Prompt-Vorlage

Ein brauchbares Muster lautet: [Subjekt mit zwei Merkmalen] [Aktion in einem Verb] in [Ort], [Lichtstimmung], gefilmt mit [Kameraangabe], [Bildtempo]. Konkret: „Eine Handwerkerin in blauer Arbeitsjacke öffnet eine Werkzeugkiste auf einer Werkbank, warmes Seitenlicht durch ein Werkstattfenster, Nahaufnahme aus leichter Untersicht mit langsamer Kamerafahrt nach rechts.“

Für Varianten ändert man immer nur einen Baustein gleichzeitig. Wer gleichzeitig Subjekt, Licht und Kamera austauscht, lernt nichts darüber, welcher Baustein das Ergebnis getragen hat.

Was Prompts zuverlässig zerstört

Zu viele Adjektive erzeugen matschige Bilder, weil das Modell sich nicht entscheiden kann. Widersprüchliche Angaben wie „Nachtaufnahme“ und „grelles Sonnenlicht“ führen zu Zufallsresultaten. Abstrakte Begriffe ohne visuelle Übersetzung bleiben wirkungslos. Und negative Formulierungen funktionieren nur dort, wo das Werkzeug sie ausdrücklich unterstützt.

Ein zweiter häufiger Fehler ist die Überladung mit technischen Angaben. Parameter wie Sampler, Schrittzahl oder Seed sind nützlich, wenn man Varianten desselben Bildes braucht – aber sie ersetzen keine gute Bildbeschreibung. Erst die Beschreibung, dann die Technik.

Das passende Modell auswählen

Es gibt nicht das eine beste Videomodell. Es gibt Modelle, die in bestimmten Aufgaben klarer führen, und solche, die in anderen günstiger und schneller sind. Die Auswahl sollte deshalb von der Aufgabe abhängen, nicht von einer Rangliste.

Text-zu-Video, Bild-zu-Video und animierte Standbilder

Text-zu-Video eignet sich für Stimmungsaufnahmen, Landschaften, abstrakte Hintergründe und schnelle Konzepttests. Bild-zu-Video ist stärker, wenn eine konkrete Komposition, ein Produktfoto oder eine Figur erhalten bleiben muss. Die Animation von Standbildern wiederum ist der pragmatischste Weg zu kontrollierten Ergebnissen: Man erzeugt zuerst ein perfektes Einzelbild und bewegt es anschließend mit einer subtilen Kamerafahrt.

In der Praxis kombiniert man alle drei. Der typische Ablauf: Konzeptbild generieren, daraus eine kurze Bewegung ableiten, bei Bedarf Zwischenbilder erzeugen und im Schnitt zusammenführen.

Entscheidungskriterien statt Bauchgefühl

Bewerte jedes Werkzeug anhand von acht Kriterien: maximale Clipdauer, Ausgabequalität, Konsistenz über mehrere Läufe, Steuerbarkeit der Kamera, Umgang mit Text im Bild, Lizenz- und Nutzungsbedingungen, Exportformate und der Preis pro fertiger Minute. Notiere die Werte, bevor du dich verliebst – Modelle wechseln schneller als Workflows.

Ein weiteres Kriterium wird oft übersehen: Wie gut lässt sich ein Fehler korrigieren? Manche Werkzeuge erlauben das Nachbearbeiten einzelner Segmente, andere zwingen zum kompletten Neulauf. Wenn eine Szene zu 90 Prozent stimmt, ist die Möglichkeit zur Teilkorrektur mehr wert als die letzte Stufe Bildqualität.

Testläufe statt Bauchgefühl

Der schnellste Weg zu einer belastbaren Entscheidung ist ein standardisierter Test. Nimm fünf Szenen aus deiner Szenenliste, formuliere für jede einen identischen Prompt und lasse ihn von jedem Kandidaten einmal ausgeben. Bewerte anschließend nach einer festen Checkliste: Erkennbarkeit des Subjekts, Bewegungstreue, Lichtstimmung, Artefakte, Texttreue und Zeit bis zum brauchbaren Ergebnis.

Nach einem solchen Test weißt du, welches Werkzeug dein Arbeitspferd wird und welches nur für Spezialfälle in Frage kommt. Wichtiger noch: Du hast danach Vergleichsmaterial, auf das du dich später berufen kannst, wenn ein Modell aktualisiert wird.

Konsistenz über mehrere Szenen herstellen

Konsistenz ist die eigentliche Königsdisziplin. Ein einzelner schöner Clip ist einfach. Fünf Clips, die wie aus einem Film wirken, sind Arbeit.

Figuren und Gesichter

Wenn dieselbe Person mehrfach auftritt, sollte sie zuerst als Referenzbild definiert werden – am besten in Frontalansicht, neutralem Licht und ohne Bewegung. Dieses Bild dient dann als Basis für alle weiteren Szenen. Beschreibungen wie „dieselbe Frau wie zuvor“ funktionieren nur, solange das Werkzeug den Kontext behält; sichere Ergebnisse liefert die Referenz.

Bei Händen, Profilen und starken Bewegungen bleibt die Figur die fehleranfälligste Stelle. Plane Szenen so, dass kritische Details nicht im Zentrum stehen: Ein Schnitt auf ein Produkt, eine Nahaufnahme oder ein Zwischenschnitt kann einen Moment kaschieren, der sonst auffallen würde.

Licht, Farbe und Objektiv

Konsistenz bedeutet nicht nur dasselbe Gesicht, sondern dieselbe Welt. Formuliere für das gesamte Projekt eine feste Licht- und Farbvorgabe und wiederhole sie in jedem Prompt: warmes Seitenlicht, entsättigte Grün- und Blautöne, weicher Kontrast. Ergänze eine Brennweitenvorgabe, etwa 35 mm für Umgebungen und 85 mm für Details. Diese Wiederholung wirkt unspektakulär, ist aber der stärkste Hebel für einen homogenen Look.

Referenzbilder und Bildkombination

Für Produkte und komplexe Kompositionen lohnt sich die Kombination mehrerer Referenzen: ein Bild für die Form, eines für die Oberfläche, eines für die Umgebung. So lassen sich Materialdetails steuern, ohne sie in Worte fassen zu müssen. Wer häufig Produktvideos erstellt, sollte eine kleine Bibliothek solcher Referenzen aufbauen – sortiert nach Material, Lichtsituation und Perspektive.

Postproduktion: Der Teil, der Qualität sichtbar macht

Die meisten generierten Clips werden nicht durch das Bild, sondern durch den Schnitt gut oder schlecht. Postproduktion ist kein Anhang, sondern die halbe Arbeit.

Schnitt und Rhythmus

Beginne mit einer Rohmontage, in der jede Szene zehn Prozent kürzer ist als geplant. Kurzvideos verlieren fast immer an Tempo. Achte darauf, dass die erste Bewegung im Bild nicht erst nach einer Sekunde beginnt, und dass harte Schnitte an Bewegungsrichtungen ansetzen. Wenn eine Szene nicht funktioniert, kürze sie, statt sie zu retten.

Ton, Musik und Stimme

Voiceover oder Originalton entscheiden über die Glaubwürdigkeit. Sprich in einem Raum mit Textilien auf, nutze ein einfaches Richtmikrofon oder ein Headset und nimm jede Passage zwei- bis dreimal auf. Musik dient der Führung, nicht der Dekoration: Sie sollte unter der Stimme um sechs bis zwölf Dezibel abgesenkt sein und an Szenenwechseln keine Konkurrenz erzeugen. Atmosphärische Geräusche – Schritte, Tastatur, Wind – verbinden generierte Szenen hörbar.

Untertitel und Textebenen

Untertitel werden oft ignoriert und oft stumm geschaut. Formatiere sie groß, kontrastreich und maximal zweizeilig, mit ruhiger Positionierung innerhalb des sicheren Bereichs. Wichtige Begriffe lassen sich als kurze Textebene betonen, aber nicht mehr als zwei solcher Einblendungen pro zehn Sekunden.

Format, Beschnitt und Export

Exportiere in der höchsten sinnvollen Qualität und erstelle anschließend die benötigten Seitenverhältnisse aus einer Master-Datei. Vermeide mehrfaches Neukodieren, das Bild und Ton sichtbar verschlechtert. Prüfe vor der Auslieferung jeden Export auf einem echten Telefon – nicht nur im Vorschaumonitor.

Typische Fehler und wie du sie vermeidest

Der häufigste Fehler ist der Start ohne Konzept. Danach folgt die Überproduktion: zu viele Szenen, zu viele Effekte, zu viele Schriftarten. Weitere Klassiker: identische Prompts für unterschiedliche Szenen, Wechsel der Lichtstimmung zwischen zwei Einstellungen derselben Sequenz, Musik auf Dauerpräsenz und Untertitel, die erst nach dem Export geprüft werden.

Ein unterschätzter Fehler ist die fehlende Versionierung. Speichere Prompt, Referenzbilder und Einstellungen jeder Szene in einer einfachen Tabelle. Wenn du eine Woche später eine Variante brauchst, willst du nicht rekonstruieren müssen, wie der gute Lauf entstanden ist.

Und schließlich: nicht zu früh ausliefern. Zeig den Clip zwei Personen, die nicht am Projekt beteiligt sind, und beobachte, wo ihr Blick abschweift. Diese zwei Minuten Feedback sparen in der Regel eine komplette Überarbeitungsrunde.

Durchgehendes Beispielprojekt: 45-Sekunden-Produktteaser

Angenommen, ein kleines Software-Team will eine Funktion vorstellen. Das Konzept: eine wiederkehrende Frustration und ihre Auflösung. Sechs Szenen, vertikal, 45 Sekunden.

Szene eins, drei Sekunden: eine Hand tippt hektisch auf eine Tastatur, warmes Bildschirmlicht, 50 mm, leichte Handkamera. Szene zwei, sieben Sekunden: dieselbe Person lehnt sich zurück, Blick auf einen vollen Posteingang, entsättigte Farben. Szene drei, zehn Sekunden: Bildschirmaufnahme der neuen Oberfläche mit ruhiger Kamerafahrt, dazu Voiceover, das den Ablauf in zwei Sätzen erklärt. Szene vier, acht Sekunden: Nahaufnahme einer Maus, die einen Knopf klickt, 85 mm, sehr flaches Licht. Szene fünf, zehn Sekunden: die Person atmet hörbar aus und lächelt kurz, weiches Gegenlicht. Szene sechs, sieben Sekunden: Produktlogo auf ruhigem Hintergrund, Textebene mit der Kernaussage.

Für alle Figurenszenen dient ein einziges Referenzbild als Grundlage, Lichtvorgabe und Farbpalette bleiben konstant. Das Voiceover wird zuerst aufgenommen, der Schnitt folgt der Stimme, nicht umgekehrt. Musik liegt durchgehend leise darunter, ein einzelner atmosphärischer Ton markiert den Übergang von Problem zu Lösung. Nach dem Export entstehen zusätzlich eine quadratische und eine horizontale Fassung aus derselben Master-Datei.

FAQ

Wie viele Szenen braucht ein Kurzvideo?
Für 15 bis 30 Sekunden reichen drei bis fünf Szenen, für 45 bis 60 Sekunden fünf bis acht. Mehr Szenen bedeuten mehr Schnitte und damit mehr Gelegenheiten für Inkonsistenzen.

Wie lang sollten generierte Clips sein?
Kurz. Drei bis fünf Sekunden pro Lauf sind ein guter Ausgangspunkt, weil kurze Clips weniger Fehler zeigen und sich leichter neu erzeugen lassen. Mehrere kurze Läufe sind fast immer besser als ein langer.

Muss ich jede Szene neu generieren, wenn die Figur nicht passt?
Nicht unbedingt. Zuerst prüfen, ob sich die Szene durch einen Zwischenschnitt, eine andere Perspektive oder eine Bildbeschnitt-Lösung retten lässt. Erst wenn das nicht gelingt, neu generieren – möglichst mit angepasstem Referenzbild.

Wie wichtig ist Auflösung im Vergleich zur Bewegung?
Bewegung schlägt Auflösung. Eine leicht weiche Einstellung mit glaubwürdiger Bewegung wirkt professioneller als ein gestochen scharfes Bild mit ruckelnder oder unlogischer Bewegung.

Was mache ich bei Text im Bild?
Text im generierten Bild ist unzuverlässig. Setze Schriftzüge in der Postproduktion als eigene Ebene. Das ist schneller, sauberer und jederzeit korrigierbar.

Wann lohnt sich ein Sprecher statt einer synthetischen Stimme?
Bei Marken mit hohem Vertrauensanspruch, bei erklärenden Inhalten mit vielen Fachbegriffen und immer dann, wenn Emotion transportiert werden soll. Für kurze, sachliche Hinweise ist eine hochwertige synthetische Stimme dagegen völlig ausreichend.

Wie viele Varianten sollte ich pro Szene erzeugen?
Drei bis fünf Läufe sind ein guter Kompromiss zwischen Auswahl und Aufwand. Wer zwanzig Varianten erzeugt, verbringt mehr Zeit mit Sichten als mit Verbessern.

Fazit

Kurzvideos mit KI entstehen nicht durch einen einzigen Knopfdruck, sondern durch eine Kette klarer Entscheidungen: Konzept, Szenenliste, präziser Prompt, passende Modellwahl, konsistente Bildsprache und ein sorgfältiger Feinschliff bei Ton und Untertiteln. Wer diese Kette einmal vollständig durchlaufen hat, kann sie für jedes weitere Projekt wiederverwenden – und genau darin liegt der eigentliche Gewinn.

Starte mit einem einzigen 30-Sekunden-Projekt, dokumentiere jeden Schritt und baue daraus deine eigene Vorlage. Das nächste Video geht dann in einem Bruchteil der Zeit über die Bühne.

Alexander

Alexander