Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

KI-Videos aus ChatGPT-Prompts: LinkedIn-Workflow für Profis

Oct 6, 2026

Warum ein Sprachmodell allein noch kein Video produziert

ChatGPT, Claude, Gemini und verwandte Systeme sind hervorragend darin, Sprache zu strukturieren. Sie schreiben Skripte, verdichten Argumente zu Sätzen, liefern Hook-Varianten und verwandeln eine vage Idee in eine klare Aussage. Was sie nicht tun: Pixel erzeugen. Zwischen dem fertigen Skript und dem ersten brauchbaren Clip liegt eine eigene Disziplin – die Übersetzung von Sprache in visuelle Parameter. Genau an dieser Stelle scheitern die meisten Versuche, aus einem Chat heraus ein Video zu bauen: Man kopiert den Fließtext in ein Videotool und erhält Bewegung, aber keine Aussage.

Wer den Prozess beherrschen will, trennt zwei Aufgaben sauber. Die erste ist dramaturgisch: Was soll die Zielgruppe nach dem Clip wissen, fühlen oder tun? Die zweite ist visuell: Welche Einstellung, welches Licht, welche Kamerabewegung transportiert diesen Inhalt in wenigen Sekunden? Sprachmodelle sind für die erste Aufgabe gebaut. Für die zweite braucht es Bildgeneratoren, Videomodelle und eine Prompt-Sprache, die beide Welten verbindet.

Was Textmodelle wirklich gut können

Ein Sprachmodell ist ein Denkwerkzeug, kein Kamerateam. Sein größter Beitrag liegt in der Verdichtung. Aus einem halbseitigen Gedanken wird ein 30-Sekunden-Skript mit klarem Einstieg, einem Argument und einer Handlungsaufforderung. Ebenso wertvoll ist die Variantenbildung: Wer zehn Hook-Formulierungen braucht, bekommt sie in einem Durchgang und behält die drei stärksten. Auch die Umformulierung von Fachjargon in Alltagssprache gehört zu den Stärken – ein unterschätzter Hebel für Videos, die im Feed innerhalb von Sekunden verstanden werden müssen.

Wo die Grenze liegt

Textmodelle kennen keine physische Kontinuität. Sie wissen nicht, ob eine Person im nächsten Clip dasselbe Gesicht, dieselbe Jacke und dieselbe Lichtrichtung hat. Sie kennen keine Brennweiten, keine Achsensprünge, keine Farbtemperatur. Wer diese Parameter nicht selbst in den Prompt schreibt, überlässt sie dem Zufall – und Zufall ist der häufigste Grund, warum eine Serie aus fünf Clips aussieht, als hätte sie fünf verschiedene Teams gedreht.

Der dreistufige Workflow: vom Briefing zur Bildsprache

Ein belastbarer Ablauf hat drei Stufen. Wer sie einhält, produziert schneller und konsistenter, als wenn er direkt am Prompt herumprobiert.

Stufe 1: Das Briefing in vier Fragen

Beantworte vor dem ersten Prompt vier Fragen schriftlich. Erstens: Wer sieht das Video – Rolle, Vorkenntnis, Erwartung? Zweitens: Welche eine Aussage soll hängen bleiben? Drittens: Welche Handlung folgt daraus – Kommentar, Klick, Bewerbung, Termin? Viertens: Welche Tonalität passt – sachlich, pointiert, persönlich, erklärend? Diese vier Antworten werden zum Systemprompt für alle weiteren Schritte. Ohne sie entsteht ein Video, das hübsch aussieht und nichts bewirkt.

Stufe 2: Skript in Szenen zerlegen

Ein Skript, das aus Absätzen besteht, ist kein Drehbuch. Zerlege es in Szenen mit Funktion, Dauer und Bildidee. Eine brauchbare Aufteilung für einen 45-Sekunden-Clip:

Szene Funktion Dauer Bildidee
1 Hook 0–3 s Nahaufnahme Hände über Tastatur, Bewegung
2 Problem 3–12 s Halbtotale Person am Schreibtisch, frustriert
3 Wendepunkt 12–22 s Bildschirm, Diagramm, ruhige Fahrt
4 Beweis 22–35 s Detailaufnahme, Ergebnis sichtbar
5 Handlung 35–45 s Person blickt in Kamera, ruhiger Abschluss

Diese Tabelle ist der eigentliche Produktionsplan. Jede Zeile wird später zu einem eigenen Prompt. Wer keine Shot-Liste hat, dreht in Gedanken immer denselben Clip.

Stufe 3: Szenen in Prompt-Parameter übersetzen

Erst jetzt kommt das Sprachmodell ins Spiel – und zwar als Übersetzer. Der Auftrag lautet: Nimm Szene 3 und beschreibe sie in den sechs Bausteinen Subjekt, Handlung, Umgebung, Kamera, Licht und Stil, plus eine Negativliste. Das Ergebnis ist ein Text, den ein Videomodell versteht, und gleichzeitig dokumentiert er deine Entscheidungen. Wenn eine Szene nicht funktioniert, änderst du genau einen Baustein – nicht den ganzen Prompt.

Prompt-Architektur: Wie aus einem Satz eine Szene wird

Die meisten schwachen Ergebnisse entstehen nicht durch schlechte Modelle, sondern durch unterbestimmte Prompts. Sechs Bausteine decken fast alles ab, was ein Videomodell wissen muss.

Die sechs Bausteine

Subjekt: Wer oder was ist zu sehen, mit welchen Merkmalen (Alter, Kleidung, Material, Farbe)? Handlung: Was passiert konkret in diesen Sekunden? Ein Verb statt einer Stimmung. Umgebung: Ort, Tageszeit, Hintergrundelemente, Wetter. Kamera: Einstellungsgröße, Winkel, Bewegung, Brennweite, Schärfentiefe. Licht und Farbe: Lichtrichtung, Härte, Farbtemperatur, Kontrast. Stil: dokumentarisch, werblich, filmisch, animiert – plus Technik wie 35 mm, flaches Licht, kein Filter.

Dazu kommt eine Negativliste: keine lesbaren Logos, kein Text im Bild, keine überzeichneten Farben, keine hektischen Schnitte, keine verzerrten Hände. Negativlisten sind kein Luxus. Sie verhindern die häufigsten Fehler, bevor sie entstehen.

Beispiel: Vom Rohtext zum fertigen Prompt

Subjekt: Frau, Mitte 30, dunkelblaues Jackett, offene Haare
Handlung: sie legt eine Mappe auf den Tisch und öffnet sie ruhig
Umgebung: helles Büro mit Glasfassade, weiches Tageslicht, Pflanzen im Hintergrund
Kamera: Halbtotale, leichte Fahrt nach links, 35 mm, flache Schärfentiefe
Licht: Tageslicht von links, weiche Schatten, neutraler Weißabgleich
Stil: dokumentarisch, natürliche Hauttöne, kein Farbfilter
Negativ: kein lesbarer Text, keine Logos, keine schnellen Bewegungen, keine Verzerrungen

Dieser Prompt ist lang, aber er ist nicht beliebig. Jede Zeile entspricht einer Entscheidung, die du später gezielt ändern kannst.

Warum die Reihenfolge zählt

Videomodelle gewichten den Anfang eines Prompts stärker. Subjekt und Handlung gehören deshalb nach vorn. Stil- und Negativangaben ans Ende. Wer mit der Kamera beginnt und das Motiv erst im dritten Satz nennt, bekommt oft eine schöne Kamerafahrt ohne klares Motiv.

Shot-Listen und Timing für professionelle Netzwerke

Ein Business-Feed ist kein Kinosaal. Er ist stumm, klein und schnell. Diese drei Eigenschaften bestimmen jedes Timing.

Der Hook in den ersten Sekunden

Die ersten Sekunden entscheiden, ob weitergescrollt wird. Ein Hook ist kein Slogan, sondern eine sichtbare Spannung: eine Hand, die etwas öffnet; ein Diagramm, das ausschlägt; eine Person, die kurz innehält. Textliche Hooks funktionieren nur mit Untertiteln, denn der Ton ist meist aus. Formuliere den Hook als Satz von maximal neun Wörtern und prüfe, ob er auch ohne Kontext verständlich ist.

Untertitel und Safe Zones

Untertitel gehören in die untere Mitte, aber nicht in die letzte Zeile – dort überlagern Plattform-Elemente. Halte links und rechts etwa zehn Prozent frei. Zeilenlänge: maximal 38 Zeichen pro Zeile, zwei Zeilen gleichzeitig. Für die Lesbarkeit gilt: halbfette Schrift, leichte Kontur oder halbtransparenter Balken, konstante Position. Springende Untertitel zerstören den Lesefluss schneller als ein unscharfes Bild.

Länge und Kadenz

Ein erklärender Clip trägt 45 bis 75 Sekunden. Ein Meinungsclip 20 bis 40 Sekunden. Ein Fallbeispiel darf 90 Sekunden dauern, wenn jede Szene einen neuen Gedanken liefert. Der Schnittrhythmus sollte zur Aussage passen: ruhige Szenen bei Zahlen und Argumenten, kürzere Einstellungen beim Einstieg. Ein Clip, der durchgehend im gleichen Tempo läuft, wirkt flach, egal wie gut die Bilder sind.

Modellwahl: Welches Werkzeug für welchen Look

Es gibt nicht das beste Videomodell, sondern das passende für eine Aufgabe. Die Wahl hängt von drei Kriterien ab: Realismusgrad, Kontrolle über Details und Iterationsgeschwindigkeit.

Aufgabe Modelltyp Worauf achten
Erklärende Business-Szene fotorealistisch, ruhige Bewegung Lichtkontinuität, natürliche Hauttöne
Produkt- und Detailaufnahme hohe Detailtreue, kurze Dauer Materialwiedergabe, Reflexionen
Konzepttest und Varianten schnelle Modelle, kurze Clips Durchsatz, geringe Wartezeit
Animierter Erklärstil stilisierte Modelle konsistente Formensprache
Serie mit gleicher Person Referenzbild-Unterstützung Gesichtstreue über Szenen

Fotorealistische Szenen

Runway, Sora, Kling, Luma und Flux decken unterschiedliche Schwerpunkte ab. Für ruhige Business-Aufnahmen zählt vor allem, wie das Modell mit Licht und Bewegung umgeht. Modelle, die starke Kamerabewegungen lieben, produzieren schnell eine Dynamik, die zum sachlichen Inhalt nicht passt. Reduziere Bewegung im Prompt bewusst: langsame Fahrt, feste Kamera, minimaler Zoom.

Stilisierte und animierte Looks

Pika, PixVerse und Hailuo liefern oft überzeugende stilisierte Ergebnisse. Der Vorteil: Fehler fallen weniger auf, weil der Look bereits abstrahiert. Der Nachteil: Marken- und Produkttreue ist schwerer. Für erklärende Sequenzen mit Symbolen und Diagrammen ist ein stilisierter Look häufig die bessere Wahl, weil er Komplexität reduziert.

Schnelle Iteration und Konzepttests

Bevor du in aufwendige Einstellungen investierst, teste die Bildidee mit einem kurzen, günstigen Clip. Wenn die Komposition in vier Sekunden nicht funktioniert, funktioniert sie auch in zwölf Sekunden nicht. Diese Regel spart die meiste Zeit im gesamten Workflow.

Konsistenz über mehrere Clips hinweg

Konsistenz ist das schwierigste Problem der KI-Videoproduktion. Fünf Clips mit derselben Person, demselben Raum und derselben Lichtstimmung wirken nur dann wie eine Serie, wenn du sie aktiv steuerst.

Referenzbilder und Charakterbögen

Erzeuge zuerst ein Standbild der Hauptperson oder des Hauptprodukts und nutze es als Referenz in allen folgenden Szenen. Halte in einem kurzen Dokument fest, was unveränderlich ist: Kleidung, Frisur, Farbpalette, Lichtrichtung. Diese Notiz ist dein Charakterbogen. Ohne sie beschreibst du dieselbe Person in jedem Prompt neu und erhältst jedes Mal jemand anderen.

Reihenfolge, Wiederholungen, Varianten

Arbeite szenenweise und nicht promptweise. Generiere pro Szene drei bis fünf Varianten, wähle die beste und notiere die Einstellungen, die dazu geführt haben. Bei wiederholbaren Modellen hilft ein fester Ausgangswert, damit derselbe Prompt reproduzierbar bleibt. Wenn ein Modell keine festen Werte unterstützt, halte den Prompt stattdessen wortwörtlich identisch und ändere nur die Handlung.

Licht und Farbe nachträglich stabilisieren

Selbst bei sorgfältiger Arbeit weichen Farbtemperatur und Kontrast zwischen Clips ab. Ein einheitlicher Farblook im Schnittprogramm löst das Problem schneller als zehn neue Generierungen. Lege eine Farbkorrektur-Ebene über alle Clips: Weißabgleich, leichte Kontrastkurve, identische Sättigung. Diese fünf Minuten Arbeit machen aus fünf Einzelclips eine Serie.

Audio, Text und Schnitt

Video ohne Tonplanung wirkt unfertig, auch wenn niemand hinhört.

Voiceover

Schreibe den Sprechtext separat vom Bildskript. Gesprochene Sprache braucht kürzere Sätze als geschriebene. Eine brauchbare Faustregel: 130 bis 150 Wörter pro Minute. Wer den Text selbst einspricht, gewinnt Authentizität; wer eine synthetische Stimme nutzt, sollte Tonhöhe und Tempo bewusst anpassen, damit sie nicht nach Ansage klingt.

Musik und Sounddesign

Musik trägt Stimmung, nicht Information. Wähle ein ruhiges, tiefenarmes Stück für erklärende Inhalte und verzichte auf Vocals. Einzelne Akzente – ein leises Klicken beim Szenenwechsel, ein weiches Anschwellen beim Wendepunkt – erhöhen die wahrgenommene Qualität stärker als ein lauter Soundtrack.

Untertitel und Typografie

Nutze maximal zwei Schriftschnitte: eine für Untertitel, eine für Titel. Halte Hierarchien einfach – Titel groß und fett, Untertitel mittel und regelmäßig. Animierte Untertitel nur, wenn sie in derselben Position bleiben. Positionswechsel bei jedem Satz kosten Aufmerksamkeit, die dem Inhalt fehlt.

Schnittrhythmus

Beginne nicht am Anfang, sondern am Hook. Prüfe danach, ob die erste Sekunde auch ohne Ton funktioniert. Kürze jede Szene um zehn Prozent, wenn der Clip zu lang wirkt – das ist fast immer die richtige Diagnose. Und exportiere in einem Format, das die Plattform nicht nachkomprimiert: vertikal, hohe Bitrate, sauberes Tonsignal.

Typische Fehler und wie du sie behebst

Fehler 1: Zu viele Anweisungen in einem Prompt

Ein Prompt mit zwanzig Details ergibt selten ein klares Bild. Zerlege die Szene lieber in zwei Einstellungen mit je sechs Bausteinen. Weniger Konflikt im Prompt bedeutet mehr Kontrolle im Ergebnis.

Fehler 2: Widersprüchliche Stilangaben

Filmisch, dokumentarisch und minimalistisch gleichzeitig funktioniert nicht. Entscheide dich für eine Hauptrichtung und ergänze höchstens eine technische Angabe wie 35 mm oder flaches Licht.

Fehler 3: Text im Bild

Videomodelle erzeugen Schriftzeichen oft fehlerhaft. Schreibe Text grundsätzlich im Schnittprogramm über das Bild, nicht per Prompt. Das gilt auch für Zahlen und Diagrammbeschriftungen.

Fehler 4: Keine Shot-Liste

Ohne Szenenplan entstehen Einzelclips statt eines Videos. Baue die Tabelle aus Stufe 2, bevor du das erste Mal generierst.

Fehler 5: Kein Rohmaterial-Puffer

Plane von jeder Szene mindestens zwei brauchbare Varianten ein. Wenn der Schnitt stockt und keine Alternative existiert, wird die ganze Szene neu generiert – und dann passt sie nicht mehr zum Rest.

Fehler 6: Zu früh perfektionieren

Feinschliff an Szenen, die dramaturgisch nicht tragen, ist verschwendete Zeit. Entscheide zuerst über den Aufbau, dann über die Details.

Prompt-Vorlagen zum Kopieren

Drei Bausteine, die sich in vielen Projekten bewährt haben.

Vorlage A – Erklärende Business-Szene
Subjekt: [Rolle], [Kleidung], [Alter]
Handlung: [ein klares Verb in dieser Sekunde]
Umgebung: [Ort], [Tageszeit], [Hintergrund]
Kamera: [Einstellungsgröße], [Bewegung], [Brennweite], flache Schärfentiefe
Licht: [Richtung], [Härte], neutraler Weißabgleich
Stil: dokumentarisch, natürliche Farben, kein Filter
Negativ: kein Text, keine Logos, keine schnellen Bewegungen
Vorlage B – Produktdetail
Subjekt: [Produkt] auf [Untergrund]
Handlung: langsame Drehung, gleichmäßiges Licht bleibt konstant
Umgebung: [Studio oder Umgebung], ruhiger Hintergrund
Kamera: Makro, feste Position, minimale Fahrt nach vorn
Licht: Softbox von oben links, sanfte Reflexe, hoher Kontrast in den Kanten
Stil: werblich, klar, sachlich
Negativ: keine Hände, keine Unschärfe auf dem Produkt, kein Text
Vorlage C – Meinungsclip
Subjekt: [Person], Oberkörper, direkt in die Kamera
Handlung: spricht, nickt knapp, natürliche Mimik
Umgebung: [Büro, Homeoffice, Außenbereich], weich unscharfer Hintergrund
Kamera: feste Halbtotale auf Augenhöhe, kein Zoom
Licht: Fensterlicht von vorn links, weiche Schatten
Stil: persönlich, glaubwürdig, leicht körnig
Negativ: kein Text, keine starke Bewegung, keine Farbstiche

Ergänze zu jeder Vorlage vier bis acht Untertitel-Zeilen und einen Handlungssatz am Ende. Damit ist der Clip inhaltlich vollständig, bevor er gerendert wird.

FAQ

Brauche ich mehrere Videomodelle?

Für den Start reicht eines, das ruhige Szenen gut beherrscht. Ein zweites Modell lohnt sich, sobald du einen bestimmten Look brauchst – etwa animierte Erklärsequenzen oder Produktdetails. Wichtiger als die Menge der Werkzeuge ist ein dokumentierter Prompt-Stil.

Wie lang sollte ein Business-Clip sein?

Zwischen 20 und 75 Sekunden, abhängig von der Aussage. Ein einzelner Gedanke trägt 30 Sekunden. Zwei Gedanken brauchen 60. Alles darüber verlangt eine klare Gliederung, sonst sinkt die Abschlussrate.

Kann ich dieselbe Person über mehrere Clips zeigen?

Ja, mit Referenzbildern und einem festen Charakterbogen. Ohne diese beiden Hilfen driftet das Gesicht bei jeder Generierung. Wenn ein Modell keine Referenzen unterstützt, reduziere die Anzahl unterschiedlicher Ansichten und nutze mehr Detailaufnahmen.

Was mache ich, wenn Szenen nicht zusammenpassen?

Prüfe zuerst Lichtrichtung und Farbtemperatur, dann die Einstellungsgrößen, dann den Schnittrhythmus. In neun von zehn Fällen liegt das Problem im Farblook, nicht im Bildinhalt.

Wie viele Varianten pro Szene sind sinnvoll?

Drei bis fünf. Mehr bringen selten neue Informationen, kosten aber Zeit. Wenn alle fünf Varianten nicht funktionieren, stimmt die Bildidee nicht – nicht die Generierung.

Wie integriere ich Text in den Clip?

Nur im Schnitt. Untertitel, Titel und Zahlen setzt du manuell, damit sie scharf und korrekt sind. Modelle erzeugen Schriftzeichen unzuverlässig, besonders bei kurzen Wörtern und Zahlen.

Wie viel Zeit sollte ich einplanen?

Für einen 45-Sekunden-Clip mit fünf Szenen sind zwei bis vier Stunden realistisch, wenn Skript und Shot-Liste stehen. Ohne Planung dauert derselbe Clip einen ganzen Tag, weil jede Entscheidung während der Produktion neu getroffen wird.

Eignet sich das auch für andere Plattformen?

Ja. Derselbe Ablauf funktioniert für jedes Format mit kleinem Bildschirm und stummem Autoplay. Passe lediglich Seitenverhältnis und Untertitelposition an. Der Kern bleibt: klare Aussage, Szenenplan, konsistente Bildsprache.

Alexander

Alexander