Warum Text-zu-Video eine eigene Produktionslogik braucht
Der Ausgangspunkt klingt verlockend einfach: eine Idee in ein Textfeld tippen, ein Modell auswählen, generieren lassen und nach wenigen Minuten einen vertikalen Clip erhalten. In der Praxis zeigt sich schnell, dass dieser erste Clip selten brauchbar ist. Er wirkt zufällig, die Bewegung passt nicht zum Inhalt, die Figur verändert zwischen zwei Einstellungen ihr Gesicht, und der Ton fehlt ohnehin. Das Problem liegt nicht am Modell, sondern an der Erwartung, dass ein einziger Generierungsschritt alle Entscheidungen übernimmt, die früher auf Drehtag, Regie und Schnittplatz verteilt waren.
Text-zu-Video funktioniert zuverlässig erst dann, wenn man es als Produktionskette begreift. Jede Etappe hat eine klar umrissene Aufgabe und ein eigenes Qualitätskriterium: Das Skript entscheidet über Dramaturgie, das Startbild über den Look, das Videomodell über die Bewegung, die Tonspur über die Verständlichkeit und der Schnitt über den Rhythmus. Wer diese Ebenen trennt, kann jede einzelne verbessern, austauschen und prüfen. Wer sie vermischt, erhält Ergebnisse, die sich weder gezielt reparieren noch verlässlich wiederholen lassen.
Der zweite Grund für eine eigene Logik ist die Plattform. Kurzvideos werden stumm, in hoher Geschwindigkeit und auf kleinen Displays konsumiert. Das verändert jede Gestaltungsentscheidung: Gesichter müssen in der Vorschau erkennbar bleiben, Aussagen müssen in Untertiteln funktionieren, und die erste Sekunde muss ohne Vorgeschichte verständlich sein. Ein Clip, der auf einem großen Monitor beeindruckend wirkt, kann im Feed vollständig untergehen.
Hinzu kommt der wirtschaftliche Aspekt. Generierung kostet Rechenzeit, und Rechenzeit ist der eigentliche Engpass, nicht die Kreativität. Wer den Ablauf standardisiert, produziert nicht nur schneller, sondern auch gleichmäßiger. Gleichmäßigkeit ist das, was aus einzelnen Clips eine Serie macht, und Serien sind das Format, das Zuschauer bindet.
Dieser Leitfaden beschreibt einen werkzeugunabhängigen Ablauf: von den ersten Skriptzeilen über Prompt-Aufbau und Modellwahl bis zur Qualitätskontrolle vor dem Upload. Die genannten Produkte sind Beispiele, keine Vorschriften. Jede Etappe lässt sich durch ein anderes Werkzeug ersetzen, solange die Aufgabe dieselbe bleibt.
Die vier Bausteine einer belastbaren Video-Pipeline
Ein einzelnes Werkzeug erzeugt selten ein vollständiges Reel. In der Praxis arbeiten mindestens vier Bausteine zusammen, und jeder hat eine abgegrenzte Aufgabe. Wer diese Aufgaben trennt, verliert weniger Zeit mit Nachbesserungen und kann einzelne Bausteine austauschen, sobald ein passenderes Produkt verfügbar ist.
Skript und Dramaturgie
Textmodelle wie ChatGPT, Claude oder Gemini übernehmen die Dramaturgie. Sie formulieren den Hook für die ersten anderthalb Sekunden, verdichten den Nutzen in drei bis fünf Sätzen und liefern eine Liste visueller Stichwörter. Brauchbare Ergebnisse entstehen, wenn man dem Modell nicht sagt „schreibe ein Video“, sondern Rolle, Zielgruppe, Länge, Tonalität und gewünschte Emotion vorgibt. Ein Skript für ein dreißig Sekunden langes Reel umfasst siebzig bis neunzig gesprochene Wörter, aufgeteilt in sechs bis acht kurze Beats. Jeder Beat enthält genau eine Aussage.
Ein Beispiel für eine brauchbare Vorgabe: „Schreibe für Berufstätige zwischen dreißig und vierzig ein Skript mit sechs Beats à zwölf Wörtern, das drei konkrete Zeitfresser benennt und mit einer Handlungsaufforderung endet. Tonalität sachlich, kein Marketing-Sprech, keine Superlative.“ Nach der Generierung folgt der wichtigste Schritt überhaupt: streichen. Aus achtzig Wörtern werden sechzig, aus sechzig werden fünfzig. Kürzen ist kein Feinschliff, sondern der halbe Schnitt.
Startbild und visueller Anker
Bildgeneratoren wie Midjourney, Flux oder Stable Diffusion liefern den Startframe, aus dem sich Bewegung ableiten lässt. Hier fällt die zentrale ästhetische Entscheidung: Seitenverhältnis neun zu sechzehn, eine klar erkennbare Lichtquelle, begrenzte Farbpalette und ein Motiv, das auch im kleinen Vorschaubild noch lesbar bleibt. Überladene Szenen rächen sich doppelt, weil das Videomodell versucht, jedes Detail mitzubewegen, und das Ergebnis flimmert. Ein bis zwei Hauptelemente pro Einstellung genügen vollständig. Wer zwei bis drei Bildvarianten pro Einstellung erzeugt und die stärkste auswählt, spart später mehrere Animationsversuche.
Bewegung und Clipgenerierung
Videomodelle wie Runway, Kling, Luma oder Pika erzeugen aus Text oder Startbild einen Clip von typischerweise fünf bis zehn Sekunden. Sie bestimmen Kamerafahrt, Bewegungstempo und physikalische Plausibilität. Entscheidend ist die Arbeitsteilung: Das Bildmodell definiert den Look, das Videomodell nur noch die Bewegung. Wer beides gleichzeitig in einen Prompt packt, bekommt meist weder das eine noch das andere sauber. Fünf Sekunden sind der zuverlässigste Kompromiss zwischen Konsistenz und Bewegungsfreiheit; längere Sequenzen setzt man aus mehreren kurzen Clips zusammen.
Ton, Untertitel und Feinschnitt
Sprachsynthese mit ElevenLabs oder vergleichbaren Diensten, automatische Transkription mit Whisper, Feinschnitt in CapCut oder DaVinci Resolve. In dieser Etappe entsteht der Rhythmus: Schnitte auf den Beat, Text-Overlays für stille Zuschauer, ein Sound-Design, das die Bewegung unterstützt. Ein großer Teil des Publikums sieht Kurzvideos ohne Ton, deshalb sind Untertitel kein Extra, sondern Grundausstattung. Das Musikbett bleibt deutlich unter der Stimme, als Faustregel bei minus achtzehn bis minus zwanzig Dezibel relativ zur Sprachspur.
| Etappe | Aufgabe | Beispielwerkzeuge | Häufiger Fehler |
|---|---|---|---|
| Skript | Dramaturgie, Hook, Beats | ChatGPT, Claude, Gemini | Zu viel Inhalt für die Länge |
| Startbild | Look, Komposition | Midjourney, Flux, Stable Diffusion | Überladene Szenen |
| Video | Bewegung, Kamera | Runway, Kling, Luma, Pika | Zu viele Anweisungen pro Clip |
| Ton und Schnitt | Rhythmus, Untertitel | ElevenLabs, Whisper, CapCut | Fehlende Untertitel |
Prompts als Regieanweisungen schreiben
Ein Prompt ist kein Suchbegriff, sondern eine Regieanweisung. Die brauchbarsten Prompts folgen einer stabilen Reihenfolge: Motiv, Handlung, Umgebung, Licht, Optik, Bewegung, Stimmung. Diese Reihenfolge lässt sich in einer Vorlage speichern und für jede Szene neu befüllen. Das klingt bürokratisch, spart aber genau die Zeit, die sonst in Interpretationsversuchen verloren geht.
Die Reihenfolge der Bausteine
Ein bewährtes Muster lautet: „[Motiv] [Handlung] in [Umgebung], [Lichtstimmung], [Objektiv und Perspektive], [Kamerabewegung], [Tempo], [Stimmung].“ Ein Beispiel: „Junge Läuferin in Neonjacke läuft über nasse Asphaltstraße, blaue Stunde, fünfunddreißig Millimeter, langsame Kamerafahrt von links, ruhiges Tempo, konzentrierte Stimmung.“ Jeder Baustein ist eine bewusste Entscheidung, kein Füllwort. Fällt ein Baustein weg, übernimmt das Modell die Entscheidung — und trifft sie meist anders, als man es wollte.
Bewegung sparsam dosieren
Die meisten misslungenen Clips entstehen durch überladene Bewegung. Wenn gleichzeitig die Kamera fährt, die Figur springt und der Hintergrund wogt, verliert das Modell die Kontinuität. Die Regel lautet: pro Clip genau eine dominante Bewegung plus eine subtile Nebenbewegung. Bei Dialogszenen ist weniger Kamera mehr — ein langsames Heranfahren wirkt stärker als eine schnelle Kreisbewegung. Bei Produktaufnahmen funktioniert ein einzelner langsamer Schwenk über das Objekt besser als jede Kombination aus Zoom und Rotation.
Negative Anweisungen richtig einsetzen
Verbote wie „keine verzerrten Hände, keine zusätzlichen Personen im Hintergrund“ helfen, lösen aber selten alles. Sie wirken am besten, wenn sie an eine konkrete Beobachtung anknüpfen, nicht an eine allgemeine Sorge. Wer nach dem ersten Testlauf erkennt, dass im Hintergrund Passanten entstehen, ergänzt eine entsprechende Anweisung. Pauschale Verbotslisten machen Prompts lang und unübersichtlich, ohne die Trefferquote spürbar zu verbessern.
Vorlagen statt Einzelprompts
Wichtiger als jedes Verbot ist Konsistenz. Gleiche Beschreibung für Figur, Kleidung, Licht und Objektiv über alle Szenen hinweg. Wer diese Beschreibung in eine Textdatei kopiert und pro Szene nur Handlung und Kamerawinkel ändert, erhält eine visuell zusammenhängende Serie statt lose verbundener Einzelclips. Diese Textdatei ist das eigentliche Kernstück der Produktion: Sie enthält den Stil, die Figurenkarte, die Lichtvorgaben und die Standardauflösung. Neue Szenen entstehen dann in wenigen Sekunden, weil nur noch die variablen Blöcke ausgetauscht werden.
Der Produktionsworkflow in acht Etappen
Ein reproduzierbarer Ablauf spart mehr Zeit als jedes einzelne Werkzeug. Die folgenden Etappen lassen sich an einem halben Arbeitstag durchlaufen.
Erstens: Briefing verdichten. Zielgruppe, Plattform, Kernbotschaft und gewünschte Handlung in drei Zeilen notieren. Ohne diese drei Zeilen raten alle späteren Modelle, und man erkennt am Ergebnis nicht mehr, ob der Fehler im Skript oder in der Umsetzung lag.
Zweitens: Skript und Beat-Liste. Ein Textmodell erzeugt sechs bis acht Beats, jeder mit maximal fünfzehn Wörtern Sprachtext. Danach manuell kürzen. Die Beat-Liste ist das Gerüst für alles Weitere und ersetzt das klassische Storyboard.
Drittens: Shotlist bauen. Jedem Beat eine Einstellung zuordnen: Totale, Halbtotale, Detail, Insert. Vier bis sechs Einstellungen reichen für ein Reel von dreißig Sekunden. Wer mehr Schnitte plant, muss mit stärkeren Bildsprüngen rechnen, weil generiertes Material zwischen Einstellungen leicht variiert.
Viertens: Startframes generieren. Pro Einstellung zwei bis drei Bildvarianten, dann die beste auswählen. Bei Figuren mit Wiedererkennungswert dieselbe Referenzbeschreibung verwenden, am besten mit gleichem Ausgangswert für die Zufallsverteilung.
Fünftens: Clips animieren. Fünf-Sekunden-Clips erzeugen und zwei bis drei Versuche pro Einstellung einplanen. Nur die beste Version weiterverwenden. Zwischenergebnisse konsequent löschen, sonst wächst der Materialberg schneller als der Schnittplatz ihn bewältigt.
Sechstens: Sprachspur anlegen. Stimme generieren oder einsprechen, Sätze kürzen, Pausen setzen. Die Sprachspur ist der Taktgeber für den Schnitt, deshalb kommt sie vor der Montage und nicht danach.
Siebentens: Montage. Clips auf die Beat-Liste schneiden, Untertitel einblenden, erstes und letztes Bild auf Hook und Handlungsaufforderung abstimmen. Übergänge sparsam einsetzen; harte Schnitte wirken bei generiertem Material meist sauberer als weiche Blenden.
Achtens: Export und Prüfung. In 1080 mal 1920 exportieren, Bitrate prüfen, die ersten drei Sekunden im Vollbild und auf einem kleinen Display testen. Erst danach veröffentlichen.
Die Reihenfolge ist bewusst starr. Wer bei Etappe fünf einsteigt, weil gerade ein neues Modell veröffentlicht wurde, produziert teure Zufallsclips ohne dramaturgischen Rahmen und muss später die Hälfte verwerfen.
Charakterkonsistenz und Serienproduktion
Sobald mehr als ein Reel entsteht, wird Konsistenz zum wichtigsten Qualitätsmerkmal. Zuschauer erkennen Figuren, Farbwelt und Bildsprache wieder, und genau das ist der Grund, warum Serien funktionieren. Dafür braucht es drei Dinge: eine textliche Figurenkarte, ein Referenzbild und eine feste Kette aus Startframe und Animation.
Die Figurenkarte beschreibt Alter, Gesichtszüge, Frisur, Kleidung, Farben und typische Gesten in maximal sechzig Wörtern. Diese Beschreibung wird wortgleich in jeden Prompt kopiert. Für das Referenzbild lohnt es sich, dasselbe Bildmodell und denselben Ausgangswert zu verwenden, damit die Gesichtsproportionen stabil bleiben. Bei Animationsmodellen mit Bild-zu-Video-Modus ist der Startframe die stärkste Konsistenzbremse: Je ähnlicher die Startframes, desto ähnlicher die Figuren.
Für wiederkehrende Umgebungen gilt dasselbe Muster: eine feste Lichtstimmung, eine feste Brennweite, eine begrenzte Farbpalette. Szenen wirken dann wie Teile eines Films statt wie Sammlungen einzelner Experimente. Zusätzlich hilft ein kleines Serien-Design-Dokument mit Logo-Platzierung, Untertitelstil, Schriftart und Übergangsart. Dieselbe Vorlage für jedes Video spart pro Reel mehrere Minuten Montagearbeit und verhindert, dass die Serie nach wenigen Folgen auseinanderläuft.
Ein praktischer Test nach jeder dritten Folge: Die Startframes der Serie nebeneinanderlegen. Passen Lichtrichtung, Farbtemperatur und Bildausschnitt zusammen, ist die Serie stabil. Fallen einzelne Frames sichtbar heraus, liegt der Fehler fast immer in einer nachträglich geänderten Prompt-Zeile.
Format, Länge und Plattformlogik
KI-Video ist kein Selbstzweck. Die Plattform bestimmt Länge, Tempo und Tonspur. Vertikale Kurzvideos folgen einer eigenen Mechanik: Die erste Sekunde entscheidet über den Verbleib, das Tempo über die Vollendung, die letzte Sekunde über die Interaktion.
Für sehr kurze Formate von fünfzehn Sekunden gilt: eine einzige Aussage, ein einziger visueller Höhepunkt, kein Raum für Nebenhandlung. Bei dreißig bis fünfundvierzig Sekunden passen drei Beats mit je einer kleinen Wendung. Ab sechzig Sekunden braucht es eine erkennbare Dramaturgie mit Spannungsbogen, sonst bricht die Aufmerksamkeit in der Mitte ab. Diese Grenzen sind keine Geschmacksfrage, sondern eine Folge davon, wie schnell Nutzer in einem Feed weiterwischen.
Zusätzlich lohnt sich eine Formatentscheidung vor der Produktion. Erklärformat mit Sprecherstimme, atmosphärisches Format mit Musik oder Demonstrationsformat mit Bildschirmaufzeichnung. Jedes Format verlangt andere Werkzeuge und andere Einstellungen. Erklärvideos brauchen stabile Figuren und klare Sprache, Atmosphärenclips profitieren von langsamen Kamerafahrten und starkem Sound-Design, Demonstrationsvideos benötigen zusätzlich Bildschirmaufzeichnungen, die kein Videomodell sinnvoll erzeugen kann.
Wer dieselbe Idee für mehrere Plattformen ausspielt, produziert nicht mehrfach neu, sondern exportiert Varianten: eine Kurzfassung für den schnellen Feed, eine längere Fassung mit zusätzlichem Kontext für die eigene Seite, eine stumme Fassung mit besonders großen Untertiteln. Alle drei entstehen aus derselben Montage.
Qualitätskontrolle: typische Fehler und Gegenmittel
Die meisten Probleme wiederholen sich. Wer sie kennt, erkennt sie schon im ersten Clip einer Serie und spart sich ganze Durchläufe.
- Verzerrte Details. Gesichter, Hände und Hintergrundschrift geraten ins Rutschen. Gegenmittel: kürzere Clips, weniger Bewegung, störende Details aus dem Hintergrund entfernen, problematische Bildbereiche in der Montage beschneiden.
- Flimmern zwischen den Szenen. Unterschiedliche Lichtstimmung und Farbtemperatur. Gegenmittel: einheitliche Lichtbeschreibung in jedem Prompt, Farbanpassung in der Montage, eine feste Farbvorgabe im Serien-Dokument.
- Auseinanderlaufende Figuren. Gegenmittel: eine Figurenkarte, gleicher Startframe-Stil, gleicher Ausgangswert, gleiches Bildmodell über die gesamte Serie.
- Unruhiges Tempo. Gegenmittel: Schnitt auf den Beat, nicht auf die Cliplänge. Clips dürfen mitten in der Bewegung enden, das wirkt dynamischer als ein auslaufender Clip.
- Unverständlicher Ton. Gegenmittel: kürzere Sätze, Untertitel, niedriges Musikbett, keine Effekte auf der Sprachspur.
- Kein klarer Abschluss. Gegenmittel: die letzte Einstellung vorproduzieren und explizit auf die Handlungsaufforderung abstimmen, statt sie aus Restmaterial zusammenzusetzen.
- Zu viele Schrift-Ebenen. Gegenmittel: höchstens zwei Textelemente gleichzeitig im Bild, alles andere in Untertitel verlagern.
Eine einfache Prüfroutine hilft: Jedes Reel wird dreimal angesehen, einmal im Vollbild mit Ton, einmal stumm in der Vorschau, einmal in doppelter Geschwindigkeit. Fehler, die diese drei Durchgänge überleben, fallen dem Publikum in der Regel nicht auf. Wer zusätzlich eine fremde Person eine halbe Minute zuschauen lässt und danach fragt, worum es ging, bekommt die ehrlichste Rückmeldung überhaupt.
Rechenzeit, Durchsatz und Skalierung im Zaum halten
Generierung verbraucht Rechenzeit, und Rechenzeit ist der eigentliche Engpass. Deshalb gilt: erst billig testen, dann teuer produzieren. Für jede Einstellung zuerst ein einzelnes Standbild erzeugen, dann eine niedrig aufgelöste Animation prüfen und erst danach die endgültige Auflösung berechnen lassen. Dieser dreistufige Filter reduziert Ausschuss erheblich, weil die meisten Fehler schon im Standbild sichtbar sind.
Sinnvoll ist außerdem Batch-Denken. Wer fünf Reels pro Woche plant, produziert nicht fünf einzelne Projekte, sondern ein Set aus gemeinsam genutzten Startframes, einer Figurenkarte und einer Montagevorlage. Der Großteil der Arbeit ist dann Variation, nicht Neuerstellung. Für die Zeitplanung gilt eine grobe Faustregel: Skript und Shotlist etwa ein Drittel der Zeit, Generierung ein Drittel, Montage und Korrektur das letzte Drittel. Wer die Montage unterschätzt, plant zu knapp und liefert am Ende halbfertige Clips.
Ein weiterer Hebel ist Wiederholbarkeit. Prompt-Vorlagen, Untertitel-Presets und exportierte Montagevorlagen machen aus einem Handwerksprozess eine Pipeline. Erst dann lässt sich die Ausgabemenge steigern, ohne dass die Qualität sinkt. Umgekehrt gilt: Solange jede Folge improvisiert wird, bringt jedes zusätzliche Video nur zusätzlichen Stress.
Sinnvoll ist auch eine klare Aufräumroutine. Nach jedem Projekt werden Testclips gelöscht und nur Startframes, Projektdatei und Export aufbewahrt. Dieses Archiv ist nach einigen Wochen wertvoller als jedes einzelne fertige Video, weil es als Ausgangspunkt für neue Formate dient.
Wann sich der Aufwand lohnt und wann nicht
Nicht jede Aufgabe braucht KI-Video. Für Produkterklärungen mit exakten Details, für Interviews und für alles, was echte Personen an echten Orten zeigen muss, bleibt klassisches Filmmaterial überlegen. KI-Video glänzt bei Konzepten, Atmosphäre, Visualisierungen, historischen oder futuristischen Szenen und überall dort, wo ein Dreh organisatorisch unmöglich oder zu aufwendig wäre.
Ein nützlicher Test: Lässt sich die Kernaussage in einem einzigen Bild erzählen, das sich bewegt? Wenn ja, ist KI-Video eine gute Wahl. Wenn die Aussage von präziser Sprache, einem glaubwürdigen Gesicht oder exakter Produktdarstellung abhängt, sollte man auf Aufnahme oder eine hybride Lösung setzen — KI für Hintergründe, Übergänge und Visualisierungen, echte Aufnahme für die Kernszene.
Ein zweiter Test betrifft die Frequenz. Für ein einmaliges Projekt ist der Aufbau einer Vorlagenkette zu aufwendig. Ab etwa vier Videos pro Monat amortisiert sich die Vorarbeit dagegen schnell, weil Figurenkarte, Prompt-Vorlage und Montagepreset immer wieder greifen. Entscheidend ist also nicht die Frage, ob KI-Video grundsätzlich gut ist, sondern ob das eigene Produktionsvolumen zur Investition in Struktur passt.
FAQ: häufige Fragen zu KI-Reels
Wie viele Versuche braucht ein guter Clip? Für kurze Einstellungen sind zwei bis drei Versuche realistisch, bei komplexen Bewegungen auch fünf. Wer nach zehn Versuchen kein brauchbares Ergebnis hat, sollte die Einstellung vereinfachen statt weiter zu generieren. Meist liegt das Problem in einer überladenen Szene, nicht im Modell.
Reicht Text zu Video ohne Startbild? Für Atmosphäre, Abstraktion und Naturmotive ja. Für Figuren, Markenauftritte und alles mit Wiedererkennungswert ist der Weg über ein Startbild deutlich stabiler, weil der Look vor der Animation festgelegt wird.
Welche Clip-Länge ist am zuverlässigsten? Fünf Sekunden sind der beste Kompromiss aus Konsistenz und Bewegungsfreiheit. Längere Sequenzen setzt man aus mehreren kurzen Clips zusammen und verbindet sie über harte Schnitte.
Wie viele Einstellungen braucht ein Reel von dreißig Sekunden? Vier bis sechs. Mehr Schnitte wirken bei generiertem Material schnell hektisch, weil die Bildsprache zwischen den Einstellungen leicht variiert.
Wie wichtig sind Untertitel? Sehr wichtig. Ein großer Teil des Publikums sieht Kurzvideos ohne Ton. Untertitel erhöhen Verständnis und Verweildauer messbar und sind zugleich eine Absicherung gegen undeutlich generierte Sprache.
Muss man für jede Szene einen neuen Prompt schreiben? Nein. Eine feste Vorlage mit austauschbaren Blöcken für Handlung, Kamerawinkel und Tempo reicht für die meisten Szenen. Nur der Handlungsblock ändert sich.
Wie vermeidet man, dass alle Folgen gleich aussehen? Indem man Bewegung und Blickwinkel variiert, nicht die Farbwelt. Konstanz im Look, Varianz in der Kamera — das ist die Grundregel für Serien. Wer auch die Farben wechselt, verliert die Wiedererkennung, die eine Serie überhaupt trägt.
Woran erkennt man, dass eine Serie reif für die Skalierung ist? Wenn zwei aufeinanderfolgende Folgen ohne neue Vorlagenarbeit entstehen konnten. Dann sind Figurenkarte, Prompt-Vorlage und Montagepreset so weit, dass nur noch Inhalte ausgetauscht werden müssen.
Von Text zu fesselnden Reels führt kein einzelner Zauberprompt, sondern ein stabiler Ablauf: verdichtetes Skript, klare Shotlist, bewusst gewählte Startframes, sparsam dosierte Bewegung, saubere Ton- und Untertitelarbeit und eine Qualitätskontrolle, die Fehler früh abfängt. Die Werkzeuge wechseln, die Logik bleibt. Wer Skript, Bild, Video und Schnitt als vier getrennte Aufgaben begreift und jede einzelne beherrscht, kann neue Modelle gelassen ausprobieren — und produziert trotzdem Reels, die nach Absicht aussehen und nicht nach Zufall.




