Figurenkonsistenz: der unterschätzte Kern jeder KI-Videoserie
Ein einzelner Clip beeindruckt schnell. Sobald dieselbe Figur aber in zehn oder zwanzig Einstellungen auftreten soll, wird aus einer Spielerei eine Produktionsaufgabe. Generative Videomodelle sind stark darin, plausibles Material zu erfinden, und schwach darin, dieselbe Entscheidung zweimal identisch zu treffen. Gesichtsproportionen verschieben sich um Millimeter, Frisuren wechseln die Länge, der Wollpullover wird von Einstellung zu Einstellung heller, und der Look pendelt zwischen Fotorealismus und Illustration.
Für Zuschauer ist das kein technisches Detail, sondern ein Bruch in der Erzählung. Wer einer Serie folgen soll, muss die Hauptfigur sofort wiedererkennen – ohne Erklärung, in jeder Einstellung, auch in der Totalen. Wiedererkennung läuft dabei über mehr als ein Gesicht: über Silhouette, Frisur, Körperproportionen, Kleidungsfarbe, Requisiten und die Richtung, aus der das Licht kommt.
Deshalb ist Konsistenz weniger eine Frage des richtigen Modells als eine Frage des richtigen Prozesses. Modelle liefern Rohmaterial; Stabilität entsteht aus festen Referenzen, disziplinierten Prompts, geplanter Einstellungsfolge und konsequenter Nachkontrolle. Dieser Leitfaden beschreibt einen solchen Prozess Schritt für Schritt – mit konkreten Beispielen, Entscheidungskriterien und den Fehlern, die in der Praxis am häufigsten Zeit kosten.
Am Ende sollte dein Workflow so aufgebaut sein, dass ein Ergebnis nicht von Glück abhängt, sondern reproduzierbar ist. Reproduzierbarkeit ist der eigentliche Qualitätssprung: Ein zufällig perfekter Clip hilft niemandem, wenn du ihn nicht wiederholen kannst.
Die vier häufigsten Ursachen für sichtbare Brüche
Bevor du Werkzeuge wechselst, lohnt sich eine ehrliche Fehleranalyse. In der Praxis lassen sich fast alle Konsistenzbrüche auf vier Ursachen zurückführen – und alle vier liegen in der Verantwortung der Produktion, nicht des Modells.
Uneindeutige Beschreibungen
Eine Frau mit dunklen Haaren beschreibt Millionen von Menschen. Jedes Modell füllt die Lücken bei jedem neuen Zufallswert anders. Wer Haarfarbe, Augenfarbe, Frisurform, Gesichtsform, Körperbau und Kleidungsdetails nicht festnagelt, bekommt bei jeder Einstellung eine andere Person. Das gilt auch für scheinbar nebensächliche Angaben: Ein Umhang kann grün oder grünlich-grau sein, und beide Varianten wirken nebeneinander wie ein Kostümwechsel.
Die Gegenmaßnahme ist unspektakulär: eine Liste mit wörtlichen Formulierungen, die du nie abwandelst. Sobald du zwei Synonyme für dieselbe Sache verwendest, interpretiert das Modell zwei verschiedene Merkmale.
Fehlende visuelle Anker
Text ist ein schwaches Signal für Identität. Referenzbilder, Charakter-Embeddings oder trainierte Adapter sind deutlich stärker, weil sie Identitätsmerkmale als Vektor speichern statt als Worte. Ein Modell, das eine Figur bereits kennt, muss sie nicht aus der Beschreibung rekonstruieren – es kopiert Merkmale statt sie zu erfinden. Der Unterschied ist besonders bei Details sichtbar, die Sprache kaum beschreiben kann: die genaue Form einer Nase, der Abstand der Augen, die Rundung eines Kinns.
Widersprüchliche Szenenangaben
Wenn in einer Einstellung weiches Gegenlicht und in der nächsten harte Kantenlichter stehen, ändert sich nicht nur die Beleuchtung, sondern auch die wahrgenommene Gesichtsform. Licht formt Silhouetten, und Silhouetten sind ein wesentlicher Teil der Wiedererkennung. Dasselbe gilt für Brennweiten: Weitwinkel verzerrt Gesichter, Tele staucht sie. Wer beides mischt, produziert Figuren, die nur entfernt verwandt aussehen.
Unkontrollierte Bewegung
Große Kamerafahrten, schnelle Drehungen, Sprünge und Nahaufnahmen mit starker Mimik sind die härtesten Tests für jedes System. Je komplexer die Bewegung, desto stärker leidet die Identitätstreue. Wer das weiß, plant ruhige Einstellungen dort, wo Gesichter im Mittelpunkt stehen, und verlegt Dynamik in Einstellungen mit Händen, Landschaften oder Objekten.
Die technischen Bausteine für stabile Identität
Referenzbilder und Identitäts-Embeddings
Der einfachste Einstieg ist ein sauberes Referenzset: sechs bis zehn Bilder derselben Figur aus unterschiedlichen Winkeln, mit neutraler Beleuchtung und ohne Verdeckungen. Diese Bilder werden entweder direkt als Bedingung an das Modell übergeben oder zu einem Embedding verdichtet, das die Identität als Zahlenvektor beschreibt. Embeddings haben den Vorteil, dass sie unabhängig von einzelnen Bildartefakten funktionieren – das Ergebnis ist weniger an einen konkreten Hintergrund gebunden. Wichtig ist die Widerspruchsfreiheit: Ein Set aus zehn stilistisch unterschiedlichen Bildern mittelt sich zu einem weichen, generischen Gesicht.
Keyframes und zeitliche Kohärenz
Keyframe-Steuerung bedeutet, dass du Anfangs- und teils auch Endbilder einer Einstellung selbst festlegst. Das Modell interpoliert dazwischen. Für konsistente Figuren ist das der stärkste Hebel überhaupt, weil du die Identität an beiden Enden eines Clips kontrollierst und das System nur noch die Bewegung dazwischen erfinden muss. Zwei Faustregeln haben sich bewährt: Je kürzer der Clip, desto stabiler das Ergebnis. Und je näher die Keyframes beieinanderliegen, desto weniger Raum hat das Modell für eigene Interpretation.
Leichtes Fine-Tuning mit Adaptern
Wer wiederkehrende Figuren über viele Projekte hinweg nutzt, kommt um kleines Fine-Tuning kaum herum. Ein kompakter Adapter, trainiert auf zwanzig bis vierzig konsistenten Bildern, lernt Gesichtsmerkmale sehr zuverlässig und lässt sich mit unterschiedlichen Prompts kombinieren. Der Aufwand liegt einmalig bei ein bis zwei Stunden Vorbereitung – danach sinkt die Ausschussquote spürbar. Für ein einmaliges Kurzprojekt lohnt sich das meist nicht; ab etwa zehn Minuten Material mit derselben Hauptfigur amortisiert sich der Aufwand schnell.
Multi-Image-Fusion
Viele moderne Systeme verarbeiten mehrere Referenzbilder gleichzeitig: eines für das Gesicht, eines für die Kleidung, eines für den Stil. Diese Trennung ist praktisch, weil du das Outfit wechseln kannst, ohne die Person zu verlieren. Achte darauf, dass die Referenzen sich nicht widersprechen – ein Gesichtsbild mit warmem Licht und ein Stilbild mit kühlem Licht erzeugen einen unangenehmen Mittelweg, der weder nach der einen noch nach der anderen Vorlage aussieht.
Der Produktionsworkflow in sechs Schritten
Schritt 1: Charakterbibel anlegen
Bevor der erste Prompt geschrieben wird, entsteht ein Dokument mit allen festen Merkmalen. Bewährt hat sich eine Tabelle mit den Spalten Merkmal, wörtliche Beschreibung und Referenzdatei. Typische Zeilen: Alter, Gesichtsform, Augenfarbe, Haarfarbe und Haarlänge, Frisur, Körperbau, Kleidung inklusive Stoff und Farbton, Accessoires sowie zwei bis drei ausdrucksstarke Adjektive für den Charakter. Diese Tabelle ist die einzige Quelle der Wahrheit. Jeder Prompt zieht seine Formulierungen von dort, und niemand im Team improvisiert.
Schritt 2: Referenzset produzieren
Erzeuge die Referenzbilder mit einem Bildmodell, das Gesichter zuverlässig darstellt, und zwar bewusst in mehreren Perspektiven: frontal, Dreiviertelansicht, Profil. Vermeide extreme Brennweiten, starke Weitwinkelverzerrung und harte Schatten. Ein Set mit gleichmäßigem, weichem Licht lässt sich später leichter in unterschiedliche Szenen übertragen. Sortiere die Bilder nach Perspektive, damit du beim Testen schnell vergleichen kannst, welche Vorlage welche Wirkung hat.
Schritt 3: Einstellungen planen
Zerlege das Skript in Einstellungen von zwei bis fünf Sekunden. Notiere pro Einstellung: Figur, Handlung, Kamerawinkel, Lichtstimmung und Dauer. Halte die Zahl der Figuren pro Einstellung niedrig – zwei Personen in einer Aufnahme sind doppelt so schwer zu stabilisieren wie eine. Plane außerdem, welche Einstellungen Gesichter zeigen und welche nicht. Die gesichtslosen Einstellungen sind dein Puffer: Dort kannst du Dynamik ausleben, ohne die Identität zu gefährden.
Schritt 4: In Wellen generieren
Generiere nicht eine Einstellung nach der anderen fertig, sondern arbeite in Wellen: erst alle Keyframes, dann alle Clips einer Kategorie. So erkennst du Stildrift früh, bevor zwanzig Clips im falschen Look vorliegen. Ein sinnvolles Vorgehen ist, zuerst die ruhigen Dialogszenen zu erzeugen, weil sie als visueller Maßstab für alle weiteren Einstellungen dienen. Danach folgen Bewegungsszenen, zuletzt Spezialfälle.
Schritt 5: Versionieren
Speichere zu jedem Clip Prompt, Zufallswert, Modellversion, Referenzset und Erstellungszeitpunkt. Ohne diese Versionierung ist jede Verbesserung reines Raten, weil du nicht weißt, welche Änderung welchen Effekt hatte. Ein einfaches Textprotokoll pro Einstellung reicht aus: Was wurde geändert, was war das Ergebnis, welche Version ist die aktuelle. In Teams verhindert das außerdem, dass zwei Personen dieselbe Einstellung parallel reparieren.
Schritt 6: Qualitätskontrolle in der Timeline
Lege alle Clips hintereinander in eine Timeline und schaue sie in Echtzeit an, nicht einzeln. Prüfe drei Dinge: Bleibt die Gesichtsform erkennbar? Bleiben Kleidungsfarben konstant? Bleibt die Lichtrichtung plausibel? Was durchfällt, wird neu generiert – nicht nachträglich repariert. Nachträgliches Retuschieren kostet meist mehr Zeit als eine neue Generierung und hinterlässt sichtbare Spuren.
Prompt-Muster, die Figuren zusammenhalten
Feste Reihenfolge
Ein guter Charakter-Prompt hat eine feste Reihenfolge: Identität, Kleidung, Handlung, Kamera, Licht, Stil. Diese Reihenfolge verankert die stabilen Merkmale früh und macht Prompts untereinander vergleichbar. Wenn du die Reihenfolge bei jedem Prompt beibehältst, kannst du außerdem besser erkennen, welcher Baustein für ein Problem verantwortlich ist.
Immer dieselben Wörter
Wechsle nicht zwischen kastanienbraun und mahagoni, nicht zwischen schmal und zierlich, nicht zwischen Wolljacke und Strickjacke. Jede Variation erzeugt eine neue Interpretationsfläche. Lege für jedes Merkmal genau eine Formulierung fest und kopiere sie. Das wirkt pedantisch, ist aber der billigste Konsistenzgewinn überhaupt.
Negativanker sparsam einsetzen
Zu viele Verbote verengen den Spielraum und führen zu steifen Bewegungen. Zwei bis vier Negativbegriffe reichen, etwa um Haarlänge, Brillen oder Bartwuchs zu fixieren. Alles Weitere gehört in die Charakterbibel, nicht in jeden einzelnen Prompt.
Beispiel für eine wiederkehrende Figur
Mara, 34, schmale Gesichtsform, hohe Wangenknochen, dunkelbraune Augen,
schulterlanges welliges kastanienbraunes Haar, linke Augenbraue leicht
angehoben, dunkelgruene Wolljacke mit Hornknoepfen, weisse Baumwollbluse,
geht langsam durch einen regennassen Innenhof, halbnahe Einstellung,
Kamera auf Brusthoehe, seitliche Nachmittagssonne, cineastischer Realismus
Bemerkenswert ist, wie wenig dieser Prompt über Gefühle sagt und wie viel über sichtbare Merkmale. Genau das ist gewollt: Stimmung entsteht später über Licht, Tempo und Ton.
Bewegungssprache dosieren
Beschreibe Bewegung in kleinen, nachvollziehbaren Einheiten: langsame Kopfdrehung nach links, ein Schritt vorwärts, Hand hebt eine Tasse. Vermeide Sammelanweisungen wie sie wirbelt durch den Raum und lacht gleichzeitig. Wenn eine Bewegung zu komplex wird, zerlege sie in zwei Einstellungen – das ist fast immer schneller als der Versuch, sie in einem Clip zu erzwingen.
Entscheidungskriterien statt Ranglisten
Die Frage nach dem besten Modell führt selten zu brauchbaren Antworten, weil sich Anforderungen unterscheiden. Nützlicher sind Kriterien, die du an deinem eigenen Material testest.
- Unterstützt das System Referenzbilder oder Embeddings? Ohne Identitätskonditionierung ist Konsistenz nur über Glück und Nachbearbeitung erreichbar.
- Erlaubt es Keyframe-Steuerung? Das ist der wichtigste Hebel für kontrollierte Übergänge.
- Wie reagiert es auf Bewegung? Teste denselben Prompt mit einer ruhigen und einer dynamischen Kamerafahrt und vergleiche die Gesichtstreue.
- Wie stabil sind Farben? Generiere eine Reihe mit identischer Kleidungsbeschreibung und prüfe, ob der Farbton über zehn Clips konstant bleibt.
- Welche Auflösung und Dauer sind möglich? Kurze Clips lassen sich leichter konsistent halten; lange brauchen mehr Kontrolle und mehr Ausschuss.
- Wie reproduzierbar ist ein Ergebnis? Systeme mit fixierbarem Zufallswert sind im Serienbetrieb deutlich wertvoller.
Der pragmatische Werkzeug-Stack
In der Praxis hat sich eine Aufteilung bewährt: ein Bildmodell für Charakterdesign und Keyframes, ein Videomodell für Bewegung, ein Interpolations- oder Upscaling-Werkzeug für flüssige Übergänge und ein Schnittprogramm für den Feinschliff. Spezialisierte Open-Source-Modelle lohnen sich, wenn du volle Kontrolle über Adapter und Trainingsdaten brauchst; gehostete Dienste sind im Alltag schneller einsatzbereit. Entscheidend ist nicht die Anzahl der Werkzeuge, sondern dass jedes genau eine Aufgabe hat.
Kontinuität jenseits des Gesichts
Konsistenz endet nicht am Gesicht. Zuschauer bemerken Inkonsistenzen bei Requisiten oft früher als bei Mimik, weil Gegenstände eindeutige Formen haben.
Kleidung
Definiere pro Szene ein vollständiges Outfit inklusive Stoff und Farbton und wiederhole es wörtlich. Kleidungswechsel gehören an erzählerisch sinnvolle Schnittstellen, zum Beispiel zwischen Tagen, nicht mitten in eine Szene. Notiere auch Details, die leicht verschwinden: Knopfreihen, Reißverschlüsse, Taschen, Schuhe.
Licht
Lege für jede Szene eine Lichtrichtung und eine Lichtqualität fest, etwa Seitenlicht von links, weich, späte Nachmittagssonne. Wechselt die Lichtrichtung zwischen aufeinanderfolgenden Einstellungen, wirkt die Figur wie ausgetauscht, selbst wenn das Gesicht identisch ist. Wenn du eine Szene über mehrere Tage produzierst, schreibe die Lichtangabe an den Anfang jeder Prompt-Vorlage.
Kamera und Brennweite
Definiere eine Brennweite pro Szene. Eine Figur, die abwechselnd im Weitwinkel und im Tele aufgenommen wird, sieht unterschiedlich aus – das ist Physik, kein Modellfehler. Halte zusätzlich die Kamerahöhe stabil. Eine Figur von unten gefilmt wirkt dominanter, von oben gefilmt kleiner; ein Wechsel innerhalb einer Szene irritiert.
Requisiten und Umgebung
Wenn eine Figur eine Tasche, eine Brille oder einen Becher trägt, muss das Objekt in jeder Einstellung vorhanden sein. Notiere solche Dinge in der Charakterbibel als tragende Requisiten. Dasselbe gilt für wiederkehrende Umgebungen: Ein Innenhof mit anderem Pflasterbelag wirkt wie ein anderer Ort, selbst wenn die Figur stimmt.
Typische Fehler und Gegenmaßnahmen
Zu viele Referenzbilder. Mehr Material ist nicht automatisch besser. Widersprüchliche Vorlagen mitteln sich zu einem weichen, generischen Gesicht. Nutze sechs bis zehn konsistente Bilder statt dreißig gemischte.
Charakter und Stil verwechseln. Ein stilisierter Look kann eine schwache Identität verdecken. Prüfe zwischendurch in neutraler Beleuchtung, ob die Figur noch erkennbar ist.
Ohne Storyboard starten. Ohne Plan entstehen Einstellungen, die später nicht zusammenpassen. Ein Storyboard aus einfachen Skizzen spart mehr Zeit als jedes Modell-Upgrade.
Nachträglich retuschieren. Wenn ein Clip die Identität verliert, ist Neugenerieren fast immer schneller als manuelles Reparieren.
Tonspur ignorieren. Musik und Geräusche überdecken kleine visuelle Sprünge. Wer den Ton früh einplant, kann Lücken geschickter kaschieren und muss weniger neu generieren.
Unrealistische Bewegungserwartungen. Manche Bewegungen sind für aktuelle Systeme schlicht nicht stabil zu erzeugen. Zerlege sie in mehrere kurze Einstellungen statt sie in einem langen Clip zu erzwingen.
Keine feste Wortliste. Wer spontan umformuliert, produziert Drift ohne es zu merken. Halte die Formulierungen aus der Charakterbibel wörtlich ein.
Zu späte Kontrolle. Prüfe nicht erst am Ende der Produktion. Alle fünf bis zehn Clips eine kurze Timeline-Kontrolle spart viel Nacharbeit.
Praxisbeispiel: eine sechsteilige Serie in vier Tagen
Ein kleines Produktionsteam plante eine sechsteilige Kurzserie über eine Küchenchefin mit insgesamt 42 Einstellungen. Tag eins: Charakterbibel und Referenzset mit acht Bildern aus drei Perspektiven. Tag zwei: Keyframes für alle Einstellungen, erzeugt mit einem Bildmodell und dem festen Outfit weiße Schürze, dunkelblaue Hose, Haarnetz. Tag drei: Videogenerierung in zwei Wellen, zuerst die ruhigen Dialoge, dann die dynamischen Kochszenen. Tag vier: Schnitt, Farbanpassung und Ton.
Die wichtigste Erkenntnis war wenig glamourös: Die ruhigen Einstellungen mit Gesichtern wurden zuerst generiert und dienten als visueller Referenzmaßstab für alle weiteren. Jede Einstellung, die farblich oder in der Gesichtsform abwich, wurde sofort verworfen. Am Ende lag die Ausschussquote bei etwa einem Drittel – ein Wert, der ohne Charakterbibel und Keyframe-Planung deutlich höher gelegen hätte. Besonders auffällig war, dass die Kochszenen mit schnellen Handbewegungen fast nie im ersten Versuch brauchbar waren, während die Dialoge nach zwei Durchläufen saßen.
Für die Nachbearbeitung blieb dadurch mehr Zeit, weil nicht die Hälfte des Materials neu erzeugt werden musste. Die zweite Erkenntnis betraf die Reihenfolge: Hätte das Team mit den dynamischen Szenen begonnen, wäre der Maßstab für Farben und Licht deutlich unklarer gewesen. Ruhe zuerst, Bewegung danach – diese einfache Regel hat in vielen Projekten Bestand.
FAQ: häufige Fragen aus der Praxis
Wie viele Referenzbilder brauche ich wirklich?
Fuer die meisten Faelle genuegen sechs bis zehn Bilder aus drei Perspektiven mit gleichmaessiger Beleuchtung. Mehr Bilder helfen nur, wenn sie sich nicht widersprechen. Widerspruechliche Vorlagen sind schaedlicher als wenige, dafuer eindeutige.
Reicht ein gutes Modell, um Konsistenz zu garantieren?
Nein. Selbst ein starkes System driftet ohne feste Referenzen, klare Prompt-Vorlagen und Keyframe-Kontrolle. Konsistenz ist ein Ergebnis deines Prozesses, nicht nur der Software.
Was mache ich, wenn die Kleidung ständig die Farbe wechselt?
Beschreibe den Farbton mit einem konkreten Referenzobjekt, etwa dunkelgrün wie Tannennadeln, und ergänze eine kurze Negativliste für alternative Töne. Prüfe zusätzlich, ob die Beleuchtung über die Szene hinweg konstant ist – Farbverschiebungen entstehen oft durch wechselndes Licht.
Lohnt sich Fine-Tuning für ein einmaliges Projekt?
Meist nicht. Für kurze Projekte reichen Referenzbilder und Keyframes. Ab etwa zehn Minuten Material mit derselben Hauptfigur amortisiert sich ein trainierter Adapter schnell.
Wie lang sollten einzelne Clips sein?
Zwei bis fünf Sekunden sind ein guter Standard. Alles darüber erhöht die Wahrscheinlichkeit, dass die Identität mitten im Clip kippt. Wenn eine Szene länger wirken soll, schneide mehrere kurze Einstellungen aneinander.
Wie gehe ich mit Dialogszenen um?
Lippensynchronisation ist ein eigenes Themenfeld. Produziere die Aufnahme zunächst ohne Sprechbewegung und ergänze die Mundanimation in einem separaten Schritt – so bleibt die Gesichtsform unter Kontrolle und du kannst die Sprachspur später austauschen.
Woran erkenne ich, ob mein Workflow trägt?
An der Ausschussquote. Wenn du mehr als die Hälfte der Clips verwerfen musst, fehlt meist eine der drei Grundlagen: eindeutige Referenzen, stabile Keyframes oder eine feste Wortliste. Wenn die Quote unter einem Drittel liegt, ist der Prozess belastbar.
Brauche ich mehrere Modelle gleichzeitig?
Nicht zwingend, aber häufig sinnvoll. Ein Modell kann für Gesichter stark und für Bewegung schwach sein. Wähle Werkzeuge nach Aufgabe, nicht nach Beliebtheit, und teste jedes neue Werkzeug mit derselben Testeinstellung, damit Vergleiche fair bleiben.
Checkliste für den Start
- Charakterbibel mit allen festen Merkmalen inklusive wörtlicher Formulierungen anlegen
- Sechs bis zehn konsistente Referenzbilder aus drei Perspektiven erzeugen
- Skript in Einstellungen von zwei bis fünf Sekunden zerlegen
- Pro Szene Licht, Kamera, Brennweite und Outfit wörtlich festhalten
- Keyframes vor dem ersten Videoclip generieren
- Prompts mit festem Wortlaut und fixiertem Zufallswert versionieren
- Alle Clips in einer Timeline in Echtzeit prüfen, alle fünf bis zehn Clips erneut
- Ausschuss neu generieren statt nachträglich retuschieren
- Ruhige Einstellungen zuerst produzieren, Dynamik danach
- Tragende Requisiten und Umgebungsdetails dokumentieren
Wer diese Reihenfolge einhält, merkt schnell, dass die Qualität weniger von spektakulären Einzelframes abhängt als von der ruhigen Wiederholbarkeit derselben Entscheidungen. Genau darin liegt der Unterschied zwischen einem beeindruckenden Testclip und einer Serie, die Zuschauer bis zur letzten Einstellung begleitet.



