Warum Figurenkonsistenz der entscheidende Qualitätsfaktor ist
Ein einzelner Clip gelingt inzwischen in wenigen Minuten: glaubwürdiges Licht, saubere Bewegung, ansprechende Farben, stimmige Atmosphäre. Der eigentliche Engpass liegt nicht mehr in der Bildqualität, sondern in einer viel einfacheren Frage: Ist das dieselbe Person wie im Shot davor? An dieser Frage entscheidet sich, ob aus einer Sammlung hübscher Sequenzen eine Geschichte wird oder ob das Publikum nach zwanzig Sekunden aussteigt.
Zuschauer erkennen Inkonsistenz erstaunlich schnell. Kleine Abweichungen bei Augenabstand, Kinnform, Haaransatz oder der Farbe eines Pullovers fallen auf, auch wenn sie selten bewusst benannt werden. Die menschliche Gesichtswahrnehmung arbeitet mit sehr feinen Toleranzen. Wer eine Figur über mehrere Szenen zeigt, muss genau diese Toleranzen treffen und nicht bloß eine allgemeine Ästhetik bedienen.
In klassischen Produktionen übernehmen Casting, Maske, Kostüm und Continuity diese Aufgabe. Menschen dokumentieren, wie eine Figur aussieht, und prüfen jede Einstellung. In der KI-gestützten Produktion übernimmt Referenzmaterial diese Rolle: Die Bilder sind das Casting, die Prompt-Bibliothek ist das Continuity-Buch, und die fixierten Parameter sind der Anweisungszettel für jeden Drehtag.
Dabei werden drei Ebenen der Konsistenz häufig verwechselt:
- Identität: Gesichtsproportionen, Körperbau, Frisur, Alter, typische Mimik.
- Ausstattung: Kleidung, Materialien, Farben, Accessoires, Schmutz oder Verletzungen über die Handlung hinweg.
- Welt: Lichtstimmung, Farbtemperatur, Objektivcharakter, Location, Tageszeit, Wetter.
Wer nur die Identität absichert, verliert die Figur beim ersten Szenenwechsel, weil sich Licht und Optik ändern. Wer alle drei Ebenen plant, bekommt Material, das sich wie eine Serie anfühlt. Das ist der Unterschied zwischen einem Demo-Reel und einem Format, das man über Wochen weiterproduzieren kann.
Der Drei-Sekunden-Test
Ein nützlicher Praxistest: Legen Sie zwei Standbilder aus zwei verschiedenen Szenen nebeneinander und blenden Sie für drei Sekunden zwischen ihnen hin und her. Wenn ein Betrachter ohne Hinweis sagen kann, dass es sich um dieselbe Person handelt, ist die Identität gesichert. Wenn nicht, liegt die Ursache fast nie am Modell, sondern an Referenzmaterial, Lichtführung oder uneinheitlicher Prompt-Struktur.
Was Konsistenz wirtschaftlich bedeutet
Konsistenz ist kein Selbstzweck. Sie entscheidet über Nachdrehs, über die Zahl der Generierungen pro fertiger Sekunde und über die Möglichkeit, eine Figur später erneut einzusetzen. Eine Figur, die sauber dokumentiert ist, lässt sich in einem neuen Projekt nach zwei Monaten wieder aufnehmen, ohne bei null zu beginnen. Das ist der eigentliche Hebel: Wiederverwendbarkeit statt Einmalproduktion.
Multi-Image-Fusion verstehen: Wie aus mehreren Bildern eine Figur wird
Multi-Image-Fusion klingt technischer, als sie ist. Der Begriff beschreibt, dass ein Modell nicht mit einem einzigen Referenzbild arbeitet, sondern mehrere Aufnahmen derselben Figur als gemeinsame Informationsquelle nutzt. Aus diesen Bildern entsteht ein Merkmalsraum, der bei jeder Generierung erneut abgefragt wird.
Die drei Stufen der Verarbeitung
- Extraktion: Ein Bildencoder liest aus jeder Referenz geometrische und texturale Merkmale: Gesichtsproportionen, Augenform, Haarlinie, Hautton, Kleidungsfarbe, Materialstruktur.
- Fusion und Gewichtung: Die Merkmale werden zusammengeführt und unterschiedlich stark gewichtet. Ein frontales Portrait trägt meist mehr zur Gesichtsidentität bei als eine bewegte Action-Aufnahme, in der das Gesicht klein und unscharf ist.
- Konditionierung: Bei jedem generierten Frame oder Videoabschnitt wird die Fusion als zusätzliche Bedingung an das Modell gegeben, parallel zum Text-Prompt.
Drei praktische Wege im Vergleich
- Startframe-Verfahren: Ein Referenzbild dient als erstes Bild eines Image-to-Video-Laufs. Einfach, schnell und für kurze Formate oft ausreichend, aber anfällig, sobald sich Pose, Brennweite oder Location stark ändern.
- Referenz-Adapter: Zusätzliche Netzwerke schieben Bildmerkmale in den Generierungsprozess, ohne dass das Basismodell neu trainiert wird. Der flexibelste Weg für kurze bis mittlere Projekte und für Figuren, die nur in einer Produktion vorkommen.
- Feinabstimmung: Ein eigenes kleines Zusatzmodell, trainiert auf 20 bis 60 sauberen Aufnahmen einer Figur. Aufwendiger in der Vorbereitung, aber die stabilste Lösung für wiederkehrende Formate und feste Besetzungen.
Die Wahl hängt an drei Fragen: Wie oft taucht die Figur auf? Wie stark variieren Posen und Locations? Wie viel Zeit steht für Vorbereitung zur Verfügung? Wer diese drei Fragen ehrlich beantwortet, wählt meist automatisch den richtigen Weg.
Was Modelle wirklich übernehmen
Nicht alle Merkmale sind gleich robust. Gesichtsgeometrie überträgt sich zuverlässig, Frisur und Haartextur meist, Kleidungsdetails nur mittelmäßig, Accessoires und Materialphysik eher schwach. Deshalb bleibt der Text-Prompt Pflicht: Alles, was das Referenzbild nur unscharf transportiert, muss sprachlich wiederholt werden. Die Fusion liefert die Basis, der Prompt liefert die Präzision.
Das Referenzpaket: Vom Einzelportrait zur Charakterbibel
Die Qualität der Referenzen begrenzt die Qualität jeder Fusion. Ein hübsches Portrait reicht nicht; gebraucht wird ein kleines, in sich konsistentes Set.
Die fünf Pflichtansichten
- Frontales Portrait mit neutralem Ausdruck
- Dreiviertelansicht
- Profilaufnahme
- Ganzkörper frontal
- Ganzkörper in einer typischen Bewegung oder Pose der Figur
Optional ergänzen: Rückansicht für Frisur und Nackenlinie, Detailaufnahme der Hände, Nahaufnahme eines wiederkehrenden Accessoires oder einer Waffe, eines Werkzeugs oder eines Schmuckstücks.
Qualitätskriterien für Referenzbilder
- Neutrale, weiche Beleuchtung ohne harte Schatten
- Keine Filter, keine Beauty-Retusche, kein Weichzeichnen
- Scharfe Augenpartie, sichtbare Hautstruktur
- Mindestens 1024 Pixel an der langen Kante, besser deutlich mehr
- Einheitlicher Hintergrund und einheitliche Kleidung innerhalb einer Version
- Keine Wasserzeichen, keine weiteren Personen im Bild
- Gleicher Hautton in allen Referenzen, kein Mischlicht
Ein häufiger Fehler: Referenzen aus unterschiedlichen Quellen zusammenwerfen, etwa ein KI-generiertes Portrait, ein Handyfoto und ein Screenshot aus einem anderen Projekt. Das Modell mittelt dann Widersprüche und liefert eine Figur, die niemandem ähnelt. Besser ist es, das gesamte Set aus einer Quelle zu erzeugen oder in einer einzigen Session zu fotografieren.
Charakterbibel und Dateiorganisation
Legen Sie pro Figur einen Ordner an und versionieren Sie ihn: figur_mara_v1, figur_mara_v2. Dateinamen wie mara_v1_front.png machen Referenzen in der Pipeline eindeutig und verhindern, dass versehentlich eine alte Version verwendet wird. Dazu gehört eine kurze Textdatei mit dem Identitätsblock, den verwendeten Seeds, dem Basismodell, der Auflösung und Notizen zu Kleidung, Requisiten und Frisurvarianten.
Diese Textdatei ist wichtiger als jedes einzelne Bild, weil sie die Produktion reproduzierbar macht. Wer nach drei Wochen eine Szene nachziehen muss, findet dort alles, was nötig ist. Wer nur Bilder archiviert, beginnt zu raten.
Shotlist und Kontinuitätsplan: Konsistenz entsteht vor der Generierung
Konsistenz ist zu neunzig Prozent Planung und zu zehn Prozent Modellwahl. Eine Shotlist mit festen Spalten verhindert die meisten Probleme: Shot-ID, Figuren, Pose, Emotion, Location, Kamerawinkel, Brennweite, Lichtstimmung, benötigte Referenzbilder, Seed, Status.
Der Kontinuitätsplan ergänzt, was zwischen den Shots passiert: Welche Figur trägt wann welches Kostüm? Welche Requisite liegt wo? Welche Tageszeit gilt in welcher Szene? Kleidungswechsel sind bewusste Schnitte und sollten geplant sein, nicht zufällig entstehen. Auch Verletzungen, Schmutz oder ein nasser Mantel gehören hierher, weil sie sich über Szenen entwickeln müssen.
Blockweise produzieren
Ein bewährtes Vorgehen ist die blockweise Produktion. Generieren Sie zuerst alle Shots einer Figur in derselben Location mit derselben Lichtstimmung. Erst danach wechseln Sie die Umgebung. So bleiben Referenz, Seed und Prompt-Struktur konstant, und Sie erkennen Fehler einer Figur früh, bevor sie sich über das halbe Projekt verteilen.
Szenen, die später im Schnitt direkt nebeneinander liegen, sollten auch in der Produktion benachbart sein. Ein harter Schnitt zwischen zwei Wochen auseinanderliegenden Generierungssessions ist die häufigste Ursache für sichtbare Sprünge.
Prioritäten setzen
Nicht jeder Shot braucht maximale Kontrolle. Entscheiden Sie vorab, welche Einstellungen publikumsnah sind: Nahaufnahmen des Gesichts, emotionale Momente, Szenen mit Dialognähe. Dort investieren Sie Referenzen, Iterationen und Prüfzeit. Weite Totalen, in denen die Figur klein ist, verzeihen deutlich mehr.
Prompting für stabile Figuren
Der Identitätsblock
Der wichtigste Trick ist unspektakulär: Formulieren Sie einen Identitätsblock, der in jedem Prompt wortgleich wiederholt wird. Er beschreibt Alter, Gesichtsform, Augenfarbe, Frisur, Kleidung mit Farbe und Material. Nur Aktions-, Kamera- und Lichtblock ändern sich.
Ein Beispiel für eine solche Struktur:
Identität: Frau, Anfang dreißig, ovales Gesicht, dunkle Augen,
dunkelbraune Schulterblatt-Frisur mit Mittelscheitel,
dunkelgrüne Wolljacke, graues Shirt
Aktion: geht langsam durch einen Flur, blickt zur Kamera
Kamera: 50 mm, Augenhöhe, halbnah, leicht seitlich
Licht: weiches Tageslicht von links, kühle Farbtemperatur
Ort: Betonflur mit großen Fenstern
Wiederholung und kontrollierte Variation
Halten Sie die Reihenfolge der Blöcke konstant. Modelle reagieren empfindlich auf unterschiedliche Satzstrukturen; eine stabile Formulierung wirkt wie ein Anker. Variieren Sie bewusst und sparsam: eine Variable pro Iteration. Wenn Sie gleichzeitig Frisurbeschreibung, Brennweite und Licht ändern, wissen Sie bei einem Fehler nicht, welche Änderung ihn verursacht hat.
Ein zweiter Fehler ist Überladung. Ein Prompt mit vierzig Adjektiven erzeugt keine Präzision, sondern Rauschen. Der Identitätsblock sollte aus fünf bis acht Merkmalen bestehen, die tatsächlich unterscheidend sind. Alles andere gehört in den Szenenblock.
Negativ-Prompts und Parameter
Negativ-Prompts helfen gegen typische Ausreißer: zweite Person, doppelte Gesichtszüge, verzerrte Hände, wechselnde Haarfarbe, Weichzeichner, überstrahlte Haut, Wasserzeichen, zusätzliche Gliedmaßen. Bei den Parametern gilt: Seed pro Location und Figur fixieren, Bewegungsstärke moderat halten, Auflösung nicht unter der Trainingsauflösung des Modells wählen und die Bildrate nicht zwischen Shots wechseln.
Ein Detail, das oft übersehen wird: Die Reihenfolge der Referenzbilder beeinflusst das Ergebnis. Wenn möglich, notieren Sie, welches Bild als erste Referenz eingetragen war. Nur so ist ein gelungener Lauf reproduzierbar.
Licht, Optik und Umgebung angleichen
Viele scheinbare Identitätsfehler sind Beleuchtungsfehler. Ein Gesicht, das unter weichem Nordlicht entstanden ist, wirkt bei hartem Gegenlicht wie eine andere Person. Achten Sie auf Farbtemperatur, Lichtrichtung und Kontrastumfang. Wenn die Szene einen Wechsel verlangt, kompensieren Sie ihn in der Nachbearbeitung mit einer Farbanpassung, statt die Figur neu zu generieren.
Auch das Objektiv verändert die Wahrnehmung. Ein 24-mm-Objektiv verlängert die Nase und vergrößert den Abstand zwischen den Ohren, ein 85-mm-Objektiv komprimiert das Gesicht und verschmälert die Wangen. Wechseln Sie die Brennweite nicht ohne dramaturgischen Grund. Eine Figur, die in einer Szene mit 35 mm und in der nächsten mit 85 mm aufgenommen wirkt, verliert optische Wiedererkennbarkeit, selbst wenn die Gesichtsgeometrie stimmt.
Zwischenreferenzen erzeugen
Bei einem Location-Wechsel lohnt ein Zwischenschritt: Generieren Sie zunächst ein Ganzkörperbild der Figur im neuen Licht und nutzen Sie es als zusätzliche Referenz für die folgenden Shots. So übernimmt die Fusion die neue Umgebung, ohne die Identität zu verlieren. Dieses Zwischenbild ist eine Brücke und kostet zwei Minuten, spart aber oft einen halben Drehtag.
Dasselbe gilt für Tageszeiten. Wer von Mittag auf Abend wechselt, sollte nicht nur die Lichtbeschreibung ändern, sondern eine neue Referenz erzeugen und sie in das Paket aufnehmen.
Bewegung und Zeit: Konsistenz über mehrere Shots
First- und Last-Frame
Der robusteste Weg zu kontrollierten Übergängen ist die Arbeit mit Start- und Endbild. Sie definieren, wie ein Shot beginnt und endet, und lassen das Modell nur dazwischen interpolieren. Für Figuren ist das entscheidend: Beide Endpunkte stammen aus geprüften Referenzen, die Drift bleibt begrenzt. Ohne feste Endpunkte wandert das Gesicht über die Sekunden, bis der letzte Frame nicht mehr zum ersten passt.
Shot-Länge bewusst wählen
Kurze Einstellungen von zwei bis vier Sekunden kaschieren kleine Abweichungen, weil das Auge sie nicht lange genug vergleichen kann. Lange Einstellungen brauchen mehr Kontrolle: niedrigere Bewegungsstärke, ruhigere Kamera, weniger Körperdrehung. Wenn eine Szene lang sein muss, teilen Sie sie in mehrere kurze Shots mit gleicher Lichtsetzung und schneiden Sie auf Bewegung.
Übergänge gestalten
Schneiden Sie auf Bewegung, nicht zwischen zwei statischen Posen. Ein Close-up oder ein Detail-Shot zwischen zwei Locations gibt dem Publikum einen Moment, in dem eine minimale Abweichung nicht auffällt. Vermeiden Sie harte Schnitte von einer Totalen direkt in eine Nahaufnahme desselben Gesichts, wenn die Referenzen nicht optimal sind. Ein Zwischenschnitt auf Hände, Gegenstände oder Umgebung ist dramaturgisch oft sogar stärker als der direkte Sprung.
Fehlerdiagnose und Qualitätskontrolle
Prüfen Sie in Stichproben, nicht erst am Ende. Ziehen Sie aus jedem Shot mehrere Standbilder, vergleichen Sie sie mit dem Referenzpaket und mit dem Nachbar-Shot. Erst wenn die Figur über die Schnittgrenze hinweg stimmt, gilt der Shot als freigegeben. Dieses Gate-Prinzip verhindert, dass Fehler in die nächste Produktionsstufe wandern und dort teurer werden.
| Symptom | Wahrscheinliche Ursache | Gegenmaßnahme |
|---|---|---|
| Gesicht verändert sich im Verlauf des Shots | hohe Bewegungsstärke, zu langer Shot | Shot verkürzen, Bewegung reduzieren, Start- und Endframe fixieren |
| Haarfarbe driftet | Frisur nur im Bild, nicht im Text | Frisur und Farbe in den Identitätsblock aufnehmen |
| Kleidung wechselt Material | zu wenige Referenzen mit Kostüm | Ganzkörperbild im Kostüm ergänzen |
| Figur wirkt nach Szenenwechsel fremd | Licht- und Objektivwechsel | Brennweite und Lichtstimmung angleichen, Zwischenreferenz erzeugen |
| Zwei Personen verschmelzen | unklare Bildkomposition | Personen einzeln generieren, Negativ-Prompt ergänzen |
| Hände deformieren | komplexe Handhaltung in der Pose | Hände ruhig halten oder außerhalb des Bildes führen, retuschieren |
| Figur altert sichtbar über Szenen | widersprüchliche Altersangaben im Prompt | Altersangabe wortgleich fixieren |
Eine einfache Kennzahl
Ergänzend hilft eine einfache Metrik: der Anteil der Shots, die im ersten Anlauf freigegeben werden. Steigt er über mehrere Projekte, funktioniert die Pipeline. Sinkt er, ist meist das Referenzpaket zu dünn oder das Prompt-Template zu uneinheitlich. Notieren Sie diesen Wert pro Projekt in einer Tabelle; nach drei Produktionen sehen Sie, welche Änderung gewirkt hat.
Die Retusche-Entscheidung
Nicht jeder Fehler rechtfertigt eine Neugenerierung. Faustregel: Wenn der Fehler in einer Sekunde Bewegung nicht auffällt, retuschieren. Wenn er in einer Nahaufnahme steht und länger als zwei Sekunden sichtbar ist, neu generieren. Wer alles retuschiert, verliert die Kontrolle über die Farbkonsistenz, weil jede Retusche die Gradierung leicht verschiebt.
Werkzeuge, Pipeline und Entscheidungskriterien
Die Werkzeugwahl sollte sich an drei Kriterien orientieren: Kontrolle, Wiederholbarkeit und Iterationsgeschwindigkeit. Ein Basismodell mit starkem Image-to-Video und sauberer Seed-Steuerung ist wertvoller als eines mit spektakulären Einzel-Shots. Für Posen- und Tiefenkontrolle helfen Steuerungsnetzwerke, für Gesichter spezialisierte Referenzadapter, für wiederkehrende Figuren ein kleines trainiertes Zusatzmodell.
Sinnvolle Bausteine einer Pipeline:
- Referenzaufbau: Bildgenerierung oder Fotoshooting für das Charakterpaket
- Fusion: Adapter oder Feinabstimmung, je nach Projektlänge
- Steuerung: Pose-, Tiefen- und Kantenkontrolle für komplizierte Einstellungen
- Video: Image-to-Video-Läufe mit fixierten Parametern
- Nachbearbeitung: Upscaling, Farbkorrektur, Retusche von Händen und Rändern
- Archiv: Referenzen, Seeds und Prompt-Versionen pro Figur
In Teams lohnt eine klare Rollenverteilung: Eine Person verantwortet das Charakterdesign und das Referenzpaket, eine zweite die Prompt-Bibliothek und die Parameter, eine dritte die Kontinuitätsprüfung im Schnitt. Diese Trennung ist kein Overhead. Sie verhindert, dass dieselbe Figur in drei Varianten entsteht, weil drei Personen unterschiedlich formulieren.
Entscheidungskriterien auf einen Blick
- Einmalige Nutzung, unter zehn Shots: Startframe-Verfahren genügt.
- Mehrere Shots in wechselnden Locations: Referenz-Adapter plus fünf bis acht Referenzbilder.
- Wiederkehrende Figur über Monate: Feinabstimmung plus Charakterbibel.
- Mehrere Hauptfiguren in einer Szene: einzeln generieren und im Schnitt zusammenführen.
- Sehr emotionale Nahaufnahmen: mehr Iterationen einplanen und Brennweite fixieren.
Ein weiterer Punkt, der oft unterschätzt wird: Rechenzeit ist billiger als Nacharbeit. Ein zusätzlicher Durchlauf mit angepasstem Prompt kostet Minuten, eine fehlerhafte Szene im finalen Schnitt kostet einen halben Tag. Wer früh iteriert, spart später.
Häufige Fragen
Wie viele Referenzbilder brauche ich?
Für einen kurzen Clip genügen drei: Portrait, Dreiviertelansicht, Ganzkörper. Für Produktionen mit wechselnden Locations und Posen sind fünf bis acht Referenzen sinnvoll, inklusive einer Bewegungspose und einer Rückansicht. Mehr Bilder helfen nur, wenn sie qualitativ gleichwertig sind; ein unscharfes oder widersprüchliches Bild schadet mehr, als es nützt.
Reicht ein einzelnes, sehr gutes Bild?
Manchmal, solange die Kamera nah bleibt, die Pose ruhig ist und sich die Location nicht ändert. Sobald die Figur den Raum verlässt, kippt die Ähnlichkeit. Ein Einzelbild ist ein Startpunkt, kein Ersatz für ein Referenzpaket.
Warum sieht die Figur nach dem Szenenwechsel wie eine andere Person aus?
In den meisten Fällen liegt es nicht an der Fusion, sondern an Licht, Farbtemperatur oder Brennweite. Gleichen Sie diese Faktoren zuerst an, bevor Sie Referenzen austauschen oder neu trainieren. Erst wenn Identität, Ausstattung und Welt einzeln geprüft wurden, lohnt der Blick auf das Modell.
Wann lohnt sich ein eigenes trainiertes Modell?
Wenn eine Figur über viele Projekte hinweg wiederkehrt oder ein Format mit fester Besetzung geplant ist. Der Aufwand rechnet sich, sobald die Zahl der Shots pro Figur deutlich steigt und Adapter-Lösungen sichtbar an ihre Grenzen kommen. Als Orientierung: ab etwa dreißig geplanten Shots wird die Vorbereitung meist günstiger als die wiederholte Fehlerkorrektur.
Wie gehe ich mit Kostümwechseln um?
Planen Sie sie als bewusste Schnitte und erzeugen Sie pro Kostüm ein eigenes Ganzkörper-Referenzbild. Ändern Sie den Identitätsblock nur im Kleidungsabschnitt und behalten Sie Gesichts-, Haar- und Körperbeschreibung wortgleich bei. So bleibt die Identität stabil, während sich die Ausstattung sichtbar verändert.
Wie vermeide ich, dass sich eine Figur während eines langen Shots verändert?
Verkürzen Sie den Shot, senken Sie die Bewegungsstärke und arbeiten Sie mit festem Start- und Endbild. Wenn die Dramaturgie eine lange Einstellung verlangt, zerlegen Sie sie in mehrere kurze Abschnitte mit identischer Lichtsetzung und schneiden Sie auf Bewegung.
Wie dokumentiere ich eine Figur für spätere Produktionen?
Ein Ordner mit Referenzbildern, eine Textdatei mit Identitätsblock, Seeds, Modellangaben und eine kurze Liste der Varianten, etwa Frisur oder Kleidung. Zusätzlich ein bis zwei finale Standbilder aus dem fertigen Schnitt, damit später klar ist, wie die Figur im Publikum angekommen ist.
Was ist der häufigste Anfängerfehler?
Zu viele Variablen gleichzeitig ändern. Wer Referenz, Prompt, Brennweite und Bewegungsstärke in einem Schritt anpasst, kann nichts daraus lernen. Der zweithäufigste Fehler ist, erst am Ende des Projekts zu prüfen. Beides kostet mehr Zeit als jede Modellentscheidung.
Konsistenz ist am Ende weniger ein Modellproblem als ein Prozess. Referenzpakete, wiederholbare Prompts, fixierte Parameter und eine Prüfroutine vor dem Schnitt liefern die Wiedererkennbarkeit, die generative Videos von zufälligen Clips unterscheidet. Wer diese Schritte einmal standardisiert, produziert schneller, mit weniger Nacharbeit und mit einer Figur, die das Publikum über die gesamte Laufzeit wiedererkennt – Szene für Szene.



