Warum Charakterkonsistenz über Erfolg oder Misserfolg entscheidet
Generatives Video hat in kurzer Zeit enorme Sprünge gemacht: Einzelaufnahmen wirken heute oft fotorealistisch, Bewegungen laufen flüssig, Licht und Materialien überzeugen. Der Bruch entsteht selten innerhalb einer Szene – er entsteht zwischen den Szenen. Dieselbe Figur, die in Einstellung eins noch markante Wangenknochen und eine ruhige Augenpartie hatte, bekommt zwei Schnitte später ein weicheres Gesicht, eine andere Frisur und plötzlich einen Bartschatten. Für Zuschauer ist das kein technisches Detail, sondern ein Identitätswechsel – und der zerstört die Geschichte.
Das Problem ist wirtschaftlich relevant. Serienformate auf Social Media, wiederkehrende Werbefiguren, Erklärvideos mit einem festen Sprecher, Testimonials, die über Wochen ausgespielt werden: Alles davon lebt von Wiedererkennung. Wer jede Einstellung isoliert generiert, produziert Ausschuss. Wer mit einem sauberen Referenzsystem arbeitet, produziert Assets.
Charakterkonsistenz ist deshalb weniger eine Prompt-Frage als eine Frage des Produktionsdesigns. Dieser Leitfaden erklärt, wie Multi-Image-Fusion technisch funktioniert, wie Sie ein belastbares Referenzset aufbauen, wie der Workflow von der Charakterbibel bis zum fertigen Clip aussieht – und an welchen Stellen die Qualität typischerweise kippt.
So funktioniert Multi-Image-Fusion technisch
Multi-Image-Fusion bedeutet: Das Modell erhält nicht ein einzelnes Referenzbild, sondern mehrere Aufnahmen derselben Figur und leitet daraus eine gemeinsame Identitätsrepräsentation ab. Statt ein Gesicht Pixel für Pixel zu kopieren, extrahiert das System konsistente Merkmale – Proportionen, Augenabstand, Nasenform, Kieferlinie, Hautton, Haarlinie – und verdichtet sie zu einem Signal, das jede generierte Szene mitsteuert.
Typische Videomodelle und Bildgeneratoren mit Referenzfunktion arbeiten dabei mit zwei Ebenen: einer strukturellen Bedingung (Pose, Komposition, Licht) und einer Identitätsbedingung (Gesichts- und Körpermerkmale). Die Identitätsbedingung wirkt als weiche Vorgabe. Sie ist stark genug, um ein Gesicht über zwanzig Einstellungen zu tragen, aber schwach genug, um bei widersprüchlichen Eingaben zu driften.
Identitätsvektoren statt Gesichtskopien
Der eigentliche Trick ist Abstraktion. Aus Ihren Referenzbildern entsteht ein Merkmalsraum, in dem „diese Person“ ein wiedererkennbarer Bereich ist. Bei jeder Generierung fragt das Modell im Kern: Wie nah liegt das entstehende Gesicht an diesem Bereich? Je klarer der Bereich definiert ist, desto stabiler das Ergebnis. Ein einzelnes Referenzbild definiert nur einen Punkt – und ein Punkt lässt sich leicht verfehlen.
Warum mehrere Bilder robuster sind als eines
Ein einziges Foto ist immer ein Zufallsprodukt: eine bestimmte Lichtsituation, ein bestimmter Winkel, ein bestimmter Ausdruck. Nutzt das Modell nur diese eine Quelle, überträgt es auch deren Zufälle: Schattenwurf, Kopfhaltung, Augenausdruck. Mit acht bis fünfundzwanzig Bildern mittelt das System diese Zufälle heraus und findet den gemeinsamen Nenner. Profilaufnahmen liefern Informationen, die ein Frontalfoto nicht enthält – etwa Nasenprofil und Kieferverlauf. Genau diese Winkel entscheiden später darüber, ob eine Dreivierteldrehung noch glaubwürdig ist.
Die Grenzen des Verfahrens
Multi-Image-Fusion stabilisiert Identität, nicht Anatomie. Extreme Blickwinkel, starke Verdeckungen durch Hände oder Requisiten, harte Seitenlichtsituationen und schnelle Kopfbewegungen bleiben schwierig. Auch Konsistenz jenseits des Gesichts – Kleidung, Requisiten, Raumgestaltung – entsteht nicht automatisch. Das Modell kennt keine Kontinuitätslogik; es kennt nur Ähnlichkeit. Wer das akzeptiert, plant anders: kürzer, kontrollierter, mit mehr Zwischenprüfungen.
Ein Referenzset aufbauen, das wirklich trägt
Die Qualität Ihres Referenzsets bestimmt die Obergrenze der erreichbaren Konsistenz. Ein schlechtes Set lässt sich später nicht durch Prompts reparieren.
Der Aufnahmeplan
Arbeiten Sie systematisch statt intuitiv. Ein Set aus fünfzehn bis fünfundzwanzig Bildern sollte abdecken:
- Frontale Ansicht bei neutraler Grundbeleuchtung
- Dreiviertelansicht von links und von rechts
- Zwei Profilaufnahmen (links, rechts)
- Eine Nahaufnahme des Gesichts, formatfüllend
- Eine Halbtotale und eine Ganzkörperaufnahme
- Neutrale Mimik, leichtes Lächeln, sprechender Mund mit sichtbaren Zähnen
- Eine Aufnahme mit seitlichem Licht, eine mit weichem Gegenlicht
- Maximal zwei Outfits, um Garderobensignale nicht zu verwässern
Alle Bilder sollten dieselbe Person, dieselbe Frisur und denselben Grundton haben. Wechseln Sie zwischen den Aufnahmen nicht die Brennweite zu stark, sonst entstehen perspektivische Verzerrungen, die das Modell als Merkmal interpretiert.
Auswahl und Aufbereitung
Weniger als acht Referenzen machen das Ergebnis fragil. Mehr als vierzig bringen kaum zusätzliche Stabilität und können widersprüchliche Signale einspeisen – etwa, wenn zwei Bilder unterschiedliche Gesichtsformen zeigen, weil eines stark retuschiert wurde. Aussortieren sollten Sie konsequent:
- Bewegungsunschärfe oder Verwacklung
- Sonnenbrillen, Schals, Hände vor dem Gesicht
- Starke Beauty-Filter oder Weichzeichnung
- Selfies mit Weitwinkelverzerrung
- Bilder mit extrem unterschiedlicher Farbtemperatur
Schneiden Sie die Bilder auf einen einheitlichen Kopf-Schulter-Ausschnitt zu und markieren Sie das beste Frontalfoto als Hauptanker. Dieses Ankerbild verwenden Sie, wenn eine Einstellung besonders kritisch ist.
Synthetische Figuren und Rechte an realen Personen
Bei erfundenen Figuren empfiehlt sich der umgekehrte Weg: Zuerst entsteht ein Charakterblatt mit konsistenten Merkmalen, aus dem Sie anschließend Referenzaufnahmen ableiten. So bleibt die Figur von Anfang an frei von Zufällen. Bei realen Personen gilt: schriftliche Einwilligung einholen, Nutzungsumfang klären und festhalten, ob die Referenzen nach Projektende gelöscht werden müssen. Das ist keine Formalie – es bestimmt, welche Sets Sie überhaupt dauerhaft archivieren dürfen.
Der komplette Workflow: von der Charakterbibel zum fertigen Clip
Schritt 1: Charakterbibel anlegen
Eine Charakterbibel ist ein kurzes Dokument, das jede Einstellung überlebt. Sie enthält:
- Name, Alter, Herkunft, Körperbau
- Gesichtsmerkmale in Worten (Augenform, Brauen, Nasenrücken, Kieferlinie)
- Frisur, Haarfarbe, Bartstatus
- Grundgarderobe mit exakter Bezeichnung jedes Kleidungsstücks
- Farbpalette der Figur und ihrer Umgebung
- Accessoires, die immer oder nie vorkommen
Wichtigster Bestandteil ist der Identitätsblock: ein Textbaustein von vierzig bis sechzig Wörtern, der die Figur beschreibt und in jeder Einstellung wortgleich wiederholt wird. Nicht „ähnlich formuliert“ – wortgleich. Jede Variation ist ein neues Signal.
Schritt 2: Shotlist und Kontinuitätskarte
Erstellen Sie eine Tabelle mit einer Zeile pro Einstellung: Nummer, Einstellungsgröße, Blickrichtung, Garderobenzustand (Jacke offen oder geschlossen), Requisiten, Lichtstimmung, Tageszeit. Die Kontinuitätskarte ist der billigste Teil der Produktion und verhindert die teuersten Fehler. Wer sie weglässt, merkt erst beim Schnitt, dass zwischen zwei Einstellungen die Kaffeetasse ihre Seite gewechselt hat.
Schritt 3: Erst Keyframe, dann Bewegung
Generieren Sie zuerst ein Standbild pro Einstellung. Prüfen Sie es gegen die Charakterbibel – Gesicht, Garderobe, Licht. Erst wenn der Keyframe sitzt, wandeln Sie ihn in Bewegungsmaterial um. Dieser Zwischenschritt kostet wenige Minuten und spart komplette Generierungsläufe, weil Fehler sichtbar werden, bevor Rechenzeit in Animation fließt.
Schritt 4: Generieren, prüfen, verwerfen
Ändern Sie pro Iteration genau eine Variable. Wenn Gesicht und Garderobe stimmen, aber das Licht nicht passt, korrigieren Sie ausschließlich den Lichtteil des Prompts. Wer drei Dinge gleichzeitig ändert, lernt nichts über die Ursache. Vergleichen Sie Kandidaten in einer Kontaktbogenansicht nebeneinander – im direkten Vergleich sieht man Drift, die einzeln betrachtet unsichtbar bleibt.
Schritt 5: Postproduktion
Rechnen Sie mit Nacharbeit. Sanfte Stabilisierung, punktuelle Hautretusche, Farbanpassung über alle Einstellungen, Frame-Interpolation für flüssigere Bewegung und Ton, der die Aufmerksamkeit führt. Ein einheitliches Grading über alle Clips hinweg kaschiert kleine Unterschiede in Farbtemperatur und Kontrast deutlich besser als jedes Nachgenerieren.
Prompting für Konsistenz: die Bausteinmethode
Die fünf Blöcke
Bauen Sie jeden Prompt nach demselben Schema:
- Identitätsblock: wortgleich aus der Charakterbibel
- Garderobenblock: exakte Bezeichnungen, keine Synonyme
- Szenenblock: Ort, Handlung, Tageszeit
- Kamerablock: Brennweite, Einstellungsgröße, Bewegungsart
- Stilblock: Look, Farbton, Filmkorn, Bildrate-Anmutung
Dazu ein negativer Block mit unerwünschten Elementen: zusätzliche Personen im Hintergrund, Text im Bild, Wasserzeichen, verzerrte Hände, doppelte Gliedmaßen.
Wortdisziplin schlägt Ausführlichkeit
Der häufigste Grund für Identitätsdrift ist sprachliche Unschärfe. „Mann“ in Einstellung eins und „junger Kerl“ in Einstellung zwei sind für das Modell zwei verschiedene Konzepte. Dasselbe gilt für Synonyme bei Kleidung: „Hemd“, „Bluse“, „Oberteil“ erzeugen drei unterschiedliche Stoffe. Legen Sie eine Begriffsliste an und halten Sie sich daran.
Vorsicht auch bei widersprüchlichen Adjektiven. Wenn Ihre Referenzfigur weiche Gesichtszüge hat, Sie aber „markante Wangenknochen“ in den Prompt schreiben, entsteht ein Kompromiss – im Ergebnis ein drittes, unbekanntes Gesicht. Beschreiben Sie die Figur so, wie sie tatsächlich aussieht.
Seeds, Seitenverhältnisse und Parameterdisziplin
Für vertikale Kurzvideos setzen Sie das Seitenverhältnis einmal fest und ändern es nie innerhalb einer Serie. Fixieren Sie, wenn möglich, den Basisseed und die Stichprobenschritte. Halten Sie Kamerabewegungen klein: langsamer Schwenk, leichte Fahrt, subtiler Push. Drei bis sechs Sekunden pro Einstellung sind ein gutes Arbeitsmaß, weil sich Drift mit der Laufzeit summiert.
Kleidung, Requisiten und Sets konsistent halten
Konsistenz endet nicht am Kinn. Definieren Sie pro Figur ein Standard-Outfit und höchstens zwei Varianten, jeweils mit einer eigenen Referenzaufnahme. Notieren Sie Details, die später auffallen: Ärmelaufschlag, offener Kragen, Schmuck auf welcher Seite, Taschenposition.
| Kontinuitätsklasse | Was erfassen | Artefakt |
|---|---|---|
| Figur | Gesicht, Haare, Körperbau | Referenzset plus Identitätsblock |
| Garderobe | Schnitt, Farbe, Zustand | Referenzbild pro Outfit |
| Requisiten | Anzahl, Position, Zustand | Inventarliste pro Einstellung |
| Umgebung | Raum, Möbel, Hintergrunddetails | Hintergrund-Referenzplatte |
| Licht | Richtung, Härte, Tageszeit | Lichtkarte pro Szene |
| Format | Seitenverhältnis, Bildrate, Grading | Projektprofil |
Für Sets lohnt sich eine eigene Referenzplatte: ein Bild des Raums ohne Figur. Damit lassen sich Szenen neu generieren, ohne den Hintergrund zu verlieren. Farbpaletten pro Drehort verhindern, dass Szenen unterschiedlich „kalt“ oder „warm“ wirken.
Szenen mit mehreren Figuren
Zwei Figuren in einer Generierung sind der häufigste Grund für Identitätsvermischung. Das Modell mittelt Gesichtsmerkmale, Haarfarben und sogar Kleidung, wenn sich die Figuren ähneln. Praktikable Strategien:
- Getrennte Durchläufe für jede Figur, anschließend zusammensetzen
- Über-die-Schulter-Einstellungen, bei denen nur ein Gesicht groß im Bild ist
- Weite Einstellungen, in denen Gesichter klein bleiben und Details nicht auffallen
- Klare Differenzierung über Palette: unterschiedliche Haarfarben, Kleidungsfarben, Lichtseiten
- Feste Blickrichtungen, damit der Schnitt später die Achse hält
Wenn eine gemeinsame Einstellung unvermeidbar ist, generieren Sie drei bis fünf Varianten mit reduzierter Bewegung und wählen die stabilste. Für Dialoge gilt: Nahaufnahmen im Wechsel, Reaktionen statt gleichzeitiger Präsenz. Das ist klassische Filmgrammatik und zufällig auch die technisch einfachste Lösung.
Troubleshooting: wenn das Gesicht kippt
| Symptom | Wahrscheinliche Ursache | Maßnahme |
|---|---|---|
| Gesicht wird weicher oder älter | Zu wenige Referenzen, widersprüchliche Adjektive | Mehr Winkel ergänzen, beschreibende Adjektive entfernen |
| Identität wechselt nach dem Schnitt | Stil- oder Seedwechsel zwischen Einstellungen | Stilblock vereinheitlichen, Seed fixieren |
| Merkmale verschmelzen bei Bewegung | Schnelle Kopfbewegung, lange Takes | Kürzere Einstellungen, geringere Bewegungsintensität |
| Garderobe springt | Synonyme im Prompt | Begriffsliste erzwingen |
| Gesicht dauerhaft verdeckt | Hände, Requisiten, Haare | Kameraposition ändern, alternative Einstellungsgröße |
| Künstlicher Gesamteindruck | Zu starke Nachschärfung oder Wiederherstellung | Retusche reduzieren, Grading vereinheitlichen |
Ein wichtiger Grundsatz: Nicht jeder Fehler ist ein Generierungsfehler. Kleine Abweichungen bei Nebenfiguren, Hintergrunddetails oder Requisiten lassen sich im Schnitt kaschieren. Investieren Sie Nacharbeit dort, wo die Hauptfigur betroffen ist, und akzeptieren Sie Mikrofehler im Randbereich. Wer jede Einstellung perfekt generieren will, produziert vor allem Stillstand.
Qualitätskontrolle mit Checkliste und Fehlerklassifikation
Prüfen Sie jede fertige Einstellung in fester Reihenfolge:
- Identität: Gesichtsproportionen, Augenabstand, Haarlinie
- Garderobe: Schnitt, Farbe, Zustand, Schmuck
- Requisiten: Anzahl, Position, Zustand
- Umgebung: Möbel, Hintergrunddetails, Tageszeit
- Licht: Richtung, Härte, Farbtemperatur
- Bewegung: Natürlichkeit, Drift über die Take-Länge
- Ton und Format: Lautheit, Seitenverhältnis, Grading
Klassifizieren Sie Fehler anschließend:
- Klasse A – Identität gebrochen: neu generieren, kein Kompromiss
- Klasse B – Kontinuitätsfehler: retuschieren oder Einstellung tauschen
- Klasse C – Ästhetik: akzeptieren, wenn der Blick nicht hängen bleibt
Diese Klassifikation verhindert die typische Endlosschleife, in der eine eigentlich gute Einstellung zwanzig Mal neu generiert wird, weil ein Detail im Hintergrund stört.
Häufige Fehler und FAQ
Typische Fehler
- Nur ein Referenzbild verwenden und dann Stabilität erwarten
- Den Identitätsblock in jeder Einstellung neu formulieren
- Licht, Garderobe und Kamerawinkel gleichzeitig ändern
- Zu lange Takes generieren statt kurzer, kontrollierter Einstellungen
- Keine Shotlist führen und Kontinuität erst im Schnitt prüfen
- Referenzbilder mit unterschiedlicher Bearbeitung mischen
- Bei mehreren Figuren auf eine gemeinsame Generierung hoffen
Wie viele Referenzbilder brauche ich wirklich?
Für eine wiederkehrende Hauptfigur sind fünfzehn bis fünfundzwanzig Aufnahmen ein solider Arbeitsbereich. Unter acht wird es fragil, über vierzig bringt kaum mehr Stabilität. Entscheidend ist die Vielfalt der Winkel, nicht die reine Menge.
Reicht ein gutes Standbild für eine ganze Serie?
Für kurze Formate mit überwiegend frontalen Einstellungen kann ein starkes Bild plus sauberer Identitätsblock erstaunlich weit tragen. Sobald Dreivierteldrehungen, Profilaufnahmen oder wechselnde Lichtsituationen dazukommen, brauchen Sie mehrere Winkel.
Warum sieht meine Figur in der Totalen anders aus als in der Nahaufnahme?
In der Totalen ist das Gesicht klein und liefert kaum Identitätssignal. Das Modell füllt die Lücke mit Wahrscheinlichkeiten. Gegenmaßnahmen: eine Ganzkörper-Referenz ergänzen, die Totale kürzer halten und Details wie Garderobe und Frisur exakt beschreiben, damit der Wiedererkennungseffekt über Kleidung und Silhouette läuft.
Kann ich Konsistenz nachträglich retten?
Teilweise. Sanfte Hautretusche, Farbanpassung und Stabilisierung helfen bei kleinen Abweichungen. Ein grundlegend anderes Gesicht lässt sich nicht glaubwürdig angleichen – hier ist Neugenerierung günstiger als Stunden in der Nachbearbeitung.
Wie gehe ich mit wechselnden Outfits um?
Legen Sie pro Outfit ein eigenes Referenzbild an und einen eigenen Garderobenblock, der immer vollständig zitiert wird. Ein Outfitwechsel innerhalb einer Einstellung funktioniert praktisch nie zuverlässig; planen Sie ihn als Schnitt zwischen zwei Einstellungen.
Was ist wichtiger: Prompt oder Referenzen?
Die Referenzen setzen die Obergrenze, der Prompt entscheidet, wie nah Sie herankommen. Ein gutes Set mit einem nachlässigen Prompt liefert mittelmäßige Ergebnisse; ein präziser Prompt mit einem schwachen Set liefert keine. Beginnen Sie immer beim Referenzset.


