Limited Time Sale: Get 30% OFF on Next-Gen AI Video Creation 🎉

Multi-Image-Fusion: Ein Charakter über viele Szenen hinweg

Sep 15, 2026

Warum Konsistenz über viele Szenen der eigentliche Engpass ist

Ein einzelner Clip ist schnell generiert. Sobald daraus eine Sequenz mit fünf, zehn oder dreißig Einstellungen wird, kippt die Aufgabe: Aus einem Kreativproblem wird ein Logistikproblem. Die Figur muss wiedererkennbar bleiben, während sich Ort, Tageszeit, Garderobe, Kamerawinkel und Stimmung ändern. Zuschauer verzeihen erstaunlich viel – wackelige Übergänge, ungewöhnliche Schnitte, sogar kleine Logikfehler. Was sie nicht verzeihen, ist ein Charakter, der in der zweiten Einstellung wie eine andere Person aussieht. Das Gehirn erkennt Gesichter extrem präzise. Schon kleine Abweichungen bei Augenabstand, Kieferpartie oder Haarlinie brechen die Illusion, und der Zuschauer ist emotional aus der Geschichte heraus.

Genau hier setzt Multi-Image-Fusion an. Statt zu hoffen, dass ein Text-Prompt diesmal dieselbe Person erzeugt, gibst du dem Modell mehrere Referenzbilder derselben Figur aus verschiedenen Blickwinkeln und Lichtsituationen. Daraus entsteht so etwas wie ein visueller Fingerabdruck, der auf neue Szenen übertragen wird. Das verschiebt die Arbeit vom Hoffen zum Steuern – und das ist der Unterschied zwischen einem netten Experiment und einer Serie, die man tatsächlich weiterführen kann.

Der wirtschaftliche Aspekt kommt hinzu. Jede Einstellung, die du wegen inkonsistenter Gesichter neu generierst, kostet Zeit, Rechenleistung und Nerven. Brauchst du bei einem zehnteiligen Projekt pro Szene zwei zusätzliche Versuche, verdoppelt sich der Aufwand fast. Ein sauber aufgesetztes Referenz-Setup amortisiert sich daher schon nach wenigen Einstellungen.

Wie Multi-Image-Fusion technisch funktioniert

Referenzbilder als Ankerpunkte

Bei der Multi-Image-Fusion bekommt das Modell nicht nur Text, sondern mehrere Bilder derselben Person. Diese Bilder dienen als Anker: Sie definieren Gesichtsgeometrie, Proportionen, Hautton, Frisur und typische Kleidung. Aus ihnen werden Merkmalsvektoren berechnet, die während der Generierung auf die neuen Frames einwirken. Man kann sich das wie eine weiche Schablone vorstellen, die über jede neue Szene gelegt wird – nicht starr, aber stark genug, um die Identität zu halten.

Wichtig: Es geht nicht darum, ein Bild eins zu eins zu kopieren. Wäre es so, könntest du nie eine neue Pose erzeugen. Die Fusion arbeitet mit Gewichtung. Je nach Modell und Einstellung entscheidest du, wie stark die Referenz den Output dominiert. Zu wenig Gewicht – die Figur driftet. Zu viel Gewicht – die Figur wird steif, wiederholt dieselbe Kopfhaltung oder übernimmt Artefakte aus dem Referenzbild.

Was im latenten Raum passiert

Diffusionsmodelle erzeugen Bilder iterativ im latenten Raum, also in einer komprimierten mathematischen Repräsentation. Dort existieren keine Pixel, sondern Richtungen und Wahrscheinlichkeiten. Die Referenzbilder beeinflussen diese Richtung: Sie erhöhen die Wahrscheinlichkeit bestimmter Merkmalskombinationen und senken andere. Deshalb sind gemischte Referenzen so mächtig. Zeigst du dieselbe Person von vorn, im Profil und von schräg oben, lernst du dem Modell eine Art dreidimensionales Verständnis an. Es weiß dann eher, wie die Nase aussieht, wenn der Kopf gedreht wird.

Hier liegt auch die Antwort auf die häufigste Frustration: Ein einzelnes Referenzbild reicht für frontale Einstellungen, aber sobald sich die Figur bewegt oder das Licht wechselt, muss das Modell raten. Mehrere Perspektiven reduzieren dieses Raten drastisch.

Character Drift: Symptome, Ursachen, Gegenmaßnahmen

Woran du Drift erkennst

Character Drift ist selten ein plötzlicher Bruch. Meist ist es ein schleichender Prozess. Typische Anzeichen:

  • Das Gesicht bleibt ähnlich, aber Augenform oder Augenabstand verändern sich leicht.
  • Die Haarfarbe kippt von einem warmen Braun zu einem kühleren Ton.
  • Die Figur verliert Alter: Falten verschwinden, die Wangen werden runder.
  • Die Statur verändert sich über mehrere Szenen hinweg sichtbar.
  • Kleidungsdetails wie Kragen, Knopfleiste oder Taschen wandern oder verschwinden.

Fällt dir so etwas auf, ist meist nicht das Modell schuld, sondern die Konfiguration: zu wenige Referenzen, widersprüchliche Referenzen oder ein Prompt, der Merkmale beschreibt, die den Referenzen widersprechen.

Was wirklich hilft

Erstens: Redundanz. Nutze mindestens drei bis fünf Referenzbilder aus unterschiedlichen Winkeln. Zweitens: Widerspruchsfreiheit. Wenn deine Referenzen eine Person mit Mittelscheitel zeigen, darf der Prompt keinen seitlichen Pony verlangen. Drittens: Konsistenz in der Beschreibung. Verwende für dieselbe Figur immer dieselben Schlüsselbegriffe. Viertens: Referenzgewichtung kalibrieren, bevor du eine ganze Sequenz renderst. Mache einen Test mit drei Einstellungen und prüfe, ob die Identität hält.

Ein oft unterschätzter Punkt: Auch die Szenenbeschreibung beeinflusst die Identität. Ein Prompt mit „energisch, jung, dynamisch“ erzeugt ein anderes Gesicht als „müde, erfahren, ruhig“. Beschreibe die Figur deshalb neutral und stecke Emotion in die Regie, nicht in die Charakterbeschreibung.

Referenzbilder auswählen und aufbereiten

Mindestanzahl, Winkel, Ausdruck

Die Faustregel lautet: drei Bilder für kurze Projekte, fünf bis acht für längere Sequenzen. Die Auswahl sollte abdecken:

  • Frontalaufnahme mit neutralem Ausdruck
  • Dreiviertelprofil links und rechts
  • Profil
  • Leichte Aufsicht und leichte Untersicht
  • Mindestens ein Bild mit sprechender Mimik, falls Dialog vorkommt

Vermeide extreme Ausdrücke wie Lachen oder Wut als Hauptreferenz. Sie verzerren Gesichtsproportionen und ziehen die Identität in Richtung Karikatur. Auch starke Weitwinkelaufnahmen sind problematisch, weil sie die Nase vergrößern und die Kieferpartie verbreitern – das Modell lernt dann eine Proportion, die es später in jeder Szene reproduziert.

Technische Qualität und Hintergrund

Scharf, gleichmäßig beleuchtet, ohne harte Schatten im Gesicht. Der Hintergrund ist zweitrangig, sollte aber nicht mit der Figur konkurrieren – ein unruhiges Muster kann als Textur auf die Kleidung überspringen. Achte darauf, dass alle Referenzbilder denselben Hautton zeigen. Mischlicht aus Tageslicht und Kunstlicht erzeugt widersprüchliche Farbinformationen und ist eine der häufigsten Ursachen für Drift.

Falls du nur Fotos mit unterschiedlicher Qualität hast, hilft eine kurze Vorstufe: Auflösung angleichen, Belichtung normalisieren, Gesicht mittig zuschneiden, störende Objekte entfernen. Dieser Aufwand von zehn Minuten spart später Stunden.

Der Workflow: Von der Charakterbibel zum fertigen Clip

Charakterbibel anlegen

Bevor du irgendetwas generierst, dokumentiere die Figur. Eine Charakterbibel enthält:

  • Name, Alter, Herkunft
  • Gesichtsmerkmale in neutraler Sprache
  • Haarfarbe, Frisur, Länge
  • Statur und Körpergröße relativ zum Umfeld
  • Grundgarderobe inklusive Materialien und Farben
  • Stimme und Sprechweise, falls Dialog vorkommt
  • Verbotene Merkmale – Dinge, die nie auftauchen dürfen

Diese Datei ist dein Vertrag mit dir selbst. Sobald du anfängst, Prompts spontan umzuformulieren, beginnt der Drift.

Shotlist und Szenenaufteilung

Zerlege die Sequenz in Einstellungen, bevor du renderst. Für jede Einstellung notierst du Ort, Tageszeit, Einstellungsgröße, Kamerabewegung, Handlung und Emotion. Anschließend gruppierst du Einstellungen mit ähnlichen Bedingungen. Szenen mit gleichem Licht und gleicher Distanz lassen sich in einem Durchgang erzeugen – das verbessert die Konsistenz und spart Rechenzeit.

Prompting pro Szene

Ein wiederverwendbarer Prompt-Aufbau hat sich bewährt: Identitätsblock plus Garderobenblock plus Szenenblock plus Kamerablock plus Stilblock. Der Identitätsblock beschreibt ausschließlich die Person und bleibt über alle Einstellungen identisch. Der Szenenblock beschreibt Ort, Wetter und Handlung. Der Kamerablock beschreibt Brennweite, Höhe und Bewegung. Der Stilblock beschreibt Farbpalette, Filmkorn und Lichtstimmung. Wenn du diese Blöcke wie Bausteine kombinierst, bleibt die Figur stabil, während die Szene variiert.

Ein Beispiel für den Identitätsblock: „Frau, Anfang dreißig, mittellanges dunkelbraunes Haar mit Mittelscheitel, runde Augen, schmale Nase, leichte Sommersprossen auf den Wangen, schmale Statur, dunkelgrüne Wolljacke.“ Diesen Block kopierst du wörtlich in jeden Prompt. Der Szenenblock darunter wechselt: „Bäckerei am frühen Morgen, warmes Seitenlicht von links, Dampf über der Theke.“ So entsteht Variation, ohne die Identität zu gefährden.

Modellwahl und Testläufe

Nicht jedes Modell behandelt Referenzbilder gleich. Manche sind stark bei Gesichtern, aber schwach bei Bewegung. Manche halten Kleidung besser, andere Licht. Teste zwei bis drei Modelle mit derselben Einstellung und vergleiche drei Dinge: Gesichtstreue, Bewegungstreue und Artefaktfreiheit. Entscheide dich dann für ein Hauptmodell und ein Ausweichmodell für Spezialfälle wie schnelle Action oder Nahaufnahmen mit Dialog.

Sinnvolle Entscheidungskriterien sind: Wie stark lässt sich die Referenz gewichten? Unterstützt das Modell mehrere Referenzbilder gleichzeitig? Bleibt die Kleidung stabil? Wie gut funktioniert Text im Bild, falls Schilder oder Logos vorkommen? Und wie vorhersehbar sind die Ergebnisse bei Wiederholung?

Qualitätskontrolle und Nachbesserung

Sieh dir die Ergebnisse in einer Schleife an, nicht einzeln. Erst wenn drei aufeinanderfolgende Einstellungen nebeneinander funktionieren, ist die Figur stabil. Wer jeden Clip isoliert beurteilt, übersieht genau jenen Drift, der in der Montage später auffällt. Lege dir außerdem eine Referenz-Montage an: ein Raster mit Standbildern aller Szenen. Auf einen Blick erkennst du dort Abweichungen, die dir bei der Einzelbetrachtung entgehen.

Stilwechsel ohne Identitätsverlust

Ein Charakter muss nicht in einem einzigen Look bleiben. Du kannst dieselbe Figur in einer fotorealistischen Szene, als animierte Variante oder in einer stark stilsierten Grafik zeigen – solange die Kernmerkmale erhalten bleiben. Der Trick liegt in der Reihenfolge: Erzeuge zuerst eine stabile Basis im Hauptstil, und leite Stilvarianten daraus ab. Verwende die generierten Basisbilder als neue Referenzen für die Stilvariante.

Achte darauf, welche Merkmale stilunabhängig sind. Gesichtsgeometrie, Augenfarbe, Frisurform und Körperproportionen bleiben erkennbar, egal ob realistisch oder illustriert. Kleidungsdetails sind dagegen stark stilabhängig. Reduziere sie in Stilvarianten auf klare Formen und Farben, sonst erzeugt das Modell widersprüchliche Texturen.

Licht, Kamera und Farbe als Konsistenzfaktoren

Konsistenz endet nicht beim Gesicht. Ein Zuschauer nimmt eine Figur als Teil einer Welt wahr. Wenn die Lichtrichtung zwischen zwei aufeinanderfolgenden Einstellungen von links nach rechts springt, wirkt der Schnitt falsch, obwohl das Gesicht identisch ist. Notiere deshalb für jede Szene die Lichtrichtung, die Farbtemperatur und die Grundstimmung.

Ähnlich verhält es sich mit der Kamera. Eine Sequenz mit 35-mm-Blickwinkel, dann plötzlich extremer Weitwinkel, dann Teleaufnahme wirkt unruhig. Bleibe bei einer Brennweite pro Szene und variiere nur die Einstellungsgröße. Und halte die Farbpalette begrenzt: Zwei bis drei Grundfarben pro Projekt sorgen für Wiedererkennbarkeit – auch über verschiedene Schauplätze hinweg.

Häufige Fehler und wie du sie vermeidest

Der erste Klassiker: Referenzen mit widersprüchlichem Licht. Bilder aus dem Studio und vom Fensterlicht nebeneinander erzeugen einen instabilen Hautton. Der zweite Klassiker: zu wenige Referenzen für bewegte Szenen. Wer nur eine Frontaufnahme hochlädt und dann eine Drehung erwartet, bekommt geratenen Hinterkopf.

Ein dritter Fehler sind Überbeschreibungen. Je mehr Adjektive im Identitätsblock stehen, desto mehr Konfliktpotenzial entsteht. Halten sie schlank und konkret. Viertens: das Mischen von Stilvorgaben aus verschiedenen Genres. „Dokumentarisch“ und „Märchenhaft“ gleichzeitig führt zu wechselnden Rendering-Looks.

Fünftens: das Ändern mehrerer Variablen gleichzeitig. Wenn du Referenzbilder, Gewichtung und Prompt gleichzeitig anpasst, weißt du nie, welche Änderung geholfen hat. Ändere immer nur eine Variable pro Testlauf. Sechstens: fehlende Versionierung. Speichere Prompts und Einstellungen pro Szene in einer Textdatei, sonst kannst du eine gut gelungene Einstellung später nicht reproduzieren.

FAQ: Häufige Fragen zur Multi-Image-Fusion

Wie viele Referenzbilder brauche ich wirklich?
Für einen kurzen Clip mit zwei bis drei Einstellungen genügen drei Bilder. Sobald Bewegung, Drehungen oder wechselndes Licht dazukommen, sind fünf bis acht deutlich stabiler. Mehr als zehn bringen selten einen Zusatznutzen und verlangsamen die Generierung.

Was tun, wenn das Modell die Referenz kaum beachtet?
Erhöhe schrittweise das Referenzgewicht. Falls das nicht hilft, prüfe, ob deine Referenzbilder sich gegenseitig widersprechen. Ein häufiges Problem: zwei Bilder mit unterschiedlicher Gesichtsbehaarung. Reduziere in solchen Fällen auf die konsistenten Bilder und ergänze später weitere.

Kann ich denselben Charakter in völlig unterschiedlichen Stilen zeigen?
Ja, wenn du stufenweise vorgehst. Erzeuge zuerst eine stabile Basis im Hauptstil und verwende diese Bilder als Referenz für die Stilvariante. Direkter Wechsel ohne Zwischenschritt führt fast immer zu Identitätsverlust.

Funktioniert das auch für Tiere oder Objekte?
Ja. Bei Tieren sind Fellmuster und Kopfform die wichtigsten Anker, bei Objekten Kanten, Material und Farbe. Bei Fahrzeugen oder Produkten hilft zusätzlich eine klare 360-Grad-Auswahl, damit das Modell Proportionen lernt.

Wie gehe ich mit Dialogszenen um?
Erzeuge die Mundbewegung nach Möglichkeit in einer separaten Stufe oder nutze ein Modell, das Lippenbewegungen aus einer Referenz übernimmt. Wichtig ist, dass die Referenzbilder mindestens eine Aufnahme mit neutral geöffnetem Mund enthalten – sonst rät das Modell und verformt die Kieferpartie.

Muss ich rechtlich etwas beachten?
Ja. Verwende nur Bilder, an denen du die nötigen Rechte hast. Für die Darstellung realer Personen brauchst du deren Zustimmung, besonders bei veröffentlichter Nutzung. Dokumentiere, woher deine Referenzen stammen.

Wie lange dauert die Einrichtung?
Realistisch: eine bis zwei Stunden für die Charakterbibel, die Auswahl der Referenzen und drei Testeinstellungen. Danach läuft jede weitere Szene deutlich schneller, weil Identitätsblock und Gewichtung bereits kalibriert sind.

Woran erkenne ich, dass mein Setup gut genug ist?
Wenn du drei aufeinanderfolgende Einstellungen ohne Beschreibung der Figur aneinanderschneiden kannst und Zuschauer sie als dieselbe Person wahrnehmen, ist das Setup belastbar. Ein zweiter Test: Zeige das Raster aller Szenen jemandem, der das Projekt nicht kennt, und frage, ob eine Figur aus dem Rahmen fällt.

Checkliste für den Start

  • Charakterbibel mit neutralen Merkmalen und verbotenen Details anlegen
  • Drei bis acht konsistente Referenzbilder aus verschiedenen Winkeln kuratieren
  • Belichtung und Hautton der Referenzen angleichen
  • Identitätsblock formulieren und wortgleich wiederverwenden
  • Referenzgewicht mit drei Testeinstellungen kalibrieren
  • Nur eine Variable pro Testlauf ändern
  • Shotlist nach Licht und Distanz gruppieren
  • Standbild-Raster zur Qualitätskontrolle erstellen
  • Prompts und Einstellungen pro Szene versionieren

Wenn du diese neun Punkte abarbeitest, wird Multi-Image-Fusion von einem Glücksspiel zu einem reproduzierbaren Produktionsschritt. Der Aufwand liegt einmalig am Anfang – der Gewinn zieht sich durch jede weitere Szene, jede neue Episode und jedes Format, das du aus derselben Figur entwickeln willst.

Alexander

Alexander