Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Multi-Image Fusion: Konsistente Charaktere im KI-Video

Sep 27, 2026

Warum Charakterkonsistenz das eigentliche QualitÀtsproblem ist

Wer regelmĂ€ĂŸig mit generativen Videomodellen arbeitet, kennt das Muster: Der erste Clip sitzt. Frisur, Licht, Augenpartie, Proportionen – alles wirkt glaubwĂŒrdig. In der zweiten Einstellung ist die Nase plötzlich schmaler, der Haaransatz sitzt tiefer, die Kieferlinie wirkt runder, und die Haut hat einen anderen Grundton. In der dritten Einstellung trĂ€gt die Figur zwar dieselbe Kleidung, aber die Schuhe sind anders, und der Ring an der rechten Hand ist verschwunden.

Dieses PhĂ€nomen wird als Identity Drift bezeichnet. Es ist kein Zufallsfehler eines einzelnen Modells, sondern eine strukturelle Eigenschaft von Diffusions- und Videogenerierungsarchitekturen. Jede neue Generierung beginnt mit einem anderen Rauschen, einer anderen latenten Ausgangslage. Selbst bei identischem Textprompt entsteht dadurch ein statistisch verwandtes, aber nicht identisches Ergebnis. FĂŒr einzelne Testclips ist das unproblematisch. Sobald eine Figur jedoch ĂŒber mehrere Szenen hinweg erzĂ€hlen soll, wird Drift zum Kernproblem jeder Produktion.

Die Lösung liegt nicht darin, den perfekten Prompt zu finden. Text ist ein zu grobes Steuerinstrument, um Gesichtsgeometrie, Materialbeschaffenheit und Requisiten ĂŒber Dutzende Einstellungen hinweg zu fixieren. Stattdessen braucht es visuelle Anker: mehrere Referenzbilder derselben Figur, die wĂ€hrend der Generierung zusammengefĂŒhrt und ausgewertet werden. Genau dafĂŒr existiert Multi-Image Fusion.

Multi-Image Fusion erklÀrt: Was technisch wirklich passiert

Multi-Image Fusion bedeutet nicht, dass Pixel gemittelt oder Bilder ĂŒbereinandergelegt werden. Das Verfahren arbeitet auf der Ebene latenter Merkmale. Die Referenzbilder werden in den latenten Raum des Modells ĂŒbersetzt, wo sie als Vektoren fĂŒr GesichtszĂŒge, Körperbau, Kleidung, Farbpalette und Lichtcharakter dienen. Diese Vektoren werden anschließend gewichtet und mit dem Textprompt sowie der gewĂŒnschten Kameraeinstellung kombiniert.

Entscheidend ist die Gewichtung. Ein Referenzbild, das die Figur frontal bei neutralem Licht zeigt, liefert ein anderes Signal als eine Aufnahme im Dreiviertelprofil mit hartem Seitenlicht. Gute Fusionspipelines gewichten Referenzen danach, wie hochwertig, wie scharf und wie reprĂ€sentativ sie fĂŒr die Zielansicht sind. Manche Systeme erlauben es, einzelnen Bildern eine höhere PrioritĂ€t zuzuweisen, andere arbeiten mit automatischer ÄhnlichkeitsprĂŒfung.

Referenzbilder statt reiner Textbeschreibung

Beschreibungen wie „braune Augen, leichtes GrĂŒbchen links, kantige Kieferpartie" sind nĂŒtzlich, aber selten reproduzierbar. Zwei Personen, die denselben Text lesen, stellen sich unterschiedliche Gesichter vor – und ein Modell tut im Prinzip dasselbe. Referenzbilder eliminieren diese InterpretationslĂŒcke. Sie liefern ein konkretes Ziel statt einer Beschreibung des Ziels.

Der zweite Vorteil: Referenzen transportieren Details, die sich sprachlich kaum sauber beschreiben lassen. Narben, Sommersprossenmuster, Zahnstellung, der genaue Farbverlauf eines Stoffes oder die Form eines Brillengestells. Solche Merkmale entscheiden darĂŒber, ob eine Figur ĂŒber Szenen hinweg als dieselbe Person erkannt wird.

Die Rolle bei Stil- und Szenenwechseln

Multi-Image Fusion ist nicht nur fĂŒr Gesichtstreue relevant. Sie hĂ€lt eine Figur auch dann stabil, wenn sich der Stil oder die Umgebung Ă€ndert. Ein Wechsel von Tageslicht im Innenraum zu Nachtaufnahme im Regen verĂ€ndert Schatten, Kontrast und Farbtemperatur. Ohne Referenzanker passt das Modell die Figur an die neue Lichtsituation an – und verĂ€ndert dabei oft unbeabsichtigt Hautton und Gesichtskontur.

Mit Fusion kannst du getrennt steuern: Eine Referenzgruppe definiert die IdentitĂ€t, eine zweite Referenzgruppe definiert den Look der Szene. So bleibt die Figur gleich, wĂ€hrend die Bildsprache wechselt. Diese Trennung von IdentitĂ€t und AtmosphĂ€re ist der wichtigste konzeptionelle Hebel fĂŒr lĂ€ngere Projekte.

Identity Drift messen, bevor er das Projekt ruiniert

Drift ist schleichend. Deshalb sollte QualitĂ€tssicherung nicht am Ende stattfinden, sondern nach jeder Generierungsrunde. Ein einfacher Kontaktabzug – alle Standbilder des Clips nebeneinander – macht Abweichungen sofort sichtbar. PrĂŒfe dabei sechs Kriterien:

  • Gesichtsgeometrie: Abstand der Augen, Breite des Kiefers, Form der Nase
  • Hautton und Textur: Farbtemperatur, Sommersprossen, Muttermale
  • Haaransatz und Volumen: Linie an der Stirn, LĂ€nge, Struktur, Glanz
  • Kleidung: Schnitt, SaumlĂ€nge, Kragenform, Stofffalten
  • Requisiten: Schmuck, Brille, Taschen, Waffen, Werkzeuge
  • Silhouette: Schulterbreite, KörpergrĂ¶ĂŸe im VerhĂ€ltnis zum Bildausschnitt

Notiere Abweichungen sofort mit Timecode. Wenn du dieselbe Passage nachgenerierst, ohne die Ursache zu kennen, wiederholst du denselben Fehler mit anderem Rauschen. HĂ€ufige Ursachen sind zu wenige Referenzen, widersprĂŒchliche Referenzen, ein zu aggressiver Bewegungsprompt oder ein Szenenwechsel, der mehrere Parameter gleichzeitig verĂ€ndert.

Das Referenzset: die 6-Shot-Methode

FĂŒr die meisten Projekte reichen sechs hochwertige Referenzbilder aus, sofern sie strategisch gewĂ€hlt sind. Photorealistische, scharfe Bilder funktionieren besser als stilisierte Illustrationen, digitale Malereien oder Bilder mit starker Nachbearbeitung. Achte außerdem darauf, dass alle Referenzen dieselbe Person zeigen – Mischungen aus zwei Ă€hnlichen Gesichtern erzeugen einen Mittelwert, der wie eine dritte, fremde Person wirkt.

Blickwinkel und Lichtsituationen

Ein gutes Set deckt die Ansichten ab, die im fertigen Video tatsÀchlich vorkommen:

  1. Frontal, neutrales Licht – dient als primĂ€rer Anker fĂŒr Gesichtsproportionen
  2. Dreiviertel links – stabilisiert NasenrĂŒcken und Wangenpartie
  3. Dreiviertel rechts – verhindert asymmetrische Verzerrungen
  4. Profil – fixiert Stirnlinie, Kinn und Halspartie
  5. Halbnah mit Interaktion – zeigt HĂ€nde, Gestik, Körperhaltung
  6. Ganzkörper – definiert Proportionen und Kleidungsfall

Vermeide harte Gegenlichtaufnahmen, extreme Weitwinkelverzerrungen und Bilder mit BewegungsunschĂ€rfe. Sie liefern widersprĂŒchliche Signale und verschlechtern das Ergebnis, obwohl sie visuell attraktiv wirken.

Kleidung, Requisiten und Szenenanker

Wenn die Figur im Video mehrere Outfits trĂ€gt, lege fĂŒr jedes Outfit ein eigenes Set an. Ein einziges Set mit vier verschiedenen Jacken fĂŒhrt dazu, dass das Modell Kleidungsmerkmale mischt – ein Kragen von hier, ein Ärmel von dort. Besser: Referenzgruppe A fĂŒr Business-Look, Gruppe B fĂŒr Freizeit, Gruppe C fĂŒr Kampfszenen. Beim Generieren wĂ€hlst du die passende Gruppe aus.

Requisiten verdienen eigene Referenzbilder, wenn sie erzÀhlerisch wichtig sind. Eine bestimmte Uhr, eine Brille oder eine Tasche, die in jeder Einstellung erkennbar sein soll, gehört als Detailaufnahme ins Set. Auch Umgebungsanker helfen: ein wiederkehrender Raum, ein Fahrzeug, ein Arbeitsplatz. Sie stabilisieren nicht die Figur, sondern die Welt um sie herum.

Workflow von der Charakterbibel zum fertigen Clip

Ein reproduzierbarer Ablauf schlÀgt jede Improvisation. Die folgende Reihenfolge hat sich in der Praxis bewÀhrt.

Schritt 1: Charakterbibel anlegen

Erstelle ein Dokument mit festen Attributen: Name, Alter, KörpergrĂ¶ĂŸe, Haarfarbe, Augenfarbe, besondere Merkmale, Lieblingsoutfit, Accessoires. Notiere außerdem, welche Merkmale variabel sein dĂŒrfen – etwa ein Bart, der im Verlauf der Geschichte wĂ€chst. Diese Trennung von fixen und variablen Attributen verhindert spĂ€ter widersprĂŒchliche Prompts.

Schritt 2: Referenzbilder erzeugen und kuratieren

Generiere zunÀchst eine breite Auswahl an PortrÀts und wÀhle die sechs besten aus. Kriterium ist nicht Schönheit, sondern Eignung: SchÀrfe, neutraler Ausdruck, klare Lichtsituation, keine Verdeckungen. Speichere die Dateien mit sprechenden Namen wie figur-lin-frontal-neutral.png statt IMG_0421.png. Ein sauber benanntes Set spart bei jeder weiteren Runde Zeit.

Schritt 3: Keyframes mit Fusion generieren

Beginne mit Standbildern, nicht mit Bewegungsclips. Keyframes sind billiger, schneller zu prĂŒfen und leichter zu korrigieren. Generiere pro Szene zwei bis drei Varianten, vergleiche sie gegen die Charakterbibel und behalte nur die beste. Erst wenn die Standbilder ĂŒberzeugen, sollte Bewegung ins Spiel kommen.

Schritt 4: Bewegung mit stabilen Ankern

Beim Übergang zum Clip bleibt das Referenzset aktiv. Reduziere BewegungsintensitĂ€t und Kamerafahrten in den ersten Sekunden. Schnelle Schwenks, Zooms und Körperdrehungen belasten die Konsistenz am stĂ€rksten. Wenn du eine dynamische Einstellung brauchst, generiere sie in zwei Stufen: ruhige Ausgangsbewegung, dann ein zweiter Lauf mit mehr Dynamik.

Schritt 5: Szenenwechsel vorbereiten

Bei einem Schnitt wechseln oft Umgebung, Licht, Kleidung und Kamerawinkel gleichzeitig. Das ist die schwierigste Situation fĂŒr jedes Modell. EntschĂ€rfe sie, indem du an den Schnittstellen bewusst KontinuitĂ€t einbaust: dieselbe Lichtrichtung, dieselbe Farbtemperatur, ein sichtbares Requisit aus der vorherigen Szene. So erkennt das Modell die Verbindung leichter.

Schritt 6: QualitÀtskontrolle und Archivierung

PrĂŒfe jede Einstellung gegen die sechs Kriterien aus dem vorherigen Abschnitt. Versioniere anschließend alle Freigaben und alle verworfenen Varianten. Verworfene LĂ€ufe sind wertvoll: Sie zeigen, welche Referenzkombination nicht funktioniert, und verhindern, dass du denselben Fehler in einer Woche erneut machst.

Fusion oder Einzelbild-Prompting? Entscheidungskriterien

Nicht jedes Projekt braucht ein aufwendiges Referenzset. Die Wahl hÀngt von LÀnge, Anspruch und Wiedererkennbarkeit ab.

Situation Empfehlung
Einzelner Clip, keine Fortsetzung Einzelbild-Referenz genĂŒgt
Zwei bis drei Einstellungen, gleiche Umgebung Ein bis zwei Referenzen pro Figur
Serie mit wiederkehrender Hauptfigur Sechs-Teil-Set pro Figur und Outfit
Mehrere Figuren in einer Szene Getrennte Sets plus Szenenanker
Werbespot mit Produkt Produktreferenzen höher gewichten als Figur
Dokumentarischer Look Viele Umgebungsreferenzen, weichere IdentitÀt

Die Faustregel: Je mehr Einstellungen dieselbe Figur zeigt, desto stĂ€rker zahlt sich ein sauberes Referenzset aus. Bei einem einzelnen Clip ist der Aufwand oft grĂ¶ĂŸer als der Nutzen. Bei einer zehnteiligen Serie spart es dagegen mehrere vollstĂ€ndige Neuproduktionen.

Prompt-Vorlagen fĂŒr konsistente Fusion-LĂ€ufe

Ein guter Prompt beschreibt Situation und Kamera, nicht die IdentitĂ€t. IdentitĂ€t kommt aus den Referenzen. Wiederhole also nicht Haarfarbe und Augenfarbe im Text – das konkurriert mit den Bildsignalen und erzeugt WidersprĂŒche.

Vorlage fĂŒr eine ruhige Szene:

[Figur-Referenzset A] + [Szenenanker] | halbnah, leichte Untersicht, 35 mm, weiches Tageslicht von links, ruhige Kamerafahrt nach rechts, realistische Hauttextur, natĂŒrliche Farben, keine Stilisierung

Vorlage fĂŒr eine Nachtszene:

[Figur-Referenzset A] + [Szenenanker Nacht] | amerikanische Einstellung, 50 mm, warmes Kunstlicht, Regen auf Haut, Reflexionen im Vordergrund, langsame RĂŒckwĂ€rtsfahrt, Filmkorn fein

Vorlage fĂŒr einen Actionschnitt:

[Figur-Referenzset A] + [Outfit-Set C] | dynamische Perspektive, kurze Brennweite, BewegungsunschĂ€rfe nur im Hintergrund, Gesicht scharf, harte Kontraste, kĂŒhle Farbpalette

Negativlisten sind hilfreich, aber sparsam einzusetzen: „keine Stilisierung, keine zusĂ€tzlichen Personen, keine Texturen im Gesicht, kein Weitwinkel" deckt die hĂ€ufigsten Störungen ab, ohne das Modell zu ĂŒberfordern. Zu lange Negativlisten fĂŒhren dazu, dass das Modell die PrioritĂ€ten verliert.

HĂ€ufige Fehler und wie du sie behebst

Fehler 1: Zu viele Referenzen mit unterschiedlicher QualitĂ€t. Sechs scharfe Bilder schlagen zwanzig gemischte. Reduziere auf die besten und prĂŒfe, ob alle dieselbe Lichtsituation zeigen.

Fehler 2: IdentitĂ€t im Prompt doppelt beschrieben. Wenn du „dunkle Locken" schreibst und die Referenz glattes Haar zeigt, entsteht ein Kompromiss. Beschreibe im Text nur, was sich Ă€ndern soll.

Fehler 3: Bewegung zu frĂŒh. Starte jede Szene mit einer ruhigen Einstellung als Anker. Erst danach mehr Bewegung.

Fehler 4: WidersprĂŒchliche Outfit-Referenzen im selben Set. Trenne Outfits konsequent in eigene Gruppen.

Fehler 5: Kein Kontaktabzug. Ohne visuellen Vergleich ĂŒbersiehst du Drift, bis die ganze Sequenz unbrauchbar ist.

Fehler 6: Szenenwechsel mit zu vielen Änderungen. Ändere pro Schnitt maximal zwei Parameter: entweder Licht und Ort oder Outfit und Kamerawinkel – nicht alles gleichzeitig.

Fehler 7: Verwaiste Referenzdateien. Wenn die Charakterbibel auf Bilder verweist, die umbenannt oder verschoben wurden, bricht der Workflow. Halte Struktur und Namen stabil.

Referenzen organisieren: Ordner, Versionen, Teamarbeit

Konsistenzarbeit ist zu großen Teilen Dateiverwaltung. Eine flache Struktur mit klaren Namen funktioniert besser als tiefe Verschachtelung:

projekt/charaktere/lin/refs/, projekt/charaktere/lin/outfits/business/, projekt/szenen/03-nachtcafe/frames/, projekt/szenen/03-nachtcafe/renders/v01/

Versioniere Renders als v01, v02, v03 und notiere im Änderungsprotokoll, welche Referenzgruppe verwendet wurde. In Teamkonstellationen sollte genau eine Person die Verantwortung fĂŒr das Referenzset tragen. Sobald mehrere Beteiligte Bilder hinzufĂŒgen, entsteht eine inkonsistente Sammlung, deren Fehler schwer nachvollziehbar sind.

Trenne außerdem Rohmaterial und Freigaben. Was freigegeben ist, wird nicht mehr ĂŒberschrieben. Diese Regel klingt banal, verhindert aber die hĂ€ufigste Ursache fĂŒr plötzlich auftretende Inkonsistenzen in spĂ€ten Projektphasen.

Wann du Fusionsarbeit bewusst weglassen solltest

Nicht jede Produktion profitiert. Bei abstrakten Visuals, Landschaftsaufnahmen, Produktanimationen ohne Gesichter oder bewusst surrealen Sequenzen ist IdentitĂ€tsstabilitĂ€t nebensĂ€chlich. Auch bei Stilen, die von Natur aus stark variieren – handgezeichnete Animation, Collage, Glitch-Ästhetik – kann ein rigides Referenzset die gewĂŒnschte Wirkung zerstören.

Ein weiterer Grenzfall: Figuren, die sich im Verlauf der Geschichte verĂ€ndern sollen. Narben, Alterung, Verletzungen oder ein Wechsel der Frisur sind erzĂ€hlerische Werkzeuge. Hier brauchst du keine Fusion, die alles fixiert, sondern eine bewusste Staffelung: Ausgangsset fĂŒr die frĂŒhe Phase, modifiziertes Set fĂŒr die spĂ€tere. Dokumentiere den Übergang, damit die VerĂ€nderung wie Absicht und nicht wie Drift aussieht.

FAQ: HĂ€ufige Fragen zur Multi-Image Fusion

Wie viele Referenzbilder sind optimal?
FĂŒr die meisten Projekte reichen vier bis acht. Unter vier fehlt dem Modell Information, ĂŒber zwölf steigt die Wahrscheinlichkeit widersprĂŒchlicher Signale. QualitĂ€t und Konsistenz der Auswahl sind wichtiger als die Anzahl.

Funktioniert Fusion auch mit stilisierten Referenzen?
Ja, aber nur innerhalb desselben Stils. Mische keine fotorealistischen und illustrierten Referenzen, weil das Modell sonst einen unbrauchbaren Mittelweg erzeugt. WĂ€hle einen Look und bleibe konsequent.

Warum verÀndert sich die Figur trotz gutem Referenzset?
Meist liegt es an einem widersprĂŒchlichen Textprompt, an zu starker Bewegung oder an einem Szenenwechsel mit zu vielen gleichzeitigen Änderungen. PrĂŒfe diese drei Punkte zuerst.

Muss ich fĂŒr jede Einstellung neu generieren?
Nein. Sobald ein Keyframe ĂŒberzeugt, kannst du ihn als Ausgangspunkt fĂŒr die Bewegung nutzen. Das reduziert Drift deutlich gegenĂŒber einer völligen Neugenerierung.

Wie gehe ich mit Nebenfiguren um?
Auch Nebenfiguren brauchen ein kleines Set, wenn sie in mehreren Einstellungen auftreten. Zwei bis drei Referenzen genĂŒgen. Achte darauf, dass sie sich klar von der Hauptfigur unterscheiden – Ă€hnliche Gesichtstypen verschmelzen im Modell leichter als erwartet.

Wie lange dauert der Aufbau eines guten Referenzsets?
Rechne mit ein bis drei Stunden pro Hauptfigur, inklusive Auswahl, Benennung und TestlĂ€ufen. Diese Investition amortisiert sich bereits ab etwa fĂŒnf Einstellungen, weil Nachgenerierungen entfallen.

Kann ich Referenzsets zwischen Projekten wiederverwenden?
Nur innerhalb desselben Stils und derselben Bildsprache. Ein Set aus einem weichen Tageslichtprojekt liefert in einer harten Nachtproduktion andere Ergebnisse. Lege fĂŒr jedes Projekt eigene Kopien an, statt Referenzen projektĂŒbergreifend zu verlinken.

Was ist der wichtigste einzelne Hebel?
Die Trennung von IdentitÀt und AtmosphÀre. Figurenreferenzen definieren, wer zu sehen ist. Szenenanker definieren, wo und wie. Wer diese beiden Ebenen getrennt hÀlt, löst die meisten Konsistenzprobleme, bevor sie entstehen.

Alexander

Alexander