Start Free Now
Limited Time Offer: Get 50% OFF Starter & Basic Yearly Plans 🎉

Multi-Image Fusion: konsistente Figuren im KI-Kurzfilm erklärt

Sep 23, 2026

Eine Figur, die in der ersten Einstellung ein Muttermal auf der linken Wange trägt und in der fünften auf der rechten, ist kein kreativer Zufall, sondern ein Produktionsfehler. Genau dieses Problem hat die generative Videoproduktion lange ausgebremst: Einzelne Clips beeindrucken, zusammenhängende Geschichten zerfallen. Multi-Image Fusion ist die Technik, die diesen Bruch am wirksamsten schließt, weil sie Identität nicht beschreibt, sondern zeigt.

Der folgende Leitfaden erklärt, wie die Methode technisch funktioniert, welcher Workflow sich in der Praxis bewährt, welche Werkzeugklassen zu welchem Projekttyp passen und woran Produktionen typischerweise scheitern. Es geht ausdrücklich nicht um ein einzelnes Programm, sondern um eine Kette aus Referenzauswahl, Charakterdefinition, Modellwahl, Szenengenerierung, Kontinuitätsprüfung und Nachbearbeitung. Wer nur ein Glied beherrscht, bekommt Figuren, die nach Zufallsgenerator aussehen statt nach Regie.

Warum Figurenkonsistenz der eigentliche Engpass ist

Generative Videomodelle erzeugen jedes Bild aus einer Wahrscheinlichkeitsverteilung. Sie wissen nicht, dass die Frau im roten Mantel dieselbe Person sein soll wie zwei Einstellungen zuvor. Sie wissen nur: roter Mantel, Straße, Abendlicht. Ohne zusätzliche Steuerung entsteht bei jedem Durchlauf eine neue Interpretation – andere Nase, andere Augenform, anderes Alter, andere Stirnhöhe.

Dieses Problem verschärft sich mit der Länge des Materials. Ein einzelner Clip von fünf Sekunden fällt kaum auf; das Auge hat keine Vergleichsreferenz. Ein Kurzfilm mit vierzig Einstellungen und drei Figuren besteht dagegen aus einhundertzwanzig Gelegenheiten, die Identität zu verlieren. Und weil Zuschauer Gesichter besonders fein wahrnehmen – feiner als Hände, Kleidung oder Hintergründe – fällt jede Abweichung sofort auf, auch wenn sie technisch nur wenige Prozent beträgt.

Hinzu kommt der wirtschaftliche Faktor. Wer eine Szene sechsmal neu generiert, weil die Figur nicht stimmt, verbraucht nicht nur Rechenzeit, sondern auch die eigene Aufmerksamkeit. Aufmerksamkeit ist in kreativen Projekten die knappste Ressource: Nach der vierten Korrekturrunde sinkt die Bereitschaft, eine Einstellung noch einmal zu überdenken, und man akzeptiert Kompromisse, die man am Anfang abgelehnt hätte. Eine saubere Referenzbasis reduziert die Zahl der Wiederholungen drastisch und hält damit die Entscheidungsqualität hoch.

Deshalb stützen sich professionelle Pipelines fast immer auf bildbasierte Konsistenz statt auf ausführlichere Textbeschreibungen. Beschreibungen sind mehrdeutig, Bilder sind es nicht. Ein Satz wie „dunkelblonde, schulterlange Haare" lässt mehrere Frisuren zu; ein Referenzbild lässt genau eine zu.

Wie Multi-Image Fusion technisch arbeitet

Der Kern besteht darin, aus mehreren diskreten Bildern eine kompakte Charakterrepräsentation zu destillieren und diese in den Generierungsprozess einzuspeisen. Statt eines einzigen Referenzfotos werden mehrere Winkel, Lichtsituationen und Mimiken kombiniert, damit das Modell ein robustes Mittelmaß der Identität lernt, das auch dann trägt, wenn die Zielansicht nicht exakt einer Referenz entspricht.

Referenzbilder als Identitätsanker

Ein einzelnes Porträtfoto liefert nur eine Projektion einer Person. Ändert sich später die Kameraposition, muss das Modell die fehlenden Informationen erfinden – und erfindet sie jedes Mal anders. Mit acht bis zwölf gut gewählten Referenzen entsteht ein deutlich stabileres Bild der Figur. Wichtig ist die Balance: zu wenige Bilder führen zu Überschärfung auf einzelne Merkmale, zu viele uneinheitliche Bilder verwischen die Identität zu einem Durchschnittsgesicht, das niemandem ähnelt.

Entscheidend ist nicht die schiere Menge, sondern die Winkelabdeckung. Ein Set aus zwölf Frontalaufnahmen ist schwächer als ein Set aus sechs Aufnahmen, die frontal, Halbprofil links, Halbprofil rechts, Profil, leichte Untersicht und leichte Aufsicht abdecken. Das Modell lernt aus Variation, nicht aus Wiederholung.

Embeddings und Identitätsvektoren

Technisch gibt es mehrere Wege, Referenzen wirksam zu machen. Der einfachste ist ein bildbasierter Adapter, der das Referenzbild als zusätzliche Bedingung in den Diffusionsprozess einspeist. Er ist schnell eingerichtet und eignet sich für einzelne Clips oder kurze Sequenzen.

Der aufwendigere Weg ist ein eigens trainiertes Modell-Add-on, das die Identität dauerhaft in den Gewichten speichert. Es funktioniert danach in jeder Szene ohne mitgeliefertes Referenzbild und vereinfacht dadurch Prompt und Workflow erheblich. Dazwischen liegen Verfahren, die Gesichtsmerkmale über separate Erkennungsnetzwerke einbinden und nur auf den Kopfbereich anwenden – nützlich, wenn der Rest des Bildes frei variieren soll.

Die Wahl hängt vom Projekt ab. Für einen einmaligen Clip genügt ein Adapter. Für eine Serie mit wiederkehrendem Cast lohnt sich ein trainiertes Modell, weil sich der einmalige Trainingsaufwand über viele Einstellungen amortisiert.

Seed, Bewegungsstärke und Führungsskala

Konsistenz entsteht nicht nur durch die Figur, sondern durch kontrollierte Zufälligkeit. Ein fester Seed pro Einstellung macht Ergebnisse reproduzierbar; wer ihn ändert, verliert die Vergleichbarkeit. Bewegungsstärke und Führungsskala entscheiden, wie stark das Modell der Referenz folgt: zu niedrig, und die Figur driftet; zu hoch, und die Bewegung erstarrt, Gesichter wirken wie Masken, Haut verliert Struktur.

Praktikable Startwerte liegen meist bei mittlerer Führungsskala, niedriger bis mittlerer Bewegungsstärke und einer bewusst reduzierten Anzahl von Neuinterpretationen pro Einstellung. Von dort tastet man sich in kleinen Schritten nach oben, bis die Bewegung natürlich wirkt, ohne dass die Identität kippt.

Referenzbilder auswählen: Kriterien, Mengen, Ausschlussregeln

Beginne mit dreißig bis fünfzig Bildern der Figur und reduziere auf die stärksten acht bis zwölf. Diese Kuratierung ist der wirkungsvollste Einzelhebel des gesamten Projekts – mehr als Modellwahl, mehr als Prompt-Feinschliff.

Ausschlusskriterien, die sich in der Praxis bewährt haben:

  • unscharfe Aufnahmen oder Bewegungsunschärfe im Gesicht
  • verdeckte Gesichtspartien durch Haare, Hände, Schatten oder Brillenreflexe
  • widersprüchliche Frisuren oder Haarlängen innerhalb des Sets
  • stark abweichendes Alter, etwa Kinderbilder neben Erwachsenenaufnahmen
  • harte Farbstiche durch Mischlicht oder nachträgliche Filter
  • extreme Weitwinkelverzerrung, die Proportionen verschiebt

Aufnahmekriterien:

  • mindestens zwei Ganzkörperansichten, wenn die Figur später gehen, sitzen oder in Interaktion gezeigt wird
  • mindestens zwei klar unterschiedliche Gesichtsausdrücke, etwa neutral und lachend
  • zwei Lichtsituationen, idealerweise weiches Tageslicht und gerichtetes Kunstlicht
  • saubere Trennung von Figur und Hintergrund, damit das Modell keine Umgebungsmerkmale mitlernt

Ein häufiger Anfängerfehler ist ein Set, das nur schöne Bilder enthält statt repräsentative. Das Modell übernimmt dann nicht nur das Gesicht, sondern auch eine bestimmte Kopfdrehung oder einen bestimmten Blick als Standardhaltung – und jede Szene sieht aus wie dieselbe Fotostrecke.

Der Produktionsworkflow von der Referenz zum fertigen Shot

Ein belastbarer Ablauf besteht aus sechs Phasen. Jede lässt sich einzeln optimieren, aber erst die Reihenfolge macht das Ergebnis stabil.

Referenzset kuratisieren und einfrieren

Lege das Set einmal fest und ändere es danach nicht mehr. Jede nachträgliche Ergänzung verändert die gelernte Identität leicht und zieht eine Reihe von Nachgenerierungen nach sich. Wenn du glaubst, eine neue Aufnahme hinzufügen zu müssen, teste sie zuerst isoliert gegen drei bereits abgenommene Einstellungen.

Charakterprofil als wortgleicher Textblock

Erstelle eine kurze Beschreibung: Alter, Statur, Haarfarbe und -länge, Augenfarbe, auffällige Merkmale, Grundkleidung, Grundstimmung. Dieser Block wird in jeden Prompt kopiert, wortgleich. Variation entsteht nur über den Szenenteil, nie über den Charakterteil. Das klingt banal, ist aber der häufigste Fehler in der Praxis: Wer die Figur bei jeder Szene neu formuliert, erzeugt jedes Mal eine neue Person.

Ankerbegriffe und Negativliste anlegen

Definiere pro Figur feste Ankerbegriffe und eine Negativliste. Die Negativliste verhindert die Wiederholung von Fehlern, die in Tests aufgetreten sind – unerwünschte Accessoires, falsche Haarlänge, unpassende Gesichtsausdrücke, zusätzliche Personen im Hintergrund. Bei mehreren Figuren in einer Einstellung bekommt jede einen eigenen Anker, und die Position im Bild wird explizit beschrieben, damit die Identitäten nicht vertauscht werden.

Einstellungsweise generieren mit Kontinuitätsprotokoll

Generiere immer nur eine Einstellung pro Durchlauf und prüfe direkt danach: Stimmen Gesichtsproportionen, Kleidung, Frisur, Alter? Führe ein einfaches Protokoll mit Einstellungsnummer, Seed, Prompt-Version, verwendetem Referenzset und Ergebnisnote. Dieses Protokoll ist der Unterschied zwischen einer kontrollierten Produktion und einem Ratespiel, sobald du nach zwei Wochen eine Szene neu aufsetzen musst. Ein Tabellendokument genügt; wichtig ist nur, dass es gepflegt wird, während du arbeitest, nicht danach.

Dynamische Szenen und Stilwechsel steuern

Bewegung ist der härteste Test für jede Konsistenzlösung. Bei schnellen Kamerafahrten, Nahaufnahmen mit Kopfdrehung oder Actionszenen hilft es, die Figur zunächst in der Zielpose als Standbild zu erzeugen und erst danach zu animieren. Prüfe das Standbild, bevor es Bewegung bekommt: Ein fehlerhaftes Bild wird durch Animation nicht besser, nur flüssiger.

Stilwechsel – etwa der Übergang von realistisch zu stilisiert – sollten nie innerhalb einer Einstellung erfolgen, sondern an einem Schnitt. Andernfalls kämpfen Stilbedingung und Identitätsbedingung gegeneinander und erzeugen einen sichtbaren Kompromiss, der weder stilisiert noch fotografisch wirkt.

Nachbearbeitung und Angleichung

Selbst eine gute Pipeline liefert Hauttöne, die von Einstellung zu Einstellung um einige Prozent abweichen. Ein Farbabgleich pro Szene, ein leichter Filmkorn-Aufsatz und eine konsistente Schärfung gleichen kleine Unterschiede aus, sodass das Auge sie nicht mehr als Identitätswechsel liest. Reicht das nicht, hilft ein Gesichtsaustausch in der Postproduktion als letzter Schritt – aber nur als Korrektur, nie als Grundlage.

Werkzeugklassen: Welche Pipeline passt zu welchem Projekt

Die Landschaft teilt sich grob in drei Gruppen. Erstens Bildgeneratoren mit Adapter-Ökosystem, die maximale Kontrolle über Referenzen bieten und sich für komplexe, wiederkehrende Figuren eignen. Zweitens Videomodelle mit eingebauter Bild-zu-Video-Funktion, die eine Referenz direkt animieren – schnell, aber mit weniger Eingriffsmöglichkeiten. Drittens All-in-One-Umgebungen mit Storyboard-Ansatz, die Konsistenz über Projektverwaltung statt über Modellparameter lösen.

Für ein Musikvideo mit einer Figur und abstrakten Übergängen reicht die zweite Gruppe. Für eine Mini-Serie mit wiederkehrendem Cast, wechselnden Kostümen und Dialogszenen führt kaum ein Weg an einer Pipeline aus der ersten Gruppe vorbei, ergänzt durch Animationsmodelle.

Praktisch bewährt hat sich eine Arbeitsteilung: Identität und Komposition im Bildmodell, Bewegung im Videomodell, Feinschliff im Schnittprogramm. Diese Trennung klingt umständlich, spart aber Zeit, weil jedes Werkzeug nur die Aufgabe löst, für die es gebaut ist.

Wichtig ist, Werkzeuge nicht nach Prestige, sondern nach Fehlerprofil zu wählen. Manche Modelle sind stark bei Gesichtern und schwach bei Händen, andere umgekehrt. Ein kurzer Test mit derselben Referenz und drei Posen zeigt schneller als jede Bewertungsliste, welches Modell zu deiner Figur passt. Dokumentiere diese Tests im selben Protokoll wie die Produktion.

Entscheidungskriterien für Aufwand und Pipeline-Tiefe

Nicht jedes Projekt braucht eine trainierte Identität. Vier Fragen helfen bei der Einordnung.

Wie viele Einstellungen zeigt die Figur? Unter zehn Einstellungen genügt ein bildbasierter Adapter. Über dreißig lohnt sich ein trainiertes Modell.

Wie nah ist die Kamera? Nahaufnahmen verzeihen keine Abweichung, weil das Gesicht große Bildfläche einnimmt. Weite Totalen verzeihen erstaunlich viel, weil das Gesicht nur wenige Pixel belegt.

Wie oft wird die Figur wiederverwendet? Ein einmaliger Kurzfilm rechtfertigt weniger Aufwand als eine geplante Reihe mit Nachfolgefolgen.

Wie wichtig ist Wiederholbarkeit? Wer im Auftrag arbeitet oder Serien produziert, profitiert von einem dokumentierten Referenzset, das Monate später noch vergleichbare Ergebnisse liefert.

Wer diese Fragen ehrlich beantwortet, investiert selten falsch. Der teuerste Fehler ist nicht die falsche Modellwahl, sondern eine überdimensionierte Pipeline für ein Projekt, das keine braucht – oder eine zu schlanke für ein Projekt, das dreißig Nahaufnahmen verlangt.

Typische Fehler und wie du sie vermeidest

Der erste Fehler ist ein widersprüchliches Referenzset: Bilder mit unterschiedlichem Make-up, verschiedener Frisur oder stark abweichendem Alter. Das Modell mittelt dann zwischen mehreren Personen und erzeugt eine, die niemandem ähnelt.

Der zweite Fehler ist zu viel Prompt. Lange Beschreibungen von Kleidung, Licht und Stimmung in einem Satz konkurrieren mit der Identitätsbedingung. Besser: kurzer Charakterblock, klarer Szenenblock, sauber getrennt.

Der dritte Fehler ist das Animieren eines ungeprüften Standbilds. Das wurde bereits erwähnt, weil es so häufig passiert.

Der vierte Fehler ist fehlende Dokumentation. Ohne Notizen zu Seeds, Prompt-Versionen und Referenzsets ist jede Nachgenerierung ein Neuanfang – und meistens entsteht dabei eine leicht andere Figur, was eine ganze Szene unbrauchbar macht.

Der fünfte Fehler ist das Ignorieren von Proportionen über Bildformate hinweg. Wer im Hochformat referenziert und im Breitformat produziert, muss die Referenz vorher auf das Zielformat anpassen oder formatfüllend beschneiden, sonst verschiebt sich die Gesichtsgeometrie sichtbar.

Der sechste Fehler ist das gleichzeitige Ändern mehrerer Variablen. Wer Prompt, Seed und Führungsskala in einem Durchlauf anpasst, weiß danach nicht, welche Änderung gewirkt hat. Ändere immer nur eine Variable pro Test.

Der siebte Fehler ist Ungeduld in der ersten Szene. Die erste Einstellung einer Figur legt den Maßstab für alle folgenden. Wird hier ein Kompromiss akzeptiert, zieht sich dieser Kompromiss durch das gesamte Material.

Qualitätssicherung, Sonderfälle und schwierige Szenen

Eine kurze Prüfroutine spart ganze Arbeitstage. Kontrolliere nacheinander: Gesichtsproportionen über alle Einstellungen der Szene, Haarlänge und Haarfarbe, Kleidungsdetails wie Kragen und Knöpfe, Hautton unter gleichem Licht, Größenverhältnis zu anderen Figuren, Konsistenz von Requisiten in der Hand. Prüfe außerdem den Übergang zwischen zwei Einstellungen am Schnittpunkt, nicht jede Einstellung isoliert – das Auge bewertet Kontinuität immer im Vergleich.

Lege fest, welche Abweichung akzeptabel ist. Perfekte Gleichheit ist bei generativem Material unrealistisch und wirkt schnell unnatürlich. Eine Figur darf unter verändertem Licht anders aussehen. Sie darf nur nicht wie eine andere Person aussehen.

Sonderfall Profilansicht: Profile brauchen eigene Referenzen, sonst erfindet das Modell die Nase. Sonderfall Spiegelung: Reflexionen verdoppeln die Anforderung an Konsistenz, weil dieselbe Identität zweimal überzeugen muss. Erzeuge solche Szenen als Standbild und korrigiere kleinere Abweichungen in der Nachbearbeitung, statt die Generierung zu wiederholen.

Sonderfall zwei Figuren in einer Einstellung: Beschreibe beide Positionen explizit, gib jeder Figur einen eigenen Anker und generiere zunächst jede Figur einzeln, bevor du beide in einer Komposition zusammenführst. Aufwendiger, aber deutlich zuverlässiger als der Versuch, beide in einem Durchlauf zu erzeugen.

Sonderfall Hände und Interaktionen: Sobald die Figur Gegenstände hält, prüfe zusätzlich Handform und Perspektive. Ein konsistentes Gesicht mit unbrauchbaren Händen wirkt im fertigen Film trotzdem falsch.

Häufige Fragen

Reicht ein einziges Referenzbild für konsistente Figuren?

Für kurze Clips und weite Einstellungen oft ja. Sobald die Kamera näher kommt oder die Pose stark wechselt, wird es riskant, weil das Modell fehlende Ansichten erfindet. Mit drei bis fünf Bildern aus unterschiedlichen Winkeln steigt die Stabilität deutlich, ohne dass der Workflow komplizierter wird.

Wie viele Referenzbilder sind optimal?

In der Praxis liegt der beste Bereich meist zwischen acht und zwölf. Entscheidend ist nicht die Anzahl, sondern die Vielfalt bei gleichbleibender Identität: verschiedene Winkel, zwei Lichtsituationen, mindestens zwei Gesichtsausdrücke.

Warum verändert sich die Figur trotz gleicher Referenz von Szene zu Szene?

Meist liegt es an zu starker Bewegungs- oder Kreativitätsfreiheit, an uneinheitlichen Prompt-Blöcken oder an einer Szenenbeschreibung, die der Identitätsbedingung widerspricht. Prüfe zuerst den Prompt, dann die Parameter, zuletzt das Referenzset.

Lohnt sich ein eigenes trainiertes Modell für eine kleine Produktion?

Für ein einzelnes Kurzvideo selten. Sobald aber mehr als zwanzig Einstellungen anstehen oder eine Fortsetzung geplant ist, zahlt sich der einmalige Aufwand durch schnellere Durchläufe und stabilere Ergebnisse aus.

Wie gehe ich mit schnellen Kamerafahrten um?

Erzeuge die Figur zuerst in der Start- und in der Endpose als Standbild. Sind beide stimmig, animiere die Bewegung dazwischen und prüfe die Zwischenbilder auf Drift. Bei starken Bewegungen empfiehlt es sich, die Auflösung zunächst zu reduzieren und erst nach der Abnahme hochzurechnen.

Was mache ich bei Szenen mit starker Stilisierung?

Trenne Stilisierung und Identität zeitlich: erst realistische Identitätsprüfung, dann Stilübertragung als eigenen Arbeitsschritt. Wer beides gleichzeitig verlangt, bekommt meist eine Figur, die im Stil verschwindet.

Wie dokumentiere ich am effizientesten?

Ein Tabellendokument mit einer Zeile pro Einstellung genügt: Nummer, Szene, Seed, Prompt-Version, Referenzset-Version, Führungsskala, Ergebnisnote, offene Punkte. Der Wert entsteht nicht durch Vollständigkeit, sondern durch konsequentes Ausfüllen während der Arbeit.

Woran erkenne ich, dass ein Referenzset nicht trägt?

Generiere dieselbe Figur in drei neutralen Posen mit unterschiedlichem Licht und vergleiche nebeneinander. Wenn die drei Ergebnisse nicht als dieselbe Person gelesen werden, liegt das Problem fast immer im Set, nicht im Modell.

Fazit

Multi-Image Fusion ist kein Trick, sondern eine Disziplin. Wer Referenzen sorgfältig kuratiert, Charakterblöcke wortgleich hält, Parameter konservativ startet und jede Einstellung dokumentiert, produziert Figuren, die ein Publikum als Personen wahrnimmt – nicht als zufällige Gesichter.

Der Rest ist Handwerk: prüfen, vergleichen, korrigieren, wiederholen, bis die Kontinuität selbstverständlich wirkt. Und wer diesen Ablauf einmal sauber aufgebaut hat, kann ihn für jede weitere Figur und jedes weitere Projekt wiederverwenden – das ist der eigentliche Gewinn, der weit über den einzelnen Film hinausgeht.

Alexander

Alexander